Tuần trước, Anthropic gây chấn động khi tuyên bố mô hình Claude Mythos đã tìm ra phương pháp tấn công các thuật toán mã hóa nhanh hơn. Nhưng khi tôi đào sâu vào tuyên bố này, điều đầu tiên khiến tôi cảnh giác là sự vắng mặt toàn bộ chi tiết kỹ thuật. Không tên thuật toán, không vector tấn công, không complexity class. Họ muốn chúng ta tin rằng AI đã đạt được bước đột phá trong mật mã học, nhưng từ góc nhìn của một người đã audit hàng trăm smart contract và giao thức DeFi, tôi biết rõ: nếu bạn không thể show code, bạn đang kể chuyện.

Giả định tin cậy họ đang đặt ra là công chúng sẽ chấp nhận lời tuyên bố mà không cần bằng chứng. Trong ngành của tôi, một auditor không bao giờ kết luận lỗ hổng chỉ dựa trên lời nói. Mỗi phát hiện phải đi kèm PoC (Proof of Concept), trace execution path, và mô tả chính xác điều kiện khai thác. Vậy mà Anthropic, một công ty AI hàng đầu, lại đưa ra một tuyên bố mật mã học không có PoC. Điều này gợi nhớ đến tuyên bố năm 2023 của OpenAI rằng GPT-4 có thể giải quyết các bài toán mật mã phức tạp, sau đó bị chỉ ra là hiểu lầm.
Hãy cùng trace execution path của tuyên bố này. 'Claude Mythos' không phải tên model chính thức. Anthropic chưa bao giờ công bố model chuyên về mật mã. Họ có thể đang nói về một phiên bản fine-tuned nội bộ, hoặc đơn giản là một kịch bản PR. Từ kiến thức về kiến trúc transformer, tôi biết rằng việc phát hiện lỗ hổng mật mã đòi hỏi không chỉ pattern matching mà còn suy luận biểu tượng chặt chẽ. Model ngôn ngữ hiện tại yếu trong step-by-step symbolic reasoning, đặc biệt với các bài toán yêu cầu chứng minh toán học.
Điều tinh tế (và đáng sợ) trong thiết kế tuyên bố này là nó khai thác nỗi sợ bảo mật của công chúng. Ngay lập tức, các bài báo bắt đầu đặt câu hỏi liệu AES, RSA, ECC có bị đe dọa không. Nhưng thực tế: chưa có bất kỳ ảnh hưởng nào. Các nhà mật mã học vẫn đang chờ đợi. Nếu Anthropic thực sự phát hiện ra một phương pháp tấn công mới, theo chuẩn responsible disclosure, họ phải báo cáo cho NIST hoặc IETF trước khi công bố công khai. Việc họ chọn thông báo qua báo chí thay vì đệ trình tới cộng đồng khoa học là tín hiệu đáng ngờ.

Phần lớn phân tích sai về sự kiện này ở chỗ họ cho rằng đây là một thành tựu AI. Thực ra, nếu Anthropic có một phương pháp tấn công mới, bản chất nó không phải là thành tựu của AI mà là phát hiện của các nhà mật mã học trong đội ngũ Anthropic, và AI chỉ là công cụ. Họ cố tình gán công lao cho model để tăng giá trị thương hiệu. Tôi đã chứng kiến chiến thuật tương tự trong các dự án blockchain: gán mọi thành tựu kỹ thuật cho 'giao thức thông minh' để che giấu sự thiếu hụt chi tiết.
Đây là lỗ hổng kiến trúc của câu chuyện này: nó không thể được verify. Các nhà báo không thể chạy lại thí nghiệm. Cộng đồng không có code để kiểm tra. Nhà đầu tư không có benchmark. Trong thế giới DeFi, một dự án ra mắt với tuyên bố 'chúng tôi tìm ra cách hack AMM' mà không có proof sẽ bị cộng đồng audit ngay lập tức. Tại sao Anthropic lại được đối xử khác? Chỉ vì họ có thương hiệu AI mạnh? Điều này gợi nhắc tôi về vụ OpenSea từng tuyên bố phát hiện lỗ hổng NFT nhưng sau đó im lặng.
Vậy chúng ta nên đặt cược vào đâu? Từ kinh nghiệm audit của tôi, khi một bên tuyên bố lớn mà không có code, thường có ba khả năng: (1) họ có thứ gì đó nhưng chưa hoàn thiện – cần thêm thời gian; (2) họ đang phóng đại một phát hiện nhỏ để gây chú ý; (3) họ đang thử nghiệm thị trường xem công chúng phản ứng thế nào trước khi đưa ra sản phẩm. Trong mọi trường hợp, không có lý do gì để các giao thức DeFi hay công ty bảo mật thay đổi lộ trình của mình dựa trên một tuyên bố không có bằng chứng.
Các dev không nói với bạn rằng hầu hết các tuyên bố 'AI phát hiện lỗ hổng' đều kết thúc bằng im lặng. Tôi đã theo dõi lĩnh vực này 19 năm, từ các công cụ fuzzing tự động ban đầu đến những mô hình ngôn ngữ lớn gần đây. Không có công cụ nào từng tự động tìm ra zero-day trong mật mã mà không có sự hỗ trợ của con người. Mật mã học là lĩnh vực được nghiên cứu kỹ lưỡng nhất trong khoa học máy tính. Nếu có một bước đột phá thực sự, nó sẽ đến từ các nhà mật mã học có học vị, không phải từ một tuyên bố PR.
Kết luận của tôi rất đơn giản: hãy chờ đợi. Nếu Anthropic đệ trình lên NIST hoặc IETF, nếu họ publish paper trên eprint.iacr.org, nếu họ release code dưới dạng open-source, thì lúc đó chúng ta mới có thể đánh giá. Cho đến lúc đó, tôi coi đây là một chiêu trò marketing tinh vi giữa lúc thị trường crypto đang downtrend và mọi người đang tìm kiếm tin tốt. Đừng để nỗi sợ bảo mật khiến bạn tin vào một câu chuyện không có backbone.
Liệu sáu tháng nữa chúng ta có thấy một paper hay chỉ thấy một dòng tweet bị xóa? Câu trả lời, như mọi khi, nằm trong code mà họ không chịu cho chúng ta thấy.
