Anthropic RSP: Khi 'Safety-First' trở thành một smart contract không thể kiểm toán
Hoàng Quân
Hook: 90% các dự án AI safety framework hiện nay chỉ là whitepaper đẹp — nhưng Anthropic đã phát hành bản cập nhật thứ hai của Responsible Scaling Policy (RSP) vào năm 2025. Trên on-chain, tôi thấy một pattern quen thuộc: một thực thể tự xưng là 'phi tập trung' nhưng lại nắm toàn bộ quyền kiểm soát cập nhật. RSP cũng vậy: một framework do chính Anthropic thiết kế, đánh giá và thực thi. Không có multisig, không có timelock, không có cơ chế phản đối từ cộng đồng. Đây giống như một hợp đồng thông minh mà chỉ có deployer mới có quyền gọi hàm.
Context: Dựa trên kinh nghiệm audit của tôi với các giao thức DeFi và phân tích 10.000 giao dịch ICO, tôi nhận thấy RSP là nỗ lực đầu tiên trong ngành AI nhằm lượng hóa rủi ro thành các cấp độ ASL (1-4), tương tự như BSL trong sinh học. Bản cập nhật thứ hai cho thấy framework này đã đi vào vận hành liên tục, không chỉ là tài liệu tĩnh. Nhưng điểm mấu chốt: Anthropic vừa là người viết code, vừa là người chạy test, vừa là người ký duyệt kết quả. Trong blockchain, điều này được gọi là 'rug pull vector'.
Core: Phân tích kỹ thuật của tôi tập trung vào ba khía cạnh. Thứ nhất, ASL-3 là ngưỡng quan trọng: nó yêu cầu kiểm soát truy cập model weights, KYC và báo cáo lỗ hổng. Nhưng ai định nghĩa 'ngưỡng'? Từ dữ liệu on-chain của các DAO, tôi biết rằng bất kỳ quyết định nào về ngưỡng rủi ro đều có thể bị thao túng nếu thiếu minh bạch. Anthropic không công bố test sets hay external audit. Điều này tương tự như một giao thức DeFi không công bố mã nguồn của oracle. Thứ hai, RSP chỉ tập trung vào rủi ro thảm họa (CBRN, cyberattack) mà bỏ qua bias, privacy — giống như một blockchain chỉ bảo vệ khỏi 51% attack nhưng bỏ qua sandwich attack. Thứ ba, chi phí tuân thủ RSP là có thật: Anthropic phải đầu tư hàng trăm triệu USD vào an ninh hạ tầng, nhưng không có cơ chế nào để cộng đồng kiểm tra xem số tiền đó có được sử dụng hiệu quả hay không. Trong blockchain, chúng ta gọi đó là 'trust me bro'.
Contrarian: Góc nhìn phản trực giác: RSP thực chất là một chiến lược kinh doanh xuất sắc. Nó tạo ra 'safety premium' cho Anthropic, cho phép họ tính phí cao hơn cho doanh nghiệp, đồng thời biện minh cho việc không open-source model mạnh. Nhưng nếu nhìn từ góc độ blockchain, đây là một dạng 'centralized safety' — tương tự như một sàn CEX tuyên bố bảo vệ tài sản của bạn nhưng thực tế bạn không có private key. Tương quan giữa an toàn và tập trung không phải là nhân quả. Một hệ thống thực sự an toàn cần có sự phân quyền và kiểm toán độc lập. Anthropic đang bán 'safety-as-a-product' giống như các công ty bảo mật tập trung bán dịch vụ cho khách hàng doanh nghiệp, nhưng về bản chất, họ vẫn là single point of failure.
Takeaway: Tuần tới, hãy theo dõi xem liệu Anthropic có công bố bất kỳ bằng chứng nào về kiểm toán độc lập hay không. Nếu không, hãy nhớ: niềm tin không bao giờ nằm trong whitepaper. Và trong thế giới blockchain, chúng ta đã học được bài học đó từ rất nhiều vụ sập. Câu hỏi đặt ra: liệu AI safety có thể được xây dựng trên một nền tảng tin cậy tập trung, hay chúng ta cần một phiên bản 'on-chain' của RSP?