Tín hiệu sớm đã xuất hiện. Ai biết đọc?
Tháng 4/2025, hội nghị vLLM đầu tiên diễn ra cùng Ray Summit tại San Francisco. Không phải một keynote thông thường. Từ Intel, AMD, Prime Intellect đến Hugging Face, tất cả đều nói về một thứ: disaggregated serving – tách prefill và decode thành hai dịch vụ độc lập. Ba team độc lập, ba bài trình bày khác nhau, cùng một kết luận: Agentic traffic đang làm vỡ khuôn mẫu batch inference truyền thống.
Tôi đã theo dõi hạ tầng AI từ năm 2023, khi các dự án crypto AI như Bittensor, Render Network, io.net bắt đầu thu hút dòng vốn. Nhưng chưa bao giờ tôi thấy một sự đồng thuận kỹ thuật mạnh mẽ đến vậy từ nhiều phía. Và đây không phải chuyện của riêng AI – nó là tín hiệu cho cả ngành crypto, nơi các mạng lưới phi tập trung đang cố gắng chiếm lấy thị phần inference.
Context: Batch inference đã từng là vua
Hãy quay lại 2022-2023. Khi đó, mọi framework inference đều tối ưu cho batch: gom nhiều request vào một lô, xử lý song song trên GPU, tối đa throughput. vLLM nổi lên như một chuẩn mực nhờ cơ chế PagedAttention và quản lý KV cache thông minh. Collocated prefill/decode trên cùng một GPU là kiến trúc mặc định. Nó hoạt động tốt cho chatbot, summarization, code generation – những workload có luồng request liên tục, ít gián đoạn.

Nhưng Agent thay đổi mọi thứ. Một Agent không chỉ gửi một prompt rồi nhận response. Nó gọi tool, chờ kết quả, giữ context qua nhiều vòng, có thể tạm dừng hàng giây trước khi tiếp tục. Đây là traffic không đồng nhất, không dự đoán được, và – quan trọng nhất – nó phá vỡ giả định của batch processing.
Core: Disaggregated serving – cơ chế và tâm lý
Prefill và decode có tính chất hoàn toàn khác nhau. Prefill tính toán nhiều (compute-bound), decode phụ thuộc băng thông bộ nhớ (memory-bound). Ghép chúng vào cùng một GPU là thỏa hiệp: bạn phải cân bằng giữa hai loại tài nguyên, và trong thực tế, một trong hai luôn bị lãng phí.
Disaggregated serving tách chúng ra. Một cụm GPU chuyên prefill, một cụm chuyên decode. KV cache – trạng thái của cuộc hội thoại – phải được truyền từ prefill node sang decode node qua mạng RDMA. Đây không phải ý tưởng mới về mặt lý thuyết (DistServe, Splitwise đã đề cập từ 2023), nhưng lần đầu tiên nó được đưa vào production-grade framework như vLLM với các connector chuyên dụng: NixlConnector (RDMA) và MORI-IO (AMD).
Tôi nhìn thấy sự tương đồng với kiến trúc rollup trong blockchain. Prefill giống như sequencer – xử lý giao dịch, tạo batch. Decode giống như prover – xác nhận trạng thái, tạo output. Và KV cache giống như state diff – cần được đồng bộ giữa các layer. Disaggregated serving là một dạng "rollup hóa" của inference AI.
Số liệu từ AMD: trên 8x MI300X, MORI-IO đạt goodput cao hơn 2.5 lần so với collocated. Tất nhiên, con số này đến từ một bài test có kiểm soát. Nhưng hướng đi đã rõ: các nhà sản xuất phần cứng đang đặt cược vào kiến trúc này.
Prime Intellect còn đi xa hơn: họ áp dụng nguyên lý tương tự cho mô hình MoE 1 nghìn tỷ tham số, lưu KV cache phân tán trên CPU memory và SSD. Điều này gợi nhớ đến cách Filecoin lưu trữ dữ liệu phi tập trung – nhưng ở đây là trạng thái mô hình, không phải file. Và tôi đã từng viết về Filecoin năm 2017, khi nó huy động 257 triệu USD. Lúc đó, tôi nhận ra Proof-of-Replication khác với ICO thông thường. Bây giờ, tôi thấy Prime Intellect khác với các dự án inference cluster thông thường.
Contrarian: Góc nhìn phản trực giác
Disaggregated serving nghe có vẻ phi tập trung – tách biệt tài nguyên, tối ưu từng phần. Nhưng thực tế, nó làm tăng sự phụ thuộc vào hạ tầng mạng. RDMA, InfiniBand, UEC – những thứ này không rẻ. Chỉ các cloud lớn hoặc các công ty có data center riêng mới đủ khả năng triển khai. Điều này trái ngược hoàn toàn với tinh thần phi tập trung của crypto.

Hãy nhìn vào Tether: USDT chiếm 70% thị trường stablecoin, nhưng chưa bao giờ có audit độc lập thực sự. Cả ngành giả vờ vấn đề này không tồn tại. Tương tự, disaggregated serving tạo ra một lớp hạ tầng mới – KV cache routing, session affinity, prefix caching – mà nếu do một thực thể duy nhất kiểm soát, nó sẽ trở thành điểm tập trung quyền lực mới.
vLLM Router dùng consistent hashing và sticky routing để giữ session cùng một decode instance. Điều này có nghĩa: một khi Agent được gán vào một node, nó sẽ ở đó suốt vòng đời. Điều này hiệu quả, nhưng cũng tạo ra cơ hội cho việc theo dõi và profiling người dùng. Trong thế giới crypto, điều này gọi là "privacy leak".
Tôi từng mắc sai lầm với BAYC năm 2021: quá tập trung vào câu chuyện cộng đồng, bỏ qua rủi ro thanh khoản, mất 40%. Bài học: bất kỳ kiến trúc mới nào cũng có điểm mù. Disaggregated serving có thể mang lại hiệu suất, nhưng chi phí vận hành và độ phức tạp có thể giết chết lợi nhuận nếu Agent traffic không đạt kỳ vọng.
Takeaway: Câu chuyện tiếp theo
Agent traffic có thực sự chiếm đa số inference trong 2 năm tới? Nếu không, disaggregated serving sẽ chỉ là một giải pháp niche. Nhưng nếu có, nó sẽ định hình lại toàn bộ chuỗi cung ứng GPU – từ prefill farm đến decode farm, và kéo theo nhu cầu về KV cache storage, routing middleware, và các giải pháp bảo mật.
Trong crypto, các dự án như io.net, Render, Bittensor đang cố gắng xây dựng mạng lưới GPU phi tập trung. Họ có thể tận dụng xu hướng này để cung cấp dịch vụ disaggregated serving như một sản phẩm. Nhưng họ cũng phải đối mặt với bài toán network latency – thứ mà RDMA chỉ giải quyết được trong data center, không phải qua internet công cộng.
Airdrop là đòn bẩy của kẻ thức thời. Nhưng lần này, đòn bẩy không phải là token, mà là kiến trúc. Ai nắm được KV cache, người đó nắm Agent.
Tín hiệu sớm đã xuất hiện. Ai biết đọc?
