Lối đi thực tế cho AI: Từ sinh từ sang quyết định tức thì
Lối đi thực tế cho AI: Từ sinh từ sang quyết định tức thì
Nhiều đội ngũ kỹ thuật khi xây dựng hệ thống tác tử (agent) hoặc luồng tự động hóa vẫn giữ một thói quen tốn kém: dùng một mô hình ngôn ngữ lớn dạng sinh từ (generative LLM) chỉ để trả lời những câu hỏi dạng đúng hoặc sai, phân loại ý định người dùng hay kiểm tra an toàn dữ liệu. Việc bắt một mô hình phải nhả từng token qua nhiều chu kỳ giải mã tuần tự khiến độ trễ bị kéo dài từ vài trăm mili-giây đến vài giây, kéo theo hóa đơn điện toán tăng vọt mà độ tin cậy lại bấp bênh.
Những chuyển động kỹ thuật gần đây cho thấy một ngã rẽ rõ ràng. Thay vì ép các mô hình sinh văn bản đa năng làm mọi khâu, giới kỹ thuật đang tách bạch kiến trúc thành hai tầng riêng biệt: các mô hình ra quyết định siêu nhẹ chạy tức thì tại biên, và các mô hình suy luận chuyên sâu nhưng đi kèm bài toán kiểm soát chi phí chặt chẽ trên đám mây.
Bỏ cơ chế sinh token khi chỉ cần một quyết định
Khác biệt cốt lõi giữa việc “trò chuyện” và “ra quyết định” nằm ở cơ chế suy luận. Một mô hình sinh văn bản thông thường phải dự đoán từng từ một, từ này nối tiếp từ kia, đồng nghĩa với việc tiêu tốn rất nhiều băng thông bộ nhớ của chip xử lý. Nhưng nếu tác vụ chỉ là xác định ảnh camera có chướng ngại vật hay không, một tin nhắn đầu vào có an toàn hay không, việc sinh token trở nên thừa thãi.
Họ mô hình d1 vừa được Liquid AI công bố nhắm thẳng vào điểm nghẽn này. Hai phiên bản mở gồm d1-3B và d1-omni-600M không sinh token theo cách truyền thống. Chúng xử lý toàn bộ ngữ cảnh và đưa ra câu trả lời chỉ qua một lượt chạy suy luận duy nhất (single forward pass).
Kết quả đo đạc thực tế phản ánh rõ ưu thế này:
- Trên thiết bị nhúng NVIDIA Jetson AGX Thor, bản d1-3B phản hồi câu hỏi đa phương thức (văn bản và hình ảnh) trong 16 mili-giây.
- Trên Jetson AGX Orin, thời gian này là 26 mili-giây.
- Ngay cả trên phần cứng giới hạn như Jetson Orin Nano, độ trễ cũng chỉ dừng ở mức 50 mili-giây.
Về độ chuẩn xác, d1-3B đạt 48,57 điểm trên bảng đánh giá Decision Index 0.2.1, vượt qua toàn bộ các mô hình 4B và 9B khác, thậm chí vượt cả Decider 35B-A3B (47,11 điểm) dù kích thước chỉ bằng một phần nhỏ. Phiên bản thể nghiệm d1-omni-600M xây dựng từ kiến trúc encoder hai chiều 350M còn tích hợp thêm cả bộ mã hóa âm thanh, cho phép xử lý văn bản, ảnh và âm thanh ngay trên thiết bị biên mà không cần máy chủ hỗ trợ.
Ý tưởng này cũng xuất hiện ở tầng an ninh. Mô hình mở Security-One 27B được thiết kế với mục đích duy nhất: đứng chặn trước mọi agent để phán đoán prompt đưa vào có độc hại hay chứa mã tấn công chèn lệnh (prompt injection) hay không. Nhờ cơ chế đánh giá qua một lượt duy nhất, mô hình này đạt tỷ lệ phát hiện 99,8% trên bài kiểm tra BIPIA, bỏ xa các giải pháp kiểm duyệt dùng mô hình tổng quát vốn vừa chậm vừa dễ bị vượt mặt.
Chuyên biệt hóa có công thức thay vì nhồi nhét vạn năng
Song song với việc tối ưu tầng biên, hướng đi ở tầng suy luận sâu cũng đang thay đổi. Thay vì cố tạo ra một cỗ máy biết mọi thứ trên đời, các kỹ sư chuyển sang công thức: lấy một nền tảng mở vững chắc, sau đó tinh chỉnh có định hướng bằng kỹ thuật tinh chỉnh có giám sát (SFT), học tăng cường (RL) và tăng cường tính toán ở thời điểm suy luận (test-time compute).
NVIDIA vừa chứng minh hiệu quả của hướng đi này với họ mô hình Nemotron 3. Thay vì huấn luyện từ đầu một hệ thống khổng lồ mới, họ dùng cùng một gốc mô hình rồi rẽ làm hai nhánh chuyên môn hóa: một nhánh giải toán hình thức cho kỳ thi Olympic Toán quốc tế (IMO), một nhánh giải thuật toán lập trình cho kỳ thi Olympic Tin học quốc tế (IOI).
Ở nhánh lập trình, phiên bản Nemotron-3-Ultra-CC kết hợp SFT với cơ chế tự sửa sai GenCorrect đã ghi được 535,4 trên 600 điểm tại bộ đề IOI 2026. Mức điểm này vượt xa ngưỡng huy chương vàng thực tế (361,12 điểm) và cao hơn cả điểm số của thí sinh con người đứng đầu năm đó (498 điểm).
Điểm đáng chú ý cho giới làm phần mềm là: Nvidia không giữ kín các công thức đó mà công bố công khai cả mô hình, dữ liệu và quy trình huấn luyện trên Hugging Face. Điều này cho thấy khả năng suy luận cấp cao không còn là đặc quyền của các mô hình đóng kín. Một đội ngũ kỹ thuật có chuyên môn miền hẹp hoàn toàn có thể dùng công thức chuyên biệt hóa này để giải quyết trọn vẹn bài toán nghiệp vụ của mình với chi phí phần cứng hợp lý.
Cạm bẫy chi phí sau bảng giá rẻ của tầng đám mây
Đối với những hệ thống vẫn cần dùng API thương mại từ các hãng lớn, bài toán vận hành lại nằm ở các chi phí ẩn. Đơn cử như bản Claude Haiku 5.5 vừa được Anthropic đưa ra thị trường nhằm đối đầu trực diện với GPT-6 Luna.
Nhìn vào bảng giá công bố, Haiku 5.5 trông như một món hời lớn: 0,10 USD cho một triệu token đầu vào và 0,50 USD cho một triệu token đầu ra. Nhưng khi đưa vào môi trường sản xuất thực tế, có ba chi tiết kỹ thuật mà kỹ sư hệ thống cần lưu tâm:
| Yếu tố so sánh | Claude Haiku 5.5 | GPT-6 Luna |
|---|---|---|
| Giá cơ sở (dưới 100k token) | 0,10 USD in / 0,50 USD out | 0,10 USD in / 0,50 USD out |
| Mức nhảy giá ngữ cảnh dài | Tăng 5 lần từ mốc 100k token (lên 0,50 / 2,50 USD) | Tăng nhẹ từ mốc 272k token (lên 0,20 / 0,75 USD) |
| Hệ số tokenizer | Tốn khoảng 1,25 lần token so với bản 4.5 cũ | Giữ nguyên tỷ lệ chuẩn |
| Cơ chế suy luận (Reasoning) | Bắt buộc bật, mặc định mức trung bình | Cho phép tùy biến linh hoạt |
Thứ nhất là bước nhảy giá ở mốc 100.000 token. Nếu hệ thống nhồi tài liệu lớn, lịch sử hội thoại dài hoặc bảng biểu chi tiết vượt qua mốc này, chi phí lập tức tăng gấp 5 lần. Thứ hai, bộ tách từ (tokenizer) mới của Haiku 5.5 ngốn nhiều token hơn khoảng 25% cho cùng một đoạn văn bản dài so với bản 4.5 trước đây. Cuối cùng, mô hình không cho phép tắt hoàn toàn tính năng suy luận logic (reasoning trace).
Khi thử nghiệm sinh một hình vector phức tạp, nếu đặt suy luận ở mức tối đa, Haiku 5.5 mất hơn 5 phút tính toán và phát sinh thêm hàng nghìn token suy luận nội bộ. Dù chi phí suy luận một lượt chỉ vài cent, nhưng nếu nhân với hàng trăm nghìn lượt gọi API của một hệ thống chăm sóc khách hàng tự động, ngân sách sẽ thâm hụt rất nhanh.
Lựa chọn kiến trúc cho kỹ sư Việt Nam
Từ những thực tế trên, việc thiết kế một giải pháp AI trong giai đoạn hiện nay đòi hỏi sự tỉnh táo về mặt kiến trúc thay vì tâm lý chạy theo phiên bản mô hình mới nhất.
Trước hết, hãy kiên quyết cắt bỏ LLM dạng sinh từ ra khỏi các tác vụ kiểm tra điều kiện, định tuyến và phân loại nội dung. Nếu hệ thống cần chạy tại chỗ hoặc chạy trên các máy chủ biên cấu hình vừa phải, những mô hình một lượt như d1-3B hoặc các dòng encoder chuyên dụng là lựa chọn vượt trội về cả độ trễ lẫn độ ổn định. Mức phản hồi dưới 50 mili-giây trên phần cứng tầm trung đủ sức giải quyết các luồng xử lý thời gian thực mà không làm nghẽn hạ tầng.
Đối với các tác vụ trên đám mây, nếu sử dụng các mô hình suy luận giá rẻ như Haiku 5.5, hệ thống cần được thiết lập hạn mức ngữ cảnh nghiêm ngặt dưới 100.000 token trước khi đẩy vào API. Việc tóm tắt ngữ cảnh định kỳ và kiểm soát mức độ suy luận (thinking effort) phải trở thành tham số mặc định trong mã nguồn thay vì để mặc cho nhà cung cấp điều phối.
Suy cho cùng, giá trị của một hệ thống kỹ thuật nằm ở việc giải quyết đúng bài toán với chi phí tối thiểu. Biết cách dùng đúng mô hình ra quyết định cho khâu điều phối và chỉ gọi mô hình suy luận lớn khi thật sự cần tính toán phức tạp - đó mới là điểm tựa thực tế nhất cho những người trực tiếp vận hành sản phẩm.