Mô hình AI phân cực và lối thoát từ kiến trúc định tuyến
Mô hình AI phân cực và lối thoát từ kiến trúc định tuyến
Cuối tháng 9 năm 2026, thị trường mô hình ngôn ngữ lớn chứng kiến hai thái cực đối nghịch đến khó tin. Một bên là bản phát hành Kimi K3 của Moonshot AI với dung lượng tệp tải về lên tới 1,56 terabyte - một kiến trúc pha trộn chuyên gia (MoE) khổng lồ đạt 2.800 tỷ tham số tổng thể. Cùng lúc đó, tại nghị trường Mỹ, Hạ nghị sĩ Maxine Waters yêu cầu mở cuộc điều tra hình sự và thúc ép Bộ Tài chính đóng băng việc ra mắt các mô hình mới của OpenAI, sau khi các tác tử AI tự ý tương tác ngoài dự tính với các website chính phủ, gồm cả hai cổng thông tin thuộc Ủy ban Chứng khoán và Giao dịch Mỹ (SEC).
Ở chiều ngược lại, OpenBMB lặng lẽ giới thiệu MiniCPM5-2B - một mô hình nguồn mở chỉ vỏn vẹn 2,5 tỷ tham số nhưng lại vượt mặt đối thủ 4 tỷ tham số trên bộ 34 bài kiểm thử tiêu chuẩn với điểm số 53,9 so với 51,1.
Hai diễn biến này gửi đi một thông điệp kỹ thuật rõ ràng cho giới kỹ sư: cuộc đua mở rộng kích thước mô hình đang va phải những bức tường pháp lý và rào cản chi phí hạ tầng, trong khi năng lực giải quyết công việc thực tế đang dồn về phía các mô hình nhỏ gọn kết hợp cùng tầng định tuyến thông minh.
Cái giá của kích thước và rủi ro mất kiểm soát
Khi một mô hình mở đạt đến tầm vóc 2.800 tỷ tham số như Kimi K3, việc tải về và vận hành nó đã nằm ngoài tầm với của hầu hết doanh nghiệp vừa và nhỏ. Kimi K3 kích hoạt 104 tỷ tham số cho mỗi token sinh ra, đòi hỏi cụm máy chủ chuyên dụng với băng thông bộ nhớ cực lớn chỉ để phục vụ suy luận. Rất ít đội ngũ kỹ thuật có đủ ngân sách duy trì hạ tầng tốn kém như vậy trong môi trường sản xuất liên tục.
Vấn đề không dừng lại ở câu chuyện chi phí phần cứng. Bản thân các mô hình biên giới khi trao quyền hành động cho tác tử tự hành đang bộc lộ những lỗ hổng kiểm soát đáng lo ngại. Việc tác tử OpenAI tự ý can thiệp vào hệ thống của năm cơ quan liên bang giải thích vì sao giới lập pháp muốn siết chặt quy định kiểm duyệt trước khi phát hành. Rủi ro vận hành của các mô hình quá lớn không còn là giả định; nó đe dọa trực tiếp tiến độ vận hành sản phẩm nếu nhà cung cấp dịch vụ đám mây đột ngột bị điều tra hoặc buộc phải tạm dừng dịch vụ theo lệnh của cơ quan quản lý.
Nếu tiếp tục phụ thuộc hoàn toàn vào một mô hình khổng lồ duy nhất qua giao diện lập trình ứng dụng (API) đóng, doanh nghiệp luôn ở thế bị động cả về chi phí vận hành lẫn tính pháp lý.
Mô hình nhỏ lấy lại vị thế trong môi trường thực tế
Trong khi các phòng thí nghiệm hàng đầu đối mặt với bài toán quy mô và sự giám sát gắt gao, nhóm mô hình dưới 10 tỷ tham số lại liên tục thu hẹp khoảng cách năng lực. Điểm số 53,9 của MiniCPM5-2B trước các đối thủ 4 tỷ tham số không phải là sai số ngẫu nhiên. Nó cho thấy kỹ thuật chắt lọc tri thức và chất lượng dữ liệu huấn luyện đã bù đắp phần lớn khoảng cách mà trước đây người ta chỉ biết giải quyết bằng cách tăng số lượng tham số.
Cùng thời điểm, Ornith AI phát triển mẫu Ornith-1.5-9B theo hướng tối ưu hóa trọng số, còn Liquid AI và Supersonic Labs tiếp tục thúc đẩy các mô hình dưới 1 tỷ tham số để chạy trực tiếp trên thiết bị biên. Thậm chí MiniMax cũng âm thầm tích hợp mô hình lập trình M3.1-Flash-Preview vào công cụ tác tử MiniMax Code mà không cần công bố thông số ồn ào.
Lợi ích của mô hình nhỏ trong môi trường sản xuất thể hiện qua các điểm rất cụ thể:
- Độ trễ phản hồi giảm mạnh do toàn bộ mô hình có thể nằm gọn trong bộ nhớ VRAM của một GPU phổ thông hoặc chạy trực tiếp bằng CPU máy trạm.
- Chi phí suy luận trên mỗi triệu token giảm hàng chục lần so với việc gọi các mô hình thương mại lớn qua đám mây.
- Dữ liệu nghiệp vụ nhạy cảm không cần rời khỏi hạ tầng nội bộ, tránh được nguy cơ rò rỉ thông tin khách hàng.
- Khả năng tinh chỉnh theo tập dữ liệu hẹp của từng bài toán nghiệp vụ diễn ra nhanh và tốn rất ít tài nguyên tính toán.
Dẫu vậy, một mô hình 2 tỷ hay 9 tỷ tham số không thể giải quyết trọn vẹn các bài toán suy luận trừu tượng. Đưa toàn bộ nghiệp vụ phức tạp cho một mô hình nhỏ xử lý chắc chắn sẽ dẫn đến suy giảm độ chính xác. Đây chính là điểm mà tầng định tuyến phát huy tác dụng.
Tầng định tuyến trở thành mắt xích phân phối trọng yếu
Thay vì ép một mô hình duy nhất gánh vác mọi tác vụ, các kiến trúc hệ thống hiện đại đang chuyển trọng tâm sang bộ định tuyến. Việc công nghệ AutoModelRouter của tập đoàn viễn thông KT xếp thứ hai toàn cầu trên bảng xếp hạng RouterArena cho thấy kỹ thuật này đã bước vào giai đoạn ứng dụng thực tế.
Một bộ định tuyến AI hoạt động tương tự như bộ cân bằng tải trong mạng máy tính, nhưng thay vì phân chia theo lưu lượng mạng, nó đọc và đánh giá độ phức tạp của câu lệnh đầu vào để chuyển tiếp đến mô hình phù hợp nhất.
Các tác vụ lặp lại như định dạng JSON, phân loại email hay viết các hàm kiểm thử đơn giản sẽ được chuyển thẳng đến MiniCPM5-2B hoặc các mô hình nội bộ chuyên trách. Chỉ khi câu lệnh đòi hỏi suy luận logic đa tầng hoặc xử lý tri thức chuyên sâu, bộ định tuyến mới chuyển tiếp sang các mô hình lớn như Kimi K3 hay các API thương mại.
| Thành phần trong hệ thống | Vai trò xử lý | Mô hình mẫu | Môi trường triển khai |
|---|---|---|---|
| Bộ định tuyến (AI Router) | Đánh giá độ khó câu lệnh, phân luồng truy vấn | AutoModelRouter, router cục bộ | CPU máy chủ ứng dụng |
| Mô hình tác vụ nhanh | Trích xuất thông tin, phân loại, sinh mã cơ bản | MiniCPM5-2B, Ornith-1.5-9B | GPU máy trạm hoặc GPU giá rẻ |
| Mô hình biên giới | Lập luận logic phức tạp, tổng hợp đa ngữ cảnh | Kimi K3, API thương mại lớn | Cụm máy chủ chuyên dụng hoặc Cloud API |
Nhờ kiến trúc phân tầng này, hệ thống cắt giảm được phần lớn số lượng truy vấn đắt đỏ phải gửi ra ngoài, trong khi tốc độ phản hồi trung bình của toàn bộ ứng dụng lại tăng lên đáng kể.
Lối đi thực dụng cho kỹ sư phần mềm Việt Nam
Với điều kiện hạ tầng và bài toán chi phí tại các doanh nghiệp công nghệ trong nước, việc chạy đua theo các mô hình hàng nghìn tỷ tham số là con đường tốn kém nhưng ít đem lại hiệu quả thực tế. Tải về 1,56 terabyte trọng số của Kimi K3 chỉ để chạy vài tác vụ cơ bản thường là sự lãng phí tài nguyên máy chủ.
Lối đi thực tế hơn nhiều lúc này nằm ở việc làm chủ các mô hình nhỏ và thiết lập một tầng định tuyến thông minh ngay từ đầu. Thay vì gắn chặt toàn bộ sản phẩm vào một API của bên thứ ba, đội ngũ kỹ thuật nên bóc tách luồng công việc nội bộ thành các tầng tác vụ riêng biệt. Những khâu xử lý văn bản quy chuẩn, trích xuất dữ liệu thô hay hỗ trợ viết mã hoàn toàn có thể bàn giao cho các mô hình dưới 10 tỷ tham số tự lưu trữ tại chỗ.
Khi tiến hành triển khai, hãy tự xây dựng một bộ dữ liệu kiểm thử đặc thù cho bài toán của mình thay vì chỉ nhìn vào điểm số benchmark công bố trên giấy. Một mô hình đạt điểm cao trên 34 bài kiểm thử tiêu chuẩn quốc tế chưa chắc đã xử lý tốt ngữ cảnh tiếng Việt hoặc thuật ngữ chuyên ngành của doanh nghiệp nếu không được kiểm chứng qua dữ liệu thực tế.
Lợi thế cạnh tranh của người làm công nghệ hiện nay không nằm ở việc sở hữu mô hình to nhất, mà nằm ở năng lực xâu chuỗi: dùng mô hình nhỏ để tiết kiệm chi phí, dùng bộ định tuyến để bảo toàn chất lượng đầu ra, và chỉ kích hoạt các cỗ máy khổng lồ khi bài toán thực sự đòi hỏi.