Khi AI agent bắt đầu chạm vào nút bấm thực thi
Khi AI agent bắt đầu chạm vào nút bấm thực thi
Vài ngày trước, nền tảng công nghệ quảng cáo Adform đưa ra một thông báo khiến giới kỹ thuật vận hành phải chú ý: họ mở hơn 800 hàm nghiệp vụ trên hệ thống FLOW cho các trợ lý AI như ChatGPT hay Claude truy cập trực tiếp. Hồi tháng 7, nền tảng này mới chỉ cho phép các agent sử dụng 29 quyền đọc dữ liệu (read-only). Việc nhảy vọt từ vài chục hàm xem báo cáo lên gần một nghìn hàm bao quát từ lập kế hoạch, kích hoạt đến tối ưu chiến dịch cho thấy các nhà phát triển đang muốn biến mô hình ngôn ngữ thành cánh tay điều khiển hệ thống thực thụ.
Tuy nhiên, điều Adform chưa khẳng định rõ ràng là liệu các mô hình đó có được phép tự ý thay đổi một chiến dịch đang chạy ngoài đời thực hay không, hay vẫn phải dừng lại ở mức gợi ý để con người bấm nút xác nhận. Khoảng cách giữa việc “đọc dữ liệu” và “ra lệnh ghi đè” chính là ranh giới phức tạp nhất mà các kỹ sư phần mềm đang phải đối mặt khi đưa agent vào dây chuyền vận hành.
Ranh giới rủi ro chuyển từ mô hình sang cổng API
Nhiều năm qua, các cuộc thảo luận về an toàn AI chủ yếu xoay quanh chính bản thân mô hình: liệu nó có bị jailbreak không, có ảo giác khi gặp câu hỏi khó không, hay trọng số có bị lệch chuẩn đạo đức không. Những câu hỏi đó hiển nhiên cần thiết. Thế nhưng khi agent được tích hợp sâu vào hạ tầng doanh nghiệp, rủi ro lớn nhất lại nằm ở tầng giao tiếp giữa mô hình và các giao diện lập trình ứng dụng (API).
Một agent đọc nhầm dữ liệu báo cáo thì gây hiểu lầm, nhưng một agent gọi sai hàm API có quyền thay đổi dữ liệu (write hoặc mutate) thì hậu quả tính bằng tiền thật ngay lập tức. Trong trường hợp của Adform, các đối tác lớn như Dell Technologies hay Publicis Groupe từng thử nghiệm hạ tầng này, nhưng việc cấp quyền ghi cho AI vẫn luôn là bài toán đau đầu. Một câu lệnh hiểu sai ngữ cảnh hoàn toàn có thể đẩy ngân sách chiến dịch lên gấp mười lần hoặc tắt nhầm luồng phân phối quảng cáo đang hoạt động ổn định.
Mô hình ngôn ngữ bản chất hoạt động dựa trên xác suất. Do đó, việc gắn một cơ chế dựa trên xác suất vào một hệ thống phần mềm vốn đòi hỏi tính tất định là nguồn cơn tạo ra các lỗ hổng vận hành mới. Kỹ sư không thể chỉ dựa vào prompt để dặn agent “đừng xóa dữ liệu quan trọng”, vì prompt injection hay các lỗi suy luận logic bất thường luôn có thể xảy ra trong những tình huống biên.
Áp lực chi phí và sự phân hóa ở hai đầu thái cực
Để một agent hoàn thành công việc nhiều bước, nó phải đọc dữ liệu, lập luận, gọi thử công cụ, đọc kết quả trả về rồi mới ra quyết định tiếp theo. Quy trình lặp lại này tiêu tốn lượng token khổng lồ.
Tuần qua, thị trường chứng kiến sự chuyển dịch rõ rệt về mặt hạ tầng nhằm giải quyết chính bài toán kinh tế này. OpenAI tung ra hai phiên bản GPT-6 Sol và GPT-6 Luna với mức giảm giá 50% so với thế hệ trước. Trong đó, GPT-6 Luna hạ chi phí xuống chỉ còn 0,10 USD cho một triệu token đầu vào và 0,50 USD cho một triệu token đầu ra. Đi kèm với đó là cơ chế lưu bộ nhớ đệm prompt (prompt caching) cải tiến, giúp cắt giảm tới 90% chi phí vận hành cho các agent phải chạy nền liên tục với khối lượng ngữ cảnh lớn.
Ở chiều ngược lại, Anthropic ra mắt Claude Opus 5.5 với giá 4 USD đầu vào và 20 USD đầu ra cho mỗi triệu token. Mức giá này định vị Opus 5.5 phục vụ các tác vụ đòi hỏi suy luận chuyên sâu và chuỗi lập trình phức tạp - thể hiện qua điểm số 58 trên bài đo chuẩn năng lực agent (AAII). Một điểm đáng chú ý là phản hồi từ cộng đồng cho thấy Opus 5.5 đã bỏ bớt lối hành văn kiểu cách, dùng từ ngữ tự nhiên và đi thẳng vào vấn đề hơn. Đối với việc điều khiển công cụ, câu trả lời càng ngắn gọn, chính xác về mặt cú pháp thì tỷ lệ gọi API thành công càng cao.
Hai hướng đi này tạo ra sự phân công lao động rất rõ ràng trong kiến trúc agent: các mô hình giá rẻ, phản hồi nhanh đảm nhận việc điều phối và xử lý dữ liệu thô, còn mô hình suy luận lớn chỉ được gọi đến ở những điểm nghẽn logic then chốt.
Lối đi thực dụng cho các tác vụ quyết định cục bộ
Không phải lúc nào bài toán vận hành cũng cần đến một mô hình ngôn ngữ lớn chạy trên các cụm máy chủ GPU đắt đỏ. Ngày 24 tháng 9, Fastino Labs phát hành GLiNER2.5-Decide dưới giấy phép mã nguồn mở Apache 2.0. Đây là một mô hình dạng encoder chỉ vỏn vẹn 340 triệu tham số, chạy hoàn toàn trên CPU thông thường thay vì đòi hỏi phần cứng chuyên dụng.
GLiNER2.5-Decide không sinh văn bản tự do như ChatGPT hay Claude. Thay vào đó, nó nhận vào một đoạn văn bản cùng một tập hợp các quy tắc định sẵn, sau đó trả về quyết định có cấu trúc kèm theo phân phối xác suất và điểm tin cậy. Thử nghiệm trên chip Intel Xeon Platinum 8581C (48 vCPU) cho thấy độ trễ trung vị (p50) của mô hình chỉ là 167,3 mili-giây với kích thước batch bằng 1 và độ dài 64 token.
| Tiêu chí | Mô hình quyết định nhỏ (như GLiNER2.5-Decide) | Mô hình ngôn ngữ lớn (như Claude Opus 5.5, GPT-6) |
|---|---|---|
| Kích thước & Hạ tầng | 340M tham số, chạy tốt trên CPU máy chủ phổ thông | Hàng trăm tỷ tham số, phụ thuộc hạ tầng GPU hoặc API đám mây |
| Độ trễ phản hồi | Dưới 200 mili-giây, tính ổn định cao | Dao động từ vài giây đến hàng chục giây tùy chuỗi suy luận |
| Định dạng đầu ra | Cấu trúc phân loại rõ ràng, kèm điểm số xác suất | Văn bản tự nhiên hoặc chuỗi JSON cần parser kiểm tra lại |
| Môi trường phù hợp | Hệ thống nội bộ, môi trường cô lập mạng (air-gapped) | Tác vụ lập kế hoạch phức tạp, phân tích dữ liệu đa dạng |
Cách tiếp cận của Fastino cho thấy một hướng đi rất thực tế: tách phần “đưa ra quyết định theo luật” ra khỏi phần “tạo sinh ngôn ngữ”. Một mô hình 340 triệu tham số có thể nằm gọn trong hạ tầng mạng nội bộ, hoạt động độc lập không cần Internet, chịu trách nhiệm phân loại và chặn các yêu cầu rủi ro trước khi các lệnh đó chạm tới API của hệ thống cốt lõi.
Kỹ sư Việt Nam nên thiết kế hệ thống agent ra sao?
Nhìn vào những chuyển động công nghệ kể trên, việc vội vã tích hợp API của các mô hình thương mại để trao toàn quyền tự động cho phần mềm là một nước đi tiềm ẩn nhiều rủi ro hơn là lợi ích. Để triển khai agent một cách an toàn và tối ưu chi phí trong điều kiện thực tế tại Việt Nam, kiến trúc hệ thống nên tuân thủ các nguyên tắc sau:
- Tách rời hoàn toàn luồng đọc (Read Path) và luồng ghi (Write Path): Cho phép LLM thoải mái truy vấn, tổng hợp và phân tích dữ liệu qua các hàm chỉ đọc. Nhưng với mọi thao tác làm thay đổi trạng thái hệ thống như sửa bảng ghi, trừ tiền hoặc gửi thông báo hàng loạt, hệ thống bắt buộc phải tạo một phiếu yêu cầu (draft action) để con người phê duyệt.
- Tận dụng cơ chế prompt caching để ghìm chi phí: Khi dùng các API giá rẻ như GPT-6 Luna cho các tác vụ lặp đi lặp lại nhiều bước, việc cấu trúc lại prompt để tận dụng vùng nhớ đệm có thể giảm hóa đơn dịch vụ hàng tháng từ 70% đến 90%.
- Sử dụng mô hình chuyên biệt nhỏ làm lớp lọc an toàn: Trước khi đưa một quyết định do LLM đề xuất vào thực thi, hãy đưa quyết định đó qua một mô hình nhỏ chạy trên CPU cục bộ để đối soát với các điều kiện logic nghiệp vụ cứng. Nếu điểm tin cậy không đạt ngưỡng yêu cầu, lệnh đó lập tức bị hủy mà không cần phụ thuộc vào mạng ngoài.
Cơn sốt xây dựng agent biết làm mọi thứ đang dần nhường chỗ cho bài toán kỹ thuật thực dụng hơn: kiểm soát quyền hạn, tối ưu mili-giây độ trễ và giữ an toàn cho dữ liệu doanh nghiệp. Đưa AI vào quy trình không có nghĩa là buông tay lái, mà là xây dựng những rào chắn kỹ thuật đủ vững để hệ thống không tự làm hỏng chính mình khi không có người ngồi giám sát từng dòng lệnh.