news.vtnn
AI

Khi AI agent bắt đầu chạm vào nút bấm thực thi

27 tháng 9, 2026 · 8 phút đọc
Khi AI agent bắt đầu chạm vào nút bấm thực thi

Khi AI agent bắt đầu chạm vào nút bấm thực thi

Vài ngày trước, nền tảng công nghệ quảng cáo Adform đưa ra một thông báo khiến giới kỹ thuật vận hành phải chú ý: họ mở hơn 800 hàm nghiệp vụ trên hệ thống FLOW cho các trợ lý AI như ChatGPT hay Claude truy cập trực tiếp. Hồi tháng 7, nền tảng này mới chỉ cho phép các agent sử dụng 29 quyền đọc dữ liệu (read-only). Việc nhảy vọt từ vài chục hàm xem báo cáo lên gần một nghìn hàm bao quát từ lập kế hoạch, kích hoạt đến tối ưu chiến dịch cho thấy các nhà phát triển đang muốn biến mô hình ngôn ngữ thành cánh tay điều khiển hệ thống thực thụ.

Tuy nhiên, điều Adform chưa khẳng định rõ ràng là liệu các mô hình đó có được phép tự ý thay đổi một chiến dịch đang chạy ngoài đời thực hay không, hay vẫn phải dừng lại ở mức gợi ý để con người bấm nút xác nhận. Khoảng cách giữa việc “đọc dữ liệu” và “ra lệnh ghi đè” chính là ranh giới phức tạp nhất mà các kỹ sư phần mềm đang phải đối mặt khi đưa agent vào dây chuyền vận hành.

Ranh giới rủi ro chuyển từ mô hình sang cổng API

Nhiều năm qua, các cuộc thảo luận về an toàn AI chủ yếu xoay quanh chính bản thân mô hình: liệu nó có bị jailbreak không, có ảo giác khi gặp câu hỏi khó không, hay trọng số có bị lệch chuẩn đạo đức không. Những câu hỏi đó hiển nhiên cần thiết. Thế nhưng khi agent được tích hợp sâu vào hạ tầng doanh nghiệp, rủi ro lớn nhất lại nằm ở tầng giao tiếp giữa mô hình và các giao diện lập trình ứng dụng (API).

Một agent đọc nhầm dữ liệu báo cáo thì gây hiểu lầm, nhưng một agent gọi sai hàm API có quyền thay đổi dữ liệu (write hoặc mutate) thì hậu quả tính bằng tiền thật ngay lập tức. Trong trường hợp của Adform, các đối tác lớn như Dell Technologies hay Publicis Groupe từng thử nghiệm hạ tầng này, nhưng việc cấp quyền ghi cho AI vẫn luôn là bài toán đau đầu. Một câu lệnh hiểu sai ngữ cảnh hoàn toàn có thể đẩy ngân sách chiến dịch lên gấp mười lần hoặc tắt nhầm luồng phân phối quảng cáo đang hoạt động ổn định.

Mô hình ngôn ngữ bản chất hoạt động dựa trên xác suất. Do đó, việc gắn một cơ chế dựa trên xác suất vào một hệ thống phần mềm vốn đòi hỏi tính tất định là nguồn cơn tạo ra các lỗ hổng vận hành mới. Kỹ sư không thể chỉ dựa vào prompt để dặn agent “đừng xóa dữ liệu quan trọng”, vì prompt injection hay các lỗi suy luận logic bất thường luôn có thể xảy ra trong những tình huống biên.

Áp lực chi phí và sự phân hóa ở hai đầu thái cực

Để một agent hoàn thành công việc nhiều bước, nó phải đọc dữ liệu, lập luận, gọi thử công cụ, đọc kết quả trả về rồi mới ra quyết định tiếp theo. Quy trình lặp lại này tiêu tốn lượng token khổng lồ.

Tuần qua, thị trường chứng kiến sự chuyển dịch rõ rệt về mặt hạ tầng nhằm giải quyết chính bài toán kinh tế này. OpenAI tung ra hai phiên bản GPT-6 Sol và GPT-6 Luna với mức giảm giá 50% so với thế hệ trước. Trong đó, GPT-6 Luna hạ chi phí xuống chỉ còn 0,10 USD cho một triệu token đầu vào và 0,50 USD cho một triệu token đầu ra. Đi kèm với đó là cơ chế lưu bộ nhớ đệm prompt (prompt caching) cải tiến, giúp cắt giảm tới 90% chi phí vận hành cho các agent phải chạy nền liên tục với khối lượng ngữ cảnh lớn.

Ở chiều ngược lại, Anthropic ra mắt Claude Opus 5.5 với giá 4 USD đầu vào và 20 USD đầu ra cho mỗi triệu token. Mức giá này định vị Opus 5.5 phục vụ các tác vụ đòi hỏi suy luận chuyên sâu và chuỗi lập trình phức tạp - thể hiện qua điểm số 58 trên bài đo chuẩn năng lực agent (AAII). Một điểm đáng chú ý là phản hồi từ cộng đồng cho thấy Opus 5.5 đã bỏ bớt lối hành văn kiểu cách, dùng từ ngữ tự nhiên và đi thẳng vào vấn đề hơn. Đối với việc điều khiển công cụ, câu trả lời càng ngắn gọn, chính xác về mặt cú pháp thì tỷ lệ gọi API thành công càng cao.

Hai hướng đi này tạo ra sự phân công lao động rất rõ ràng trong kiến trúc agent: các mô hình giá rẻ, phản hồi nhanh đảm nhận việc điều phối và xử lý dữ liệu thô, còn mô hình suy luận lớn chỉ được gọi đến ở những điểm nghẽn logic then chốt.

Lối đi thực dụng cho các tác vụ quyết định cục bộ

Không phải lúc nào bài toán vận hành cũng cần đến một mô hình ngôn ngữ lớn chạy trên các cụm máy chủ GPU đắt đỏ. Ngày 24 tháng 9, Fastino Labs phát hành GLiNER2.5-Decide dưới giấy phép mã nguồn mở Apache 2.0. Đây là một mô hình dạng encoder chỉ vỏn vẹn 340 triệu tham số, chạy hoàn toàn trên CPU thông thường thay vì đòi hỏi phần cứng chuyên dụng.

GLiNER2.5-Decide không sinh văn bản tự do như ChatGPT hay Claude. Thay vào đó, nó nhận vào một đoạn văn bản cùng một tập hợp các quy tắc định sẵn, sau đó trả về quyết định có cấu trúc kèm theo phân phối xác suất và điểm tin cậy. Thử nghiệm trên chip Intel Xeon Platinum 8581C (48 vCPU) cho thấy độ trễ trung vị (p50) của mô hình chỉ là 167,3 mili-giây với kích thước batch bằng 1 và độ dài 64 token.

Tiêu chíMô hình quyết định nhỏ (như GLiNER2.5-Decide)Mô hình ngôn ngữ lớn (như Claude Opus 5.5, GPT-6)
Kích thước & Hạ tầng340M tham số, chạy tốt trên CPU máy chủ phổ thôngHàng trăm tỷ tham số, phụ thuộc hạ tầng GPU hoặc API đám mây
Độ trễ phản hồiDưới 200 mili-giây, tính ổn định caoDao động từ vài giây đến hàng chục giây tùy chuỗi suy luận
Định dạng đầu raCấu trúc phân loại rõ ràng, kèm điểm số xác suấtVăn bản tự nhiên hoặc chuỗi JSON cần parser kiểm tra lại
Môi trường phù hợpHệ thống nội bộ, môi trường cô lập mạng (air-gapped)Tác vụ lập kế hoạch phức tạp, phân tích dữ liệu đa dạng

Cách tiếp cận của Fastino cho thấy một hướng đi rất thực tế: tách phần “đưa ra quyết định theo luật” ra khỏi phần “tạo sinh ngôn ngữ”. Một mô hình 340 triệu tham số có thể nằm gọn trong hạ tầng mạng nội bộ, hoạt động độc lập không cần Internet, chịu trách nhiệm phân loại và chặn các yêu cầu rủi ro trước khi các lệnh đó chạm tới API của hệ thống cốt lõi.

Kỹ sư Việt Nam nên thiết kế hệ thống agent ra sao?

Nhìn vào những chuyển động công nghệ kể trên, việc vội vã tích hợp API của các mô hình thương mại để trao toàn quyền tự động cho phần mềm là một nước đi tiềm ẩn nhiều rủi ro hơn là lợi ích. Để triển khai agent một cách an toàn và tối ưu chi phí trong điều kiện thực tế tại Việt Nam, kiến trúc hệ thống nên tuân thủ các nguyên tắc sau:

Cơn sốt xây dựng agent biết làm mọi thứ đang dần nhường chỗ cho bài toán kỹ thuật thực dụng hơn: kiểm soát quyền hạn, tối ưu mili-giây độ trễ và giữ an toàn cho dữ liệu doanh nghiệp. Đưa AI vào quy trình không có nghĩa là buông tay lái, mà là xây dựng những rào chắn kỹ thuật đủ vững để hệ thống không tự làm hỏng chính mình khi không có người ngồi giám sát từng dòng lệnh.

← Về trang chủ Lưu trữ →