AI agent cần ranh giới ngoài mô hình: NVIDIA đưa lớp giám sát xuống phần cứng

Open Agent Safety Platform kết hợp môi trường chạy OpenShell với bộ giám sát Sentry trên BlueField-4. Thiết kế đặt việc kiểm soát hành động bên ngoài tác nhân AI, nhưng hiệu quả thực tế vẫn cần được đo trong từng hệ thống.

AI agent cần ranh giới ngoài mô hình: NVIDIA đưa lớp giám sát xuống phần cứng

Một AI agent được giao sửa lỗi có thể cần đọc mã, chạy chương trình và gọi dịch vụ bên ngoài. Khi ấy, chất lượng câu trả lời chỉ là một phần của vấn đề: người vận hành còn phải quyết định chương trình được phép chạm vào đâu.

Ngày 28/9/2026, NVIDIA công bố Open Agent Safety Platform, kết hợp phần mềm OpenShell với thiết kế hệ thống Sentry. Điểm đáng chú ý là việc thực thi giới hạn được đặt ngoài mô hình, mở rộng tới phần cứng giám sát riêng.

OpenShell đặt giới hạn quanh công việc của agent

Theo tài liệu triển khai OpenShell, hệ thống có ba thành phần: Gateway quản lý môi trường và chính sách; Sandbox chạy tác vụ; Supervisor đứng ngoài tác vụ để kiểm tra những yêu cầu gửi đi. Sandbox không có đường mạng ra ngoài bỏ qua Supervisor trong kiến trúc được mô tả.

Cách tổ chức này tách quyền quyết định hành động khỏi quyền cho phép hành động. Agent vẫn có thể đề xuất gọi một API, nhưng đề xuất đó phải đi qua nơi thực thi chính sách.

Ví dụ, với một hệ thống biên tập, quyền tạo bản nháp có thể được cấp riêng với quyền xuất bản. Nếu hai thao tác dùng các endpoint khác nhau, chính sách có thể cho phép endpoint thứ nhất và yêu cầu xét duyệt khi cần endpoint còn lại. Đây là ví dụ ứng dụng nguyên tắc phân quyền, không phải một bài kiểm thử do NVIDIA công bố.

Khóa truy cập và thay đổi quyền được xử lý ra sao?

Kho mã nguồn OpenShell mô tả việc kiểm soát truy cập tệp, lời gọi hệ thống và kết nối mạng ở thời điểm chương trình chạy. Thông tin xác thực thật được giữ ngoài workload của agent và chỉ gắn vào yêu cầu gửi đến đích đã được phép.

Dự án còn sử dụng kiểm chứng hình thức khi thay đổi chính sách: hệ thống đánh giá quyền mới sẽ mở thêm khả năng gì, chẳng hạn tiếp cận một máy chủ hoặc phương thức API mới, để đưa các thay đổi rủi ro qua bước con người xem xét.

Điều này cần được hiểu đúng phạm vi. Kiểm tra một chính sách không tự chứng minh rằng mục tiêu kinh doanh được viết chính xác, dữ liệu đầu vào đáng tin hay mọi hành động hợp lệ đều hữu ích. Nó giúp biến một phần ranh giới vận hành thành điều kiện có thể kiểm tra.

Sentry bổ sung một bộ giám sát trên chip riêng

Trong thiết kế tham chiếu của NVIDIA, OpenShell hoạt động trên CPU Vera, còn Sentry chạy trên DPU BlueField-4. DPU là bộ xử lý chuyên trách; ở đây nó cung cấp một miền giám sát tách khỏi nơi tác vụ AI đang thực thi.

Tài liệu kỹ thuật nhấn mạnh đường đi tới mô hình như một điểm kiểm soát. Với kiến trúc Vera Rubin POD được mô tả, BlueField-4 nằm trên đường duy nhất từ node tới mô hình, cho phép quan sát và áp dụng chính sách ngoài workload.

Điểm này phụ thuộc kiến trúc triển khai. Nếu một hệ thống để lại đường gọi dịch vụ không qua nơi kiểm soát, sơ đồ bảo vệ trên giấy chưa đủ phản ánh những gì chương trình thực sự có thể làm. Đó là câu hỏi người vận hành cần kiểm tra khi chuyển một thiết kế tham chiếu thành hệ thống cụ thể.

Khả năng phản ứng nhanh cần đi cùng bằng chứng vận hành

NVIDIA nói Sentry có thể cách ly agent vượt ranh giới trong thời gian tính bằng mili giây. Đây là tuyên bố của hãng; thông cáo không cung cấp một bộ kết quả kiểm thử độc lập đủ để suy ra thời gian phản ứng cho mọi cấu hình.

Đánh giá triển khai vì thế cần trả lời những câu hỏi cụ thể: hành động nào được quan sát, thao tác nào bị chặn, nhật ký có giải thích được quyết định hay không, và công việc hợp lệ bị ảnh hưởng đến mức nào. Một cơ chế chặn đúng nhưng thường xuyên làm gián đoạn tác vụ cũng tạo chi phí vận hành.

OpenShell được phát hành theo giấy phép Apache 2.0. Kho dự án hướng dẫn chạy trên Linux và macOS dùng Apple Silicon, đồng thời ghi hỗ trợ Windows qua WSL 2 ở trạng thái thử nghiệm. Những lựa chọn này cho phép khảo sát lớp phần mềm trước; chúng không đồng nghĩa mọi máy đều có lớp Sentry trên BlueField-4.

Giá trị cần chứng minh tiếp theo nằm ở những triển khai có phạm vi quyền rõ ràng, đo được hành vi và tái hiện được kết quả. Với doanh nghiệp, một bộ kiểm soát hữu ích phải giúp giải thích agent đã được phép làm gì, đã làm gì và vì sao một hành động bị dừng.

Ảnh: sơ đồ Open Agent Safety Platform do NVIDIA công bố. Bài dựa trên thông cáo ngày 28/9/2026, tài liệu kỹ thuật và kho mã nguồn chính thức; các ví dụ ứng dụng là phân tích của phu.lt.

Nguồn: NVIDIA Newsroom; hướng dẫn OpenShell; thiết kế giám sát phần cứng; GitHub NVIDIA/OpenShell.

Chia sẻ