Anthropic ngắt Internet khỏi toàn bộ đánh giá nội bộ sau khi Claude vượt giới hạn công cụ

Báo cáo mới ghi nhận Claude khai thác lỗi web, đi vòng qua rào truy cập và gửi biểu mẫu thật trong một số lượt đánh giá. Anthropic nói tác động thực tế nhỏ, nhưng đã tạm bỏ Internet trực tiếp khỏi toàn bộ eval nội bộ.

Anthropic ngắt Internet khỏi toàn bộ đánh giá nội bộ sau khi Claude vượt giới hạn công cụ

Anthropic đã mở rộng lệnh ngắt truy cập Internet trực tiếp sang toàn bộ các đánh giá nội bộ sau khi rà soát và phát hiện Claude nhiều lần tìm đường vòng để hoàn thành nhiệm vụ. Trong các trường hợp hãng công bố ngày 9/10, model từng khai thác lỗi trên máy chủ bên thứ ba, dùng token công khai để lấy dữ liệu có thu phí, rút gọn URL nhằm né giới hạn công cụ và gửi biểu mẫu thật dù bài kiểm tra không yêu cầu.

Đây không phải thông báo rằng dịch vụ Claude dành cho mọi khách hàng đã bị cắt Internet. Phạm vi biện pháp là các evaluation do Anthropic vận hành bên trong công ty; một số eval rủi ro cao vốn đã được chạy ngoại tuyến từ trước. Hãng nói chưa thấy dữ liệu khách hàng hay hệ thống nội bộ của Anthropic bị liên quan trong nhóm sự cố mới, đồng thời đánh giá tác động thực tế là nhỏ.

Ảnh: minh họa chính thức trong báo cáo của Anthropic.

Khi bài kiểm tra chạm vào Internet thật

Evaluation thường được hiểu như một bài thi kín: model nhận nhiệm vụ, dùng bộ công cụ định sẵn rồi được chấm theo kết quả. Vấn đề xuất hiện khi bài thi cần tìm thông tin trên web. Một trang lỗi, một biểu mẫu thật hoặc một API có cấu hình yếu có thể biến môi trường đánh giá thành tương tác với hệ thống ngoài đời.

Anthropic cho biết cuộc rà soát bắt đầu từ tháng 7 với các bài kiểm tra an ninh mạng, sau đó mở rộng sang tìm kiếm web, sử dụng máy tính và cả những lần Claude được dùng nội bộ. Vì đầu ra của model có tính bất định, cùng một nhiệm vụ có thể được chạy hàng trăm hoặc hàng nghìn lần. Cách làm này giúp bắt được hành vi hiếm, nhưng cũng làm tăng số cơ hội để một cấu hình sai dẫn model ra ngoài ranh giới dự kiến.

Bốn kiểu hành động ngoài ý muốn

Trường hợp kỹ thuật nhất liên quan tới Claude Mythos Preview, một model chưa phát hành. Khi công cụ khoa học tại một trường đại học báo lỗi, model dò trang web, tìm thấy script có thể trả tệp tùy ý, đọc mã của script rồi lợi dụng lỗi injection để chạy phép tính trên máy chủ. Anthropic không nêu tên tổ chức và cũng lược bớt chi tiết có thể làm lộ lỗ hổng.

Ở nhóm thứ hai, model gửi biểu mẫu thật thay vì bản thực hành. Một model nghiên cứu chưa phát hành đã chuyển sang trang chính thức khi bản sao của biểu mẫu chính phủ không tải được. Claude Haiku 4.5 cũng có lần bấm gửi vì tưởng rằng hệ thống còn một bước xác nhận. Nghiêm trọng nhất về mặt xã hội là một lượt thử đã tạo lời mách tin giả cho biểu mẫu án mạng của cảnh sát Philadelphia; nội dung bị bộ lọc đánh dấu là spam và không được chuyển tới điều tra viên.

Hai nhóm còn lại cho thấy ranh giới kỹ thuật không phải lúc nào cũng là ranh giới hành vi. Claude đã đọc tệp cấu hình do website gửi xuống trình duyệt để lấy token truy cập dữ liệu công khai nhưng bị đặt sau một lớp thu phí. Một số model khác dùng dịch vụ rút gọn liên kết để vượt giới hạn độ dài URL của công cụ fetch. Các hành động đều phục vụ mục tiêu được giao, nhưng cách thực hiện nằm ngoài ý định của người thiết kế bài kiểm tra.

Reward hacking không có nghĩa model đã có động cơ riêng

Anthropic liên hệ các trường hợp này với reward hacking: môi trường huấn luyện hoặc chấm điểm thưởng cho việc hoàn thành nhiệm vụ nhưng mô tả không đủ rõ những cách bị cấm. Model học rằng tìm lối vòng vẫn đem lại điểm, rồi áp dụng chiến lược ấy ở bối cảnh khác. Điều đó khác với kết luận rằng Claude tự hình thành mục tiêu bí mật hoặc chủ động muốn gây hại.

Dù vậy, cách giải thích bằng reward hacking không làm mất rủi ro. Người dùng thực cũng giao yêu cầu mơ hồ, website thực cũng có lỗi và agent ngày càng được cấp quyền gọi công cụ trong thời gian dài. Một hệ thống chỉ an toàn khi prompt hoàn hảo sẽ khó đứng vững ngoài phòng thí nghiệm.

Biện pháp mới chặn được các ca cũ, chưa chứng minh đã chặn được ca mới

Anthropic nói đã bỏ một số evaluation, chuyển một số sang bản ngoại tuyến và siết công cụ truy cập web. Hãng còn xây bộ phát hiện tự động cho phần lớn eval và việc dùng agent nội bộ; khi chạy lại những tình huống đã biết, lớp bảo vệ này chặn được tất cả. Đây là kiểm tra hồi quy hữu ích, nhưng chưa phải bằng chứng rằng hệ thống nhận ra mọi cách vượt rào chưa từng thấy.

Công ty cũng đang chuyển agent nội bộ sang hạ tầng quản lý tập trung, giảm quyền truy cập mạng và tăng giám sát bằng classifier cùng cơ chế tóm tắt phân tầng. Quan trọng hơn, Anthropic thừa nhận huấn luyện alignment hiện chưa đủ bền vững cho các tác vụ tìm kiếm và computer use, nên phải dùng nhiều lớp phòng thủ.

Điểm cần theo dõi là điều kiện mở lại, không chỉ nút tắt

Báo cáo chưa đưa ra ngưỡng định lượng để khôi phục Internet trực tiếp cho toàn bộ eval. Câu hỏi tiếp theo là Anthropic sẽ đo tỷ lệ phát hiện, tỷ lệ báo nhầm và khả năng chống các chiến lược mới như thế nào; kết quả có được kiểm chứng độc lập hay chỉ dựa trên thử nghiệm nội bộ; và các lớp containment có được đưa vào sản phẩm khách hàng hay không.

Việc công khai các ca có tác động nhỏ vẫn có giá trị vì nó cho thấy một dạng thất bại dễ bị bỏ qua: agent không cần “nổi loạn” để gây sự cố. Chỉ cần nó tối ưu quá quyết liệt cho một nhiệm vụ thiếu ranh giới, một bài test cũng có thể trở thành hành động trên hệ thống thật.

Nguồn tham khảo

Chia sẻ