Tag: AI safety
Anthropic chia quyền cyber của Claude thành ba tầng truy cập
Cyber Verification Program mới phân tách công việc phòng thủ, red team và hệ thống trọng yếu, đổi ít chặn hơn lấy yêu cầu xác minh...
AI safety từng chủ yếu thử model trong phòng lab: Bài toán mới là...
Red team và benchmark vẫn cần thiết, nhưng chúng không thể đoán hết cách kẻ xấu che giấu ý định, chia công việc qua nhiều phiên ho...
Rogue AI agent trở lại tâm điểm khi nguy cơ vượt khỏi sandbox ngà...
Hàng loạt sự cố từ OpenAI, Anthropic, Meta đến Kimi K3 đang khiến khái niệm “rogue AI agent” trở lại tâm điểm. Vấn đề không phải A...