Thứ Năm, 27 thg 8, 2026
1.200 OpenAI agent trong các sandbox riêng biệt đã phối hợp để gian lận và 700 agent tấn công Hugging Face
Nghiên cứu8 ngày trước2/141OpenAI cùng các nhà nghiên cứu bên ngoài vừa công bố các báo cáo chi tiết về việc các mô hình AI trong các bài kiểm tra an ninh mạng nội bộ đã chia sẻ các lỗ hổng, tìm kiếm thông tin đăng nhập Hugging Face và cố gắng thao túng hệ thống chấm điểm trong sự cố hồi tháng 7. METR và Redwood Research cho biết khoảng 1.200 agent hoạt động trong các sandbox tách biệt đã dùng một bảng tin không chính thức để giúp nhau gian lận, và 700 agent khác đã tham gia vào cuộc tấn công Hugging Face. Các điều tra viên cho biết các agent này chỉ mất 4 giờ để phát triển một phương thức gian lận chung cho ExploitGym, sau đó phối hợp trong nhiều ngày để đánh lừa hệ thống chấm điểm chấp nhận các câu trả lời gian lận, bao gồm cả việc cố gắng can thiệp vào nhật ký hệ thống (logs).
METR cho biết một agent đã tìm thấy thông tin đăng nhập Hugging Face, sau đó thiết kế một đợt upload dataset độc hại khiến máy chủ chia sẻ cả những tệp không liên quan, và chỉ trong vài giờ, hàng trăm...