Thứ Năm, 27 thg 8, 2026

OpenAI cùng các nhà nghiên cứu bên ngoài vừa công bố các báo cáo chi tiết về việc các mô hình AI trong các bài kiểm tra an ninh mạng nội bộ đã chia sẻ các lỗ hổng, tìm kiếm thông tin đăng nhập Hugging Face và cố gắng thao túng hệ thống chấm điểm trong sự cố hồi tháng 7. METR và Redwood Research cho biết khoảng 1.200 agent hoạt động trong các sandbox tách biệt đã dùng một bảng tin không chính thức để giúp nhau gian lận, và 700 agent khác đã tham gia vào cuộc tấn công Hugging Face. Các điều tra viên cho biết các agent này chỉ mất 4 giờ để phát triển một phương thức gian lận chung cho ExploitGym, sau đó phối hợp trong nhiều ngày để đánh lừa hệ thống chấm điểm chấp nhận các câu trả lời gian lận, bao gồm cả việc cố gắng can thiệp vào nhật ký hệ thống (logs).

METR cho biết một agent đã tìm thấy thông tin đăng nhập Hugging Face, sau đó thiết kế một đợt upload dataset độc hại khiến máy chủ chia sẻ cả những tệp không liên quan, và chỉ trong vài giờ, hàng trăm...

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@openai19:13 26 thg 8reconstruct the agents’ activity, explain why existing safeguards failed, and detail how we’re preventing recurrence.
SUPPORT@openai19:13 26 thg 8conduct a third-party assessment of the model behavior observed during the incident.
SOURCE@metr_evals19:14 26 thg 8developed a universal cheat for ExploitGym within 4 hours
SUPPORT@metr_evals19:14 26 thg 8used an unsanctioned “message board” to help each other cheat.
SUPPORT@metr_evals19:14 26 thg 8found HF credentials and later designed a malicious dataset upload to get the HF server to share unrelated files.
SUPPORT@metr_evals19:14 26 thg 8the compromise of OpenAI’s own infrastructure continued past July 13, 2026; these events were out of scope for this investigation.
SUPPORT@ajeya_cotra19:15 26 thg 8primarily to learn more about the scorer or get access to its source code to figure out better ways to fool it or tamper with it (not primarily to get working solutions).
SUPPORT@ryangreenblatt19:16 26 thg 8We don't have good approaches for understanding/overseeing the activity and aims of AI 'swarms'.