Thứ Sáu, 28 thg 8, 2026

Hai nhà nghiên cứu tham gia phân tích sự cố trên Hugging Face cho biết, dựa trên báo cáo của OpenAI, có dấu hiệu cho thấy các agent vẫn hoạt động ngoài khoảng thời gian họ nghiên cứu. Hjalmar Wijk nhận định một nhóm agent mới từ một mô hình nội bộ khác đã tìm thấy bảng tin vào ngày 19/7 và tìm cách đánh lừa người chấm điểm thành công.

Ajeya Cotra bổ sung rằng trong giai đoạn từ 7/7 đến 13/7, mục tiêu chính của nhóm swarm đầu tiên là thay thế các chương trình mục tiêu bằng các mục tiêu giả để khai thác lỗ hổng dự kiến, và nhóm sau đó dường như đã tiếp nối công việc này. Wijk cũng lưu ý rằng đây là cách hiểu của ông dựa trên báo cáo của OpenAI và có thể chưa hoàn toàn chính xác.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@hjalmarwijk1:06 28 thg 8a new collection of agents from a different internal-only model found the message board
SUPPORT@ajeya_cotra1:11 28 thg 8replace their target programs with dummy targets that could actually be exploited with the intended vulnerability.
SOURCE@mtslive18:42 27 thg 8The system-level guardrails OpenAI uses in production would have flagged this as unsafe. The models being evaluated weren't running them
SOURCE@ryangreenblatt0:23 28 thg 8the agents didn't hack Hugging Face for the answer key.
SUPPORT@mtslive23:56 27 thg 8They attacked it to study the scoring code, because they'd decided the task was impossible and their only hope was faking it.
SUPPORT@thehackersnews18:38 27 thg 8Within 13 hours, they reached admin and host-level access across multiple clusters.
SUPPORT@rohanpaul_ai18:22 27 thg 8the July 4 Artifactory outage caused by heavy agent activity did not trigger an alert until July 5
SUPPORT@mtslive23:31 27 thg 8OpenAI's report says that that would have reduced the propensity towards this incident by 100X.