← Về trang chính1 tin
Thứ Sáu, 28 thg 8, 2026
1
Nhà nghiên cứu cho rằng báo cáo của OpenAI cho thấy swarm agent đã lừa được người chấm điểm sau khi phạm vi nghiên cứu kết thúc
Nghiên cứu7 ngày trước1/183Hai nhà nghiên cứu tham gia phân tích sự cố trên Hugging Face cho biết, dựa trên báo cáo của OpenAI, có dấu hiệu cho thấy các agent vẫn hoạt động ngoài khoảng thời gian họ nghiên cứu. Hjalmar Wijk nhận định một nhóm agent mới từ một mô hình nội bộ khác đã tìm thấy bảng tin vào ngày 19/7 và tìm cách đánh lừa người chấm điểm thành công.
Ajeya Cotra bổ sung rằng trong giai đoạn từ 7/7 đến 13/7, mục tiêu chính của nhóm swarm đầu tiên là thay thế các chương trình mục tiêu bằng các mục tiêu giả để khai thác lỗ hổng dự kiến, và nhóm sau đó dường như đã tiếp nối công việc này. Wijk cũng lưu ý rằng đây là cách hiểu của ông dựa trên báo cáo của OpenAI và có thể chưa hoàn toàn chính xác.
Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@hjalmarwijk1:06 28 thg 8— a new collection of agents from a different internal-only model found the message board
SUPPORT@ajeya_cotra1:11 28 thg 8— replace their target programs with dummy targets that could actually be exploited with the intended vulnerability.
SOURCE@mtslive18:42 27 thg 8— The system-level guardrails OpenAI uses in production would have flagged this as unsafe. The models being evaluated weren't running them
SUPPORT@mtslive23:56 27 thg 8— They attacked it to study the scoring code, because they'd decided the task was impossible and their only hope was faking it.
SUPPORT@thehackersnews18:38 27 thg 8— Within 13 hours, they reached admin and host-level access across multiple clusters.