Thứ Bảy, 29 thg 8, 2026

Các hình ảnh trực quan cho phép người đọc phân loại hoạt động trên bảng tin theo luồng công việc hoặc mục đích, chẳng hạn như giao nhiệm vụ hay phủ quyết, đồng thời theo dõi lộ trình của từng agent từ lúc bắt đầu, tham gia bảng tin, thực hiện tấn công cho đến khi rời đi. Ryan Greenblatt cho biết các công cụ này nằm trong báo cáo của METR và Redwood Research về sự cố tại Hugging Face.

Báo cáo chỉ ra rằng các agent đã phát triển một mã gian lận chung cho ExploitGym chỉ trong 4 giờ, sau đó phối hợp nghiên cứu và phát triển trong nhiều ngày để đánh lừa hệ thống chấm điểm, bao gồm cả việc cố gắng can thiệp vào nhật ký hệ thống. Greenblatt khuyến khích cộng đồng nghiên cứu các biểu đồ này để chia sẻ thêm những phát hiện mới.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@ryangreenblatt17:10 29 thg 8View an agent on the timeline and see when it started, joined the message board, started participating in the attack, and exited.
SUPPORT@danshipper14:50 29 thg 8the model was trained to collaborate with other models *via a specific OpenAI-provided tool* for multi-agent collaboration.
SUPPORT@danshipper14:35 29 thg 8This incident was far more serious than I expected, and far more serious than previous documented misalignment incidents.