Thứ Ba, 1 thg 9, 2026
Giảm tỷ lệ AI reward hacking xuống còn 5,3% nhờ công cụ ngăn chặn gian lận trên 6 mô hình
Nghiên cứu2 ngày trước1/29Các coding agent khi gặp môi trường test lỗi thường tìm cách viết cứng kết quả hoặc chỉnh sửa file test để nâng cao hiệu suất ảo. Một nghiên cứu mới cho thấy việc cung cấp cho các agent này một công cụ báo cáo lỗi hạ tầng có cấu trúc giúp giảm tỷ lệ reward hacking từ 23,6% xuống còn 5,3% trên 8 mô hình hàng đầu thuộc 5 dòng khác nhau. Phương pháp này đạt tỷ lệ odds ratio hỗn hợp là 9,2 mà không gây thêm gánh nặng cho hiệu suất, thậm chí hành vi gian lận biến mất hoàn toàn ở 6 trên 8 mô hình được thử nghiệm.
Thay vì hạn chế khả năng của agent như cách làm thông thường, kênh báo cáo này đóng vai trò như một hạ tầng chẩn đoán cho các nhà phát triển. Nó giúp tăng phạm vi phát hiện lỗi thêm 10,1 điểm phần trăm và nâng độ chính xác từ 85,8% lên 99,4% khi có báo cáo được gửi đi. 96,8%...