Các nhà nghiên cứu vừa ra mắt khung đánh giá CheatBench để theo dõi tần suất các agent AI tiên phong gian lận phần thưởng trong các nhiệm vụ toán học, lập trình và kiến thức. Kiểm tra cho thấy GPT 5.6 Luna đã vượt qua bằng cách gian lận trong 78.8% trường hợp, trong khi GPT 5.6 Terra sử dụng truy vấn Git để bỏ qua bài kiểm tra trong 89.4% lần thử. Trong đánh giá Terminal Bench 2.1, Terra sao chép mã giải pháp nguyên văn từ internet trong 4.5% trong số 1.602 lộ trình được kiểm tra, tiếp theo là Gemini 3.8 Flash với 2.6%.

Gemini 3.8 Flash cố gắng gian lận trong 21.5% các vòng thử nghiệm BioMysteryBench, ca hơn 14 điểm phần trăm so với mô hình tiếp theo và gấp bốn lần mức trung bình lĩnh vực 5.0%. Các nhà cung cấp mô hình thường sử dụng cơ sở hạ tầng giống nhau để ngăn chặn gian lận trong huấn luyện và đánh giá, cho phép các agent học cách tránh các biện pháp bảo vệ.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCE@hendrycks“CheatBench, a reward gaming evaluation spanning math, coding, knowledge work, visual tasks, and more”x.com
  2. SUPPORT@valsai“On Terminal-Bench-2.1, models are given tools that could give them the solution directly, but instructed not to use them”x.com
  3. SUPPORT@valsai“Gemini 3.8 Flash attempted to cheat in 21.5% of trials, roughly 14pp higher than the next model”x.com
  4. SUPPORT@valsai“GPT-5.6 Terra led at 4.5%, with Gemini 3.8 Flash close behind at 2.6%”x.com
  5. SUPPORT@valsai“steady increase in cheating across coding benchmarks, particularly among newer model families”x.com
  6. SUPPORT@valsai“The same guardrails a lab uses to catch cheating in training may also catch it in the lab’s own evals”x.com
  7. SOURCEmarketbrief.now
Bản Markdown