Các nhà phát triển vừa cập nhật bộ dữ liệu và bảng xếp hạng Terminal-Bench lên phiên bản 4.0 để bám sát tốc độ phát triển của các mô hình AI hiện nay. Bản cập nhật này bao gồm 66 tác vụ thuộc nhiều lĩnh vực như khoa học, phần mềm, ML, vận hành, bảo mật, phần cứng và truyền thông. Đặc biệt, một nhánh mới mang tên Terminal-Bench-Science cũng được thêm vào để đánh giá khả năng thực hiện quy trình nghiên cứu của các AI agent. Kết quả ban đầu cho thấy Opus 5 vượt qua Fable 5, trong khi GLM 5.3 dẫn đầu ở phân khúc mô hình mã nguồn mở.

Ryan Marten và Steven Dillmann thực hiện bản cập nhật này nhằm hiệu chỉnh lại các giả định về tài nguyên tác vụ trên bảng xếp hạng. Việc mở rộng quy mô diễn ra trong bối cảnh các kỹ thuật post-training đang dần bắt kịp các tình huống sử dụng thực tế, giúp thu hẹp khoảng cách hiệu suất giữa các mô hình từ các lab khác ngoài OpenAI hay Anthropic.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCE@zixuanli_“Benchmark iteration is catching up with model development”x.com
  2. SUPPORT@himanshustwts“GLM 5.3 is best open source model out there sharing very close boundary with Fable 5”x.com
  3. SUPPORT@zixuanli_“pushed a version update to the Terminal-Bench dataset and leaderboard”x.com
  4. SUPPORT@andykonwinski“benchmark for evaluating AI agents on research workflows across scientific do…”x.com
  5. SUPPORT@jun_song“Those benchmark scores are from before the nerfs, and right now both are heavily degraded”x.com
Bản Markdown