Thứ Bảy, 29 thg 8, 2026

Các nhà phát triển vừa cập nhật bộ dữ liệu và bảng xếp hạng Terminal-Bench lên phiên bản 4.0 để bám sát tốc độ phát triển của các mô hình AI hiện nay. Bản cập nhật này bao gồm 66 tác vụ thuộc nhiều lĩnh vực như khoa học, phần mềm, ML, vận hành, bảo mật, phần cứng và truyền thông. Đặc biệt, một nhánh mới mang tên Terminal-Bench-Science cũng được thêm vào để đánh giá khả năng thực hiện quy trình nghiên cứu của các AI agent. Kết quả ban đầu cho thấy Opus 5 vượt qua Fable 5, trong khi GLM 5.3 dẫn đầu ở phân khúc mô hình mã nguồn mở.

Ryan Marten và Steven Dillmann thực hiện bản cập nhật này nhằm hiệu chỉnh lại các giả định về tài nguyên tác vụ trên bảng xếp hạng. Việc mở rộng quy mô diễn ra trong bối cảnh các kỹ thuật post-training đang dần bắt kịp các tình huống sử dụng thực tế, giúp thu hẹp khoảng cách hiệu suất giữa các mô hình từ các lab khác ngoài OpenAI hay Anthropic.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@zixuanli_0:30 29 thg 8Benchmark iteration is catching up with model development
SUPPORT@himanshustwts1:24 29 thg 8GLM 5.3 is best open source model out there sharing very close boundary with Fable 5
SUPPORT@zixuanli_4:30 29 thg 8pushed a version update to the Terminal-Bench dataset and leaderboard
SUPPORT@andykonwinski3:59 29 thg 8benchmark for evaluating AI agents on research workflows across scientific do…
SUPPORT@jun_song0:48 29 thg 8Those benchmark scores are from before the nerfs, and right now both are heavily degraded