Thứ Bảy, 29 thg 8, 2026
Terminal Bench 4.0 ra mắt 66 tác vụ mới nhằm đánh giá chuyên sâu AI agent
Nghiên cứu6 ngày trước1/8Các nhà phát triển vừa cập nhật bộ dữ liệu và bảng xếp hạng Terminal-Bench lên phiên bản 4.0 để bám sát tốc độ phát triển của các mô hình AI hiện nay. Bản cập nhật này bao gồm 66 tác vụ thuộc nhiều lĩnh vực như khoa học, phần mềm, ML, vận hành, bảo mật, phần cứng và truyền thông. Đặc biệt, một nhánh mới mang tên Terminal-Bench-Science cũng được thêm vào để đánh giá khả năng thực hiện quy trình nghiên cứu của các AI agent. Kết quả ban đầu cho thấy Opus 5 vượt qua Fable 5, trong khi GLM 5.3 dẫn đầu ở phân khúc mô hình mã nguồn mở.
Ryan Marten và Steven Dillmann thực hiện bản cập nhật này nhằm hiệu chỉnh lại các giả định về tài nguyên tác vụ trên bảng xếp hạng. Việc mở rộng quy mô diễn ra trong bối cảnh các kỹ thuật post-training đang dần bắt kịp các tình huống sử dụng thực tế, giúp thu hẹp khoảng cách hiệu suất giữa các mô hình từ các lab khác ngoài OpenAI hay Anthropic.