---
format: "aidr-story-markdown/v1"
id: "90e9195777129f14ef887f3cceff3f2366e703ff217860c1315ed9fd05078f78"
canonical_url: "https://aidr.today/90e91957?lang=vi"
title: "Terminal Bench 4.0 ra mắt 66 tác vụ mới nhằm đánh giá chuyên sâu AI agent"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-08-29T05:37:48.000Z"
category: "Research"
topics: ["agent","benchmark","open-source","reasoning"]
source_urls: ["https://huggingnews.com/ai/terminal-bench-40-debuts-66-tasks-in-expanded-ai-agent-evaluation-858bff43","https://x.com/ZixuanLi_/status/2093496352915562552","https://x.com/himanshustwts/status/2093510073129853241","https://x.com/ZixuanLi_/status/2093556798364008545","https://x.com/andykonwinski/status/2093549026298020157","https://x.com/jun_song/status/2093500903601147912"]
summary: "Các nhà phát triển vừa cập nhật bộ dữ liệu và bảng xếp hạng Terminal-Bench lên phiên bản 4.0 để bám sát tốc độ phát triển của các mô hình AI hiện nay. Bản cập nhật này bao gồm 66 tác vụ thuộc nhiều lĩnh vực như khoa học, phần mềm, ML, vận hành, bảo mật, phần cứng và truyền thông. Đặc biệt, một nhánh mới mang tên Terminal-Bench-Science cũng được thêm vào để đánh giá khả năng thực hiện quy trình nghiên cứu của các AI agent. Kết quả ban đầu cho thấy Opus 5 vượt qua Fable 5, trong khi GLM 5.3 dẫn đầu ở phân khúc mô hình mã nguồn mở. Ryan Marten và Steven Dillmann thực hiện bản cập nhật này nhằm hiệu chỉnh lại các giả định về tài nguyên tác vụ trên bảng xếp hạng. Việc mở rộng quy mô diễn ra trong bối cảnh các kỹ thuật post-training đang dần bắt kịp các tình huống sử dụng thực tế, giúp thu hẹp khoảng cách hiệu suất giữa các mô hình từ các lab khác ngoài OpenAI hay Anthropic."
---

# Terminal Bench 4\.0 ra mắt 66 tác vụ mới nhằm đánh giá chuyên sâu AI agent

> [Open the canonical story](<https://aidr.today/90e91957?lang=vi>)

**Published:** 2026-08-29T05:37:48.000Z
**Category:** Research
**Topics:** agent, benchmark, open\-source, reasoning

## Summary

Các nhà phát triển vừa cập nhật bộ dữ liệu và bảng xếp hạng Terminal\-Bench lên phiên bản 4\.0 để bám sát tốc độ phát triển của các mô hình AI hiện nay\. Bản cập nhật này bao gồm 66 tác vụ thuộc nhiều lĩnh vực như khoa học, phần mềm, ML, vận hành, bảo mật, phần cứng và truyền thông\. Đặc biệt, một nhánh mới mang tên Terminal\-Bench\-Science cũng được thêm vào để đánh giá khả năng thực hiện quy trình nghiên cứu của các AI agent\. Kết quả ban đầu cho thấy Opus 5 vượt qua Fable 5, trong khi GLM 5\.3 dẫn đầu ở phân khúc mô hình mã nguồn mở\. Ryan Marten và Steven Dillmann thực hiện bản cập nhật này nhằm hiệu chỉnh lại các giả định về tài nguyên tác vụ trên bảng xếp hạng\. Việc mở rộng quy mô diễn ra trong bối cảnh các kỹ thuật post\-training đang dần bắt kịp các tình huống sử dụng thực tế, giúp thu hẹp khoảng cách hiệu suất giữa các mô hình từ các lab khác ngoài OpenAI hay Anthropic\.

## Sources

- [Story source](<https://huggingnews.com/ai/terminal-bench-40-debuts-66-tasks-in-expanded-ai-agent-evaluation-858bff43>)
- [Story source](<https://x.com/ZixuanLi_/status/2093496352915562552>)
- [Supporting source](<https://x.com/himanshustwts/status/2093510073129853241>)
- [Supporting source](<https://x.com/ZixuanLi_/status/2093556798364008545>)
- [Supporting source](<https://x.com/andykonwinski/status/2093549026298020157>)
- [Supporting source](<https://x.com/jun_song/status/2093500903601147912>)

