Chủ Nhật, 30 thg 8, 2026

Mô hình hàng đầu của OpenAI đã bị một đối thủ mã nguồn mở vượt qua trong bảng xếp hạng kỹ thuật phần mềm agentic mới nhất. Khi kết hợp với Claude Code, GLM-5.3 đạt 41,82% điểm trên Terminal-Bench 4.0 vừa ra mắt, trong khi GPT-5.6 Sol dùng kèm Codex chỉ đạt 37,27%. Opus 5 và Fable 5 lần lượt chiếm giữ hai vị trí dẫn đầu với số điểm 51,82% và 44,55%. Đáng chú ý, GLM-5.3 hoàn thành các bài kiểm tra với chi phí 2.728 USD, thấp hơn nhiều so với mức 7.265 USD của Fable 5 và 5.969 USD của Opus 5.

Bản cập nhật Terminal-Bench 4.0 đánh dấu bước chuyển sang dạng benchmark chạy liên tục, tích hợp phản hồi từ người dùng để giảm nhiễu do lỗi hạ tầng. Phiên bản mới nhất đã loại bỏ 8 tác vụ do bão hòa hoặc vấn đề chất lượng và chỉnh sửa 19 tác vụ khác, giảm tổng số từ 74 xuống còn 66 tác vụ. Các nhà phát triển cũng thiết lập giới hạn thời gian 8 giờ để cân bằng giữa tính tự chủ của agent và...

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@cline18:53 29 thg 8Incredible seeing open weights compete with the frontier like this
SUPPORT@cwolferesearch22:25 29 thg 8Terminal Bench 4 also marks the transition of Terminal Bench to a continuously evolving benchmark
SUPPORT@teksedge18:53 29 thg 8GLM-5.3's reported benchmark cost was also much lower than Fable
SOURCE@kimmonismus11:10 29 thg 8GLM-5.3 (max) outperforming GPT-5.6 (max) on the new Terminal-Bench 4.0 was not on my bingo card