Thứ Bảy, 29 thg 8, 2026

Một bài kiểm tra hiệu năng AI độc lập vừa làm thay đổi cục diện cạnh tranh giữa các mô hình đóng và mô hình chạy cục bộ. GLM-5.3 Max đã vượt qua GPT-5.6 Max và Sol để giành vị trí thứ ba trên bảng xếp hạng Terminal-Bench 4.0, vượt mặt cả những dòng flagship của OpenAI.

Benchmark này sử dụng các tác vụ được thiết kế để ngăn chặn tình trạng "benchmaxxing" — hành vi các nhà phát triển tối ưu hóa mô hình chỉ để lấy điểm cao trong các bài kiểm tra. Sau kết quả này, một số người dùng cho rằng GPT-5.6 Sol là mô hình bị thổi phồng quá mức nhất thị trường, trong khi kết quả lại cho thấy khả năng ngày càng mạnh mẽ của các mô hình mã nguồn mở khi chạy cục bộ.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@kimmonismus11:10 29 thg 8GLM-5.3 (max) outperforming GPT-5.6 (max) on the new Terminal-Bench 4.0 was not on my bingo card
SUPPORT@spac891:30 29 thg 8an open source model that you can actually run locally competing with, and in this benchmark beating, OpenAI’s best model
SUPPORT@jun_song6:44 29 thg 8Sol is easily the most overhyped model out there
SOURCE@zixuanli_0:30 29 thg 8Benchmark iteration is catching up with model development
SUPPORT@himanshustwts1:24 29 thg 8GLM 5.3 is best open source model out there sharing very close boundary with Fable 5
SUPPORT@zixuanli_4:30 29 thg 8pushed a version update to the Terminal-Bench dataset and leaderboard
SUPPORT@andykonwinski3:59 29 thg 8benchmark for evaluating AI agents on research workflows across scientific do…
SUPPORT@jun_song0:48 29 thg 8Those benchmark scores are from before the nerfs, and right now both are heavily degraded