← Về trang chính1 tin
1
Mô hình mã nguồn mở GLM-5.3 vượt qua GPT-5.6 để đứng thứ 3 trên Terminal-Bench 4.0, đánh bại sản phẩm tốt nhất của OpenAI
Research34 ngày trướcMột bài kiểm tra hiệu năng AI độc lập vừa làm thay đổi cục diện cạnh tranh giữa các mô hình đóng và mô hình chạy cục bộ. GLM-5.3 Max đã vượt qua GPT-5.6 Max và Sol để giành vị trí thứ ba trên bảng xếp hạng Terminal-Bench 4.0, vượt mặt cả những dòng flagship của OpenAI.
Benchmark này sử dụng các tác vụ được thiết kế để ngăn chặn tình trạng "benchmaxxing" — hành vi các nhà phát triển tối ưu hóa mô hình chỉ để lấy điểm cao trong các bài kiểm tra. Sau kết quả này, một số người dùng cho rằng GPT-5.6 Sol là mô hình bị thổi phồng quá mức nhất thị trường, trong khi kết quả lại cho thấy khả năng ngày càng mạnh mẽ của các mô hình mã nguồn mở khi chạy cục bộ.
Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
- SOURCE@kimmonismus“GLM-5.3 (max) outperforming GPT-5.6 (max) on the new Terminal-Bench 4.0 was not on my bingo card”x.com
- SUPPORT@spac89“an open source model that you can actually run locally competing with, and in this benchmark beating, OpenAI’s best model”x.com
- SUPPORT@jun_song“Sol is easily the most overhyped model out there”x.com
- SOURCE@zixuanli_“Benchmark iteration is catching up with model development”x.com
- SUPPORT@himanshustwts“GLM 5.3 is best open source model out there sharing very close boundary with Fable 5”x.com
- SUPPORT@zixuanli_“pushed a version update to the Terminal-Bench dataset and leaderboard”x.com
- SUPPORT@andykonwinski“benchmark for evaluating AI agents on research workflows across scientific do…”x.com
- SUPPORT@jun_song“Those benchmark scores are from before the nerfs, and right now both are heavily degraded”x.com