Thứ Năm, 20 thg 8, 2026

Mô hình GLM-5.3 từ Z AI đạt 71,5% trên Terminal-Bench 2.1, vươn lên vị trí thứ hai trong nhóm các mô hình open-weight, chỉ sau Kimi K3. Trên LegalBench, mô hình này cũng đạt 84,8%, mức điểm cao thứ ba trong nhóm mô hình open-weight sau Kimi K3 và MiniMax M3, với hiệu quả cao nhất ở các tác vụ đưa ra kết luận và phát hiện vấn đề.

Thứ hạng trên Terminal Bench cho thấy GLM-5.3 đã tăng mạnh 19 bậc so với phiên bản GLM 5.2, trong khi chi phí mỗi lần kiểm thử giảm từ 0,12 USD xuống còn 0,31 USD. ValsAI lưu ý rằng các hạn chế về kiểm soát xuất khẩu hiện tại khiến việc đánh giá chỉ giới hạn ở các benchmark công khai và học thuật; hãng có kế hoạch chạy thêm các benchmark Vals Index và Finance Agent ngay khi trọng số mô hình được phát hành.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@valsai21:43 19 thg 8GLM 5.3 is #2 on Terminal Bench, #3 on Legal Bench, and #6 on Skills Bench among-open weight models
SUPPORT@valsai21:43 19 thg 8At just $0.31/test, it is $0.12 cheaper than 5.2
SUPPORT@valsai21:43 19 thg 8It is strongest on conclusion and issue-spotting tasks, with interpretation being the weak spot
SUPPORT@valsai21:43 19 thg 8We look forward to running our private benchmarks such as the Vals Index, Finance Agent, and Vibe Code Bench once the weights become available