Thứ Năm, 20 thg 8, 2026
Cập nhật: GLM-5.3 nhảy 19 bậc, đứng thứ 2 trong nhóm mô hình open-weight trên Terminal Bench
Models15 ngày trước1/20Mô hình GLM-5.3 từ Z AI đạt 71,5% trên Terminal-Bench 2.1, vươn lên vị trí thứ hai trong nhóm các mô hình open-weight, chỉ sau Kimi K3. Trên LegalBench, mô hình này cũng đạt 84,8%, mức điểm cao thứ ba trong nhóm mô hình open-weight sau Kimi K3 và MiniMax M3, với hiệu quả cao nhất ở các tác vụ đưa ra kết luận và phát hiện vấn đề.
Thứ hạng trên Terminal Bench cho thấy GLM-5.3 đã tăng mạnh 19 bậc so với phiên bản GLM 5.2, trong khi chi phí mỗi lần kiểm thử giảm từ 0,12 USD xuống còn 0,31 USD. ValsAI lưu ý rằng các hạn chế về kiểm soát xuất khẩu hiện tại khiến việc đánh giá chỉ giới hạn ở các benchmark công khai và học thuật; hãng có kế hoạch chạy thêm các benchmark Vals Index và Finance Agent ngay khi trọng số mô hình được phát hành.