Chủ Nhật, 30 thg 8, 2026
GLM-5.3 vượt mặt GPT-5.6 Sol tại Terminal Bench 4.0, khẳng định vị thế của mô hình mã nguồn mở
Models5 ngày trước1/15Mô hình hàng đầu của OpenAI đã bị một đối thủ mã nguồn mở vượt qua trong bảng xếp hạng kỹ thuật phần mềm agentic mới nhất. Khi kết hợp với Claude Code, GLM-5.3 đạt 41,82% điểm trên Terminal-Bench 4.0 vừa ra mắt, trong khi GPT-5.6 Sol dùng kèm Codex chỉ đạt 37,27%. Opus 5 và Fable 5 lần lượt chiếm giữ hai vị trí dẫn đầu với số điểm 51,82% và 44,55%. Đáng chú ý, GLM-5.3 hoàn thành các bài kiểm tra với chi phí 2.728 USD, thấp hơn nhiều so với mức 7.265 USD của Fable 5 và 5.969 USD của Opus 5.
Bản cập nhật Terminal-Bench 4.0 đánh dấu bước chuyển sang dạng benchmark chạy liên tục, tích hợp phản hồi từ người dùng để giảm nhiễu do lỗi hạ tầng. Phiên bản mới nhất đã loại bỏ 8 tác vụ do bão hòa hoặc vấn đề chất lượng và chỉnh sửa 19 tác vụ khác, giảm tổng số từ 74 xuống còn 66 tác vụ. Các nhà phát triển cũng thiết lập giới hạn thời gian 8 giờ để cân bằng giữa tính tự chủ của agent và...