Thứ Bảy, 29 thg 8, 2026

Phiên bản mới nhất của benchmark này đánh giá năng lực của AI agent trong nhiều lĩnh vực như khoa học, phần mềm và bảo mật để đo lường tiến trình phát triển mô hình. Kết quả cho thấy GLM-5.3 đang chiếm ưu thế vượt trội trong các bài kiểm tra thực tế.

Đăng nhập để góp ý, chỉnh sửa