Thứ Năm, 20 thg 8, 2026
Z AI nâng tầm trí tuệ GLM-5.3 nhờ RL, thay đổi tư duy chạy đua số lượng tham số
Models15 ngày trước1/22Z AI vừa ra mắt GLM-5.3 như một thử nghiệm nhằm chứng minh rằng việc tập trung vào giai đoạn post-training và reinforcement learning (RL) có thể tăng cường trí thông minh mà không cần nới rộng kích thước mô hình. Dù giữ nguyên kiến trúc, số lượng tham số tổng và tham số kích hoạt như phiên bản GLM-5.2, mô hình mới đã trải qua một tháng huấn luyện mở rộng trong các môi trường dài hạn và RL. Công ty cho biết hiệu suất cải thiện rõ rệt, đồng thời khẳng định post-training chính là đòn bẩy hiệu quả nhất để nâng cao năng lực mô hình trong chu kỳ phát triển hiện nay.
Cách tiếp cận này đi ngược lại xu hướng chạy đua số lượng tham số khổng lồ của ngành — điều mà Z AI gọi là 'vòng quẩn quanh của hàng nghìn tỷ tham số'. Phân tích về Switch Transformer với 1,6 nghìn tỷ tham số trước đây cho thấy dù các mô hình lớn rất giỏi truy xuất kiến thức, chúng thường thất bại ở các tác vụ suy luận. Z AI tin rằng để đạt được khả năng suy luận cấp cao, chẳng hạn như phát hiện lỗ hổng bảo mật, cần tập trung vào việc tăng độ sâu hiệu dụng và tối ưu post-training thay vì chỉ cố gắng nạp thêm thật nhiều dữ liệu ghi nhớ.