Chủ Nhật, 30 thg 8, 2026

Hãng quyết định lùi lịch phát hành GLM-5.3-Flash nhằm xử lý sự sai lệch trong benchmark, khiến thời gian suy luận trên các bài kiểm tra AIME và GPQA bị kéo dài gấp đôi. Qua kiểm tra với vLLM và SGLang, đội ngũ kỹ thuật phát hiện các engine mã nguồn mở tạo ra chuỗi suy luận dài hơn so với Z.ai API, gây ảnh hưởng đến chất lượng mô hình và hiệu suất sử dụng token.

Sau khi Z.ai nhanh chóng cập nhật API để chuẩn hóa độ dài suy luận giữa các nhà cung cấp, Fireworks AI đã chọn lùi ngày ra mắt thêm một ngày thay vì phát hành ngay lập tức. Quyết định này giúp người dùng tránh lãng phí token vào các hành vi 'suy nghĩ quá mức' (overthinking), vốn có thể làm tăng chi phí vận hành.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@vllm_project3:19 30 thg 8We worked alongside @inferact and @FireworksAI_HQ on the investigation
SUPPORT@sgl_project4:30 30 thg 8Correctness comes first
SUPPORT@morganlinton1:32 30 thg 8GLM 5.3 Flash can have overthinking issues, but these can be mitigated
SOURCEhuggingnews