← Về trang chính1 tin
Chủ Nhật, 30 thg 8, 2026
1
Fireworks AI trì hoãn ra mắt GLM-5.3-Flash hai ngày để khắc phục lỗi 'suy nghĩ quá mức'
Models5 ngày trước2/53Hãng quyết định lùi lịch phát hành GLM-5.3-Flash nhằm xử lý sự sai lệch trong benchmark, khiến thời gian suy luận trên các bài kiểm tra AIME và GPQA bị kéo dài gấp đôi. Qua kiểm tra với vLLM và SGLang, đội ngũ kỹ thuật phát hiện các engine mã nguồn mở tạo ra chuỗi suy luận dài hơn so với Z.ai API, gây ảnh hưởng đến chất lượng mô hình và hiệu suất sử dụng token.
Sau khi Z.ai nhanh chóng cập nhật API để chuẩn hóa độ dài suy luận giữa các nhà cung cấp, Fireworks AI đã chọn lùi ngày ra mắt thêm một ngày thay vì phát hành ngay lập tức. Quyết định này giúp người dùng tránh lãng phí token vào các hành vi 'suy nghĩ quá mức' (overthinking), vốn có thể làm tăng chi phí vận hành.
Đăng nhập để góp ý, chỉnh sửa