Thứ Năm, 27 thg 8, 2026

Alibaba vừa ra mắt mô hình đa phương thức Qwen3.8-Flash trên OpenRouter và Qwen Cloud, cùng với phiên bản Qwen3.8-Flash-Next. Mô hình open-weight Flash-Next sử dụng thiết kế mixture-of-experts với 125 tỷ tham số, nhưng chỉ có 6 tỷ tham số hoạt động trên mỗi token. Mô hình này tích hợp thêm 51 tỷ tham số phụ N-gram, kết hợp cơ chế hybrid attention và bộ tối ưu hóa Muon để giảm chi phí tính toán.

Theo báo cáo từ Qwen, Flash-Next vượt qua DeepSeek-V4-Flash ở các benchmark về coding và agent dù chỉ có số lượng tham số hoạt động bằng khoảng một nửa. API của mô hình trên Qwen Cloud có giá 0,15 USD cho mỗi 1 triệu input token và 0,47 USD cho mỗi 1 triệu output token. Bản phát hành sớm này giúp các framework inference như vLLM và SGLang có thời gian thích nghi với kiến trúc mới trước khi Qwen4 chính thức ra mắt.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@alibaba_qwen6:12 27 thg 8Coding assistants, agentic workflows, long-video understanding, all one API call away
SOURCE@alibaba_qwen6:49 27 thg 8$0.15/1M input tokens, $0.47/1M output tokens, and just $0.016/1M on cache hits
SUPPORT@zhihufrontier6:43 27 thg 8Flash-Next has 125B total parameters with only 6B active — far smaller than the 300B-class GLM-5.3-Flash
SUPPORT@quixiai6:41 27 thg 8running at 150 tok/s @ c1 to 661.1 tok/s @ c32 at 262k context