Alibaba mã nguồn mở mô hình Qwen 6B Active, bản xem trước đầu tiên của kiến trúc Qwen4
Releases36 ngày trướcAlibaba vừa ra mắt mô hình đa phương thức Qwen3.8-Flash trên OpenRouter và Qwen Cloud, cùng với phiên bản Qwen3.8-Flash-Next. Mô hình open-weight Flash-Next sử dụng thiết kế mixture-of-experts với 125 tỷ tham số, nhưng chỉ có 6 tỷ tham số hoạt động trên mỗi token. Mô hình này tích hợp thêm 51 tỷ tham số phụ N-gram, kết hợp cơ chế hybrid attention và bộ tối ưu hóa Muon để giảm chi phí tính toán.
Theo báo cáo từ Qwen, Flash-Next vượt qua DeepSeek-V4-Flash ở các benchmark về coding và agent dù chỉ có số lượng tham số hoạt động bằng khoảng một nửa. API của mô hình trên Qwen Cloud có giá 0,15 USD cho mỗi 1 triệu input token và 0,47 USD cho mỗi 1 triệu output token. Bản phát hành sớm này giúp các framework inference như vLLM và SGLang có thời gian thích nghi với kiến trúc mới trước khi Qwen4 chính thức ra mắt.
Nguồn chính
- SOURCE@alibaba_qwen“Coding assistants, agentic workflows, long-video understanding, all one API call away”x.com
- SOURCE@alibaba_qwen“$0.15/1M input tokens, $0.47/1M output tokens, and just $0.016/1M on cache hits”x.com
- SUPPORT@zhihufrontier“Flash-Next has 125B total parameters with only 6B active — far smaller than the 300B-class GLM-5.3-Flash”x.com
- SUPPORT@quixiai“running at 150 tok/s @ c1 to 661.1 tok/s @ c32 at 262k context”x.com