Thứ Năm, 27 thg 8, 2026
Alibaba mã nguồn mở mô hình Qwen 6B Active, bản xem trước đầu tiên của kiến trúc Qwen4
Phát hành8 ngày trước2/50Alibaba vừa ra mắt mô hình đa phương thức Qwen3.8-Flash trên OpenRouter và Qwen Cloud, cùng với phiên bản Qwen3.8-Flash-Next. Mô hình open-weight Flash-Next sử dụng thiết kế mixture-of-experts với 125 tỷ tham số, nhưng chỉ có 6 tỷ tham số hoạt động trên mỗi token. Mô hình này tích hợp thêm 51 tỷ tham số phụ N-gram, kết hợp cơ chế hybrid attention và bộ tối ưu hóa Muon để giảm chi phí tính toán.
Theo báo cáo từ Qwen, Flash-Next vượt qua DeepSeek-V4-Flash ở các benchmark về coding và agent dù chỉ có số lượng tham số hoạt động bằng khoảng một nửa. API của mô hình trên Qwen Cloud có giá 0,15 USD cho mỗi 1 triệu input token và 0,47 USD cho mỗi 1 triệu output token. Bản phát hành sớm này giúp các framework inference như vLLM và SGLang có thời gian thích nghi với kiến trúc mới trước khi Qwen4 chính thức ra mắt.