← Về trang chính1 tin
1
DeepSeek V4.1 Flash giảm 50% tính toán prefill trong chuyển đổi từ Transformer tiêu chuẩn
Models15 ngày trướcDeepSeek-V4.1-Flash sử dụng thiết kế Causal Encoder-Decoder kích hoạt 8 tỷ tham số cho mỗi token prefill so với 16 tỷ cho mỗi token decode. Mô hình có 40 lớp...
Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
- SOURCEmarketbrief.now