Thứ Bảy, 22 thg 8, 2026

Mô hình mới nhất của Zai sử dụng Kimi-Linear Decode trên GPU RTX PRO 6000 để tối ưu hóa throughput khi inference. Trên benchmark KernelBench-Mega, phiên bản GLM-5.3 đạt tốc độ nhanh gấp 21,4 lần so với mức cơ sở của PyTorch, gần như gấp đôi mức 11,1 lần của GLM-5.2. Phiên bản này cũng vượt qua bài kiểm tra single-launch, một yêu cầu kỹ thuật mà phiên bản trước đó chưa làm được.

Sự cải thiện hiệu suất này dựa trên việc sử dụng CUDA `load_inline` launch với 512-thread CTAs duy trì liên tục và 30 grid barriers. Cách triển khai này giữ quá trình Int4 dequant bên trong GEMV và tích hợp Multi-Head Latent Attention (MLA) để tránh việc phải tạo ra bộ nhớ KV cồng kềnh.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@elliotarledge11:30 22 thg 8MLA is absorbed so the fat KV is not materialized
SUPPORT@zai_org12:31 22 thg 8One CUDA `load_inline` launch