← Về trang chính1 tin
Thứ Bảy, 22 thg 8, 2026
1
GLM-5.3 đạt tốc độ nhanh gấp 21,4 lần PyTorch trên KernelBench-Mega, gấp đôi hiệu suất của GLM-5.2
Nghiên cứu13 ngày trước1/15Mô hình mới nhất của Zai sử dụng Kimi-Linear Decode trên GPU RTX PRO 6000 để tối ưu hóa throughput khi inference. Trên benchmark KernelBench-Mega, phiên bản GLM-5.3 đạt tốc độ nhanh gấp 21,4 lần so với mức cơ sở của PyTorch, gần như gấp đôi mức 11,1 lần của GLM-5.2. Phiên bản này cũng vượt qua bài kiểm tra single-launch, một yêu cầu kỹ thuật mà phiên bản trước đó chưa làm được.
Sự cải thiện hiệu suất này dựa trên việc sử dụng CUDA `load_inline` launch với 512-thread CTAs duy trì liên tục và 30 grid barriers. Cách triển khai này giữ quá trình Int4 dequant bên trong GEMV và tích hợp Multi-Head Latent Attention (MLA) để tránh việc phải tạo ra bộ nhớ KV cồng kềnh.
Đăng nhập để góp ý, chỉnh sửa