---
format: "aidr-story-markdown/v1"
id: "7ef96a45f8c78a770275812e944d5c42c383829ef5935ef26939412195d902d3"
canonical_url: "https://aidr.today/7ef96a45?lang=vi"
title: "GLM-5.3 đạt tốc độ nhanh gấp 21,4 lần PyTorch trên KernelBench-Mega, gấp đôi hiệu suất của GLM-5.2"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-08-22T14:48:07.000Z"
category: "Research"
topics: ["inference","chips","llm"]
source_urls: ["https://huggingnews.com/ai/glm-53-hits-214x-pytorch-speedup-on-kernelbench-mega-doubling-glm-52-per-930bfc4c","https://x.com/elliotarledge/status/2091125950243033209","https://x.com/Zai_org/status/2091141282714587232"]
summary: "Mô hình mới nhất của Zai sử dụng Kimi-Linear Decode trên GPU RTX PRO 6000 để tối ưu hóa throughput khi inference. Trên benchmark KernelBench-Mega, phiên bản GLM-5.3 đạt tốc độ nhanh gấp 21,4 lần so với mức cơ sở của PyTorch, gần như gấp đôi mức 11,1 lần của GLM-5.2. Phiên bản này cũng vượt qua bài kiểm tra single-launch, một yêu cầu kỹ thuật mà phiên bản trước đó chưa làm được. Sự cải thiện hiệu suất này dựa trên việc sử dụng CUDA `load_inline` launch với 512-thread CTAs duy trì liên tục và 30 grid barriers. Cách triển khai này giữ quá trình Int4 dequant bên trong GEMV và tích hợp Multi-Head Latent Attention (MLA) để tránh việc phải tạo ra bộ nhớ KV cồng kềnh."
---

# GLM\-5\.3 đạt tốc độ nhanh gấp 21,4 lần PyTorch trên KernelBench\-Mega, gấp đôi hiệu suất của GLM\-5\.2

> [Open the canonical story](<https://aidr.today/7ef96a45?lang=vi>)

**Published:** 2026-08-22T14:48:07.000Z
**Category:** Research
**Topics:** inference, chips, llm

## Summary

Mô hình mới nhất của Zai sử dụng Kimi\-Linear Decode trên GPU RTX PRO 6000 để tối ưu hóa throughput khi inference\. Trên benchmark KernelBench\-Mega, phiên bản GLM\-5\.3 đạt tốc độ nhanh gấp 21,4 lần so với mức cơ sở của PyTorch, gần như gấp đôi mức 11,1 lần của GLM\-5\.2\. Phiên bản này cũng vượt qua bài kiểm tra single\-launch, một yêu cầu kỹ thuật mà phiên bản trước đó chưa làm được\. Sự cải thiện hiệu suất này dựa trên việc sử dụng CUDA \`load\_inline\` launch với 512\-thread CTAs duy trì liên tục và 30 grid barriers\. Cách triển khai này giữ quá trình Int4 dequant bên trong GEMV và tích hợp Multi\-Head Latent Attention \(MLA\) để tránh việc phải tạo ra bộ nhớ KV cồng kềnh\.

## Sources

- [Story source](<https://huggingnews.com/ai/glm-53-hits-214x-pytorch-speedup-on-kernelbench-mega-doubling-glm-52-per-930bfc4c>)
- [Story source](<https://x.com/elliotarledge/status/2091125950243033209>)
- [Supporting source](<https://x.com/Zai_org/status/2091141282714587232>)

