Thứ Tư, 26 thg 8, 2026

Mô hình mà Z.ai từng giới thiệu dưới tên Ox Alpha hiện đã chính thức có mặt trên các nền tảng của hãng, đánh dấu phiên bản multimodal đầu tiên của dòng GLM-5. Theo Z.ai, GLM-5.3-Flash sở hữu context window 1 triệu token, tổng cộng 320 tỷ tham số (trong đó có 18 tỷ tham số active) và được phát hành dưới giấy phép MIT. Trước đó, phiên bản Ox Alpha đã chạy hoàn toàn trên các chip AI của Trung Quốc.

OpenRouter cho biết Ox Alpha đã xử lý hơn 20 nghìn tỷ token chỉ trong 6 ngày trước khi ra mắt, trở thành mô hình lớn nhất trên nền tảng này. Phiên bản chính thức mới được Z.ai cải thiện về hiệu suất và độ ổn định, với mức giá 0,15 USD cho mỗi 1 triệu token đầu vào và 0,50 USD cho mỗi 1 triệu token đầu ra, kèm ưu đãi giảm giá 50% trong hai tuần tới. Trong bảng xếp hạng AutoEval sớm nhất, Arena đã xếp mô hình này ở vị trí thứ 5 trong danh mục Code Arena WebDev.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@zai_org14:12 26 thg 8Previously previewed as Ox Alpha, running entirely on Chinese AI chips
SOURCE@zixuanli_14:15 26 thg 8The official release delivers stronger performance and significantly better stability.
SUPPORT@openrouter14:14 26 thg 8the biggest model ever on OpenRouter
SUPPORT@vllm_project14:21 26 thg 8320B total, 18B active, 45 layers where GLM-4.5 had 92.
SUPPORT@arena14:37 26 thg 8landed around #5 in the Code Arena: WebDev (#2 among open models) scoring 1634 (AutoEval).
SUPPORT@semianalysis_14:42 26 thg 8attaining hardware efficiency and per-token cost comparable to Nvidia GPUs.
SUPPORT@zixuanli_14:23 26 thg 8GLM-5.3-Flash is now 50% off through the official https://t.co/GTCIA6vbgh API for the next two weeks.
SOURCE@zai_org14:12 26 thg 8performs on par with Claude Opus 4.8