Thứ Năm, 27 thg 8, 2026

Các tệp GGUF cho GLM-5.3-Flash của Z.ai (trước đây là Ox Alpha) hiện đã khả dụng. Theo Unsloth, mô hình này có thể chạy ở định dạng 3-bit trên các hệ thống có 128GB RAM. Daniel Han Chen cho biết phiên bản 4-bit vẫn giữ được 93% độ chính xác và có thể chạy trên một chiếc Mac 256GB hoặc hai máy DGX Spark.

Tuần này, Z.ai đã ra mắt GLM-5.3-Flash dưới giấy phép MIT với context window lên tới 1 triệu token. Hãng cho biết mô hình này được vận hành hoàn toàn trên các chip AI của Trung Quốc. Với việc chiếm gần 20% thị phần token hàng tuần, mô hình này đã vươn lên vị trí số 1 trên OpenRouter. OpenRouter cũng xác nhận Ox Alpha đã xử lý hơn 20 nghìn tỷ token chỉ trong vòng sáu ngày.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@unslothai14:43 27 thg 8GLM-5.3-Flash (ox-alpha) rivals Claude Opus 4.8 on DeepSWE, coding & agentic benchmarks.
SUPPORT@hesamation13:00 27 thg 8Delivered nearly 20% weekly token share (no. 1) on OpenRouter.
SUPPORT@zai_org15:27 27 thg 8GLM-5.3-Flash can now be run locally! ✨
SUPPORT@danielhanchen15:23 27 thg 8It runs perfectly on a 256GB Mac or two DGX Sparks.
SUPPORT@nvidiaai13:24 27 thg 8881 tok/s C=64
SOURCE@zai_org3:19 27 thg 8GLM-5.3’s weights will be released tomorrow.
SUPPORT@jietang5:03 27 thg 8Natively multimodal with a 1M-token context…
SUPPORT@ollama0:58 27 thg 8it's available -- but rolling out, so performance isn't fully there yet!!