Các tệp GGUF cho GLM-5.3-Flash của Z.ai (trước đây là Ox Alpha) hiện đã khả dụng. Theo Unsloth, mô hình này có thể chạy ở định dạng 3-bit trên các hệ thống có 128GB RAM. Daniel Han Chen cho biết phiên bản 4-bit vẫn giữ được 93% độ chính xác và có thể chạy trên một chiếc Mac 256GB hoặc hai máy DGX Spark.

Tuần này, Z.ai đã ra mắt GLM-5.3-Flash dưới giấy phép MIT với context window lên tới 1 triệu token. Hãng cho biết mô hình này được vận hành hoàn toàn trên các chip AI của Trung Quốc. Với việc chiếm gần 20% thị phần token hàng tuần, mô hình này đã vươn lên vị trí số 1 trên OpenRouter. OpenRouter cũng xác nhận Ox Alpha đã xử lý hơn 20 nghìn tỷ token chỉ trong vòng sáu ngày.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCE@unslothai“GLM-5.3-Flash (ox-alpha) rivals Claude Opus 4.8 on DeepSWE, coding & agentic benchmarks.”x.com
  2. SUPPORT@hesamation“Delivered nearly 20% weekly token share (no. 1) on OpenRouter.”x.com
  3. SUPPORT@zai_org“GLM-5.3-Flash can now be run locally! ✨”x.com
  4. SUPPORT@danielhanchen“It runs perfectly on a 256GB Mac or two DGX Sparks.”x.com
  5. SUPPORT@nvidiaai“881 tok/s C=64”x.com
  6. SOURCE@zai_org“GLM-5.3’s weights will be released tomorrow.”x.com
  7. SUPPORT@jietang“Natively multimodal with a 1M-token context…”x.com
  8. SUPPORT@ollama“it's available -- but rolling out, so performance isn't fully there yet!!”x.com
Bản Markdown