---
format: "aidr-story-markdown/v1"
id: "12196500c013ecfecdc0d43607d35d3cb30e23d30553134ea11a298b69cd5d47"
canonical_url: "https://aidr.today/12196500?lang=vi"
title: "Unsloth phát hành bản GLM-5.3-Flash 3-bit cho máy 128GB RAM sau khi đứng đầu OpenRouter"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-08-27T17:02:04.000Z"
category: "Releases"
topics: ["open-source","llm","inference","fine-tuning"]
source_urls: ["https://huggingnews.com/ai/update-unsloth-releases-3-bit-glm-53-flash-for-128gb-ram-after-reaching-7cea2e2d","https://x.com/UnslothAI/status/2092986464196002094","https://x.com/Hesamation/status/2092960390615298444","https://x.com/Zai_org/status/2092997479318880513","https://x.com/danielhanchen/status/2092996385302094189","https://x.com/NVIDIAAI/status/2092966605579755903","https://x.com/Zai_org/status/2092814169263218860","https://x.com/jietang/status/2092840334040379779"]
summary: "Các tệp GGUF cho GLM-5.3-Flash của Z.ai (trước đây là Ox Alpha) hiện đã khả dụng. Theo Unsloth, mô hình này có thể chạy ở định dạng 3-bit trên các hệ thống có 128GB RAM. Daniel Han Chen cho biết phiên bản 4-bit vẫn giữ được 93% độ chính xác và có thể chạy trên một chiếc Mac 256GB hoặc hai máy DGX Spark. Tuần này, Z.ai đã ra mắt GLM-5.3-Flash dưới giấy phép MIT với context window lên tới 1 triệu token. Hãng cho biết mô hình này được vận hành hoàn toàn trên các chip AI của Trung Quốc. Với việc chiếm gần 20% thị phần token hàng tuần, mô hình này đã vươn lên vị trí số 1 trên OpenRouter. OpenRouter cũng xác nhận Ox Alpha đã xử lý hơn 20 nghìn tỷ token chỉ trong vòng sáu ngày."
---

# Unsloth phát hành bản GLM\-5\.3\-Flash 3\-bit cho máy 128GB RAM sau khi đứng đầu OpenRouter

> [Open the canonical story](<https://aidr.today/12196500?lang=vi>)

**Published:** 2026-08-27T17:02:04.000Z
**Category:** Releases
**Topics:** open\-source, llm, inference, fine\-tuning

## Summary

Các tệp GGUF cho GLM\-5\.3\-Flash của Z\.ai \(trước đây là Ox Alpha\) hiện đã khả dụng\. Theo Unsloth, mô hình này có thể chạy ở định dạng 3\-bit trên các hệ thống có 128GB RAM\. Daniel Han Chen cho biết phiên bản 4\-bit vẫn giữ được 93% độ chính xác và có thể chạy trên một chiếc Mac 256GB hoặc hai máy DGX Spark\. Tuần này, Z\.ai đã ra mắt GLM\-5\.3\-Flash dưới giấy phép MIT với context window lên tới 1 triệu token\. Hãng cho biết mô hình này được vận hành hoàn toàn trên các chip AI của Trung Quốc\. Với việc chiếm gần 20% thị phần token hàng tuần, mô hình này đã vươn lên vị trí số 1 trên OpenRouter\. OpenRouter cũng xác nhận Ox Alpha đã xử lý hơn 20 nghìn tỷ token chỉ trong vòng sáu ngày\.

## Sources

- [Story source](<https://huggingnews.com/ai/update-unsloth-releases-3-bit-glm-53-flash-for-128gb-ram-after-reaching-7cea2e2d>)
- [Story source](<https://x.com/UnslothAI/status/2092986464196002094>)
- [Supporting source](<https://x.com/Hesamation/status/2092960390615298444>)
- [Supporting source](<https://x.com/Zai_org/status/2092997479318880513>)
- [Supporting source](<https://x.com/danielhanchen/status/2092996385302094189>)
- [Supporting source](<https://x.com/NVIDIAAI/status/2092966605579755903>)
- [Story source](<https://x.com/Zai_org/status/2092814169263218860>)
- [Supporting source](<https://x.com/jietang/status/2092840334040379779>)

