---
format: "aidr-story-markdown/v1"
id: "0498e7d0713dfae5a49364eef0ec79ce033d2dd90374581434c11ca981f22f08"
canonical_url: "https://aidr.today/0498e7d0?lang=vi"
title: "Xiaomi Livestreams RL Training for 1 Trillion Parameter Model at $493,000 a Day"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-09-17T11:52:30.000Z"
category: "Research"
topics: ["rl","training","open-source","huggingface","compute","scaling","xiaomi","llm"]
source_urls: ["https://huggingnews.com/ai/xiaomi-livestreams-rl-training-for-1-trillion-parameter-model-at-493000-a053b57e","https://x.com/percyliang/status/2100456950660247662","https://x.com/gauravisnotme/status/2100464511635615825","https://x.com/madiator/status/2100456756455649746","https://x.com/eliebakouch/status/2100316319459500128","https://x.com/eliebakouch/status/2100324137642131516","https://x.com/omarsar0/status/2100337683277173009","https://x.com/natolambert/status/2100324332916335033"]
summary: "MiMo-V2.6 Pro, mô hình có tổng cộng 1,02 nghìn tỷ tham số (1,02T) và 42 tỷ tham số đang hoạt động, đang trải qua một vòng huấn luyện Reinforcement Learning được phát trực tuyến qua bảng điều khiển công cộng. Luồng trực tuyến này trực tiếp các số liệu nội bộ thời gian thực, bao gồm chi phí vận hành hàng ngày lên tới 493.000 USD và chi phí 70.000 USD cho mỗi bước của phiên bản Pro. Paralell với đó, mô hình MiMo V2.6 Flash với 309 tỷ tổng tham số và 15 tỷ tham số đang hoạt động đang được huấn luyện với chi phí 247.000 USD mỗi ngày. Quy trình huấn luyện này mở rộng tính toán với khoảng 2 tỷ token cho mỗi bước, sử dụng 1.568 prompts và 16 rollouts. Đội ngũ Xiaomi dự định công bố chi tiết kỹ thuật dưới dạng mã nguồn mở trong vài tuần tới, với các mô hình cuối cùng được đăng tải trên Hugging Face. Các vòng chạy công cộng khác bao gồm mô hình Marin 535B-A23B, đã xử lý 5 nghìn tỷ token trong tổng số 18 nghìn tỷ token trong một tháng, cũng như một vòng chạy chi phí cao khác do nhà phát triển MOPD thực hiện."
---

# Xiaomi Livestreams RL Training for 1 Trillion Parameter Model at $493,000 a Day

> [Open the canonical story](<https://aidr.today/0498e7d0?lang=vi>)

**Published:** 2026-09-17T11:52:30.000Z
**Category:** Research
**Topics:** rl, training, open\-source, huggingface, compute, scaling, xiaomi, llm

## Summary

MiMo\-V2\.6 Pro, mô hình có tổng cộng 1,02 nghìn tỷ tham số \(1,02T\) và 42 tỷ tham số đang hoạt động, đang trải qua một vòng huấn luyện Reinforcement Learning được phát trực tuyến qua bảng điều khiển công cộng\. Luồng trực tuyến này trực tiếp các số liệu nội bộ thời gian thực, bao gồm chi phí vận hành hàng ngày lên tới 493\.000 USD và chi phí 70\.000 USD cho mỗi bước của phiên bản Pro\. Paralell với đó, mô hình MiMo V2\.6 Flash với 309 tỷ tổng tham số và 15 tỷ tham số đang hoạt động đang được huấn luyện với chi phí 247\.000 USD mỗi ngày\. Quy trình huấn luyện này mở rộng tính toán với khoảng 2 tỷ token cho mỗi bước, sử dụng 1\.568 prompts và 16 rollouts\. Đội ngũ Xiaomi dự định công bố chi tiết kỹ thuật dưới dạng mã nguồn mở trong vài tuần tới, với các mô hình cuối cùng được đăng tải trên Hugging Face\. Các vòng chạy công cộng khác bao gồm mô hình Marin 535B\-A23B, đã xử lý 5 nghìn tỷ token trong tổng số 18 nghìn tỷ token trong một tháng, cũng như một vòng chạy chi phí cao khác do nhà phát triển MOPD thực hiện\.

## Sources

- [Story source](<https://huggingnews.com/ai/xiaomi-livestreams-rl-training-for-1-trillion-parameter-model-at-493000-a053b57e>)
- [Story source](<https://x.com/percyliang/status/2100456950660247662>)
- [Supporting source](<https://x.com/gauravisnotme/status/2100464511635615825>)
- [Supporting source](<https://x.com/madiator/status/2100456756455649746>)
- [Supporting source](<https://x.com/eliebakouch/status/2100316319459500128>)
- [Supporting source](<https://x.com/eliebakouch/status/2100324137642131516>)
- [Supporting source](<https://x.com/omarsar0/status/2100337683277173009>)
- [Supporting source](<https://x.com/natolambert/status/2100324332916335033>)

