Xiaomi Livestreams RL Training for 1 Trillion Parameter Model at $493,000 a Day
Research15 ngày trướcMiMo-V2.6 Pro, mô hình có tổng cộng 1,02 nghìn tỷ tham số (1,02T) và 42 tỷ tham số đang hoạt động, đang trải qua một vòng huấn luyện Reinforcement Learning được phát trực tuyến qua bảng điều khiển công cộng. Luồng trực tuyến này trực tiếp các số liệu nội bộ thời gian thực, bao gồm chi phí vận hành hàng ngày lên tới 493.000 USD và chi phí 70.000 USD cho mỗi bước của phiên bản Pro. Paralell với đó, mô hình MiMo V2.6 Flash với 309 tỷ tổng tham số và 15 tỷ tham số đang hoạt động đang được huấn luyện với chi phí 247.000 USD mỗi ngày.
Quy trình huấn luyện này mở rộng tính toán với khoảng 2 tỷ token cho mỗi bước, sử dụng 1.568 prompts và 16 rollouts. Đội ngũ Xiaomi dự định công bố chi tiết kỹ thuật dưới dạng mã nguồn mở trong vài tuần tới, với các mô hình cuối cùng được đăng tải trên Hugging Face. Các vòng chạy công cộng khác bao gồm mô hình Marin 535B-A23B, đã xử lý 5 nghìn tỷ token trong tổng số 18 nghìn tỷ token trong một tháng, cũng như một vòng chạy chi phí cao khác do nhà phát triển MOPD thực hiện.
Nguồn chính
- SOURCE@percyliang“Here's how Marin 535B-A23B is doing today”x.com
- SUPPORT@gauravisnotme“They are at about 5T/18T tokens in a month”x.com
- SUPPORT@madiator“Those behind MOPD are livestreaming a very expensive training run!”x.com
- SUPPORT@eliebakouch“literally livestreaming the RL training run of Mimo V2.6 Pro (1T, 42B active) and Flash (309B, 15B active)”x.com
- SUPPORT@eliebakouch“Mimo V2.6 Pro (1.02T total, 42B active param) 493k$ / day”x.com
- SUPPORT@omarsar0“$1M+ so far”x.com
- SUPPORT@natolambert“One of the coolest at-scale RL resources made public yet!”x.com
- SUPPORT@andrewcurran_“We believe RL is one of the most scalable and efficient paths toward self-improvement.”x.com