---
format: "aidr-story-markdown/v1"
id: "377aabd58d63ffd47e9220d3075971083718c0e68f2d1a9d85d7ca1e8ed06b3a"
canonical_url: "https://aidr.today/377aabd5?lang=vi"
title: "Tái tạo OLMo 3 7B Pre-training trong MaxText: nghiên cứu trường hợp huấn luyện quy mô lớn trên TPUs"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-09-24T16:14:05.000Z"
category: "Research"
topics: ["research","training","tpu","jax","olmo","reproducibility"]
source_urls: ["https://developers.googleblog.com/reproducing-olmo-3-7b-pre-training-in-maxtext-case-study-of-large-scale-training-on-tpus/"]
summary: "Đội ngũ MaxText đã tái tạo thành công mô hình ngôn ngữ OLMo 3 7B của AI2 từ đầu trên Google Cloud TPUs bằng JAX/XLA, khớp chính xác với phiên bản tham chiếu PyTorch trên GPU trong cả giai đoạn pre-training và mid-training trên mọi bộ đánh giá được giữ lại. Quá trình triển khai đạt được tới 57,4% Model Flops Utilization (MFU) và chứng minh tính di chuyển hạ tầng mạnh mẽ bằng cách vượt qua các thay đổi kích thước cụm giữa chương trình và chuyển đổi giữa các thế hệ TPU khác nhau mà không cần thay đổi công thức. Đặc biệt, bài tập này chứng minh tính cần thiết của việc xác thực toàn diện trên tập dữ liệu được giữ lại bằng cách phát hiện một lỗi ghi nhớ ngầm trong data-loader khiến mất mát huấn luyện bị hạ thấp một cách sai lệch và có thể đã tạo ra kết quả hiệu suất ảo nếu không được phát hiện."
---

# Tái tạo OLMo 3 7B Pre\-training trong MaxText: nghiên cứu trường hợp huấn luyện quy mô lớn trên TPUs

> [Open the canonical story](<https://aidr.today/377aabd5?lang=vi>)

**Published:** 2026-09-24T16:14:05.000Z
**Category:** Research
**Topics:** research, training, tpu, jax, olmo, reproducibility

## Summary

Đội ngũ MaxText đã tái tạo thành công mô hình ngôn ngữ OLMo 3 7B của AI2 từ đầu trên Google Cloud TPUs bằng JAX/XLA, khớp chính xác với phiên bản tham chiếu PyTorch trên GPU trong cả giai đoạn pre\-training và mid\-training trên mọi bộ đánh giá được giữ lại\. Quá trình triển khai đạt được tới 57,4% Model Flops Utilization \(MFU\) và chứng minh tính di chuyển hạ tầng mạnh mẽ bằng cách vượt qua các thay đổi kích thước cụm giữa chương trình và chuyển đổi giữa các thế hệ TPU khác nhau mà không cần thay đổi công thức\. Đặc biệt, bài tập này chứng minh tính cần thiết của việc xác thực toàn diện trên tập dữ liệu được giữ lại bằng cách phát hiện một lỗi ghi nhớ ngầm trong data\-loader khiến mất mát huấn luyện bị hạ thấp một cách sai lệch và có thể đã tạo ra kết quả hiệu suất ảo nếu không được phát hiện\.

## Sources

- [Story source](<https://developers.googleblog.com/reproducing-olmo-3-7b-pre-training-in-maxtext-case-study-of-large-scale-training-on-tpus/>)

