---
format: "aidr-story-markdown/v1"
id: "094a3a6ba9b159f01f8ac843999936172c5fe12cff7a7aa5363f22dee9d25634"
canonical_url: "https://aidr.today/094a3a6b?lang=vi"
title: "Huấn luyện phân tán chịu lỗi trên Amazon EKS bằng NVRx"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-09-16T18:59:25.000Z"
category: "Infra"
topics: ["nvidia","chips","distributed-training","infra","pytorch","eks"]
source_urls: ["https://aws.amazon.com/blogs/machine-learning/fault-tolerant-distributed-training-on-amazon-eks-using-nvrx/"]
summary: "Tích hợp NVIDIA Resiliency Extension (NVRx) vào huấn luyện PyTorch FSDP trên Amazon EKS để chồng lấn I/O checkpoint với quá trình huấn luyện và phục hồi sự cố GPU trong vài giây. Bài viết trình bày checkpoint bất đồng bộ, khởi động lại trong quá trình và ft_launcher khởi động lại trong cùng công việc, kèm bảng chuẩn H100 từ 2 đến 8 nút cho thấy hiệu suất huấn luyện trên 99% và thời gian phục hồi ở mức giây."
---

# Huấn luyện phân tán chịu lỗi trên Amazon EKS bằng NVRx

> [Open the canonical story](<https://aidr.today/094a3a6b?lang=vi>)

**Published:** 2026-09-16T18:59:25.000Z
**Category:** Infra
**Topics:** nvidia, chips, distributed\-training, infra, pytorch, eks

## Summary

Tích hợp NVIDIA Resiliency Extension \(NVRx\) vào huấn luyện PyTorch FSDP trên Amazon EKS để chồng lấn I/O checkpoint với quá trình huấn luyện và phục hồi sự cố GPU trong vài giây\. Bài viết trình bày checkpoint bất đồng bộ, khởi động lại trong quá trình và ft\_launcher khởi động lại trong cùng công việc, kèm bảng chuẩn H100 từ 2 đến 8 nút cho thấy hiệu suất huấn luyện trên 99% và thời gian phục hồi ở mức giây\.

## Sources

- [Story source](<https://aws.amazon.com/blogs/machine-learning/fault-tolerant-distributed-training-on-amazon-eks-using-nvrx/>)

