---
format: "aidr-story-markdown/v1"
id: "8dcd44f75536cbb4f4c72c55919bab4c7d77ccf1c32056118a7559ee3eb36234"
canonical_url: "https://aidr.today/8dcd44f7?lang=vi"
title: "Người dùng phát hành bộ sưu tập arXiv hoàn chỉnh đầu tiên với 16 TB và 3,1 triệu bài báo trên Hugging Face"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-09-20T05:36:58.000Z"
category: "Infra"
topics: ["arxiv","huggingface","dataset","open-source","academic","corpus","latex","pdf"]
source_urls: ["https://marketbrief.now/ai/user-releases-first-complete-16-tb-arxiv-corpus-of-31-million-papers-on-1cb9eb7b","https://x.com/lhoestq/status/2101432725085241801","https://x.com/eliebakouch/status/2101426116892266820","https://x.com/TheZachMueller/status/2101421105198047301","https://x.com/secemp9/status/2101416879772340411","https://huggingnews.com/ai/user-releases-first-complete-16-tb-arxiv-corpus-of-31-million-papers-on-1cb9eb7b"]
summary: "Một kho lưu trữ rộng lớn về tài liệu học thuật hiện đã có sẵn dưới dạng bộ dữ liệu mở trên nền tảng Hugging Face. Bộ sưu tập 16 TB, được chia sẻ bởi người dùng @secemp9…"
---

# Người dùng phát hành bộ sưu tập arXiv hoàn chỉnh đầu tiên với 16 TB và 3,1 triệu bài báo trên Hugging Face

> [Open the canonical story](<https://aidr.today/8dcd44f7?lang=vi>)

**Published:** 2026-09-20T05:36:58.000Z
**Category:** Infra
**Topics:** arxiv, huggingface, dataset, open\-source, academic, corpus, latex, pdf

## Summary

Một kho lưu trữ rộng lớn về tài liệu học thuật hiện đã có sẵn dưới dạng bộ dữ liệu mở trên nền tảng Hugging Face\. Bộ sưu tập 16 TB, được chia sẻ bởi người dùng @secemp9…

## Sources

- [Story source](<https://marketbrief.now/ai/user-releases-first-complete-16-tb-arxiv-corpus-of-31-million-papers-on-1cb9eb7b>)
- [Story source](<https://x.com/lhoestq/status/2101432725085241801>)
- [Supporting source](<https://x.com/eliebakouch/status/2101426116892266820>)
- [Supporting source](<https://x.com/TheZachMueller/status/2101421105198047301>)
- [Story source](<https://x.com/secemp9/status/2101416879772340411>)
- [Story source](<https://huggingnews.com/ai/user-releases-first-complete-16-tb-arxiv-corpus-of-31-million-papers-on-1cb9eb7b>)

