---
format: "aidr-story-markdown/v1"
id: "12c7c4b93f1e3a449874069b9582785fa6a140290dd9946bd4dcebb519c16b4d"
canonical_url: "https://aidr.today/12c7c4b9?lang=vi"
title: "Văn Bản Web Do AI Tạo Ra Chiếm 31% Và Gây Hại Cho Huấn Luyện Mô Hình Ngôn Ngữ"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-10-01T15:42:09.000Z"
category: "Research"
topics: ["llm","openai","agent","google"]
source_urls: ["https://marketbrief.now/ai/ai-web-text-hits-31percent-and-harms-language-model-training-7a3ac5f5","https://huggingnews.com/ai/ai-web-text-hits-31percent-and-harms-language-model-training-7a3ac5f5","https://x.com/TransluceAI/status/2105725928357937410","https://x.com/jackhcable/status/2105460442399437149","https://x.com/GerritD/status/2105467194276720731","https://huggingnews.com/cybersecurity/ai-agents-probed-white-house-and-department-of-war-websites-df053323","https://marketbrief.now/cybersecurity/ai-agents-probed-white-house-and-department-of-war-websites-df053323","https://huggingnews.com/ai/70percent-of-teens-use-ai-for-schoolwork-with-plunging-test-scores-027b8f87"]
summary: "Một nhóm nghiên cứu đã phân tích quá trình pretraining của 800 mô hình khác nhau để xác định ảnh hưởng của dữ liệu đồng hồi sinh đến khả năng dự đoán văn bản con người của AI. Bằng cách kiểm tra các mô hình ngôn ngữ với số lượng tham số từ 19,9M đến 973M, nghiên cứu cho thấy việc đưa token do AI tạo ra vào tập huấn luyện có thể dẫn đến tăng loss trên văn bản con người được giữ lại, làm suy giảm hiệu suất tổng thể. Pangram xác định 31,1% token web được lọc FineWeb là do AI tạo ra vào tháng 8 năm 2026, tăng từ 27,5% vào tháng 6 năm 2026 và 10% vào tháng 6 năm 2024. Đối với các mô hình thiếu dữ liệu, token AI ban đầu cải thiện độ chính xác trước khi lợi ích đảo ngược thành hại, trong khi các mô hình có ngân sách văn bản con người cao sẽ ngay lập tức bị suy giảm. Luật skaling mới của các nhà nghiên cứu dự đoán những tác động này cho các mô hình lên đến 3,6x lớn hơn với độ chính xác 41% cao hơn so với các ước tính trước đây."
---

# Văn Bản Web Do AI Tạo Ra Chiếm 31% Và Gây Hại Cho Huấn Luyện Mô Hình Ngôn Ngữ

> [Open the canonical story](<https://aidr.today/12c7c4b9?lang=vi>)

**Published:** 2026-10-01T15:42:09.000Z
**Category:** Research
**Topics:** llm, openai, agent, google

## Summary

Một nhóm nghiên cứu đã phân tích quá trình pretraining của 800 mô hình khác nhau để xác định ảnh hưởng của dữ liệu đồng hồi sinh đến khả năng dự đoán văn bản con người của AI\. Bằng cách kiểm tra các mô hình ngôn ngữ với số lượng tham số từ 19,9M đến 973M, nghiên cứu cho thấy việc đưa token do AI tạo ra vào tập huấn luyện có thể dẫn đến tăng loss trên văn bản con người được giữ lại, làm suy giảm hiệu suất tổng thể\. Pangram xác định 31,1% token web được lọc FineWeb là do AI tạo ra vào tháng 8 năm 2026, tăng từ 27,5% vào tháng 6 năm 2026 và 10% vào tháng 6 năm 2024\. Đối với các mô hình thiếu dữ liệu, token AI ban đầu cải thiện độ chính xác trước khi lợi ích đảo ngược thành hại, trong khi các mô hình có ngân sách văn bản con người cao sẽ ngay lập tức bị suy giảm\. Luật skaling mới của các nhà nghiên cứu dự đoán những tác động này cho các mô hình lên đến 3,6x lớn hơn với độ chính xác 41% cao hơn so với các ước tính trước đây\.

## Sources

- [Story source](<https://marketbrief.now/ai/ai-web-text-hits-31percent-and-harms-language-model-training-7a3ac5f5>)
- [Story source](<https://huggingnews.com/ai/ai-web-text-hits-31percent-and-harms-language-model-training-7a3ac5f5>)
- [Story source](<https://x.com/TransluceAI/status/2105725928357937410>)
- [Story source](<https://x.com/jackhcable/status/2105460442399437149>)
- [Supporting source](<https://x.com/GerritD/status/2105467194276720731>)
- [Story source](<https://huggingnews.com/cybersecurity/ai-agents-probed-white-house-and-department-of-war-websites-df053323>)
- [Story source](<https://marketbrief.now/cybersecurity/ai-agents-probed-white-house-and-department-of-war-websites-df053323>)
- [Story source](<https://huggingnews.com/ai/70percent-of-teens-use-ai-for-schoolwork-with-plunging-test-scores-027b8f87>)

