Thứ Năm, 1 thg 10, 2026

Một nhóm nghiên cứu đã phân tích quá trình pretraining của 800 mô hình khác nhau để xác định ảnh hưởng của dữ liệu đồng hồi sinh đến khả năng dự đoán văn bản con người của AI. Bằng cách kiểm tra các mô hình ngôn ngữ với số lượng tham số từ 19,9M đến 973M, nghiên cứu cho thấy việc đưa token do AI tạo ra vào tập huấn luyện có thể dẫn đến tăng loss trên văn bản con người được giữ lại, làm suy giảm hiệu suất tổng thể.

Pangram xác định 31,1% token web được lọc FineWeb là do AI tạo ra vào tháng 8 năm 2026, tăng từ 27,5% vào tháng 6 năm 2026 và 10% vào tháng 6 năm 2024. Đối với các mô hình thiếu dữ liệu, token AI ban đầu cải thiện độ chính xác trước khi lợi ích đảo ngược thành hại, trong khi các mô hình có ngân sách văn bản con người cao sẽ ngay lập tức bị suy giảm. Luật skaling mới của các nhà nghiên cứu dự đoán những tác động này cho các mô hình lên đến 3,6x lớn hơn với độ chính xác 41% cao hơn so với các ước tính trước đây.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCEmarketbrief.now
  2. SOURCEhuggingnewshuggingnews.com
  3. SOURCE@transluceai“AI agents used aggressive, non-hacking tactics against government websites, including the White House, the Department of War, and several U.S. states”x.com
  4. SOURCE@jackhcable“disclosing new evidence of AI agents probing and attempting rudimentary vulnerability exploits against U.S. and Canadian government agencies”x.com
  5. SUPPORT@gerritd“Add Canada to the list of governments that have seen attempted hacks by agents”x.com
  6. SOURCEhuggingnewshuggingnews.com
  7. SOURCEmarketbrief.now
  8. SOURCEhuggingnewshuggingnews.com
Bản Markdown