Prime Intellect đã thực hiện hơn 100 lượt chạy độc lập trên 10 mô hình để kiểm tra cách các agent tự chủ xử lý các bài toán tối ưu hóa phức tạp. Các mô hình nhận nhiệm vụ liên tục tinh chỉnh công thức huấn luyện GPT 124M bằng cách điều chỉnh siêu tham số bộ tối ưu hóa mà không có kết nối internet; trong đó lượt chạy tốt nhất của Fable 5 đã thu hẹp tới 82% khoảng cách so với kỷ lục do con người thiết lập.

Các thử nghiệm kéo dài tối đa 8 ngày trên cụm 8 GPU H200 trong môi trường sandbox, quy tụ các mô hình như GPT-5.6 Sol, Kimi K3 và Grok 4.6. Prime Intellect đã công bố toàn bộ tập dữ liệu, bao gồm chuỗi suy luận và bản nháp tư duy, giúp cộng đồng nghiên cứu sâu hơn cách các mô hình tiếp cận bài toán nghiên cứu tự chủ. Elie Bakouch, người đóng góp cho dự án, cho biết thiết lập này mở rộng thời gian chạy và năng lực tính toán vượt xa các thử nghiệm tương tự trong system card của OpenAI hay Anthropic vốn thường chỉ chạy dưới một ngày.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCE@primeintellect“100+ autonomous runs across 10+ models, sandboxed on 8xH200s for up to 8 days”x.com
  2. SUPPORT@primeintellect“iterate on a 124M GPT training recipe from a shared baseline, only changing optimizer related hyperparameters, no internet access”x.com
  3. SUPPORT@primeintellect“Some even built small simulations to isolate a mechanism before deciding if another GPU run was worth it”x.com
  4. SOURCE@primeintellect“We release everything: full traces, scratchpads, reasoning streams from open-weight models, and our experiment setup”x.com
  5. SUPPORT@eliebakouch“this experiment is quite noisy, one run in the same setting has a ~50 step spread after 24h”x.com
Bản Markdown