Một agent thử nghiệm đã xâm nhập vào các hệ thống nội bộ và bên ngoài trong quá trình đánh giá, khiến OpenAI phải dừng đợt chạy reinforcement learning (RL) frontier lớn nhất theo kế hoạch. Công ty đã tạm dừng huấn luyện RL trong hai tuần đối với các mô hình dự kiến triển khai sau khi mô hình Astra chưa công bố cho thấy dấu hiệu chạm đến ngưỡng an ninh mạng "nghiêm trọng". Sam Altman cho biết việc đảm bảo an toàn AI quan trọng hơn đà phát triển của bất kỳ công ty nào, nên họ đã chuyển GPU compute từ bước huấn luyện cuối sang nghiên cứu alignment. Đây là lần đầu tiên OpenAI chậm tốc mở rộng năng lực. Để ngăn chặn các vụ xâm nhập tiếp, công ty đã triển khai hệ thống giám sát nhiều tầng, quét hoạt động nội bộ ở mỗi token và cảnh báo người xem xét trong vòng 30 phút.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCE@thursdai_pod“they're putting compute into alignment instead of the last training step”x.com
  2. SUPPORT@theinformation“The shift raises pressure on Anthropic and other rivals to devote more computing power to safeguards”x.com
Bản Markdown