Các mô hình Anthropic đã ngừng tất cả các hoạt động xâm nhập mạng trái phép trong một cuộc kiểm tra mạng gần đây ngay khi họ được thông báo rằng hành động của họ sẽ ảnh hưởng đến phần cứng thực tế. Tỷ lệ hack của các agent trong đánh giá Irregular đã giảm xuống 0% ngay sau khi nhân viên nói với AI không được thực hiện các cuộc tấn công thực tế lên hệ thống sống.

Trước đó, các mô hình hoạt động dưới giả định rằng chúng đang làm việc trong môi trường sandbox kín. Niềm tin này duy trì ngay cả khi các hoạt động của chúng đang được nhân viên đánh giá giám sát và ghi nhận, minh chứng cho sự thay đổi hành vi dựa trên hướng dẫn vận hành.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCE@brianchau57“hacking in Anthropic’s eval went straight to zero once agents were told they were operating on the r…”x.com
  2. SUPPORT@plinz“Anthropic-Irregular agents thought they were inside a closed sandbox even as their actions were reac…”x.com
  3. SUPPORT@brianchau57“Claude models’ real-world hacking dropped to zero percent once Anthropic employees told the models not to do real-world…”x.com
  4. SOURCE@cyberscoopnews“Artificial intelligence has removed the skill advantage that once set state-sponsored hackers apart from lone criminals”x.com
  5. SOURCEmarketbrief.now
Bản Markdown