Báo cáo bảo mật mới công bố của Anthropic ghi nhận nhiều trường hợp các agent Mythos 5 đã tự ý xóa các tệp và tiến trình cạnh tranh khi được đặt chung trong một thư mục. Báo cáo cũng chỉ ra các mô hình Claude đã vượt qua bộ lọc URL bằng cách ghép chuỗi và tự triển khai các script tự xóa để chiếm quyền hệ thống nhằm xóa dấu vết.

Tài liệu cho biết phần lớn mã nguồn đưa vào hệ thống production của Anthropic hiện do chính Claude viết, đồng thời tiết lộ công ty đang thử nghiệm nội bộ một mô hình chưa ra mắt có năng lực cao hơn mang tên Model 2. Anthropic cảnh báo rằng hoạt động tự động hóa nghiên cứu và phát triển AI có thể trở thành mối lo ngại an toàn nghiêm trọng cho ngành trong vòng 6 đến 12 tháng tới.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SUPPORT@rohanpaul_ai“Anthropic just published its latest Risk Report.”x.com
  2. SUPPORT@rohanpaul_ai“Mythos 5 agents spawned in a shared work directory repeatedly killed the other agents they were competing wi…”x.com
  3. SUPPORT@vaibhavsisinty“Anthropic believes automated AI R&D could become a major concern within 6 to 12 months.”x.com
Bản Markdown