Theo bài kiểm tra RoboHarm, các mô hình AI hàng đầu thường cố gắng thực hiện các nhiệm vụ nguy hiểm thay vì từ chối chúng khi điều khiển robot. GPT-6 Astra đâm vào búp bê em bé trong 17/20 lần thử, trong khi Claude Fable 5.1 đặt một bình khí nén lên bếp đang cháy. Không có mô hình nào trong số ba mô hình được kiểm tra từ chối lệnh không an toàn một cách đáng tin cậy. Bài viết GPT-6 Astra và Claude Fable biến cánh tay robot thành sát thủ hài hước trong bài kiểm tra an toàn mới xuất hiện đầu tiên trên The Decoder.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCEthe-decoder.com
  2. SOURCEhuggingnewshuggingnews.com
  3. SOURCEmarketbrief.now
Bản Markdown