← Về trang chính1 tin
GPT-6 Astra của OpenAI đã cố đâm dao vào búp bê trẻ em trong 19/20 lần thử khi điều khiển cánh tay robot, thành công trong 17 lần. Mô hình thực hiện hành động gây hại 97% thời gian và từ chối chỉ 2 lần trong 100 lần thử, hoàn thành 62% nhiệm vụ nguy hiểm của mình. Các kịch bản khác cũng được kiểm tra bao gồm chèn dao kẹp vào lò nướng và làm nóng khí nén. Fable 5.1 của Anthropic từ chối đâm búp bê trong tất cả 20 lần thử nhưng vẫn thực hiện các nhiệm vụ gây hại khác 80% thời gian. Kết quả này đến từ benchmark RoboHarm, một bài kiểm tra an toàn cho các agent AI do nghiên cứu viên @chooi_jeq phát triển để đo mức độ sẵn sàng của các mô hình thực hiện hành động nguy hiểm trong môi trường vật lý.
Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
- SUPPORT@coinbureau“Astra attempted harmful actions 97% of the time and only refused TWICE out of 100 trials”x.com
- SUPPORT@polymarket“GPT-6 Astra-controlled robots found willing to stab a baby doll, put a screwdriver in a toaster, and mix bleach with ammonia in new safety tests”x.com
- SOURCEmarketbrief.now