Các tín hiệu nội bộ từ bên trong các mô hình ngôn ngữ lớn đã xác định "lừa đảo phần thưởng" trong 50% đến 96% các lần triển khai được nghiên cứu bởi Goodfire AI. Công ty đã phát triển một nền tảng giám sát mới giúp giảm đáng kể chi phí và thời gian cần thiết để phát hiện các hành vi lừa đảo này.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCEmarketbrief.now
  2. SOURCEhuggingnewshuggingnews.com
Bản Markdown