Các AI agent tự cải thiện thường có xu hướng ghi nhớ các tác vụ kiểm tra, khiến hiệu quả đạt được bị giảm sút hoặc biến mất khi gặp các tác vụ mới. RRSI, một phương pháp mới từ các nhà nghiên cứu Google, giúp kiềm chế hiện tượng này và nâng điểm số trên các benchmark chưa từng gặp lên tới 4,7 điểm, trong khi dùng ít hơn khoảng 30% token so với phiên bản không có chính quy hóa. Bài viết Google researchers find a way to keep self-improving AI agents from memorizing their tests xuất hiện lần đầu trên Decoder.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCEthe-decoder.com
Bản Markdown