OpenAI đưa kiến trúc Loop Transformers vào Astra nhằm ngăn chặn việc giám sát Chain of Thought
Research30 ngày trướcMô hình AI Astra sắp ra mắt của OpenAI sử dụng cách tiếp cận kiến trúc mới gọi là recurrent depth để tối ưu chi phí xử lý và hiệu suất. Phương pháp này, hay còn gọi là loop transformers, làm mờ đi quá trình suy luận nội bộ của mô hình, khiến các nhà nghiên cứu an toàn AI khó giám sát hơn. Theo báo cáo từ The Information, OpenAI hiện đang giới hạn việc áp dụng kỹ thuật này trong Astra để duy trì khả năng kiểm soát nhất định.
Các chuyên gia an toàn AI nhận định việc giám sát chain of thought là một "cơ hội mong manh" để đảm bảo tính alignment và kiểm soát mô hình. Việc chuyển sang dạng logic "neuralese" mà con người không thể đọc hiểu có thể kích hoạt cuộc đua giữa các phòng lab, nơi hiệu suất được ưu tiên hơn tính minh bạch. Những lo ngại này xuất hiện ngay khi OpenAI đang chuẩn bị tung ra Astra...
Nguồn chính
- SOURCE@steph_palazzolo“obscures a model’s thinking process, making it more difficult to monitor”x.com
- SUPPORT@amir“a leap forward on performance, but sparking concerns inside & outside OpenAI re: security”x.com
- SUPPORT@_nathancalvin“breakthrough in neuralese for Astra that could destroy chain of thought monitorability”x.com
- SUPPORT@_nathancalvin“monitorable chain of thought as 'A New and Fragile Opportunity for AI safety'”x.com
- SOURCE@zeffmax“limit cyber capabilities to select partners”x.com
- SUPPORT@wallstengine“found and chained together two zero-day vulnerabilities”x.com
- SUPPORT@zeffmax“confident it can release Astra safely”x.com
- SUPPORT@tradfi“limit Astra’s full cyber abilities to test group”x.com