Thứ Tư, 2 thg 9, 2026

Mô hình AI Astra sắp ra mắt của OpenAI sử dụng cách tiếp cận kiến trúc mới gọi là recurrent depth để tối ưu chi phí xử lý và hiệu suất. Phương pháp này, hay còn gọi là loop transformers, làm mờ đi quá trình suy luận nội bộ của mô hình, khiến các nhà nghiên cứu an toàn AI khó giám sát hơn. Theo báo cáo từ The Information, OpenAI hiện đang giới hạn việc áp dụng kỹ thuật này trong Astra để duy trì khả năng kiểm soát nhất định.

Các chuyên gia an toàn AI nhận định việc giám sát chain of thought là một "cơ hội mong manh" để đảm bảo tính alignment và kiểm soát mô hình. Việc chuyển sang dạng logic "neuralese" mà con người không thể đọc hiểu có thể kích hoạt cuộc đua giữa các phòng lab, nơi hiệu suất được ưu tiên hơn tính minh bạch. Những lo ngại này xuất hiện ngay khi OpenAI đang chuẩn bị tung ra Astra...

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@steph_palazzolo1:04 2 thg 9obscures a model’s thinking process, making it more difficult to monitor
SUPPORT@amir1:01 2 thg 9a leap forward on performance, but sparking concerns inside & outside OpenAI re: security
SUPPORT@_nathancalvin1:15 2 thg 9breakthrough in neuralese for Astra that could destroy chain of thought monitorability
SUPPORT@_nathancalvin1:33 2 thg 9monitorable chain of thought as 'A New and Fragile Opportunity for AI safety'
SOURCE@zeffmax20:07 1 thg 9limit cyber capabilities to select partners
SUPPORT@wallstengine20:05 1 thg 9found and chained together two zero-day vulnerabilities
SUPPORT@zeffmax20:07 1 thg 9confident it can release Astra safely
SUPPORT@tradfi20:00 1 thg 9limit Astra’s full cyber abilities to test group