Thứ Sáu, 4 thg 9, 2026
Mô hình LLM mới nhất từ OpenAI giúp tăng cường khả năng suy luận tương tác, đạt 98% ở mức FrontierMath Tier 4. GPT-6 Astra ghi nhận 169 điểm trên chỉ số năng lực của Epoch AI, phá vỡ kỷ lục 163 trước đó, và đạt 84% ở bài kiểm tra Mystery Game Puzzles so với mức cao nhất cũ là 59%. Trên benchmark ARC-AGI-3, mô hình đạt 66%, nhưng con số này vọt lên gần 100% khi kết hợp với cơ chế hội thoại liên tục với chi phí 360 USD mỗi trò chơi.
Mô hình này sử dụng kỹ thuật suy luận khiến các quy trình nội bộ trở nên khó kiểm tra hơn đối với các nhà nghiên cứu, làm tăng rủi ro AI có thể lẩn tránh sự giám sát của con người. Sự đánh đổi về mặt kiến trúc này nhằm mục đích cắt giảm chi phí vận hành và cải thiện khả năng viết code, dù nó gây khó khăn cho việc phát hiện các hành vi nguy hiểm. CEO Sam Altman tuần này cho biết...