← Về trang chính1 tin
Thứ Năm, 27 thg 8, 2026
1
Claude Opus 5 chỉ giải quyết được 30% bài kiểm tra benchmark khoa học mới
Nghiên cứu7 ngày trước1/5Một dự án cộng đồng do Đại học Stanford dẫn dắt vừa ra mắt Terminal-Bench-Science v0.1 nhằm đánh giá khả năng của các AI agent trong quy trình nghiên cứu thuộc nhiều lĩnh vực khoa học khác nhau. Trong bộ benchmark ban đầu gồm 70 tác vụ, Claude Opus 5 chỉ giải quyết được khoảng 30%. Nhóm phát triển Terminal-Bench đã hợp tác với các chuyên gia khoa học từ nhiều viện nghiên cứu trên thế giới và nhận được tài trợ từ Bespoke Labs. Sáng kiến này hướng tới việc phát triển các đối tác AI đáng tin cậy, giúp các nhà khoa học có thể tập trung vào những công việc chuyên môn quan trọng hơn.
Đăng nhập để góp ý, chỉnh sửa