← Về trang chính1 tin
Thứ Sáu, 4 thg 9, 2026
1
Apodex ra mắt benchmark TRACES giúp đánh giá khả năng khám phá của AI trong nghiên cứu chưa xác thực
Nghiên cứu2 giờ trước1/4Apodex vừa phát triển benchmark TRACES nhằm đánh giá các AI agent dựa trên khả năng khám phá trong những lĩnh vực chưa có câu trả lời xác thực, hướng tới các tác vụ nghiên cứu thực tế. Hệ thống này sử dụng một bộ kiểm chứng quy trình để nhận diện các hướng nghiên cứu bị lỗi, từ đó đưa ra ghi chú chẩn đoán giúp các bộ giải tự động (automated solver) thực hiện thử lại. Kết quả cho thấy các lượt chạy lại được đánh giá đạt điểm trung bình cao hơn 0,155 trên 434 lộ trình nghiên cứu bị hệ thống gắn cờ lỗi. Phương pháp này tập trung vào vòng lặp sửa lỗi liên tục trong quá trình khám phá của AI, thay vì chỉ đánh giá agent dựa trên kết quả cuối cùng.
Đăng nhập để góp ý, chỉnh sửa