Thứ Sáu, 4 thg 9, 2026

Apodex vừa phát triển benchmark TRACES nhằm đánh giá các AI agent dựa trên khả năng khám phá trong những lĩnh vực chưa có câu trả lời xác thực, hướng tới các tác vụ nghiên cứu thực tế. Hệ thống này sử dụng một bộ kiểm chứng quy trình để nhận diện các hướng nghiên cứu bị lỗi, từ đó đưa ra ghi chú chẩn đoán giúp các bộ giải tự động (automated solver) thực hiện thử lại. Kết quả cho thấy các lượt chạy lại được đánh giá đạt điểm trung bình cao hơn 0,155 trên 434 lộ trình nghiên cứu bị hệ thống gắn cờ lỗi. Phương pháp này tập trung vào vòng lặp sửa lỗi liên tục trong quá trình khám phá của AI, thay vì chỉ đánh giá agent dựa trên kết quả cuối cùng.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@omarsar012:57 4 thg 9TRACES scores AI systems on discoveries where the answer isn't confirmed yet
SUPPORT@omarsar012:57 4 thg 9repaired reruns scored 0.155 higher on average, per Apodex's reported evaluation
SUPPORT@dair_ai13:01 4 thg 9Very important paper accelerating research around AI discovery