Terminal-Bench-Science là bộ benchmark mới được thiết kế để kiểm tra năng lực của các AI agent khi thực hiện các luồng công việc nghiên cứu khoa học phức tạp.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. THẢO LUẬNmatt_dnews.ycombinator.com
Bản Markdown