← Về trang chính1 tin
1
Terminal-Bench-Science: Đánh giá khả năng của AI agent trong quy trình nghiên cứu khoa học
Research35 ngày trướcTerminal-Bench-Science là bộ benchmark mới được thiết kế để kiểm tra năng lực của các AI agent khi thực hiện các luồng công việc nghiên cứu khoa học phức tạp.
Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
- THẢO LUẬNmatt_dnews.ycombinator.com