← Về trang chính1 tin
1
Epoch AI Đánh Giá 9 Trong Số 15 Bảng Xếp Hạng AI Là Có Lỗi Trong Cuộc Kiểm Tra Đầu Tiên
Research14 ngày trướcEpoch AI vừa ra mắt kết quả kiểm tra đầu tiên của mình, trong đó chỉ ra rằng 9 trên tổng số 15 bảng xếp hạng AI hiện nay đều tồn tại các vấn đề nghiêm trọng. Những lỗ hổng này có thể dẫn đến kết quả đánh giá sai lệch, ảnh hưởng đến khả năng so sánh và đánh giá thực sự của các mô hình AI. Đây là bước đầu quan trọng nhằm nâng cao độ tin cậy của các benchmark trong lĩnh vực AI.
Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
- SOURCE@epochairesearch“launching with 15 benchmarks: 4 Verified, 9 Flawed, and 2 with not enough information”x.com
- SUPPORT@epochairesearch“any errors that exist do not substantially affect the results”x.com
- SUPPORT@tamaybes“In Terminal Bench 4.0 we found 45.5% of tasks to be broken”x.com
- SUPPORT@nrehiew_“on DeepSWE, Epoch found 23 false negatives out of 131 tasks”x.com
- SUPPORT@charliermarsh“in DeepSWE v1.1, the verifier discards the agent's changes to some test files”x.com
- SUPPORT@emollick“tells us how bad the state of benchmarking is, and how terrible some of our favorite benchmarks are”x.com
- SUPPORT@epochairesearch“Benchmarks assess AI capabilities, but the benchmarks themselves vary substantially in quality”x.com
- SUPPORT@epochairesearch“To avoid conflicts of interest we do not review Epoch-created benchmarks”x.com