A benchmark for evaluating AI agents on research workflows across scientific domains

Sign in to suggest edits

Key sources

  1. DISCUSSIONmatt_dnews.ycombinator.com
Markdown