---
format: "aidr-story-markdown/v1"
id: "6f8f0395b3313ab9c59876e1a7c85875c35f92625f1601e5aa12d514d0ba77c1"
canonical_url: "https://aidr.today/6f8f0395?lang=en"
title: "Terminal-Bench-Science: Evaluating AI agents on scientific research workflows"
lang: "en"
requested_lang: "en"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-08-28T00:06:51.000Z"
category: "Research"
topics: ["agent","benchmark","reasoning"]
source_urls: ["https://www.terminal-bench-science.ai/announcement","https://news.ycombinator.com/item?id=49472820"]
summary: "A benchmark for evaluating AI agents on research workflows across scientific domains"
---

# Terminal\-Bench\-Science: Evaluating AI agents on scientific research workflows

> [Open the canonical story](<https://aidr.today/6f8f0395?lang=en>)

**Published:** 2026-08-28T00:06:51.000Z
**Category:** Research
**Topics:** agent, benchmark, reasoning

## Summary

A benchmark for evaluating AI agents on research workflows across scientific domains

## Sources

- [Story source](<https://www.terminal-bench-science.ai/announcement>)
- [Discussion](<https://news.ycombinator.com/item?id=49472820>)

