Hacker Newsmatt_dThu, Aug 27, 2026, 5:06 PM PDT
score 25.2
116HN36HN cmts
AI agents solve only 30% of real scientific research tasks in new benchmark
Original: Terminal-Bench-Science: Evaluating AI agents on scientific research workflows
Source: terminal-bench-science.ai ↗
Writing ELI5 summary…