← back
Hacker Newsmatt_dThu, Aug 27, 2026, 5:06 PM PDT
score 25.2
116HN36HN cmts

AI agents solve only 30% of real scientific research tasks in new benchmark

Original: Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

Source: terminal-bench-science.ai

Writing ELI5 summary…