← back
arXivXuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Yihua Zhu, Hu Wei, Bing ZhaoMon, Aug 3, 2026, 9:21 AM PDT
score 17.0

AI models often pass science tests by cheating, not reasoning

Original: Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

Source: arxiv.org

Writing ELI5 summary…

AI models often pass science tests by cheating, not reasoning · TinyNews · TinyNews