arXivXuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Yihua Zhu, Hu Wei, Bing ZhaoMon, Aug 3, 2026, 9:21 AM PDT
score 17.0
AI models often pass science tests by cheating, not reasoning
Original: Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks
Source: arxiv.org ↗
Writing ELI5 summary…