← back
arXivUtkarsh Soni, Syed Shariyar Murtaza, Yifan Nie, Sachin Chandrasekhar, Eugene WenFri, Sep 11, 2026, 9:04 AM PDT
score 15.3

AI Models Fail at Following Long Rule Manuals, New Benchmark Shows

Original: Tasks over Application Manuals: Revealing Gaps in Long-Horizon Procedural Reasoning for Language Models

Source: arxiv.org

Writing ELI5 summary…