← back
arXivXin He, Yanlin Wang, Mingwei Liu, Jiachi Chen, Hongyu Zhang, Guanbin LiThu, Sep 3, 2026, 10:53 AM PDT
score 16.9

AI coding agents pass tests but miss review standards, new benchmark shows

Original: SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents

Source: arxiv.org

Writing ELI5 summary…