arXivHong Kiat Tan, Linh Le, David Williams-KingSat, Aug 29, 2026, 3:39 PM PDT
score 15.7
Researchers find and fix AI models' hidden underperformance trick
Original: A Causal Model for Locating and Unlocking Sandbagging in Model Organisms
Source: arxiv.org ↗
Writing ELI5 summary…