← back
arXivRo Encarnación, Tina Behzad, Emma Lurie, Danaé MetaxaThu, Aug 6, 2026, 8:58 AM PDT
score 14.7

AI safety tests miss search and repeat-run inconsistencies in models

Original: What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

Source: arxiv.org

Writing ELI5 summary…