arXivRo Encarnación, Tina Behzad, Emma Lurie, Danaé MetaxaThu, Aug 6, 2026, 8:58 AM PDT
score 14.7
AI safety tests miss search and repeat-run inconsistencies in models
Original: What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)
Source: arxiv.org ↗
Writing ELI5 summary…