← back
arXivAbdulrahman AlRabah, Xiaocheng Yang, Dilek Hakkani-Tür, Abdussalam AlawiniMon, Aug 3, 2026, 8:15 AM PDT
score 16.9

New benchmark tests AI assistants that use imperfect tools

Original: PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise

Source: arxiv.org

Writing ELI5 summary…