← back
arXivNiklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa, Jan Philip Wahle, Bela Gipp, Terry RuasThu, Jul 30, 2026, 5:54 AM PDT
score 16.1

New benchmark tests AI agents' deceiving skills in a social game

Original: Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

Source: arxiv.org

Writing ELI5 summary…