arXivNiklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa, Jan Philip Wahle, Bela Gipp, Terry RuasThu, Jul 30, 2026, 5:54 AM PDT
score 16.1
New benchmark tests AI agents' deceiving skills in a social game
Original: Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game
Source: arxiv.org ↗
Writing ELI5 summary…