← back
arXivGuangsheng Yu, Yanna Jiang, Qin Wang, Baihe Ma, Xu WangFri, Sep 11, 2026, 6:04 AM PDT
score 15.2

AI 'unlearning' tests fail when models become agents

Original: K-Bench: A Benchmark for LLM Unlearning in Agentic Deployments

Source: arxiv.org

Writing ELI5 summary…