← back
arXivMuhammad Zeeshan Akram, Mufid Kamel Marican, Anvesh Reddy Yenugu, Ali Zain Kaimkhani, Minghong FangTue, Sep 29, 2026, 12:04 AM PDT
score 16.9

New defense protects AI models from harmful fine-tuning attacks

Original: Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning

Source: arxiv.org ↗

Writing ELI5 summary…