arXivMuhammad Zeeshan Akram, Mufid Kamel Marican, Anvesh Reddy Yenugu, Ali Zain Kaimkhani, Minghong FangTue, Sep 29, 2026, 12:04 AM PDT
score 16.9
New defense protects AI models from harmful fine-tuning attacks
Original: Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning
Source: arxiv.org ↗
Writing ELI5 summary…