arXivErfan Baghaei Potraghloo, Seyedarmin Azizi, Arya Fayyazi, Saeid Shokoufa, Mehdi Kamal, Souvik Kundu, Massoud PedramMon, Oct 5, 2026, 10:53 AM PDT
score 17.0
Training language models to answer correctly in one shot
Original: Sharpen Without Search: On-Policy Distillation of Sequence-Level Power Distribution
Source: arxiv.org ↗
Writing ELI5 summary…