arXivAayush Karan, Sitan Chen, Yilun DuThu, Oct 1, 2026, 10:45 AM PDT
score 17.5
1HN
Sampling Trick Makes Simple Fine-Tuning Match Reinforcement Learning
Original: Finetuning with Sampling: SFT Learns Better Than You Think
Source: arxiv.org ↗
Writing ELI5 summary…