← back
arXivJunyu Lu, Shichao Weng, Zhiqiang Wang, Haojie Luo, Jingfan Zhang, Yuhua Zhou, Cheng Du, Yuzhuo Zhang, Xi Li, Jinwei Du, Tiancheng Feng, Chuan Xiao, Shuyuan ZhengWed, Sep 30, 2026, 9:06 AM PDT
score 17.0

Tree search makes reinforcement learning training more sample-efficient

Original: OPTS-TTPO: Enhancing Finite-Sample Policy-Gradient Learning with Tree Search

Source: arxiv.org ↗

Writing ELI5 summary…