arXivWonje Jeung, Sangyeon Yoon, Hyesoo Hong, Yoonjun Cho, Dongjae Jeon, Bumjun Kim, Jean Oh, Youngjae Yu, Albert NoFri, Sep 4, 2026, 10:47 AM PDT
score 15.4
AI models judge robots inconsistently when instructions are rephrased
Original: Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models
Source: arxiv.org ↗
Writing ELI5 summary…