← back
arXivWonje Jeung, Sangyeon Yoon, Hyesoo Hong, Yoonjun Cho, Dongjae Jeon, Bumjun Kim, Jean Oh, Youngjae Yu, Albert NoFri, Sep 4, 2026, 10:47 AM PDT
score 15.4

AI models judge robots inconsistently when instructions are rephrased

Original: Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models

Source: arxiv.org

Writing ELI5 summary…