arXivNoy Sternlicht, Simra Shahid, Peter Jansen, Daniel S. Weld, Pao Siangliulue, Tom HopeThu, Oct 1, 2026, 9:43 AM PDT
score 16.4
LLM Novelty Judges Prove Unreliable for Scoring New Ideas
Original: Old Ideas, Novel Problems: The Instability of LLM-Based Novelty Evaluation
Source: arxiv.org ↗
Writing ELI5 summary…