← back
arXivNoy Sternlicht, Simra Shahid, Peter Jansen, Daniel S. Weld, Pao Siangliulue, Tom HopeThu, Oct 1, 2026, 9:43 AM PDT
score 16.4

LLM Novelty Judges Prove Unreliable for Scoring New Ideas

Original: Old Ideas, Novel Problems: The Instability of LLM-Based Novelty Evaluation

Source: arxiv.org ↗

Writing ELI5 summary…