arXivWei Jia, Zhicong Lu, Yu Chen, Xiang Wang, Shuai Li, Wenqian Lv, Jiayue Cao, Huaxing liuMon, Aug 3, 2026, 4:27 AM PDT
score 16.8
AI model aligns video timestamps with visual evidence for better action localization
Original: CAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal Grounding
Source: arxiv.org ↗
Writing ELI5 summary…