← back
arXivZehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun ZhuWed, Aug 5, 2026, 7:28 AM PDT
score 17.1

Video-to-Audio AI Gets Better by Tracking How Frames Change

Original: Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

Source: arxiv.org

Writing ELI5 summary…