← back
arXivDavide Testa, Hugh Mee Wong, Alessandro Lenci, Bernardo Magnini, Albert GattFri, Sep 4, 2026, 6:52 AM PDT
score 15.2

How AI links video images to answer choices, and where it fails

Original: From Vision to Language: Investigating Causal Information Flow in Multimodal Decision-Making

Source: arxiv.org

Writing ELI5 summary…