arXivDavide Testa, Hugh Mee Wong, Alessandro Lenci, Bernardo Magnini, Albert GattFri, Sep 4, 2026, 6:52 AM PDT
score 15.2
How AI links video images to answer choices, and where it fails
Original: From Vision to Language: Investigating Causal Information Flow in Multimodal Decision-Making
Source: arxiv.org ↗
Writing ELI5 summary…