Vai al contenuto
AI.info

Ricerca

CaRGo-T: Causal Reasoning Graph-of-Thought migliora la comprensione dell’umorismo multimodale

I modelli di visione e linguaggio (VLM) su larga scala hanno dimostrato una notevole versatilità in un’ampia gamma di compiti multimodali. Comprendere l’umorismo, tuttavia, resta difficile perché i co

CaRGo-T: Causal Reasoning Graph-of-Thought migliora la comprensione dell’umorismo multimodale
arXiv
2608.23172
Pubblicato
2026-08-24
Autori
Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

Abstract degli autori

I modelli di visione e linguaggio (VLM) su larga scala hanno dimostrato una notevole versatilità in un’ampia gamma di compiti multimodali. Comprendere l’umorismo, tuttavia, resta difficile perché i contenuti umoristici dipendono spesso da interazioni sottili tra entità, eventi, contesto e relazioni implicite che coinvolgono immagini e testo. Queste interazioni possono richiedere catene di ragionamento complesse, difficili da cogliere con i prompt convenzionali o con un ragionamento lineare passo dopo passo. In questo lavoro proponiamo CaRGo-T (Causal Reasoning Graph-of-Thought), un framework di ragionamento che rappresenta le relazioni causali e contestuali alla base dell’umorismo multimodale mediante una struttura di ragionamento leggera basata su grafi. Il grafo viene serializzato in una rappresentazione basata su codice generata da un VLM, che può poi essere interpretata dallo stesso VLM o da un altro VLM per produrre la previsione finale in contesti di apprendimento zero-shot o in-context. Valutiamo CaRGo-T sulla comprensione e sul riconoscimento dell’umorismo usando quattro dataset che comprendono diverse forme di contenuti comici, tra cui satira, sarcasmo e meme. Esperimenti con VLM commerciali e open source allo stato dell’arte mostrano che CaRGo-T migliora sistematicamente le prestazioni rispetto agli approcci di riferimento esistenti basati sul ragionamento, con miglioramenti di circa l’1-20% nella comprensione dell’umorismo e dell’1-3% nel suo riconoscimento. Un’ulteriore analisi basata sull’informazione mutua indica che le rappresentazioni del ragionamento prodotte da CaRGo-T contengono più informazioni pertinenti all’output atteso rispetto a quelle generate dagli approcci di ragionamento di riferimento. Il codice è disponibile all’indirizzo https://github.com/abhi1nandy2/CaRGo-T.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv