Vai al contenuto
AI.info

Ricerca

Vettori funzionali interlinguistici per il rilevamento delle emozioni nei modelli linguistici di grandi dimensioni

I vettori funzionali (FV) si sono recentemente affermati come un meccanismo promettente per orientare il comportamento dei modelli linguistici di grandi dimensioni (LLM), inserendo rappresentazioni di

Vettori funzionali interlinguistici per il rilevamento delle emozioni nei modelli linguistici di grandi dimensioni
arXiv
2608.29613
Pubblicato
2026-08-30
Autori
Jieying Xue, Phuong Minh Nguyen, Minh Le Nguyen, Shogo Okada

Abstract degli autori

I vettori funzionali (FV) si sono recentemente affermati come un meccanismo promettente per orientare il comportamento dei modelli linguistici di grandi dimensioni (LLM), inserendo rappresentazioni di direzioni latenti specifiche per un compito, ricavate da esempi forniti nel contesto. Sebbene studi precedenti abbiano mostrato che gli FV possono riprodurre il comportamento richiesto da un compito in contesti strutturati di apprendimento in-context, la loro efficacia nei compiti semanticamente complessi e la loro capacità di generalizzare tra lingue diverse restano poco esplorate. Studiamo la trasferibilità interlinguistica degli FV usando il riconoscimento multilingue e multi-etichetta delle emozioni come benchmark impegnativo di classificazione semantica. In particolare, esaminiamo se gli FV estratti da una lingua di partenza possano orientare il comportamento del modello in un’altra lingua, sia in condizioni zero-shot standard senza perturbazioni sia in condizioni zero-shot con perturbazioni, senza fornire esempi durante l’inferenza. In diversi contesti interlinguistici, l’applicazione degli FV migliora notevolmente le prestazioni. Ciò suggerisce che gli FV catturino segnali pertinenti al compito e indipendenti dalla lingua, anziché schemi lessicali puramente specifici di una lingua, e ne mette in luce il potenziale come meccanismo leggero e trasferibile per l’adattamento multilingue ai compiti. Osserviamo che ogni LLM presenta un intervallo ottimale relativamente stabile nel numero di teste di attenzione da usare per costruire FV efficaci, e che questo andamento rimane costante tra le lingue. Inoltre, gli FV possono riprodurre in parte gli effetti di orientamento del modello ottenuti con il normale apprendimento in-context few-shot, evitando al contempo il costo computazionale dell’elaborazione di più esempi. Questo li rende efficaci per applicazioni pratiche su larga scala. Il nostro codice è disponibile all’indirizzo https://github.com/yingjie7/cross_lingual_fvs.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv