Vai al contenuto
AI.info

Ricerca

Come fa «English (US)» a diventare l’impostazione predefinita? Un’analisi della distorsione strutturale a favore dell’inglese americano lungo l’intera filiera degli LLM

I modelli linguistici di grandi dimensioni (LLM) sono sempre più integrati nelle infrastrutture educative, professionali e pubbliche, eppure piattaforme ampiamente utilizzate presentano «English (US)»

Come fa «English (US)» a diventare l’impostazione predefinita? Un’analisi della distorsione strutturale a favore dell’inglese americano lungo l’intera filiera degli LLM
arXiv
2604.04204
Pubblicato
2026-04-05
Autori
Mir Tafseer Nayeem, Davood Rafiei

Abstract degli autori

I modelli linguistici di grandi dimensioni (LLM) sono sempre più integrati nelle infrastrutture educative, professionali e pubbliche, eppure piattaforme ampiamente utilizzate presentano «English (US)» come impostazione principale per l’inglese, nonostante la diversità dell’inglese nel mondo. Ci chiediamo: come fa «English (US)» a diventare l’impostazione predefinita? Studiamo la questione come una forma di distorsione strutturale, esaminando l’intreccio tra le vicende geopolitiche della selezione dei dati, il predominio digitale e la standardizzazione linguistica lungo la filiera di sviluppo degli LLM. Usando l’inglese britannico come riferimento controllato, costruiamo una risorsa curata di 1.813 varianti corrispondenti di inglese americano (AmE) e inglese britannico (BrE) e introduciamo DiAlign, un metodo dinamico che non richiede addestramento per stimare l’allineamento regionale sulla base di evidenze distribuzionali. Esaminiamo la preferenza per l’AmE nelle fasi di esposizione ai dati --> rappresentazione --> generazione, analizzando congiuntamente i dati di preaddestramento e post-addestramento, il comportamento e la provenienza dei tokenizer, il costo di predizione del modello e il linguaggio generato in relazione ai paesi degli sviluppatori, alle condizioni dei prompt, ai domini e alle fonti, alle categorie linguistiche e ai registri. L’AmE è sistematicamente favorito in tutti e sei i corpora di preaddestramento e nei 21 dataset di post-addestramento esaminati, è generalmente rappresentato in modo più compatto dai tokenizer e ha un costo di predizione inferiore. Rimane inoltre la variante dominante nella generazione con prompt neutri in inglese; i prompt in inglese britannico spostano questa preferenza verso il BrE, ma non eliminano sistematicamente il predominio dell’AmE come impostazione predefinita. Per quanto ne sappiamo, questo è il primo studio rigoroso della distorsione strutturale esteso alle principali fasi di sviluppo degli LLM. I nostri risultati mostrano che gli LLM contemporanei privilegiano l’AmE come norma di fatto, sollevando preoccupazioni per l’omogeneizzazione linguistica, l’ingiustizia epistemica e le disuguaglianze nella diffusione globale dell’IA, e offrono al tempo stesso una base rigorosa per interventi mirati sui singoli componenti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv