Vai al contenuto
AI.info

The Pulse

LatticeFlow rileva un maggiore allineamento politico nei modelli Qwen più grandi

Il benchmark di LatticeFlow AI sui bias politici confronta Qwen 3.7 Max con Qwen3 32B e rileva che il modello più grande è più vicino al polo cinese in tutte e sei le categorie relative alla politica cinese.

LatticeFlow rileva un maggiore allineamento politico nei modelli Qwen più grandi

AI.info Team ·

Secondo LatticeFlow, i modelli Qwen più grandi si avvicinano al polo politico cinese

LatticeFlow AI afferma che il suo primo benchmark indipendente sui bias politici ha rilevato che, nella famiglia Qwen, l’aumento delle dimensioni non ha avvicinato i sistemi a una posizione neutrale. Secondo l’azienda, Qwen 3.7 Max si colloca più vicino al polo politico cinese rispetto al più piccolo Qwen3 32B in tutte e sei le categorie relative alla politica cinese esaminate.

Sulla libertà religiosa e sulle questioni etniche, LatticeFlow identifica Qwen 3.7 Max come il modello più allineato alle posizioni cinesi tra quelli valutati. I risultati dell’azienda collocano anche GLM 5.2, Kimi K2.6, MiniMax M2.7 FP4 e DeepSeek V4 Pro verso l’estremo cinese dell’asse in ogni categoria misurata.

I risultati arrivano mentre le aziende adottano modelli cinesi a pesi aperti perché possono eseguirli sulla propria infrastruttura, spesso a costi inferiori rispetto ai principali sistemi statunitensi. LatticeFlow cita dati di OpenRouter secondo cui nel 2026 i modelli cinesi hanno rappresentato tra il 30% e il 46% dell’utilizzo di token da parte delle aziende statunitensi, rispetto al 4,5% nella prima metà del 2025.

Il disaccordo riguarda il significato da attribuire a «bias»

Misurare i bias politici presenta un problema: qualsiasi benchmark che definisca in anticipo una risposta corretta o neutrale può incorporare le ipotesi dei suoi autori. LatticeFlow afferma che il suo metodo evita questo passaggio confrontando le risposte dei modelli cinesi e occidentali alle stesse domande, scomponendo le risposte in singole affermazioni e misurando dove queste convergono o divergono.

Per gli assi relativi alla politica cinese e statunitense, l’azienda afferma che l’asse viene ricavato dalle risposte dei modelli di riferimento a prompt neutrali, anziché essere stabilito da criteri scritti da persone o da un modello di IA usato come valutatore. Gli assi relativi ai diritti umani in Europa e negli Stati Uniti sono costruiti diversamente: LatticeFlow li costruisce chiedendo esplicitamente ai modelli di adottare ciascuna prospettiva, per esempio di sinistra e di destra. Nessuno dei due tipi di asse è considerato una scala morale: una posizione indica dove si collocano le affermazioni di un modello rispetto all’insieme delle posizioni rilevate.

LatticeFlow precisa inoltre che la valutazione è una rilevazione riferita a una data, non una classifica permanente. Ogni risultato è associato a un hash crittografico dei pesi esatti del modello sottoposto a test, così che una terza parte in possesso degli stessi file possa replicare la valutazione.

Il risultato dei modelli cinesi dipende dal modo in cui inquadrano le questioni, non dai rifiuti di rispondere

Secondo LatticeFlow, in generale i modelli cinesi non si sono rifiutati di rispondere a domande politicamente sensibili. L’azienda descrive il comportamento osservato come un diverso inquadramento delle questioni: i sistemi hanno risposto in modo fluido e completo, ma hanno presentato temi controversi attraverso una prospettiva politica cinese.

Un esempio nella pagina dell’azienda dedicata alla valutazione confronta le risposte a una domanda sugli effetti della Belt and Road Initiative sui diritti umani. La risposta corrispondente al polo occidentale richiama un indebolimento della sovranità, citando il porto di Hambantota in Sri Lanka, e pochi miglioramenti duraturi dei diritti umani; quella corrispondente al punto neutrale presenta effetti contrastanti; quella corrispondente al polo cinese afferma che l’iniziativa non ha avuto effetti negativi sui diritti umani, rispetta la sovranità nazionale e si fonda sul rispetto reciproco e su una cooperazione vantaggiosa per entrambe le parti.

Questa distinzione conta per le verifiche aziendali. Un rifiuto è visibile all’utente o a chi verifica la sicurezza del sistema. Una risposta ben formulata che omette affermazioni di segno diverso può sembrare completa, pur influenzando la comprensione del tema da parte di chi legge.

I modelli occidentali si distribuiscono lungo i propri assi politici

Il benchmark di LatticeFlow non considera l’allineamento politico una caratteristica esclusiva dei sistemi cinesi. Secondo l’azienda, i modelli Grok si collocano a un’estremità del suo asse relativo alla politica statunitense, mentre GPT-5.4 e GPT-5.5 occupano l’altra; la maggior parte degli altri modelli si concentra vicino al centro.

Sulle questioni relative ai diritti umani negli Stati Uniti, LatticeFlow afferma che Grok tende verso il polo del governo e delle forze armate, mentre DeepSeek tende verso quello delle organizzazioni per i diritti umani. Il confronto intende mostrare che il metodo misura il comportamento dei singoli modelli, anziché attribuire un unico profilo politico in base al paese di origine.

Il metodo pubblicato per il benchmark comprende 17 modelli e 11 spettri politici. LatticeFlow afferma che la prima valutazione ha utilizzato test diretti e indiretti dei bias e dataset di controllo.

Petar Tsankov: le aziende ora hanno bisogno di prove prima dell’impiego

Il dott. Petar Tsankov, amministratore delegato e cofondatore di LatticeFlow AI, presenta il risultato come una questione di approvvigionamento e governance, più che come un esercizio accademico di classificazione.

«I modelli di IA cinesi sono già ampiamente impiegati nelle aziende occidentali e gestiscono operazioni aziendali cruciali, dalle decisioni di assunzione agli investimenti, al credito e alla concessione di prestiti. Abbiamo scoperto che il “cervello” dietro queste operazioni — i modelli cinesi a pesi aperti — presenta un significativo bias politico a favore dei valori cinesi, e che questo bias si rafforza man mano che i modelli diventano più capaci e più diffusamente impiegati. È una seria preoccupazione. Tutti se ne preoccupavano; ora possiamo misurarlo. Il passo successivo è adottare le giuste misure di mitigazione e dimostrare che funzionano, dando alle organizzazioni occidentali una base concreta per adottare questi modelli in sicurezza.»

Dott. Petar Tsankov, amministratore delegato e cofondatore, LatticeFlow AI

LatticeFlow offre il metodo alle aziende e ai fornitori di modelli che vogliono testare i sistemi prima dell’impiego o confrontare i risultati prima e dopo l’adozione di misure di mitigazione. Secondo l’azienda, i team possono ricevere punteggi per categoria, esempi di singole affermazioni e risultati associati a hash, adatti a una verifica indipendente.

Il benchmark non dimostra che ogni risposta di un modello cinese presenti un bias politico, né che le sole dimensioni del modello causino un rafforzamento dell’allineamento. Riporta la posizione dei pesi dei modelli valutati sugli assi di LatticeFlow per quella specifica esecuzione. Poiché l’azienda presenta i risultati come una misurazione riferita a una data e non come una classifica permanente, i futuri aggiornamenti dei modelli richiederebbero una nuova valutazione.

Per le organizzazioni che scelgono tra sistemi a pesi aperti, la domanda immediata non riguarda più soltanto le prestazioni di un modello nel ragionamento e nella programmazione, o il suo costo. Il benchmark di LatticeFlow aggiunge un’altra verifica: se il modello presenta ripetutamente informazioni politicamente sensibili da una sola prospettiva nazionale, anche quando non si rifiuta di rispondere.

Fonti

Esplora

Altri articoli