Ricerca
Misurare il trasferimento linguistico nelle policy robotiche: aggiungere il greco a una policy visione-linguaggio-azione Cosmos3
I modelli di base per la robotica vengono addestrati e valutati prevalentemente in inglese, e per la maggior parte delle lingue non esistono corpora di dimostrazioni robotiche. Studiamo l’aggiunta del

- arXiv
- 2609.07470
- Pubblicato
- 2026-09-07
- Autori
- Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos
Abstract degli autori
I modelli di base per la robotica vengono addestrati e valutati prevalentemente in inglese, e per la maggior parte delle lingue non esistono corpora di dimostrazioni robotiche. Studiamo l’aggiunta del greco a uno stack aperto visione-linguaggio-azione usando soltanto istruzioni riformulate automaticamente, senza modifiche all’architettura. La sfida principale è misurare, più che tradurre. Diversi strumenti apparentemente validi portano a conclusioni errate: una metrica basata sull’istogramma dei colori premia il rumore; un benchmark con un solo obiettivo registra l’84,6% con istruzioni corrette in greco e l’82,6% con istruzioni deliberatamente errate; la perdita durante l’addestramento non predice il successo in greco; e i confronti basati su una sola esecuzione sono dominati dalla variabilità tra seed. Su una suite di novanta compiti progettati per distinguere le prestazioni, con tre seed per gruppo, una torre testuale multilingue senza dimostrazioni in greco rimane al livello registrato con istruzioni errate, mentre l’addestramento solo in greco supera il rispettivo controllo di non più di 2,7 punti. L’addestramento bilingue produce un vantaggio costante di 6,7-7,1 punti rispetto al rispettivo controllo e raggiunge circa due quinti delle prestazioni in inglese. La policy si adatta eccessivamente alle formulazioni del traduttore; l’addestramento su sette formulazioni per compito dimezza all’incirca questa penalizzazione. Sia partire da un modello del mondo adattato alla lingua sia sbloccare la torre testuale peggiorano le prestazioni. I risultati indicano due requisiti pratici per adattare le policy robotiche a lingue con poche risorse: predisporre un controllo nullo garantito prima di fidarsi di una metrica e replicare i risultati ottenuti per queste lingue usando seed diversi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv