The Pulse
Xiaomi rende open source MiMo-V2.6 Pro e Flash con risorse per l’apprendimento per rinforzo
Xiaomi ha rilasciato i modelli MiMo-V2.6-Pro e MiMo-V2.6-Flash insieme ai relativi pesi, al rapporto tecnico e alle risorse per l’apprendimento per rinforzo.

AI.info Team ·
Xiaomi ha rilasciato ufficialmente e reso open source la serie MiMo-V2.6, composta da due modelli nativi completamente multimodali: MiMo-V2.6-Pro e MiMo-V2.6-Flash. L’azienda descrive il rilascio come parte del proprio lavoro sull’auto-miglioramento ricorsivo, che utilizza l’apprendimento per rinforzo su compiti complessi e verificabili per migliorare le prestazioni dei modelli attraverso cicli ripetuti di esplorazione e feedback.
L’annuncio, aggiornato il 22 settembre 2026, afferma che ciascun modello ha completato 30 passaggi di apprendimento per rinforzo in meno di sei giorni. Nel complesso, le esecuzioni hanno utilizzato circa 750.000 traiettorie e sono costate circa 850.000 dollari per Flash e 2,62 milioni di dollari per Pro. Xiaomi riferisce che il tasso medio di superamento dei compiti di addestramento è migliorato del 25% per Flash e del 12% per Pro.
Infrastruttura di addestramento open source
Xiaomi pubblica più dei soli pesi dei modelli. Il rilascio comprende un rapporto tecnico completo, ambienti di addestramento e codice per l’apprendimento per rinforzo, con l’obiettivo di aiutare i ricercatori a riprodurre ed esaminare i risultati dell’azienda.
Il pacchetto contiene oltre 7.000 ambienti per compiti di apprendimento per rinforzo, che coprono ingegneria del software, riproduzione di vulnerabilità, attività ad alto contenuto di conoscenze e progettazione e sviluppo web. Include anche un framework end-to-end per l’apprendimento per rinforzo basato su verl, uni-agent e mini-swe-agent. Secondo Xiaomi, il framework copre l’interazione con gli ambienti, la raccolta delle traiettorie, la valutazione delle ricompense e l’ottimizzazione delle policy.
L’azienda ha inoltre rilasciato harness leggeri e componibili, che separano i prompt di sistema, gli strumenti e la gestione del contesto. Questi componenti sono progettati per consentire ai ricercatori di assemblare diverse configurazioni di addestramento e combinare gli elementi del framework tra vari compiti.
Durante l’addestramento, ogni aggiornamento ha utilizzato 1.568 campioni, supportato una finestra di contesto di 1 milione di token ed elaborato tra 3,5 e 3,7 miliardi di token per passaggio. Xiaomi afferma che il sistema di addestramento ha combinato compiti di programmazione, generali, visivi e di cybersicurezza attraverso più harness. Descrive inoltre misure pensate per stabilizzare l’addestramento, tra cui il congelamento del router mixture-of-experts e l’uso di progettazione delle ricompense, valutazione avversaria, rilevamento delle anomalie e controlli incrociati dei validatori per ridurre il reward hacking.
Risultati dichiarati sull’apprendimento per rinforzo
Nella valutazione a lungo raggio di ingegneria del software DeepSWE v1.1, Xiaomi riferisce che Flash è passato da 48,8 a 65,7 e Pro da 58,4 a 72,6. L’azienda presenta questi dati come prova di una maggiore efficienza nell’uso dei campioni, della capacità di continuare ad apprendere e delle prestazioni su compiti esterni al set di addestramento.
Xiaomi afferma che MiMo-V2.6-Pro ha raggiunto 46 punti nell’Artificial Analysis Intelligence Index, superando Kimi K3 e Qwen3.8 Max in questo indice. L’azienda afferma inoltre che Pro ha ottenuto risultati paragonabili a Claude Opus5 e GPT-5.6 Sol nella maggior parte degli Agent Benchmark, mentre Flash ha superato MiMo-V2.5-Pro.
Dalla generazione di codice ai mondi interattivi
La serie MiMo-V2.6 combina percezione multimodale, ragionamento spaziale 3D e capacità di interazione con il computer. Xiaomi afferma che i modelli possono trasformare testo, immagini o video in mondi interattivi eseguibili attraverso un flusso di lavoro che coinvolge più agenti. Il processo può includere la costruzione della scena, la programmazione della logica interattiva, la verifica visiva e le correzioni basate sui risultati del rendering.
L’annuncio descrive anche la modellazione in Blender basata su descrizioni testuali o immagini di riferimento. In un ambiente di simulazione incarnata, MiMo-V2.6 può usare immagini riprese da più angolazioni per controllare un braccio robotico Franka Panda, afferrare oggetti, abbinarne i colori e posizionare gli elementi con precisione attraverso il feedback visivo.
Per i compiti che prevedono l’uso del computer, Xiaomi afferma che il modello può comprendere le interfacce grafiche e utilizzare i comuni strumenti per ufficio e produttività per recuperare informazioni, modificare contenuti ed elaborare dati. Può anche controllare i risultati, risolvere problemi e modificare le azioni successive in base al feedback visivo.
Applicazioni nella ricerca e nella creazione digitale
Xiaomi presenta MiMo-V2.6-Pro come assistente nella ricerca sui materiali: recupera letteratura scientifica e brevetti, propone progetti di strutture metallo-organiche pensati per catturare inquinanti persistenti e usa strumenti open source per simulare la forza di legame prima di selezionare i candidati da sottoporre a ulteriori verifiche.
Il modello è stato usato anche per formalizzare in Lean 4 il teorema principale dell’articolo di Li e Yorke «Period Three Implies Chaos». Xiaomi afferma che il progetto risultante contiene oltre 6.000 righe di codice sorgente Lean ed è stato verificato dal kernel di Lean senza segnaposto non dimostrati.
Altri esempi riguardano interfacce front-end, progetti Figma, presentazioni, file SVG, video e musica. Xiaomi afferma che MiMo-V2.6-Pro può creare un brano orchestrale, convertire la partitura risultante in formato MIDI e applicare conoscenze di orchestrazione e arrangiamento.
Accesso tramite servizi ospitati e disponibilità dei modelli open source
La serie MiMo-V2.6 è disponibile attraverso la piattaforma aperta e il client desktop di Xiaomi. I prezzi delle API restano invariati rispetto alla serie V2.5 e MiMo-V2.6-Pro dispone di una modalità UltraSpeed che, secondo Xiaomi, può offrire una velocità di inferenza fino a 20 volte superiore a quella standard.
L’azienda ha inoltre rilasciato MiMo-V2.6-Distill-Qwen-9B e riferisce miglioramenti rispetto al proprio modello di riferimento sottoposto a fine-tuning supervisionato in 11 benchmark, dopo l’addestramento con apprendimento per rinforzo. I nomi dei modelli API sono mimo-v2.6-pro, mimo-v2.6-flash e mimo-v2.6-pro-ultraspeed.