The Pulse
Tether pubblica un dataset STEM da 191 miliardi di token per modelli più piccoli
Tether AI Research ha pubblicato QVAC Genesis III, un dataset sintetico da 191,43 miliardi di token per addestrare modelli più piccoli al ragionamento in ambito STEM. L’azienda afferma che i modelli addestrati sul corpus hanno superato Cosm

AI.info Team ·
Tether punta sui dati migliori, non su modelli più grandi
Tether AI Research ha pubblicato QVAC Genesis III il 23 settembre, presentando un dataset sintetico da 191,43 miliardi di token come alternativa alla continua spinta del settore verso modelli più grandi e sistemi di calcolo più potenti.
L’azienda afferma che Genesis III aiuta i modelli più piccoli a rispondere a domande STEM e a spiegare il ragionamento alla base delle risposte. L’obiettivo dichiarato è l’IA locale: tutor, assistenti tecnici e strumenti di ricerca che possano funzionare su laptop, telefoni e server locali, invece di inviare ogni richiesta a un modello nel cloud.
«La maggior parte del settore dell’IA si è concentrata sul rendere i modelli più grandi e sul fornire loro maggiore potenza di calcolo», ha dichiarato Paolo Ardoino, CEO di Tether, nell’annuncio. «Genesis III mostra cosa può succedere quando ci si concentra invece sul migliorare i dati da cui apprendono i modelli più piccoli».
La pubblicazione è accompagnata da un articolo di ricerca inviato ad arXiv il 17 settembre. Tether afferma che l’articolo è stato accettato anche per la presentazione alla Conference on Language Modeling del 2026.
Cosa aggiunge Genesis III alle precedenti pubblicazioni di QVAC
Genesis III amplia QVAC Genesis I e QVAC Genesis II, pubblicati rispettivamente a ottobre e dicembre 2025. Il nuovo corpus contiene 159,6 milioni di documenti che coprono 19 aree STEM, tra cui biologia, chimica, fisica, matematica, informatica, medicina, astronomia, ingegneria elettrica, statistica e machine learning.
Il dataset è disponibile tramite la piattaforma Genesis aperta di QVAC ed è distribuito con licenza CC-BY-NC 4.0 per la ricerca e l’istruzione. La pagina di QVAC fornisce un esempio di caricamento di una riga con la libreria datasets di Hugging Face, che consente ai ricercatori di trasmettere in streaming o scaricare il materiale per le sessioni di addestramento.
Il progetto si basa su due forme di dati sintetici per il ragionamento. Failure Analysis prende gli errori commessi da un modello studente più piccolo e li trasforma in spiegazioni correttive. Un modello insegnante più potente individua l’errore, spiega il fraintendimento e illustra una soluzione.
Option-Level Reasoning usa domande a cui il modello studente ha risposto correttamente. Genera spiegazioni del perché la risposta selezionata sia giusta e le altre opzioni siano sbagliate. L’obiettivo dell’approccio è fornire ai modelli più informazioni sugli errori e sulle alternative rispetto a una convenzionale coppia di domanda e risposta.
I miglioramenti riportati rispetto a Cosmopedia-v2
L’articolo valuta modelli da 1,7 miliardi di parametri addestrati da zero e confronta Genesis III con Cosmopedia-v2, un corpus di addestramento sintetico aperto. Tether afferma che il dataset Option-Level ha prodotto miglioramenti con diverse architetture di modelli, tra cui Qwen, Llama, SmolLM e Gemma.
Rispetto a un modello Cosmopedia-v2 addestrato con lo stesso numero di token, i risultati di Genesis III hanno migliorato i punteggi di 28,57 punti percentuali su ARC-Easy, 21,35 punti su ARC-Challenge e 15,03 punti sul benchmark STEM MMLU. L’articolo riporta inoltre che un modello Genesis III ha superato il modello Cosmo-1B, reso pubblico, che è più grande ed è stato addestrato con ulteriori dati di matematica e codice.
Nella valutazione dello studio, un modello da 1,7 miliardi di parametri addestrato con i dati Option-Level ha raggiunto un Valid Answer Rate del 99,45%. L’articolo descrive questa misura come un protocollo di analisi delle risposte che rileva se un modello produce una risposta finale valida, invece di basarsi soltanto sull’accuratezza esatta nei benchmark.
I risultati riportati provengono dall’articolo e dall’annuncio di Tether. Mostrano le prestazioni nei benchmark nell’ambito delle procedure di addestramento e valutazione specificate nello studio; non garantiscono in generale che ogni modello di piccole dimensioni addestrato su Genesis III ottenga risultati analoghi.
Perché Tether vuole il ragionamento sul dispositivo
L’iniziativa QVAC di Tether punta a far funzionare l’IA localmente, con l’inferenza eseguita su hardware controllato dall’utente. Genesis III si inserisce in questa strategia concentrandosi sui dati di addestramento usati dai modelli più piccoli, anziché limitarsi ad aumentare il numero di parametri.
L’esecuzione locale potrebbe ridurre la necessità di inviare domande sensibili a un servizio esterno e aiutare gli strumenti a funzionare dove la connettività è limitata. Tether indica l’istruzione come una possibile applicazione: un tutor locale potrebbe svolgere un problema di fisica, spiegare un passaggio matematico errato e individuare dove il ragionamento dello studente non ha funzionato.
Lo stesso approccio potrebbe supportare assistenti specializzati per ricercatori e professionisti. Tether descrive questi sistemi come strumenti capaci di funzionare localmente senza trasmettere continuamente domande tecniche o altre informazioni sensibili a server esterni.
Accesso aperto, con una licenza riservata alla ricerca
La disponibilità del dataset consente ai ricercatori indipendenti di accedere a un ampio corpus STEM sintetico, organizzato esplicitamente per livelli di difficoltà, stili didattici e tracce di ragionamento. QVAC descrive Genesis III come la sua pubblicazione più grande finora e indica che Genesis I contiene 41 miliardi di token e Genesis II 107 miliardi di token.
La licenza non commerciale limita gli usi che le aziende possono fare della pubblicazione, pur consentendone l’impiego per la ricerca e l’istruzione. Questa distinzione è importante per gli sviluppatori che potrebbero voler realizzare tutor commerciali o assistenti tecnici basati sul corpus: il dataset è aperto all’esame e all’uso a fini di ricerca, ma la licenza non concede diritti commerciali senza restrizioni.
Per ora, la tesi più forte a favore di Genesis III è circoscritta, non universale. Negli esperimenti riportati dagli autori, spiegazioni generate con attenzione e ragionamento contrastivo aiutano modelli da 1,7 miliardi di parametri a competere con sistemi più grandi o addestrati in modo diverso in alcuni test STEM selezionati. Il dataset è disponibile sulla pagina Genesis di QVAC e nella relativa pubblicazione su Hugging Face.