Vai al contenuto
AI.info

Ricerca

Quanto vale un token di IA? Leggi di scala per il testo web generato dall’IA nel mondo reale

Il testo web costituisce la maggior parte dei dati di preaddestramento ed è sempre più spesso generato dall’IA. Dopo aver applicato il filtro di qualità di FineWeb, rileviamo che Pangram classifica co

Quanto vale un token di IA? Leggi di scala per il testo web generato dall’IA nel mondo reale
arXiv
2609.40295
Pubblicato
2026-09-30
Autori
Jenna Russell, Ben Glickenhaus, Katherine Thai, John Wieting, Mohit Iyyer, Max Spero, Bradley Emi

Abstract degli autori

Il testo web costituisce la maggior parte dei dati di preaddestramento ed è sempre più spesso generato dall’IA. Dopo aver applicato il filtro di qualità di FineWeb, rileviamo che Pangram classifica come generato dall’IA il 27,5% dei token nei dati web di giugno 2026, una quota che sale al 31,1% entro agosto. A differenza dei dati sintetici o degli scenari di collasso dei modelli, questo testo di IA *nel mondo reale* proviene da molti modelli, è scritto per lettori umani ed entra nei corpora di preaddestramento senza etichette. In che modo il testo di IA presente nel mondo reale influisce sul preaddestramento dei modelli linguistici? Per rispondere, preaddestriamo 800 modelli linguistici variando il rapporto fra i token di IA aggiunti e i token umani, e adattiamo leggi di scala ai valori della funzione di perdita calcolati su testo umano e generato dall’IA escluso dall’addestramento. Per i modelli con pochi dati, l’aggiunta di token di IA ai dati di preaddestramento riduce inizialmente la perdita sul testo umano, ma il beneficio si esaurisce man mano che se ne aggiungono altri e si *trasforma* rapidamente in un effetto dannoso. Per i modelli addestrati con grandi quantità di testo umano, i token di IA fanno aumentare la perdita quasi subito, mentre lo stesso numero di nuovi token umani continua a ridurla. Leggi di scala come quella di Hoffman et al. (2022) non riescono a prevedere questo comportamento. Proponiamo una nuova legge di scala con termini distinti per i benefici e gli effetti dannosi, che consente al valore di un token di IA di cambiare segno e, in assenza di testo di IA, si riduce alla legge di Chinchilla. Adattata su modelli più piccoli, la nostra legge di scala prevede l’effetto del testo di IA sulla perdita calcolata su testo umano escluso dall’addestramento per modelli fino a 3,6 volte più grandi, con un errore inferiore del 41% rispetto alla migliore legge esistente, considerando tutti i rapporti fra token di IA e token umani. Raccomandiamo di filtrare il testo di IA quando l’obiettivo è il testo umano, di riutilizzare il testo umano prima di ampliare il dataset di addestramento con testo web generato dall’IA e di riportare separatamente la perdita di validazione sul testo umano e su quello di IA; il testo di IA resta prezioso quando l’obiettivo è il testo di IA. Rendiamo disponibili WildAI, un corpus di 83 miliardi di token con etichette relative all’IA, all’argomento e al formato, tutti gli 800 modelli e il codice all’indirizzo https://github.com/pangramlabs/WildAI.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv