Vai al contenuto
AI.info

Trasformazione dei settori

L’IA nell’istruzione: tutor, copiature e cosa mostrano le prove

La tesi di Bloom sul tutoraggio e i due sigma, Khanmigo e Duolingo Max, l’offerta gratuita per insegnanti lanciata da Anthropic nel luglio 2026, i bias di Turnitin, il ritorno dei libretti d’esame e ciò che gli studi randomizzati controllat

L’IA nell’istruzione: tutor, copiature e cosa mostrano le prove

Gabriele Masetti ·

La promessa dei due sigma, e perché è stata sopravvalutata

Prima o poi, chiunque proponga un tutor basato sull’IA cita Benjamin Bloom. In un articolo del 1984, il ricercatore dell’Università di Chicago nel campo dell’istruzione descrisse il lavoro di dottorato dei suoi studenti Joanne Anania e Joseph Burke. I loro risultati mostravano che il tutoraggio individuale, unito all’apprendimento per padronanza, portava lo studente medio seguito da un tutor a due deviazioni standard sopra gli studenti di una classe tradizionale di 30 persone: un risultato migliore di quello del 98% dei suoi pari. Bloom lo chiamò «il problema dei due sigma»: se il tutoraggio funziona così bene, perché le scuole non possono offrirlo a tutti?

L’entità degli effetti del tutoraggio: la celebre tesi di Bloom a confronto con quanto effettivamente misurato dalle meta-analisi.

Il dato è reale, ma da quattro decenni la ricerca non riesce a replicarlo. Una meta-analisi del 1982 di Peter Cohen, James Kulik e Chen-Lin Kulik collocava l’effetto medio del tutoraggio più vicino a 0,33 deviazioni standard, pari a circa 13 punti percentili. Una meta-analisi del 2020 su 96 studi randomizzati sul tutoraggio ha rilevato un effetto medio di 0,37 deviazioni standard, pari a circa 14 punti percentili, e nessuno degli studi esaminati ha raggiunto i due sigma pieni.

Il dato di Bloom descrive un limite superiore in condizioni quasi ideali, non un risultato tipico. La distanza tra il mito fondativo e la realtà misurata è la prospettiva giusta da cui valutare tutto ciò che oggi promettono le aziende del tutoraggio con l’IA, e la reazione contro le copiature assistite dall’IA che le ha seguite nelle scuole.

I prodotti già presenti nelle classi

Khanmigo di Khan Academy, basato sui modelli di OpenAI, costa ai singoli utenti 4 dollari al mese o 44 dollari all’anno; un abbonamento copre fino a dieci bambini dello stesso nucleo familiare. Da quando un accordo mediato da Microsoft, annunciato nel maggio 2024, ha dato a Khan Academy accesso ad Azure OpenAI Service, ogni insegnante statunitense verificato delle scuole K-12 può usare Khanmigo gratuitamente. I distretti scolastici pagano a parte: gli strumenti di base per la reportistica partono da circa 5 dollari per studente all’anno, il piano «Enterprise Starter» costa 10 dollari e il componente aggiuntivo per il tutoraggio rivolto agli studenti circa 15 dollari per studente all’anno. L’introduzione nella contea di Palm Beach ha raggiunto tutte le 58 scuole superiori di un distretto con più di 179.000 studenti, a un costo di circa 1,2 milioni di dollari.

Duolingo Max, lanciato nel 2023 e inizialmente basato su GPT-4, si colloca sopra l’abbonamento standard Super e costa 29,99 dollari al mese o 168 dollari all’anno. Aggiunge «Video Call», un interlocutore IA con cui conversare dal vivo, e scenari di «Roleplay» basati su copioni. Ciò che lo distingueva si è ridotto nettamente nel gennaio 2026, quando «Explain My Answer» — la funzione di spiegazione grammaticale che prima era il tratto distintivo di Max — è diventata gratuita per tutti gli utenti di Duolingo. Al piano a pagamento è rimasta soprattutto la pratica di conversazione in preparazione a esami come TOEFL o IELTS.

Le università si sono mosse più rapidamente e hanno speso di più. Arizona State è diventata la prima università partner di OpenAI nel gennaio 2024, introducendo inizialmente ChatGPT Enterprise; nel 2025 la collaborazione si è ampliata, dando a ogni studente, docente e membro del personale di ASU accesso a ChatGPT Edu senza costi a carico dei singoli, utilizzando i modelli attuali di OpenAI, a sostegno di quasi 700 progetti nell’ambito dell’AI Innovation Challenge dell’università.

California State University è andata ancora oltre: un contratto per l’intero sistema universitario, secondo quanto riportato, da circa 17 milioni di dollari, poi rinnovato a 13 milioni di dollari all’anno per tre anni. L’accordo dà accesso a ChatGPT Edu a più di 470.000 studenti e 63.000 tra docenti e membri del personale: è il più grande accordo di OpenAI con il settore universitario. L’introduzione del servizio non è stata priva di problemi.

Un’indagine condotta in tutto il sistema CSU su oltre 94.000 studenti e membri del personale ha rilevato che il 65% degli studenti e il 59% dei docenti dubita che l’IA abbia effettivamente giovato all’istruzione, l’80% degli studenti non si sente a proprio agio nel presentare come proprio un lavoro generato dall’IA e il 52% dei docenti segnala un effetto negativo sul proprio insegnamento.

Anthropic entra nelle scuole K-12 e rafforza il suo impegno nell’università

L’ingresso di Anthropic nell’istruzione si è articolato in due iniziative a un anno di distanza. Nell’aprile 2025 è stato lanciato Claude for Education per le università, con la London School of Economics, Northeastern e Champlain College come primi partner ad adottarlo in tutto il campus e accesso gratuito per qualsiasi utente Pro statunitense con un indirizzo .edu. La sua funzione centrale, Learning mode, è progettata per accompagnare gli studenti attraverso i passaggi del ragionamento con prompt di tipo socratico, anziché fornire loro risposte già pronte: una risposta diretta alla critica secondo cui i chatbot usati come tutor sono «macchine delle risposte».

Il 14 luglio 2026 Anthropic ha lanciato Claude for Teachers, offrendo agli insegnanti statunitensi verificati delle scuole K-12 accesso gratuito alle funzionalità premium di Claude, a una raccolta di competenze per l’insegnamento e a strumenti per pianificare le lezioni collegati agli standard didattici di tutti i 50 stati tramite un partner chiamato Learning Commons. Gli insegnanti che si iscrivono entro il 30 giugno 2027 si assicurano un anno intero di accesso gratuito. Anthropic ha sviluppato congiuntamente con l’American Federation of Teachers condizioni per il trattamento dei dati conformi alla FERPA e ha stretto collaborazioni con la Gates Foundation e Teach For America, oltre ad avviare un progetto pilota nelle scuole pubbliche di Detroit.

Gli articoli di Chalkbeat ed Education Week hanno presentato il lancio come il segnale più chiaro finora che le aziende dell’IA vedono negli insegnanti, e non solo negli studenti, la via d’ingresso nelle classi americane. Alcuni critici citati in quegli articoli temevano che, grazie all’accesso gratuito anziché attraverso gli acquisti pubblici, un ristretto numero di fornitori potesse influenzare i programmi scolastici in tutto il paese.

Il panico per gli imbrogli, in cifre

L’ansia alla base di tutte queste prese di posizione non è immaginaria. Il Pew Research Center ha rilevato che la quota di adolescenti statunitensi che dichiarano di aver usato ChatGPT per i compiti scolastici è salita dal 13% nel 2023 al 26% entro la fine del 2024. Gli adolescenti neri e ispanici (31% per ciascun gruppo) dichiarano di averlo usato più spesso degli adolescenti bianchi (22%). Gli stessi ragazzi tracciano distinzioni nette: il 54% ritiene accettabile usare un chatbot per fare ricerche su un argomento, ma solo il 18% lo considera accettabile per scrivere temi.

I docenti giudicano il cambiamento più negativamente degli studenti. Secondo un sondaggio del luglio 2024 ripreso da Inside Higher Ed, il 68% dei docenti si aspettava che l’IA generativa danneggiasse l’integrità accademica, mentre il 47% degli oltre 2.000 studenti intervistati ammetteva che imbrogliare era diventato più facile. Un sondaggio della Elon University e dell’American Association of Colleges and Universities, pubblicato nel gennaio 2026, ha rilevato che il 78% dei docenti ritiene che gli imbrogli favoriti dall’IA siano in aumento; il 57% afferma che sono aumentati «molto».

Un altro sondaggio, condotto tra i responsabili degli istituti di istruzione superiore, ha rilevato che il 59% riteneva che gli imbrogli fossero aumentati da quando l’IA generativa era diventata ampiamente disponibile. Ma solo l’11% dei responsabili delle tecnologie dichiarava che il proprio istituto avesse qualcosa di simile a una strategia complessiva sull’IA per affrontare il problema.

Perché non ci si può fidare degli strumenti di rilevamento

La prima reazione delle scuole è stata combattere il software con altro software, ma questa scelta si è in gran parte ritorta contro di loro. Turnitin pubblicizza un tasso di falsi positivi inferiore all’1% per i documenti che contengono più del 20% di testo generato dall’IA. I test indipendenti raccontano una storia diversa per chi rischia maggiormente di essere accusato a torto: uno studio di Stanford del 2023 (Liang, Yuksekgonul, Mao, Wu e Zou, pubblicato su Patterns) ha messo alla prova sette diffusi strumenti di rilevamento di testi prodotti da GPT su temi TOEFL scritti da persone non madrelingua inglese, riscontrando un tasso medio di falsi positivi del 61,3%.

Uno solo degli strumenti ha segnalato come generati dall’IA il 97,8% di quei temi, e tutti e sette hanno classificato erroneamente il 19,8% dei testi, mentre gli stessi strumenti hanno ottenuto risultati quasi impeccabili sui temi di studenti statunitensi dell’ottavo anno di scuola. Il meccanismo è semplice: chi scrive in una lingua che non è la propria tende a usare strutture sintattiche più semplici e prevedibili, proprio il modello a bassa «perplessità» che gli strumenti sono addestrati a segnalare come testo scritto da una macchina.

Gruppo segnalato dagli strumenti di rilevamento dell’IA Tasso di falsi positivi
Persone non madrelingua inglese (temi TOEFL, studio di Stanford del 2023) 61,3% (media)
Studenti neri (Common Sense Media, 2024) ~20%
Studenti bianchi ~7%
Studenti latini ~10%

La distorsione non riguarda solo la lingua d’origine. Nel 2024 Common Sense Media ha intervistato circa 1.045 adolescenti e genitori e ha rilevato che i lavori degli studenti neri venivano erroneamente segnalati come generati dall’IA circa il 20% delle volte, contro il 7% per gli studenti bianchi e il 10% per quelli latini: una differenza che i ricercatori hanno attribuito in parte al fatto che gli strumenti interpretano erroneamente l’inglese vernacolare afroamericano come un’anomalia statistica. Considerati insieme, i due risultati mostrano che gli strumenti acquistati dalle scuole per tutelare l’integrità accademica finiscono per penalizzare sistematicamente proprio gli studenti meno responsabili del comportamento che si vuole contrastare.

Tornano i quaderni d’esame blu

Di fronte a strumenti di rilevamento che non funzionano e a chatbot che invece funzionano, i docenti si sono rivolti a una soluzione più vecchia del personal computer: l’esame scritto a mano. Secondo quanto riportato da Axios, U.S. News e dalla stampa di settore, in alcune università le vendite dei quaderni d’esame blu sono aumentate fino all’80%. Texas A&M, la University of Florida e UC Berkeley sono tra gli atenei che segnalano una domanda in forte crescita di prove in aula, con carta e penna.

La logica è semplice: uno studente che scrive a mano in un’aula sorvegliata non può ricorrere a un chatbot durante l’esame. Alcuni docenti riferiscono che il rallentamento imposto dalla scrittura a mano migliora la qualità del ragionamento degli studenti così come emerge dagli elaborati. I critici ribattono che scrivere a mano entro un tempo prestabilito svantaggia gli studenti con disabilità e chi scrive in più lingue ed elabora le informazioni in modo diverso, e che chi è deciso a imbrogliare troverà comunque il modo di farlo, indipendentemente dalla forma dell’esame.

Che cosa mostrano davvero gli studi randomizzati

Mettendo da parte il marketing e gli allarmismi, la ricerca controllata racconta una storia più precisa e più utile: a fare la differenza è il sostegno strutturato all’apprendimento.

Uno studio randomizzato controllato sostenuto dalla Banca Mondiale a Benin City, in Nigeria, ha offerto a circa 800 studenti delle scuole secondarie sei settimane di tutoraggio doposcuola — 12 sessioni, due volte alla settimana — con Microsoft Copilot basato su GPT-4. L’intervento ha migliorato i risultati in inglese di 0,23 deviazioni standard, a un costo di circa 48 dollari per studente. Secondo i ricercatori, il risultato supera quello dell’80% dei programmi educativi valutati con rigore e produce progressi paragonabili a circa due anni di istruzione ordinaria.

Uno studio randomizzato controllato di Harvard, guidato da Gregory Kestin e pubblicato su Scientific Reports nel giugno 2025, ha sottoposto 194 studenti di un corso introduttivo di fisica agli stessi contenuti, presentati tramite un tutor di IA progettato appositamente oppure durante una lezione basata sull’apprendimento attivo. La dimensione dell’effetto stimata per il gruppo seguito dal tutor di IA era compresa tra 0,73 e 1,3 deviazioni standard rispetto al gruppo in aula (p < 0,00000001). Il gruppo con il tutor ha terminato in un tempo mediano di 49 minuti, contro circa 60 minuti per quello in aula, e ha riferito maggiore coinvolgimento e motivazione. Il tutor era stato progettato deliberatamente secondo principi consolidati della scienza dell’apprendimento — domande attive, piccoli passi, suggerimenti graduali e riscontri tempestivi — anziché essere lasciato come una finestra di chat aperta.

Questo dettaglio progettuale è al centro del risultato più preoccupante emerso nel settore. Hamsa Bastani, Osbert Bastani e colleghi hanno condotto uno studio randomizzato controllato nelle classi di matematica del nono, decimo e undicesimo anno di una scuola superiore turca, pubblicato su PNAS nel 2025 con il titolo «L’IA generativa senza misure di salvaguardia può danneggiare l’apprendimento». Gli studenti che potevano usare GPT-4 senza restrizioni durante le esercitazioni hanno migliorato i risultati delle esercitazioni dal 48% al 127%.

Quando lo strumento è stato tolto per gli esami da svolgere senza assistenza, quegli stessi studenti hanno ottenuto risultati inferiori del 17% rispetto a un gruppo di controllo che non aveva usato l’IA: il chatbot aveva permesso loro di trovare le risposte giuste senza sviluppare le competenze necessarie. Una seconda versione dello strumento, limitata a suggerimenti socratici progettati con il contributo degli insegnanti anziché a risposte dirette, ha evitato del tutto questo danno.

Il National Student Support Accelerator di Stanford ha condotto uno studio randomizzato controllato complementare con 900 tutor e 1.800 studenti delle classi K-12 in un distretto scolastico del Sud degli Stati Uniti. Ha sperimentato Tutor CoPilot, uno strumento di supporto in tempo reale che suggerisce ai tutor umani domande e spiegazioni migliori durante le sessioni. Non interagiva direttamente con gli studenti: aiutava i tutor adulti a lavorare meglio. Tra gli studenti seguiti dai tutor che il distretto aveva valutato meno favorevolmente, il tasso di superamento è salito dal 56% al 65%, riducendo quasi del tutto il divario rispetto al 66% ottenuto dagli studenti seguiti dai tutor valutati più favorevolmente.

Studio Risultato
Studio randomizzato controllato della Banca Mondiale a Benin City (tutoraggio con Microsoft Copilot/GPT-4) Risultati in inglese +0,23 deviazioni standard, ~48 dollari/studente
Studio randomizzato controllato di Harvard sulla fisica (Kestin, 2025) Dimensione dell’effetto: 0,73-1,3 deviazioni standard rispetto alla lezione in aula
Studio randomizzato controllato turco pubblicato su PNAS (Bastani e colleghi) Risultati delle esercitazioni da +48% a +127%; risultati degli esami senza assistenza -17% rispetto al gruppo di controllo
Studio randomizzato controllato di Stanford su Tutor CoPilot Tasso di superamento con i tutor valutati meno favorevolmente: 56% -> 65%

Il vantaggio più evidente e i prossimi passi

Considerati insieme, questi studi mostrano tutti lo stesso schema: il tutoraggio con IA costruito attorno a un sostegno strutturato all’apprendimento — suggerimenti invece di risposte, domande attive, un essere umano coinvolto nel processo — produce miglioramenti reali nell’apprendimento, spesso notevoli. L’accesso all’IA senza alcuna struttura, offerto a un principiante come un prontuario di risposte, gonfia i risultati nel breve periodo e lascia una lacuna nelle competenze nel lungo periodo, quando lo strumento non è più disponibile. Il gruppo di Bastani lo ha detto esplicitamente: a distinguere un tutor utile da una stampella era la scelta di limitare il modello ai suggerimenti approvati dagli insegnanti.

Finora, il beneficio più costante riguarda gli adulti in classe. Gallup e la Walton Family Foundation hanno intervistato 2.232 insegnanti delle scuole pubbliche statunitensi tra il 18 marzo e l’11 aprile 2025 e hanno rilevato che 6 su 10 avevano usato strumenti di IA durante l’anno scolastico. Chi li usava ogni settimana ha riferito di risparmiare circa sei ore settimanali nella preparazione delle lezioni, nella valutazione dei compiti e nella creazione di materiali: all’incirca sei settimane nell’arco di un anno scolastico di 37,4 settimane.

La guida dell’UNESCO del 2023 sull’IA generativa nell’istruzione e nella ricerca, ancora il quadro di riferimento citato dai ministeri che elaborano le politiche nazionali, raccomanda un’età minima per l’uso dei chatbot senza supervisione e tutele obbligatorie per la riservatezza dei dati. A questa si affianca il quadro UNESCO del 2024 sulle competenze in materia di IA per gli studenti, fondato su una visione incentrata sull’essere umano e sull’etica, anziché sulla sola padronanza degli strumenti.

Da tutto questo non emerge un giudizio semplice sull’«IA nelle scuole» come se fosse un fenomeno unico, perché non lo è. È un tutor socratico che offre un sostegno strutturato in un corso di fisica a Harvard, una finestra di chat senza restrizioni in una classe di algebra turca e un contratto aziendale da 13 milioni di dollari all’anno a Cal State: le prove disponibili valutano questi tre casi in modo completamente diverso. Le battaglie sulle prove scritte a mano e sui software di rilevamento riguardano, in sostanza, quale di queste tre realtà prenderà forma in una determinata classe.

Gli insegnanti che aderiscono al programma gratuito di Anthropic hanno tempo fino al 30 giugno 2027 per assicurarsi un anno di accesso: la prossima vera prova per stabilire quale modello prevarrà è già in corso.

Esplora

Altri articoli