The Pulse
Cloudflare blocca per impostazione predefinita i crawler per l’addestramento dell’IA e degli agenti
Le nuove impostazioni predefinite di Cloudflare entreranno in vigore il 15 settembre 2026 e bloccheranno i crawler per l’addestramento dell’IA e gli agenti sulle pagine che mostrano annunci pubblicitari, continuando invece a consentire l’ac

AI.info Team ·
Le nuove regole predefinite di Cloudflare entreranno in vigore martedì 15 settembre e bloccheranno i crawler utilizzati per l’addestramento dell’IA e le attività degli agenti in tempo reale sulle pagine che mostrano annunci pubblicitari, continuando invece a consentire l’accesso ai crawler dei motori di ricerca. La modifica riguarda i nuovi domini, i nuovi siti aggiunti dai clienti esistenti e i clienti esistenti del piano gratuito che non hanno modificato le proprie impostazioni.
La policy trasforma un annuncio di luglio in una modifica effettiva per una larga parte del web. Cloudflare afferma che i proprietari dei siti possono ancora modificare le impostazioni dalla dashboard dell’azienda, ma che ora le opzioni predefinite favoriscono la scoperta tramite ricerca rispetto ai sistemi automatizzati che copiano contenuti per addestrare modelli o agiscono per conto di un utente.
«Ora che la maggior parte del traffico su Internet non è generato da esseri umani, dobbiamo fare di più e agire più rapidamente affinché possa emergere un ecosistema sostenibile», ha dichiarato Matthew Prince, cofondatore e amministratore delegato di Cloudflare, nell’annuncio dell’azienda del 1° luglio.
Cloudflare distingue tra ricerca, agenti e addestramento
I controlli di Cloudflare suddividono il traffico automatizzato in tre categorie. I crawler dei motori di ricerca raccolgono o indicizzano materiale affinché un sistema possa rispondere alle domande in un secondo momento. I crawler degli agenti recuperano pagine in tempo reale per conto di un utente, inclusi gli strumenti di recupero basati su chat e i sistemi che utilizzano un browser. I crawler per l’addestramento raccolgono materiale per addestrare o sottoporre a fine-tuning un modello.
I clienti possono consentire o bloccare ciascuna categoria su un intero sito oppure bloccarla solo sulle pagine in cui Cloudflare rileva annunci pubblicitari. La documentazione dell’azienda afferma che le opzioni sono disponibili per tutti i clienti, compresi quelli del piano Free, e che ogni impostazione può essere applicata sia ai bot verificati sia ad altri bot non verificati che si comportano allo stesso modo.
Il 15 settembre Cloudflare eliminerà la vecchia impostazione «Block AI bots». Il controllo precedente bloccava i crawler verificati per l’addestramento, ma escludeva quelli che combinavano l’addestramento con la ricerca. La nuova policy considera insieme le diverse finalità di un crawler, per cui l’accesso è determinato dalla regola applicabile più restrittiva.
Le restrizioni più severe per i crawler a uso misto
La policy è particolarmente rilevante per i crawler che combinano ricerca e addestramento. Nel suo blog, Cloudflare cita Googlebot, Applebot e BingBot come esempi di crawler multifunzione che possono essere interessati quando un cliente sceglie di bloccare il traffico per l’addestramento. Sulle pagine con annunci pubblicitari, questi crawler potrebbero essere bloccati se il proprietario del sito ha scelto di limitare l’addestramento e non ha escluso il sito dalla nuova regola.
Cloudflare afferma che la modifica affronta una controversia che per gli editori è diventato sempre più difficile evitare: i siti vogliono comparire nei risultati dei motori di ricerca e nelle risposte dell’IA, ma non necessariamente vogliono che lo stesso accesso alimenti lo sviluppo dei modelli. L’azienda sostiene che i crawler a uso misto costringono gli editori ad accettare questo compromesso, perché non possono separare la visibilità dal riutilizzo dei contenuti.
Secondo la documentazione di Cloudflare, i clienti possono escludersi dalla nuova regola prima di modificare le proprie impostazioni. La scelta non è permanente: i proprietari dei siti possono configurare separatamente l’accesso per la ricerca, gli agenti e l’addestramento tramite le impostazioni di sicurezza nella dashboard.
La pubblicità diventa la linea di demarcazione di Cloudflare
Cloudflare considera la pubblicità un segnale del fatto che una pagina è destinata ad attirare un visitatore umano. Con le nuove impostazioni predefinite, i crawler per l’addestramento e gli agenti vengono bloccati su queste pagine, mentre la ricerca resta consentita perché, secondo Cloudflare, è più probabile che riporti i visitatori sul sito.
La regola non blocca ogni richiesta automatizzata. La tassonomia più ampia dei bot di Cloudflare comprende anche transazioni, raccolta di dati, test di sicurezza, ottimizzazione per i motori di ricerca, verifica degli annunci pubblicitari, anteprime sui social e recupero dei feed. Le impostazioni predefinite del 15 settembre riguardano le tre categorie legate all’IA che, secondo l’azienda, i proprietari dei siti vogliono gestire direttamente più spesso.
La distinzione lascia inoltre ai proprietari dei siti il compito di decidere se il traffico generato da un sistema di IA abbia un valore. Un crawler dei motori di ricerca può aiutare una pagina a comparire in una risposta o tra i risultati, mentre un crawler per l’addestramento può incorporare lo stesso materiale in un modello senza rimandare l’utente all’editore.
Cloudflare aggiunge strumenti di visibilità e pagamento
La modifica alle impostazioni predefinite arriva insieme a nuovi controlli pensati per mostrare ai clienti come i sistemi automatizzati utilizzano i loro contenuti. La directory BotBase di Cloudflare offre ai clienti di Enterprise Bot Management una panoramica consultabile dei bot e degli agenti verificati noti, comprese le relative classificazioni e gli identificativi usati per il rilevamento.
L’azienda sta inoltre sviluppando Attribution Business Insights, una dashboard progettata per mostrare come le aziende di IA utilizzano i contenuti dei siti e quanto traffico umano riportano. Cloudflare afferma che lo strumento è pensato per fornire agli editori più informazioni quando negoziano accordi di licenza o di accesso.
Cloudflare sta anche testando separatamente dei segnali che comunicano alle aziende di IA quando una pagina è cambiata e deve essere recuperata di nuovo. L’azienda afferma che, secondo i suoi dati, oltre la metà del traffico dei crawler per l’IA viene impiegata per recuperare pagine invariate, ma descrive la riduzione dei recuperi ripetuti come un test e non come un risultato già conseguito.
Il precedente programma Pay Per Crawl viene inoltre ampliato con Pay Per Use, in base al quale gli editori verrebbero pagati quando i loro contenuti generano valore, anziché semplicemente quando un crawler li recupera. Cloudflare indica Ceramic.ai e You.com come partner dell’iniziativa, ma l’annuncio non fornisce una data generale di lancio né un calendario dei pagamenti.
Una policy pensata per il modo in cui sono progettati i crawler
La scadenza del 15 settembre fissata da Cloudflare è anche una richiesta alle aziende di IA di dichiarare cosa fanno i loro crawler. L’azienda afferma che gli operatori dovrebbero usare crawler distinti per le attività di ricerca, quelle degli agenti e quelle di addestramento, invece di presentare un unico bot con più finalità.
Questo requisito potrebbe rendere più semplici le decisioni degli editori sull’accesso, ma mette anche sotto pressione le aziende i cui sistemi usano un solo crawler per più servizi. Un bot che non distingue chiaramente la ricerca dall’addestramento potrebbe perdere l’accesso alle pagine con annunci pubblicitari, anche quando la sua attività di ricerca sarebbe altrimenti consentita.
Per i proprietari dei siti, il compito immediato è pratico: rivedere le nuove impostazioni, verificare se riguardano le pagine con annunci pubblicitari e decidere se mantenere l’accesso per i crawler a uso misto. Per i clienti che non modificano i controlli, ora è Cloudflare a fare questa scelta: la ricerca è consentita, mentre il traffico per l’addestramento e quello degli agenti vengono bloccati sulle pagine con annunci pubblicitari.