Vai al contenuto
AI.info

The Pulse

Cloudflare separa il rifiuto dell’addestramento dell’IA dalla ricerca

Il 15 settembre 2026 Cloudflare ha introdotto l’impostazione Disallow AI Training, che consente ai proprietari di siti web di rifiutare l’addestramento dei modelli mantenendo disponibili per la ricerca i crawler responsabili. La policy appl

Cloudflare separa il rifiuto dell’addestramento dell’IA dalla ricerca

AI.info Team ·

Cloudflare ora permette ai proprietari di siti web di rifiutare l’addestramento dei modelli di IA senza rinunciare automaticamente alla visibilità nei motori di ricerca tradizionali, distinguendo due tipi di accesso automatizzato che spesso arrivano tramite lo stesso crawler.

L’azienda ha annunciato la modifica il 15 settembre 2026, introducendo una nuova impostazione Disallow AI Training. Cloudflare afferma che il controllo mantiene disponibili per la ricerca i crawler responsabili a uso misto, bloccando invece i crawler di addestramento che non offrono una modalità separata di opt-out.

La modifica affronta un problema pratico per editori e altri proprietari di siti: un singolo bot può raccogliere pagine sia per un indice di ricerca sia per lo sviluppo di modelli di IA. Bloccare quel bot può escludere un sito dai risultati di ricerca proprio mentre ne impedisce l’uso dei contenuti per l’addestramento.

Cloudflare introduce un controllo separato per l’addestramento

Cloudflare ora classifica il traffico automatizzato in tre categorie: Ricerca, Addestramento e Agenti. I crawler di ricerca creano un indice, quelli di addestramento raccolgono materiale per addestrare o sottoporre a fine-tuning i modelli, mentre i crawler degli agenti recuperano pagine per conto di una persona, come nel caso di un sistema che recupera contenuti per una chat o utilizza un browser.

Un crawler a uso misto svolge sia attività di ricerca sia di addestramento con un’unica identità. La nuova impostazione di Cloudflare pubblica una preferenza di non addestramento tramite robots.txt. Dopo aver ricevuto tale preferenza, i crawler responsabili a uso misto possono continuare ad accedere a un sito per la ricerca, mentre gli altri crawler di addestramento vengono bloccati.

L’azienda definisce responsabile un operatore che offre, o si è impegnato a offrire entro una scadenza, un’opzione di opt-out dall’addestramento dell’IA, un modo per rifiutare i riepiloghi generati dall’IA, visibilità a livello di URL sulle pagine messe a disposizione per l’addestramento e la garanzia che l’opt-out dall’addestramento non influisca sui risultati di ricerca tradizionali.

Applebot, Bingbot e Googlebot ricevono un trattamento diverso

Cloudflare classifica Applebot, Bingbot e Googlebot come responsabili. Con l’impostazione Disallow AI Training, questi crawler possono continuare a raccogliere pagine per la ricerca. Selezionando l’impostazione più restrittiva, Block, vengono invece fermati del tutto, comprese le loro attività di ricerca.

Cloudflare include nella categoria dei responsabili anche i crawler pertinenti di Amazon, Anthropic, Meta e OpenAI, ma afferma che queste aziende tengono separati i crawler di ricerca da quelli di addestramento. Cloudflare può così bloccare i crawler destinati solo all’addestramento senza compromettere l’accesso per la ricerca.

Google supporta già una regola Google-Extended in robots.txt e mette a disposizione controlli nei suoi strumenti per webmaster per escludere i contenuti dai risultati della ricerca generativa. Cloudflare afferma che Google ha dichiarato che rinunciare tramite Google-Extended non influisce sul posizionamento nei risultati di ricerca.

Apple supporta una regola analoga, Applebot-Extended, e ha dichiarato a sua volta che l’opt-out dall’addestramento non influisce sul posizionamento nei risultati di ricerca. Apple non ha ancora fornito a Cloudflare uno strumento per l’ispezione a livello di URL, anche se, secondo Cloudflare, l’azienda ha condiviso i dettagli di una soluzione in fase di sviluppo, prevista per il 2027.

La posizione di Microsoft è meno definita. Bing supporta attualmente le preferenze sull’addestramento tramite il tag meta NOARCHIVE e offre controlli attraverso Bing Webmaster Tools. Microsoft sta lavorando al supporto di una preferenza di non addestramento a livello di dominio in robots.txt, previsto per l’inizio del 2027. Fino all’introduzione di tale supporto, Cloudflare afferma che l’impostazione Disallow AI Training non trasmetterà automaticamente a Bingbot una preferenza di non addestramento.

Ora “Block” comprende anche i crawler a uso misto

I controlli Block e Block on pages with ads già esistenti di Cloudflare si applicano ora ai crawler a uso misto oltre che a quelli destinati solo all’addestramento. Ciò significa che un proprietario di un sito che seleziona Block può impedire ad Applebot, Bingbot e Googlebot di raggiungere il sito, rinunciando all’accesso dalla ricerca oltre che a quello per l’addestramento.

L’azienda sta dismettendo la precedente impostazione Block AI Bots a favore di controlli separati per Ricerca, Addestramento e Agenti. Anche Managed Robots.txt viene sostituito da Bot Preference Sync, che pubblica le preferenze pertinenti nel file robots di un sito.

Cloudflare afferma che le configurazioni esistenti verranno in genere trasferite automaticamente. Una precedente selezione di Block AI Bots corrisponde a Allow per la Ricerca, Disallow AI Training per l’Addestramento e Block on pages with ads per il traffico degli Agenti. I clienti che non avevano mai configurato i controlli precedenti riceveranno impostazioni equivalenti in base alle loro scelte passate.

I nuovi domini ricevono impostazioni predefinite basate sulla pubblicità

Le impostazioni consigliate da Cloudflare per i nuovi domini variano a seconda che il sito ricavi o meno entrate dalla pubblicità. La Ricerca rimane consentita in entrambe le configurazioni.

Per i siti senza pubblicità, la configurazione consigliata consente il traffico di Ricerca, Addestramento e Agenti. Per i siti finanziati dalla pubblicità, Cloudflare consiglia Disallow AI Training per il traffico di Addestramento e Block on pages with ads per quello degli Agenti. L’azienda motiva questa scelta spiegando che l’addestramento sostituisce la visita di una persona con una risposta, mentre un agente recupera una pagina senza che ci sia una persona a vedere la pubblicità.

I clienti possono modificare le impostazioni durante la configurazione iniziale o in seguito dalla dashboard di Cloudflare. L’azienda afferma che i controlli si applicano a livello di dominio, non ai singoli URL.

I limiti ancora presenti di Robots.txt

Cloudflare riconosce che un file robots da solo non può identificare chi sta effettuando il crawling, spiegare perché un crawler sta raccogliendo una pagina o fermare un operatore che ignora l’istruzione. I controlli di rete dell’azienda aggiungono l’identificazione dei crawler, la classificazione del comportamento, l’applicazione delle regole e la reportistica tramite Cloudflare Radar.

La nuova impostazione, inoltre, non crea un’opzione di opt-out equivalente per gli agenti. Cloudflare afferma che gli agenti non generano lo stesso conflitto con la reperibilità nei risultati di ricerca dei crawler a uso misto e che sul web non esiste una direttiva ampiamente adottata per esprimere una preferenza di non accesso da parte degli agenti. L’azienda afferma che potrebbe rivedere la decisione man mano che prosegue il lavoro sugli standard.

La policy di Cloudflare offre ai proprietari di siti una scelta più chiara per il conflitto specifico che ha motivato l’annuncio: mantenere l’accesso alla ricerca per i crawler responsabili a uso misto rifiutando l’addestramento dell’IA, oppure usare Block e rimuovere entrambe le forme di accesso. Per Bing, tuttavia, la separazione non è ancora pienamente operativa: il supporto di Microsoft a robots.txt a livello di dominio è ancora previsto per l’inizio del 2027.

Fonte

Esplora

Altri articoli