Skip to main content

Last updated

Crawler AI: chi preleva il tuo sito e cosa controlla ogni token

Ogni motore AI che risponde a domande sul tuo mercato preleva contenuti dal web, e ogni fornitore pubblica token di user agent che puoi consentire o bloccare nel robots.txt. I token non sono intercambiabili. Alcuni alimentano l'addestramento dei modelli, altri alimentano l'indice di ricerca da cui un motore cita, altri ancora prelevano una pagina in tempo reale perché un utente ha appena fatto una domanda. Blocca quello sbagliato e rinunci a visibilità senza proteggere nulla.

Tre tipi di prelievo

La documentazione dei fornitori si divide nettamente in tre ruoli. I crawler di addestramento raccolgono contenuti che possono essere usati per addestrare i futuri modelli di base. I crawler di ricerca costruiscono l'indice di recupero che un motore usa per fondare e citare le sue risposte. I preleva-pagine attivati dall'utente visitano una pagina nel momento in cui la domanda di un utente lo richiede. Solo il primo ruolo tocca l'addestramento. Solo gli altri due decidono se puoi comparire nelle risposte.

OpenAI: GPTBot, OAI-SearchBot e ChatGPT-User

OpenAI documenta i suoi bot esattamente su queste linee. GPTBot scansiona contenuti per addestrare i modelli di base di AI generativa, e non consentirlo indica che i tuoi contenuti non dovrebbero essere usati in quell'addestramento. OAI-SearchBot serve a far comparire i siti nelle funzionalità di ricerca di ChatGPT, e OpenAI afferma che i siti che ne escono non saranno mostrati nelle risposte di ricerca di ChatGPT. ChatGPT-User esegue prelievi per le azioni degli utenti in ChatGPT e nelle Custom GPT; poiché sono avviati dall'utente, OpenAI segnala che le regole del robots.txt potrebbero non applicarsi, e questo agente non determina l'inclusione nella ricerca. Il punto pratico: bloccare GPTBot non ti toglie dalla ricerca di ChatGPT. Bloccare OAI-SearchBot sì.

Anthropic: ClaudeBot, Claude-SearchBot e Claude-User

Anthropic documenta tre agenti con la stessa divisione dei compiti. ClaudeBot raccoglie contenuti web che potrebbero contribuire all'addestramento dei modelli, e non consentirlo segnala che il tuo materiale futuro va escluso dai dataset di addestramento. Claude-SearchBot analizza i contenuti per migliorare la pertinenza e l'accuratezza delle risposte di ricerca; bloccarlo può ridurre la tua visibilità in quei risultati. Claude-User preleva le pagine quando le persone fanno domande a Claude, e bloccarlo impedisce che i tuoi contenuti vengano recuperati per la query di un utente.

Perplexity: PerplexityBot e Perplexity-User

La documentazione sui crawler di Perplexity afferma che PerplexityBot esiste per far comparire e linkare i siti nei risultati di ricerca di Perplexity e non viene usato per scansionare contenuti destinati ai modelli di base AI. Bloccarlo quindi non impedisce nulla sul fronte addestramento; ti costa solo la presenza nei risultati di Perplexity. Perplexity-User supporta le azioni degli utenti e in genere ignora le regole del robots.txt perché è stato un utente a richiedere il prelievo. Anch'esso non viene usato per l'addestramento.

Google: Googlebot e Google-Extended

Google-Extended è il token più frainteso di questo elenco. Secondo la documentazione di Google sui crawler, non è affatto un crawler separato: la scansione avviene sotto gli user agent Google esistenti, e Google-Extended è un token del robots.txt usato con funzione di controllo. Controlla se i contenuti scansionati possano essere usati per addestrare i futuri modelli Gemini e per il grounding nelle app Gemini e in Grounding with Google Search su Vertex AI. Google afferma esplicitamente che non incide sull'inclusione di un sito in Google Search e non è un fattore di ranking. Le funzionalità AI dentro Search sono governate dai normali controlli di Search che valgono per Googlebot, non da Google-Extended. Bloccare Google-Extended tiene i tuoi contenuti fuori dall'addestramento di Gemini. Bloccare Googlebot ti toglie da Search e da tutto ciò che ci è costruito sopra.

Il compromesso, token per token

TokenBloccarlo impedisceBloccarlo ti costa
GPTBotL'uso dei tuoi contenuti nell'addestramento dei modelli OpenAINessun effetto documentato sulla ricerca di ChatGPT
OAI-SearchBotL'inclusione nella ricerca di ChatGPTComparire nelle risposte di ricerca di ChatGPT
ChatGPT-UserPoco; il robots.txt può non applicarsi alle azioni degli utentiI prelievi delle tue pagine avviati dagli utenti
ClaudeBotL'uso dei tuoi contenuti nell'addestramento dei modelli AnthropicNulla di documentato sul fronte ricerca
Claude-SearchBotL'indicizzazione per le risposte di ricerca di ClaudeLa visibilità in quelle risposte
Claude-UserIl recupero per le query dei singoli utentiLa visibilità nella ricerca web guidata dall'utente
PerplexityBotNulla sull'addestramento; è un bot di ricercaComparire nei risultati di Perplexity
Google-ExtendedL'addestramento di Gemini e gli usi di grounding elencatiNulla in Google Search, secondo Google
GooglebotGoogle Search stessoLa visibilità nella ricerca e le funzionalità AI costruite su di essa

Il modo pulito di decidere: i token di addestramento sono una scelta di policy che puoi fare in entrambi i sensi, mentre i token di ricerca e utente sono una scelta di fatturato, perché un motore che non può recuperarti non può citarti. Verificare che i crawler di recupero riescano davvero a raggiungere le tue pagine è materia di SEO tecnica, e cosa fanno dei tuoi contenuti una volta che li hanno è trattato in cos'è la GEO.

Mettilo in pilota automatico

Vupie applica tutto quello che trovi in questa guida, otto articoli premium al mese.

Entra nella beta