AI-crawlers: wie je site ophaalt en wat elk token regelt
Elke AI-machine die vragen over jouw markt beantwoordt, haalt webcontent op, en elke leverancier publiceert user-agent-tokens die je in robots.txt kunt toestaan of blokkeren. De tokens zijn niet uitwisselbaar. Sommige voeden modeltraining, sommige voeden de zoekindex waaruit een machine citeert, en sommige halen een pagina live op omdat een gebruiker er net naar vroeg. Blokkeer je de verkeerde, dan geef je zichtbaarheid op zonder iets te beschermen.
Drie soorten fetchers
De documentatie van de leveranciers valt netjes uiteen in drie rollen. Trainingscrawlers verzamelen content die gebruikt kan worden om toekomstige foundation models te trainen. Zoekcrawlers bouwen de retrieval-index die een machine gebruikt om zijn antwoorden te gronden en te citeren. Door gebruikers getriggerde fetchers bezoeken een pagina op het moment dat de vraag van een gebruiker dat vereist. Alleen de eerste rol raakt training. Alleen de andere twee bepalen of je in antwoorden kunt verschijnen.
OpenAI: GPTBot, OAI-SearchBot en ChatGPT-User
OpenAI documenteert zijn bots precies langs deze lijnen. GPTBot crawlt content om generatieve AI-foundationmodellen te trainen, en hem disallowen geeft aan dat je content niet in die training gebruikt moet worden. OAI-SearchBot wordt gebruikt om websites te tonen in de zoekfuncties van ChatGPT, en OpenAI stelt dat sites die zich daarvoor afmelden niet worden getoond in ChatGPT-zoekantwoorden. ChatGPT-User haalt pagina's op voor gebruikersacties in ChatGPT en Custom GPTs; omdat die door gebruikers worden gestart, merkt OpenAI op dat robots.txt-regels mogelijk niet van toepassing zijn, en deze agent bepaalt niet of je in de zoekresultaten wordt opgenomen. Het praktische punt: GPTBot blokkeren haalt je niet uit ChatGPT-zoekresultaten. OAI-SearchBot blokkeren wel.
Anthropic: ClaudeBot, Claude-SearchBot en Claude-User
Anthropic documenteert drie agents met dezelfde taakverdeling. ClaudeBot verzamelt webcontent die kan bijdragen aan modeltraining, en hem disallowen geeft het signaal dat je toekomstige materiaal uit trainingsdatasets moet blijven. Claude-SearchBot analyseert content om de relevantie en juistheid van zoekantwoorden te verbeteren; hem blokkeren kan je zichtbaarheid in die resultaten verkleinen. Claude-User haalt pagina's op wanneer mensen Claude vragen stellen, en hem blokkeren voorkomt dat je content wordt opgehaald voor de zoekopdracht van een gebruiker.
Perplexity: PerplexityBot en Perplexity-User
De crawlerdocumentatie van Perplexity stelt dat PerplexityBot bestaat om websites te tonen en te linken in de zoekresultaten van Perplexity en niet wordt gebruikt om content te crawlen voor AI-foundationmodellen. Hem blokkeren voorkomt dus niets aan de trainingskant; het kost je alleen aanwezigheid in de resultaten van Perplexity. Perplexity-User ondersteunt gebruikersacties en negeert robots.txt-regels doorgaans, omdat een gebruiker om de fetch heeft gevraagd. Ook die wordt niet gebruikt voor training.
Google: Googlebot en Google-Extended
Google-Extended is het meest verkeerd gelezen token in deze lijst. Volgens de crawlerdocumentatie van Google is het helemaal geen aparte crawler: het crawlen gebeurt onder bestaande Google-user-agents, en Google-Extended is een robots.txt-token dat als bedieningsknop dient. Het bepaalt of gecrawlde content gebruikt mag worden voor het trainen van toekomstige Gemini-modellen en voor grounding in Gemini Apps en Grounding with Google Search op Vertex AI. Google stelt expliciet dat het geen invloed heeft op de opname van een site in Google Search en geen rankingsignaal is. AI-functies binnen Search vallen onder de gewone Search-instellingen die voor Googlebot gelden, niet onder Google-Extended. Google-Extended blokkeren houdt je content buiten Gemini-training. Googlebot blokkeren haalt je uit Search en alles wat daarop gebouwd is.
De afweging, token voor token
| Token | Blokkeren stopt | Blokkeren kost je |
|---|---|---|
| GPTBot | Gebruik van je content in OpenAI-modeltraining | Geen gedocumenteerd effect op ChatGPT-zoeken |
| OAI-SearchBot | Opname in ChatGPT-zoeken | Getoond worden in ChatGPT-zoekantwoorden |
| ChatGPT-User | Weinig; robots.txt geldt mogelijk niet voor gebruikersacties | Door gebruikers gestarte fetches van je pagina's |
| ClaudeBot | Gebruik van je content in Anthropic-modeltraining | Niets gedocumenteerds aan de zoekkant |
| Claude-SearchBot | Indexering voor de zoekantwoorden van Claude | Zichtbaarheid in die antwoorden |
| Claude-User | Ophalen voor individuele gebruikersvragen | Zichtbaarheid in door gebruikers gestuurd webzoeken |
| PerplexityBot | Niets op trainingsgebied; het is een zoekbot | Verschijnen in Perplexity-resultaten |
| Google-Extended | Gemini-training en de genoemde grounding-toepassingen | Niets in Google Search, aldus Google |
| Googlebot | Google Search zelf | Zoekzichtbaarheid en de AI-functies die daarop gebouwd zijn |
De heldere manier om te beslissen: trainingstokens zijn een beleidskeuze die je beide kanten op kunt maken, terwijl zoek- en gebruikerstokens een omzetkeuze zijn, want een machine die je niet kan ophalen, kan je niet citeren. Controleren of de retrieval-crawlers je pagina's daadwerkelijk kunnen bereiken hoort bij technische SEO, en wat ze met je content doen zodra ze die hebben, komt aan bod in wat is GEO.