Skip to main content

Last updated

AI-crawlers: wie je site ophaalt en wat elk token regelt

Elke AI-machine die vragen over jouw markt beantwoordt, haalt webcontent op, en elke leverancier publiceert user-agent-tokens die je in robots.txt kunt toestaan of blokkeren. De tokens zijn niet uitwisselbaar. Sommige voeden modeltraining, sommige voeden de zoekindex waaruit een machine citeert, en sommige halen een pagina live op omdat een gebruiker er net naar vroeg. Blokkeer je de verkeerde, dan geef je zichtbaarheid op zonder iets te beschermen.

Drie soorten fetchers

De documentatie van de leveranciers valt netjes uiteen in drie rollen. Trainingscrawlers verzamelen content die gebruikt kan worden om toekomstige foundation models te trainen. Zoekcrawlers bouwen de retrieval-index die een machine gebruikt om zijn antwoorden te gronden en te citeren. Door gebruikers getriggerde fetchers bezoeken een pagina op het moment dat de vraag van een gebruiker dat vereist. Alleen de eerste rol raakt training. Alleen de andere twee bepalen of je in antwoorden kunt verschijnen.

OpenAI: GPTBot, OAI-SearchBot en ChatGPT-User

OpenAI documenteert zijn bots precies langs deze lijnen. GPTBot crawlt content om generatieve AI-foundationmodellen te trainen, en hem disallowen geeft aan dat je content niet in die training gebruikt moet worden. OAI-SearchBot wordt gebruikt om websites te tonen in de zoekfuncties van ChatGPT, en OpenAI stelt dat sites die zich daarvoor afmelden niet worden getoond in ChatGPT-zoekantwoorden. ChatGPT-User haalt pagina's op voor gebruikersacties in ChatGPT en Custom GPTs; omdat die door gebruikers worden gestart, merkt OpenAI op dat robots.txt-regels mogelijk niet van toepassing zijn, en deze agent bepaalt niet of je in de zoekresultaten wordt opgenomen. Het praktische punt: GPTBot blokkeren haalt je niet uit ChatGPT-zoekresultaten. OAI-SearchBot blokkeren wel.

Anthropic: ClaudeBot, Claude-SearchBot en Claude-User

Anthropic documenteert drie agents met dezelfde taakverdeling. ClaudeBot verzamelt webcontent die kan bijdragen aan modeltraining, en hem disallowen geeft het signaal dat je toekomstige materiaal uit trainingsdatasets moet blijven. Claude-SearchBot analyseert content om de relevantie en juistheid van zoekantwoorden te verbeteren; hem blokkeren kan je zichtbaarheid in die resultaten verkleinen. Claude-User haalt pagina's op wanneer mensen Claude vragen stellen, en hem blokkeren voorkomt dat je content wordt opgehaald voor de zoekopdracht van een gebruiker.

Perplexity: PerplexityBot en Perplexity-User

De crawlerdocumentatie van Perplexity stelt dat PerplexityBot bestaat om websites te tonen en te linken in de zoekresultaten van Perplexity en niet wordt gebruikt om content te crawlen voor AI-foundationmodellen. Hem blokkeren voorkomt dus niets aan de trainingskant; het kost je alleen aanwezigheid in de resultaten van Perplexity. Perplexity-User ondersteunt gebruikersacties en negeert robots.txt-regels doorgaans, omdat een gebruiker om de fetch heeft gevraagd. Ook die wordt niet gebruikt voor training.

Google: Googlebot en Google-Extended

Google-Extended is het meest verkeerd gelezen token in deze lijst. Volgens de crawlerdocumentatie van Google is het helemaal geen aparte crawler: het crawlen gebeurt onder bestaande Google-user-agents, en Google-Extended is een robots.txt-token dat als bedieningsknop dient. Het bepaalt of gecrawlde content gebruikt mag worden voor het trainen van toekomstige Gemini-modellen en voor grounding in Gemini Apps en Grounding with Google Search op Vertex AI. Google stelt expliciet dat het geen invloed heeft op de opname van een site in Google Search en geen rankingsignaal is. AI-functies binnen Search vallen onder de gewone Search-instellingen die voor Googlebot gelden, niet onder Google-Extended. Google-Extended blokkeren houdt je content buiten Gemini-training. Googlebot blokkeren haalt je uit Search en alles wat daarop gebouwd is.

De afweging, token voor token

TokenBlokkeren stoptBlokkeren kost je
GPTBotGebruik van je content in OpenAI-modeltrainingGeen gedocumenteerd effect op ChatGPT-zoeken
OAI-SearchBotOpname in ChatGPT-zoekenGetoond worden in ChatGPT-zoekantwoorden
ChatGPT-UserWeinig; robots.txt geldt mogelijk niet voor gebruikersactiesDoor gebruikers gestarte fetches van je pagina's
ClaudeBotGebruik van je content in Anthropic-modeltrainingNiets gedocumenteerds aan de zoekkant
Claude-SearchBotIndexering voor de zoekantwoorden van ClaudeZichtbaarheid in die antwoorden
Claude-UserOphalen voor individuele gebruikersvragenZichtbaarheid in door gebruikers gestuurd webzoeken
PerplexityBotNiets op trainingsgebied; het is een zoekbotVerschijnen in Perplexity-resultaten
Google-ExtendedGemini-training en de genoemde grounding-toepassingenNiets in Google Search, aldus Google
GooglebotGoogle Search zelfZoekzichtbaarheid en de AI-functies die daarop gebouwd zijn

De heldere manier om te beslissen: trainingstokens zijn een beleidskeuze die je beide kanten op kunt maken, terwijl zoek- en gebruikerstokens een omzetkeuze zijn, want een machine die je niet kan ophalen, kan je niet citeren. Controleren of de retrieval-crawlers je pagina's daadwerkelijk kunnen bereiken hoort bij technische SEO, en wat ze met je content doen zodra ze die hebben, komt aan bod in wat is GEO.

Zet het op de automatische piloot

Vupie past alles uit deze gids toe, acht premium artikelen per maand.

Doe mee aan de beta