Skip to main content

AI-crawlers: vem hämtar din sajt och vad varje token styr

Varje AI-motor som besvarar frågor om din marknad hämtar webbinnehåll, och varje leverantör publicerar user agent-tokens som du kan tillåta eller blockera i robots.txt. De här tokens är inte utbytbara. Vissa matar modellträning, vissa matar sökindexet en motor citerar från, och vissa hämtar en sida live för att en användare just frågade om den. Blockera fel token och du ger upp synlighet utan att skydda något.

Tre sorters hämtare

Leverantörernas dokumentation delar sig prydligt i tre roller. Träningscrawlers samlar innehåll som kan användas för att träna framtida grundmodeller. Sökcrawlers bygger det hämtningsindex en motor använder för att grunda och citera sina svar. Användarutlösta hämtare besöker en sida i det ögonblick en användares fråga kräver det. Bara den första rollen rör träning. Bara de andra två avgör om du kan synas i svar.

OpenAI: GPTBot, OAI-SearchBot och ChatGPT-User

OpenAI dokumenterar sina bots längs exakt de linjerna. GPTBot crawlar innehåll för träning av generativa AI-grundmodeller, och att blockera den anger att ditt innehåll inte ska användas i den träningen. OAI-SearchBot används för att lyfta fram webbplatser i ChatGPTs sökfunktioner, och OpenAI uppger att sajter som valt bort den inte kommer att visas i ChatGPTs söksvar. ChatGPT-User utför hämtningar för användaråtgärder i ChatGPT och Custom GPTs; eftersom dessa är användarinitierade noterar OpenAI att robots.txt-regler kanske inte gäller, och den här agenten avgör inte inkludering i sök. Den praktiska poängen: att blockera GPTBot tar dig inte bort från ChatGPTs sök. Att blockera OAI-SearchBot gör det.

Anthropic: ClaudeBot, Claude-SearchBot och Claude-User

Anthropic dokumenterar tre agenter med samma arbetsfördelning. ClaudeBot samlar webbinnehåll som kan bidra till modellträning, och att blockera den signalerar att ditt framtida material ska undantas från träningsdata. Claude-SearchBot analyserar innehåll för att förbättra söksvarens relevans och korrekthet; att blockera den kan minska din synlighet i de resultaten. Claude-User hämtar sidor när enskilda personer ställer frågor till Claude, och att blockera den hindrar ditt innehåll från att hämtas för en användares fråga.

Perplexity: PerplexityBot och Perplexity-User

Perplexitys crawlerdokumentation anger att PerplexityBot finns för att lyfta fram och länka webbplatser i Perplexitys sökresultat och inte används för att crawla innehåll till AI-grundmodeller. Att blockera den skyddar därför ingenting på träningssidan; det kostar dig bara närvaro i Perplexitys resultat. Perplexity-User stödjer användaråtgärder och ignorerar i regel robots.txt-regler eftersom en användare begärde hämtningen. Den används inte heller för träning.

Google: Googlebot och Google-Extended

Google-Extended är den mest missförstådda token på den här listan. Enligt Googles crawlerdokumentation är den inte en separat crawler alls: crawlingen sker under befintliga Google-user agents, och Google-Extended är en robots.txt-token som används i styrande syfte. Den styr om crawlat innehåll får användas för träning av framtida Gemini-modeller och för grounding i Gemini Apps och Grounding with Google Search på Vertex AI. Google anger uttryckligen att den inte påverkar en sajts inkludering i Google Search och inte är en rankningssignal. AI-funktioner inne i Search styrs av de vanliga Search-kontrollerna som gäller Googlebot, inte av Google-Extended. Att blockera Google-Extended håller ditt innehåll utanför Gemini-träning. Att blockera Googlebot tar bort dig från Search och allt som är byggt ovanpå.

Avvägningen, token för token

TokenAtt blockera den stopparAtt blockera den kostar dig
GPTBotAnvändning av ditt innehåll i OpenAIs modellträningIngen dokumenterad effekt på ChatGPTs sök
OAI-SearchBotInkludering i ChatGPTs sökAtt visas i ChatGPTs söksvar
ChatGPT-UserLite; robots.txt kanske inte gäller användaråtgärderAnvändarinitierade hämtningar av dina sidor
ClaudeBotAnvändning av ditt innehåll i Anthropics modellträningInget dokumenterat på söksidan
Claude-SearchBotIndexering för Claudes söksvarSynlighet i de svaren
Claude-UserHämtning för enskilda användares frågorSynlighet i användarstyrd webbsökning
PerplexityBotInget på träningssidan; det är en sökbotAtt synas i Perplexitys resultat
Google-ExtendedGemini-träning och de listade grounding-användningarnaInget i Google Search, enligt Google
GooglebotGoogle Search självtSöksynlighet och AI-funktionerna byggda ovanpå

Det rena sättet att besluta: träningstokens är ett policyval du kan göra åt vilket håll som helst, medan sök- och användartokens är ett intäktsval, eftersom en motor som inte kan hämta dig inte kan citera dig. Att verifiera att hämtningscrawlarna faktiskt når dina sidor hör hemma i teknisk SEO, och vad de gör med ditt innehåll när de väl har det täcks i vad är GEO.