llms.txt: förslaget, löftet och den uppmätta verkligheten
llms.txt är en föreslagen konvention: en markdown-fil serverad på /llms.txt som ger språkmodeller en kuraterad karta över en sajts mest användbara innehåll. Det är inte en standard, och ingen större motor har antagit den. Det har inte hindrat en liten industri från att sälja llms.txt-generering som en hävstång för AI-synlighet, så den här sidan prövar påståendet mot själva förslaget, leverantörsdokumentationen och serverloggarna.
Var förslaget kommer ifrån
Förslaget publicerades av Jeremy Howard i september 2024 på llmstxt.org. Resonemanget är praktiskt. Språkmodellers kontextfönster är små i förhållande till en hel webbplats, och HTML-sidor bär navigation, script och markup som slösar det utrymmet. Ett kuraterat markdown-index skulle låta en modell eller en agent hitta det substantiella materialet direkt.
Specifikationen är kort. Den ber om en markdown-fil på rotsökvägen med en H1 som namnger sajten, det enda obligatoriska elementet, följd av en blockquote-sammanfattning, valfria prosasektioner och H2-avgränsade listor med länkar med korta noter. En sektion med titeln "Optional" markerar länkar som kan hoppas över när kontexten är knapp. Förslaget rekommenderar också att servera rena markdown-kopior av viktiga sidor på samma URL med .md tillagt. Inget av det här är svårt att producera, och inget av det är problemet. Problemet finns på konsumtionssidan.
Vilka som säger sig använda den
Ingen större motor dokumenterar att den respekterar llms.txt för hämtning. Google säger rakt ut i sin vägledning om AI-funktioner att llms.txt ignoreras av Google Search; resten av det dokumentet gås igenom i vad Google faktiskt säger om AI-sökoptimering.
OpenAI, Anthropic och Perplexity publicerar var för sig detaljerad dokumentation för sina crawlers, täckt token för token i AI-crawlers och vad varje token styr. Ingen av den dokumentationen nämner llms.txt. Det finns inget uttalande från någon av de här leverantörerna som förbinder ett produktionssvarssystem att läsa filen. Stödbilden är inte blandad eller framväxande. I skrivande stund är den frånvarande.
Vad loggarna visar
Dokumentation skulle kunna släpa efter praktiken, så det starkare beviset är serverloggar. Om motorerna använde filen skulle de hämta den. Två mätningar säger att de inte gör det.
Ett 90-dagars crawlerloggexperiment registrerade 62,100 AI-botförfrågningar. Av dem hämtade 84 llms.txt-filen, ungefär 0.1 procent.
En studie av 137,000 sajter mätte ett enmånadsfönster och fann att 28 procent av domänerna publicerade en giltig llms.txt-fil, och att 97 procent av de filerna aldrig hämtades av någonting, AI-crawler eller annat. Samma data visar myntets andra sida: på domäner utan filen gjorde AI-bots noll förfrågningar efter den. De letar inte.
En fil som inte hämtas kan inte påverka vad en motor säger om dig. Vad llms.txt än må bli har påståendet att den förbättrar AI-synlighet idag inget uppmätt stöd.
llms.txt är inte robots.txt
De två filerna buntas ofta ihop i samma råd, och de gör olika jobb. robots.txt är en konvention för åtkomstkontroll: AI-leverantörerna dokumenterar sina user agent-tokens för den, begär den rutinmässigt och anger vad varje token styr. llms.txt är ett innehållsupptäcktsförslag som samma leverantörer inte har antagit. Ingenting skrivet i en llms.txt-fil beviljar, begränsar eller signalerar något om åtkomst. Beslut om vilka AI-system som får hämta din sajt fattas i robots.txt, token för token, som täcks i AI-crawlers. Att blanda ihop de två filerna leder till fel beslut åt båda hållen.
En rimlig hållning
Att publicera en llms.txt-fil kostar några minuter och ingenting därefter. Google säger att filen varken hjälper eller skadar. Om antagande någonsin kommer ligger en publicerad fil redan på plats, och dina egna serverloggar visar den dag hämtningsfrekvensen ändras. På den grunden är det en harmlös gardering att ha en.
Att betala för en är en annan sak. En fil som motorerna inte läser kan inte vara en optimering, och pengar lagda på att generera, granska eller bevaka llms.txt är pengar som inte läggs på det oglamorösa arbete som är dokumenterat att spela roll: indexerbara sidor, svarbart innehåll, verifierbara påståenden. Vupie genererar en llms.txt för sin egen sajt och för kundsajter och påstår ingenting om den, vilket är den hållning bevisen stödjer.