llms.txt: het voorstel, de belofte en de gemeten werkelijkheid
llms.txt is een voorgestelde conventie: een markdownbestand op /llms.txt dat taalmodellen een gecureerde kaart geeft van de nuttigste content van een site. Het is geen standaard, en geen enkele grote machine heeft het overgenomen. Dat heeft een kleine industrie er niet van weerhouden om het genereren van llms.txt te verkopen als hefboom voor AI-zichtbaarheid, dus deze pagina toetst die claim aan het voorstel zelf, aan de documentatie van de leveranciers en aan de serverlogs.
Waar het voorstel vandaan komt
Het voorstel werd in september 2024 gepubliceerd door Jeremy Howard op llmstxt.org. De redenering is praktisch. De contextvensters van taalmodellen zijn klein ten opzichte van een hele website, en HTML-pagina's dragen navigatie, scripts en markup met zich mee die die ruimte verspillen. Een gecureerde markdown-index zou een model of een agent het inhoudelijke materiaal direct laten vinden.
De specificatie is kort. Ze vraagt om een markdownbestand op het rootpad met een H1 die de site benoemt, het enige verplichte element, gevolgd door een blockquote-samenvatting, optionele tekstsecties en met H2 afgebakende lijsten met links en korte notities. Een sectie met de titel "Optional" markeert links die je kunt overslaan als de context krap is. Het voorstel raadt ook aan om schone markdownkopieën van belangrijke pagina's aan te bieden op dezelfde URL met .md erachter. Niets daarvan is moeilijk te produceren, en niets daarvan is het probleem. Het probleem zit aan de consumptiekant.
Wie zegt het te gebruiken
Geen enkele grote machine documenteert dat het llms.txt voor retrieval honoreert. Google stelt in zijn richtlijnen over AI-functies rechtstreeks dat llms.txt door Google Search wordt genegeerd; de rest van dat document wordt doorgenomen in wat Google werkelijk zegt over optimalisatie voor AI-zoeken.
OpenAI, Anthropic en Perplexity publiceren elk gedetailleerde documentatie voor hun crawlers, token voor token behandeld in AI-crawlers en wat elk token regelt. In geen van die documentatie wordt llms.txt genoemd. Er is geen verklaring van een van deze leveranciers waarin een productiesysteem voor antwoorden zich vastlegt op het lezen van het bestand. Het verhaal over ondersteuning is niet gemengd of opkomend. Op het moment van schrijven is het afwezig.
Wat de logs laten zien
Documentatie kan achterlopen op de praktijk, dus het sterkere bewijs zijn serverlogs. Als machines het bestand gebruikten, zouden ze het ophalen. Twee metingen zeggen dat ze dat niet doen.
Een experiment van 90 dagen met crawlerlogs registreerde 62.100 verzoeken van AI-bots. Daarvan haalden er 84 het llms.txt-bestand op, ongeveer 0,1 procent.
Een onderzoek van 137.000 sites mat een venster van een maand en vond dat 28 procent van de domeinen een geldig llms.txt-bestand publiceerde, en dat 97 procent van die bestanden nooit door wat dan ook werd opgehaald, AI-crawler of anderszins. Dezelfde data toont de andere kant van de medaille: op domeinen zonder het bestand deden AI-bots er nul verzoeken naar. Ze gaan er niet naar zoeken.
Een bestand dat niet wordt opgehaald, kan niet beïnvloeden wat een machine over je zegt. Wat llms.txt ook mag worden, de claim dat het vandaag de AI-zichtbaarheid verbetert, heeft geen gemeten onderbouwing.
llms.txt is geen robots.txt
De twee bestanden worden vaak in hetzelfde advies gebundeld, en ze doen verschillend werk. robots.txt is een conventie voor toegangsbeheer: de AI-leveranciers documenteren hun user-agent-tokens ervoor, vragen het routinematig op en vermelden wat elk token regelt. llms.txt is een voorstel voor contentontdekking dat diezelfde leveranciers niet hebben overgenomen. Niets wat in een llms.txt-bestand staat, verleent, beperkt of signaleert iets over toegang. Beslissingen over welke AI-systemen je site mogen ophalen, worden genomen in robots.txt, token voor token, zoals behandeld in AI-crawlers. De twee bestanden door elkaar halen leidt in beide richtingen tot verkeerde beslissingen.
Een redelijk standpunt
Een llms.txt-bestand publiceren kost een paar minuten en daarna niets. Google zegt dat het bestand noch helpt noch schaadt. Mocht er ooit adoptie komen, dan staat een gepubliceerd bestand al klaar, en je eigen serverlogs laten de dag zien waarop de ophaalcijfers veranderen. Op die basis is zo'n bestand hebben een onschadelijke voorzorgsmaatregel.
Ervoor betalen is een ander verhaal. Een bestand dat machines niet lezen, kan geen optimalisatie zijn, en geld dat je uitgeeft aan het genereren, auditen of monitoren van llms.txt is geld dat je niet uitgeeft aan het ongeglamoureuze werk waarvan gedocumenteerd is dat het ertoe doet: indexeerbare pagina's, beantwoordbare content, verifieerbare beweringen. Vupie genereert een llms.txt voor zijn eigen site en voor klantsites en claimt er niets voor, wat het standpunt is dat het bewijs ondersteunt.