llms.txt: a proposta, a promessa e a realidade medida
llms.txt é uma convenção proposta: um arquivo markdown servido em /llms.txt que dá aos modelos de linguagem um mapa curado do conteúdo mais útil de um site. Não é um padrão, e nenhum mecanismo importante o adotou. Isso não impediu uma pequena indústria de vender a geração de llms.txt como alavanca de visibilidade em IA, então esta página confere a alegação contra a própria proposta, a documentação dos fornecedores e os logs de servidor.
De onde vem a proposta
A proposta foi publicada por Jeremy Howard em setembro de 2024 em llmstxt.org. Seu raciocínio é prático. As janelas de contexto dos modelos de linguagem são pequenas em relação a um site inteiro, e páginas HTML carregam navegação, scripts e marcação que desperdiçam esse espaço. Um índice curado em markdown permitiria a um modelo ou a um agente encontrar o material substantivo diretamente.
A especificação é curta. Ela pede um arquivo markdown no caminho raiz com um H1 nomeando o site, o único elemento obrigatório, seguido de um resumo em blockquote, seções de prosa opcionais e listas de links delimitadas por H2 com notas curtas. Uma seção intitulada "Optional" marca links que podem ser pulados quando o contexto está apertado. A proposta também recomenda servir cópias limpas em markdown das páginas importantes na mesma URL com .md acrescentado. Nada disso é difícil de produzir, e nada disso é o problema. O problema está do lado do consumo.
Quem diz que o usa
Nenhum mecanismo importante documenta honrar llms.txt para recuperação. O Google afirma diretamente em sua orientação sobre recursos de IA que llms.txt é ignorado pela Busca do Google; o resto desse documento é percorrido em o que o Google realmente diz sobre otimização para busca com IA.
OpenAI, Anthropic e Perplexity publicam, cada uma, documentação detalhada para seus crawlers, coberta token por token em crawlers de IA e o que cada token controla. Nada dessa documentação menciona llms.txt. Não há declaração de nenhum desses fornecedores comprometendo um sistema de respostas em produção a ler o arquivo. A história do suporte não é mista nem emergente. No momento em que isto é escrito, ela é ausente.
O que os logs mostram
A documentação poderia estar atrasada em relação à prática, então a evidência mais forte são os logs de servidor. Se os mecanismos usassem o arquivo, eles o buscariam. Duas medições dizem que não buscam.
Um experimento de 90 dias com logs de crawler registrou 62.100 requisições de bots de IA. Dessas, 84 buscaram o arquivo llms.txt, cerca de 0,1 por cento.
Um estudo de 137.000 sites mediu uma janela de um mês e constatou que 28 por cento dos domínios publicavam um arquivo llms.txt válido, e que 97 por cento desses arquivos nunca foram buscados por coisa alguma, crawler de IA ou não. Os mesmos dados mostram o outro lado da moeda: em domínios sem o arquivo, os bots de IA fizeram zero requisições por ele. Eles não saem procurando.
Um arquivo que não é buscado não pode influenciar o que um mecanismo diz sobre você. Seja o que for que llms.txt venha a se tornar, a alegação de que ele melhora a visibilidade em IA hoje não tem suporte medido.
llms.txt não é robots.txt
Os dois arquivos costumam vir empacotados no mesmo conselho, e eles fazem trabalhos diferentes. robots.txt é uma convenção de controle de acesso: os fornecedores de IA documentam seus tokens de user agent para ele, o requisitam rotineiramente e declaram o que cada token governa. llms.txt é uma proposta de descoberta de conteúdo que esses mesmos fornecedores não adotaram. Nada escrito em um arquivo llms.txt concede, restringe ou sinaliza coisa alguma sobre acesso. Decisões sobre quais sistemas de IA podem buscar seu site são tomadas no robots.txt, token por token, como coberto em crawlers de IA. Confundir os dois arquivos leva a decisões erradas nas duas direções.
Uma posição razoável
Publicar um arquivo llms.txt custa alguns minutos e nada depois disso. O Google diz que o arquivo nem ajuda nem prejudica. Se a adoção um dia chegar, um arquivo publicado já está no lugar, e seus próprios logs de servidor mostrarão o dia em que as taxas de busca mudarem. Nessa base, ter um é uma proteção inofensiva.
Pagar por um é outra questão. Um arquivo que os mecanismos não leem não pode ser uma otimização, e dinheiro gasto gerando, auditando ou monitorando llms.txt é dinheiro não gasto no trabalho sem glamour que está documentado que importa: páginas indexáveis, conteúdo que responde, afirmações verificáveis. A Vupie gera um llms.txt para o próprio site e para os sites dos clientes e não alega nada por isso, que é a postura que a evidência sustenta.