Skip to main content

llms.txt: la propuesta, la promesa y la realidad medida

llms.txt es una convención propuesta: un archivo markdown servido en /llms.txt que da a los modelos de lenguaje un mapa curado del contenido más útil de un sitio. No es un estándar, y ningún motor importante lo ha adoptado. Eso no ha impedido que una pequeña industria venda la generación de llms.txt como palanca de visibilidad en IA, así que esta página contrasta la afirmación con la propia propuesta, la documentación de los proveedores y los logs de servidor.

De dónde viene la propuesta

La propuesta fue publicada por Jeremy Howard en septiembre de 2024 en llmstxt.org. Su razonamiento es práctico. Las ventanas de contexto de los modelos de lenguaje son pequeñas en relación con un sitio web completo, y las páginas HTML llevan navegación, scripts y marcado que desperdician ese espacio. Un índice markdown curado permitiría a un modelo o a un agente encontrar el material sustantivo directamente.

La especificación es corta. Pide un archivo markdown en la ruta raíz con un H1 que nombre el sitio, el único elemento obligatorio, seguido de un resumen en blockquote, secciones de prosa opcionales y listas de enlaces delimitadas por H2 con notas breves. Una sección titulada "Optional" marca los enlaces que pueden omitirse cuando el contexto es escaso. La propuesta también recomienda servir copias limpias en markdown de las páginas importantes en la misma URL con .md añadido. Nada de esto es difícil de producir, y nada de esto es el problema. El problema está en el lado del consumo.

Quién dice que lo usa

Ningún motor importante documenta que respete llms.txt para la recuperación. Google afirma directamente en su guía sobre funciones de IA que llms.txt es ignorado por la Búsqueda de Google; el resto de ese documento se recorre en qué dice Google realmente sobre la optimización para la búsqueda con IA.

OpenAI, Anthropic y Perplexity publican cada uno documentación detallada de sus rastreadores, cubierta token por token en rastreadores de IA y qué controla cada token. Nada de esa documentación menciona llms.txt. No hay ninguna declaración de ninguno de estos proveedores que comprometa a un sistema de respuestas en producción a leer el archivo. La historia del soporte no es mixta ni emergente. En el momento de escribir esto, es inexistente.

Lo que muestran los logs

La documentación podría ir por detrás de la práctica, así que la evidencia más fuerte son los logs de servidor. Si los motores usaran el archivo, lo solicitarían. Dos mediciones dicen que no lo hacen.

Un experimento de 90 días con logs de rastreadores registró 62,100 solicitudes de bots de IA. De ellas, 84 solicitaron el archivo llms.txt, alrededor del 0.1 por ciento.

Un estudio de 137,000 sitios midió una ventana de un mes y encontró que el 28 por ciento de los dominios publicaba un archivo llms.txt válido, y que el 97 por ciento de esos archivos nunca fue solicitado por nada, ni rastreador de IA ni otra cosa. Los mismos datos muestran la otra cara de la moneda: en los dominios sin el archivo, los bots de IA hicieron cero solicitudes de él. No van a buscarlo.

Un archivo que no se solicita no puede influir en lo que un motor dice sobre ti. Sea lo que sea en lo que llms.txt pueda convertirse, la afirmación de que mejora la visibilidad en IA hoy no tiene ningún respaldo medido.

llms.txt no es robots.txt

Los dos archivos suelen empaquetarse en el mismo consejo, y hacen trabajos distintos. robots.txt es una convención de control de acceso: los proveedores de IA documentan sus tokens de user agent para él, lo solicitan de forma rutinaria y declaran qué gobierna cada token. llms.txt es una propuesta de descubrimiento de contenido que esos mismos proveedores no han adoptado. Nada de lo escrito en un archivo llms.txt concede, restringe o señala nada sobre el acceso. Las decisiones sobre qué sistemas de IA pueden acceder a tu sitio se toman en robots.txt, token por token, como se cubre en rastreadores de IA. Confundir los dos archivos lleva a decisiones equivocadas en ambas direcciones.

Una posición razonable

Publicar un archivo llms.txt cuesta unos minutos y nada después. Google dice que el archivo ni ayuda ni perjudica. Si la adopción llega algún día, un archivo publicado ya está en su sitio, y tus propios logs de servidor mostrarán el día en que cambien las tasas de solicitud. Sobre esa base, tener uno es una cobertura inofensiva.

Pagar por uno es otra cuestión. Un archivo que los motores no leen no puede ser una optimización, y el dinero gastado en generar, auditar o monitorizar llms.txt es dinero que no se gasta en el trabajo sin glamur que sí está documentado que importa: páginas indexables, contenido que responde, afirmaciones verificables. Vupie genera un llms.txt para su propio sitio y para los sitios de sus clientes y no reclama nada por ello, que es la postura que la evidencia respalda.