llms.txt : la proposition, la promesse et la réalité mesurée
llms.txt est une convention proposée : un fichier markdown servi à /llms.txt qui donne aux modèles de langage une carte sélective du contenu le plus utile d'un site. Ce n'est pas une norme, et aucun moteur majeur ne l'a adoptée. Cela n'a pas empêché une petite industrie de vendre la génération de llms.txt comme un levier de visibilité IA, alors cette page confronte l'affirmation à la proposition elle-même, à la documentation des éditeurs et aux journaux de serveur.
D'où vient la proposition
La proposition a été publiée par Jeremy Howard en septembre 2024 sur llmstxt.org. Son raisonnement est pratique. Les fenêtres de contexte des modèles de langage sont petites par rapport à un site web entier, et les pages HTML transportent navigation, scripts et balisage qui gaspillent cet espace. Un index markdown sélectif permettrait à un modèle ou à un agent de trouver directement la matière substantielle.
La spécification est courte. Elle demande un fichier markdown à la racine avec un H1 nommant le site, seul élément obligatoire, suivi d'un résumé en citation, de sections de texte optionnelles, et de listes de liens délimitées par des H2 avec de courtes notes. Une section intitulée « Optional » marque les liens que l'on peut sauter quand le contexte est serré. La proposition recommande aussi de servir des copies markdown propres des pages importantes à la même URL avec .md ajouté. Rien de tout cela n'est difficile à produire, et rien de tout cela n'est le problème. Le problème est du côté de la consommation.
Qui dit s'en servir
Aucun moteur majeur ne documente le fait d'honorer llms.txt pour la récupération. Google indique directement dans ses recommandations sur les fonctionnalités IA que llms.txt est ignoré par Google Search ; le reste de ce document est déroulé dans ce que Google dit réellement sur l'optimisation pour la recherche IA.
OpenAI, Anthropic et Perplexity publient chacun une documentation détaillée pour leurs crawlers, traitée jeton par jeton dans crawlers IA et ce que contrôle chaque jeton. Aucune de ces documentations ne mentionne llms.txt. Il n'existe aucune déclaration d'un de ces éditeurs engageant un système de réponse en production à lire le fichier. Le soutien n'est ni mitigé ni émergent. À l'heure où ces lignes sont écrites, il est absent.
Ce que montrent les journaux
La documentation peut être en retard sur la pratique, donc la preuve la plus forte, ce sont les journaux de serveur. Si les moteurs utilisaient le fichier, ils le récupéreraient. Deux mesures disent qu'ils ne le font pas.
Une expérience de 90 jours sur les journaux de crawlers a enregistré 62 100 requêtes de bots IA. Parmi elles, 84 ont récupéré le fichier llms.txt, soit environ 0,1 pour cent.
Une étude de 137 000 sites a mesuré une fenêtre d'un mois et a constaté que 28 pour cent des domaines publiaient un fichier llms.txt valide, et que 97 pour cent de ces fichiers n'avaient jamais été récupérés par quoi que ce soit, crawler IA ou autre. Les mêmes données montrent l'autre face de la médaille : sur les domaines sans le fichier, les bots IA n'ont fait aucune requête pour l'obtenir. Ils ne vont pas le chercher.
Un fichier qui n'est pas récupéré ne peut pas influencer ce qu'un moteur dit de vous. Quoi que llms.txt puisse devenir, l'affirmation selon laquelle il améliore la visibilité IA aujourd'hui n'a aucun appui mesuré.
llms.txt n'est pas robots.txt
Les deux fichiers sont souvent regroupés dans les mêmes conseils, alors qu'ils font des travaux différents. robots.txt est une convention de contrôle d'accès : les éditeurs IA documentent leurs jetons user agent pour lui, le demandent systématiquement et précisent ce que régit chaque jeton. llms.txt est une proposition de découverte de contenu que ces mêmes éditeurs n'ont pas adoptée. Rien de ce qui est écrit dans un fichier llms.txt n'accorde, ne restreint ni ne signale quoi que ce soit au sujet de l'accès. Les décisions sur les systèmes IA autorisés à récupérer votre site se prennent dans robots.txt, jeton par jeton, comme traité dans crawlers IA. Confondre les deux fichiers mène à de mauvaises décisions dans les deux sens.
Une position raisonnable
Publier un fichier llms.txt coûte quelques minutes et rien ensuite. Google dit que le fichier n'aide ni ne nuit. Si l'adoption arrive un jour, un fichier publié est déjà en place, et vos propres journaux de serveur montreront le jour où les taux de récupération changent. Sur cette base, en avoir un est une couverture inoffensive.
Le payer est une autre affaire. Un fichier que les moteurs ne lisent pas ne peut pas être une optimisation, et l'argent dépensé à générer, auditer ou surveiller llms.txt est de l'argent non dépensé dans le travail sans gloire dont l'utilité est documentée : des pages indexables, du contenu qui répond, des affirmations vérifiables. Vupie génère un llms.txt pour son propre site et pour les sites de ses clients et n'en revendique rien, ce qui est la position que les preuves soutiennent.