llms.txt : contrôler ce que les IA lisent de votre site

Depuis deux ans, un petit fichier texte concentre une part démesurée des conversations GEO : llms.txt. La promesse est séduisante : poser à la racine de votre site une carte rédigée pour les machines, et reprendre la main sur ce que ChatGPT, Claude, Perplexity ou Gemini lisent (et citent) de vous. La réalité de 2026 est plus nuancée : l'adoption côté sites a explosé, le support côté moteurs reste marginal. Entre les deux, beaucoup de promesses commerciales et peu de logs serveurs.

Cet article fait le point terrain : ce que llms.txt est vraiment, ce que les crawlers IA en font (chiffres à l'appui), où se joue le vrai contrôle (robots.txt et l'arbitrage bloquer/nourrir) et pourquoi le fichier reste malgré tout un pari raisonnable, à condition de le prendre pour ce qu'il est.

Un fichier que les machines ne demandent pas n'est pas un canal de contrôle : c'est une intention. Le contrôle réel se joue là où les crawlers passent vraiment : robots.txt, accessibilité du contenu, autorité.

llms.txt : la proposition

L'idée vient de Jeremy Howard (Answer.AI), qui l'a formalisée en septembre 2024 : un fichier Markdown placé à la racine du site (/llms.txt), qui offre aux modèles de langage une version distillée de vos contenus essentiels. La logique est défendable : les fenêtres de contexte des LLM sont limitées, et vos pages HTML sont encombrées de navigation, de scripts et de bandeaux cookies. Plutôt que de laisser la machine trier, on lui tend une carte propre.

Le format est codifié : un titre H1 (le nom du site), un résumé en citation, puis des sections de liens annotés, chaque lien accompagné d'une ligne qui dit ce qu'on y trouve. Une variante, llms-full.txt, va plus loin en compilant le contenu intégral des pages clés dans un seul fichier. Des acteurs sérieux ont adopté le format (Anthropic, Stripe, Zapier, Cloudflare) et l'adoption a été multipliée par près de neuf en un an. Mais presque toujours sur un même profil de site : de la documentation technique, pensée pour être consommée par des outils.

Ce que les crawlers IA en font vraiment

C'est ici que le terrain contredit le marketing. Les analyses de logs serveurs convergent : environ 97 % des fichiers llms.txt en place ne reçoivent aucune requête de bot IA. Une étude portant sur plus de 500 millions de visites de crawlers IA sur 90 jours n'a relevé que quelques centaines d'accès directs au fichier : une goutte d'eau statistique.

Côté moteurs, les positions sont publiques. Google ne supporte pas llms.txt et ne prévoit pas de le faire. Gary Illyes l'a confirmé dès l'été 2025, et John Mueller a comparé le fichier à la balise meta keywords, abandonnée pour cause d'auto-déclaration invérifiable. OpenAI et Anthropic renvoient officiellement vers robots.txt pour gérer l'accès de leurs crawlers, sans engagement de lire llms.txt. Seul Perplexity déclare récupérer le fichier pour aider à prioriser ses lectures. Les consommateurs réels du format, aujourd'hui, sont ailleurs : les agents de code (Cursor, Cline et consorts) et les intégrations où un humain fournit explicitement l'URL du fichier à son outil.

Conclusion d'étape, mesurée mais ferme : en 2026, poser un llms.txt n'améliore pas mesurablement vos chances d'être cité par ChatGPT, Gemini ou Claude. Quiconque vous vend le contraire vend une superstition. Ce qui ne veut pas dire que le fichier est inutile. On y revient plus bas.

Le vrai poste de contrôle : robots.txt face aux crawlers IA

Pendant que llms.txt occupe les conversations, le contrôle réel s'exerce dans un fichier vieux de trente ans : robots.txt. Les crawlers IA légitimes le respectent, et c'est là que se joue la seule décision qui compte : qui a le droit de lire quoi. Encore faut-il distinguer deux familles de bots que tout oppose : les bots d'entraînement, qui collectent pour nourrir les futurs modèles, et les bots de réponse, qui indexent ou consultent vos pages pour répondre à un utilisateur, avec citation et lien à la clé.

User-agentCe qu'il faitSi vous le bloquez
GPTBotEntraînement des modèles OpenAIVos contenus sortent des futurs entraînements ; pas d'effet direct sur ChatGPT Search
OAI-SearchBotIndex de ChatGPT SearchVous disparaissez des résultats et citations de ChatGPT Search
ChatGPT-UserConsultation en direct à la demande d'un utilisateurChatGPT ne peut plus ouvrir vos pages en session
ClaudeBotCollecte Anthropic (entraînement)Même logique que GPTBot, côté Claude
PerplexityBotIndex de PerplexityVous sortez des réponses sourcées de Perplexity
Google-ExtendedGemini (entraînement et grounding)N'affecte ni votre SEO ni les AI Overviews
CCBotCommon Crawl (corpus publics)Vous sortez des corpus utilisés par de nombreux modèles
BytespiderCollecte ByteDancePeu de contrepartie visibilité ; souvent bloqué par défaut

Le piège classique de ce tableau : Google-Extended. Beaucoup le bloquent en croyant sortir des AI Overviews. C'est raté : les AI Overviews et le mode IA de Google s'appuient sur l'index Search classique, alimenté par Googlebot. Pour en disparaître, il faudrait bloquer Googlebot, donc sortir de Google tout court. Google-Extended ne gouverne que l'usage de vos contenus par Gemini.

Bloquer ou nourrir ? L'arbitrage stratégique

La bonne réponse dépend de votre modèle, pas de la mode. Un média ou un éditeur qui vit de la licence de ses contenus a un vrai calcul de protection à faire : ses archives sont son actif, et les accords de licence se négocient mieux quand l'accès n'est pas gratuit. Mais pour une PME de services, un e-commerçant, un cabinet (l'immense majorité de mes clients), le calcul s'inverse : être cité par les IA est un canal d'acquisition naissant, et les visites qui en proviennent arrivent pré-qualifiées par la réponse qui les a recommandées.

Ma position terrain, celle que j'applique dans mes missions GEO : ouvrir grand les bots de réponse (OAI-SearchBot, PerplexityBot, ChatGPT-User), et décider en conscience pour les bots d'entraînement selon la nature des contenus. Un blog de démonstration d'expertise a tout intérêt à nourrir les modèles, une base documentaire propriétaire peut-être pas. L'important est que ce soit une décision, datée et documentée, pas un réglage par défaut hérité d'un template.

Écrire un llms.txt malgré tout (et bien)

Alors, faut-il en poser un ? Oui, mais comme on achète un billet de loterie à prix coûtant. Le pari est asymétrique : une à deux heures de travail, zéro risque de pénalité, des consommateurs réels dès aujourd'hui (agents de code, outils d'analyse, intégrations), et une option gratuite sur un futur où un moteur majeur déciderait de le lire. Ce qui est déraisonnable, ce n'est pas le fichier ; c'est d'en attendre un effet de classement.

Les règles d'un fichier utile : un H1 avec le nom du site et une ligne de positionnement ; un résumé en citation ; trois à cinq sections (offre, guides, cas clients, contact) contenant chacune une poignée de liens annotés d'une ligne, pas un sitemap déguisé ; des URL canoniques ; une mise à jour à chaque publication importante. Gardez llms-full.txt pour les sites dont la documentation est le produit. Et n'y mettez ni catalogue exhaustif ni bourrage de mots-clés : le fichier s'adresse à des machines qui lisent bien, pas à un index qu'on manipule.

Ce qui fait vraiment lire (et citer) votre site par les IA

Si le levier n'est pas le fichier, où est-il ? D'abord dans l'accessibilité brute : la plupart des fetchers IA lisent le HTML sans exécuter JavaScript. Un contenu qui n'existe qu'après rendu client est invisible pour eux. Ensuite dans l'extractibilité : titres hiérarchisés, réponses directes en tête de section, listes et tableaux qu'un modèle peut citer sans reconstruction, les principes que je détaille dans mon guide complet du GEO. Puis dans les données structurées Schema.org, qui restent le canal de description machine le mieux supporté. Enfin dans l'autorité : les moteurs génératifs citent les sources que le web cite déjà, le pont entre netlinking et GEO que couvre mon accompagnement SEO.

Et comme toujours en GEO : mesurer avant d'agir. Savoir si ChatGPT, Perplexity ou les AI Overviews vous citent déjà (et sur quels prompts) est un préalable à toute politique de crawl. C'est exactement l'objet de mon audit GEO et du monitoring que j'ai décrit en détail ici.

L'erreur la plus coûteuse

La pensée magique, dans ses deux versions. Version crédule : poser un llms.txt généré par un plugin et considérer le chantier GEO réglé, pendant que le site reste illisible sans JavaScript et invisible dans les réponses. Version défensive : bloquer tous les bots IA par réflexe de protection, et constater six mois plus tard que les concurrents occupent seuls les réponses de ChatGPT et Perplexity sur vos requêtes métier. Dans les deux cas, le problème est le même : une décision par défaut là où il fallait une décision informée, bot par bot, contenu par contenu.

Au creuset : la carte n'est pas le territoire

Le plomb, ici, c'est le fichier posé par superstition, qu'aucune machine ne demande et que personne ne met à jour. L'or, c'est une politique de crawl choisie en conscience, un contenu que les fetchers lisent sans effort, et une autorité qui force la citation. llms.txt peut coiffer cet édifice (une carte propre, tendue à ceux qui voudront bien la prendre), mais il ne remplace aucune de ses fondations.

Si vous voulez savoir ce que les IA lisent (et surtout ce qu'elles citent) de votre site aujourd'hui, c'est précisément le premier livrable de mon expertise GEO : un état des lieux mesuré, puis une politique de crawl et de contenu qui transforme vos pages en sources que les moteurs génératifs recommandent.

Savoir ce que les IA citent de votre site

J'audite votre présence dans ChatGPT, Perplexity et les AI Overviews, je passe en revue votre politique de crawl (robots.txt, llms.txt) et je vous livre un plan d'action GEO priorisé.

Découvrir l'expertise GEO → WhatsApp →

Articles connexes

GEO

Monitorer ChatGPT, Perplexity et AI Overviews en 2026

Ressource
GEO

GEO : le guide complet 2026

Ressource
EXPERTISE

Offre : GEO, être cité par ChatGPT, Perplexity et Gemini

Ressource