Growth Marketing
Insight

GEO technique — llms.txt, balisage de schéma et robots d’exploration IA : les 3 piliers d’infrastructure d’un site lisible par l’IA

5 min de lecture
llms.txt, 스키마 마크업, AI 크롤러를 중심으로 Technical GEO 인프라를 설명하는 GEO 백서 글 썸네일

Cet article est le 9/20 de la série livre blanc GEO de Growth — chapitre 6, GEO technique. La table des matières complète et le PDF intégral sont disponibles sur la page du livre blanc.

Réponse directe : le GEO technique repose sur trois éléments : l’adoption de llms.txt, l’application généralisée du balisage de schéma, et l’autorisation stratégique des robots d’exploration IA. Selon la recherche HtmlRAG, les pages web qui préservent leur structure HTML affichent des performances RAG significativement meilleures que le texte brut — les fondations techniques du SEO traditionnel restent tout aussi valables pour la citation par l’IA. Sans cette base technique, même le meilleur contenu n’entre jamais dans le champ de vision de l’IA.

Pourquoi l’infrastructure technique doit venir en premier

De nombreux responsables marketing de marque demandent : « ne suffit-il pas d’améliorer d’abord le contenu ? » L’intuition est juste, mais l’ordre compte. Pour reprendre la métaphore de la stratégie GEO en 3 axes : sans route, même la meilleure voiture n’atteint jamais sa destination. Si un robot d’exploration IA ne peut pas lire correctement votre contenu lors de sa visite, toute la stratégie de contenu et tous les efforts de mentions externes qui suivent perdent une grande partie de leur effet.

La recherche OpenScholar d’Allen AI et de l’université de Washington (2024) le confirme. Même de grands modèles comme GPT-4o, lorsqu’ils génèrent des réponses à des questions scientifiques à partir de leurs seules connaissances internes sans sources structurées, présentaient un taux d’hallucination de 78 à 90 % dans leurs citations. À l’inverse, OpenScholar — qui recherche et référence de véritables sources via la génération augmentée par récupération (RAG) — a atteint un niveau de précision de citation comparable à celui d’un expert humain. Rendre votre contenu « structurellement lisible » par l’IA est une condition préalable à la citation.

La recherche de Pan et al. sur la feuille de route des graphes de connaissances (IEEE TKDE, 2024) conclut de même que les données structurées réduisent les hallucinations des LLM et renforcent la reconnaissance d’entités. Pour que l’IA reconnaisse l’information fournie par votre site comme une entité claire, cette information doit être structurée sous une forme lisible par une machine. C’est l’essence même de l’axe technique de la stratégie GEO : le GEO technique.

Passons en revue les trois piliers du GEO technique, un par un. La place de ce dispositif technique dans l’ensemble du livre blanc est visible sur la page du livre blanc GEO.

Diagramme de l'architecture du GEO technique, construite sur trois piliers d'infrastructure : llms.txt, balisage de schéma JSON-LD, et paramètres d'accès des robots IA
Le GEO technique est un système où llms.txt, le balisage de schéma et la stratégie des robots IA fonctionnent comme un seul et même dispositif.

llms.txt — un manuel pour l’IA, sur votre site

llms.txt est un fichier de description de site web standardisé pour les agents IA et les LLM, apparu au second semestre 2024. Si robots.txt est un fichier qui indique aux robots des moteurs de recherche « où ils ont le droit d’explorer », llms.txt est un fichier qui résume systématiquement pour l’IA « ce qu’est ce site, quelles informations il propose, et où se trouve le contenu essentiel ».

Graphique sombre résumant les rôles de llms.txt et llms-full.txt, leur apparition au second semestre 2024, et un taux d'adoption d'environ 10 % sur une analyse de près de 300 000 domaines
llms.txt est un guide résumé qui aide l’IA à saisir rapidement l’identité d’un site et son contenu essentiel.

Pourquoi est-ce important ? Un robot d’exploration IA ne lit pas les milliers de pages d’un site lors de sa visite. Dans une fenêtre de contexte limitée, il doit saisir rapidement l’information la plus essentielle. llms.txt joue exactement ce rôle de « guide résumé » — un peu comme remettre un livret de présentation de l’entreprise à un nouvel employé. L’adoption progresse vite : lorsque SE Ranking a analysé environ 300 000 domaines fin 2025, près de 10 % disposaient déjà d’un llms.txt, avec des entreprises technologiques comme Anthropic, Stripe et Cloudflare en tête de l’adoption.

llms.txt se décline généralement en deux versions. La version résumée (llms.txt) présente de façon concise l’identité du site, ses services essentiels et les liens vers son contenu principal. La version complète (llms-full.txt) est une édition élargie qui décrit en détail tous les services et tout le contenu. Les agents IA lisent en général d’abord la version résumée et ne consultent la version complète que lorsqu’ils ont besoin d’informations plus approfondies.

Voici un exemple de llms.txt pour une agence marketing B2B fictive.

# Growth Marketing Agency

> Growth Marketing Agency est une agence de marketing
> digital B2B basée à Séoul, en Corée du Sud, spécialisée
> dans le conseil en stratégie SEO/GEO et le marketing de contenu.

## Services principaux

- [Conseil GEO](/service/geo-consulting) : audit de visibilité en recherche IA et définition de stratégie
- [Marketing de contenu](/service/content-marketing) : conception et production de contenu expert B2B
- [SEO technique](/service/technical-seo) : optimisation de la structure du site et mise en place de schémas

## Contenu expert

- [Le guide complet du GEO](/geo-guide) : livre blanc complet sur la stratégie GEO (2026)
- [Blog d'insights marketing](/insight) : analyses sectorielles hebdomadaires et études de cas
- [Études de cas](/case) : résultats de campagnes clients et analyse du ROI

## Contact

- E-mail : contact@example.com
- Téléphone : +82-2-1234-5678

Voyons le rôle de chaque élément dans cet exemple. Le titre # en première ligne est le nom officiel de l’organisation ; c’est l’unité de base que l’IA utilise pour identifier l’entité. Le bloc de citation > résume l’identité de l’organisation en une à trois phrases et permet à l’IA de saisir immédiatement « ce qu’est ce site ». Les ## sections regroupent en catégories les services essentiels, le contenu et les coordonnées, et le format - [nom du lien](URL) : description permet à l’IA de comprendre en langage naturel l’objet de chaque page. llms.txt s’écrit en Markdown, car c’est le format que les modèles d’IA analysent le mieux.

Le balisage de schéma — structurer votre marque avec JSON-LD

Le balisage de schéma est une technique qui transforme l’information d’une page web en données structurées lisibles par une machine. Le format JSON-LD (JavaScript Object Notation for Linked Data) s’est notamment imposé comme la norme, recommandée à la fois par Google et par les principaux moteurs d’IA.

Schéma montrant comment les champs @type, name, description et sameAs d'une entrée JSON-LD Organization aident l'IA à comprendre une marque
Le schéma JSON-LD permet à l’IA de lire l’information de marque comme un fait structuré, et non comme quelque chose à déduire.

Pourquoi JSON-LD est-il devenu plus important à l’ère de l’IA ? Dans le SEO traditionnel, le balisage de schéma était considéré comme un simple « bonus pour obtenir des résultats enrichis ». Mais à l’ère de la recherche IA, son rôle a fondamentalement changé. Lorsque l’IA lit le texte d’une page web, elle doit déduire si « ce texte est un nom d’entreprise, une description de service, ou une adresse ». JSON-LD supprime entièrement cette étape de déduction — il indique explicitement « ceci est une Organization, son nom est X, et son adresse est Y ».

BrightEdge, qui a suivi pendant 16 mois les citations dans les AI Overviews (AIO), a constaté que plus de la moitié (environ 54 %) des pages citées en AIO se recoupent avec des pages déjà bien classées en recherche organique traditionnelle. Cela signifie que les fondations techniques du SEO traditionnel — données structurées, rapidité de chargement, optimisation mobile — restent tout aussi valables pour la citation par l’IA. L’approche du GEO technique ne consiste pas à abandonner vos actifs SEO existants, mais à y ajouter une couche adaptée à l’IA.

Voici un exemple de schéma Organization à appliquer sur le site d’une entreprise.

{
  "@context": "https://schema.org",
  "@type": "Organization",
  "name": "Growth Marketing Agency",
  "url": "https://www.example.com",
  "logo": "https://www.example.com/logo.png",
  "description": "Agence de marketing digital B2B spécialisée en GEO, SEO et marketing de contenu.",
  "foundingDate": "2018",
  "address": {
    "@type": "PostalAddress",
    "addressLocality": "Séoul",
    "addressCountry": "KR"
  },
  "sameAs": [
    "https://www.linkedin.com/company/example",
    "https://fr.wikipedia.org/wiki/Example"
  ]
}

Voyons le rôle de chaque champ pour l’IA. @type: Organization déclare à l’IA que cette donnée n’est pas un simple texte, mais une entité organisationnelle à part entière. name est le nom officiel de l’entité, et c’est le repère que l’IA utilise pour relier ce même nom trouvé dans d’autres sources à cette même entité. description permet à l’IA de comprendre « ce que fait réellement cette organisation », augmentant les chances qu’elle soit retenue comme source de réponse pour des questions connexes. sameAs est l’un des champs les plus importants : il relie cette entité à des sources externes faisant autorité, comme LinkedIn ou Wikipédia, ce qui constitue pour l’IA un signal de confiance lors de la vérification croisée : « cette organisation est aussi référencée sur Wikipédia, et possède une page LinkedIn officielle ».

Au-delà du schéma Organization, il est recommandé d’appliquer les schémas Article, FAQPage et HowTo aux pages de contenu, et les schémas Service et Product aux pages de services. Comme le démontre la recherche RAG fondée sur les graphes de connaissances évoquée dans notre article sur l’autorité d’entité, une représentation graphique et structurée des connaissances renforce considérablement la compréhension de l’IA. Le balisage de schéma en est la mise en œuvre pratique concrète.

Stratégie des robots IA — « autoriser » doit être le réglage par défaut

L’erreur la plus fréquente dans la stratégie des robots IA est le réflexe « on bloque d’abord, on verra ensuite ». C’est un vestige de la mentalité défensive de l’ère du SEO. À l’ère du GEO, « autoriser » doit être le réglage par défaut, et « bloquer » l’exception.

Matrice comparant les critères d'autorisation et de blocage des robots IA tels que GPTBot, OAI-SearchBot, PerplexityBot et ClaudeBot selon la zone de contenu à protéger
À l’ère du GEO, la politique par défaut consiste à laisser le contenu public ouvert et à ne bloquer que les zones qui ont réellement besoin d’être protégées.

La première étape consiste à comprendre les principaux robots IA et leur rôle. GPTBot est le robot d’OpenAI, utilisé pour collecter des données d’entraînement pour les modèles génératifs de la famille GPT (l’apparition dans les résultats de recherche de ChatGPT relève d’un robot distinct, OAI-SearchBot). ClaudeBot est le robot d’Anthropic, utilisé pour collecter des données publiques afin d’améliorer les modèles Claude, tandis que les citations de recherche relèvent de Claude-SearchBot. PerplexityBot est un robot destiné à faire apparaître et à créer des liens vers votre site dans les résultats de recherche de Perplexity ; il n’est pas utilisé pour l’entraînement des modèles. GoogleOther est un robot polyvalent utilisé par les équipes produit de Google pour collecter du contenu public à diverses fins, y compris la R&D interne ; l’utilisation de votre contenu pour entraîner les modèles Gemini est contrôlée séparément via le jeton Google-Extended. Bytespider est le robot d’entraînement IA de ByteDance (maison mère de TikTok), et CCBot est le robot du projet Common Crawl, qui constitue le socle des jeux de données de pré-entraînement de la plupart des grands LLM.

Que se passe-t-il si vous bloquez ces robots ? Votre contenu disparaît des données d’entraînement de l’IA et est également exclu de la recherche en temps réel. Lorsque l’IA reçoit une question connexe, elle cite le contenu d’un concurrent à votre place. C’est comme bloquer soi-même sa propre route.

Le cas de Naver est un avertissement emblématique. Le fichier robots.txt du blog Naver déclare « interdire strictement l’accès aux robots à des fins d’entraînement de l’IA et de génération augmentée par récupération (RAG) », et bloque explicitement GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, CCBot, entre autres (vérifié en juin 2026). Résultat : l’immense volume de contenu en coréen du blog Naver et de Naver Knowledge iN est de facto exclu des réponses de ChatGPT et de Perplexity. Pour Naver, il s’agissait probablement d’un choix stratégique visant à protéger son propre service d’IA (AI Briefing) — mais si une entreprise ordinaire copie cette stratégie de blocage, elle se retire elle-même de l’ère de la recherche IA.

Configurer robots.txt pour autoriser les robots IA est simple. Ne rien faire équivaut déjà par défaut à autoriser, mais il est préférable d’exprimer explicitement cette intention. Cela dit, les zones qui ont réellement besoin d’être protégées — contenu payant, pages de données clients — doivent être bloquées de façon sélective, tandis que le contenu marketing et les pages publiques doivent impérativement rester ouverts. Les critères de décision de blocage/autorisation par robot et la procédure de configuration de robots.txt sont traités de façon opérationnelle dans notre guide robots.txt pour les robots IA, dédié à ce sujet.

[Check-list] Audit GEO technique en 20 points

Nous avons organisé une check-list pour vérifier l’état de votre GEO technique en 4 catégories et 20 points. Nous recommandons que votre équipe IT/développement et votre équipe SEO la passent en revue ensemble.

Graphique d'audit résumant les 4 catégories de l'audit GEO technique, chacune comportant 5 points
L’audit GEO technique divise quatre domaines en cinq points chacun, pour vérifier rapidement votre base technique.

A. llms.txt et accessibilité à l’IA (5 points)

  1. Un fichier llms.txt existe-t-il à la racine du site (example.com/llms.txt) ?
  2. La version détaillée llms-full.txt est-elle également fournie ?
  3. llms.txt contient-il le nom de l’organisation, ses services essentiels et des liens vers son contenu phare ?
  4. Le contenu de llms.txt correspond-il à la structure et aux services réels du site, et a-t-il été mis à jour au cours des 3 derniers mois ?
  5. llms.txt contient-il des coordonnées et des liens vers des sources externes faisant autorité (Wikipédia, LinkedIn, etc.) ?

B. Balisage de schéma et données structurées (5 points)

  1. Le schéma Organization est-il implémenté sur la page principale au format JSON-LD ?
  2. Le schéma Article est-il appliqué à toutes les pages de blog/contenu ?
  3. Le schéma FAQPage est-il appliqué au contenu FAQ, et le schéma HowTo au contenu de type tutoriel ?
  4. Le champ sameAs est-il relié aux profils de réseaux sociaux officiels et à des sources externes faisant autorité ?
  5. L’outil Google Rich Results Test affiche-t-il zéro erreur de données structurées ?

C. Paramètres des robots IA (5 points)

  1. GPTBot, ClaudeBot et PerplexityBot ne sont-ils pas bloqués dans robots.txt ?
  2. GoogleOther et Google-Extended ne sont-ils pas bloqués ?
  3. CCBot (Common Crawl) est-il autorisé, au minimum, sur les principales pages publiques ?
  4. Seules les pages de contenu payant et de données clients sont-elles bloquées de façon sélective ?
  5. L’en-tête HTTP X-Robots-Tag ne comporte-t-il pas de directive noindex ciblant les robots IA ?

D. Base technique du site (5 points)

  1. Toutes les pages atteignent-elles le niveau « Bon » de Google pour les Core Web Vitals (LCP, CLS, INP) ?
  2. Un design responsive adapté au mobile est-il appliqué ?
  3. Le plan de site (sitemap XML) est-il à jour et inclut-il toutes les pages publiques ?
  4. HTTPS est-il appliqué sur toutes les pages, sans avertissement de contenu mixte (Mixed Content) ?
  5. Les titres de page (H1) et les meta descriptions sont-ils rédigés pour correspondre à une intention de recherche formulée sous forme de question ?

Organisation responsable : le rôle de l’équipe IT/développement

Le GEO technique se déploie selon un modèle de collaboration où l’équipe IT/développement pilote l’exécution et l’équipe SEO définit les exigences. La rédaction de llms.txt, l’implémentation du balisage de schéma et la configuration des robots relèvent toutes de domaines nécessitant une exécution technique. Cela dit, les décisions stratégiques — comme « quelles informations mettre dans llms.txt » ou « quel schéma appliquer en priorité » — doivent être prises conjointement avec les équipes de marketing de marque et de contenu. Consultez la matrice RACI de notre article sur la conception organisationnelle du GEO pour voir comment les responsabilités du GEO technique se répartissent entre les services.

Graphique sombre organisant la vérification du balisage de schéma et des données structurées en 5 points : Organization JSON-LD, Article, FAQPage et HowTo, sameAs, et vérification de zéro erreur
La vérification du balisage de schéma va de la déclaration de l’entité organisationnelle à la structuration par type de contenu, jusqu’à la vérification de zéro erreur.
Schéma de collaboration montrant, étape par étape, les rôles des équipes IT/développement, SEO, marketing de marque et contenu dans le GEO technique
Le GEO technique ne fonctionne que si l’implémentation de l’équipe IT/développement et les décisions stratégiques des équipes SEO, marque et contenu avancent ensemble.
Check-list vérifiant l'existence du fichier llms.txt, la disponibilité de la version détaillée, le nom de l'organisation et les liens vers les services essentiels, la mise à jour au cours des 3 derniers mois, et les liens vers des sources externes faisant autorité
La vérification de llms.txt doit porter non seulement sur l’existence du fichier, mais aussi sur la structure du site et les liens vers des sources externes faisant autorité.

Points clés à retenir

  • Le GEO technique est la condition technique préalable à toute stratégie GEO. Construisez-le avant le contenu ou les actions de mentions externes.
  • llms.txt est la « présentation de l’entreprise » que vous remettez à l’IA. L’adoption se répand rapidement en ce moment — rédigez le vôtre avant vos concurrents.
  • Le balisage de schéma JSON-LD permet à l’IA de reconnaître vos informations comme des faits, et non comme des déductions.
  • Pour les robots IA, « autoriser est le défaut, bloquer est l’exception ». Un blocage total comme celui de Naver vous retire de la recherche IA.
  • Utilisez la check-list en 20 points pour vérifier immédiatement l’état actuel de votre infrastructure technique.

Si vous êtes curieux de savoir comment votre marque apparaît actuellement dans les réponses de l’IA, contactez-nous pour un audit de part de voix dans les réponses IA. Vous pouvez également demander le PDF intégral du livre blanc GEO.

Questions fréquentes (FAQ)

En quoi llms.txt diffère-t-il de robots.txt ?

Si robots.txt indique aux robots « quel périmètre ils ont le droit de collecter », llms.txt est un guide en Markdown qui résume pour l’IA « ce qu’est ce site et où se trouve son contenu essentiel ». Les deux fichiers ne sont pas substituables l’un à l’autre, mais complémentaires.

Par quel balisage de schéma faut-il commencer ?

Le schéma Organization (JSON-LD) sur la page principale est le point de départ. Après avoir relié des sources externes faisant autorité comme Wikipédia et LinkedIn via l’attribut sameAs, étendez l’application aux schémas Article, FAQPage et HowTo sur les pages de contenu, et Service et Product sur les pages de services.

Que se passe-t-il si l’on bloque les robots IA ?

Le contenu disparaît à la fois des données d’entraînement de l’IA et de la recherche en temps réel, et l’IA cite le contenu d’un concurrent à la place lorsqu’elle répond à des questions connexes. Sauf raison stratégique de blocage total comme dans le cas de Naver, le principe général consiste à ne bloquer sélectivement que les pages ayant besoin d’être protégées, en laissant le contenu marketing ouvert.

Qui doit prendre en charge le GEO technique ?

Le modèle standard est une collaboration où l’équipe IT/développement pilote la mise en œuvre et l’équipe SEO définit les exigences. Les décisions stratégiques — comme les informations à inclure dans llms.txt ou le schéma à prioriser — nécessitent également la participation des équipes de marketing de marque et de contenu.

Série livre blanc GEO : ← Chapitre précédent · Table des matières complète · Chapitre suivant