Comment créer un fichier robots.txt — Comprendre en 5 minutes

Pourquoi le fichier robots.txt est-il important, et pourquoi en avez-vous vraiment besoin ?
Si vous gérez un site web, vous vous êtes probablement déjà demandé comment faire en sorte que vos pages importantes soient trouvées par les moteurs de recherche, tout en gardant les pages superflues hors de vue.
C’est exactement le rôle de ce fichier. Il indique aux robots des moteurs de recherche : « vous pouvez regarder cette page, mais pas celle-là ».
Bien utilisé, il permet d’optimiser vos performances SEO et d’éviter un crawl inutile. Mal configuré, en revanche, il peut faire disparaître des pages importantes des résultats de recherche par erreur.
Dans cet article, nous allons voir, du concept de base jusqu’à la configuration concrète, tout ce qu’un marketeur B2B doit comprendre, même sans expertise SEO.
À la fin de cette lecture, vous serez en mesure de gérer efficacement l’exposition de votre site dans les résultats de recherche, même sans être spécialiste SEO.
Qu’est-ce que le robots.txt, et pourquoi est-il important ?
De nombreux marketeurs se concentrent sur la rédaction de contenu et la stratégie de mots-clés pour le SEO, mais comprendre comment les moteurs de recherche explorent votre site est tout aussi essentiel.
Les robots des moteurs de recherche visitent et indexent automatiquement toutes les pages d’un site, et le fichier robots.txt contrôle précisément quelles pages ils peuvent explorer ou non. La documentation officielle de Google définit robots.txt comme « un fichier qui indique aux robots des moteurs de recherche quelles URL ils peuvent explorer sur votre site », principalement utilisé pour éviter de surcharger le site de requêtes.
Il se trouve à la racine du site et transmet aux moteurs de recherche des instructions pour autoriser ou bloquer certains chemins.
Bien configuré, il évite un crawl inutile et permet de concentrer le budget de crawl sur les pages importantes. Mal configuré, il peut entraîner l’erreur critique de voir des pages clés exclues des résultats de recherche.
Selon Google Search Central, les règles elles-mêmes sont simples, mais une erreur de configuration peut avoir un impact direct sur le SEO.
C’est pourquoi il est essentiel de bien comprendre comment le configurer correctement.

La syntaxe et la structure de base du robots.txt
Sa structure de base repose sur un jeu de commandes simples destinées à communiquer avec les robots des moteurs de recherche.

Chaque ligne associe un robot précis (User-agent) aux règles qui s’appliquent à lui (Disallow, Allow, etc.).
Comprendre le User-agent
Les robots des moteurs de recherche ont pour rôle de collecter et d’indexer le contenu d’un site web.
Mais tous les moteurs de recherche ne suivent pas exactement les mêmes règles de crawl, d’où la nécessité, parfois, de définir des règles ciblant un robot en particulier.
C’est là qu’intervient la directive User-agent. Elle permet de préciser à quel robot une règle donnée s’applique.
Par exemple, le robot de Google s’appelle « Googlebot », celui de Naver « Yeti », et celui de Bing « Bingbot ».
Pour cibler un robot précis, indiquez son User-agent. Pour appliquer une règle à tous les robots, utilisez le symbole « * ».
User-agent: *
Ce réglage signifie que la même règle s’applique à tous les robots des moteurs de recherche.
La différence entre Allow et Disallow
La fonction centrale du robots.txt est d’indiquer aux robots des moteurs de recherche s’ils doivent explorer, ou non, un chemin donné.
C’est le rôle des directives Allow et Disallow.
Ces deux réglages constituent véritablement le cœur du fichier.
Allow est la directive qui autorise le crawl d’une page ou d’un dossier précis ; Disallow est celle qui le bloque.
Par défaut, les robots des moteurs de recherche tentent d’explorer toutes les pages, mais Disallow permet de bloquer l’accès à un chemin spécifique.
Par exemple, un répertoire « /admin » correspond à une page d’administration qui n’a pas besoin d’être exposée aux moteurs de recherche.
Pour empêcher tous les robots des moteurs de recherche d’explorer le répertoire « /admin », vous pouvez donc configurer ceci :
User-agent: *
Disallow: /admin/
À l’inverse, si vous souhaitez bloquer un dossier tout en autorisant le crawl d’une page précise à l’intérieur de celui-ci, vous pouvez utiliser la directive Allow.
User-agent: *
Disallow: /private/
Allow: /private/public-page.html
Cette configuration bloque toutes les pages du répertoire « /private/ », à l’exception de « /private/public-page.html », qui reste accessible aux moteurs de recherche. Cette approche est utile lorsque vous souhaitez exposer uniquement certains contenus au sein d’un répertoire par ailleurs privé.

Rédiger un robots.txt : application pratique
Points de vigilance lors de la rédaction du fichier
Rédigez-le sous forme de simple fichier texte, puis déposez-le à la racine de votre site.
En l’absence de robots.txt, les robots des moteurs de recherche sont libres d’explorer toutes les pages.
Voici les points à retenir lors de la rédaction du fichier (d’après le guide officiel de Google sur le robots.txt) :
- Le nom du fichier doit être exactement « robots.txt ».
- Il doit être enregistré au format UTF-8 ou ASCII.
- Les moteurs de recherche ne prennent pas en compte les modifications du robots.txt en temps réel : testez donc après chaque changement.
Stratégies d’optimisation SEO grâce au robots.txt
Optimiser le budget de crawl
Le crawl des moteurs de recherche consomme des ressources serveur. Bloquer les pages superflues est un moyen efficace de concentrer le budget de crawl sur les pages qui comptent.

User-agent: *
Disallow: /temp/
Disallow: /test/
Disallow: /admin/
En bloquant ainsi les dossiers temporaires ou les pages d’administration, vous évitez aux moteurs de recherche de gaspiller du crawl sur des pages sans intérêt.
Éviter les problèmes de contenu dupliqué
Lorsqu’un même contenu est accessible via plusieurs URL sur un site, les moteurs de recherche peuvent le considérer comme du contenu dupliqué.
Le robots.txt permet de bloquer le crawl de certaines pages pour limiter ce risque.
User-agent: *
Disallow: /duplicate-page/
Cela ne suffit toutefois pas à résoudre entièrement le problème : il est préférable de l’associer à une balise canonique.
L’associer à un sitemap pour améliorer les performances de recherche
Indiquer l’emplacement du sitemap dans le fichier aide les moteurs de recherche à comprendre plus rapidement la structure du site.
Sitemap: https://www.example.com/sitemap.xml
Avec ce réglage, les moteurs de recherche peuvent se référer au sitemap pour indexer le site plus efficacement.
Points à surveiller lors de la configuration du robots.txt
robots.txt et Noindex : quelle différence ?
Le robots.txt se contente de bloquer le crawl d’une page par les moteurs de recherche ; il ne garantit pas la disparition totale de cette page des résultats de recherche.

Même si un moteur de recherche cesse d’explorer une page, une version déjà indexée peut rester présente dans les résultats. Google précise explicitement que le robots.txt « n’est pas un mécanisme permettant d’exclure une page web des résultats de recherche », et qu’une URL bloquée peut malgré tout être indexée si d’autres sites pointent vers elle.
Dans ce cas, il faut associer une balise meta Noindex pour indiquer aux moteurs de recherche de ne pas indexer cette page.
Avec une balise Noindex, même si un moteur de recherche visite la page, il l’exclura de l’index et elle n’apparaîtra pas dans les résultats de recherche.
Un point important : si vous bloquez le crawl via robots.txt tout en définissant une balise Noindex, le robot risque de ne jamais revenir sur la page pour lire cette balise, et l’instruction Noindex peut donc ne jamais être appliquée.
La méthode la plus efficace consiste à autoriser le crawl de la page tout en appliquant la balise Noindex.
<meta name=”robots” content=”noindex”>
Ce réglage est encore plus efficace lorsqu’il est combiné avec Disallow.
Problèmes SEO pouvant résulter d’une mauvaise configuration du robots.txt
L’erreur de bloquer tout le site aux moteurs de recherche
User-agent: *
Disallow: /
Ce réglage bloque l’accès de tous les robots des moteurs de recherche à toutes les pages du site. Autrement dit, les moteurs peuvent visiter le site mais ne pourront explorer aucune page.
Ce réglage peut être utile pour garder un site privé en phase de développement, mais s’il est appliqué par erreur à un site en production, il risque de bloquer toute votre exposition dans les résultats de recherche.
C’est pourquoi il est toujours conseillé de tester toute modification du robots.txt dans Google Search Console afin d’éviter tout problème imprévu.
Si vous souhaitez bloquer certaines pages tout en conservant l’exposition d’autres pages importantes, une configuration comme celle-ci est plus adaptée :
User-agent: *
Disallow: /admin/
Disallow: /private/
Notez qu’une règle générale comme le « Disallow: / » de l’exemple ci-dessus bloque le crawl de tout le site par tous les moteurs de recherche, ce qui supprime toute votre exposition dans les résultats — à n’utiliser que si c’est précisément l’effet recherché.

Des pages importantes qui ne s’indexent pas
Vérifiez régulièrement si des pages essentielles à votre trafic de recherche sont bloquées par votre configuration robots.txt.
Si une page précise a disparu des résultats de recherche, commencez par vérifier les réglages du fichier, puis assurez-vous que les moteurs de recherche peuvent effectivement explorer cette page.
Pour cela, utilisez l’outil d’inspection d’URL de Google Search Console.
Cet outil permet de vérifier si un moteur de recherche peut explorer une page donnée et si elle est indexée ; en cas de problème, vous pouvez le corriger puis soumettre une demande d’indexation.
Le rapport de couverture de Google Search Console permet également de voir en un coup d’œil quelles pages sont explorées et indexées, et lesquelles sont bloquées.
Consulter ce rapport régulièrement permet d’anticiper d’éventuels problèmes d’indexation et d’y réagir rapidement.
À lire également
- Le guide complet du SEO technique : crawl, indexation, rendu, vitesse et structure
- Qu’est-ce qu’une balise canonique (Canonical Tag) ?
- Pourquoi un sitemap est important et 3 façons d’en créer un
- Comment corriger les erreurs de balise Open Graph
- Qu’est-ce qu’une balise H1 et comment bien l’utiliser
Si vous souhaitez appliquer cela à votre entreprise — découvrez l’approche de Growth via notre service SEO, et si vous avez besoin d’un diagnostic précis de votre situation, contactez-nous via notre page contact. Nous répondons en fonction du client unique qui devient du chiffre d’affaires, pas du volume de trafic.
Questions fréquentes
Si je bloque une page avec robots.txt, disparaît-elle totalement des résultats de recherche ?
Non. Le robots.txt bloque uniquement le crawl : ce n’est pas un outil pour contrôler l’indexation elle-même. La documentation officielle de Google précise que le robots.txt « n’est pas un mécanisme permettant d’exclure une page web des résultats de recherche ». Si d’autres sites pointent vers elle, une URL bloquée peut rester dans les résultats de recherche, avec seulement son adresse affichée. Si votre objectif est d’exclure totalement une page de la recherche, utilisez plutôt noindex.
Faut-il utiliser robots.txt ou noindex ?
Leurs objectifs diffèrent. Utilisez Disallow dans robots.txt pour réduire la charge serveur ou bloquer le crawl d’un chemin précis ; utilisez la balise meta noindex si vous voulez exclure une page des résultats de recherche. Point important : sur une page bloquée par robots.txt, le robot peut ne jamais « lire » la balise noindex, ce qui peut empêcher l’instruction de s’appliquer. Si l’objectif est l’exclusion des résultats de recherche, il est plus efficace d’autoriser le crawl et d’appliquer noindex.
Où placer le fichier robots.txt, et dans quel format faut-il l’enregistrer ?
Selon le guide officiel de Google, le fichier doit s’appeler exactement robots.txt, se trouver à la racine de l’hébergement du site, et être un fichier texte encodé en UTF-8 (ASCII inclus). Placé dans un sous-répertoire plutôt qu’à la racine, il ne sera pas reconnu par les robots. Les modifications ne sont pas prises en compte en temps réel : testez après chaque changement.
Mon site entier a disparu des résultats de recherche par erreur. Que dois-je vérifier ?
La cause la plus fréquente est une règle Disallow: / appliquée par erreur à un site en production. Elle bloque le crawl de toutes les pages, ce qui peut faire disparaître toute votre exposition dans les résultats de recherche. Vérifiez d’abord la configuration de votre robots.txt, puis utilisez l’outil d’inspection d’URL de Google Search Console pour vérifier si ces pages peuvent être explorées et indexées. Le rapport de couverture permet de voir en un coup d’œil quelles pages sont bloquées.

