qu'est-ce que robots.txt ? le fichier qui indique aux robots d'exploration où ils peuvent aller, en termes simples

seo · Mar 19, 2026 · 5 min read

robots.txt est un fichier texte brut qui se trouve à la racine de votre domaine — `mybusiness.com/robots.txt` — et indique aux robots des moteurs de recherche quelles parties du site ils sont autorisés à explorer. c'est la liste des invités du videur : le googlebot arrive, lit d'abord le fichier et suit les règles qu'il trouve.

ce que dit réellement le fichier

la syntaxe est composée de deux lignes répétées, et rien de plus :

``` User-agent: Googlebot Disallow: /admin/ ```

"User-agent" nomme le robot ("\*" signifie tous), "Disallow" répertorie les préfixes de chemin qu'il doit ignorer. c'est tout le vocabulaire. la plupart des sites ont soit un ensemble de règles vide (tout explorer) soit une seule ligne bloquant un chemin d'administration ou une page de résultats de recherche.

le fichier existe pour une seule tâche : éviter aux robots d'exploration de gaspiller des visites sur des pages qui n'ont aucune valeur dans la recherche. un grand site l'utilise pour empêcher les robots d'accéder aux filtres à facettes et aux journaux internes ; un petit site n’a presque jamais besoin de cette complexité.

ce que robots.txt ne peut pas faire

c'est là que résident les idées fausses, donc les limites strictes, clairement :

  • il ne masque pas une page à Google. une page non autorisée peut toujours apparaître dans les résultats — sans son contenu — si d'autres pages renvoient vers elle. le seul moyen de garder une page en dehors de l'index est d'utiliser une directive `noindex` sur la page elle-même, qui nécessite que le robot d'exploration soit autorisé à la visiter. le blocage et la non-indexation sont opposés, et les confondre est l'erreur classique.

  • ce n'est pas de la sécurité. un chemin non autorisé est une annonce publiée indiquant que le chemin existe. tout ce qui doit rester privé nécessite une authentification, pas une note demandant aux robots de détourner le regard.

  • ce n'est pas un outil de classement. interdire des pages ne concentre le « pouvoir » nulle part ; il supprime uniquement les visites d'exploration.

    ce que vous devriez réellement faire

  • regardez le vôtre une fois. ouvrez `yourdomain/robots.txt`. il existe par défaut sur presque toutes les plateformes. si ça ne dit rien d'effrayant, rien à faire.

  • assurez-vous qu'il ne bloque pas les CSS ou les JS. une ancienne règle de copier-coller bloquant `/assets/` rend Google rend vos pages à moitié aveugles, ce qui nuit discrètement à la façon dont les pages sont évaluées. c'est la seule façon courante pour robots.txt d'endommager activement un petit site.

  • pointez-le vers votre plan de site avec une ligne `Sitemap:` — la poignée de main décrite dans do i need an xml sitemap.

  • observer ses effets dans google search console, qui signale les anomalies d'exploration par leur nom.

    FAQ : les questions que je reçois réellement

dois-je créer un fichier robots.txt ?

probablement pas. les constructeurs et les hôtes proposent une valeur par défaut raisonnable. créez-en un le jour où vous avez une raison spécifique : un labyrinthe de paramètres chargé en exploration, une zone de préparation, un chemin d'administration générant du bruit dans les statistiques d'exploration.

puis-je bloquer mon site intermédiaire avec robots.txt ?

vous pouvez bloquer l'exploration, mais l'URL peut toujours fuir et être indexée comme une coquille vide. les sites de préparation appartiennent à un mot de passe. le mot de passe est la solution ; robots.txt est un avis de courtoisie.

le fichier robots.txt affecte-t-il mon classement ?

seulement indirectement, et uniquement de manière négative : bloquer les éléments dont Google a besoin (css, js, images) dégrade le rendu et l'évaluation des pages. utilisé judicieusement, il est invisible dans les classements - l'objectif de how do i get my website on google est bien exploré, pas moins.