Outils SEO gratuits

Générateur de robots.txt

Construisez un robots.txt valide depuis un petit formulaire, avec les bons groupes Allow et Disallow, une ligne sitemap et un blocage optionnel des robots IA, prêt à copier.

Réglages

Votre robots.txt

 

Le fichier robots.txt se trouve à la racine de votre site et indique aux robots les parties qu'ils peuvent demander. Une barre oblique de trop peut cacher tout votre site à Google, d'où l'intérêt d'une syntaxe exacte. Ce générateur gratuit construit un robots.txt valide depuis un petit formulaire : choisissez un préréglage, listez les chemins à tenir hors du crawl, pointez vers votre sitemap et, si vous le souhaitez, ajoutez des groupes dédiés qui bloquent les robots IA. La sortie se met à jour en direct et est prête à copier dans un fichier nommé robots.txt. Il s'adresse aux SEO, développeurs et propriétaires de sites qui veulent un fichier correct sans mémoriser le format.

Comment l'utiliser

1

Choisissez un préréglage

Partez d'Autoriser tous les robots, Bloquer tout le site ou Règles personnalisées. Les deux premiers écrivent tout le fichier pour vous ; le mode personnalisé ouvre les champs user-agent et chemins à bloquer.

2

Ajoutez vos règles

En mode personnalisé, réglez le user-agent (laissez * pour tous les robots) et listez les chemins à bloquer, un par ligne, comme /admin/ ou /cart. Ajoutez l'URL de votre sitemap et cochez la case pour bloquer les robots IA si vous le voulez.

3

Copiez-le sur votre site

Copiez le texte généré, enregistrez-le dans un fichier texte nommé robots.txt et déposez-le à la racine de votre domaine pour qu'il soit accessible à /robots.txt. Les robots le lisent là.

Pourquoi c'est utile

Une syntaxe valide à chaque fois

Le générateur écrit les groupes dans l'ordre attendu par les robots : une ligne user-agent, ses lignes Allow et Disallow, une ligne vide entre les groupes et la ligne Sitemap à la fin. Vous évitez les petites erreurs, deux-points manquant ou espace de trop, qui cassent discrètement un fichier tapé à la main.

Bloquez les robots IA en un clic

Une seule case ajoute des groupes Disallow dédiés pour les robots IA connus, de GPTBot et ClaudeBot à CCBot, Google-Extended et PerplexityBot : vous gardez votre contenu hors de l'entraînement et de la récupération par les IA sans chercher le nom de chaque agent.

Rien ne quitte votre navigateur

Le fichier est construit entièrement côté client. Rien de ce que vous tapez n'est envoyé ni conservé : vous pouvez préparer des règles pour un site non publié ou un projet client sans connexion.

Comment robots.txt contrôle le crawl, et là où il ne le fait pas

Ce qu'est robots.txt et comment les robots le lisent

Robots.txt est un fichier texte à la racine de votre domaine, accessible à /robots.txt, qui suit le protocole d'exclusion des robots. Un robot le récupère avant de demander vos pages et obéit aux règles qui s'appliquent à son user-agent. Le fichier est organisé en groupes : une ligne User-agent nomme le robot, et les lignes Disallow et Allow qui suivent indiquent quels chemins ce robot peut ou non demander. Une ligne vide sépare un groupe du suivant, et une ligne Sitemap, qui n'est liée à aucun groupe, se place en général à la fin.

La correspondance est plus simple qu'il n'y paraît. Disallow: /admin/ bloque toute URL dont le chemin commence par /admin/. Une ligne Disallow vide ne bloque rien, c'est ainsi qu'on autorise tout, tandis que Disallow: / bloque le site entier. Un User-agent à * est le groupe par défaut qui s'applique à tout robot sans groupe propre, et la plupart des sites n'ont besoin que de ce groupe plus une ligne sitemap.

Bloquer le crawl n'est pas bloquer l'indexation

Le malentendu le plus courant est de croire que Disallow sort une page de Google. Non. Disallow empêche un robot de récupérer la page, mais une URL liée depuis ailleurs peut toujours être indexée sans son contenu, apparaissant comme un lien nu sans description. Si le but est de tenir une page entièrement hors des résultats, laissez-la être explorée et ajoutez une balise meta noindex, ou protégez-la derrière une authentification. Robots.txt contrôle le crawl ; il ne contrôle pas l'indexation.

Cela veut aussi dire que robots.txt est le mauvais outil pour des données privées. Comme le fichier est public, n'importe qui peut lire votre liste de Disallow : y lister un dossier secret revient à l'annoncer. Servez-vous-en pour éloigner le budget de crawl des URL à faible valeur ou dupliquées, comme les résultats de recherche interne, les filtres à facettes ou un panier, et utilisez l'authentification ou le noindex pour tout ce qui doit vraiment rester caché.

Ne bloquez pas vos propres ressources

Une erreur classique est de bloquer les dossiers qui contiennent votre CSS et votre JavaScript. Google rend les pages pour les comprendre, et s'il ne peut pas récupérer ces fichiers, la page peut être jugée sur un rendu cassé. Gardez vos ressources explorables et réservez Disallow aux pages, pas aux fichiers qui les font fonctionner.

Les robots IA et les limites du fichier

Un usage plus récent de robots.txt consiste à demander aux robots IA de rester à l'écart. Des agents comme GPTBot, ClaudeBot, CCBot, Google-Extended et PerplexityBot lisent chacun leur propre groupe user-agent : les bloquer suppose d'ajouter un groupe Disallow par agent, ce que fait pour vous la case de blocage IA. Rappelez-vous que robots.txt est une requête, pas un mur : les robots respectueux lui obéissent, mais il tient par convention, pas par le serveur, donc tout ce qui doit être réellement inaccessible réclame un vrai contrôle d'accès. Si au contraire votre objectif est d'être trouvé et cité dans toutes les langues où vous publiez, c'est là qu'Otorank prend le relais : il recherche, rédige, publie et suit un contenu conçu pour être trouvé en 150+ langues, quand vous passez d'un fichier à la gestion de tout le canal.

Ils utilisent Otorank

FAQ

Questions fréquentes

Ce que robots.txt peut et ne peut pas faire, où placer le fichier, et comment fonctionne le blocage des robots IA.

À la racine de votre domaine, pour qu'il soit accessible à https://votredomaine.com/robots.txt. Les robots ne regardent que là ; un robots.txt dans un sous-dossier est ignoré.

Non. Disallow empêche le crawl de la page, mais une URL liée depuis ailleurs peut toujours être indexée sans son contenu. Pour tenir une page hors des résultats, autorisez le crawl et utilisez une balise meta noindex, ou exigez une authentification.

Une ligne Disallow vide ne bloque rien, c'est ainsi qu'on autorise tout pour ce user-agent. Disallow: / avec une barre bloque le site entier : un seul caractère change tout.

Ajoutez un groupe par user-agent IA avec Disallow: /. Cochez Bloquer les robots IA ici et le générateur ajoute automatiquement ces groupes pour GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot et d'autres.

Non. Le fichier est public et ne demande qu'une conformité volontaire : il ne peut pas protéger un contenu sensible. Utilisez une authentification ou une balise noindex pour tout ce qui doit rester caché, et réservez robots.txt au pilotage du budget de crawl.

Outils liés

ESSAI GRATUIT

Prêt à devenir
visible sur Google ?

Votre visibilité SEO, en pilote automatique

Commencez en ajoutant votre site

Nous analyserons votre site et vous montrerons des opportunités pour être visible sur Google.

Configuration en 60 secondes Aucune carte bancaire requise Annulable à tout moment