Générateur de robots.txt
Construisez un robots.txt valide depuis un petit formulaire, avec les bons groupes Allow et Disallow, une ligne sitemap et un blocage optionnel des robots IA, prêt à copier.
Réglages
Votre robots.txt
Le fichier robots.txt se trouve à la racine de votre site et indique aux robots les parties qu'ils peuvent demander. Une barre oblique de trop peut cacher tout votre site à Google, d'où l'intérêt d'une syntaxe exacte. Ce générateur gratuit construit un robots.txt valide depuis un petit formulaire : choisissez un préréglage, listez les chemins à tenir hors du crawl, pointez vers votre sitemap et, si vous le souhaitez, ajoutez des groupes dédiés qui bloquent les robots IA. La sortie se met à jour en direct et est prête à copier dans un fichier nommé robots.txt. Il s'adresse aux SEO, développeurs et propriétaires de sites qui veulent un fichier correct sans mémoriser le format.
Comment l'utiliser
Choisissez un préréglage
Partez d'Autoriser tous les robots, Bloquer tout le site ou Règles personnalisées. Les deux premiers écrivent tout le fichier pour vous ; le mode personnalisé ouvre les champs user-agent et chemins à bloquer.
Ajoutez vos règles
En mode personnalisé, réglez le user-agent (laissez * pour tous les robots) et listez les chemins à bloquer, un par ligne, comme /admin/ ou /cart. Ajoutez l'URL de votre sitemap et cochez la case pour bloquer les robots IA si vous le voulez.
Copiez-le sur votre site
Copiez le texte généré, enregistrez-le dans un fichier texte nommé robots.txt et déposez-le à la racine de votre domaine pour qu'il soit accessible à /robots.txt. Les robots le lisent là.
Pourquoi c'est utile
Une syntaxe valide à chaque fois
Le générateur écrit les groupes dans l'ordre attendu par les robots : une ligne user-agent, ses lignes Allow et Disallow, une ligne vide entre les groupes et la ligne Sitemap à la fin. Vous évitez les petites erreurs, deux-points manquant ou espace de trop, qui cassent discrètement un fichier tapé à la main.
Bloquez les robots IA en un clic
Une seule case ajoute des groupes Disallow dédiés pour les robots IA connus, de GPTBot et ClaudeBot à CCBot, Google-Extended et PerplexityBot : vous gardez votre contenu hors de l'entraînement et de la récupération par les IA sans chercher le nom de chaque agent.
Rien ne quitte votre navigateur
Le fichier est construit entièrement côté client. Rien de ce que vous tapez n'est envoyé ni conservé : vous pouvez préparer des règles pour un site non publié ou un projet client sans connexion.
Comment robots.txt contrôle le crawl, et là où il ne le fait pas
Ce qu'est robots.txt et comment les robots le lisent
Robots.txt est un fichier texte à la racine de votre domaine, accessible à /robots.txt, qui suit le protocole d'exclusion des robots. Un robot le récupère avant de demander vos pages et obéit aux règles qui s'appliquent à son user-agent. Le fichier est organisé en groupes : une ligne User-agent nomme le robot, et les lignes Disallow et Allow qui suivent indiquent quels chemins ce robot peut ou non demander. Une ligne vide sépare un groupe du suivant, et une ligne Sitemap, qui n'est liée à aucun groupe, se place en général à la fin.
La correspondance est plus simple qu'il n'y paraît. Disallow: /admin/ bloque toute URL dont le chemin commence par /admin/. Une ligne Disallow vide ne bloque rien, c'est ainsi qu'on autorise tout, tandis que Disallow: / bloque le site entier. Un User-agent à * est le groupe par défaut qui s'applique à tout robot sans groupe propre, et la plupart des sites n'ont besoin que de ce groupe plus une ligne sitemap.
Bloquer le crawl n'est pas bloquer l'indexation
Le malentendu le plus courant est de croire que Disallow sort une page de Google. Non. Disallow empêche un robot de récupérer la page, mais une URL liée depuis ailleurs peut toujours être indexée sans son contenu, apparaissant comme un lien nu sans description. Si le but est de tenir une page entièrement hors des résultats, laissez-la être explorée et ajoutez une balise meta noindex, ou protégez-la derrière une authentification. Robots.txt contrôle le crawl ; il ne contrôle pas l'indexation.
Cela veut aussi dire que robots.txt est le mauvais outil pour des données privées. Comme le fichier est public, n'importe qui peut lire votre liste de Disallow : y lister un dossier secret revient à l'annoncer. Servez-vous-en pour éloigner le budget de crawl des URL à faible valeur ou dupliquées, comme les résultats de recherche interne, les filtres à facettes ou un panier, et utilisez l'authentification ou le noindex pour tout ce qui doit vraiment rester caché.
Ne bloquez pas vos propres ressources
Une erreur classique est de bloquer les dossiers qui contiennent votre CSS et votre JavaScript. Google rend les pages pour les comprendre, et s'il ne peut pas récupérer ces fichiers, la page peut être jugée sur un rendu cassé. Gardez vos ressources explorables et réservez Disallow aux pages, pas aux fichiers qui les font fonctionner.
Les robots IA et les limites du fichier
Un usage plus récent de robots.txt consiste à demander aux robots IA de rester à l'écart. Des agents comme GPTBot, ClaudeBot, CCBot, Google-Extended et PerplexityBot lisent chacun leur propre groupe user-agent : les bloquer suppose d'ajouter un groupe Disallow par agent, ce que fait pour vous la case de blocage IA. Rappelez-vous que robots.txt est une requête, pas un mur : les robots respectueux lui obéissent, mais il tient par convention, pas par le serveur, donc tout ce qui doit être réellement inaccessible réclame un vrai contrôle d'accès. Si au contraire votre objectif est d'être trouvé et cité dans toutes les langues où vous publiez, c'est là qu'Otorank prend le relais : il recherche, rédige, publie et suit un contenu conçu pour être trouvé en 150+ langues, quand vous passez d'un fichier à la gestion de tout le canal.
Ils utilisent Otorank
Questions fréquentes
Ce que robots.txt peut et ne peut pas faire, où placer le fichier, et comment fonctionne le blocage des robots IA.
À la racine de votre domaine, pour qu'il soit accessible à https://votredomaine.com/robots.txt. Les robots ne regardent que là ; un robots.txt dans un sous-dossier est ignoré.
Non. Disallow empêche le crawl de la page, mais une URL liée depuis ailleurs peut toujours être indexée sans son contenu. Pour tenir une page hors des résultats, autorisez le crawl et utilisez une balise meta noindex, ou exigez une authentification.
Une ligne Disallow vide ne bloque rien, c'est ainsi qu'on autorise tout pour ce user-agent. Disallow: / avec une barre bloque le site entier : un seul caractère change tout.
Ajoutez un groupe par user-agent IA avec Disallow: /. Cochez Bloquer les robots IA ici et le générateur ajoute automatiquement ces groupes pour GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot et d'autres.
Non. Le fichier est public et ne demande qu'une conformité volontaire : il ne peut pas protéger un contenu sensible. Utilisez une authentification ou une balise noindex pour tout ce qui doit rester caché, et réservez robots.txt au pilotage du budget de crawl.
Outils liés
Testeur de robots.txt
Testez si une URL est autorisée ou bloquée pour un robot, avec la règle qui décide.
Validateur de sitemap
Vérifiez que votre sitemap XML est bien formé et repérez locs manquants et dates invalides.
Générateur de balises meta
Générez des balises title et meta propres et bien dimensionnées en quelques secondes.