Testeur
robots.txt.

Collez une URL : on récupère le robots.txt du domaine, on applique ses règles à ce chemin précis et on vous dit qui passe, qui est bloqué, et par quelle ligne exactement.

Aucune donnée n'est publiée. Seule l'URL testée est conservée.

Audit offert · 30 min

Un blocage que vous ne vous expliquez pas ?

Un robots.txt mal réglé peut coûter des mois de visibilité sans qu'aucune alerte ne se déclenche. On regarde votre configuration technique complète, exploration, indexation et rendu compris.

Nous contacter
FAQ

Les questions
qu'on nous pose
tout le temps.

Vous ne trouvez pas votre réponse ? On répond sous 24 h ouvrées.

Poser une question

Il indique aux robots d'exploration quelles parties du site ils peuvent parcourir. C'est une consigne, pas une sécurité : un robot malveillant l'ignore, et une page bloquée par robots.txt peut malgré tout apparaître dans les résultats si d'autres sites pointent vers elle. Pour empêcher réellement l'indexation d'une page, il faut la laisser explorable et y placer une balise meta robots noindex.

Parce que robots.txt interdit l'exploration, pas l'indexation. Google connaît l'URL par les liens qui pointent vers elle, ne peut pas lire son contenu, et affiche donc un résultat sans description. La bonne combinaison est l'inverse de l'intuition : autoriser l'exploration et poser un noindex sur la page.

Cela dépend de ce que vous vendez. Un média qui monétise ses contenus a des raisons de restreindre l'accès aux robots d'entraînement. Une marque qui veut être recommandée par ChatGPT ou Perplexity a tout intérêt à les laisser passer : un robot bloqué ne peut pas citer votre page. Notez que certains agents servent l'entraînement et d'autres la recherche en direct, et que le bon arbitrage se fait agent par agent.

Google et Bing appliquent la règle la plus spécifique, c'est-à-dire celle dont le chemin déclaré est le plus long. À longueur égale, Allow l'emporte. C'est ce qui permet d'écrire « Disallow: /wp-admin/ » suivi de « Allow: /wp-admin/admin-ajax.php » sans se contredire. Cet outil applique la même logique.

Non. Chaque robot retient un seul groupe : celui qui le nomme explicitement, ou à défaut le groupe « User-agent: * ». Si votre fichier contient un groupe Googlebot, Googlebot ignore entièrement le groupe joker, y compris les directives qui n'apparaissent que là. C'est l'erreur de configuration la plus fréquente.

Strictement à la racine du domaine, en https://votredomaine.fr/robots.txt, servi en text/plain avec un code 200. Un fichier placé dans un sous-dossier n'est jamais lu. Chaque sous-domaine a besoin du sien.

C'est le scénario le plus dangereux. Face à une erreur serveur persistante sur robots.txt, Google suspend l'exploration du site entier par précaution, considérant qu'il ne peut pas savoir ce qui est autorisé. Une 404 est sans conséquence, une 5xx prolongée peut faire disparaître un site des résultats.