CHECKCYBER

robots.txt : ne pas révéler vos chemins sensibles

Voici une idée fausse étonnamment répandue : croire que mettre un chemin en Disallow dans robots.txt le « cache ». C'est exactement l'inverse. Le fichier robots.txt est, par nature, public et lisible par tout le monde à l'adresse votresite.fr/robots.txt — c'est même sa raison d'être.

Résultat : y lister /admin, /backup, /config ou /ancienne-version revient à publier une carte au trésor de vos zones sensibles, gracieusement offerte aux attaquants. Et c'est l'un des tout premiers fichiers qu'un attaquant consulte lors de sa phase de reconnaissance. Comprendre ce que robots.txt fait — et surtout ce qu'il ne fait pas — vous évite d'en faire une faille.

À quoi sert vraiment robots.txt

robots.txt est une consigne d'indexation adressée aux moteurs de recherche bien intentionnés : il leur indique quelles pages ne pas explorer ou indexer. C'est utile pour préserver votre budget de crawl ou éviter d'indexer des pages techniques. Mais ce n'est en aucun cas un contrôle d'accès : il n'empêche personne d'accéder aux pages, il demande seulement poliment aux robots respectueux de ne pas les indexer.

Deux limites en découlent. D'une part, un robot malveillant (ou un scanner d'attaque) ignore totalement robots.txt. D'autre part, le fichier lui-même révèle publiquement chaque chemin que vous y listez. Mettre une zone sensible en Disallow, c'est donc cumuler le pire : ne pas la protéger, tout en la signalant. CheckCyber repère d'ailleurs les chemins potentiellement sensibles (admin, login, backup, config, .git…) présents dans votre robots.txt.

La bonne approche

La règle est simple : ne référencez jamais de chemin sensible dans robots.txt. La vraie protection d'une zone d'administration ou de données privées passe par un contrôle d'accès — une authentification par mot de passe — qui empêche réellement l'accès, robot ou humain.

Si votre objectif est seulement d'éviter qu'une page publique soit indexée par Google (sans la rendre confidentielle), n'utilisez pas robots.txt mais la balise meta noindex ou l'en-tête X-Robots-Tag directement sur la page : c'est plus fiable et cela n'expose aucun chemin dans un fichier public.

robots.txt — à éviter / à préférer
# À ÉVITER (révèle le chemin) :
Disallow: /admin-secret/

# À PRÉFÉRER : protéger /admin par authentification
# et ne rien lister de sensible ici.
Empêcher l’indexation sans rien révéler (sur la page)
<!-- Dans le <head> de la page concernée -->
<meta name="robots" content="noindex, nofollow">

# ou via en-tête HTTP côté serveur :
X-Robots-Tag: noindex, nofollow

Vérifier votre robots.txt

Ouvrez simplement votresite.fr/robots.txt et lisez-le comme le ferait un attaquant : aucun chemin listé ne doit constituer un indice utile vers une zone sensible. Si vous en trouvez, retirez-les et protégez les zones concernées par une vraie authentification. Un audit CheckCyber automatise ce repérage en signalant les motifs sensibles.

[ FAQ // QUESTIONS FRÉQUENTES ]

Comment empêcher Google d’indexer une page sans la révéler ?

Utilisez une balise <meta name="robots" content="noindex"> dans le <head> de la page, ou un en-tête HTTP X-Robots-Tag: noindex. Contrairement à un Disallow dans robots.txt, ces méthodes n'exposent pas le chemin publiquement. Pour une vraie confidentialité, ajoutez en plus une authentification.

Faut-il supprimer complètement robots.txt ?

Non, il reste utile pour guider l'indexation et indiquer l'emplacement de votre sitemap. Il faut simplement ne jamais y faire figurer de chemin sensible : gardez-y des règles d'indexation générales, pas une liste de vos zones privées.

Disallow protège-t-il au moins un peu une page ?

Non, il n'offre aucune protection d'accès : la page reste librement consultable par quiconque connaît son URL, et le Disallow révèle justement cette URL. Pour protéger, il faut un contrôle d'accès côté serveur, jamais une simple directive robots.txt.

[ PASSEZ À L’ACTION ]

Votre site est-il concerné ?

Lancez un audit de surface gratuit et obtenez en quelques secondes la liste exacte de vos failles, avec le correctif pour chacune. Anonyme, sans inscription.

▶ Auditer mon site

[ À LIRE AUSSI ]

[ CheckCyber // MIS À JOUR LE 2026-06-29 ]