Le fichier robots.txt est un texte placé à la racine d’un site qui indique aux moteurs de recherche quels contenus ils peuvent ou ne peuvent pas explorer.
À quoi ça sert
Il sert à :
- Protéger les pages sensibles (back‑office, tests, PDF internes).
- Optimiser le budget d’exploration en excluant les sections non utiles.
- Éviter la duplication de contenu qui pénalise le référencement.
- Faciliter la conformité RGPD en bloquant l’indexation de données personnelles.
Exemple concret
Un site e‑commerce peut contenir :
User-agent: * Disallow: /admin/ Disallow: /private/ Allow: /public/
Les robots indexent uniquement le répertoire /public, tandis que les dossiers /admin et /private restent invisibles aux moteurs.
Pourquoi c’est crucial en 2026
En 2026, les moteurs utilisent l’IA pour analyser le contexte et le volume d’URL. Un robots.txt mal configuré entraîne :
- Une surcharge du serveur (crawl excessif).
- Des fuites de données confidentielles vers les SERP.
- Une perte de visibilité à cause d’une indexation non ciblée.
Un fichier à jour garantit un crawl efficace, protège la réputation digitale et améliore le ROI SEO.
Questions fréquentes
Le robots.txt bloque‑t‑il l’accès aux internautes ?
Non, il ne restreint que les robots d’exploration ; les visiteurs peuvent toujours accéder aux pages.
Dois‑je mettre un robots.txt sur chaque sous‑domaine ?
Oui, chaque sous‑domaine possède son propre fichier à la racine pour contrôler son crawl indépendamment.
Comment vérifier que mon robots.txt fonctionne ?
Utilisez les outils de test de Google Search Console ou les requêtes curl pour voir la réponse du serveur.
Recevez votre audit gratuit sous 24 h
On analyse votre présence (site, Google, IA) et on vous dit exactement quoi améliorer. Sans engagement.
Recevoir mon audit gratuit →