Sitemap.xml et robots.txt : à quoi servent-ils ?
En bref
Le fichier sitemap.xml liste les adresses d'un site que vous souhaitez faire explorer par les moteurs de recherche. Le fichier robots.txt, placé à la racine du site, indique aux robots les parties qu'ils peuvent ou non explorer. Le premier aide à découvrir les pages, le second encadre l'exploration ; aucun des deux ne décide seul de l'indexation.
Ces deux fichiers techniques s'adressent aux robots d'exploration, les programmes qui parcourent le web pour le compte des moteurs de recherche. Ils sont souvent générés automatiquement par le CMS, et souvent mal compris. Une ligne de trop dans le robots.txt peut rendre un site entier invisible ; un sitemap rempli d'adresses en erreur brouille le travail des moteurs.
Qu'est-ce qu'un fichier sitemap.xml ?
Un sitemap est un fichier au format XML qui liste les adresses d'un site, avec éventuellement leur date de dernière modification. Il aide les moteurs à découvrir les pages, surtout celles qui reçoivent peu de liens internes ou qui viennent d'être publiées.
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url><loc>https://www.exemple.fr/services/</loc><lastmod>2026-01-15</lastmod></url>
</urlset>
Les règles d'un bon sitemap
- N'y mettre que des adresses qui répondent correctement, sans redirection ni erreur.
- N'y mettre que les versions canoniques des pages, celles que vous voulez voir dans les résultats.
- Exclure les pages marquées
noindex. - Renseigner
lastmodseulement avec des dates exactes : Google l'utilise quand elle est fiable, et ignore les champspriorityetchangefreq. - Découper en plusieurs fichiers réunis par un index au-delà de 50 000 adresses ou 50 Mo non compressés par fichier, limites fixées par le protocole.
Qu'est-ce que le fichier robots.txt ?
Le fichier robots.txt se place à la racine du domaine, par exemple https://www.exemple.fr/robots.txt. Il contient des règles adressées à un robot précis ou à tous les robots :
User-agent: *
Disallow: /admin/
Sitemap: https://www.exemple.fr/sitemap.xml
User-agentdésigne le robot concerné ; l'astérisque vise tous les robots.Disallowinterdit l'exploration d'un chemin ;Allowl'autorise explicitement.Sitemapindique l'adresse du sitemap.
Les principaux moteurs respectent ces règles, mais rien n'y oblige un robot malveillant. Le fichier est public : n'y listez jamais un chemin que vous voulez garder secret.
Pourquoi robots.txt n'empêche-t-il pas l'indexation ?
C'est l'erreur la plus fréquente. Le robots.txt bloque l'exploration, c'est-à-dire la lecture de la page. Il ne bloque pas l'indexation, c'est-à-dire l'enregistrement de l'adresse dans l'index du moteur. Une page bloquée mais citée par des liens peut apparaître dans les résultats, sans description.
Pour exclure une page des résultats, utilisez la balise <meta name="robots" content="noindex"> et laissez la page explorable : le robot doit pouvoir lire la balise pour l'appliquer.
| Objectif | Outil adapté |
|---|---|
| Faire découvrir des pages | sitemap.xml et liens internes |
| Éviter l'exploration d'une zone sans intérêt | robots.txt |
| Retirer une page des résultats | Balise noindex, page explorable |
| Protéger un contenu confidentiel | Authentification, jamais robots.txt |
Comment les déclarer et les vérifier ?
- Ouvrez
/robots.txtet l'adresse de votre sitemap dans un navigateur pour vérifier qu'ils s'affichent. - Dans Google Search Console, soumettez le sitemap dans le rapport Sitemaps et surveillez le nombre d'adresses découvertes.
- Consultez le rapport robots.txt de Search Console pour voir la version lue par Google et les éventuelles erreurs.
- Testez une page importante avec l'outil d'inspection d'URL pour confirmer qu'elle n'est pas bloquée.
- Faites de même dans Bing Webmaster Tools.
Et les robots des outils d'IA ?
Les principaux éditeurs d'IA publient les noms de leurs robots et indiquent respecter le robots.txt. Vous pouvez donc autoriser ou bloquer chacun séparément. Google propose par exemple Google-Extended, une règle qui contrôle l'utilisation de vos contenus pour ses modèles d'IA sans modifier l'exploration par Googlebot pour la recherche. Avant de bloquer un robot, vérifiez à quoi il sert : bloquer le robot de recherche d'un outil d'IA réduit vos chances d'y être cité.
Ces fichiers relèvent des fondations du SEO. Un troisième fichier, le llms.txt, est parfois ajouté à cet ensemble, sans rôle d'accès. NexSecure contrôle leur cohérence dans le cadre de la maintenance de site internet.
Questions fréquentes
Un site sans sitemap peut-il être indexé ?
Oui. Les moteurs découvrent aussi les pages en suivant les liens. Le sitemap facilite la découverte, surtout sur un site récent ou volumineux.
Comment retirer une page de Google ?
Ajoutez une balise noindex et laissez la page accessible aux robots. Pour un masquage rapide et temporaire, Search Console propose aussi un outil de suppression.
Le robots.txt protège-t-il des données sensibles ?
Non. Le fichier est public et seuls les robots respectueux l'appliquent. Un contenu confidentiel doit être protégé par une authentification.
Où doit se trouver le fichier robots.txt ?
À la racine de chaque hôte, par exemple https://www.exemple.fr/robots.txt. Un sous-domaine a besoin de son propre fichier.
Sources
Service lié
Articles liés
Rédigé par l'équipe NexSecure. Responsable de la publication : Yohann Toumine. Dernière mise à jour le 11 septembre 2026.
Une question sur votre situation ? Parler de votre projet