Sites web & applications métierDans vos locaux ou à distance

  • Conception, hébergement, maintenance
  • Du lundi au vendredi
  • 06 81 88 95 21

Référencement et GEO

Sitemap.xml et robots.txt : à quoi servent-ils ?

Mis à jour le · 3 min de lecture · NexSecure

En bref

Le fichier sitemap.xml liste les adresses d'un site que vous souhaitez faire explorer par les moteurs de recherche. Le fichier robots.txt, placé à la racine du site, indique aux robots les parties qu'ils peuvent ou non explorer. Le premier aide à découvrir les pages, le second encadre l'exploration ; aucun des deux ne décide seul de l'indexation.

Ces deux fichiers techniques s'adressent aux robots d'exploration, les programmes qui parcourent le web pour le compte des moteurs de recherche. Ils sont souvent générés automatiquement par le CMS, et souvent mal compris. Une ligne de trop dans le robots.txt peut rendre un site entier invisible ; un sitemap rempli d'adresses en erreur brouille le travail des moteurs.

Qu'est-ce qu'un fichier sitemap.xml ?

Un sitemap est un fichier au format XML qui liste les adresses d'un site, avec éventuellement leur date de dernière modification. Il aide les moteurs à découvrir les pages, surtout celles qui reçoivent peu de liens internes ou qui viennent d'être publiées.

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url><loc>https://www.exemple.fr/services/</loc><lastmod>2026-01-15</lastmod></url>
</urlset>

Les règles d'un bon sitemap

  • N'y mettre que des adresses qui répondent correctement, sans redirection ni erreur.
  • N'y mettre que les versions canoniques des pages, celles que vous voulez voir dans les résultats.
  • Exclure les pages marquées noindex.
  • Renseigner lastmod seulement avec des dates exactes : Google l'utilise quand elle est fiable, et ignore les champs priority et changefreq.
  • Découper en plusieurs fichiers réunis par un index au-delà de 50 000 adresses ou 50 Mo non compressés par fichier, limites fixées par le protocole.

Qu'est-ce que le fichier robots.txt ?

Le fichier robots.txt se place à la racine du domaine, par exemple https://www.exemple.fr/robots.txt. Il contient des règles adressées à un robot précis ou à tous les robots :

User-agent: *
Disallow: /admin/

Sitemap: https://www.exemple.fr/sitemap.xml

  • User-agent désigne le robot concerné ; l'astérisque vise tous les robots.
  • Disallow interdit l'exploration d'un chemin ; Allow l'autorise explicitement.
  • Sitemap indique l'adresse du sitemap.

Les principaux moteurs respectent ces règles, mais rien n'y oblige un robot malveillant. Le fichier est public : n'y listez jamais un chemin que vous voulez garder secret.

Pourquoi robots.txt n'empêche-t-il pas l'indexation ?

C'est l'erreur la plus fréquente. Le robots.txt bloque l'exploration, c'est-à-dire la lecture de la page. Il ne bloque pas l'indexation, c'est-à-dire l'enregistrement de l'adresse dans l'index du moteur. Une page bloquée mais citée par des liens peut apparaître dans les résultats, sans description.

Pour exclure une page des résultats, utilisez la balise <meta name="robots" content="noindex"> et laissez la page explorable : le robot doit pouvoir lire la balise pour l'appliquer.

ObjectifOutil adapté
Faire découvrir des pagessitemap.xml et liens internes
Éviter l'exploration d'une zone sans intérêtrobots.txt
Retirer une page des résultatsBalise noindex, page explorable
Protéger un contenu confidentielAuthentification, jamais robots.txt

Comment les déclarer et les vérifier ?

  1. Ouvrez /robots.txt et l'adresse de votre sitemap dans un navigateur pour vérifier qu'ils s'affichent.
  2. Dans Google Search Console, soumettez le sitemap dans le rapport Sitemaps et surveillez le nombre d'adresses découvertes.
  3. Consultez le rapport robots.txt de Search Console pour voir la version lue par Google et les éventuelles erreurs.
  4. Testez une page importante avec l'outil d'inspection d'URL pour confirmer qu'elle n'est pas bloquée.
  5. Faites de même dans Bing Webmaster Tools.

Et les robots des outils d'IA ?

Les principaux éditeurs d'IA publient les noms de leurs robots et indiquent respecter le robots.txt. Vous pouvez donc autoriser ou bloquer chacun séparément. Google propose par exemple Google-Extended, une règle qui contrôle l'utilisation de vos contenus pour ses modèles d'IA sans modifier l'exploration par Googlebot pour la recherche. Avant de bloquer un robot, vérifiez à quoi il sert : bloquer le robot de recherche d'un outil d'IA réduit vos chances d'y être cité.

Ces fichiers relèvent des fondations du SEO. Un troisième fichier, le llms.txt, est parfois ajouté à cet ensemble, sans rôle d'accès. NexSecure contrôle leur cohérence dans le cadre de la maintenance de site internet.

Questions fréquentes

Un site sans sitemap peut-il être indexé ?

Oui. Les moteurs découvrent aussi les pages en suivant les liens. Le sitemap facilite la découverte, surtout sur un site récent ou volumineux.

Comment retirer une page de Google ?

Ajoutez une balise noindex et laissez la page accessible aux robots. Pour un masquage rapide et temporaire, Search Console propose aussi un outil de suppression.

Le robots.txt protège-t-il des données sensibles ?

Non. Le fichier est public et seuls les robots respectueux l'appliquent. Un contenu confidentiel doit être protégé par une authentification.

Où doit se trouver le fichier robots.txt ?

À la racine de chaque hôte, par exemple https://www.exemple.fr/robots.txt. Un sous-domaine a besoin de son propre fichier.

Sources

Service lié

Maintenance & mises à jour

Articles liés

Rédigé par l'équipe NexSecure. Responsable de la publication : Yohann Toumine. Dernière mise à jour le 11 septembre 2026.

Une question sur votre situation ? Parler de votre projet