Définition
Qu'est-ce qu'un robot de récupération ?
Un robot de récupération est un agent qui va chercher une page au moment où une personne pose une question à un système d'IA, pour y répondre à partir de contenu à jour et en citer la source. Il se distingue du robot d'entraînement, qui collecte du contenu pour nourrir un modèle sans lien avec une question précise. Le bloquer vous retire des réponses que vos clients lisent.
Comment le reconnaître
Chaque robot s'annonce par un nom (son agent utilisateur) que son éditeur documente. Anthropic décrit Claude-User comme le robot qui va chercher une page quand une personne pose une question à Claude. OpenAI décrit ChatGPT-User comme l'agent de certaines actions déclenchées par une personne dans ChatGPT. Le critère reste le même : le passage du robot suit une question précise.
Ces passages ne se voient pas dans vos rapports de visites, parce que ces robots n'exécutent pas le code de suivi. Ils laissent une ligne dans vos journaux de serveur.
Trois familles de robots, trois décisions
Les éditeurs d'IA séparent maintenant leurs robots par fonction. Chez Anthropic, ClaudeBot collecte pour l'entraînement, Claude-SearchBot indexe le contenu pour la recherche et Claude-User va chercher une page à la demande. Chez OpenAI, GPTBot sert l'entraînement et OAI-SearchBot fait apparaître les sites dans la recherche de ChatGPT. Bloquer l'un n'en bloque pas les autres : chaque ligne du fichier robots.txt est une décision distincte.
Ses limites
Le fichier robots.txt exprime une préférence, pas une barrière. Les grands éditeurs documentent leurs robots et disent respecter le protocole, d'autres non. OpenAI précise même que les règles du fichier peuvent ne pas s'appliquer à ChatGPT-User, puisque l'action vient d'une personne. Pour empêcher réellement l'accès à une section, il faut un blocage côté serveur ou une authentification.
Une directrice des achats demande à Claude quels fabricants d'emballages desservent le Québec. Claude lance une recherche, retient votre page de services parmi les résultats, puis Claude-User va la chercher pour lire vos délais et vos certifications. La réponse cite votre page. Si votre robots.txt bloque Claude-User, Claude ne peut plus récupérer la page en réponse à la question, même si elle est indexée : la réponse pourrait alors s'écrire avec les pages de vos concurrents.
Nous lisons le robot de récupération comme un canal de visibilité, avec un lien et un visiteur possible au bout. Pour la quasi-totalité des entreprises, dont le contenu sert à vendre autre chose, il reste ouvert. La décision sur l'entraînement est séparée : elle dépend de la valeur marchande de votre contenu, pas de votre visibilité.
Le risque le plus fréquent est un blocage que personne n'a décidé. Un modèle de robots.txt copié en ligne ou modifié il y a des années par un ancien fournisseur ferme en bloc les robots d'entraînement et ceux qui citent. Personne ne mesure une absence : l'effet se découvre des mois plus tard.
À ne pas confondre avec
- Robot d'entraînement
- Il collecte du contenu pour nourrir un futur modèle, sans lien avec une question ni lien vers vous. Le bloquer limite l'usage futur de votre contenu sans effet immédiat sur votre visibilité.
- Robot de recherche
- Claude-SearchBot ou OAI-SearchBot parcourent le web à l'avance pour constituer l'index où l'assistant cherchera. Le robot de récupération passe après, au moment de la question. Bloquer le robot de recherche peut vous retirer de l'assistant en entier.
- Google-Extended
- Ce n'est pas un robot mais un jeton (le nom qu'on autorise ou bloque dans le robots.txt). Il couvre l'entraînement de Gemini et l'ancrage de ses réponses dans les applications Gemini, pas la recherche Google.
Concepts liés
- Surface de réponse
- Requête d'ancrage
- Index indépendant
- Fournisseur de recherche tiers
- Mesure de visibilité IA
- Trafic référé par l'IA
Pour aller plus loin
- Robots d'IA : lesquels autoriser ou bloquer sur votre site ?
- Bloquer Google-Extended affecte-t-il votre référencement sur Google ?
- Robots d'IA : quel impact sur votre trafic et vos coûts d'hébergement ?
- Quel moteur de recherche utilise ChatGPT ?
- Claude et Brave Search : comment rendre votre site accessible à l'IA
Services associés
Questions fréquentes
Comment savoir si mon site bloque les robots de récupération ?
Ouvrez votre fichier robots.txt (à l'adresse votredomaine.com/robots.txt) et lisez chaque ligne qui nomme un robot d'IA. Vérifiez ensuite dans vos journaux de serveur quels robots viennent réellement et sur quelles pages.