Deux familles de robots
Les éditeurs d'IA distinguent en général les robots d'entraînement, qui collectent des pages pour améliorer les futurs modèles, et les robots de recherche, qui lisent une page au moment où un utilisateur pose une question. Ce sont les seconds qui permettent d'être cité dans une réponse.
- OpenAI : GPTBot (entraînement), OAI-SearchBot (recherche dans ChatGPT), ChatGPT-User (pages ouvertes à la demande d'un utilisateur).
- Anthropic : ClaudeBot (entraînement), Claude-SearchBot (recherche), Claude-User (pages ouvertes à la demande d'un utilisateur).
- Perplexity : PerplexityBot (index de recherche), Perplexity-User (à la demande).
- Google : Google-Extended est un jeton qui contrôle l'usage de vos pages pour les modèles Gemini ; la recherche Google et ses réponses générées passent par Googlebot.
Vérifier ce que bloque votre site
Ouvrez votre-site.fr/robots.txt. Une ligne « User-agent: * » suivie de « Disallow: / » bloque tout le monde, robots des IA compris. Des lignes nommant GPTBot ou ClaudeBot avec « Disallow: / » ne bloquent que ceux-là. Vérifiez aussi votre pare-feu ou votre CDN : certaines protections anti-robots bloquent ces visiteurs sans que le robots.txt le dise.
Que faire
Si vous voulez être recommandé, laissez passer au minimum les robots de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot) et ne bloquez pas Googlebot. Vous pouvez refuser l'entraînement (GPTBot, ClaudeBot, Google-Extended) sans perdre la citation dans les réponses en direct : c'est un choix de principe, pas de visibilité immédiate.
Être lisible, pas seulement autorisé
Un robot autorisé doit encore pouvoir lire votre page. Les contenus affichés uniquement par JavaScript, derrière un clic ou dans une image sont mal compris. Le métier, la ville, les services et les coordonnées doivent figurer en texte dans la page.
Où en est votre entreprise ?
Nous posons vos questions aux IA, plusieurs fois, et nous vous montrons qui elles citent à votre place, et pourquoi.
Demander une étude