Quel crawler IA vient lire votre site, pour quoi faire, comment le bloquer et comment vérifier que c'est bien lui. 985 plages d'adresses relues aujourd'hui chez 12 robots, directement sur les fichiers que publient les éditeurs.
Un visiteur se présente comme un robot d'IA dans vos journaux ? Collez son adresse.
La vraie adresse du visiteur voyage dans un en-tête que pose le proxy. C'est elle qu'il faut comparer. Deux endroits pour le faire :
Et dans les deux cas, ne figez pas ces plages dans un fichier de configuration. Les éditeurs les changent sans préavis. Il faut retélécharger les fichiers JSON régulièrement et régénérer la liste, ce que fait cette page chaque jour.
Votre robots.txt est lu en direct et confronté aux 24 robots connus.
C'est la distinction qui manque partout. C'est pourtant la seule qui compte : bloquer l'entraînement ne vous coûte rien, bloquer l'indexation vous fait disparaître des réponses.
Le contenu sert à entraîner un modèle. Bloquer protège votre contenu sans rien vous coûter en visibilité.
| Crawler | Éditeur | À quoi il sert | Adresses | Bloquer |
|---|---|---|---|---|
| GPTBot | OpenAI | Collecte du contenu pour l'entraînement des modèles GPT. documentation |
21 plages
source |
|
| ClaudeBot | Anthropic | Collecte du contenu pour l'entraînement des modèles Claude. documentation |
26 plages
source |
|
| Google-Extended | N'est pas un robot mais une consigne : elle dit si Google peut se servir de vos pages pour entraîner Gemini. Le crawl reste fait par Googlebot. Le refuser ne vous retire pas de la recherche Google. documentation |
aucune | ||
| GoogleOther | Usages internes de Google, hors recherche publique. documentation |
272 plages
source |
||
| CCBot | Common Crawl | Le robot de l'archive publique Common Crawl, qui n'entraîne aucun modèle mais dont les données servent à beaucoup. Le bloquer vous retire de la source de départ de nombreux modèles, cet outil compris. documentation |
5 plages
source |
|
| Applebot-Extended | Apple | Comme Google-Extended, une consigne : refuser l'usage de vos pages pour entraîner les modèles d'Apple, sans sortir de Siri. documentation |
aucune | |
| Meta-ExternalAgent | Meta | Collecte pour l'entraînement des modèles Llama. documentation |
aucune | |
| Bytespider | ByteDance | Collecte pour les modèles de ByteDance. Réputé peu respectueux du robots.txt. | aucune | |
| cohere-ai | Cohere | Collecte pour les modèles de Cohere. | aucune | |
| Diffbot | Diffbot | Transforme les pages en données structurées, revendues notamment pour l'entraînement. documentation |
aucune | |
| omgili | Webz.io | Indexe forums et discussions, revendus comme corpus. | aucune | |
Le contenu est indexé pour être cité dans les réponses de l'assistant. Bloquer vous fait disparaître des réponses IA. C'est le choix le plus lourd.
| Crawler | Éditeur | À quoi il sert | Adresses | Bloquer |
|---|---|---|---|---|
| OAI-SearchBot | OpenAI | Indexe le web pour la recherche de ChatGPT. Le bloquer retire votre site des réponses sourcées d'OpenAI, sans rien changer à l'entraînement. documentation |
39 plages
source |
|
| Claude-SearchBot | Anthropic | Indexe le web pour les réponses de Claude. documentation |
26 plages
source |
|
| Googlebot | Le robot de la recherche Google, qui alimente aussi les AI Overviews. Le bloquer vous sort de Google. documentation |
317 plages
source |
||
| PerplexityBot | Perplexity | Indexe le web pour le moteur de réponses de Perplexity. documentation |
8 plages
source |
|
| bingbot | Microsoft | Le robot de Bing, qui alimente aussi Copilot. documentation |
28 plages
source |
|
| Applebot | Apple | Alimente Siri et les suggestions Spotlight. documentation |
aucune | |
| Amazonbot | Amazon | Alimente Alexa et les services Amazon. documentation |
aucune | |
| DuckAssistBot | DuckDuckGo | Alimente les réponses assistées de DuckDuckGo. documentation |
aucune | |
| YouBot | You.com | Indexe le web pour You.com. documentation |
aucune | |
Déclenché quand une personne colle votre adresse dans l'assistant. Bloquer casse la lecture pour quelqu'un qui voulait justement vous lire.
| Crawler | Éditeur | À quoi il sert | Adresses | Bloquer |
|---|---|---|---|---|
| ChatGPT-User | OpenAI | Va chercher une page précise parce qu'un utilisateur l'a demandée. documentation |
213 plages
source |
|
| Claude-User | Anthropic | Va chercher une page à la demande d'un utilisateur de Claude. documentation |
26 plages
source |
|
| Perplexity-User | Perplexity | Va chercher une page quand un utilisateur clique sur une source. documentation |
4 plages
source |
|
| MistralAI-User | Mistral | Va chercher une page à la demande d'un utilisateur du Chat. documentation |
aucune | |
Cochez ce que vous voulez refuser. Le fichier se met à jour tout seul.
Le robots.txt est une consigne, pas une barrière. Les robots sérieux la respectent, les autres non : sur ce point la seule mesure efficace est un filtrage par adresse, avec les plages ci-dessus.
Autoriser un robot ne suffit pas à être lu. Vérifiez ce que votre serveur répond réellement et ce qui est vraiment archivé, avec l'analyse de crawl-ia. Le classement des sites montre qui est le plus cité du web.