crawl-ia.com

Liste des crawlers IA

Quel crawler IA vient lire votre site, pour quoi faire, comment le bloquer et comment vérifier que c'est bien lui. 985 plages d'adresses relues aujourd'hui chez 12 robots, directement sur les fichiers que publient les éditeurs.

Un nom d'agent ne prouve rien. N'importe qui écrit GPTBot dans un en-tête. Les journaux de serveurs en sont pleins. Seule l'adresse d'origine fait foi. C'est pour ça que cette page donne les plages officielles plutôt qu'une liste de noms.

Vérifier une adresse IP

Un visiteur se présente comme un robot d'IA dans vos journaux ? Collez son adresse.

Derrière un CDN, vos journaux ne montrent plus le visiteur. Cloudflare, Fastly et tout autre proxy inverse reçoivent la requête à votre place, puis la relaient. Ce que votre access.log enregistre, c'est donc leur adresse, la même poignée de plages pour un robot comme pour un humain. Les confronter aux plages de cette page ne peut jamais rien donner.

La vraie adresse du visiteur voyage dans un en-tête que pose le proxy. C'est elle qu'il faut comparer. Deux endroits pour le faire :

Et dans les deux cas, ne figez pas ces plages dans un fichier de configuration. Les éditeurs les changent sans préavis. Il faut retélécharger les fichiers JSON régulièrement et régénérer la liste, ce que fait cette page chaque jour.

Ce que votre site dit à chacun

Votre robots.txt est lu en direct et confronté aux 24 robots connus.

Trois usages, trois décisions différentes

C'est la distinction qui manque partout. C'est pourtant la seule qui compte : bloquer l'entraînement ne vous coûte rien, bloquer l'indexation vous fait disparaître des réponses.

Entraînement

Le contenu sert à entraîner un modèle. Bloquer protège votre contenu sans rien vous coûter en visibilité.

CrawlerÉditeur À quoi il sert Adresses Bloquer
GPTBot OpenAI Collecte du contenu pour l'entraînement des modèles GPT.
documentation
21 plages
source
ClaudeBot Anthropic Collecte du contenu pour l'entraînement des modèles Claude.
documentation
26 plages
source
Google-Extended Google N'est pas un robot mais une consigne : elle dit si Google peut se servir de vos pages pour entraîner Gemini. Le crawl reste fait par Googlebot. Le refuser ne vous retire pas de la recherche Google.
documentation
aucune
GoogleOther Google Usages internes de Google, hors recherche publique.
documentation
272 plages
source
CCBot Common Crawl Le robot de l'archive publique Common Crawl, qui n'entraîne aucun modèle mais dont les données servent à beaucoup. Le bloquer vous retire de la source de départ de nombreux modèles, cet outil compris.
documentation
5 plages
source
Applebot-Extended Apple Comme Google-Extended, une consigne : refuser l'usage de vos pages pour entraîner les modèles d'Apple, sans sortir de Siri.
documentation
aucune
Meta-ExternalAgent Meta Collecte pour l'entraînement des modèles Llama.
documentation
aucune
Bytespider ByteDance Collecte pour les modèles de ByteDance. Réputé peu respectueux du robots.txt. aucune
cohere-ai Cohere Collecte pour les modèles de Cohere. aucune
Diffbot Diffbot Transforme les pages en données structurées, revendues notamment pour l'entraînement.
documentation
aucune
omgili Webz.io Indexe forums et discussions, revendus comme corpus. aucune

Indexation pour les réponses

Le contenu est indexé pour être cité dans les réponses de l'assistant. Bloquer vous fait disparaître des réponses IA. C'est le choix le plus lourd.

CrawlerÉditeur À quoi il sert Adresses Bloquer
OAI-SearchBot OpenAI Indexe le web pour la recherche de ChatGPT. Le bloquer retire votre site des réponses sourcées d'OpenAI, sans rien changer à l'entraînement.
documentation
39 plages
source
Claude-SearchBot Anthropic Indexe le web pour les réponses de Claude.
documentation
26 plages
source
Googlebot Google Le robot de la recherche Google, qui alimente aussi les AI Overviews. Le bloquer vous sort de Google.
documentation
317 plages
source
PerplexityBot Perplexity Indexe le web pour le moteur de réponses de Perplexity.
documentation
8 plages
source
bingbot Microsoft Le robot de Bing, qui alimente aussi Copilot.
documentation
28 plages
source
Applebot Apple Alimente Siri et les suggestions Spotlight.
documentation
aucune
Amazonbot Amazon Alimente Alexa et les services Amazon.
documentation
aucune
DuckAssistBot DuckDuckGo Alimente les réponses assistées de DuckDuckGo.
documentation
aucune
YouBot You.com Indexe le web pour You.com.
documentation
aucune

Visite à la demande

Déclenché quand une personne colle votre adresse dans l'assistant. Bloquer casse la lecture pour quelqu'un qui voulait justement vous lire.

CrawlerÉditeur À quoi il sert Adresses Bloquer
ChatGPT-User OpenAI Va chercher une page précise parce qu'un utilisateur l'a demandée.
documentation
213 plages
source
Claude-User Anthropic Va chercher une page à la demande d'un utilisateur de Claude.
documentation
26 plages
source
Perplexity-User Perplexity Va chercher une page quand un utilisateur clique sur une source.
documentation
4 plages
source
MistralAI-User Mistral Va chercher une page à la demande d'un utilisateur du Chat.
documentation
aucune

Fabriquer votre robots.txt

Cochez ce que vous voulez refuser. Le fichier se met à jour tout seul.

Le robots.txt est une consigne, pas une barrière. Les robots sérieux la respectent, les autres non : sur ce point la seule mesure efficace est un filtrage par adresse, avec les plages ci-dessus.

Et après ?

Autoriser un robot ne suffit pas à être lu. Vérifiez ce que votre serveur répond réellement et ce qui est vraiment archivé, avec l'analyse de crawl-ia. Le classement des sites montre qui est le plus cité du web.