Aller au contenu
Offre de rentrée · −50 % à vie sur la plateforme, pour toute souscription avant le 30 septembre. Voir l’offre →
Outil gratuit

Vérificateur de crawlers IA

Collez votre domaine et voyez, crawler par crawler, lequel peut lire votre site et lequel en est écarté. Dix-huit robots IA vérifiés, avec l'effet réel de chaque blocage.

Nous lisons le robots.txt de ce domaine et appliquons les règles de correspondance officielles, crawler par crawler.

Le blocage le plus coûteux est celui que vous ignorez

Un robots.txt hérité d'une autre époque, une règle copiée sur un forum, un réglage par défaut de votre hébergeur : les blocages de crawlers IA sont rarement décidés, ils sont subis. Le site continue de fonctionner, le trafic Google ne bouge pas, et la disparition des réponses d'assistants ne déclenche aucune alerte.

C'est la raison d'être de cet outil. Il ne vous dit pas seulement ce qui est bloqué, il vous dit ce que ce blocage vous coûte : un crawler d'entraînement écarté ne change rien à vos réponses d'aujourd'hui, un crawler d'index écarté vous en retire entièrement.

Les trois familles de crawlers IA

Les robots IA ne font pas tous la même chose, et les confondre conduit aux mauvaises décisions. Les crawlers d'entraînement collectent du texte pour les modèles à venir. Les crawlers d'index construisent la base de connaissances interrogée au moment de répondre. Les crawlers de lecture directe vont chercher une page précise parce qu'un utilisateur vient de poser une question.

OpenAI, Anthropic et Perplexity opèrent chacun plusieurs agents relevant de familles différentes, configurables séparément. Vous pouvez donc refuser l'entraînement tout en restant pleinement visible dans les réponses. C'est l'arbitrage que la plupart des entreprises veulent, et celui que le blocage global détruit.

Une fois l'accès réglé, mesurez ce qu'il produit avec le vérificateur de citabilité.

Pourquoi cela compte pour le GEO

  • L'accès précède tout le reste: Aucun travail éditorial ne compense un crawler bloqué. C'est la seule vérification qui invalide tout le reste quand elle échoue.

  • Le coût du blocage dépend du crawler: Refuser l'entraînement est un choix de licence. Refuser l'index est un retrait des réponses.

  • Les réglages par défaut sont rarement les vôtres: Beaucoup de blocages viennent d'un modèle d'hébergeur ou d'une règle copiée, jamais d'une décision explicite.

  • Une vérification ne suffit pas: Un robots.txt change au fil des migrations et des déploiements. Ce contrôle a vocation à être répété.

Autoriser les crawlers est le point de départ. Citeme vérifie ensuite si les moteurs vous citent réellement, sur dix moteurs et chaque semaine.

Questions fréquentes

Un crawler IA est un robot opéré par une entreprise d'intelligence artificielle qui lit les pages web pour qu'un modèle puisse les exploiter. Il en existe trois catégories que l'on confond couramment. Les crawlers d'entraînement comme GPTBot, ClaudeBot et Google-Extended collectent du texte susceptible d'entraîner les futurs modèles. Les crawlers d'index comme OAI-SearchBot, PerplexityBot et Claude-SearchBot construisent la base que l'assistant interroge au moment de répondre. Les crawlers de lecture directe comme ChatGPT-User et Perplexity-User vont chercher une page à l'instant, parce qu'un utilisateur vient de poser une question qui l'exige. La distinction compte parce que les conséquences diffèrent. Bloquer un crawler d'entraînement agit sur des modèles qui n'existent pas encore. Bloquer un crawler d'index ou de lecture directe vous retire des réponses générées aujourd'hui.