AI

Welke AI-bots moet je toelaten op je website? (volledige lijst)

Het korte antwoord

Laat altijd de zoekbots door: OAI-SearchBot (ChatGPT), PerplexityBot, Claude-SearchBot en Googlebot. Die bepalen of je in AI-antwoorden verschijnt. De trainingsbots — GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, Meta-ExternalAgent — mag je blokkeren als je niet wil dat je content in modellen belandt; dat kost je geen zichtbaarheid. Het onderscheid tussen die twee groepen is het hele verhaal.

De twee soorten bots, en waarom je ze niet mag verwarren

Een AI-bedrijf stuurt niet één crawler naar je site maar meerdere, en ze doen andere dingen. De ene bouwt trainingsdata voor het model. De andere bouwt de zoekindex waar het model uit put wanneer iemand een vraag stelt. Een derde haalt live een pagina op omdat een gebruiker net die link deelde.

Blokkeren van de eerste groep is een keuze over je auteursrecht. Blokkeren van de tweede groep is jezelf uit de zoekresultaten schrijven. Dat wordt in de praktijk voortdurend door elkaar gehaald.

De volledige tabel

User-agentVan wieWat het doetBlokkeren?
OAI-SearchBotOpenAIBouwt de zoekindex van ChatGPTNooit
GPTBotOpenAIVerzamelt trainingsdataMag
ChatGPT-UserOpenAIHaalt live een pagina op voor een gebruikerNooit
PerplexityBotPerplexityZoekindex — traint nietNooit
Perplexity-UserPerplexityLive ophalen bij een vraagNooit
Claude-SearchBotAnthropicZoekkwaliteit van ClaudeNooit
Claude-UserAnthropicLive ophalen bij een vraagNooit
ClaudeBotAnthropicVerzamelt trainingsdataMag
GooglebotGoogleZoekindex — ook de basis van AI OverviewsNooit
Google-ExtendedGoogleAlleen Gemini-trainingMag
ApplebotAppleSiri, Spotlight, SafariNooit
Applebot-ExtendedAppleAlleen training Apple IntelligenceMag
Meta-ExternalAgentMetaCrawl en training voor Meta AIMag
BingbotMicrosoftZoekindex Bing en CopilotNooit

⚠️ Google is hier expliciet over in zijn documentatie: Google-Extended heeft geen invloed op je opname in Google Search en is geen rankingsignaal. Apple zegt hetzelfde over Applebot-Extended.

Een robots.txt die klopt

Wil je alles toelaten — voor de meeste KMO's is dat de juiste keuze — dan volstaat dit:

  • User-agent: *
  • Allow: /
  • Sitemap: https://www.jouwdomein.be/sitemap.xml

Wil je niet dat je content gebruikt wordt om modellen te trainen?

Dat is een legitieme keuze, en je kan hem maken zonder je zichtbaarheid op te geven. Zet dan alleen de trainingsbots op slot en laat de zoekbots met rust:

  • User-agent: GPTBot → Disallow: /
  • User-agent: ClaudeBot → Disallow: /
  • User-agent: Google-Extended → Disallow: /
  • User-agent: Applebot-Extended → Disallow: /
  • User-agent: meta-externalagent → Disallow: /
  • En verder niets. OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot en Bingbot blijven welkom.

Twee bots die je robots.txt negeren

Wees eerlijk over de grenzen van dit systeem. ChatGPT-User en Perplexity-User halen een pagina op omdat een gebruiker daar op dat moment om vraagt. OpenAI schrijft in zijn documentatie dat robots.txt-regels daar mogelijk niet op van toepassing zijn; Perplexity is er nog directer over.

Dat is verdedigbaar — het is technisch hetzelfde als iemand die zelf op je link klikt — maar reken er niet op dat robots.txt een muur is. Het is een bordje, geen slot.

Controleer of het klopt

Typ je domein in met /robots.txt erachter en lees wat er staat. Drie dingen om op te letten:

  • Staat er ergens een blok met tientallen AI-bots op Disallow? Dan draait er waarschijnlijk Cloudflare-beheer op je site, niet je eigen keuze.
  • Staat er een Content-Signal-regel? Dat is Cloudflare, en de standaardwaarde is ai-train=no.
  • Staat er een Sitemap-regel? Zonder sitemap moeten de bots je pagina's zelf bij elkaar sprokkelen.

Veelgestelde vragen

Verlies ik Google-posities als ik Google-Extended blokkeer?
Nee. Google documenteert dat expliciet: Google-Extended heeft geen invloed op opname in Google Search en telt niet mee als rankingsignaal. Of het AI Overviews raakt, zegt Google niet — die draaien op de gewone Search-index, dus waarschijnlijk niet.
Mijn site draait op Cloudflare. Moet ik iets doen?
Kijk het na. Cloudflare rolde in september 2025 een Content Signals Policy uit naar meer dan 3,8 miljoen domeinen, met als standaard search=yes en ai-train=no. Voor de meeste bedrijven is dat prima, maar het is wel een keuze die voor je gemaakt is.
Helpt het om AI-bots expliciet toe te laten?
Technisch verandert het niets — wat niet verboden is, is toegelaten. Maar het maakt je keuze zichtbaar voor wie je robots.txt leest, en het voorkomt dat een plugin of hostingpartij er later stilletjes iets in zet.

Bronnen

  1. OpenAI: overzicht van de botsOpenAI
  2. Anthropic: crawlt Anthropic het web?Anthropic
  3. Perplexity: bots en user-agentsPerplexity
  4. Google: veelvoorkomende crawlersGoogle Search Central
  5. Apple: over ApplebotApple
  6. Cloudflare Content Signals PolicyCloudflare, september 2025
Foto van Pieter Herremans, Strategie & klanten bij VIEWS

Geschreven door

Pieter Herremans

Strategie & klanten bij VIEWS

Pieter voert de gesprekken met zaakvoerders en vertaalt hun cijfers naar een campagne. Wat hier staat komt uit die gesprekken.

Wil je dit voor jouw bedrijf laten werken?

We bekijken je huidige instroom, rekenen door of het rendeert, en zeggen het ook als het niet past.

Ontdek wat mogelijk is voor jouw bedrijf

Kijken ze naar jouw bedrijf, of naar dat van je concurrent?

Laat je gegevens achter en we bellen je binnen een werkdag. Geen verplichting, geen pitch.

Plan mijn gesprek