De twee soorten bots, en waarom je ze niet mag verwarren
Een AI-bedrijf stuurt niet één crawler naar je site maar meerdere, en ze doen andere dingen. De ene bouwt trainingsdata voor het model. De andere bouwt de zoekindex waar het model uit put wanneer iemand een vraag stelt. Een derde haalt live een pagina op omdat een gebruiker net die link deelde.
Blokkeren van de eerste groep is een keuze over je auteursrecht. Blokkeren van de tweede groep is jezelf uit de zoekresultaten schrijven. Dat wordt in de praktijk voortdurend door elkaar gehaald.
De volledige tabel
| User-agent | Van wie | Wat het doet | Blokkeren? |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Bouwt de zoekindex van ChatGPT | Nooit |
| GPTBot | OpenAI | Verzamelt trainingsdata | Mag |
| ChatGPT-User | OpenAI | Haalt live een pagina op voor een gebruiker | Nooit |
| PerplexityBot | Perplexity | Zoekindex — traint niet | Nooit |
| Perplexity-User | Perplexity | Live ophalen bij een vraag | Nooit |
| Claude-SearchBot | Anthropic | Zoekkwaliteit van Claude | Nooit |
| Claude-User | Anthropic | Live ophalen bij een vraag | Nooit |
| ClaudeBot | Anthropic | Verzamelt trainingsdata | Mag |
| Googlebot | Zoekindex — ook de basis van AI Overviews | Nooit | |
| Google-Extended | Alleen Gemini-training | Mag | |
| Applebot | Apple | Siri, Spotlight, Safari | Nooit |
| Applebot-Extended | Apple | Alleen training Apple Intelligence | Mag |
| Meta-ExternalAgent | Meta | Crawl en training voor Meta AI | Mag |
| Bingbot | Microsoft | Zoekindex Bing en Copilot | Nooit |
⚠️ Google is hier expliciet over in zijn documentatie: Google-Extended heeft geen invloed op je opname in Google Search en is geen rankingsignaal. Apple zegt hetzelfde over Applebot-Extended.
Een robots.txt die klopt
Wil je alles toelaten — voor de meeste KMO's is dat de juiste keuze — dan volstaat dit:
- User-agent: *
- Allow: /
- Sitemap: https://www.jouwdomein.be/sitemap.xml
Wil je niet dat je content gebruikt wordt om modellen te trainen?
Dat is een legitieme keuze, en je kan hem maken zonder je zichtbaarheid op te geven. Zet dan alleen de trainingsbots op slot en laat de zoekbots met rust:
- User-agent: GPTBot → Disallow: /
- User-agent: ClaudeBot → Disallow: /
- User-agent: Google-Extended → Disallow: /
- User-agent: Applebot-Extended → Disallow: /
- User-agent: meta-externalagent → Disallow: /
- En verder niets. OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot en Bingbot blijven welkom.
Twee bots die je robots.txt negeren
Wees eerlijk over de grenzen van dit systeem. ChatGPT-User en Perplexity-User halen een pagina op omdat een gebruiker daar op dat moment om vraagt. OpenAI schrijft in zijn documentatie dat robots.txt-regels daar mogelijk niet op van toepassing zijn; Perplexity is er nog directer over.
Dat is verdedigbaar — het is technisch hetzelfde als iemand die zelf op je link klikt — maar reken er niet op dat robots.txt een muur is. Het is een bordje, geen slot.
Controleer of het klopt
Typ je domein in met /robots.txt erachter en lees wat er staat. Drie dingen om op te letten:
- Staat er ergens een blok met tientallen AI-bots op Disallow? Dan draait er waarschijnlijk Cloudflare-beheer op je site, niet je eigen keuze.
- Staat er een Content-Signal-regel? Dat is Cloudflare, en de standaardwaarde is ai-train=no.
- Staat er een Sitemap-regel? Zonder sitemap moeten de bots je pagina's zelf bij elkaar sprokkelen.
Veelgestelde vragen
- Verlies ik Google-posities als ik Google-Extended blokkeer?
- Nee. Google documenteert dat expliciet: Google-Extended heeft geen invloed op opname in Google Search en telt niet mee als rankingsignaal. Of het AI Overviews raakt, zegt Google niet — die draaien op de gewone Search-index, dus waarschijnlijk niet.
- Mijn site draait op Cloudflare. Moet ik iets doen?
- Kijk het na. Cloudflare rolde in september 2025 een Content Signals Policy uit naar meer dan 3,8 miljoen domeinen, met als standaard search=yes en ai-train=no. Voor de meeste bedrijven is dat prima, maar het is wel een keuze die voor je gemaakt is.
- Helpt het om AI-bots expliciet toe te laten?
- Technisch verandert het niets — wat niet verboden is, is toegelaten. Maar het maakt je keuze zichtbaar voor wie je robots.txt leest, en het voorkomt dat een plugin of hostingpartij er later stilletjes iets in zet.
Bronnen
- OpenAI: overzicht van de botsOpenAI
- Anthropic: crawlt Anthropic het web?Anthropic
- Perplexity: bots en user-agentsPerplexity
- Google: veelvoorkomende crawlersGoogle Search Central
- Apple: over ApplebotApple
- Cloudflare Content Signals PolicyCloudflare, september 2025
Geschreven door
Pieter Herremans
Strategie & klanten bij VIEWS
Pieter voert de gesprekken met zaakvoerders en vertaalt hun cijfers naar een campagne. Wat hier staat komt uit die gesprekken.
Wil je dit voor jouw bedrijf laten werken?
We bekijken je huidige instroom, rekenen door of het rendeert, en zeggen het ook als het niet past.
Ontdek wat mogelijk is voor jouw bedrijf