Ga naar hoofdinhoud

Scan issue

AI-zoekdiensten kunnen je site niet lezen.

ChatGPT, Perplexity en de AI-overzichten van Google halen gewone webpagina's op en lezen de HTML die binnenkomt. Staat je tekst daar niet in, of mogen ze niet langs, dan valt er voor hen niets te lezen.

Uitleg

Wat controleert deze check?

Twee dingen, allebei technisch en allebei meetbaar. Eerst of je robots.txt de crawlers buitensluit die de antwoorden voeden: OAI-SearchBot en ChatGPT-User van OpenAI, PerplexityBot en Perplexity-User, Claude-SearchBot en Claude-User van Anthropic, plus de gewone Googlebot, Bingbot en Applebot. Alleen een volledig verbod telt mee; een regel die alleen je beheeromgeving afschermt is normaal en zegt niets.

Wat hier nadrukkelijk niet meetelt zijn de crawlers die uitsluitend trainingsmateriaal ophalen: GPTBot en ClaudeBot. Hun leveranciers documenteren zelf dat die niets met zoeken te maken hebben. OpenAI schrijft over GPTBot dat hij content ophaalt die gebruikt kan worden om modellen te trainen, en over OAI-SearchBot dat wie díe buitensluit niet in de zoekantwoorden van ChatGPT verschijnt. Twee losse knoppen dus. Blokkeer je alleen de trainingskant, dan noemt de scan dat wel, maar er gaat geen punt af, want het kost je geen vindbaarheid.

Daarnaast of de tekst van je pagina in de HTML zelf staat. Sommige sites sturen een vrijwel lege pagina en bouwen de inhoud pas op met JavaScript in de browser. Zoekmachines voeren dat meestal wel uit, maar het kost tijd en gaat regelmatig mis. Veel AI-crawlers doen het helemaal niet: die lezen de HTML zoals die binnenkomt en verder niets.

Wat deze check nadrukkelijk níet meet, is of ChatGPT jouw bedrijf zal noemen. Dat hangt af van veel meer dan techniek, en daar doen we hier dus geen uitspraak over. Wat hier gemeten wordt is of het technisch überhaupt kán.

Impact

Waarom dit telt voor jouw site.

Een groeiend deel van de mensen die iets zoekt, stelt de vraag aan een AI-assistent in plaats van aan een zoekbalk. Die assistent geeft één antwoord met een handvol bronnen, in plaats van tien blauwe links. Wie in dat antwoord voorkomt, bestaat voor die zoeker. Wie er niet in voorkomt, bestaat niet.

Het verschil met gewone SEO is dat je hier geen positie deelt met negen anderen. Er is veel minder ruimte, en de vraag of je bron überhaupt gelezen kan worden gaat vooraf aan alle andere vragen. Een site die achter een volledig verbod in robots.txt staat, doet in dat hele proces niet mee.

Voor het blokkeren van AI-crawlers valt overigens iets te zeggen, en dat is een legitieme keuze. Het punt is dat het een keuze hoort te zijn. In de praktijk staan die regels er vaak omdat een plug-in ze heeft toegevoegd of omdat iemand ooit een lijstje van internet heeft geplakt, zonder dat iemand het besluit genomen heeft.

Oplossen

Zo maak je je site leesbaar.

Twee verschillende oorzaken, dus twee verschillende oplossingen. Kijk eerst welke van de twee bij jou speelt.

01

Bekijk je robots.txt

Ga naar jouwsite.nl/robots.txt. Zoek naar een User-agent-regel met daaronder Disallow gevolgd door een enkele slash. Dat is een volledig verbod. Kijk vervolgens welke naam erboven staat, want dat bepaalt wat het je kost.

02

Scheid de zoekkant van de trainingskant

OAI-SearchBot, PerplexityBot, Claude-SearchBot en de -User-varianten halen pagina's op om er antwoorden mee te geven. Die buitensluiten kost je een plaats in dat antwoord. GPTBot en ClaudeBot halen alleen materiaal op om modellen te trainen en spelen in de antwoorden geen rol. Die twee blokkeren kost je dus niets aan vindbaarheid en is een keuze die je gerust kunt maken.

03

Zet je tekst in de HTML

Kijk in je browser bij paginabron of je kop en je eerste alinea daar letterlijk in staan. Zo niet, dan wordt je pagina pas in de browser opgebouwd. In Next.js, Nuxt en Astro is server-side renderen een instelling; bij een oudere React- of Vue-site is het meer werk, maar het levert ook een snellere pagina op.

04

Beschrijf je bedrijf in gewone zinnen

Een AI-assistent citeert tekst waar een concreet antwoord in staat. Een pagina die alleen uit kreten en knoppen bestaat, biedt niets om uit te citeren. Beschrijf wat je doet, voor wie, in welke plaats en wat het kost, in normale volzinnen.

05

Zet je bedrijfsgegevens in schema

Een JSON-LD blok met naam, adres, telefoon en openingstijden geeft een machine dezelfde feiten zonder dat hij ze uit lopende tekst hoeft te destilleren. Dat helpt zowel Google als de AI-diensten die op Google's index leunen.

Veelgestelde vragen

Ik wil juist niet dat AI mijn teksten gebruikt. Word ik daar dan op afgerekend?

Nee. Blokkeer je alleen GPTBot en ClaudeBot, dan doe je precies waar die knop voor bedoeld is: je teksten worden niet gebruikt om modellen te trainen, terwijl je gewoon vindbaar blijft in de antwoorden. De scan noemt het wel, want het is beter dat je weet dat het er staat, maar er gaat geen punt af. Aftrek is er alleen als je de zoekkant dichtzet, en dat is een ander besluit met een andere prijs.

Blokkeert Google's AI-overzicht dezelfde crawler?

Nee, GPTBot is van OpenAI en raakt Google niet. Google zegt over de AI-overzichten dat een pagina daarvoor gewoon geïndexeerd moet zijn en in de zoekresultaten met een snippet getoond mag worden, en dat er verder geen aparte eisen zijn. De knop die daarover gaat is dus je robots.txt-regel voor Googlebot, en die staat hierboven in de zoeklijst. Google-Extended is weer een andere instelling, bedoeld om training en grounding in andere Google-systemen te beperken; Google bevestigt niet dat die de AI-overzichten raakt, dus rekent deze scan er ook niet op af.

Mijn site draait op React en de tekst staat niet in de bron. Moet ik alles herbouwen?

Meestal niet. In moderne frameworks is server-side renderen of pre-renderen een instelling. Is dat bij jou niet zo, dan is dat een goed moment om te wegen of de site nog past bij wat je ervan vraagt.

Gratis scan

Heb je al een site? Scan 'm gratis voor we starten.

Negen checks op techniek, commercieel en marketing. Het rapport vormt het startpunt van ons gesprek, met cijfers in plaats van aannames.