Ga naar hoofdinhoud

Scan issue

Google moet je pagina's zelf maar zien te vinden.

Een sitemap is een lijst van alle pagina's op je site, met per pagina wanneer hij voor het laatst veranderd is. Zonder die lijst moet een zoekmachine alles ontdekken door links te volgen, en dan duurt het langer voordat nieuw werk in de index staat.

Uitleg

Wat zijn robots.txt en een sitemap?

robots.txt is een tekstbestand op jouwsite.nl/robots.txt dat zoekmachines als eerste ophalen. Erin staat welke delen van je site ze wel en niet mogen bezoeken, en waar je sitemap staat. Het is geen slot: het is een verzoek, waar nette crawlers zich aan houden en kwaadwillende niet.

Een sitemap is een XML-bestand, meestal op /sitemap.xml, met alle URL's die je geïndexeerd wilt hebben. Per adres staat er wanneer het voor het laatst is gewijzigd. Zoekmachines gebruiken die datum om te bepalen wat ze opnieuw komen ophalen, in plaats van je hele site elke keer af te lopen.

De scan kijkt of robots.txt bestaat, en of er een sitemap is: eerst of robots.txt er een noemt, en zo niet, of /sitemap.xml bestaat en er ook echt uitziet als een sitemap. Dat laatste is niet overbodig: sommige sites geven op elk onbekend pad hun gewone homepage terug, en dan lijkt er een sitemap te zijn die er niet is.

Impact

Waarom dit telt voor jouw site.

Zonder sitemap vindt Google je pagina's alleen via links, van je homepage naar binnen. Pagina's waar weinig naartoe wijst, of die diep weggestopt zitten, komen dan traag of nooit aan de beurt. Dat raakt precies de pagina's waarvoor je nieuwe teksten schrijft.

Het verschil is het duidelijkst bij verandering. Publiceer je een nieuwe dienstenpagina, dan zorgt een sitemap met een verse datum ervoor dat die vaak binnen dagen wordt opgehaald. Zonder kan het weken duren, en tot die tijd bestaat de pagina alleen voor mensen die hem al kunnen vinden.

Er is ook een keerzijde die vaker voorkomt dan een ontbrekende sitemap: een robots.txt die per ongeluk te veel afsluit. Een enkele regel Disallow met een slash haalt je hele site uit de zoekresultaten. Dat gebeurt in de praktijk vooral als een testomgeving live gaat en de instelling van die testomgeving meeverhuist.

Oplossen

Zo zet je het goed.

Voor de meeste sites is dit een kwestie van minuten, want het systeem kan het meestal zelf.

01

Controleer eerst wat er nu staat

Open jouwsite.nl/robots.txt in je browser. Staat er een regel Disallow gevolgd door alleen een slash zonder verdere beperking, dan sluit je alles af. Dat is de belangrijkste controle van deze hele lijst.

02

Laat je systeem de sitemap genereren

WordPress maakt er sinds versie 5.5 zelf een, en plug-ins als Yoast of Rank Math nemen het over. In Next.js, Nuxt en Astro is het een bestand dat de lijst opbouwt uit je eigen content. Handmatig bijhouden is nergens voor nodig en gaat altijd mis.

03

Verwijs ernaar in robots.txt

Zet er een regel Sitemap: https://jouwsite.nl/sitemap.xml in, met het volledige adres inclusief https. Dat is de plek waar elke zoekmachine als eerste kijkt.

04

Dien hem in bij Google Search Console

Onder Sitemaps kun je het adres opgeven. Je ziet daarna hoeveel URL's er gevonden zijn en hoeveel er zijn opgenomen. Dat verschil is vaak leerzamer dan de sitemap zelf.

05

Houd hem schoon

Alleen pagina's die je echt geïndexeerd wilt hebben. Bedankpagina's, zoekresultaten en filtercombinaties horen er niet in. Een sitemap vol pagina's die Google vervolgens overslaat, verzwakt het signaal van de rest.

Veelgestelde vragen

Ik heb maar vijf pagina's. Heb ik dan een sitemap nodig?

Strikt genomen niet: bij een kleine site die goed doorgelinkt is, vindt Google alles vanzelf. Het kost alleen vrijwel niets en het helpt vooral bij wat er later bij komt.

Is een ontbrekende robots.txt een fout?

Nee, een site zonder robots.txt wordt gewoon volledig gecrawld. Het bestand is nuttig om je sitemap aan te wijzen en om beheerpagina's af te schermen, maar het ontbreken ervan blokkeert niets.

Mijn sitemap staat er wel, maar de scan vindt hem niet.

Waarschijnlijk staat hij op een ander adres, bijvoorbeeld /sitemap_index.xml. Zet dan een Sitemap-regel in robots.txt die naar het juiste bestand wijst, dan vinden zoekmachines en deze scan hem allebei.

Gratis scan

Heb je al een site? Scan 'm gratis voor we starten.

Negen checks op techniek, commercieel en marketing. Het rapport vormt het startpunt van ons gesprek, met cijfers in plaats van aannames.