Online marketing bureau voor ambitieuze ondernemers
Online Marketing Blog

XML-sitemap en robots.txt: zo stuur je crawlers door je site

Een XML-sitemap is een bestand dat zoekmachines een lijst geeft van de pagina's op je website die je geïndexeerd wilt hebben. Robots.txt is de tegenhanger: een bestand dat crawlers vertelt welke delen van je site ze niet moeten bezoeken. Samen sturen ze hoe Google en andere crawlers door je site bewegen. Beide bestanden zijn klein, […]

Thomas Haring
Thomas Haring
Online marketing specialist, developer & AI-specialist

Een XML-sitemap is een bestand dat zoekmachines een lijst geeft van de pagina's op je website die je geïndexeerd wilt hebben. Robots.txt is de tegenhanger: een bestand dat crawlers vertelt welke delen van je site ze niet moeten bezoeken. Samen sturen ze hoe Google en andere crawlers door je site bewegen. Beide bestanden zijn klein, […]

Een XML-sitemap is een bestand dat zoekmachines een lijst geeft van de pagina's op je website die je geïndexeerd wilt hebben. Robots.txt is de tegenhanger: een bestand dat crawlers vertelt welke delen van je site ze niet moeten bezoeken. Samen sturen ze hoe Google en andere crawlers door je site bewegen.

Beide bestanden zijn klein, staan meestal ongezien op de achtergrond en worden daarom zelden gecontroleerd. Dat is precies het risico. Een sitemap vol verouderde URL's of een robots.txt met één verkeerde regel kan ervoor zorgen dat belangrijke pagina's later, slechter of helemaal niet in Google verschijnen. Het goede nieuws: beide zijn binnen een kwartier na te lopen.

Twee bestanden, twee taken

De sitemap nodigt uit, robots.txt houdt tegen. De sitemap zegt "deze pagina's zijn belangrijk, kom ze bekijken"; robots.txt zegt "hier hoef je niet te komen". Ze werken pas goed als ze elkaar niet tegenspreken.

XML-sitemap Robots.txt
Doel Pagina's aanwijzen die gevonden moeten worden Delen van de site afschermen voor crawlers
Locatie Vrij te kiezen, vaak /sitemap.xml of /sitemap_index.xml Altijd in de hoofdmap: /robots.txt
Wat het níet doet Garanderen dat pagina's geïndexeerd worden Pagina's uit de index halen
Grootste risico Rommel: redirects, 404's en noindex-pagina's erin Eén regel die per ongeluk de hele site blokkeert

Dat laatste punt over robots.txt wordt vaak verkeerd begrepen. Robots.txt regelt crawlen, niet indexeren. Een pagina die je blokkeert, kan nog steeds in Google verschijnen als andere sites ernaar linken, alleen zonder beschrijving. Wil je een pagina echt uit de zoekresultaten houden, dan heb je een noindex-tag nodig, en die kan Google alleen lezen als de pagina níet geblokkeerd is.

Wat hoort er in je XML-sitemap, en wat niet?

In je XML-sitemap horen alleen pagina's die je in Google wilt zien: bereikbaar, indexeerbaar en de canonieke versie. Elke URL die daar niet aan voldoet, maakt de sitemap minder betrouwbaar als signaal en kost crawlaandacht zonder iets op te leveren.

Wel opnemen:

  • Pagina's die een statuscode 200 geven.
  • De canonieke URL's, dus precies de versie waar je canonical tag naar wijst.
  • Diensten, producten, categorieën, blogartikelen en andere pagina's met zoekwaarde.

Niet opnemen:

  • URL's die doorverwijzen of een 404 geven.
  • Pagina's met een noindex-tag, zoals bedankpagina's of je winkelwagen.
  • Filter- en parametervarianten die met een canonical naar een andere pagina verwijzen.
  • Tag- en archiefpagina's zonder eigen inhoud, als je die bewust niet laat indexeren.

Over de technische details hoef je je meestal geen zorgen te maken. Eén sitemap mag maximaal 50.000 URL's bevatten; grotere sites gebruiken een sitemap-index die naar meerdere sitemaps verwijst. WordPress maakt sinds versie 5.5 zelf een basissitemap aan, en SEO-plugins zoals Yoast en Rank Math vervangen die door een eigen, beter instelbare versie. De velden voor prioriteit en wijzigingsfrequentie negeert Google; de datum van de laatste wijziging gebruikt Google wel, zolang die betrouwbaar is.

Hoe je canonieke versies bepaalt en waarom die in je sitemap moeten overeenkomen, lees je in ons artikel over de canonical tag.

Sitemap indienen in Search Console: stap voor stap

Een sitemap indienen in Google Search Console duurt een paar minuten en geeft je daarna een doorlopend overzicht van hoeveel ingediende pagina's Google heeft gevonden en verwerkt. Google kan je sitemap ook zelf vinden, maar indienen geeft je inzicht in fouten.

  1. Zoek de URL van je sitemap op. Bij Yoast is dat meestal /sitemap_index.xml, bij Rank Math ook, en zonder plugin /wp-sitemap.xml. Open hem in je browser om te controleren dat hij laadt.
  2. Ga in Search Console naar Sitemaps in het linkermenu.
  3. Vul het pad van de sitemap in en klik op Indienen.
  4. Controleer na enige tijd de status. "Gelukt" betekent dat Google het bestand kon lezen; het aantal gevonden URL's hoort in de buurt te liggen van het aantal pagina's dat je verwacht.
  5. Zet de sitemap-URL ook onderaan je robots.txt met een regel als Sitemap: https://www.voorbeeld.nl/sitemap_index.xml. Zo vinden ook andere zoekmachines, zoals Bing, hem.

"Gelukt" zegt alleen dat het bestand leesbaar is, niet dat alle pagina's geïndexeerd zijn. Wat er met de afzonderlijke URL's gebeurt, zie je in het rapport Pagina's. Staan daar veel pagina's onder "niet geïndexeerd", dan helpt ons artikel over een pagina die niet geïndexeerd wordt je verder.

Welke robots.txt-fouten maken pagina's onzichtbaar?

De zwaarste robots.txt-fout is een regel die meer blokkeert dan bedoeld, met als bekendste voorbeeld Disallow: /, wat de hele site afsluit voor crawlers. Omdat je site er voor bezoekers gewoon uitziet, valt zo'n fout vaak pas op als het verkeer al wegzakt.

De fouten die we het vaakst tegenkomen:

  1. Een vergeten blokkade van de ontwikkelomgeving. Tijdens het bouwen staat de site terecht dicht voor zoekmachines. Wordt die instelling bij de livegang niet teruggezet, dan blijft de nieuwe site onzichtbaar. Controleer na elke livegang ook het vinkje "Zoekmachines ontmoedigen deze site te indexeren" in WordPress.
  2. CSS- en JavaScript-mappen blokkeren. Google wil je pagina's renderen zoals een bezoeker ze ziet. Zonder toegang tot opmaak en scripts kan het je pagina verkeerd beoordelen, bijvoorbeeld op mobielvriendelijkheid.
  3. Te brede patronen. Een regel als Disallow: /p blokkeert niet alleen /prive/ maar ook /producten/ en /prijzen/. Robots.txt werkt met het begin van het pad.
  4. Blokkeren in plaats van noindex. Pagina's die je uit Google wilt hebben, blokkeer je niet in robots.txt maar geef je een noindex-tag. Anders kan Google die tag nooit lezen.
  5. Een robots.txt die een foutcode geeft. Als het bestand een serverfout teruggeeft, kan Google tijdelijk stoppen met crawlen van de hele site, uit voorzorg.

Search Console heeft een robots.txt-rapport (onder Instellingen) waarin je ziet welke versie Google het laatst heeft opgehaald en of daar problemen in zaten. Robots.txt en sitemap zijn twee van de vaste onderdelen in een technische controle; het volledige rijtje staat in technische SEO: wat je écht moet fixen.

AI-crawlers in robots.txt: wat zet je erin?

Via robots.txt kun je per crawler bepalen of AI-bedrijven je site mogen bezoeken, maar het is een verzoek, geen slot. De bekende partijen houden zich er grotendeels aan; minder nette scrapers niet. Zie het dus als beleidskeuze, niet als beveiliging.

De belangrijkste namen om te kennen: GPTBot (OpenAI, voor het trainen van modellen), OAI-SearchBot (voor de zoekfunctie in ChatGPT), ClaudeBot (Anthropic), PerplexityBot en Google-Extended. Die laatste is geen aparte crawler maar een token waarmee je aangeeft of Google je content mag gebruiken voor zijn AI-modellen; je posities in gewone zoekresultaten veranderen er niet door.

Voor de meeste MKB-bedrijven is de nuchtere keuze: laat de zoekgerichte crawlers toe. Wie AI-zoekmachines blokkeert, kan daar ook niet als bron verschijnen, terwijl klanten er steeds vaker hun vragen stellen. Het trainen van modellen is een aparte afweging die je per crawler kunt maken. En waar je ook over leest: een llms.txt-bestand is geen vervanging voor robots.txt en heeft nauwelijks aantoonbaar effect, zoals we eerlijk uitleggen in llms.txt: wat het is en wat je ervan mag verwachten.

Uit de praktijk: waar het meestal misgaat

De meeste problemen met sitemaps en robots.txt ontstaan niet bij de bouw, maar bij veranderingen erna: een migratie, een nieuwe plugin of een snelle aanpassing door iemand die de gevolgen niet overzag. Daarom nemen we beide bestanden mee in elke controle na een livegang.

Een patroon dat we geregeld zien: twee SEO-plugins die allebei een sitemap aanmaken, waarvan de oude nog in Search Console staat ingediend. Google krijgt dan twee lijsten die elkaar deels tegenspreken. Een ander patroon: een sitemap vol URL's die na een herstructurering doorverwijzen. Elke redirect in de sitemap is een kleine aanwijzing aan Google dat het bestand niet bijgehouden wordt. Opschonen kost weinig tijd en maakt het signaal weer bruikbaar.

Veelgestelde vragen

Heeft een kleine website een XML-sitemap nodig?

Een kleine site met goede interne links wordt meestal ook zonder sitemap gevonden. Toch is een sitemap handig: hij helpt nieuwe pagina's sneller op te merken en geeft je in Search Console inzicht in hoe Google je pagina's verwerkt. Op WordPress kost het geen extra werk, dus er is weinig reden om hem weg te laten.

Haalt robots.txt een pagina uit Google?

Nee. Robots.txt voorkomt alleen dat crawlers de pagina bezoeken. Een geblokkeerde pagina kan in de index blijven of erin komen als er links naartoe wijzen. Wil je een pagina uit de zoekresultaten, gebruik dan een noindex-tag en laat de pagina bereikbaar, zodat Google die tag kan lezen.

Moet ik mijn sitemap opnieuw indienen na elke wijziging?

Nee. Google haalt een ingediende sitemap zelf periodiek opnieuw op. Opnieuw indienen is alleen zinvol als de sitemap-URL verandert, bijvoorbeeld na het wisselen van SEO-plugin of een migratie. Verwijder dan ook de oude sitemap uit Search Console, zodat er geen verouderde lijst blijft meetellen.

Moet ik AI-crawlers blokkeren?

Dat is een keuze, geen verplichting. Blokkeer je zoekgerichte AI-crawlers, dan verklein je de kans dat AI-zoekmachines jouw bedrijf als bron noemen. Wil je alleen niet dat je teksten voor modeltraining worden gebruikt, dan kun je de trainingscrawlers apart weren en de zoekcrawlers toelaten.

Weet je niet zeker of je sitemap en robots.txt doen wat ze moeten doen? In de technische scan van onze SEO-aanpak lopen we beide bestanden na, samen met de indexering in Search Console, zodat je weet welke pagina's Google wel en niet ziet.

Deel dit artikel: LinkedIn
Thomas Haring

Klaar om jouw online marketing naar een hoger niveau te tillen?

Vraag vandaag nog een gratis websitescan aan en ontdek welke kansen jij laat liggen.

Wat klanten over ons zeggen.

Beoordelingen
5.0 (23)
K Kevin Haring Geplaatst op Google

Ik heb zelf niks met computers of websites, maar ik wilde wel een professionele website voor mijn bedrijf. Via via kwam … Lees meer

R Ricardo de Roos Geplaatst op Google

Vakkundig, zeer behulpzaam en bereid mee te denken. Onlinemeersucces.nl zal ik zeker aanraden!

H hafid Geplaatst op Google

Eerlijke en betrouwbare webmaster . Hij zet zich voor 100% in voor de beste resultaten voor je bedrijf . Goed communicat… Lees meer

T Thomas Hendrikx Geplaatst op Google

Online Meer Succes adverteert inmiddels al maanden voor mijn webshop en dit heeft tot goede verkoopresultaten geleid. Ve… Lees meer

R Robert Zwaanswijk Geplaatst op Google

Voor mijn bedrijf had ik hulp nodig met mijn webshop, Google Ads en Facebook/Instagram marketing. Onlinemeerssuces.nl he… Lees meer

Alle reviews