Wat doen een sitemap en robots.txt eigenlijk, en waarin verschillen ze?
Een sitemap is een lijst van URL's die u aan zoekmachines aanbiedt als wegwijzer naar de content die u geïndexeerd wilt zien; robots.txt is juist een set instructies die crawlers vertelt welke delen van de site zij wel of niet mogen bezoeken. Ze werken dus in tegengestelde richting: de sitemap nodigt uit, robots.txt houdt tegen. Een cruciaal punt dat vaak verkeerd begrepen wordt: robots.txt regelt het crawlen, niet het indexeren. Als andere websites linken naar een URL die in robots.txt is geblokkeerd, kan Google die URL nog altijd indexeren zonder de inhoud ooit gecrawld te hebben, vaak zichtbaar als een resultaat zonder beschrijving in de zoekresultaten. Wilt u een pagina echt uit de index houden, dan is een noindex-metatag op de pagina zelf (of wachtwoordbeveiliging) de juiste route, niet een regel in robots.txt.
Beide bestanden hebben een vaste, verplichte locatie: robots.txt hoort in de hoofdmap van het domein te staan (bijvoorbeeld voorbeeld.nl/robots.txt), en de meeste sitemaps staan op een vergelijkbare plek zoals voorbeeld.nl/sitemap.xml. Crawlers zoeken standaard op deze locaties, en verwijzen bovendien vanuit robots.txt zelf naar de sitemap via een `Sitemap:`-regel, zodat beide bestanden elkaar aanvullen in plaats van los van elkaar te bestaan.
Hoe bouwt u een sitemap die Google vertrouwt?
Een schone sitemap bevat uitsluitend canonieke, indexeerbare URL's: geen doorverwezen pagina's, geen pagina's met een noindex-tag, en geen duplicaten. Elke URL in de sitemap moet ook daadwerkelijk toegankelijk zijn voor crawlers; controleer dus altijd of de sitemap en robots.txt geen tegenstrijdige signalen geven. Een pagina die in robots.txt is geblokkeerd, hoort per definitie niet in de sitemap thuis, en omgekeerd.
Voor sites die regelmatig nieuwe content publiceren, zoals een blog of webshop, is een dynamisch gegenereerde sitemap die automatisch meegroeit met nieuwe en verwijderde pagina's de praktische keuze. Statische sitemaps die u handmatig bijwerkt, raken bij een actieve site snel verouderd en gaan dan URL's missen of juist verwijderde pagina's blijven aanbieden.
Bij een grote site is het bovendien verstandig om de sitemap op te splitsen in aparte deelsitemaps per contenttype, bijvoorbeeld één voor blogartikelen, één voor productpagina's en één voor statische pagina's, samengebracht in een overkoepelende sitemap-index. Zo ziet u in Search Console meteen welk deel van de site eventuele indexatieproblemen veroorzaakt, in plaats van te moeten zoeken in één lange, ongedifferentieerde lijst URL's.
Wat hoort er wel en niet in robots.txt?
Robots.txt is bedoeld om crawlbudget te sturen, niet om gevoelige informatie te verbergen — de inhoud van het bestand is voor iedereen zichtbaar. Typische toepassingen zijn het weren van crawlers uit interne zoekresultaten, filterpagina's met eindeloze parametercombinaties, of testomgevingen. Crawlbudget is vooral relevant voor grote sites: Google besteedt een beperkt aantal crawlaanvragen per site per periode, en elke aanvraag die opgaat aan een waardeloze filterpagina is een aanvraag die niet naar een belangrijke contentpagina gaat. Bij een kleine site met enkele tientallen pagina's speelt dit nauwelijks een rol, maar bij een webshop met duizenden parametercombinaties kan een goed ingerichte robots.txt het verschil maken tussen snel of traag geïndexeerde nieuwe producten.
Een veelgemaakte en kostbare fout is het per ongeluk blokkeren van CSS- en JavaScript-bestanden. Zonder toegang tot deze bestanden kan Google een pagina niet correct renderen en dus ook niet goed beoordelen, wat rechtstreeks een goede technische SEO-audit in de weg zit. Controleer daarom regelmatig of de map met stylesheets en scripts expliciet toegankelijk blijft.
Een andere klassieke misser: bij de livegang van een nieuwe site vergeten om de regel `Disallow: /` te verwijderen die tijdens de bouwfase was toegevoegd om de hele site af te schermen. Dit blokkeert zonder waarschuwing de volledige indexatie van een net gelanceerde site.
Moet u ook rekening houden met AI-crawlers?
Naast Googlebot en Bingbot bezoeken ook crawlers van AI-systemen uw site, elk met een eigen user-agent, bijvoorbeeld voor het verzamelen van trainingsdata of het direct ophalen van een pagina om een gebruikersvraag te beantwoorden. Of u deze crawlers toegang geeft, is een bewuste keuze: toegang bieden vergroot de kans dat uw content wordt meegenomen in AI-antwoorden en eventueel geciteerd wordt, terwijl blokkeren voorkomt dat uw content zonder duidelijke bronvermelding wordt hergebruikt.
Deze afweging verschilt per site en per doelstelling, maar wees in elk geval bewust van welke user-agents in uw robots.txt staan vermeld en welke regels voor hen gelden. Een regel die alleen `User-agent: *` gebruikt, geldt voor alle crawlers inclusief AI-bots; wilt u specifiek onderscheid maken, dan voegt u een apart blok toe voor de user-agent van de betreffende AI-crawler.
Indexatie controleren en bijsturen via Search Console
Het Coverage-rapport (indexeringsrapport) in Search Console toont welke pagina's geïndexeerd zijn, welke zijn uitgesloten en om welke reden. In 2026 geven de AI-ondersteunde inzichten in dit rapport concretere verklaringen bij indexeringsbeslissingen en signaleren ze structured-data-fouten in bijna realtime, wat het gissen naar de oorzaak van een uitsluiting aanzienlijk vermindert.
Gebruik daarnaast de URL-inspectietool om een specifieke pagina te testen: deze laat zien of de pagina gecrawld en geïndexeerd is, of er een canonieke URL is aangewezen die afwijkt van de pagina die u bedoelde, en of robots.txt de pagina blokkeert. Dien na een grote structurele wijziging, zoals een sitemap-update na een contentbatch of een herziening van de robots.txt, de sitemap opnieuw in via Search Console om herindexering te versnellen.
Checklist bij twijfel over indexatieproblemen
- Controleer of de sitemap-URL bereikbaar is en geen 404 of serverfout geeft.
- Vergelijk de sitemap met robots.txt: staat er geen enkele geblokkeerde URL in de sitemap?
- Test een steekproef van belangrijke pagina's met de URL-inspectietool.
- Controleer of CSS- en JavaScript-mappen niet per ongeluk geblokkeerd zijn.
- Kijk in het Coverage-rapport naar patronen: worden specifieke sjablonen of URL-structuren systematisch uitgesloten?
- Verifieer dat noindex-tags alleen staan op pagina's die u daadwerkelijk buiten de index wilt houden.
Doorloop deze punten niet alleen bij een probleem, maar ook standaard na een grote sitewijziging: een herontwerp, een verhuizing naar een nieuw CMS of een grote contentbatch. Juist bij dat soort wijzigingen sluipen de meeste indexatiefouten erin, en een korte controle achteraf voorkomt dat een technisch mankement wekenlang onopgemerkt blijft en zichtbaarheid kost.



