
Een XML-sitemap is een bestand dat de URL’s van een site opsomt om hun verkenning door zoekmachine-robots te vergemakkelijken. Het lokaliseren van dit bestand op een externe site (of op de eigen site) maakt het mogelijk om het volume van indexeerbare pagina’s, de frequentie van updates en de technische structuur van een domein te evalueren. De methoden om toegang te krijgen tot dit bestand variëren afhankelijk van de serverconfiguratie en het gebruikte CMS, en de URL van de sitemap is niet altijd wat men zou verwachten.
Robots.txt: het eerste bestand om te raadplegen voor het lokaliseren van een sitemap
De meeste gidsen raden aan om direct /sitemap.xml in de root van het domein te testen. Deze aanpak werkt vaak, maar negeert een veelvoorkomend geval: de sitemap is niet altijd op deze locatie gehost. Sommige sites gebruiken aangepaste paden, submappen of bestandsnamen die automatisch door hun CMS worden gegenereerd.
Aanrader : Hoe kies je een machine voor het efficiënt afgraven van een terras
Het bestand robots.txt, toegankelijk op votredomaine.com/robots.txt, bevat een of meerdere regels die beginnen met Sitemap: gevolgd door de exacte URL. Deze verklaring is genormaliseerd en leesbaar voor alle crawlers. Het blijft de meest betrouwbare bron omdat het weerspiegelt wat de sitebeheerder heeft gekozen om aan de zoekmachines te verklaren.
Eenzelfde robots.txt kan bovendien naar meerdere sitemaps verwijzen, bijvoorbeeld een hoofd-sitemap en een sitemap die aan afbeeldingen of video’s is gewijd. Proberen de URL te raden zonder dit bestand te raadplegen, betekent een al beschikbare informatie negeren. Beginnen met daar te kijken stelt ook degenen die de sitemap van Hi Business willen vinden in staat om in enkele seconden te controleren of de sitemap openbaar is verklaard.
Zie ook : Hoe je eenvoudig een Carrefour-factuur online kunt downloaden: gids en praktische tips

Paden van sitemaps volgens het CMS: WordPress, Shopify, Wix en anderen
Wanneer robots.txt geen sitemap vermeldt, geeft het CMS van de site een waardevolle aanwijzing. Elke platform genereert zijn bestand op een standaardlocatie, en deze locaties verschillen aanzienlijk.
- WordPress zonder SEO-plugin: sinds recente versies genereert WordPress een native sitemap toegankelijk op
/wp-sitemap.xml. Als Yoast SEO of Rank Math echter is geïnstalleerd, wordt het pad vaak/sitemap_index.xml. - Shopify plaatst zijn sitemap systematisch op
/sitemap.xml, maar het bestand is een index die verwijst naar subsitemaps (producten, collecties, pagina’s, blogartikelen). - Wix gebruikt ook
/sitemap.xml, met een vergelijkbare indexstructuur. Squarespace en Webflow volgen dezelfde conventie. - Prestashop gebruikt in verschillende gangbare configuraties
/1_index_sitemap.xml, een pad dat weinig SEO-specialisten spontaan testen.
Het identificeren van het CMS voordat je URL’s test, voorkomt dat je blindelings meerdere pogingen doet. Tools zoals BuiltWith of Wappalyzer detecteren de technologie van een site in enkele seconden.
Google Search Console en de kloof tussen de verklaarde sitemap en de in aanmerking genomen sitemap
Voor een site waarvan je eigenaar bent of waarvoor je administratieve toegang hebt, toont Google Search Console de daadwerkelijk ingediende sitemap, de verwerkingsstatus en de datum van de laatste crawl door de robot. Deze informatie gaat verder dan alleen het bestaan van het bestand.
Een zelden besproken punt: de sitemap die in Search Console is ingediend, kan verschillen van die in robots.txt. Een oude sitemap kan nog steeds in robots.txt worden vermeld terwijl een recentere versie handmatig via de console is ingediend. Het omgekeerde bestaat ook, een sitemap die in robots.txt is verklaard maar nooit in Search Console is ingediend, wat niet voorkomt dat deze door Googlebot wordt gecrawld, maar de zichtbaarheid van de daadwerkelijke verwerking vermindert.
Bing Webmaster Tools biedt een vergelijkbare functie. Voor een volledige SEO-audit maakt het combineren van de twee bronnen het mogelijk om inconsistenties te identificeren tussen wat de site aankondigt en wat de zoekmachines daadwerkelijk verwerken.
Wat de status van de sitemap onthult
Search Console geeft het aantal URL’s aan dat in de sitemap is gedetecteerd en het aantal URL’s dat daadwerkelijk is geïndexeerd. Een significante kloof tussen deze twee cijfers duidt op een technisch probleem: pagina’s met een 404-fout, lusomleidingen, noindex-tags die tegenstrijdig zijn met de aanwezigheid in de sitemap, of inhoud die door Google als onvoldoende wordt beschouwd.
Deze diagnose is onmogelijk uit te voeren vanuit het externe perspectief, alleen door het ruwe XML-bestand te raadplegen. De sitemap alleen garandeert niets over de daadwerkelijke indexering.

Geautomatiseerde tools voor het ontdekken van sitemaps: nut en beperkingen
Verschillende online tools scannen automatisch robots.txt, testen de conventionele paden en tonen metadata zoals het aantal URL’s of de datum van de laatste wijziging. Oplossingen zoals Sitemap Finder (aangeboden door ToolScraper of Pixellize) maken het mogelijk om deze informatie te verkrijgen zonder handmatige tussenkomst.
Hun belangrijkste voordeel is de tijdsbesparing bij een audit die meerdere domeinen betreft. Aan de andere kant detecteren deze tools geen sitemaps die door authenticatie zijn beschermd of die alleen via Search Console worden aangeboden zonder openbare verklaring. De ervaringen verschillen over de betrouwbaarheid van sommige van hen bij atypische serverconfiguraties (URL-herschrijving, tussenliggende CDN, applicatiefirewall).
Voor een eenmalig gebruik op een enkele site blijft handmatige controle van robots.txt gevolgd door een URL-test ook snel en betrouwbaarder. Automatisering komt pas echt tot zijn recht bij het analyseren van een tiental domeinen tegelijkertijd.
Sitemap en SEO: wat het XML-bestand concreet verandert
Een goed gestructureerde sitemap vergemakkelijkt de verkenning van pagina’s door robots, maar een sitemap dwingt de indexering van een pagina niet af. Google behandelt het bestand als een suggestie, niet als een richtlijn. Een pagina die is uitgesloten door een noindex-tag of geblokkeerd door robots.txt, zal niet worden geïndexeerd, zelfs als deze in de sitemap staat.
De werkelijke bijdrage van de sitemap ligt op drie assen:
- De zoekmachines wijzen op diepe of weespagina’s die de natuurlijke crawl (via interne links) niet gemakkelijk zou ontdekken.
- De datum van de laatste wijziging communiceren via de
lastmod-tag, wat de hercrawl van bijgewerkte inhoud kan versnellen. - De URL’s structureren op basis van het type inhoud (artikelen, producten, afbeeldingen, video’s) door middel van aparte sitemaps, wat het diagnosticeren in Search Console vergemakkelijkt.
Een sitemap die URL’s met fouten of pagina’s van lage kwaliteit bevat, kan daarentegen het crawlbudget verdunnen. Het is beter om een schone sitemap te hebben dan een uitgebreide sitemap die pagina’s zonder waarde voor SEO omvat.
Het lokaliseren van de sitemap van een externe site blijft een analysetap, geen doel op zich. Wat daarna telt, is de inhoud van het bestand te confronteren met de werkelijke indexeringsgegevens en de structuur van interne links van het domein.