Voordat we over methoden praten, verdient het terreinprobleem dat we er even bij stilstaan. Het verkennen van alle categorieën en pagina’s van een website is niet simpelweg klikken op een menu. Het gaat om het begrijpen van hoe de inhoud met elkaar verbonden is, het opsporen van inhoud die aan de klassieke navigatie ontsnapt, en het controleren of er niets onzichtbaar blijft voor zoekmachines.
Op een grote website met tientallen geneste rubrieken vereist het verkrijgen van een duidelijk overzicht van wat er daadwerkelijk online bestaat een gestructureerde aanpak.
Sitemap XML en robots.txt: de twee bestanden die je als eerste moet openen
Wanneer je een compleet overzicht van een site wilt maken, is de meest effectieve reflex om direct de technische bestanden te raadplegen. De sitemap XML bevat de URL’s die de eigenaar van de site wil laten indexeren. Deze is doorgaans toegankelijk door /sitemap.xml aan de root van het domein toe te voegen.
Het bestand robots.txt geeft aan de crawlers aan wat ze niet mogen verkennen. Deze twee bestanden vullen elkaar aan: de eerste toont wat zichtbaar moet zijn, de tweede onthult wat opzettelijk verborgen is. Door ze te combineren, krijg je een snelle kaart van de structuur van de site, die veel betrouwbaarder is dan handmatige navigatie.
Om een concreet voorbeeld van een sitemap georganiseerd per categorie te zien, kan je de site Little Breizh raadplegen en zien hoe elke rubriek duidelijk in de boomstructuur verschijnt. Dit type presentatie vergemakkelijkt het begrip van de globale architectuur, zelfs voor een bescheiden site.
Facetnavigatie en weespagina’s: wat het menu niet toont

Het hoofdmenu van een site toont zelden al zijn pagina’s. Op een e-commerce site met filters op maat, kleur of prijs, genereert de facetnavigatie honderden gecombineerde URL’s die in geen enkele zichtbare categorie verschijnen. Deze pagina’s bestaan, verbruiken crawlbudget, maar blijven vaak afwezig in de sitemap.
Weespagina’s vormen een symmetrisch probleem. Er is geen interne link die naar hen verwijst. Ze staan niet in het menu, noch in de interne linkstructuur van de site. Om ze te vinden, moet je de lijst van bekende URL’s (sitemap, crawl) vergelijken met de URL’s die daadwerkelijk vanuit andere pagina’s zijn gelinkt.
In de praktijk start je een crawl met een tool zoals Screaming Frog of Xenu, en confronteer je het resultaat met de sitemap XML. De URL’s die in de crawl aanwezig zijn maar afwezig in de sitemap, of omgekeerd, verdienen een handmatige controle. Het is vaak daar dat je verlaten inhoud, oude promoties of testpagina’s vindt die nooit zijn verwijderd.
Google zoekoperators om een site in kaart te brengen
Voordat je enige software installeert, is een Google-query voldoende om een eerste overzicht te krijgen. De operator site:nomdedomaine.fr toont alle pagina’s die door Google voor dit domein zijn geïndexeerd. Je kunt verfijnen met filters:
- site:voorbeeld.fr inurl:blog – om alleen de blogpagina’s te isoleren en hun werkelijke volume in de index te controleren
- site:voorbeeld.fr intitle:”categorie” – om de pagina’s te vinden waarvan de titel een specifiek begrip bevat, nuttig wanneer de boomstructuur van de site moeilijk leesbaar is
- site:voorbeeld.fr -inurl:tag – om tagpagina’s, die vaak overbodig zijn, uit te sluiten en je te concentreren op de belangrijkste inhoud
Deze methode heeft een beperking: Google indexeert slechts een fractie van de bestaande pagina’s. De resultaten geven een minimum, geen uitputtende inventaris. Voor grote sites zien we regelmatig een significante discrepantie tussen het aantal pagina’s in de sitemap en dat weergegeven door de site: operator.

Crawlbudget en AI-robots: een nieuwe druk op de verkenning
De komst van crawlers met kunstmatige intelligentie verandert de situatie voor het verkennen van sites. Verschillende analyses gepubliceerd in 2025-2026 tonen aan dat het volume van verzoeken van deze robots sterk is toegenomen, waarbij sommige agents hun verkeer spectaculair zagen vermenigvuldigen in een jaar. Deze extra druk op de servers dwingt beheerders om het beheer van hun crawlbudget te heroverwegen.
Concreet loopt een site die zijn facetten en gedupliceerde URL’s zonder beperkingen toegankelijk laat, het risico dat de robots hun passage verspillen op pagina’s zonder waarde, ten koste van strategische categorieën en inhoud. De consolidatie van URL’s (canonieke, omleidingen, beperking van parameters) wordt een directe hefboom om ervoor te zorgen dat alle nuttige pagina’s daadwerkelijk worden verkend.
Google verduidelijkt dat de optimalisatie van het crawlbudget vooral betrekking heeft op zeer grote sites, maar in de praktijk zijn e-commerce sites met sterke facetnavigatie de eerste die worden getroffen. Het correcte gebruik van HTTP-statussen (304 voor ongewijzigde pagina’s, bijvoorbeeld) maakt het ook mogelijk om aan de robots te signaleren dat een pagina niet is veranderd, wat budget vrijmaakt om nieuwe inhoud te verkennen.
Structuur en interne linkstructuur: een logische verkenning opbouwen
Het verkennen van een site beperkt zich niet tot het opsommen van URL’s. De manier waarop pagina’s met elkaar zijn verbonden, bepaalt wat een bezoeker (of een robot) daadwerkelijk kan bereiken. Een goed doordachte interne linkstructuur garandeert dat elke categorie en elke belangrijke pagina binnen drie klikken van de homepage te bereiken is.
Om de diepte van de structuur te controleren, kun je een crawler gebruiken die het aantal niveaus tussen de homepage en elke URL meet. Pagina’s die verder dan het vierde niveau liggen, worden vaak slecht geïndexeerd en zelden bezocht. Hier zijn de punten om op te letten:
- De belangrijkste categorieën moeten toegankelijk zijn vanuit het globale navigatiemenu, niet alleen vanuit een footer of een contextuele link
- Elke inhoudspagina moet minstens één interne link ontvangen vanuit een andere pagina van hetzelfde thema, om het effect van weespagina’s te vermijden
- Interne links moeten beschrijvende ankers gebruiken die de termen van de beoogde categorie bevatten, wat zowel de gebruiker als de zoekmachines helpt
De meningen hierover verschillen, maar de meeste SEO-audits tonen aan dat een platte structuur (weinig niveaus, veel horizontale links tussen categorieën) zowel de navigatie voor gebruikers als de verkenning door robots vergemakkelijkt.

Het meest effectief blijft het combineren van deze benaderingen: sitemapbestand voor het overzicht, Google-operators voor een eerste diagnose, technische crawl voor precisie, en analyse van de interne linkstructuur om de logica van de navigatie te begrijpen. Een site waarvan alle pagina’s toegankelijk en correct met elkaar verbonden zijn vormt nooit een probleem voor de verkenning, noch voor zijn bezoekers, noch voor de zoekmachines.



