Bevor wir über Methoden sprechen, verdient das Thema der Struktur eine genauere Betrachtung. Das gesamte Spektrum der Kategorien und Seiten einer Website zu erkunden, bedeutet nicht einfach, auf ein Menü zu klicken. Es geht darum, zu verstehen, wie die Inhalte miteinander verknüpft sind, diejenigen zu identifizieren, die der klassischen Navigation entgehen, und sicherzustellen, dass nichts für Suchmaschinen unsichtbar bleibt.
Auf einer umfangreichen Website mit Dutzenden von verschachtelten Rubriken erfordert es einen strukturierten Ansatz, um einen klaren Überblick darüber zu erhalten, was tatsächlich online existiert.
XML-Sitemap und robots.txt: die beiden Dateien, die zuerst geöffnet werden sollten
Wenn man ein vollständiges Inventar einer Website erstellen möchte, ist der effektivste Reflex, direkt die technischen Dateien zu konsultieren. Die XML-Sitemap listet die URLs auf, die der Eigentümer der Website indizieren lassen möchte. In der Regel erreicht man sie, indem man /sitemap.xml an die Wurzel der Domain anhängt.
Die Datei robots.txt hingegen zeigt den Robotern, was sie nicht durchsuchen dürfen. Diese beiden Dateien ergänzen sich: Die erste zeigt, was sichtbar sein sollte, die zweite offenbart, was absichtlich verborgen ist. Durch ihre Kombination erhält man eine schnelle Kartierung der Struktur der Website, die viel zuverlässiger ist als eine manuelle Navigation.
Um ein konkretes Beispiel für eine nach Kategorien organisierte Sitemap zu sehen, kann man die Website Little Breizh konsultieren und sehen, wie jede Rubrik klar im Baum dargestellt wird. Diese Art der Präsentation erleichtert das Verständnis der globalen Architektur, selbst für eine bescheidene Website.
Facettierte Navigation und verwaiste Seiten: was das Menü nicht zeigt

Das Hauptmenü einer Website zeigt selten alle ihre Seiten an. Auf einer E-Commerce-Website mit Filtern nach Größe, Farbe oder Preis generiert die facettierte Navigation Hunderte von kombinierten URLs, die in keiner sichtbaren Kategorie erscheinen. Diese Seiten existieren, verbrauchen Crawling-Budget, bleiben aber oft in der Sitemap ausgeschlossen.
Verwaiste Seiten stellen ein symmetrisches Problem dar. Es gibt keinen internen Link, der auf sie verweist. Sie sind weder im Menü noch im Netzwerk der Website enthalten. Um sie zu finden, muss man die Liste der bekannten URLs (Sitemap, Crawl) mit den tatsächlich von anderen Seiten verlinkten URLs vergleichen.
In der Praxis startet man einen Crawl mit einem Tool wie Screaming Frog oder Xenu und vergleicht das Ergebnis mit der XML-Sitemap. Die URLs, die im Crawl vorhanden, aber in der Sitemap nicht aufgeführt sind, oder umgekehrt, verdienen eine manuelle Überprüfung. Oft findet man dort verwaiste Inhalte, alte Aktionen oder Testseiten, die nie gelöscht wurden.
Google-Suchoperatoren zur Kartierung einer Website
Bevor man irgendeine Software installiert, reicht eine Google-Anfrage aus, um einen ersten Überblick zu erhalten. Der Operator site:nomdedomaine.fr zeigt alle von Google für diese Domain indizierten Seiten an. Man kann mit Filtern verfeinern:
- site:beispiel.fr inurl:blog – um ausschließlich die Blogseiten zu isolieren und ihr tatsächliches Volumen im Index zu überprüfen
- site:beispiel.fr intitle:”Kategorie” – um Seiten zu finden, deren Titel einen bestimmten Begriff enthält, nützlich, wenn die Struktur der Website schwer lesbar ist
- site:beispiel.fr -inurl:tag – um Tag-Seiten, die oft redundant sind, auszuschließen und sich auf die Hauptinhalte zu konzentrieren
Diese Methode hat eine Grenze: Google indiziert nur einen Bruchteil der existierenden Seiten. Die Ergebnisse geben einen Mindestwert, aber kein vollständiges Inventar. Bei umfangreichen Websites stellt man regelmäßig eine signifikante Diskrepanz zwischen der Anzahl der Seiten in der Sitemap und der Anzahl fest, die der Operator site: anzeigt.

Crawling-Budget und KI-Roboter: ein neuer Druck auf die Erkundung
Das Aufkommen von Crawlers mit künstlicher Intelligenz verändert die Spielregeln für die Erkundung von Websites. Mehrere Analysen, die 2025-2026 veröffentlicht wurden, zeigen, dass das Anfragevolumen dieser Roboter stark gestiegen ist, wobei einige Agenten ihren Traffic innerhalb eines Jahres dramatisch vervielfacht haben. Dieser zusätzliche Druck auf die Server zwingt die Administratoren, die Verwaltung ihres Crawling-Budgets neu zu überdenken.
Konkrete bedeutet das, dass eine Website, die ihre Facetten und doppelten URLs ohne Einschränkungen zugänglich lässt, riskieren könnte, dass die Roboter ihre Zeit mit Seiten ohne Wert verschwenden, zu Lasten der strategischen Kategorien und Inhalte. Die Konsolidierung von URLs (kanonisch, Weiterleitungen, Einschränkung von Parametern) wird zu einem direkten Hebel, damit alle nützlichen Seiten tatsächlich erkundet werden.
Google stellt klar, dass die Optimierung des Crawling-Budgets vor allem für sehr umfangreiche Websites von Bedeutung ist, aber in der Praxis sind Websites mit starker facettierter Navigation die ersten, die betroffen sind. Der korrekte Einsatz von HTTP-Status (304 für unveränderte Seiten, zum Beispiel) ermöglicht es auch, den Robotern zu signalisieren, dass eine Seite sich nicht verändert hat, was Budget für die Erkundung neuer Inhalte freigibt.
Struktur und interne Verlinkung: eine logische Erkundung aufbauen
Die Erkundung einer Website beschränkt sich nicht darauf, URLs aufzulisten. Die Art und Weise, wie die Seiten miteinander verknüpft sind, bestimmt, was ein Besucher (oder ein Roboter) tatsächlich erreichen kann. Eine gut durchdachte interne Verlinkung stellt sicher, dass jede Kategorie und jede wichtige Seite maximal drei Klicks von der Startseite entfernt ist.
Um die Tiefe der Struktur zu überprüfen, kann man einen Crawler verwenden, der die Anzahl der Ebenen zwischen der Startseite und jeder URL misst. Seiten, die über die vierte Ebene hinausgehen, sind oft schlecht indiziert und selten besucht. Hier sind die Punkte, auf die man achten sollte:
- Die Hauptkategorien müssen über das globale Navigationsmenü zugänglich sein, nicht nur über einen Footer oder einen kontextuellen Link
- Jede Inhaltsseite sollte mindestens einen internen Link von einer anderen Seite desselben Themas erhalten, um den Effekt der verwaisten Seite zu vermeiden
- Die internen Links sollten beschreibende Anker verwenden, die die Begriffe der angestrebten Kategorie enthalten, was sowohl den Nutzern als auch den Suchmaschinen hilft
Die Rückmeldungen variieren zu diesem Punkt, aber die meisten SEO-Audits zeigen, dass eine flache Struktur (wenig Ebenen, viele horizontale Links zwischen den Kategorien) sowohl die Navigation der Nutzer als auch die Erkundung durch Roboter erleichtert.

Am effektivsten ist es, diese Ansätze zu kombinieren: Sitemap-Datei für den Überblick, Google-Operatoren für eine erste Diagnose, technisches Crawling für die Präzision und Analyse der internen Verlinkung, um die Navigationslogik zu verstehen. Eine Website, deren alle Seiten zugänglich und korrekt verknüpft sind, hat niemals Probleme mit der Erkundung, weder für ihre Besucher noch für die Suchmaschinen.



