server room racks
Seo Trends

Filterseiten fressen das Crawl-Budget großer Shops auf

Ein Shop mit zwölf Kategorien, sechs Größen, vierzehn Farben, drei Preisbereichen und vier Sortierungen. Multipliziert man das durch, entstehen aus einer überschaubaren Struktur mehrere zehntausend abrufbare Adressen, und jede davon sieht für ein Suchprogramm aus wie eine eigene Seite.

Die Folge zeigt sich nicht sofort. Sie zeigt sich Monate später, wenn neue Produkte tagelang nicht im Index auftauchen und aktualisierte Kategorietexte wochenlang in der alten Fassung ausgeliefert werden, während im Serverlog Abrufe von Filterkombinationen stehen, die niemand je gesucht hat.

Dieser Text zeigt, wie sich das Ausmaß messen lässt, welche Werkzeuge tatsächlich helfen und in welcher Reihenfolge sie eingesetzt werden. Der Weg führt über den Serverlog, nicht über Vermutungen.

  • Ursache: Filter und Sortierungen erzeugen kombinatorisch neue Adressen
  • Messgrundlage: der Serverlog, aufgeschlüsselt nach Adressmuster
  • Erste Maßnahme: Verlinkung, nicht die Anweisung an den Crawler
  • Reihenfolge: verlinken, kanonisieren, ausschließen, sperren
  • Relevant ab: etwa zehntausend Adressen oder sichtbaren Verzögerungen
  • Wirkung sichtbar: nach vier bis acht Wochen, nicht nach vier Tagen

Wie aus zwölf Kategorien hunderttausend Adressen werden

Jeder Filter, der als Bestandteil der Adresse abgebildet wird, erzeugt eine neue abrufbare Seite. Zwei Filter erzeugen alle Zweierkombinationen, drei alle Dreierkombinationen, und die Reihenfolge der Parameter verdoppelt das Ergebnis noch einmal.

Dazu kommen Sortierungen, Seitenzahlen der Blätterung, Anzeigeeinstellungen und Kennzeichnungen aus Werbekampagnen. Jede dieser Angaben verändert die Adresse, obwohl sich am eigentlichen Inhalt wenig oder nichts ändert.

Verstärkt wird der Effekt durch Systeme, die Parameter in beliebiger Reihenfolge akzeptieren. Dieselbe Auswahl ist dann über mehrere Adressen erreichbar, und der Raum wächst noch einmal, ohne dass ein einziger neuer Inhalt entstanden wäre.

Der entscheidende Punkt: Diese Adressen entstehen nicht nur, sie werden auch verlinkt. Jeder anklickbare Filter ist ein Verweis, und über diese Verweise findet ein Crawler den gesamten Raum, ohne dass ihn jemand darauf hingewiesen hätte.

Crawl Budget Filterseiten: wo die Abrufe versickern

Ein Suchprogramm ruft je Website eine begrenzte Zahl von Adressen in einem Zeitraum ab. Wie groß diese Zahl ist, hängt unter anderem von der Antwortgeschwindigkeit des Servers und von der bisherigen Erfahrung mit der Website ab.

Werden neunzig Prozent dieser Abrufe für Kombinationen aus Farbe, Größe und Sortierung verbraucht, bleiben zehn Prozent für alles andere: neue Produkte, geänderte Kategorietexte, aktualisierte Preise, saisonale Landeseiten.

Der zweite Schaden ist weniger sichtbar und mindestens ebenso teuer: Die interne Verlinkung verteilt sich auf zehntausende Adressen statt auf die wenigen, die verkaufen sollen. Was auf jeder Kategorieseite hundertfach verlinkt wird, wirkt wie ein wichtiger Bereich der Website.

Genau das ist der wirtschaftliche Schaden. Nicht die Existenz der Filterseiten, sondern die Verdrängung. Eine neue Kollektion, die im Oktober online geht und im Dezember indexiert wird, hat die Saison verpasst.

Was Crawl-Budget in der Praxis bedeutet

Der Begriff klingt nach einer festen Zuteilung und ist eher eine Beobachtung. Sichtbar wird er als Zahl der täglichen Abrufe im Serverlog und als Zeitspanne zwischen Veröffentlichung und erstem Abruf einer neuen Seite.

Diese zweite Größe ist die brauchbarere. Sie lässt sich für jede neue Seite messen, sie ist unabhängig von der Gesamtzahl, und sie beschreibt genau das Problem, das im Betrieb tatsächlich stört.

Für die Diagnose genügen zwei Werte: die durchschnittliche Zahl der Abrufe pro Tag und ihre Verteilung auf Adressmuster. Alles Weitere folgt aus dieser Verteilung. Die technischen Hintergründe dazu beschreibt die Dokumentation für die Suche.

Wann es überhaupt ein Problem ist

Bei einer Website mit dreihundert Seiten spielt das Thema keine Rolle. Der gesamte Bestand wird regelmäßig abgerufen, und Filterseiten verbrauchen zwar Abrufe, verdrängen aber nichts.

Relevant wird es ab einer Größenordnung von einigen tausend echten Seiten und einer Vervielfachung durch Parameter. Ein zweites Anzeichen ist ein Server, der unter Last langsam antwortet, weil das die Abrufrate zusätzlich senkt.

Das dritte Anzeichen ist praktischer Natur: Neue Produkte brauchen erkennbar länger als früher, und der Indexierungsbericht zeigt große Zahlen unter Adressen, die zwar bekannt sind, aber nicht aufgenommen wurden.

Ein vierter Hinweis kommt aus der Kostenseite. Wenn ein erheblicher Teil der Rechenlast von Programmen erzeugt wird, die Filterkombinationen abrufen, zahlt der Betrieb für Zugriffe, die weder Umsatz noch Sichtbarkeit bringen.

Wer keines dieser drei Anzeichen hat, sollte die Zeit in andere Aufgaben stecken. Die Umstellung ist aufwendig, und ein Eingriff ohne Befund richtet mehr Schaden an, als er verhindert.

Der Serverlog ist die einzige verlässliche Quelle

Netzwerkkabel in mehreren Farben stecken geordnet in einem Verteiler an der Wand

Berichte im Werkzeug der Suchmaschine zeigen eine Zusammenfassung. Der Serverlog zeigt jeden einzelnen Abruf mit Zeitpunkt, Adresse, Antwortcode und dem Programm, das ihn ausgelöst hat.

Für die Auswertung genügt eine Woche. Gefiltert wird auf die bekannten Suchprogramme, danach werden die Adressen nach Mustern gruppiert: Produktseiten, Kategorieseiten, Adressen mit Parametern, Bilder, sonstige Dateien.

Das Ergebnis ist meist ernüchternd und immer aufschlussreich. In vielen Shops entfällt der größte Anteil auf Adressen mit Parametern, und ein erheblicher Teil davon auf Kombinationen, die im Shop selbst nie beworben werden.

Zugang zum Log bekommt man über den Betreiber der Umgebung. Wo er nicht verfügbar ist, hilft ersatzweise ein eigener Durchlauf mit einem Crawler, der die Struktur nachbildet, allerdings ohne die Information, wie oft tatsächlich abgerufen wurde.

Was im Log tatsächlich gezählt wird

Gruppe Beispielmuster Typischer Befund Erwünscht
Produktseiten Pfad ohne Parameter kleiner Anteil hoher Anteil
Kategorieseiten Pfad ohne Parameter kleiner Anteil hoher Anteil
Filterkombinationen zwei und mehr Parameter größter Anteil sehr klein
Sortierungen Parameter für Reihenfolge mittlerer Anteil kein Abruf nötig
Blätterung Seitenzahl als Parameter mittlerer Anteil begrenzt sinnvoll
Kampagnenkennzeichen Parameter aus Werbemitteln kleiner Anteil kein Abruf nötig

Die Spalte ganz rechts ist eine Zielvorstellung und kein Messwert. Sie zeigt, in welche Richtung sich die Verteilung nach der Umstellung bewegen sollte, und dient beim nächsten Durchgang als Vergleich.

Die Auswertung in sechs Schritten

  1. Serverlog für sieben Tage anfordern und auf die Suchprogramme filtern
  2. Adressen nach Mustern gruppieren und die Anteile berechnen
  3. Die zwanzig häufigsten Parameter mit ihrer Abrufzahl auflisten
  4. Je Parameter entscheiden, ob er den Inhalt ändert oder nur die Darstellung
  5. Die Zeitspanne zwischen Veröffentlichung und erstem Abruf für zehn neue Seiten messen
  6. Den Indexierungsbericht auf Adressen mit Parametern durchsehen

Der vierte Schritt ist der einzige, der eine Entscheidung verlangt, und er entscheidet über alles Weitere. Die Schritte davor sind Handarbeit, die Schritte danach folgen aus dieser einen Einordnung.

Parameter, die den Inhalt ändern, und solche, die nur sortieren

Ein Parameter, der die angezeigten Produkte tatsächlich verändert, erzeugt eine Seite mit eigenem Inhalt. Eine Auswahl nach Marke oder nach Produktart fällt darunter, ebenso eine Einschränkung auf eine Farbe, sofern danach gesucht wird.

Ein Parameter, der nur die Reihenfolge oder die Darstellung verändert, erzeugt dieselbe Seite in anderer Anordnung. Sortierung nach Preis, Zahl der Artikel pro Seite und Ansichtsumschalter gehören in diese Gruppe.

Dazwischen liegt die schwierigste Gruppe: Filter, die den Inhalt verändern, nach denen aber niemand sucht. Eine Kombination aus drei Merkmalen und einem Preisbereich ist ein sinnvolles Bedienelement und keine Seite, die gefunden werden muss.

Welche Filterkombinationen einen eigenen Eintrag verdienen

Kleiderstange in einem Geschäft mit Jacken in verschiedenen Farben und Größen nebeneinander
PattayaPatrol / BY-SA 4.0

Der Maßstab ist die tatsächliche Nachfrage. Wenn nach roten Winterjacken gesucht wird, verdient diese Kombination eine eigene, verlinkte und beschriebene Seite. Wenn nach roten Winterjacken in Größe achtunddreißig unter hundert Euro gesucht wird, in aller Regel nicht.

Praktisch bedeutet das eine überschaubare Liste: meist zwischen zwanzig und zweihundert Kombinationen, die als eigenständige Seiten geführt werden, mit eigenem Titel, eigener Beschreibung und einem Verweis aus der Navigation.

Alle übrigen Kombinationen bleiben bedienbar und werden nicht als eigenständige Seiten geführt. Für die Bedienung ändert sich dadurch nichts, und genau das ist die Absicht.

Die Liste entsteht aus drei Quellen: den tatsächlich verwendeten Filtern im eigenen Shop, den Suchanfragen aus dem Leistungsbericht und der internen Suche. Sie wird einmal im Jahr überprüft, wie es der Beitrag zu den wichtigsten Entwicklungen in der Suche für ähnliche Bestandsfragen nahelegt.

Canonical: was es leistet und was nicht

Ein kanonischer Verweis nennt die bevorzugte Adresse für einen Inhalt. Er ist ein Hinweis und keine Anweisung, und die Suchmaschine kann ihm folgen oder eine andere Adresse wählen.

Für die Frage der Abrufe hilft er kaum. Um den Verweis zu lesen, muss die Seite abgerufen werden, und damit ist der Abruf bereits verbraucht. Er reduziert Doppelungen im Index, nicht die Last.

Sinnvoll eingesetzt wird er dort, wo dieselbe Auswahl über mehrere Adressen erreichbar ist: bei unterschiedlicher Reihenfolge der Parameter, bei Kampagnenkennzeichen und bei Sortierungen.

Ein verbreiteter Fehler ist der kanonische Verweis auf die Kategoriehauptseite bei allen Filterkombinationen, auch bei denen mit eigenem Inhalt. Damit werden Seiten entwertet, die tatsächlich Nachfrage bedienen, und der Effekt fällt erst Monate später auf.

Ebenso ungünstig ist ein Verweis, der auf eine Adresse zeigt, die selbst gesperrt oder weitergeleitet ist. Solche Ketten entstehen bei Umbauten und lassen sich mit einem Durchlauf über die eigene Website in einer Stunde finden.

Robots-Datei, Meta-Angabe und die Verwechslung dazwischen

Werkzeug Wirkung Abruf gespart Geeignet für
Sperre in der Robots-Datei Adresse wird nicht abgerufen ja sehr große Parameterräume
Meta-Angabe zur Nichtaufnahme Seite wird abgerufen, nicht aufgenommen nein einzelne dünne Seiten
Kanonischer Verweis Hinweis auf die bevorzugte Adresse nein gleiche Inhalte, mehrere Adressen
Verweise ohne Weitergabe abgeschwächter Verweis kaum ergänzende Maßnahme
Filter ohne Verweis Adresse wird nicht gefunden ja Filter, die niemand sucht

Die häufigste Verwechslung betrifft die ersten beiden Zeilen. Wer eine Adresse in der Robots-Datei sperrt und gleichzeitig die Meta-Angabe zur Nichtaufnahme setzt, hebt die zweite Maßnahme auf, weil die Seite nie gelesen wird.

Die Steuerung über die Verlinkung

Die wirksamste und am seltensten genutzte Maßnahme steht in der letzten Zeile der Tabelle. Filter, die keine anklickbaren Verweise erzeugen, sondern die Auswahl im Hintergrund abbilden, werden von einem Crawler gar nicht erst gefunden.

Technisch heißt das: Die Filterauswahl verändert die Anzeige, ohne für jede Kombination einen Verweis im Quelltext zu hinterlassen. Die Adressen bleiben teilbar, wenn das gewünscht ist, aber sie stehen nicht als Verweis auf jeder Kategorieseite.

Der Aufwand liegt in der Umsetzung im Shopsystem und ist der einzige Punkt in diesem Text, der Entwicklungszeit kostet. Dafür wirkt er an der Wurzel, während alle anderen Maßnahmen Symptome behandeln.

Für die Kombinationen, die eine eigene Seite verdienen, gilt das Gegenteil: Sie werden ausdrücklich verlinkt, aus der Navigation, aus der Kategorieseite und aus passenden Ratgeberbeiträgen.

Sitemap und interne Links als Gegenprobe

Die Sitemap enthält ausschließlich Adressen, die im Index erscheinen sollen. Steht dort eine Adresse mit Parametern, ist entweder die Sitemap falsch oder die Einordnung dieser Adresse.

Dieselbe Prüfung lohnt für die interne Verlinkung. Ein eigener Durchlauf mit einem Crawler zeigt, wie viele Verweise auf Adressen mit Parametern zeigen, und diese Zahl ist der beste Fortschrittsindikator der gesamten Umstellung.

Aufschlussreich ist außerdem die Verteilung der internen Verweise auf einzelne Seiten. Wenn eine Sortierseite mehr eingehende Links hat als eine wichtige Kategorie, beschreibt das die Struktur des Shops genauer als jedes Schaubild aus der Planung.

Als Zielgröße hat sich bewährt: Die Zahl der intern verlinkten Adressen sollte in derselben Größenordnung liegen wie die Zahl der Seiten in der Sitemap. Weicht sie um ein Vielfaches ab, ist die Ursache fast immer in den Filtern zu finden.

Der Rückweg: wichtige Seiten wieder in den Index bringen

Nach der Umstellung stehen die Abrufe zur Verfügung, sie werden aber nicht automatisch dorthin gelenkt, wo sie gebraucht werden. Dafür braucht es drei Maßnahmen.

Erstens eine aktuelle Sitemap mit Änderungsdatum, die tatsächlich gepflegt wird. Zweitens interne Verweise auf die Seiten, die wieder Beachtung finden sollen, insbesondere aus der Navigation und aus Beiträgen mit Bestand.

Drittens Geduld. Die Umverteilung geschieht nicht in Tagen, sondern über Wochen, und in dieser Zeit sieht der Bericht schlechter aus als vorher, weil ausgeschlossene Adressen dort erst einmal auftauchen. Wie sich das in eine dauerhafte Arbeitsweise einfügt, ordnet der Beitrag zur Suchmaschinenoptimierung für nachhaltigen Markenerfolg ein.

Was sich nach der Umstellung messen lässt

Die erste Zahl ist die Verteilung der Abrufe im Log, gemessen im selben Verfahren wie vorher. Ein Rückgang des Anteils von Parameterseiten ist der unmittelbare Erfolg.

Die zweite Zahl ist die Zeitspanne zwischen Veröffentlichung und erstem Abruf neuer Seiten. Sie ist die Zahl, die im Betrieb tatsächlich zählt, und sie sollte nach einigen Wochen erkennbar sinken.

Die dritte Zahl ist die Zahl der aufgenommenen Seiten im Verhältnis zur Sitemap. Sie bewegt sich am langsamsten und ist deshalb ungeeignet, um kurzfristig über den Erfolg zu urteilen. Wie sich solche technischen Aufräumarbeiten wirtschaftlich einordnen, zeigt der Beitrag zu den Entwicklungen im E-Commerce.

Häufige Fragen

Schadet es, Filterseiten einfach zu sperren?

Nicht grundsätzlich, aber eine pauschale Sperre trifft auch die Kombinationen, die tatsächlich gesucht werden. Deshalb steht die Liste der erwünschten Seiten vor jeder Sperre und nicht danach.

Was passiert mit Filterseiten, die bereits im Index sind?

Sie verschwinden nach und nach, sobald sie nicht mehr verlinkt und als nicht aufzunehmen gekennzeichnet sind. Eine Sperre allein reicht dafür nicht, weil die Kennzeichnung dann nicht gelesen werden kann.

Hilft ein schnellerer Server?

Er hilft, weil die Abrufrate an der Antwortzeit hängt. Er löst aber das Verteilungsproblem nicht: Ein doppelt so schneller Server ruft doppelt so viele Filterkombinationen ab, wenn sich an der Struktur nichts ändert.

Wie oft sollte der Serverlog ausgewertet werden?

Einmal im Quartal genügt für die laufende Kontrolle, dazu einmal nach jeder größeren Änderung an der Struktur. Wöchentliche Auswertungen erzeugen Aufwand ohne zusätzliche Erkenntnis.

Gilt das auch für die interne Suche?

Ergebnisseiten der internen Suche gehören in dieselbe Kategorie und sind häufig sogar der größere Posten. Sie sollten weder verlinkt noch aufgenommen werden, weil ihr Inhalt von einer Eingabe abhängt.

Fordern Sie den Serverlog der vergangenen Woche an und gruppieren Sie die Abrufe nach Adressmuster. Wenn Parameterseiten mehr als die Hälfte ausmachen, kennen Sie die Ursache dafür, dass neue Produkte länger brauchen als früher.

Marius Hellwig betreut seit Jahren Shops und Fachportale in der organischen Suche. Er arbeitet mit Logfiles, Search-Console-Daten und Indexierungsfragen statt mit Ranglisten einzelner Keywords. Am liebsten schreibt er über Fehler, die erst im Traffic-Peak sichtbar werden.