# Was steuern robots.txt, noindex, Canonical und Redirect jeweils?

Vier technische Mittel greifen an unterschiedlichen Stellen von Crawling, Indexierung, Kanonisierung und URL-Wechsel ein.

## Die kurze Antwort

`robots.txt` steuert, welche URLs ein regelkonformer Crawler abrufen soll. `noindex` fordert ein unterstützendes Suchsystem auf, eine abrufbare Ressource nicht zu indexieren. `rel="canonical"` benennt die bevorzugte Fassung gleicher oder sehr ähnlicher Inhalte. Ein Redirect leitet Client und Crawler zu einer anderen URL. Keines dieser Mittel schützt vertrauliche Inhalte; dafür brauchst du echte Zugriffskontrolle.

Crawling bedeutet, dass ein automatischer Client eine URL abruft. Indexierung bedeutet, dass ein Suchsystem den Inhalt verarbeitet und in seinen Suchindex aufnehmen kann. Kanonisierung bedeutet, dass es aus mehreren gleichen oder sehr ähnlichen URLs eine repräsentative Fassung auswählt.

`robots.txt`, `noindex`, Canonical und Redirect greifen an unterschiedlichen Stellen ein. Sie sind nicht austauschbar.

## robots.txt steuert den Crawlerzugriff

Die Datei liegt unter `/robots.txt` im obersten Pfad eines Hosts. Mit Regeln für User-Agents legst du fest, welche Pfade ein kooperierender Crawler abrufen soll.

Ihr Zweck ist die Steuerung des Crawlings, nicht die Entfernung aus einem Suchindex. Kennt Google eine gesperrte URL etwa über Links, kann die Adresse weiterhin ohne normalen Beschreibungstext erscheinen. Weil Google die Seite nicht abrufen darf, kann es dort auch ein `noindex` nicht erkennen.

Das Robots Exclusion Protocol ist keine Zugriffskontrolle. Die Datei ist öffentlich und schützt keine vertraulichen Inhalte.

## noindex steuert die Indexierung

`noindex` steht im Robots-Meta-Tag einer HTML-Seite oder im HTTP-Header `X-Robots-Tag`. Der Header eignet sich auch für PDF-Dateien.

Wenn Google die Regel beim Crawlen erkennt, soll die Ressource nicht im Index bleiben. Dafür muss der Abruf erlaubt sein. Eine gleichzeitige Sperre in `robots.txt` verhindert gerade die Erkennung. Auch `noindex` hält Menschen mit der URL nicht vom Zugriff ab.

## Canonical benennt die bevorzugte Fassung

Ein Canonical, meist `<link rel="canonical">` im HTML-`head`, benennt die repräsentative URL gleicher oder sehr ähnlicher Inhalte. Google behandelt es als starkes Signal, aber nicht als zwingende Anweisung. Die alternative URL bleibt erreichbar; sie wird weder weitergeleitet noch automatisch gelöscht.

Ein Canonical passt, wenn mehrere Fassungen bestehen bleiben müssen. Für eine endgültig ersetzte URL ist eine dauerhafte Weiterleitung klarer.

## Redirect steuert den URL-Wechsel

Ein Redirect leitet Menschen, Browser und Crawler zu einem neuen Ziel. Dauerhafte HTTP-Weiterleitungen wie `301` und `308` signalisieren, dass die Ziel-URL die neue Adresse sein soll. `302`, `303` und `307` beschreiben vorübergehende Situationen mit unterschiedlicher HTTP-Semantik.

Serverseitige HTTP-Weiterleitungen sind für einen normalen URL-Wechsel die klare Variante. Das Ziel muss sachlich zur alten URL passen.

## Die Aufgabe bestimmt das Mittel

| Gewünschtes Ergebnis | Passendes Mittel |
|---|---|
| unnötige Crawlerabrufe begrenzen | `robots.txt` |
| erreichbare Seite aus dem Suchindex ausschliessen | abrufbares `noindex` |
| bevorzugte Fassung aus ähnlichen URLs benennen | Canonical |
| URL dauerhaft ersetzen | permanenter Redirect |
| Inhalt nicht öffentlich zugänglich machen | Authentifizierung und Autorisierung |

Prüfe die Mittel gemeinsam. Sitemap, interne Links, Canonical und Redirect sollten nicht auf widersprüchliche Ziele zeigen.

## Dein nächster Arbeitsschritt

Notiere für die betroffene URL zuerst den gewünschten Zustand: öffentlich zugänglich, crawlbar, indexierbar und weiterhin unter dieser Adresse nutzbar. Prüfe danach HTTP-Status, Weiterleitung, robots.txt, Meta-Robots oder X-Robots-Tag, Canonical, interne Links und Sitemap gemeinsam. Kontrolliere das Ergebnis mit einer normalen HTTP-Anfrage und bei Google zusätzlich mit der URL-Prüfung.

## Quellen und Vertiefung

- [Quelle bei Google](https://developers.google.com/search/docs/crawling-indexing/robots/intro) — Google Search Central: Zweck und Grenzen von robots.txt.
- [Quelle bei Google](https://developers.google.com/search/docs/crawling-indexing/block-indexing) — Google Search Central: Abrufbarkeit und Wirkung von noindex.
- [Quelle bei Google](https://developers.google.com/search/docs/crawling-indexing/consolidate-duplicate-urls) — Google Search Central: Canonical als starkes Signal.
- [Quelle bei Google](https://developers.google.com/search/docs/crawling-indexing/301-redirects) — Google Search Central: Dauerhafte und vorübergehende Redirects.
- [RFC 9309](https://www.rfc-editor.org/rfc/rfc9309) — IETF: Standard für robots.txt.

## Hinweis

Die Google-Angaben geben den dokumentierten Stand vom 17. August 2026 wieder. Technische Signale garantieren keine Indexierung oder Auswahl der bevorzugten URL.

## Vertiefender Guide

- [Zutritt, Indexierung und Referenzierung getrennt steuern](/de/guides/fuer-google-und-ki-systeme-verstaendlich-publizieren/zutritt-indexierung-referenzierung-steuern) — Crawler-Zutritt, Aufnahme in einen Suchindex, bevorzugte URL und Nutzung in Such- oder KI-Produkten sind verschiedene Ebenen. Ordne robots.txt, noindex, Canonical, Redirects und Plattformregeln korrekt zu.

## Verwandte Fragen

- [Warum ist eine veröffentlichte Seite nicht im Google-Index?](/de/fragen/veroeffentlichte-seite-nicht-google-index) — Veröffentlicht bedeutet erreichbar, aber nicht automatisch entdeckt, gecrawlt, indexierbar oder von Google als kanonische Fassung ausgewählt.
- [Welche internen Links braucht eine wichtige Antwortseite?](/de/fragen/interne-links-wichtige-antwortseite) — Eine wichtige Antwortseite braucht nachvollziehbare Wege aus ihrer Themenhierarchie und aus passenden inhaltlichen Zusammenhängen, nicht eine festgelegte Linkzahl.
- [Wie trenne ich Google-Suche, KI-Funktionen und Training bei der Crawler-Steuerung?](/de/fragen/google-suche-ki-funktionen-training-crawler-steuerung) — Googlebot, eine Search-Console-Einstellung für generative Search-Funktionen und Google-Extended betreffen unterschiedliche Entscheidungen.
- [Wie trenne ich ChatGPT Search und OpenAI-Training bei der Crawler-Steuerung?](/de/fragen/chatgpt-search-openai-training-crawler-steuerung) — OAI-SearchBot und GPTBot lassen sich unabhängig steuern; ChatGPT-User dient einem anderen, nutzerinitiierten Zweck.