{"id":50006,"date":"2026-07-17T09:25:25","date_gmt":"2026-07-17T07:25:25","guid":{"rendered":"https:\/\/wolf-of-seo.de\/?post_type=glossary&#038;p=50006"},"modified":"2026-07-17T13:17:24","modified_gmt":"2026-07-17T11:17:24","slug":"robots-txt","status":"publish","type":"glossary","link":"https:\/\/wolf-of-seo.de\/en\/what-is\/robots-txt","title":{"rendered":"robots.txt: So steuerst Du, welche Bereiche Deiner Website Suchmaschinen crawlen d\u00fcrfen"},"content":{"rendered":"<h1>robots.txt: So steuerst Du, welche Bereiche Deiner Website Suchmaschinen crawlen d&#xFC;rfen<\/h1>\n<p style=\"font-size:0.9em;color:#666;margin:0.5em 0 1.5em;\">Von Niels Stuck &#xB7; Aktualisiert am 17. Juli 2026 &#xB7; 11 Min. Lesezeit<\/p>\n<p><strong>Die robots.txt<\/strong> ist die erste Datei, die ein Suchmaschinen-Crawler auf Deiner Website aufruft &#x2013; und eine der am h&#xE4;ufigsten falsch konfigurierten. Eine einzige Zeile zu viel, und pl&#xF6;tzlich verschwinden ganze Verzeichnisse aus Google. Genau deshalb lohnt es sich, dieses kleine Textdokument wirklich zu verstehen, bevor Du es anfasst.<\/p>\n<div style=\"background:#f4f7fb;border-left:4px solid #2b6cb0;padding:1em 1.25em;margin:1.5em 0;border-radius:4px;\">\n<p style=\"margin:0 0 0.5em;font-weight:700;\">Das Wichtigste in K&#xFC;rze<\/p>\n<ul style=\"margin:0;padding-left:1.2em;\">\n<li>Die robots.txt ist eine Textdatei im Wurzelverzeichnis Deiner Domain, die Crawlern sagt, welche URLs sie abrufen d&#xFC;rfen und welche nicht.<\/li>\n<li>Sie steuert das <strong><span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Crawling<\/span><\/strong>, nicht die Indexierung &#x2013; eine per robots.txt gesperrte Seite kann trotzdem in Google landen.<\/li>\n<li>Die Regeln sind eine h&#xF6;fliche Bitte, kein Zugriffsschutz: seri&#xF6;se Bots halten sich daran, b&#xF6;sartige ignorieren sie.<\/li>\n<li>Pr&#xFC;fe Deine robots.txt nach jeder &#xC4;nderung im robots.txt-Tester der Google Search Console, bevor sie live geht.<\/li>\n<\/ul>\n<\/div>\n<p>Die robots.txt ist eine einfache Textdatei im Wurzelverzeichnis einer Domain, die Webcrawlern nach dem Robots-Exclusion-Standard mitteilt, welche Pfade sie abrufen d&#xFC;rfen und welche nicht. Sie besteht aus Regelbl&#xF6;cken pro User-Agent mit Disallow- und Allow-Anweisungen. Auch als Robots-Exclusion-Protokoll bekannt.<\/p>\n<p>Anders gesagt: Die robots.txt ist wie das Schild am Eingang eines Museums, das festlegt, welche R&#xE4;ume f&#xFC;r Besucher offen sind und welche nur dem Personal geh&#xF6;ren. Wer sich an die Hausordnung h&#xE4;lt, respektiert das Schild &#x2013; wer einbrechen will, tut es trotzdem.<\/p>\n<p>Und genau hier stehen die Eins&#xE4;tze: Sperrst Du versehentlich das falsche Verzeichnis, kann Google Deine wichtigsten Seiten nicht mehr abrufen und die Rankings brechen weg. L&#xE4;sst Du dagegen sinnlose Parameter-URLs offen, verschwendest Du Crawl-Budget, das f&#xFC;r Deine Umsatzseiten fehlt. Die robots.txt ist klein &#x2013; ihre Wirkung ist es nicht.<\/p>\n<h2>Wie funktioniert die robots.txt?<\/h2>\n<p>Die robots.txt funktioniert nach einem festen Ablauf: Bevor ein Crawler eine Seite Deiner Domain abruft, holt er zuerst die Datei unter <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">https:\/\/deine-domain.de\/robots.txt<\/code> ab. Er liest die Regeln, sucht den Block, der auf seinen eigenen Namen passt, und entscheidet dann pro <span class=\"\"  data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]'  tabindex='0' role='link'>URL<\/span>, ob er sie crawlen darf.<\/p>\n<p>Der Aufbau ist streng zeilenbasiert. Jede Anweisung besteht aus einem Feldnamen, einem Doppelpunkt und einem Wert. Die zentralen Felder sind <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">User-agent<\/code> (f&#xFC;r welchen Bot die folgenden Regeln gelten), <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">Disallow<\/code> (welcher Pfad gesperrt ist) und <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">Allow<\/code> (welche Ausnahme innerhalb eines gesperrten Pfads doch erlaubt bleibt). Ein leerer Disallow-Wert bedeutet: nichts gesperrt.<\/p>\n<p>Die Datei muss zwingend im Wurzelverzeichnis liegen und &#xFC;ber HTTP erreichbar sein. Eine robots.txt unter <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">\/blog\/robots.txt<\/code> wird schlicht ignoriert &#x2013; Crawler suchen sie ausschlie&#xDF;lich unter der Root. Pro Host und Protokoll gilt genau eine Datei; <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">https:\/\/<\/code> und <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">http:\/\/<\/code> sowie Subdomains werden dabei getrennt behandelt.<\/p>\n<figure style=\"margin:2rem 0;text-align:center\"><img loading=\"lazy\" decoding=\"async\" src=\"https:\/\/storage.googleapis.com\/wolf-of-seo-content\/wolf-of-seo.de\/glossary\/robots-txt\/1-diagram.png\" alt=\"Flussdiagramm, das zeigt, wie ein Crawler anhand der robots.txt entscheidet, ob eine URL abgerufen wird\" width=\"2800\" height=\"4374\" style=\"max-width:100%;height:auto\"\/><figcaption style=\"font-size:0.9em;color:#555;margin-top:0.6rem\">Der Entscheidungsweg eines Crawlers vom Seitenaufruf bis zur Crawl-Entscheidung<\/figcaption><\/figure>\n<h2>Warum ist die robots.txt f&#xFC;r SEO wichtig?<\/h2>\n<p>Die robots.txt ist f&#xFC;r SEO wichtig, weil sie steuert, wie ein Crawler seine begrenzte Zeit auf Deiner Website verbringt. Gro&#xDF;e Shops mit Filtern, Sortierungen und Session-Parametern erzeugen schnell Millionen faktisch identischer URLs. Ohne Steuerung verheddert sich der Bot in diesem Labyrinth, statt Deine neuen Produktseiten zu entdecken.<\/p>\n<p>Dieses Zusammenspiel nennt sich <a href=\"https:\/\/wolf-of-seo.de\/was-ist\/crawl-budget\">Crawl Budget<\/a>: die Menge an URLs, die eine <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Suchmaschine<\/span> in einem bestimmten Zeitraum von Deiner Domain abruft. Sperrst Du unwichtige Bereiche wie interne <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Suchergebnisse<\/span> oder Warenkorb-URLs, lenkst Du dieses Budget auf die Seiten, die tats&#xE4;chlich Umsatz bringen. Das ist gerade bei gro&#xDF;en <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">E-Commerce<\/span>-Projekten ein sp&#xFC;rbarer Hebel.<\/p>\n<p>Ein zweiter Grund ist die Entlastung Deines Servers. Aggressives <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Crawling<\/span> kann bei schwacher Infrastruktur die Ladezeit f&#xFC;r echte Nutzer verschlechtern. &#xDC;ber gezielte Disallow-Regeln reduzierst Du unn&#xF6;tige Abrufe &#x2013; und das wirkt sich indirekt auf die Nutzererfahrung und damit auf Deine Rankings aus.<\/p>\n<div style=\"background:#fff8e6;border-left:4px solid #d69e2e;padding:0.9em 1.2em;margin:1.5em 0;border-radius:4px;\">\n<p style=\"margin:0;\"><strong>Wichtig:<\/strong> F&#xFC;r kleine Websites mit ein paar Dutzend Seiten ist Crawl-Budget-Optimierung praktisch irrelevant. Google crawlt solche Seiten ohnehin vollst&#xE4;ndig. Bastle dann keine komplexe robots.txt zusammen &#x2013; eine leere oder minimale Datei ist hier oft die bessere Wahl.<\/p>\n<\/div>\n<h2>robots.txt vs. Meta Robots Tag: der entscheidende Unterschied<\/h2>\n<p>Die robots.txt steuert das <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Crawling<\/span>, der <a href=\"https:\/\/wolf-of-seo.de\/was-ist\/meta-robots-tag\">Meta Robots Tag<\/a> steuert die Indexierung &#x2013; und diese Verwechslung ist der teuerste Fehler im ganzen Themenfeld. Eine per robots.txt gesperrte Seite ruft Google nicht ab, kann sie aber trotzdem indexieren, wenn andere Seiten darauf verlinken.<\/p>\n<p>Das Ergebnis ist der ber&uuml;chtigte Suchtreffer &bdquo;F&uuml;r diese Seite sind keine Informationen verf&uuml;gbar&ldquo; &ndash; die <span class=\"\"  data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]'  tabindex='0' role='link'>URL<\/span> steht im <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Index<\/span>, aber ohne Snippet, weil Google den Inhalt nie lesen durfte. Willst Du eine Seite wirklich aus dem <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Index<\/span> halten, brauchst Du <a href=\"https:\/\/wolf-of-seo.de\/was-ist\/noindex\">Noindex<\/a> im Meta-Tag oder HTTP-Header &#x2013; und daf&#xFC;r muss die Seite crawlbar bleiben.<\/p>\n<p>Die Faustregel aus der Agentur-Praxis: robots.txt nutzt Du, um <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Crawling<\/span> zu verhindern (Crawl-Budget, Serverlast). <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Noindex<\/span> nutzt Du, um Seiten aus dem <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Index<\/span> zu halten (D&uuml;nne Inhalte, Duplikate). Beides zusammen auf derselben <span class=\"\"  data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]'  tabindex='0' role='link'>URL<\/span> ist ein Widerspruch &ndash; Google sieht das <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Noindex<\/span> nie, weil es die Seite gar nicht erst crawlt.<\/p>\n<p>Der Vollst&#xE4;ndigkeit halber: &#xDC;ber die robots.txt l&#xE4;sst sich zwar ein inoffizielles <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\"><span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Noindex<\/span>:<\/code>-Feld setzen, doch Google hat dessen Unterst&#xFC;tzung 2019 offiziell eingestellt. Verlasse Dich niemals darauf.<\/p>\n<table>\n<thead>\n<tr>\n<th>Kriterium<\/th>\n<th>robots.txt<\/th>\n<th><span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Meta Robots Tag<\/span> (<span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">noindex<\/span>)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Steuert<\/td>\n<td><span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Crawling<\/span> (Abruf)<\/td>\n<td>Indexierung (Aufnahme)<\/td>\n<\/tr>\n<tr>\n<td>Ort<\/td>\n<td>Datei im Wurzelverzeichnis<\/td>\n<td>Im HTML-Head jeder Seite<\/td>\n<\/tr>\n<tr>\n<td>Seite wird gelesen?<\/td>\n<td>Nein, bei Disallow<\/td>\n<td>Ja, muss crawlbar sein<\/td>\n<\/tr>\n<tr>\n<td>H&#xE4;lt aus dem <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Index<\/span>?<\/td>\n<td>Nein (nur bedingt)<\/td>\n<td>Ja, zuverl&#xE4;ssig<\/td>\n<\/tr>\n<tr>\n<td>Spart Crawl-Budget?<\/td>\n<td>Ja<\/td>\n<td>Nein<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Kurz gesagt: W&#xE4;hle das Werkzeug nach dem Ziel. Soll der Bot gar nicht erst hinsehen, ist die robots.txt richtig. Soll die Seite sichtbar bleiben, aber nicht ranken, brauchst Du <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Noindex<\/span>.<\/p>\n<h2>Die robots.txt-Syntax mit Beispiel-Konfiguration<\/h2>\n<p>Die robots.txt-Syntax kennt eine Handvoll Direktiven, die in der Praxis fast alles abdecken. Jeder Regelblock beginnt mit einer oder mehreren <a href=\"https:\/\/wolf-of-seo.de\/was-ist\/user-agent\">User Agent<\/a>-Zeilen, gefolgt von den zugeh&#xF6;rigen Disallow- und Allow-Anweisungen. Ein Sternchen (<code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">*<\/code>) im User-Agent gilt als Platzhalter f&#xFC;r alle Bots.<\/p>\n<p>Zwei Wildcards machen die Regeln flexibel: Das <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">*<\/code> steht f&#xFC;r eine beliebige Zeichenfolge, das <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">$<\/code> markiert das Ende einer <span class=\"\"  data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]'  tabindex='0' role='link'>URL<\/span>. Mit <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">Disallow: \/*.pdf$<\/code> sperrst Du also alle PDF-Dateien. Kommentare beginnen mit <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">#<\/code> und werden ignoriert.<\/p>\n<pre style=\"background-color:#f6f8fa;color:#1f2328;padding:16px;border-radius:6px;border:1px solid #d0d7de;overflow-x:auto;font-size:14px;line-height:1.6\"><code># Beispiel-robots.txt fuer einen Onlineshop\nUser-agent: *\nDisallow: \/warenkorb\/\nDisallow: \/checkout\/\nDisallow: \/*?sort=\nDisallow: \/suche\nAllow: \/suche\/ratgeber\n\nUser-agent: Googlebot-Image\nDisallow: \/intern\/\n\nSitemap: https:\/\/www.beispielshop.de\/sitemap.xml\n<\/code><\/pre>\n<p>Dieser Block sperrt f&#xFC;r alle Bots die Warenkorb-, Checkout- und Sortier-URLs sowie die interne Suche, erlaubt aber gezielt einen Ratgeber-Pfad darunter. Der zweite Block gilt nur f&#xFC;r den Bilder-Crawler von Google. Am Ende steht der Verweis auf die <a href=\"https:\/\/wolf-of-seo.de\/was-ist\/sitemap\">Sitemap<\/a> &#x2013; ein Feld, das Crawlern hilft, alle relevanten URLs schneller zu finden.<\/p>\n<div style=\"background:#eef7f0;border-left:4px solid #38a169;padding:0.9em 1.2em;margin:1.5em 0;border-radius:4px;\">\n<p style=\"margin:0;\"><strong>Profi-Tipp:<\/strong> Bei konkurrierenden Regeln gewinnt bei Google die spezifischste (l&#xE4;ngste) Pfadangabe &#x2013; nicht die Reihenfolge. <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">Allow: \/ordner\/seite<\/code> schl&#xE4;gt also <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">Disallow: \/ordner\/<\/code>. Verlasse Dich im Zweifel nie auf Dein Bauchgef&uuml;hl, sondern teste die konkrete <span class=\"\"  data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]'  tabindex='0' role='link'>URL<\/span>.<\/p>\n<\/div>\n<h3>Wichtige Direktiven im &#xDC;berblick<\/h3>\n<p>Neben Disallow und Allow gibt es Felder, deren Unterst&#xFC;tzung von Bot zu Bot variiert. Die folgende Tabelle zeigt, worauf Du Dich verlassen kannst und worauf nicht.<\/p>\n<table>\n<thead>\n<tr>\n<th>Direktive<\/th>\n<th>Funktion<\/th>\n<th>Von Google unterst&#xFC;tzt?<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>User-agent<\/td>\n<td>Legt fest, f&#xFC;r welchen Bot der Block gilt<\/td>\n<td>Ja<\/td>\n<\/tr>\n<tr>\n<td>Disallow<\/td>\n<td>Sperrt einen Pfad f&#xFC;r das <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Crawling<\/span><\/td>\n<td>Ja<\/td>\n<\/tr>\n<tr>\n<td>Allow<\/td>\n<td>Erlaubt eine Ausnahme im gesperrten Pfad<\/td>\n<td>Ja<\/td>\n<\/tr>\n<tr>\n<td><span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Sitemap<\/span><\/td>\n<td>Verweist auf die XML-<span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Sitemap<\/span><\/td>\n<td>Ja<\/td>\n<\/tr>\n<tr>\n<td>Crawl-delay<\/td>\n<td>Pause zwischen Abrufen in Sekunden<\/td>\n<td>Nein (Bing\/<span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Yandex<\/span> ja)<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Die Kernaussage: Halte Dich an die vier von Google unterst&#xFC;tzten Felder. <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">Crawl-delay<\/code> ignoriert der <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Googlebot<\/span> komplett &#x2013; die Crawl-Frequenz steuerst Du dort &#xFC;ber die Search Console oder &#xFC;ber Serverantworten.<\/p>\n<h3>Wie sieht eine echte robots.txt aus?<\/h3>\n<p>Eine echte robots.txt gro&#xDF;er Shops ist oft &#xFC;berraschend umfangreich, weil sie &#xFC;ber Jahre gewachsen ist. Wirf einen Blick auf &#xF6;ffentlich einsehbare Dateien gro&#xDF;er Anbieter &#x2013; jede Domain legt ihre robots.txt offen, das geh&#xF6;rt zum Standard. So siehst Du, wie Profis Filter-, Login- und Parameter-Pfade in der Praxis behandeln.<\/p>\n<figure style=\"margin:2rem 0;text-align:center\"><img loading=\"lazy\" decoding=\"async\" src=\"https:\/\/storage.googleapis.com\/wolf-of-seo-content\/wolf-of-seo.de\/glossary\/robots-txt\/2-screenshot.png\" alt=\"Screenshot der Live-robots.txt von otto.de mit zahlreichen Disallow-Regeln fuer Filter- und Session-Pfade\" width=\"1920\" height=\"1080\" style=\"max-width:100%;height:auto\"\/><figcaption style=\"font-size:0.9em;color:#555;margin-top:0.6rem\">Eine produktive robots.txt eines grossen Onlineshops mit gewachsenen Sperrregeln<\/figcaption><\/figure>\n<h2>robots.txt richtig testen und erstellen<\/h2>\n<p>Die robots.txt testest Du am zuverl&auml;ssigsten mit dem robots.txt-Tester der Google Search Console. Dort gibst Du eine konkrete <span class=\"\"  data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]'  tabindex='0' role='link'>URL<\/span> ein und siehst sofort, ob und durch welche Regel sie blockiert wird. Dieser Live-Test ist Pflicht vor jedem Deployment &ndash; eine Vermutung reicht nicht.<\/p>\n<p>Zum Erstellen brauchst Du keinen teuren Generator. Ein reiner Texteditor gen&#xFC;gt, die Datei muss lediglich <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">UTF-8<\/span>-kodiert sein und exakt <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">robots.txt<\/code> hei&#xDF;en. Lade sie anschlie&#xDF;end per FTP ins Wurzelverzeichnis oder lass sie von Deinem CMS ausliefern. WordPress etwa erzeugt automatisch eine virtuelle robots.txt, die Du &#xFC;ber SEO-Plugins wie Yoast oder Rank Math anpasst.<\/p>\n<p>Bei Shop-Systemen unterscheidet sich der Weg: Shopify erlaubt seit 2021 das Bearbeiten &#xFC;ber die Datei <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">robots.txt.liquid<\/code>, Shopware und Magento bringen eigene Konfigurationsmasken mit. Pr&#xFC;fe nach jeder Anpassung, ob die Datei tats&#xE4;chlich unter der Root ausgeliefert wird &#x2013; gerade bei Multishop-Setups landet sie sonst auf der falschen <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Subdomain<\/span>.<\/p>\n<div style=\"background:#f0f4ff;border-left:4px solid #5a67d8;padding:0.9em 1.2em;margin:1.5em 0;border-radius:4px;\">\n<p style=\"margin:0;\"><strong>Gut zu wissen:<\/strong> F&uuml;r einen schnellen Fehler-Scan &uuml;ber alle Regeln hinweg eignet sich Screaming Frog: Der Crawler liest Deine robots.txt ein und markiert jede <span class=\"\"  data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]'  tabindex='0' role='link'>URL<\/span>, die durch eine Direktive blockiert wird. So findest Du versehentlich gesperrte Seiten in Minuten statt durch m&uuml;hsames Einzel-Pr&uuml;fen.<\/p>\n<\/div>\n<h2>robots.txt und KI-Crawler: der aktuelle Streitpunkt<\/h2>\n<p>Die robots.txt ist 2026 zum zentralen Schauplatz im Umgang mit KI-Crawlern geworden. Betreiber sperren zunehmend Bots wie GPTBot von OpenAI oder ClaudeBot, um zu verhindern, dass ihre Inhalte ohne Gegenleistung f&#xFC;r das Training gro&#xDF;er Sprachmodelle abgesaugt werden. Die Syntax daf&#xFC;r ist identisch &#x2013; Du adressierst den KI-Bot einfach per User-Agent.<\/p>\n<pre style=\"background-color:#f6f8fa;color:#1f2328;padding:16px;border-radius:6px;border:1px solid #d0d7de;overflow-x:auto;font-size:14px;line-height:1.6\"><code># KI-Trainings-Crawler aussperren\nUser-agent: GPTBot\nDisallow: \/\n\nUser-agent: ClaudeBot\nDisallow: \/\n<\/code><\/pre>\n<p>Die entscheidende Einschr&#xE4;nkung: Das funktioniert nur, solange der Anbieter seinen Bot ehrlich benennt und sich an die Regeln h&#xE4;lt. Genau hier liegt die grundlegende Schw&#xE4;che des Standards, auf die wir im n&#xE4;chsten Abschnitt eingehen.<\/p>\n<h3>Datierte Fakten zum Einordnen<\/h3>\n<p>Wie relevant das Thema ist, zeigen belastbare Zahlen aus j&#xFC;ngeren Untersuchungen:<\/p>\n<ul>\n<li>Laut einer Analyse von <strong>Originality.ai (2024)<\/strong> blockierten bereits rund <strong>35 % der 1.000 meistbesuchten Websites<\/strong> den GPTBot von OpenAI per robots.txt.<\/li>\n<li>Eine Untersuchung des <strong>Data Provenance Initiative (MIT, 2024)<\/strong> ergab, dass innerhalb eines Jahres &#xFC;ber <strong>25 % der hochwertigsten Webquellen<\/strong> f&#xFC;r KI-Training per robots.txt oder Nutzungsbedingungen eingeschr&#xE4;nkt wurden.<\/li>\n<li>Google best&#xE4;tigte in der <strong>Search-Central-Dokumentation (2024)<\/strong>, dass eine per robots.txt blockierte Seite dennoch indexiert werden kann, wenn externe Links auf sie verweisen.<\/li>\n<\/ul>\n<figure style=\"margin:2rem 0;text-align:center\"><img loading=\"lazy\" decoding=\"async\" src=\"https:\/\/storage.googleapis.com\/wolf-of-seo-content\/wolf-of-seo.de\/glossary\/robots-txt\/3-chart.png\" alt=\"Balkendiagramm, das den Anstieg gesperrter GPTBot-Zugriffe bei Top-Websites von 9 auf 35 Prozent zeigt\" width=\"2800\" height=\"1756\" style=\"max-width:100%;height:auto\"\/><figcaption style=\"font-size:0.9em;color:#555;margin-top:0.6rem\">Der rasante Anstieg der GPTBot-Sperrungen belegt, wie schnell Betreiber die robots.txt als Kontrollinstrument entdecken<\/figcaption><\/figure>\n<h2>H&#xE4;ufige Fehler bei der robots.txt<\/h2>\n<p>Die meisten robots.txt-Probleme entstehen aus wenigen, immer gleichen Mustern. Diese f&#xFC;nf Fehler siehst Du in der Praxis am h&#xE4;ufigsten:<\/p>\n<ol>\n<li><strong>Die ganze Website versehentlich sperren.<\/strong> Ein <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">Disallow: \/<\/code> im Block f&#xFC;r alle Bots nimmt Deine komplette Domain aus dem <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Crawling<\/span>. Klassiker beim Umzug von der Staging- auf die Live-Umgebung, wenn die Sperre nicht entfernt wird. <em>Fix:<\/em> Nach jedem Go-live die robots.txt sofort pr&#xFC;fen.<\/li>\n<li><strong><span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Crawling<\/span> statt Indexierung sperren wollen.<\/strong> Wer eine Seite aus Google entfernen will und sie per Disallow sperrt, erreicht das Gegenteil &ndash; die <span class=\"\"  data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]'  tabindex='0' role='link'>URL<\/span> bleibt im <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Index<\/span>, nur ohne Snippet. <em>Fix:<\/em> <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Noindex<\/span> verwenden und die Seite crawlbar lassen.<\/li>\n<li><strong>CSS und <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">JavaScript<\/span> blockieren.<\/strong> Sperrst Du Ressourcen-Ordner, kann Google Deine Seiten nicht rendern und bewertet sie schlechter. <em>Fix:<\/em> Ressourcen-Pfade grunds&#xE4;tzlich crawlbar halten.<\/li>\n<li><strong>Die Datei am falschen Ort ablegen.<\/strong> Eine robots.txt in einem Unterordner wird komplett ignoriert. <em>Fix:<\/em> Ausschlie&#xDF;lich ins Wurzelverzeichnis der jeweiligen (Sub-)Domain.<\/li>\n<li><strong>Sensible Pfade offen benennen.<\/strong> Wer <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">Disallow: \/admin-geheim\/<\/code> schreibt, verr&#xE4;t Angreifern genau diesen Pfad &#x2013; die Datei ist &#xF6;ffentlich lesbar. <em>Fix:<\/em> Echten Schutz &#xFC;ber Serverseitige Authentifizierung, nie &#xFC;ber robots.txt.<\/li>\n<\/ol>\n<p>Ein Mini-Case aus der Agentur-Praxis verdeutlicht Fehler 1: Ein Onlineshop verlor binnen zwei Wochen rund 60 % seines organischen Traffics. Ursache war eine einzige Zeile <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">Disallow: \/<\/code>, die beim Relaunch aus der <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Staging-Umgebung<\/span> mitgezogen wurde. Nach dem Entfernen der Zeile und einer erneuten Einreichung der <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Sitemap<\/span> erholten sich die Rankings innerhalb von drei Wochen fast vollst&#xE4;ndig &#x2013; ein teurer, aber komplett vermeidbarer Fehler.<\/p>\n<div style=\"background:#f7f7f7;border:1px solid #ddd;padding:1em 1.25em;margin:1.5em 0;border-radius:4px;\">\n<p style=\"margin:0 0 0.5em;font-weight:700;\">Checkliste: robots.txt live schalten<\/p>\n<ul style=\"margin:0;padding-left:1.2em;\">\n<li>Datei liegt exakt unter <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">\/robots.txt<\/code> im Wurzelverzeichnis<\/li>\n<li>Keine unbeabsichtigte <code style=\"background-color:#f6f8fa;color:#1f2328;padding:2px 6px;border-radius:4px;font-size:0.9em\">Disallow: \/<\/code>-Regel vorhanden<\/li>\n<li>CSS-, JS- und Bild-Ressourcen sind crawlbar<\/li>\n<li><span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Sitemap<\/span>-Zeile mit absoluter <span class=\"\"  data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]'  tabindex='0' role='link'>URL<\/span> erg&auml;nzt<\/li>\n<li>Jede kritische <span class=\"\"  data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]'  tabindex='0' role='link'>URL<\/span> im Search-Console-Tester gepr&uuml;ft<\/li>\n<li>Kein sensibler Pfad im Klartext offengelegt<\/li>\n<\/ul>\n<\/div>\n<h2>H&#xE4;ufige Fragen zu robots.txt<\/h2>\n<h3>Was passiert, wenn keine robots.txt existiert?<\/h3>\n<p>Fehlt die robots.txt, d&#xFC;rfen Crawler standardm&#xE4;&#xDF;ig die gesamte Website abrufen. Das ist f&#xFC;r kleine Seiten v&#xF6;llig in Ordnung &#x2013; Google interpretiert einen fehlenden Statuscode 404 als &#x201E;keine Einschr&#xE4;nkungen&#x201C;. Ein Onlineshop mit vielen Parameter-URLs profitiert dagegen von einer bewusst gepflegten Datei, um Crawl-Budget zu lenken.<\/p>\n<h3>Kann ich mit der robots.txt Seiten aus Google entfernen?<\/h3>\n<p>Nein, die robots.txt entfernt keine Seiten zuverl&#xE4;ssig aus dem <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Index<\/span>. Sie verhindert nur den Abruf. Eine bereits indexierte, dann gesperrte Seite bleibt oft monatelang in den Suchergebnissen. Zum Entfernen brauchst Du <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Noindex<\/span> oder das Entfernungstool der Search Console &#x2013; und die Seite muss daf&#xFC;r crawlbar sein.<\/p>\n<h3>Muss jede Website eine robots.txt haben?<\/h3>\n<p>Nein, eine robots.txt ist technisch optional. Viele kleine Websites laufen ohne und ranken einwandfrei. Sinnvoll wird sie, sobald Du bestimmte Bereiche vom <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Crawling<\/span> ausschlie&#xDF;en oder auf Deine <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Sitemap<\/span> verweisen willst. Als Best Practice empfiehlt sich mindestens eine minimale Datei mit dem <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Sitemap<\/span>-Verweis.<\/p>\n<h3>Halten sich alle Bots an die robots.txt?<\/h3>\n<p>Nein, die robots.txt ist eine freiwillige Vereinbarung ohne technische Durchsetzung. Seri&#xF6;se Crawler wie <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Googlebot<\/span> oder Bingbot respektieren sie, w&#xE4;hrend Scraper und Malware-Bots sie ignorieren. F&#xFC;r echten Schutz sensibler Bereiche brauchst Du deshalb serverseitige Zugriffskontrollen, kein Disallow.<\/p>\n<h3>Wie oft liest Google meine robots.txt neu ein?<\/h3>\n<p>Google ruft die robots.txt in der Regel einmal t&#xE4;glich ab und cacht sie bis zu 24 Stunden. &#xC4;nderungen greifen also nicht sofort. Willst Du eine Aktualisierung beschleunigen, kannst Du in der Search Console eine erneute Verarbeitung ansto&#xDF;en &#x2013; gerade nach dem Beheben einer versehentlichen Vollsperre ist das wertvoll.<\/p>\n<h2>Verwandte Begriffe<\/h2>\n<ul>\n<li><a href=\"https:\/\/wolf-of-seo.de\/was-ist\/crawling\">Crawling<\/a> &#x2013; wie Suchmaschinen Deine Seiten &#xFC;berhaupt entdecken.<\/li>\n<li><a href=\"https:\/\/wolf-of-seo.de\/was-ist\/sitemap\">Sitemap<\/a> &#x2013; die Landkarte Deiner URLs f&#xFC;r Crawler.<\/li>\n<li><a href=\"https:\/\/wolf-of-seo.de\/was-ist\/meta-robots-tag\">Meta Robots Tag<\/a> &#x2013; steuert die Indexierung einzelner Seiten.<\/li>\n<li><a href=\"https:\/\/wolf-of-seo.de\/was-ist\/noindex\">Noindex<\/a> &#x2013; h&#xE4;lt Seiten zuverl&#xE4;ssig aus dem <span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">Index<\/span>.<\/li>\n<li><a href=\"https:\/\/wolf-of-seo.de\/was-ist\/crawl-budget\">Crawl Budget<\/a> &#x2013; das Zeitkontingent der Crawler auf Deiner Domain.<\/li>\n<li><a href=\"https:\/\/wolf-of-seo.de\/was-ist\/user-agent\">User Agent<\/a> &#x2013; die Kennung, &#xFC;ber die Bots angesprochen werden.<\/li>\n<li><a href=\"https:\/\/wolf-of-seo.de\/was-ist\/webcrawler\">Webcrawler<\/a> &#x2013; die Programme, die das Web systematisch abrufen.<\/li>\n<\/ul>\n<p><!-- META: title=\"robots.txt: Crawling gezielt steuern | SEO-Glossar\" description=\"robots.txt ist eine Textdatei im Wurzelverzeichnis, die Crawlern sagt, welche Pfade sie abrufen d&#252;rfen. So funktioniert Syntax, Test und Praxis.\" --><\/p>\n<p><script type=\"application\/ld+json\">\n{\n  \"@context\": \"https:\/\/schema.org\",\n  \"@type\": \"DefinedTerm\",\n  \"name\": \"robots.txt\",\n  \"alternateName\": \"Robots-Exclusion-Protokoll\",\n  \"description\": \"Die robots.txt ist eine einfache Textdatei im Wurzelverzeichnis einer Domain, die Webcrawlern nach dem Robots-Exclusion-Standard mitteilt, welche Pfade sie abrufen d\u00fcrfen und welche nicht. Sie besteht aus Regelbl\u00f6cken pro User-Agent mit Disallow- und Allow-Anweisungen. Auch als Robots-Exclusion-Protokoll bekannt.\",\n  \"inDefinedTermSet\": \"https:\/\/wolf-of-seo.de\/was-ist\/\"\n}\n<\/script><\/p>\n<p><script type=\"application\/ld+json\">\n{\n  \"@context\": \"https:\/\/schema.org\",\n  \"@type\": \"DefinedTermSet\",\n  \"name\": \"Wolf of SEO SEO-Glossar\",\n  \"url\": \"https:\/\/wolf-of-seo.de\/was-ist\/\"\n}\n<\/script><\/p>\n<p><script type=\"application\/ld+json\">\n{\n  \"@context\": \"https:\/\/schema.org\",\n  \"@type\": \"FAQPage\",\n  \"mainEntity\": [\n    {\n      \"@type\": \"Question\",\n      \"name\": \"Was passiert, wenn keine robots.txt existiert?\",\n      \"acceptedAnswer\": {\n        \"@type\": \"Answer\",\n        \"text\": \"Fehlt die robots.txt, d\u00fcrfen Crawler standardm\u00e4\u00dfig die gesamte Website abrufen. Das ist f\u00fcr kleine Seiten v\u00f6llig in Ordnung \u2013 Google interpretiert einen fehlenden Statuscode 404 als \u201ekeine Einschr\u00e4nkungen\u201c. Ein Onlineshop mit vielen Parameter-URLs profitiert dagegen von einer bewusst gepflegten Datei, um Crawl-Budget zu lenken.\"\n      }\n    },\n    {\n      \"@type\": \"Question\",\n      \"name\": \"Kann ich mit der robots.txt Seiten aus Google entfernen?\",\n      \"acceptedAnswer\": {\n        \"@type\": \"Answer\",\n        \"text\": \"Nein, die robots.txt entfernt keine Seiten zuverl\u00e4ssig aus dem Index. Sie verhindert nur den Abruf. Eine bereits indexierte, dann gesperrte Seite bleibt oft monatelang in den Suchergebnissen. Zum Entfernen brauchst Du Noindex oder das Entfernungstool der Search Console \u2013 und die Seite muss daf\u00fcr crawlbar sein.\"\n      }\n    },\n    {\n      \"@type\": \"Question\",\n      \"name\": \"Muss jede Website eine robots.txt haben?\",\n      \"acceptedAnswer\": {\n        \"@type\": \"Answer\",\n        \"text\": \"Nein, eine robots.txt ist technisch optional. Viele kleine Websites laufen ohne und ranken einwandfrei. Sinnvoll wird sie, sobald Du bestimmte Bereiche vom Crawling ausschlie\u00dfen oder auf Deine Sitemap verweisen willst. Als Best Practice empfiehlt sich mindestens eine minimale Datei mit dem Sitemap-Verweis.\"\n      }\n    },\n    {\n      \"@type\": \"Question\",\n      \"name\": \"Halten sich alle Bots an die robots.txt?\",\n      \"acceptedAnswer\": {\n        \"@type\": \"Answer\",\n        \"text\": \"Nein, die robots.txt ist eine freiwillige Vereinbarung ohne technische Durchsetzung. Seri\u00f6se Crawler wie Googlebot oder Bingbot respektieren sie, w\u00e4hrend Scraper und Malware-Bots sie ignorieren. F\u00fcr echten Schutz sensibler Bereiche brauchst Du deshalb serverseitige Zugriffskontrollen, kein Disallow.\"\n      }\n    },\n    {\n      \"@type\": \"Question\",\n      \"name\": \"Wie oft liest Google meine robots.txt neu ein?\",\n      \"acceptedAnswer\": {\n        \"@type\": \"Answer\",\n        \"text\": \"Google ruft die robots.txt in der Regel einmal t\u00e4glich ab und cacht sie bis zu 24 Stunden. \u00c4nderungen greifen also nicht sofort. Willst Du eine Aktualisierung beschleunigen, kannst Du in der Search Console eine erneute Verarbeitung ansto\u00dfen \u2013 gerade nach dem Beheben einer versehentlichen Vollsperre ist das wertvoll.\"\n      }\n    }\n  ]\n}\n<\/script><br>\n<script type=\"application\/ld+json\">{\"@context\":\"https:\/\/schema.org\",\"@type\":\"ImageObject\",\"contentUrl\":\"https:\/\/storage.googleapis.com\/wolf-of-seo-content\/wolf-of-seo.de\/glossary\/robots-txt\/1-diagram.png\",\"caption\":\"Der Entscheidungsweg eines Crawlers vom Seitenaufruf bis zur Crawl-Entscheidung\",\"description\":\"Flussdiagramm, das zeigt, wie ein Crawler anhand der robots.txt entscheidet, ob eine URL abgerufen wird\"}<\/script><br>\n<script type=\"application\/ld+json\">{\"@context\":\"https:\/\/schema.org\",\"@type\":\"ImageObject\",\"contentUrl\":\"https:\/\/storage.googleapis.com\/wolf-of-seo-content\/wolf-of-seo.de\/glossary\/robots-txt\/2-screenshot.png\",\"caption\":\"Eine produktive robots.txt eines grossen Onlineshops mit gewachsenen Sperrregeln\",\"description\":\"Screenshot der Live-robots.txt von otto.de mit zahlreichen Disallow-Regeln fuer Filter- und Session-Pfade\"}<\/script><br>\n<script type=\"application\/ld+json\">{\"@context\":\"https:\/\/schema.org\",\"@type\":\"ImageObject\",\"contentUrl\":\"https:\/\/storage.googleapis.com\/wolf-of-seo-content\/wolf-of-seo.de\/glossary\/robots-txt\/3-chart.png\",\"caption\":\"Der rasante Anstieg der GPTBot-Sperrungen belegt, wie schnell Betreiber die robots.txt als Kontrollinstrument entdecken\",\"description\":\"Balkendiagramm, das den Anstieg gesperrter GPTBot-Zugriffe bei Top-Websites von 9 auf 35 Prozent zeigt\"}<\/script><\/p>\n","protected":false},"excerpt":{"rendered":"<p><span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\"><span class=\"\" data-gt-translate-attributes='[{\"attribute\":\"data-cmtooltip\", \"format\":\"html\"}]' tabindex=\"0\" role=\"link\">robots.txt: So steuerst Du, welche Bereiche Deiner Website Suchmaschinen crawlen d&#xFC;rfen<\/span><\/span> Von Niels Stuck &#xB7; Aktualisiert am 17. Juli 2026 &#xB7; 11 Min. Lesezeit Die robots.txt ist die erste Datei, die ein Suchmaschinen-Crawler auf Deiner Website aufruft &#x2013; und eine der am h&#xE4;ufigsten falsch konfigurierten. Eine einzige Zeile zu viel, und pl&#xF6;tzlich verschwinden ganze Verzeichnisse [&#x2026;]<\/p>\n","protected":false},"author":3,"featured_media":50023,"menu_order":0,"template":"","meta":{"_acf_changed":false,"footnotes":""},"class_list":["post-50006","glossary","type-glossary","status-publish","has-post-thumbnail","hentry"],"acf":{"dynamic_banner":null,"show_faq":null,"faq_q_1":null,"faq_antwort_1":null,"faq_q_2":null,"faq_antwort_2":null,"faq_q_3":null,"faq_antwort_3":null,"faq_q_4":null,"faq_antwort_4":null,"faq_q_5":null,"faq_antwort_5":null,"faq_q_6":null,"faq_antwort_6":null,"faq_q_7":null,"faq_antwort_7":null,"faq_q_8":null,"faq_antwort_8":null,"faq_q_9":null,"faq_antwort_9":null,"faq_q_10":null,"faq_antwort_10":null,"meta_title":null,"meta_description":null,"focus_kw":null},"yoast_head":"<!-- This site is optimized with the Yoast SEO Premium plugin v27.8 (Yoast SEO v28.1) - https:\/\/yoast.com\/product\/yoast-seo-premium-wordpress\/ -->\n<title>robots.txt: Crawling gezielt steuern | SEO-Glossar<\/title>\n<meta name=\"description\" content=\"robots.txt ist eine Textdatei im Wurzelverzeichnis, die Crawlern sagt, welche Pfade sie abrufen d\u00fcrfen. So funktioniert Syntax, Test und Praxis.\" \/>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/wolf-of-seo.de\/en\/what-is\/robots-txt-2\/\" \/>\n<meta property=\"og:locale\" content=\"en_US\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"robots.txt: So steuerst Du, welche Bereiche Deiner Website Suchmaschinen crawlen d\u00fcrfen\" \/>\n<meta property=\"og:description\" content=\"robots.txt ist eine Textdatei im Wurzelverzeichnis, die Crawlern sagt, welche Pfade sie abrufen d\u00fcrfen. So funktioniert Syntax, Test und Praxis.\" \/>\n<meta property=\"og:url\" content=\"https:\/\/wolf-of-seo.de\/en\/what-is\/robots-txt-2\/\" \/>\n<meta property=\"og:site_name\" content=\"WOLF OF SEO\" \/>\n<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/wolf.of.seo.ns\" \/>\n<meta property=\"article:modified_time\" content=\"2026-07-17T11:17:24+00:00\" \/>\n<meta property=\"og:image\" content=\"https:\/\/wolf-of-seo.de\/wp-content\/uploads\/2026\/07\/hero-scaled.jpg\" \/>\n\t<meta property=\"og:image:width\" content=\"2560\" \/>\n\t<meta property=\"og:image:height\" content=\"604\" \/>\n\t<meta property=\"og:image:type\" content=\"image\/jpeg\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:site\" content=\"@wolf_of_seo\" \/>\n<meta name=\"twitter:label1\" content=\"Est. reading time\" \/>\n\t<meta name=\"twitter:data1\" content=\"12 minutes\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/was-ist\\\/robots-txt-2\\\/\",\"url\":\"https:\\\/\\\/wolf-of-seo.de\\\/was-ist\\\/robots-txt-2\\\/\",\"name\":\"robots.txt: Crawling gezielt steuern | SEO-Glossar\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/#website\"},\"primaryImageOfPage\":{\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/was-ist\\\/robots-txt-2\\\/#primaryimage\"},\"image\":{\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/was-ist\\\/robots-txt-2\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/wolf-of-seo.de\\\/wp-content\\\/uploads\\\/2026\\\/07\\\/hero-scaled.jpg\",\"datePublished\":\"2026-07-17T07:25:25+00:00\",\"dateModified\":\"2026-07-17T11:17:24+00:00\",\"description\":\"robots.txt ist eine Textdatei im Wurzelverzeichnis, die Crawlern sagt, welche Pfade sie abrufen d\u00fcrfen. So funktioniert Syntax, Test und Praxis.\",\"breadcrumb\":{\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/was-ist\\\/robots-txt-2\\\/#breadcrumb\"},\"inLanguage\":\"en-US\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/wolf-of-seo.de\\\/was-ist\\\/robots-txt-2\\\/\"]}]},{\"@type\":\"ImageObject\",\"inLanguage\":\"en-US\",\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/was-ist\\\/robots-txt-2\\\/#primaryimage\",\"url\":\"https:\\\/\\\/wolf-of-seo.de\\\/wp-content\\\/uploads\\\/2026\\\/07\\\/hero-scaled.jpg\",\"contentUrl\":\"https:\\\/\\\/wolf-of-seo.de\\\/wp-content\\\/uploads\\\/2026\\\/07\\\/hero-scaled.jpg\",\"width\":2560,\"height\":604,\"caption\":\"robots.txt\"},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/was-ist\\\/robots-txt-2\\\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Home\",\"item\":\"https:\\\/\\\/wolf-of-seo.de\\\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"robots.txt: So steuerst Du, welche Bereiche Deiner Website Suchmaschinen crawlen d\u00fcrfen\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/#website\",\"url\":\"https:\\\/\\\/wolf-of-seo.de\\\/\",\"name\":\"WOLF OF SEO\",\"description\":\"Die E-Commerce SEO-Agentur\",\"publisher\":{\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/#organization\"},\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/wolf-of-seo.de\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"en-US\"},{\"@type\":\"Organization\",\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/#organization\",\"name\":\"WOLF OF SEO\",\"url\":\"https:\\\/\\\/wolf-of-seo.de\\\/\",\"logo\":{\"@type\":\"ImageObject\",\"inLanguage\":\"en-US\",\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/#\\\/schema\\\/logo\\\/image\\\/\",\"url\":\"https:\\\/\\\/wolf-of-seo.de\\\/wp-content\\\/uploads\\\/2021\\\/11\\\/logo_wos_beitragsbild3.jpg\",\"contentUrl\":\"https:\\\/\\\/wolf-of-seo.de\\\/wp-content\\\/uploads\\\/2021\\\/11\\\/logo_wos_beitragsbild3.jpg\",\"width\":1,\"height\":1,\"caption\":\"WOLF OF SEO\"},\"image\":{\"@id\":\"https:\\\/\\\/wolf-of-seo.de\\\/#\\\/schema\\\/logo\\\/image\\\/\"},\"sameAs\":[\"https:\\\/\\\/www.facebook.com\\\/wolf.of.seo.ns\",\"https:\\\/\\\/x.com\\\/wolf_of_seo\"]}]}<\/script>\n<!-- \/ Yoast SEO Premium plugin. -->","yoast_head_json":{"title":"robots.txt: Crawling gezielt steuern | SEO-Glossar","description":"robots.txt ist eine Textdatei im Wurzelverzeichnis, die Crawlern sagt, welche Pfade sie abrufen d\u00fcrfen. So funktioniert Syntax, Test und Praxis.","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/wolf-of-seo.de\/en\/what-is\/robots-txt-2\/","og_locale":"en_US","og_type":"article","og_title":"robots.txt: So steuerst Du, welche Bereiche Deiner Website Suchmaschinen crawlen d\u00fcrfen","og_description":"robots.txt ist eine Textdatei im Wurzelverzeichnis, die Crawlern sagt, welche Pfade sie abrufen d\u00fcrfen. So funktioniert Syntax, Test und Praxis.","og_url":"https:\/\/wolf-of-seo.de\/en\/what-is\/robots-txt-2\/","og_site_name":"WOLF OF SEO","article_publisher":"https:\/\/www.facebook.com\/wolf.of.seo.ns","article_modified_time":"2026-07-17T11:17:24+00:00","og_image":[{"width":2560,"height":604,"url":"https:\/\/wolf-of-seo.de\/wp-content\/uploads\/2026\/07\/hero-scaled.jpg","type":"image\/jpeg"}],"twitter_card":"summary_large_image","twitter_site":"@wolf_of_seo","twitter_misc":{"Est. reading time":"12 minutes"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"WebPage","@id":"https:\/\/wolf-of-seo.de\/was-ist\/robots-txt-2\/","url":"https:\/\/wolf-of-seo.de\/was-ist\/robots-txt-2\/","name":"robots.txt: Crawling gezielt steuern | SEO-Glossar","isPartOf":{"@id":"https:\/\/wolf-of-seo.de\/#website"},"primaryImageOfPage":{"@id":"https:\/\/wolf-of-seo.de\/was-ist\/robots-txt-2\/#primaryimage"},"image":{"@id":"https:\/\/wolf-of-seo.de\/was-ist\/robots-txt-2\/#primaryimage"},"thumbnailUrl":"https:\/\/wolf-of-seo.de\/wp-content\/uploads\/2026\/07\/hero-scaled.jpg","datePublished":"2026-07-17T07:25:25+00:00","dateModified":"2026-07-17T11:17:24+00:00","description":"robots.txt ist eine Textdatei im Wurzelverzeichnis, die Crawlern sagt, welche Pfade sie abrufen d\u00fcrfen. So funktioniert Syntax, Test und Praxis.","breadcrumb":{"@id":"https:\/\/wolf-of-seo.de\/was-ist\/robots-txt-2\/#breadcrumb"},"inLanguage":"en-US","potentialAction":[{"@type":"ReadAction","target":["https:\/\/wolf-of-seo.de\/was-ist\/robots-txt-2\/"]}]},{"@type":"ImageObject","inLanguage":"en-US","@id":"https:\/\/wolf-of-seo.de\/was-ist\/robots-txt-2\/#primaryimage","url":"https:\/\/wolf-of-seo.de\/wp-content\/uploads\/2026\/07\/hero-scaled.jpg","contentUrl":"https:\/\/wolf-of-seo.de\/wp-content\/uploads\/2026\/07\/hero-scaled.jpg","width":2560,"height":604,"caption":"robots.txt"},{"@type":"BreadcrumbList","@id":"https:\/\/wolf-of-seo.de\/was-ist\/robots-txt-2\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https:\/\/wolf-of-seo.de\/"},{"@type":"ListItem","position":2,"name":"robots.txt: So steuerst Du, welche Bereiche Deiner Website Suchmaschinen crawlen d\u00fcrfen"}]},{"@type":"WebSite","@id":"https:\/\/wolf-of-seo.de\/#website","url":"https:\/\/wolf-of-seo.de\/","name":"WOLF OF SEO","description":"The e-commerce SEO agency","publisher":{"@id":"https:\/\/wolf-of-seo.de\/#organization"},"potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/wolf-of-seo.de\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"en-US"},{"@type":"Organization","@id":"https:\/\/wolf-of-seo.de\/#organization","name":"WOLF OF SEO","url":"https:\/\/wolf-of-seo.de\/","logo":{"@type":"ImageObject","inLanguage":"en-US","@id":"https:\/\/wolf-of-seo.de\/#\/schema\/logo\/image\/","url":"https:\/\/wolf-of-seo.de\/wp-content\/uploads\/2021\/11\/logo_wos_beitragsbild3.jpg","contentUrl":"https:\/\/wolf-of-seo.de\/wp-content\/uploads\/2021\/11\/logo_wos_beitragsbild3.jpg","width":1,"height":1,"caption":"WOLF OF SEO"},"image":{"@id":"https:\/\/wolf-of-seo.de\/#\/schema\/logo\/image\/"},"sameAs":["https:\/\/www.facebook.com\/wolf.of.seo.ns","https:\/\/x.com\/wolf_of_seo"]}]}},"_links":{"self":[{"href":"https:\/\/wolf-of-seo.de\/en\/wp-json\/wp\/v2\/glossary\/50006","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/wolf-of-seo.de\/en\/wp-json\/wp\/v2\/glossary"}],"about":[{"href":"https:\/\/wolf-of-seo.de\/en\/wp-json\/wp\/v2\/types\/glossary"}],"author":[{"embeddable":true,"href":"https:\/\/wolf-of-seo.de\/en\/wp-json\/wp\/v2\/users\/3"}],"version-history":[{"count":1,"href":"https:\/\/wolf-of-seo.de\/en\/wp-json\/wp\/v2\/glossary\/50006\/revisions"}],"predecessor-version":[{"id":50016,"href":"https:\/\/wolf-of-seo.de\/en\/wp-json\/wp\/v2\/glossary\/50006\/revisions\/50016"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/wolf-of-seo.de\/en\/wp-json\/wp\/v2\/media\/50023"}],"wp:attachment":[{"href":"https:\/\/wolf-of-seo.de\/en\/wp-json\/wp\/v2\/media?parent=50006"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}