Der Aufstieg von llms.txt: Wie Websites KI signalisieren

Zuletzt aktualisiert am June 18, 2026
Der Aufstieg von llms.txt: Wie Websites KI signalisieren
Datenextraktion mit Thunderbit.

Eine Crawl-gestützte Untersuchung dazu, wie traffic-starke Websites maschinenlesbare Hinweise für große Sprachmodelle bereitstellen, wie die ersten Umsetzungen konkret aussehen und warum sich die Verbreitung nicht einfach an der Zahl der HTTP-200-Antworten ablesen lässt.

  • Datensatz: data/llms_probe_results_top_10000.csv
  • Heruntergeladenes Tranco-Listing: 6. Mai 2026
  • Umfang: /llms.txt und /llms-full.txt auf Root-Ebene

Zentrale Kennzahlen

llms-txt-adoption-landscape.webp

  • 5,86 %: Validierte Verbreitung von llms.txt im Tranco Top 10.000, entsprechend 586 Domains.
  • 1,03 %: Validierte Verbreitung von llms-full.txt, entsprechend 103 Domains. Jede gültige Vollversion hatte auch eine gültige Indexdatei.
  • 63,51 %: Anteil der HTTP-200-Antworten für /llms.txt, die die Validierung nicht bestanden.
  • 2,74x: Grober Überschätzungsfaktor, wenn man die Verbreitung nur anhand roher HTTP-200-Antworten misst.

Kurzfassung

llms.txt ist nach wie vor eine junge Web-Konvention, aber kein Randexperiment mehr. Ein Crawl vom 6. Mai 2026 über die Tranco Top 10.000 Domains förderte 586 gültige llms.txt-Dateien zutage, was einer beobachteten Verbreitung von 5,86 % entspricht. Deutlich seltener war die Begleitdatei llms-full.txt: Nur 103 Domains hatten eine gültige Vollversion, also 1,03 %.

Methodisch ist vor allem eines wichtig: Statuscodes taugen kaum als Maßstab für die Adoption. Der Crawler verzeichnete 1.606 HTTP-200-Antworten für /llms.txt, doch nur 586 davon hielten der Validierung stand. Hinter den übrigen 1.020 verbargen sich meist Weiterleitungen auf falsche Ziele, generische HTML-Seiten, leere Inhalte oder andere ungültige Antworten. Ein naiver Crawler, der jede 200-Antwort als Adoption verbucht, würde die tatsächliche Verbreitung um etwa das 2,74-Fache überschätzen.

Unter den gültigen Anwendern ist die Umsetzungsqualität besser, als es eine reine Platzhalter-Erzählung erwarten ließe. Die mediane gültige Datei war rund 7,1 KB groß, 61,77 % der gültigen Dateien waren größer als 5 KB, 70,82 % enthielten sechs oder mehr Markdown-Abschnitte und 77,47 % enthielten 11 oder mehr Markdown-Links. Zu den frühen Anwendern gehören Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog und Cloudinary.

llms.txt versteht sich am besten als erklärendes und navigationsorientiertes Signal für KI-Systeme, nicht als Ersatz für robots.txt. Entscheidend ist nicht nur, dass die Datei existiert, sondern ob sie Maschinen hilft, autoritative, kompakte und aktuelle Informationen zu finden.

Kontext: Das Web ergänzt Signale für KI

Schon lange teilen Websites über robots.txt ihre Crawler-Präferenzen mit, machen URLs per sitemap.xml auffindbar und liefern strukturierte Daten, damit Such- und Plattformsysteme ihre Seiten besser interpretieren. Generative KI wirft jedoch ein anderes Problem auf. Inhalte lassen sich für Training, Retrieval, Zusammenfassungen, agentisches Browsing, Code-Hilfe, Kundensupport und Antwortgenerierung verwenden. Daraus entstehen zwei Anforderungen gleichzeitig: Publisher wünschen sich mehr Kontrolle über die automatisierte Nutzung, gleichzeitig sollen KI-Systeme die richtige kanonische Information finden, sobald sie mit ihren Seiten arbeiten.

Der ursprüngliche llms.txt-Vorschlag, den Jeremy Howard 2024 vorstellte, beschreibt die Datei als Markdown-Dokument im Website-Root, das zur Inferenzzeit LLM-freundliche Informationen bereithält. Das Argument: HTML-Seiten sind oft mit Navigation, Werbung, Skripten und anderen Störfaktoren überfrachtet, die ihre Verarbeitung für Sprachmodelle erschweren. Eine kompakte Markdown-Datei kann Modelle dagegen gezielt zu den wichtigsten Seiten, Dokus, APIs, Beispielen, Richtlinien und Produktinformationen führen.

Den größeren Rahmen liefert externe Web-Recherche. Die Data Provenance Initiative mit „Consent in Crisis“ dokumentiert einen rasanten Anstieg KI-bezogener Einschränkungen in robots.txt und Nutzungsbedingungen und hält fest, dass die bestehenden Web-Consent-Mechanismen nie für die großskalige Wiederverwendung von KI-Daten gedacht waren. Cloudflare Radar AI Insights wiederum hat Muster von KI-Crawlern und robots.txt auf Ebene der Top-10.000-Domains sichtbar gemacht. In diesem Umfeld steht llms.txt auf der konstruktiven Seite des KI-Signalings: nicht „dies hier nicht crawlen“, sondern „wenn du diese Website verstehen willst, fang hier an“.

Externe Evidenz und die Debatte über die Verbreitung

In der öffentlichen Debatte um llms.txt stehen sich zwei Lager gegenüber. Die optimistische These: Die Datei bietet KI-Systemen einen saubereren, effizienteren Weg zu autoritativen Inhalten. Die skeptische These: Kein großer LLM-Anbieter hat öffentlich zugesagt, llms.txt als Ranking-, Crawling- oder Zitationssignal zu nutzen, weshalb Publisher allein von der Datei keinen Traffic-Zuwachs erwarten sollten. Die drei für dieses Update ausgewerteten externen Quellen stützen eine differenziertere Schlussfolgerung: llms.txt ist nützliche Infrastruktur, doch die Belege für einen direkten Traffic-Effekt bleiben begrenzt und stark kontextabhängig.

Externe Benchmarks zur Verbreitung entwickeln sich schnell

Rankabilitys Adoption-Tracker meldete für den 22. Juni 2025 eine Verbreitungsrate von 0,3 % über die Top 1.000 Websites, also 3 von 1.000 Seiten. Dahinter steckt ein monatlicher automatisierter Scan von domain.com/llms.txt samt Validierung, die Weiterleitungen und HTML-Antworten ausschließt. Diese Methodik geht in eine ähnliche Richtung wie der konservative Validierungsansatz dieser Untersuchung.

Der Ergebnisunterschied ist beträchtlich: Diese Untersuchung fand am 6. Mai 2026 75 gültige llms.txt-Dateien in den Tranco Top 1.000, also 7,50 %. Die beiden Zahlen sollte man nicht als strikte Zeitreihe lesen, da sich Ranking-Quelle, Umsetzungsdetails, Validierungslogik und Crawl-Zeitpunkt unterscheiden können. Trotzdem deutet der Kontrast darauf hin, dass sich die Adoption zwischen Mitte 2025 und Mai 2026 spürbar bewegt hat, besonders bei entwickler-, SaaS-, Cloud-, Sicherheits- und dokumentationslastigen Websites.

QuelleSnapshotStichprobeBerichtete gültige VerbreitungEinordnung
Rankability22. Juni 2025Top 1.000 Websites0,3 %Früher öffentlicher Benchmark mit minimaler Adoption Mitte 2025.
Diese Studie6. Mai 2026Tranco Top 1.0007,50 %Späterer Crawl mit sichtbarer Adoption bei Websites mit hohem Traffic.
Diese Studie6. Mai 2026Tranco Top 10.0005,86 %Breitere Stichprobe, die zeigt, dass Adoption messbar, aber nicht Mainstream ist.

Traffic-Experimente bleiben gemischt

Search Engine Land veröffentlichte im Januar 2026 eine Analyse von 10 Websites, die jeweils 90 Tage vor und 90 Tage nach der Implementierung beobachtet wurden. Das Ergebnis: Zwei Sites legten beim KI-Traffic um 12,5 % bzw. 25 % zu, acht zeigten keinen messbaren Fortschritt und eine ging um 19,7 % zurück. Die Autoren mahnten zur kausalen Vorsicht, denn die beiden vermeintlichen Erfolgsfälle hatten gleichzeitig neue Templates eingeführt, Resource Centers neu aufgebaut, auslesbare Vergleichstabellen ergänzt, Presseberichterstattung erhalten, technische Probleme behoben oder neue FAQ-Inhalte veröffentlicht. So gelesen begleitete llms.txt stärkere Inhalte und technische Arbeit; den Anstieg allein verursacht hat es offenbar nicht.

Zu einem positiveren Schluss kam das persönliche Blog-Experiment von Renat Alimbekov, allerdings auf Basis einer kleineren Beobachtung auf Site-Ebene. Verglichen wurden zwei Viermonatszeiträume in Yandex.Metrica nach dem Hinzufügen von llms.txt und llms-full.txt. Die LLM-Referral-Sitzungen stiegen von 75 auf 92, also um 23 %, die Zahl der Nutzer wuchs von 51 auf 64. Perplexity-Sitzungen legten von 29 auf 55 zu, während ChatGPT-Sitzungen von 31 auf 26 fielen. Im selben Beitrag heißt es zudem, der gesamte Referral-Traffic sei schneller gewachsen, von 160 auf 290 Sitzungen, sodass der LLM-Anteil von 47 % auf 32 % sank.

EvidenztypBeobachtetes ErgebnisWichtigste EinschränkungBedeutung für diesen Bericht
Search-Engine-Land-Studie mit 10 Websites vor/nachherZwei Sites stiegen, acht blieben unverändert, eine sank.Positive Fälle hatten gleichzeitig Content-, PR- und technische Änderungen.Spricht dafür, llms.txt als Infrastruktur zu sehen, nicht als eigenständigen Wachstumstreiber.
Vorher/nachher-Beobachtung im persönlichen Blog von AlimbekovLLM-Referral-Sitzungen stiegen im Nachher-Zeitraum um 23 %.Keine Kontrollgruppe; der gesamte Referral-Traffic stieg um 81 %, und der LLM-Anteil sank.Weist auf mögliches Potenzial für technische Blogs hin, besonders über Perplexity, ohne die Kausalität isolieren zu können.
Diese Crawl-basierte Adoptionsstudie586 gültige Dateien und viele strukturierte Implementierungen.Misst Präsenz und Struktur, nicht den downstream Traffic-Effekt.Zeigt Adoption und Reife der Implementierung, aber nicht allein den ROI.

Was die Debatte klärt

Die externe Evidenz schärft den Blick auf diesen Datensatz. Eine gut strukturierte llms.txt-Datei kann die Parsing-Reibung für Maschinen verringern, vor allem bei Entwicklerdokumentation, API-Referenzen und Wissensdatenbank-Inhalten. Die überzeugendsten Traffic-Fälle hängen jedoch weiterhin von Inhalten ab, die nützlich, auslesbar, autoritativ und auch außerhalb der Datei auffindbar sind. Die eigentliche Frage lautet deshalb nicht isoliert „Ist llms.txt wichtig?“, sondern: Ist die Datei Teil eines umfassenderen, KI-lesbaren Content-Systems?

Aktualisierte Einordnung: llms.txt sollte als kostengünstige Infrastruktur für KI-Zielsysteme implementiert werden. Sie sollte nicht als Ersatz für bessere Dokumentation, strukturierte Inhalte, technische Zugänglichkeit, Zitate, Links oder Markenautorität positioniert werden.

Thunderbit für KI-Web-Scraping ausprobieren

Methodik

Als Stichprobe diente die Tranco Top 10.000 Domains. Tranco ist ein forschungsorientiertes Ranking der Top-Sites, das stabiler und manipulationsresistenter sein soll als viele klassische Ranglisten. Die Tranco-Quelldatei wurde am 6. Mai 2026 heruntergeladen; der Last-Modified-Zeitstempel der Quelle lag bei 5. Mai 2026, 22:17:59 GMT.

Pro Domain prüfte der Crawler zwei Root-Pfade:

  • https://example.com/llms.txt, bei Bedarf mit HTTP-Fallback.
  • https://example.com/llms-full.txt, bei Bedarf mit HTTP-Fallback.

Bei jedem Probeaufruf erfasste der Crawler Statuscode, finale URL, Abrufmethode, Antwortbytes, Content-Type, Fehlermeldung, Laufzeit und Validierungsergebnis. Erfolgreiche Antwortinhalte wurden unter raw_llms_txt/ für Sichtung und Sekundäranalyse abgelegt.

Validierungsregeln

Als gültige Datei zählte eine Antwort nur dann, wenn sie einen erfolgreichen Body lieferte und nicht wie ein generischer Web-Fallback aussah. Der finale URL-Pfad musste /llms.txt oder /llms-full.txt bleiben. Leere Bodies wurden verworfen. Offensichtliche HTML-Dokumente und App Shells ebenfalls. Der Content-Type galt als unterstützender Hinweis, nicht als alleinige Regel, da eine kleine Zahl gültiger textähnlicher Dateien mit ungewöhnlichen Content-Types ausgeliefert wurde.

Verbreitungslandschaft

Der Crawl fand 586 gültige llms.txt-Dateien im Tranco Top 10.000. Daraus ergibt sich eine gültige Verbreitungsrate von 5,86 %. Die kleinere Begleitdatei llms-full.txt war auf 103 Domains vorhanden und gültig, also auf 1,03 % der Stichprobe.

MetrikAnzahlAnteil am Top 10.000
Gecrawlte Domains10.000100,00 %
Gültige llms.txt-Dateien5865,86 %
Gültige llms-full.txt-Dateien1031,03 %
HTTP-200-Antworten für /llms.txt1.60616,06 %
Als ungültig verworfene HTTP-200-Antworten1.02010,20 %

Adoption ist nicht rein toplastig

In den Top 1.000 lag die Adoption höher als im gesamten Top 10.000, blieb aber nicht auf die allergrößten Websites beschränkt. Die Adoptionsrate in den Top 1.000 betrug 7,50 %. Das letzte 1.000er-Bucket, Rang 9.001–10.000, fiel auf 3,80 %. Die Mitte des Rankings blieb aktiv: Die Buckets 2.001–3.000, 3.001–4.000, 5.001–6.000 und 6.001–7.000 lagen alle um etwa 6 %.

tranco-domain-adoption-rate.webp

Frühe Anwender

Der höchstplatzierte gültige Anwender war Cloudflare auf Tranco-Rang 4. Weitere hochrangige Anwender waren Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink und OneSignal.

Diese Auswahl ist kein Zufall. Es sind meist Unternehmen mit großen Dokumentationsflächen, erklärungsbedürftigen Produktlinien, APIs oder Entwickler-Ökosystemen, Support-Inhalten, Preisübersichten, Sicherheits- und Datenschutzmaterial – und mit genug Markenautorität, um darauf zu achten, wie KI-Systeme ihre Sites interpretieren.

RangDomainDateigrößeBeobachtetes Muster
4cloudflare.com4.225 BKompakter Index für Produkte, Entwickler, Unternehmen und Preise.
26azure.com47.037 BEntwicklertools, KI, Compute, Storage, Sicherheit, Monitoring und optionale Ressourcen.
28github.com27.108 BProgrammatischer Zugriff, Copilot, MCP, REST API, Actions, Repositories und CLI-Links.
248stripe.com64.229 BZahlungen, Connect, Checkout, Billing, Tax, Atlas, Radar und Entwicklerdokumentation.
265salesforce.com1,02 MBRiesiger Produkt- und Agentforce-Link-Katalog ohne Markdown-Abschnittsüberschriften.

Kategorien der Top-1.000-Anwender

Die 75 gültigen Anwender in den Tranco Top 1.000 wurden anhand von Domain-Kontext, ersten Überschriften, Rohdateistruktur und Inhalts-Keywords klassifiziert. Die größte Gruppe stellte Marketing, Medien und Adtech mit 22,67 %. Cloud-, Entwickler- und Infrastruktur-Seiten kamen auf 20,00 %. Auf SaaS-, Produktivitäts- und Customer-Operations-Seiten entfielen 17,33 %. Sicherheits-, Identitäts- und Privacy-Seiten machten 12,00 % aus.

top-1000-adopters-categories.webp

KategorieDomainsAnteil der Top-1.000-AnwenderMedian des Qualitäts-ScoreMedian der Links
Marketing, Medien & Adtech1722,67 %9425
Cloud, Dev & Infrastruktur1520,00 %9462
SaaS, Produktivität & Customer Ops1317,33 %9446
Sicherheit, Identität & Datenschutz912,00 %9878
CMS, Hosting & Web-Präsenz79,33 %10024

TLD-Muster

Top-Level-Domains sind keine Branchenlabels, liefern aber brauchbare Richtungsindikatoren. Unter den TLDs mit mindestens 50 Domains in der Stichprobe hatte .io mit 14,44 % die höchste gültige Verbreitungsrate. Dahinter folgte .com mit 8,19 %. Dass die Adoption bei .gov, .edu und .net geringer ausfällt, deutet darauf hin, dass die frühe Anwenderbasis eher kommerziell und technisch als institutionell geprägt ist.

Implementierungsqualität

Gültige Adoption heißt nicht automatisch einheitliche Umsetzungsqualität. Manche Dateien sind kompakte, gut strukturierte Indizes. Manche bestehen überwiegend aus Fließtext. Manche sind reine Link-Kataloge. Manche sind nahezu leere Platzhalter. Und manche sind mehrere Megabyte schwere Inhalts-Dumps, vielleicht vollständig, aber teuer zu laden und zu parsen.

Unter den gültigen llms.txt-Dateien waren 362 größer als 5 KB, also 61,77 % der gültigen Anwender. Die mediane Dateigröße lag bei etwa 7,1 KB. Die P90-Dateigröße betrug 156 KB, P95 356 KB, P99 2,54 MB und die größte beobachtete Datei 7,97 MB.

Häufige Inhaltssignale

Ein Keyword-Scan der gültigen Dateien zeigte, dass viele Websites nicht bloß eine Erklärung veröffentlichen, sondern Modelle auf operativ nützliche Inhalte verweisen. Support- oder Hilfebegriffe tauchten in 70,31 % der gültigen Dateien auf. Blog-, Guide- oder Tutorial-Begriffe in 67,92 %. Sicherheits-, Datenschutz-, Compliance- oder Terms-Begriffe in 61,43 %. Pricing erschien in 53,92 %, Documentation in 52,22 %, API-Begriffe in 33,96 % und Changelog- oder Release-Signale in 27,30 %.

Qualitätsbewertung und Archetypen

Um von der reinen Präsenz zur Reife zu kommen, entstand für diese Untersuchung ein leichter Implementierungs-Score. Er berücksichtigt Content-Type, Dateigröße, Markdown-Struktur, Linkanzahl, Themenabdeckung und Warnsignale wie fehlende Überschriften, keine Markdown-Links, ungewöhnliche Content-Types, winzige Dateien, sehr große Dateien und Link-Dump-Verhalten. Das ist kein formaler Standard, sondern ein Forschungsmodell zum Vergleich beobachteter Implementierungen.

Mit diesem Modell wurden 416 gültige Dateien als starke strukturierte Indizes klassifiziert, 107 als nutzbare Indizes, 24 als dünn oder unregelmäßig und 39 als symbolisch oder von geringem Nutzen. Eine separate Archetypenanalyse ergab 296 strukturierte Indizes, 113 Dateien mit Abschnittstext, 63 Link-Kataloge, 52 dünne Indizes, 50 symbolische oder Platzhalter-Dateien und 12 massive Inhalts-Dumps.

tranco-crawl-implementation-archetypes.webp

ArchetypDomainsAnteil gültiger DateienMedian-ScoreMediane DateigrößeMediane Links
Strukturierter Index29650,51 %9811.241 B61,5
Abschnittstext11319,28 %784.718 B0
Link-Katalog6310,75 %864.160 B23
Dünner Index528,87 %662.814 B0
Symbolisch oder Platzhalter508,53 %2715 B0
Massiver Inhalts-Dump122,05 %742,84 MB7.259,5

Top-Anwender haben dichtere Implementierungen

tranco-crawl-ranks-stats.webp

Die 75 gültigen Anwender in den Tranco Top 1.000 erreichten einen medianen Qualitäts-Score von 96, eine mediane Dateigröße von 9.068 Byte, eine mediane Markdown-Linkanzahl von 52 und eine mediane Abschnittszahl von 11. Bei den 511 Anwendern mit Rang 1.001–10.000 fielen die Mediane niedriger aus: Score 90, Dateigröße 6.506 Byte, 23 Markdown-Links und 9 Abschnitte. Auch handelte es sich bei den Top-1.000-Anwendern häufiger um strukturierte Indizes: 69,33 % gegenüber 47,75 % in der späteren Kohorte.

Das Problem der Falschpositiven

llms-txt-http-200-outcomes.webp

Das größte Messrisiko sind Falschpositive. Von den 1.606 Domains, die für /llms.txt HTTP 200 zurückgaben, scheiterten 1.020 an der Validierung. Häufigster Grund war eine Weiterleitung auf ein falsches Ziel, in 618 Fällen. Weitere 367 Antworten waren generische HTML-Dokumente. 29 lieferten einen leeren Body, und 6 fielen unter sonstige oder nicht kategorisierte ungültige Antworten.

Das ist deshalb relevant, weil viele große Websites unbekannte Pfade auf Login-Seiten, Startseiten, App Shells, regionale Seiten, Consent-Flächen oder Marketing-Fallbacks umleiten. Für einen reinen Statuscode-Crawler wirken solche Antworten unauffällig, enthalten aber kein gültiges llms.txt-Signal.

llms-full.txt: seltener und ungleichmäßiger

Die Begleitdatei llms-full.txt war merklich seltener als llms.txt. Der Crawl fand 103 gültige Vollversionen, also 17,58 % der gültigen llms.txt-Anwender und 1,03 % der gesamten Top-10.000-Stichprobe.

Die Vollversion-Implementierungen waren uneinheitlich. Von den 103 Dual-File-Anwendern hatten 57 eine llms-full.txt, die größer war als die Indexdatei; 46 hatten dagegen eine Vollversion, die nicht größer als die Indexdatei oder kleiner als 100 Byte war. Das mediane Größenverhältnis Vollversion zu Index betrug 1,43, doch nach oben gab es deutliche Ausreißer. Die Vollversion von Supabase war etwa 7.139-mal so groß wie die Indexdatei. Made-in-China.com hatte eine 89,89-MB-Vollversion.

Domainllms.txtllms-full.txtVerhältnis
made-in-china.com4,49 MB89,89 MB20,0x
sendbird.com281,86 KB11,99 MB42,5x
taboola.com286,78 KB11,73 MB40,9x
supabase.co1,26 KB8,98 MB7.139,3x
neon.tech27,44 KB5,01 MB182,7x

Empfehlung: llms-full.txt nur veröffentlichen, wenn die Website bereits über eine stabile Dokumentations-Pipeline, Versionierung diszipliniert handhabt und einen klaren Grund hat, große Inhaltsmengen in einer einzigen maschinenlesbaren Datei bereitzustellen.

llms.txt, robots.txt und sitemap.xml

llms.txt ist kein neues robots.txt. Beide sind maschinenlesbare Dateien auf Root-Ebene, doch sie kommunizieren Unterschiedliches. robots.txt regelt Crawler-Präferenzen und Zugriff. sitemap.xml signalisiert die Auffindbarkeit von URLs. llms.txt ist ein erklärendes und navigationsorientiertes Signal.

SignalHauptrolleTypischer LeserInterpretation in dieser Studie
robots.txtCrawler-Präferenzen und Pfadbeschränkungen festlegen.Such-Crawler, KI-Crawler, Archiv-Crawler, generische Bots.Governance- und Zugriffssignal.
sitemap.xmlAuffindbare URLs für Indexierungssysteme auflisten.Suchmaschinen und Indexierungs-Pipelines.Discovery-Signal.
llms.txtKompakten Site-Kontext, wichtige Links, Dokus, APIs, Beispiele und Policy-Referenzen bereitstellen.LLM-Anwendungen, KI-Agenten, Entwicklertools, Retrieval-Systeme.Erklärungs- und Navigationssignal.

Empfehlungen

Für Websites, die llms.txt in Erwägung ziehen, zeichnen die stärksten Implementierungen dieses Datensatzes und die externen Traffic-Belege ein pragmatisches Muster:

  • Veröffentlichen Sie /llms.txt im Root und halten Sie sie ohne Login, JavaScript-Ausführung, Consent-Wände oder Weiterleitungen von anderen Pfaden zugänglich.
  • Liefern Sie sie möglichst als text/plain oder text/markdown aus.
  • Beginnen Sie mit einer kurzen Beschreibung der Website und gruppieren Sie Links anschließend nach Produkt, Dokumentation, API, Preisen, Changelog, Beispielen, Support, Richtlinien und Unternehmensressourcen.
  • Bevorzugen Sie kanonische Links statt erschöpfender URL-Listen.
  • Vermeiden Sie leere symbolische Dateien; sie sind bestenfalls ein schwaches Signal.
  • Vermeiden Sie massive, undifferenzierte Dumps, außer es gibt einen starken Anwendungsfall für maschinelle Verarbeitung und eine verlässliche Generierungspipeline.
  • Validieren Sie nach der Veröffentlichung finale URL, Response-Body, Content-Type, Markdown-Struktur, Linkanzahl und Dateigröße.

Auch bei den Erwartungen ist Sorgfalt geboten. Die vorliegenden öffentlichen Experimente belegen nicht, dass llms.txt den KI-Referral-Traffic eigenständig steigert. Wer die geschäftliche Wirkung testen möchte, sollte LLM-Referrals, zitierte Seiten, Bot-Requests, Index-Frische und Inhaltsänderungen gemeinsam im Blick behalten. Ein aussagekräftiges Experiment wäre der Vergleich gematchter Seitengruppen – möglichst mit konstant gehaltenen Content-Updates und einer Trennung plattformspezifischer Traffic-Quellen wie Perplexity, ChatGPT, Gemini, Claude und Bing/Copilot.

Einschränkungen

Dies ist ein Crawl-basiertes Snapshot, keine dauerhafte Wahrheit. Websites können llms.txt-Dateien jederzeit hinzufügen, entfernen oder ändern. Manche Domains blockieren automatisierte Anfragen oder verhalten sich je nach Geografie, TLS-Konfiguration, Weiterleitungslogik, User-Agent oder Bot-Mitigation unterschiedlich. Getestet wurden ausschließlich Root-Level-Dateien; weder Subdomains noch nicht standardisierte Pfade waren Teil der Suche.

Der Qualitäts-Score und die Archetypen sind Forschungswerkzeuge, keine offiziellen Compliance-Labels. Die Themenanalyse ist keyword-basiert und sollte als Richtungsindikator verstanden werden. Die Studie belegt nicht, dass irgendeine konkrete KI-Plattform llms.txt derzeit in der Produktion liest, respektiert oder verwendet.

Auch die hier ausgewerteten externen Traffic-Belege haben ihre Grenzen. Die Analyse von Search Engine Land ist eher eine vorsichtige Multisite-Beobachtung als ein randomisiertes Experiment. Alimbekovs Ergebnis ist als transparentes Fallbeispiel auf Site-Ebene hilfreich, hat aber keine Kontrollgruppe und fällt in einen Zeitraum, in dem der gesamte Referral-Traffic deutlich stieg. Diese Quellen helfen, die Debatte einzuordnen, machen aus diesem Crawl jedoch keine kausale Traffic-Studie.

Dateien und Reproduzierbarkeit

DateiZweck
crawl_llms_txt.pyCrawler für /llms.txt und /llms-full.txt.
analyze_llms_txt.pyPrimäre Adoptionsanalyse und Diagrammerstellung.
deep_analyze_llms_txt.pySekundäranalyse für Rangdezile, TLDs, Themen-Signale, Qualitäts-Score, Archetypen und Dual-File-Verhalten.
deep_dive_early_quality.pyKlassifizierung früher Anwender und Deep Dive zur Implementierungsqualität.
data/llms_probe_results_top_10000.csvHauptdatensatz der Crawl-Ergebnisse.
data/deep_analysis_top_10000.jsonZusammenfassung der Sekundäranalyse.
data/deep_early_quality_analysis.jsonKategorien früher Anwender, Vergleich der Qualitätskohorten, Archetyp-Details und Fallstudien.

Quellen

Korrekturen zur Methodik, Hinweise zu Datensatzproblemen und Folgeanalysen sind willkommen unter support@thunderbit.com. Dieser Bericht wird unabhängig von jeder kommerziellen Position veröffentlicht, die Thunderbit innehat. Die Daten in diesem Bericht stehen für sich. — Das Thunderbit-Forschungsteam, Mai 2026.

Thunderbit ausprobieren, um Webdaten zu extrahieren und zu analysieren Get Started Free

Shuai Guan
Shuai Guan
CEO bei Thunderbit | Experte für KI-gestützte Datenautomatisierung Shuai Guan ist CEO von Thunderbit und Absolvent der University of Michigan im Bereich Engineering. Mit fast zehn Jahren Erfahrung in Tech und SaaS-Architektur hat er sich darauf spezialisiert, komplexe KI-Modelle in praxisnahe No-Code-Tools zur Datenextraktion zu verwandeln. In diesem Blog teilt er ungefilterte, in der Praxis bewährte Einblicke in Web-Scraping- und Automatisierungsstrategien, damit Sie intelligentere, datengetriebene Workflows aufbauen können. Wenn er gerade keine Datenprozesse optimiert, widmet er dieselbe Liebe zum Detail seiner Leidenschaft für die Fotografie.

Extrahiere eine Webseite einfach per Frage

Sag einfach auf Englisch, was du brauchst. Oder noch besser: sag gar nichts.

Thunderbit ausprobieren kostenlos
Daten mit KI extrahieren
Daten einfach zu Google Sheets, Airtable oder Notion übertragen
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week