llms.txt’nin Yükselişi: Web Siteleri Yapay Zekâya Nasıl Sinyal Veriyor?

Son güncelleme: May 8, 2026
llms.txt’nin Yükselişi: Web Siteleri Yapay Zekâya Nasıl Sinyal Veriyor?
Veri çıkarma gücünü Thunderbit sağlar.

Yüksek trafikli web sitelerinin büyük dil modelleri için makine tarafından okunabilir yönlendirmeleri nasıl yayımladığını, ilk uygulamaların nasıl göründüğünü ve benimsemeyi ölçmenin neden yalnızca HTTP 200 yanıtlarını saymaktan daha fazlasını gerektirdiğini inceleyen tarama tabanlı bir çalışma.

  • Veri kümesi: data/llms_probe_results_top_10000.csv
  • İndirilen Tranco listesi: 6 Mayıs 2026
  • Kapsam: kök dizin düzeyinde /llms.txt ve /llms-full.txt

Temel Metrikler

llms-txt-adoption-landscape.webp

  • %5,86: Tranco İlk 10.000 genelinde geçerli llms.txt benimsemesi; bu da 586 alan adına denk geliyor.
  • %1,03: Geçerli llms-full.txt benimsemesi; bu da 103 alan adına denk geliyor. Geçerli tam dosya kullanan her sitenin ayrıca geçerli bir indeks dosyası da vardı.
  • %63,51: /llms.txt için alınan HTTP 200 yanıtlarının doğrulamayı geçemeyen kısmı.
  • 2,74x: Benimseme yalnızca ham HTTP 200 yanıtlarına göre ölçülseydi oluşacak yaklaşık fazla sayım.

Yönetici Özeti

llms.txt hâlâ webde erken aşamada bir konvansiyon, ama artık kenarda köşede kalmış bir deney değil. Bu çalışma, 6 Mayıs 2026 tarihinde Tranco İlk 10.000 alan adı üzerinde yapılan taramada 586 geçerli llms.txt dosyası buldu; bu da gözlenen benimseme oranının %5,86 olduğu anlamına geliyor. Eşlik eden llms-full.txt dosyası çok daha nadirdi: 103 alan adında geçerli tam dosya vardı; bu da %1,03 benimseme oranına karşılık geliyor.

En önemli metodolojik bulgu, durum kodlarının benimsemeyi ölçmek için zayıf bir gösterge olmasıdır. Tarayıcı /llms.txt için 1.606 HTTP 200 yanıtı gözlemledi, ancak bunların yalnızca 586’sı doğrulamayı geçti. Kalan 1.020 yanıtın çoğu yanlış yönlendirme, genel HTML sayfaları, boş gövdeler ya da başka geçersiz yanıtlardı. Her 200 yanıtını benimseme sayan naif bir tarayıcı, geçerli benimsemeyi yaklaşık 2,74 kat fazla tahmin ederdi.

Geçerli benimseyenler arasında uygulama kalitesi, yalnızca yer tutucu anlatısının düşündürdüğünden daha yüksek. Medyan geçerli dosya boyutu yaklaşık 7,1 KB idi; geçerli dosyaların %61,77’si 5 KB’den büyüktü; %70,82’sinde altı veya daha fazla Markdown bölümü vardı; %77,47’sinde 11 veya daha fazla Markdown bağlantısı bulunuyordu. Erken benimseyenler arasında Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog ve Cloudinary yer alıyor.

llms.txt, robots.txt’nin yerine geçen bir şey olarak değil, yapay zekâ sistemleri için açıklayıcı ve yönlendirici bir sinyal olarak en iyi şekilde anlaşılmalıdır. Değeri, yalnızca bir dosyanın var olması değil; dosyanın makinelerin yetkili, kısa ve güncel bilgilere ulaşmasına yardımcı olup olmamasıdır.

Bağlam: Web, Yapay Zekâya Yönelik Sinyaller Ekliyor

Web siteleri uzun süredir tarayıcı tercihlerini ifade etmek için robots.txt, URL keşfini iyileştirmek için sitemap.xml ve sayfaları arama ile platform sistemlerinin yorumlamasına yardımcı olmak için yapılandırılmış verileri kullanıyor. Üretken yapay zekâ farklı bir sorun getiriyor. İçerik; eğitim, geri getirme, özetleme, ajan tabanlı gezinme, kod desteği, müşteri desteği ve yanıt üretimi için kullanılabiliyor. Bu da iki eş zamanlı ihtiyacı ortaya çıkarıyor: Yayıncılar otomatik kullanımı daha fazla kontrol etmek istiyor, ancak aynı zamanda yapay zekâ sistemleri siteleriyle etkileşime girdiklerinde doğru kanonik bilgiyi bulabilmeli.

Jeremy Howard tarafından 2024’te tanıtılan orijinal llms.txt önerisi, dosyayı çıkarım zamanında LLM dostu bilgi sağlamak için web sitesinin kök dizinine yerleştirilen bir Markdown belgesi olarak çerçeveliyor. Öneri, HTML sayfalarının çoğu zaman gezinme öğeleri, reklamlar, betikler ve dil modellerinin işlemesini zorlaştıran başka gürültüler içerdiğini savunuyor. Kısa bir Markdown dosyası modelleri en önemli sayfalara, belgelere, API’lere, örneklere, politikalara ve ürün bilgilerine yönlendirebilir.

Dış web araştırmaları daha geniş arka planı sağlıyor. Data Provenance Initiative’in “Consent in Crisis” çalışması, robots.txt ve hizmet şartlarında yapay zekâ ile ilgili kısıtlamalarda hızlı bir artışı anlatıyor ve mevcut web rıza mekanizmalarının büyük ölçekli yapay zekâ veri yeniden kullanımı için tasarlanmadığını savunuyor. Cloudflare Radar AI Insights da yapay zekâ tarayıcı ve robots.txt kalıplarını İlk 10.000 alan adı düzeyinde görünür kıldı. Bu ortamda llms.txt, yapay zekâ sinyallemesinin yapıcı tarafında yer alıyor: “bunu tarama” değil, “bu siteyi anlaman gerekiyorsa buradan başla.”

Dış Kanıtlar ve Benimseme Tartışması

llms.txt etrafındaki kamu tartışması iki iddia arasında bölünüyor. İyimser iddia, dosyanın yapay zekâ sistemlerine yetkili içeriklere daha temiz ve daha verimli bir yol sunduğu yönünde. Şüpheci iddia ise büyük bir LLM sağlayıcısının bunu sıralama, tarama ya da atıf sinyali olarak kullandığını kamuya açık biçimde taahhüt etmediği, dolayısıyla yayıncıların yalnızca bu dosyadan trafik artışı beklememesi gerektiği yönünde. Bu güncelleme için incelenen üç dış kaynak, daha nüanslı bir sonuca işaret ediyor: llms.txt yararlı bir altyapıdır, ancak doğrudan trafik etkisine dair kanıtlar hâlâ sınırlı ve bağlama bağlıdır.

Dış Benimseme Ölçütleri Hızla Değişiyor

Rankability’nin benimseme izleyicisi, 22 Haziran 2025 itibarıyla ilk 1.000 web sitesi genelinde %0,3 benimseme oranı bildirdi; yani 1.000 siteden 3’ü. Bu araç, yönlendirmeleri ve HTML yanıtlarını dışlayan doğrulamayla birlikte domain.com/llms.txt için aylık otomatik tarama yaptığını belirtiyor. Bu metodoloji, bu çalışmanın temkinli doğrulama yaklaşımıyla yönsel olarak benzer.

Sonuçlardaki fark büyüktür: Bu çalışma, 6 Mayıs 2026 tarihinde Tranco İlk 1.000 içinde 75 geçerli llms.txt dosyası buldu; bu da %7,50’ye denk geliyor. Sıralama kaynağı, uygulama ayrıntıları, doğrulama mantığı ve tarama zamanı farklı olabileceği için bu iki sayı kesin bir zaman serisi olarak ele alınmamalıdır. Yine de karşıtlık, özellikle geliştirici, SaaS, bulut, güvenlik ve dokümantasyon ağırlıklı siteler arasında benimsemenin 2025 ortası ile Mayıs 2026 arasında anlamlı biçimde değiştiğini düşündürüyor.

KaynakAnlık görünümÖrneklemBildirilmiş geçerli benimsemeYorum
Rankability22 Haziran 2025İlk 1.000 web sitesi%0,32025 ortasında benimsemenin çok düşük olduğunu gösteren erken kamu ölçütü.
Bu çalışma6 Mayıs 2026Tranco İlk 1.000%7,50Yüksek trafikli sitelerde görünür benimseme olduğunu gösteren daha sonraki tarama.
Bu çalışma6 Mayıs 2026Tranco İlk 10.000%5,86Benimsemenin ölçülebilir olduğunu, ancak ana akım hâline gelmediğini gösteren daha geniş örneklem.

Trafik Deneyleri Hâlâ Karışık Sonuçlar Veriyor

Search Engine Land, Ocak 2026’da 10 siteyi izleyen bir analiz yayımladı; siteler uygulamadan önce ve sonra 90’ar gün takip edildi. Makale, iki sitede yapay zekâ trafiğinin %12,5 ve %25 arttığını, sekiz sitede ölçülebilir bir iyileşme olmadığını ve bir sitede %19,7 düşüş yaşandığını bildirdi. Temel yorumu nedensel temkinlilikti: Görünürde başarılı olan iki örnek aynı zamanda yeni şablonlar yayınlamış, kaynak merkezlerini yeniden inşa etmiş, çıkarılabilir karşılaştırma tabloları eklemiş, basın görünürlüğü kazanmış, teknik sorunları gidermiş veya yeni SSS tarzı içerik yayımlamıştı. Bu çerçevede llms.txt, daha güçlü içerik ve teknik çalışmaları belgeledi; büyümeye tek başına neden olmuş gibi görünmüyordu.

Renat Alimbekov’un kişisel blog deneyi, daha küçük ölçekli bir site gözleminden daha olumlu bir sonuca vardı. Hem llms.txt hem de llms-full.txt eklendikten sonra Yandex.Metrica’da iki dörder aylık dönem karşılaştırıldı. LLM yönlendirmeli oturumlar 75’ten 92’ye çıktı; bu %23 artış demekti ve kullanıcı sayısı 51’den 64’e yükseldi. Perplexity oturumları 29’dan 55’e çıkarken ChatGPT oturumları 31’den 26’ya düştü. Aynı gönderi, toplam yönlendirme trafiğinin de 160 oturumdan 290 oturuma daha hızlı arttığını, dolayısıyla LLM oturum payının %47’den %32’ye gerilediğini not ediyor.

Kanıt türüGözlenen sonuçTemel uyarıBu raporu nasıl etkiler
Search Engine Land’in 10 sitelik önce/sonra çalışmasıİki site yükseldi, sekizinde ölçülebilir değişim olmadı, biri düştü.Olumlu örneklerde eşzamanlı içerik, PR ve teknik değişiklikler vardı.llms.txt’yi bağımsız bir büyüme kaldıracı değil, altyapı olarak ele almayı destekler.
Alimbekov kişisel blog önce/sonra gözlemiLLM yönlendirmeli oturumlar sonrasında %23 arttı.Kontrol grubu yok; toplam yönlendirme trafiği %81 arttı ve LLM payı düştü.Özellikle Perplexity üzerinden teknik bloglar için olası bir faydaya işaret eder, ancak nedensellik ayrıştırılmış değildir.
Bu tarama tabanlı benimseme çalışması586 geçerli dosya ve birçok yapılandırılmış uygulama.Trafik etkisini değil, varlığı ve yapıyı ölçer.Benimseme ve uygulama olgunluğunu gösterir, ancak tek başına ROI’yi göstermez.

Tartışma Ne Açığa Çıkarıyor?

Dış kanıtlar, bu veri kümesinin yorumunu netleştiriyor. İyi yapılandırılmış bir llms.txt dosyası, özellikle geliştirici dokümantasyonu, API referansları ve bilgi tabanı içerikleri için makine ayrıştırma sürtünmesini azaltabilir. Ancak en güçlü trafik örnekleri yine de dosyanın dışında da yararlı, çıkarılabilir, yetkili ve keşfedilebilir olan içeriklere bağlı görünüyor. Bu nedenle pratik soru tek başına “llms.txt önemli mi?” değildir. Soru, dosyanın daha geniş bir yapay zekâya okunabilir içerik sisteminin parçası olup olmadığıdır.

Güncellenmiş yorum: llms.txt, düşük maliyetli yapay zekâya dönük altyapı olarak uygulanmalıdır. Daha iyi dokümantasyon, yapılandırılmış içerik, teknik erişilebilirlik, atıflar, bağlantılar veya marka otoritesinin yerine geçecek bir şey olarak konumlandırılmamalıdır.

Yapay zekâ web kazıma için Thunderbit’i deneyin

Yöntem

Bu çalışma, örneklem olarak Tranco İlk 10.000 alan adını kullandı. Tranco, birçok geleneksel üst site listesinden daha istikrarlı ve manipülasyona daha dayanıklı olacak şekilde tasarlanmış, araştırma odaklı bir üst site sıralamasıdır. Tranco kaynak dosyası 6 Mayıs 2026 tarihinde indirildi; kaynağın Last-Modified zaman damgası 5 Mayıs 2026, 22:17:59 GMT idi.

Tarayıcı her alan adı için kök düzeyinde iki yolu denedi:

  • Gerekirse HTTP yedeğiyle birlikte https://example.com/llms.txt.
  • Gerekirse HTTP yedeğiyle birlikte https://example.com/llms-full.txt.

Her denemede tarayıcı durum kodunu, nihai URL’yi, getirme yöntemini, yanıt baytlarını, içerik türünü, hata mesajını, geçen süreyi ve doğrulama sonucunu kaydetti. Başarılı yanıt gövdeleri inceleme ve ikincil analiz için raw_llms_txt/ altına kaydedildi.

Doğrulama Kuralları

Bir yanıt yalnızca başarılı bir gövde döndürdüğünde ve genel bir web yedek sayfası gibi görünmediğinde geçerli bir dosya olarak sayıldı. Nihai URL yolu /llms.txt ya da /llms-full.txt olarak kalmak zorundaydı. Boş gövdeler reddedildi. Açıkça HTML belgeleri ve uygulama kabukları reddedildi. İçerik türü tek başına kural olarak değil, destekleyici kanıt olarak ele alındı; çünkü az sayıda geçerli metin benzeri dosya alışılmadık içerik türleriyle sunulmuştu.

Benimseme Görünümü

Tarama, Tranco İlk 10.000 içinde 586 geçerli llms.txt dosyası buldu. Bu, %5,86’lık geçerli benimseme oranı veriyor. Daha küçük eşlikçi llms-full.txt dosyası 103 alanda geçerliydi; bu da örneklemin %1,03’üne karşılık geliyor.

MetrikSayıİlk 10.000 içindeki pay
Taranan alan adları10.000%100,00
Geçerli llms.txt dosyaları586%5,86
Geçerli llms-full.txt dosyaları103%1,03
/llms.txt için HTTP 200 yanıtları1.606%16,06
Geçersiz olduğu için reddedilen HTTP 200 yanıtları1.020%10,20

Benimseme Sadece En Üstte Yoğunlaşmış Değil

Benimseme, tam İlk 10.000’e kıyasla İlk 1.000’de daha yüksekti; ancak yalnızca en büyük sitelerle sınırlı değildi. İlk 1.000 benimseme oranı %7,50 idi. 9.001-10.000 aralığındaki son 1.000 alan adı diliminde ise oran %3,80’e düştü. Sıralamanın ortası aktif kalmaya devam etti: 2.001-3.000, 3.001-4.000, 5.001-6.000 ve 6.001-7.000 dilimlerinin tamamı yaklaşık %6 civarında seyretti.

tranco-domain-adoption-rate.webp

Erken Benimseyenler

En üst sıradaki geçerli benimseyen Cloudflare idi; Tranco sırası 4’tü. Diğer üst sıralardaki benimseyenler arasında Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink ve OneSignal yer alıyordu.

Bu benimseyenler rastgele değil. Genellikle büyük dokümantasyon alanlarına, açıklama gerektiren ürün hatlarına, API’lere veya geliştirici ekosistemlerine, destek içeriklerine, fiyatlandırma sayfalarına, güvenlik ve gizlilik materyallerine ve yapay zekâ sistemlerinin sitelerini nasıl yorumladığına dikkat edecek kadar marka otoritesine sahipler.

SıraAlan adıDosya boyutuGözlenen örüntü
4cloudflare.com4.225 BÜrün, geliştirici, şirket ve fiyatlandırma için kompakt bir dizin.
26azure.com47.037 BGeliştirici araçları, yapay zekâ, işlem, depolama, güvenlik, izleme ve isteğe bağlı kaynaklar.
28github.com27.108 BProgramatik erişim, Copilot, MCP, REST API, Actions, depolar ve CLI bağlantıları.
248stripe.com64.229 BÖdemeler, Connect, Checkout, Billing, Tax, Atlas, Radar ve geliştirici dokümanları.
265salesforce.com1,02 MBMarkdown bölüm başlığı olmadan devasa bir ürün ve Agentforce bağlantı kataloğu.

İlk 1.000’deki Benimseyen Kategorileri

Bu çalışma, Tranco İlk 1.000 içindeki 75 geçerli benimseyeni alan adı bağlamı, ilk başlıklar, ham dosya yapısı ve içerik anahtar kelimelerini kullanarak sınıflandırdı. En büyük grup %22,67 ile pazarlama, medya ve adtech oldu. Bulut, geliştirici ve altyapı siteleri %20,00 pay aldı. SaaS, üretkenlik ve müşteri operasyonu siteleri %17,33 pay aldı. Güvenlik, kimlik ve gizlilik siteleri %12,00 pay aldı.

top-1000-adopters-categories.webp

KategoriAlan adlarıİlk 1.000 benimseyen içindeki payMedyan kalite puanıMedyan bağlantı sayısı
Pazarlama, medya ve adtech17%22,679425
Bulut, geliştirme ve altyapı15%20,009462
SaaS, üretkenlik ve müşteri operasyonları13%17,339446
Güvenlik, kimlik ve gizlilik9%12,009878
CMS, barındırma ve web varlığı7%9,3310024

TLD Kalıpları

Üst düzey alan adları sektör etiketleri değildir, ama yön gösterici sinyaller olarak yararlıdır. Örneklemde en az 50 alan adı bulunan TLD’ler arasında .io, %14,44 ile en yüksek geçerli benimseme oranına sahipti. .com %8,19 ile onu izledi. .gov, .edu ve .net içindeki daha düşük benimseme, erken benimseyen tabanın kurumsal olmaktan çok ticari ve teknik olduğunu düşündürüyor.

Uygulama Kalitesi

Geçerli benimseme, tek tip uygulama kalitesi anlamına gelmez. Bazı dosyalar kısa, iyi bölümlenmiş indekslerdir. Bazıları çoğunlukla düz yazıdır. Bazıları ham bağlantı kataloglarıdır. Bazıları neredeyse boştur. Bazıları ise eksiksiz olabilir ama çekmesi ve ayrıştırması pahalı olan çok megabaytlık içerik dökümleridir.

Geçerli llms.txt dosyaları arasında 362’si 5 KB’den büyüktü; yani geçerli benimseyenlerin %61,77’si. Medyan dosya boyutu yaklaşık 7,1 KB idi. P90 dosya boyutu 156 KB, P95 356 KB, P99 2,54 MB ve gözlenen en büyük dosya 7,97 MB idi.

Yaygın İçerik Sinyalleri

Geçerli dosyaların anahtar kelime düzeyinde taraması, birçok sitenin yalnızca bir beyan yayımlamadığını; modelleri operasyonel açıdan yararlı materyallere yönlendirdiğini gösterdi. Destek veya yardım terimleri geçerli dosyaların %70,31’inde görüldü. Blog, rehber veya eğitim terimleri %67,92’sinde yer aldı. Güvenlik, gizlilik, uyumluluk veya şartlar terimleri %61,43’ünde bulundu. Fiyatlandırma %53,92, dokümantasyon %52,22, API terimleri %33,96 ve değişiklik günlüğü ya da sürüm sinyalleri %27,30 oranında görüldü.

Kalite Puanlaması ve Arketipler

Varlıktan olgunluğa geçmek için bu çalışma hafif bir uygulama puanı oluşturdu. Puan; içerik türü, dosya boyutu, Markdown yapısı, bağlantı sayısı, konu kapsamı ve başlık eksikliği, Markdown bağlantısı olmaması, alışılmadık içerik türleri, küçük dosyalar, çok büyük dosyalar ve bağlantı dökümü davranışı gibi uyarı işaretlerini dikkate alıyor. Bu resmi bir standart değildir. Gözlenen uygulamaları karşılaştırmak için kullanılan bir araştırma puanlama modelidir.

Bu modele göre 416 geçerli dosya güçlü yapılandırılmış indeks, 107’si kullanılabilir indeks, 24’ü ince veya düzensiz, 39’u ise sembolik ya da düşük faydalı olarak sınıflandırıldı. Ayrı bir arketip analizinde 296 yapılandırılmış indeks, 113 bölümlenmiş metin dosyası, 63 bağlantı kataloğu, 52 ince indeks, 50 sembolik ya da yer tutucu dosya ve 12 devasa içerik dökümü bulundu.

tranco-crawl-implementation-archetypes.webp

ArketipAlan adlarıGeçerli dosyalar içindeki payMedyan puanMedyan dosya boyutuMedyan bağlantı sayısı
Yapılandırılmış indeks296%50,519811.241 B61,5
Bölümlenmiş metin113%19,28784.718 B0
Bağlantı kataloğu63%10,75864.160 B23
İnce indeks52%8,87662.814 B0
Sembolik veya yer tutucu50%8,532715 B0
Devasa içerik dökümü12%2,05742,84 MB7.259,5

En Üst Benimseyenlerin Uygulamaları Daha Yoğun

tranco-crawl-ranks-stats.webp

Tranco İlk 1.000 içindeki 75 geçerli benimseyenin medyan kalite puanı 96, medyan dosya boyutu 9.068 bayt, medyan Markdown bağlantı sayısı 52 ve medyan bölüm sayısı 11 idi. Daha sonraki 1.001-10.000 aralığındaki 511 benimseyenin medyanları daha düşüktü: puan 90, dosya boyutu 6.506 bayt, 23 Markdown bağlantısı ve 9 bölüm. İlk 1.000 benimseyenlerin yapılandırılmış indeks olma olasılığı da daha yüksekti: sonraki kohortta %47,75’e karşılık %69,33.

Yanlış Pozitif Sorunu

llms-txt-http-200-outcomes.webp

En büyük ölçüm riski yanlış pozitiftir. /llms.txt için HTTP 200 döndüren 1.606 alan adının 1.020’si doğrulamayı geçemedi. En yaygın geçersiz neden, 618 vaka ile yanlış yönlendirmeydi. Bir başka 367 yanıt genel HTML belgeleriydi. Yirmi dokuzu boş gövde döndürdü ve altısı başka ya da sınıflandırılmamış geçersiz yanıttı.

Bu önemlidir; çünkü birçok büyük site bilinmeyen yolları giriş sayfalarına, ana sayfalara, uygulama kabuklarına, bölgesel sayfalara, onay yüzeylerine veya pazarlama yedeklerine yönlendirir. Bu yanıtlar, durum kodu odaklı bir tarayıcıya sağlıklı görünebilir, ancak geçerli bir llms.txt sinyali içermez.

llms-full.txt: Daha Nadir ve Daha Dengesiz

Eşlik eden llms-full.txt dosyası llms.txt’den çok daha nadirdi. Tarama 103 geçerli tam dosya buldu; bu, geçerli llms.txt benimseyenlerin %17,58’ine ve tüm İlk 10.000 örneklemin %1,03’üne denk geliyor.

Tam dosya uygulamaları dengesizdi. Çift dosya benimseyen 103 alan adının 57’sinde llms-full.txt, indeks dosyasından daha büyüktü; ancak 46’sında tam dosya ya indeks dosyası kadar büyük değildi ya da 100 bayttan küçüktü. Medyan tam dosya/indeks boyut oranı 1,43 idi; fakat uç durumlar çok daha yüksekti. Supabase’in tam dosyası, indeks dosyasının yaklaşık 7.139 katı büyüklüğündeydi. Made-in-China.com’un tam dosyası ise 89,89 MB idi.

Alan adıllms.txtllms-full.txtOran
made-in-china.com4,49 MB89,89 MB20,0x
sendbird.com281,86 KB11,99 MB42,5x
taboola.com286,78 KB11,73 MB40,9x
supabase.co1,26 KB8,98 MB7.139,3x
neon.tech27,44 KB5,01 MB182,7x

Öneri: llms-full.txt’yi yalnızca sitenin zaten kararlı bir dokümantasyon hattı, sürümleme disiplini ve tek bir makine tarafından okunabilir dosyada büyük hacimli içerik sunmak için net bir gerekçesi varsa yayımlayın.

llms.txt, robots.txt ve sitemap.xml

llms.txt, yeni bir robots.txt olarak görülmemelidir. İkisi de kök düzeyinde makine tarafından okunabilir dosyalardır, ancak farklı şeyler anlatırlar. robots.txt, bir tarayıcı tercihi ve erişim kontrolü sinyalidir. sitemap.xml, URL keşfi sinyalidir. llms.txt, açıklayıcı ve yönlendirici bir sinyaldir.

SinyalBirincil rolTipik okuyucuBu çalışmadaki yorum
robots.txtTarayıcı tercihlerini ve yol düzeyindeki kısıtlamaları belirtmek.Arama tarayıcıları, yapay zekâ tarayıcıları, arşiv tarayıcıları, genel botlar.Yönetişim ve erişim sinyali.
sitemap.xmlDizinleme sistemleri için keşfedilebilir URL’leri listelemek.Arama motorları ve dizinleme hatları.Keşif sinyali.
llms.txtKısa site bağlamı, önemli bağlantılar, dokümanlar, API’ler, örnekler ve politika referansları sağlamak.LLM uygulamaları, yapay zekâ ajanları, geliştirici araçları, geri getirme sistemleri.Açıklama ve gezinme sinyali.

Öneriler

llms.txt düşünen siteler için, bu veri kümesindeki ve dış trafik kanıtlarındaki en güçlü uygulamalar pragmatik bir örüntü öneriyor:

  • /llms.txt dosyasını kökte yayımlayın ve giriş yapmadan, JavaScript çalıştırmadan, onay duvarları veya yol dışı yönlendirmeler olmadan erişilebilir tutun.
  • Mümkünse text/plain veya text/markdown olarak sunun.
  • Siteye kısa bir açıklamayla başlayın, ardından bağlantıları ürün, dokümantasyon, API, fiyatlandırma, değişiklik günlüğü, örnekler, destek, politikalar ve şirket kaynakları şeklinde gruplandırın.
  • Kapsamlı URL listeleri yerine kanonik bağlantıları tercih edin.
  • Boş sembolik dosyalardan kaçının; en iyi ihtimalle zayıf bir sinyal sayılırlar.
  • Güçlü bir makine tüketim kullanım durumu ve güvenilir bir üretim hattı yoksa devasa, ayrıştırılmamış dökümlerden kaçının.
  • Yayımladıktan sonra nihai URL’yi, yanıt gövdesini, içerik türünü, Markdown yapısını, bağlantı sayısını ve dosya boyutunu doğrulayın.

Ekipler beklentileri de dikkatli biçimde belirlemelidir. Mevcut kamu deneyleri, llms.txt’nin yapay zekâ yönlendirme trafiğini bağımsız olarak artırdığını kanıtlamıyor. Bir ekip iş etkisini test etmek istiyorsa, LLM yönlendirmelerini, atıf alan sayfaları, bot isteklerini, indeks tazeliğini ve içerik değişikliklerini birlikte izlemesi gerekir. Yararlı bir deney, eşleştirilmiş sayfa gruplarını karşılaştırmalı, mümkün olduğunda içerik güncellemelerini sabit tutmalı ve Perplexity, ChatGPT, Gemini, Claude ve Bing/Copilot gibi platformlara özgü trafiği ayırmalıdır.

Sınırlamalar

Bu çalışma, kalıcı bir nihai gerçek değil, tarama tabanlı bir anlık görüntüdür. Web siteleri llms.txt dosyalarını istedikleri zaman ekleyebilir, kaldırabilir veya değiştirebilir. Bazı alan adları otomatik istekleri engelleyebilir ya da coğrafyaya, TLS yapılandırmasına, yönlendirme mantığına, kullanıcı aracısına veya bot engellemeye göre farklı davranabilir. Çalışma yalnızca kök düzeydeki dosyaları test etti; alt alan adlarını veya standart dışı yolları aramadı.

Kalite puanı ve arketipler resmi uyum etiketleri değil, araştırma araçlarıdır. Konu analizi anahtar kelime tabanlıdır ve yön gösterici olarak okunmalıdır. Çalışma, herhangi bir belirli yapay zekâ platformunun şu anda llms.txt’yi üretimde okuyup okumadığını, onurlandırıp onurlandırmadığını ya da kullanıp kullanmadığını kanıtlamaz.

Bu sürümde incelenen dış trafik kanıtlarının da sınırlamaları vardır. Search Engine Land’in analizi, rastgele bir deneyden çok uyarıcı bir çoklu site gözlemi olarak daha güçlüdür. Alimbekov’un sonucu, şeffaf bir site düzeyi vaka çalışması olarak yararlıdır; ancak kontrol grubu yoktur ve toplam yönlendirme trafiğinin belirgin biçimde arttığı bir dönemi içerir. Bu kaynaklar tartışmayı çerçevelemeye yardımcı olur, ancak bu taramayı nedensel bir trafik çalışmasına dönüştürmez.

Dosyalar ve Yeniden Üretilebilirlik

DosyaAmaç
crawl_llms_txt.py/llms.txt ve /llms-full.txt için tarayıcı.
analyze_llms_txt.pyBirincil benimseme analizi ve grafik oluşturma.
deep_analyze_llms_txt.pySıralama onlukları, TLD’ler, konu sinyalleri, kalite puanları, arketipler ve çift dosya davranışı için ikincil analiz.
deep_dive_early_quality.pyErken benimseyen sınıflandırması ve uygulama kalitesi derin incelemesi.
data/llms_probe_results_top_10000.csvAna tarama sonuçları veri kümesi.
data/deep_analysis_top_10000.jsonİkincil analiz özeti.
data/deep_early_quality_analysis.jsonErken benimseyen kategorileri, kalite kohortu karşılaştırması, arketip ayrıntıları ve vaka çalışmaları.

Kaynaklar

Yöntem düzeltmeleri, veri kümesi sorunları ve takip analizleri için support@thunderbit.com ile iletişime geçebilirsiniz. Bu rapor, Thunderbit’in sahip olduğu herhangi bir ticari pozisyondan bağımsız olarak yayımlanmıştır. Bu rapordaki veriler kendi başına anlam taşır. — Thunderbit araştırma ekibi, Mayıs 2026.

Web verilerini kazımak ve analiz etmek için Thunderbit’i deneyin Get Started Free

Shuai Guan
Shuai Guan
Thunderbit CEO’su | AI Veri Otomasyonu Uzmanı Shuai Guan, Thunderbit’in CEO’su ve University of Michigan Mühendislik mezunudur. Teknoloji ve SaaS mimarisi alanındaki yaklaşık on yıllık deneyiminden güç alarak, karmaşık yapay zeka modellerini pratik, kod yazmadan kullanılabilen veri çıkarma araçlarına dönüştürme konusunda uzmanlaşmıştır. Bu blogda, daha akıllı ve veriye dayalı iş akışları kurmanıza yardımcı olmak için web kazıma ve otomasyon stratejileri üzerine filtresiz, sahada sınanmış içgörüler paylaşıyor. Veri iş akışlarını optimize etmediği zamanlarda ise aynı detay odaklı yaklaşımını fotoğrafçılık tutkusuna da yansıtıyor.

Thunderbit'i dene

Potansiyel müşterileri ve diğer verileri sadece 2 tıkla topla. Yapay zekâ destekli.

Thunderbit'i al Ücretsiz
Yapay Zekâ ile Veri Çıkar
Verileri kolayca Google Sheets, Airtable veya Notion'a aktar
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week