Önde Gelen Web Siteleri AI Tarayıcılar İçin Çizgiyi Nasıl Çekiyor

Son güncelleme: May 8, 2026
Önde Gelen Web Siteleri AI Tarayıcılar İçin Çizgiyi Nasıl Çekiyor

Yönetici özeti

Dünyanın en yüksek trafik alan web sitelerinin Tranco ilk 10.000 listesindeki her alan adının robots.txt dosyasını topladık. Ardından bunların her birini RFC 9309 uyumlu bir ayrıştırıcıyla işledik, dosyayı sitenin benimsediği herhangi bir yapay zekâ bot politikası olup olmamasına göre sınıflandırdık ve 2026’da büyük dil modellerini eğiten ve hizmet veren ChatGPT, Claude, Perplexity, Gemini, Common Crawl, Bytespider, Apple Intelligence ve diğer tarayıcıları engellemeye çalışan dünyanın en çok ziyaret edilen sitelerinin sayısını çıkardık.

Temiz biçimde okuyabildiğimiz robots.txt dosyalarına sahip 7.248 site örnekleminde öne çıkan rakamlar:

ai-crawler-block-statistics.webp

Dünyanın ilk 10.000 sitesinin %20,3’ü en az bir yapay zekâ tarayıcısını engelliyor. %17,0’si bilinçli şekilde, doğrudan yapay zekâya özel bir kural yazmış durumda. Kalan %80 ise yapay zekâ tarayıcılarını Googlebot kadar serbest bırakıyor.

Hikâyenin şeklini değiştiren altı bulgu:

  • Haber kuruluşlarında engelleme oranı %47 — tüm sektörler arasında en yüksek oran. Alman haber sitelerinde oran %88, Fransızlarda %80, Ruslarda %0. Temel belirleyici teknoloji ya da sektör ekonomisi değil, hukuki rejim.
  • CCBot (Common Crawl) en çok engellenen bot; oran %16,3GPTBot’un (%15,8) ve Bytespider’ın (%14,9) önünde. Yayıncılar modeli değil, eğitim korpusunu hedef alıyor. En yaygın seçici kural şudur: "CCBot’u engelle, Googlebot’a izin ver" (%14,1).
  • Fransa, .fr sitelerde yapay zekâ engellemesinde %50,6 ile başı çekiyor; AB kümesi küresel tabanın 16 puan üzerinde. 275 robots.txt dosyası AB Direktifi 2019/790’a açıkça atıf yapıyor. Sayıları görünür biçimde oynatan tek hukuki rejim Madde 4.
  • %17,8 kendi yapay zekâ kurallarını yazmış; %4,5’i Cloudflare’ın satıcı şablonunu kullanıyor; %75,7’si ise sessiz. Büyük siteler kuralı kendi yazıyor; uzun kuyruk anahtarı kullanıyor. The Atlantic ve cloudflare.com’un kendisi Cloudflare Managed listesinde.
  • 108 site GPTBot’a açıkça izin veriyor — WordPress.org, Kaspersky, Norton, Avast, Sophos, The Verge, The Atlantic, NBA.com, The Sun, Branch.io. Güvenlik ve geliştirici araçları beklenenden daha baskın.
  • Yapay zekâ politikası, eğrinin tepesinde daha agresif hale gelmiyor. İlk 100, 101–1000, 1001–5000, 5001–10000 aralıklarının hepsi %19 ile %23 arasında. Başlıktaki oran, tek tek sitelerin büyüklüğünü değil, 2026’daki kamusal web’in özelliğini yansıtıyor.

Artık mesele web’in "karşı koyup koymadığı" değil. Mesele; hangi sektörlerin, hangi ülkelerin, hangi hukuki rejimlerin ve hangi yapay zekâ sağlayıcılarının aktif politikanın hedefi olduğu — ve hangilerinin olmadığı.


I. Arka plan: robots.txt nasıl bir yapay zekâ politikası aracına dönüştü

OpenAI, Ağustos 2023’te GPTBot’u yayınladığından beri üç güç robots.txt’nin anlamını değiştirdi.

Yapay zekâ sağlayıcılarının sayısı arttı. Google’ın Google-Extended’ı, Anthropic’in ClaudeBot’u, ByteDance’in Bytespider’ı, Apple’ın Applebot-Extended’ı, Amazon’un Amazonbot’u ve Meta’nın Meta-ExternalAgent’ı bunu izledi. Common Crawl’un mevcut CCBot’u, arşivi açık ağırlıklı modellerin çoğuna veri sağladığı için en yüksek kaldıraçlı engel hedefi haline geldi. Sağlayıcı dışı botlar da ortaya çıktı: AI2Bot, cohere-ai, PerplexityBot, YouBot, DuckAssistBot, Diffbot, Omgili. Kapsamlı bir 2026 engel listesi yaklaşık 25 isme ulaşıyor.

AB Telif Direktifi 2019/790’ın 4. maddesi, hak sahibinin haklarını "makine tarafından okunabilir" bir biçimde "açıkça saklı tuttuğu" durumda uygulanmayan, yasal bir metin ve veri madenciliği istisnası yarattı. 2024–2025 boyunca AB yayıncıları ve avukatları bu saklama beyanını ifade etmenin standart yolu olarak robots.txt üzerinde uzlaştı. Veri kümemiz 275 sitenin Direktif 2019/790’a açıkça atıf yaptığını ve 87 sitenin "TDM" ifadesini kullandığını gösteriyor — Avrupa haber sitelerinde bu, 4–8 satırlık bir hukuk önsözü olarak karşımıza çıkıyor.

Cloudflare, anahtarı ürünleştirdi. 2024–2025’te Cloudflare bir "AI Audit" panosu, bir "Block AI Bots" anahtarı ve Content-Signal: search=yes,ai-train=no söz dizimi ile AB 2019/790 şablonunu içeren yönetilen bir robots.txt şablonu sundu. 2026 Mayıs itibarıyla bu şablon, ayrıştırılabilir ilk 10k içinde %4,5 kullanım oranına ulaştı. Cloudflare’ın yol haritası, yeni hesaplarda anahtarın varsayılan açık gelmesini kamuya açık biçimde tartışıyor — bu da herhangi bir yayıncının tek tek karar vermesine gerek kalmadan küresel engelleme oranını 5–8 puan yukarı taşıyabilir.

2026’daki robots.txt, artık 2022’deki sıkıcı yapılandırma dosyası değil. AB’de anlaşma temelli bir telif saklama mekanizması, uzun kuyrukta satıcı biçimli bir politika nesnesi ve web sitelerini işletenlerle modelleri eğitenler arasındaki yavaş ilerleyen müzakerenin ön cephesi.


II. Yöntem

Bunu mümkün olduğunca sıkıcı ve yeniden üretilebilir tutmaya çalıştık. Tüm işlem hattı (Python betikleri, ayrıştırılmış CSV’ler, ham robots.txt arşivi, grafikler) bu raporla birlikte yayımlandı.

Örneklem

Mayıs 2026 tarihli Tranco listesi ile başladık; top-1m.csv.zip olarak indirildi ve ilk 10.000 satır alındı. Tranco, dört yukarı akış sıralamasını (Cisco Umbrella, Majestic, Farsight ve Cloudflare Radar) birleştirir, 30 günlük pencerede istikrarı filtreler ve bariz tarayıcı/CDN gürültüsünü ayıklar. Ortaya çıkan liste, açık dünyada var olan en yakın "küresel web trafiği ilk 10k" tanımıdır ve akademik web araştırmalarında standart örneklemdir (2018’de KU Leuven tarafından başlatıldığından beri 600+ hakemli makalede kullanıldı).

Liste; (a) kullanıcıların ziyaret ettiği ana web sitelerini, (b) / kökü olmayan altyapı / API / DNS / CDN alanlarını ve (c) büyük platformların iç kullanım alanlarını (ör. gvt1.com, apple-dns.net, googleusercontent.com) içerir. Bunları önceden filtrelemek yerine hepsini koruduk ve analiz katmanında infrastructure kategorisiyle etiketledik. "Ayrıştırılabilir bir robots.txt döndüren siteler"e odaklandığımızda bunlar doğal olarak dışarı düşüyor.

Getirme

10.000 alan adının her biri için HTTPS üzerinden eşzamansız bir GET /robots.txt isteği yaptık; başarısız olursa HTTP’ye düşecek şekilde yapılandırdık, yönlendirmeleri dört adıma kadar izledik, toplam süreyi 12 saniye ile sınırlandırdık, gövdeyi 500 KB ile kısıtladık ve Accept-Language: en-US içeren gerçek tarayıcıya benzer bir User-Agent kullandık. Eşzamanlı istek sayısı 80’de tutuldu. İş San Francisco’daki tek bir konut IP’sinden çalıştırıldı.

Getirme sonucu:

DurumSayıYorum
200 OK6.638robots.txt gövdesi döndü ve ayrıştırılabilir durumda.
404 Not Found610robots.txt yok. RFC 9309 bunu örtük olarak "her şeye izin ver" şeklinde tanımlar.
403 Forbidden563Köken sunucu robots.txt isteklerini aktif biçimde reddediyor. Analizden çıkarıldı.
429 Too Many Requests7Bu sıralama diliminde neredeyse hiç CDN seviyesinde kısıtlama yok.
fetch_failed (TLS / DNS / TCP hatası)2.065Çoğunlukla akamai.net, cloudfront.net, fastly.net, gtld-servers.net, apple-dns.net gibi kök CDN alanları; / altında web sunucusu çalıştırmıyorlar. "Engellenmiş" değiller — sunacak bir robots.txt dosyaları yok.
Diğer 4xx/5xx117Karışık — sunucu hataları, coğrafi kısıtlama, bozuk yanıtlar.

Bu bize analiz edilebilir örneklemde 7.248 site veriyor (6.638 200 + 610 404). 2.065 fetch_failed gerçek alan adlarıdır, ancak bunlar CDN/DNS kök noktalarıdır, insanların ziyaret ettiği siteler değil; bunları "yapay zekâ politikası" varmış gibi değerlendirmek anlamsızdır. Bunlar veri kümesinde ayrı bir erişilebilirlik metriği olarak yer alıyor.

Ayrıştırma

Her 200 gövdesi, Scrapy tarafından üretimde kullanılan RFC 9309 uygulaması olan protego ile ayrıştırıldı. Her (site, bot) çifti için üç şey hesapladık:

  1. can_fetch_root — standarttaki grup kayıtları semantiği, en uzun eşleşme önceliği ve hem genel hem de özel bot engeli varsa User-agent: * kuralının özel kural tarafından geçersiz kılınması dâhil olmak üzere botun / kökünü getirip getiremeyeceği.
  2. has_specific_rule — dosyada bu botu açıkça adlandıran bir User-agent: satırı olup olmadığı (büyük/küçük harf duyarsız).
  3. disallow_count — eşleşen bloktaki Disallow: yönergelerinin sayısı; tam site yasağı ile yol düzeyi kısıtlamaları arasında ayrım yapmak için kullanıldı.

Bu ayrım önemlidir; çünkü üst başlıktaki bir "engelleme oranı" iki tamamen farklı durumu gizler: User-agent: GPTBot \n Disallow: / yazarak bilinçli biçimde karşılık veren markalar ve yıllar önce hazırlanan genel User-agent: * \n Disallow: / engeli (örneğin hazırlık ya da bakım için konmuş) sebebiyle, o şablonda yer almayan tüm yapay zekâ botlarını da istemeden engelleyen markalar. Bu rapor boyunca "herhangi bir yapay zekâ engeli" sayısı her iki türü de içerir; "açık yapay zekâ engeli" sayısı ise bilinçli alt kümedir.

Kapsamdaki botlar

25 botu üç kategoriye ayırdık:

  • Yapay zekâ eğitim tarayıcıları (16): GPTBot, ClaudeBot, anthropic-ai, CCBot, Google-Extended, Meta-ExternalAgent, Bytespider, Applebot-Extended, Diffbot, Amazonbot, ImagesiftBot, FacebookBot, cohere-ai, AI2Bot, Omgili, Omgilibot.
  • Yapay zekâ çıkarım / canlı getirme botları (7): PerplexityBot, Perplexity-User, ChatGPT-User, OAI-SearchBot, ClaudeBot (eğitim ve çıkarım için de kullanılıyor), YouBot, DuckAssistBot.
  • Arama temel kümesi (6): Googlebot, Bingbot, DuckDuckBot, Slurp (Yahoo), Baiduspider, YandexBot.

Bazı botlar eğitim/çıkarım çizgisini aşar. En belirgini ClaudeBot’tur — Anthropic, 2024’te eski anthropic-ai kullanıcı aracısını kullanımdan kaldırdı ve şimdi hem eğitim hem de canlı getirme için ClaudeBot kullanıyor; dolayısıyla bir Disallow: ClaudeBot kuralı artık temiz biçimde "eğitimi engelle ama görünürlüğü koru" anlamına gelmiyor. Atamayı olduğu gibi bıraktık ve sonucu ileride ayrıca işaretledik.

Sektör sınıflandırması

Her alan adını 16 sektör kovasından birine (news, social, streaming, ecommerce, search, finance, infrastructure, saas, academia, dev, gov, adult, gambling, travel, telecom, unknown) çok katmanlı bir yaklaşımla sınıflandırdık:

  1. Bilinen alan adı sözlüğü — yaklaşık 500 yüksek trafikli alan adının sektörlere elle derlenmiş eşlemesi.
  2. TLD / sonek kalıpları.govgov, .edu ve .ac.*academia, tanınan CDN sonekleri → infrastructure.
  3. Alan adı anahtar sözcüklerinews, post, shop, bank, porn, casino vb. yedek sinyaller.
  4. Ana sayfa taraması — ilk üç katmanla sınıflandırılamayan ve robots.txt için 200 dönen sitelerde ana sayfa HTML’ini çekip <title>, <meta name="description">, <meta property="og:type"> alanlarını çıkardık ve dil modeli tarzı kategori ipuçlarına göre anahtar sözcük puanlaması yaptık.

Bunun sonucunda 3.407 site (%34) için güvenilir sektör etiketi elde ettik; 6.593 site unknown kaldı. unknown kovası çoğunlukla İngilizce olmayan bölgesel portallardan, tek bir kovaya sığmayan kurumsal .com marka sitelerinden ve sözlük girdisi olmayan küçük dil pazarlarındaki geleneksel yayıncılardan oluşuyor. Bu raporda sektör bazlı bir yüzde verildiğinde payda, 10.000 sitenin tamamı değil, ilgili sektör için sınıflandırılmış örneklemdir.


III. Bulgular

Bulgular 1 — İlk trafik alan her beş siteden biri en az bir yapay zekâ botunu engelliyor

7.248 analiz edilebilir site arasında 1.472’si (%20,31) en az bir yapay zekâ botunu engelliyor. 1.230’u (%16,97) bilinçli, yapay zekâya özel bir kural yazmış durumda. Googlebot tabanı %2,18 (158 site — çoğu bakım varsayılanı olarak her şeyi engelliyor ya da üç durumda rakiplerini engelleyen arama motorları).

Başlıktaki %20 oranı, Googlebot tabanının 9 katı. Bu gerçek bir sinyal: en yüksek trafik alan siteler bir yapay zekâ tarayıcısını, bir arama tarayıcısına kıyasla kat kat daha fazla engelliyor. Ama bu, 2024’ten beri basında dolaşan "yapay zekâ engellemesi evrensel kabul görüyor" anlatısından belirgin biçimde daha küçük bir sayı. Web’in en çok ziyaret edilen 10.000 sitesinde bile 6’da 5 çoğunluk yapay zekâ konusunda sessiz.

"Herhangi bir yapay zekâ engeli" (%20,3) ile "açık yapay zekâ engeli" (%17,0) arasındaki fark mutlak olarak küçük ama kavramsal olarak önemli. 3,3 puanlık boşluk, mevcut User-agent: * \n Disallow: / kuralı nedeniyle yapay zekâ botlarını yalnızca dolaylı biçimde engelleyen sitelerin payıdır; bu kural, yazıldığı sırada ortada olmayan botları da kapsar. %17,0’lik bilinçli sayı, "dünyanın en büyük web sitelerinden kaçı yapay zekâya özel bir karar verdi?" sorusunun daha temiz cevabıdır.

Önceki literatürle karşılaştırma:

KaynakTarihÖrneklemEngelleme oranı
Originality.aiMar 2025En popüler 1.000 haber sitesi (İngilizce)GPTBot’u %35,7 engelliyor
PalewireAğu 20241.500 haber kuruluşuHerhangi bir yapay zekâ tarayıcısını %36,0 engelliyor
Reuters Instituteİlkbahar 202550 önde gelen haber markası, 10 ülkeHerhangi bir yapay zekâ tarayıcısını %78 engelliyor
WIRED / NYT2023 sonuİlk 50 ABD haber sitesiGPTBot’u %26 engelliyor
Bu rapor (Thunderbit)Mayıs 2026Tranco ilk 10.000 (tüm sektörler)%20,3 / %17,0 açık

Bizim %17,0 açık oranımız, yalnızca haber sitelerini inceleyen tüm çalışmalardan daha düşük; bunun nedeni örneklemimizin üçte ikisinin haber olmaması. 650 haber sitesiyle sınırladığımızda %47’ye ulaşıyoruz — örneklem bileşimini hesaba kattığınızda önceki çalışmalarla aynı bantta. Yapısal tablo tutarlı: haber grubu, web’in geri kalanına göre yapay zekâyı 3–4 kat daha yüksek oranda engelliyor.


Bulgular 2 — Sektör derin dalışları: haberden telekoma 12 katlık fark

İki yıldır süren "yapay zekâ kazıma" haberlerinde en çok alıntılanan bulgu, Originality.ai ve Palewire’dan gelen haber kuruluşlarının %80’i GPTBot’u engelliyor sayısı oldu. Bizim kesitimiz daha küçük ama yine de ayırt edici bir tablo veriyor: ilk 10.000’deki haber sitelerinin %47,2’si en az bir yapay zekâ botunu engelliyor; %45,2’si açık bir yapay zekâ kuralı yazmış durumda.

Fakat "haber vs. geri kalan her şey" çok kaba bir ayrım. Tam döküm (örneklemde n ≥ 10 olan sektörler) çok daha zengin bir hikâye anlatıyor:

robots-industry-spread_compressed.webp

SektörnHerhangi bir yapay zekâ engeliAçıkGooglebot engelliKendi yazdığı kurallarCloudflare ManagedSessiz
Haber650%47,2%45,2%1,5%46,9%1,5%48,5
Seyahat64%29,7%29,7%0,0%35,9%3,1%54,7
Sosyal65%29,2%23,1%4,6%23,1%6,2%66,2
Streaming440%20,0%17,7%0,7%16,8%3,6%75,5
Finans129%19,4%12,4%0,8%14,7%2,3%75,2
E-ticaret224%18,3%17,4%0,4%24,1%1,3%66,1
Yetişkin254%17,3%14,6%0,4%10,2%7,9%79,5
Arama12%16,7%0,0%0,0%0,0%0,0%100,0
Akademi268%14,6%13,8%0,4%13,4%3,4%77,2
Kumar100%14,0%13,0%0,0%18,0%4,0%77,0
Geliştirici araçları129%10,1%7,8%0,0%8,5%5,4%77,5
SaaS369%7,6%6,2%0,3%9,5%0,8%87,5
Kamu172%5,2%3,5%0,0%4,1%0,6%83,1
Altyapı47%4,3%0,0%0,0%4,3%2,1%72,3
Telekom33%3,0%3,0%0,0%12,1%0,0%78,8

Haber ile telekom arasındaki 12 katlık fark, "web’in yapay zekâ politikası" ifadesini yanlış bir ölçü haline getiriyor. Tek bir sayı yok; büyüklük mertebesinde farklılaşan sektörel sayılar var. Aşağıda en belirgin dört bulguyu ele alıyoruz.

Haber: %47 engelleme, %47 kendi yazdığı kural. Haber, oyunun kurallarını yazan küme. Cloudflare Managed haberlerde sadece %1,5 — bu yayıncılar kuralı dışarıya vermez. Metinler olağanüstü zengin: NYT "AB Direktifi’nin 4. maddesi"ne atıf yapan 14 satırlık bir hukuki önsözle başlıyor; BBC "Sitemizi robot gibi değil, insan gibi kullanın... Kısacası: gezin, okuyun, izleyin, keyfini çıkarın — insan gibi." diyor; The Sun ise "The Sun, içeriklerimizin büyük dil modelleri için lisanssız kullanımına izin vermez." ifadesini kullanıyor. Bu, yapılandırmadan çok bir politika beyanı olarak robots.txt.

Seyahat %30 — sürpriz. Booking, Expedia, TripAdvisor, Kayak ve büyük havayolları haber oranının yaklaşık üçte ikisi kadar engelliyor. Seçici desen tutarlı: ortalama bir seyahat engelleyicisi 5–7 eğitim UAs’ını reddederken çıkarım UAs’larını (PerplexityBot, ChatGPT-User, OAI-SearchBot) dokunulmadan bırakıyor. Toplu fiyat ve yorum verisi hendek; siteye geri yapılan atıflar ise avantaj. Bu, herhangi bir sektörde gördüğümüz en temiz "eğitimi dışarıda bırak, çıkarımı içeri al" deseni.

Yetişkin %17 — yine sürpriz. Daha önceki küçük örneklemeler %0 gösteriyordu. Tam örneklem verisi, yetişkin sitelerinin altıda birinin en az bir yapay zekâ botunu reddettiğini ve sektörler arasındaki en yüksek Cloudflare Managed oranına (%7,9) sahip olduğunu gösteriyor. Yapay zekâ engellerinin yarısından fazlası yayıncı kararından değil, Cloudflare anahtarından geliyor. Görsel üretim eğitimi zımni tehdit; Stable Diffusion sınıfı modeller görsel stili, metin modellerinin yazı stilini öğrenmesinden daha hızlı öğreniyor.

SaaS’taki %7,6 sezgilere aykırı. Yazılım sağlayıcıları yapay zekâ politikası tartışmalarında en sesli kesim ama robots.txt’leri son derece açık. Doğru okuma şu: SaaS pazarlama ekipleri yapay zekâ aramasını bir dağıtım kanalı olarak doğru biçimde tanımladı. Gerçekte bu konuda düşünen sağlayıcılar dışarıda kalmayı değil, içeri girmeyi seçiyor — açıkça GPTBot’a izin veren liste (Bulgular 11) güvenlik ve geliştirici araçları SaaS’larıyla dolu.

Kamu %5,2, telekom %3,0, altyapı %4,3, geliştirici araçları %10,1. Kamu kayıt yükümlülükleri .gov alanlarında Disallow: / kuralını hukuken hassas hale getiriyor. Telekom pazarlama siteleri keşfedilebilir olmak istiyor. CDN kök alanlarının korunacak hiçbir şeyi yok. Geliştirici araçları ise açıkça içeri giriyor; çünkü LLM’ler onlara atıf yaptığında içeriklerinin değeri artıyor.

Çıkarım şu: "web yapay zekâyı engelliyor mu, engellemiyor mu" diye tek bir sayı yok; varsa bile anlattığından daha fazlasını kaybettirir. Veriyi dürüstçe tartışmanın tek yolu sektör seviyesinde raporlamadır.


Bulgular 3 — Yapay zekâ sağlayıcısına göre: kim en çok engelleniyor?

Verinin bir diğer doğal kesimi bot yerine yapay zekâ şirketine göre yapılabilir. Bazı sağlayıcılar birden fazla bot işletir (OpenAI üç tane: GPTBot, ChatGPT-User, OAI-SearchBot; Anthropic iki tane: ClaudeBot, anthropic-ai; Meta iki tane: Meta-ExternalAgent, FacebookBot). Sağlayıcı düzeyinde toplulaştırmak, "kamusal web her bir yapay zekâ şirketi hakkında ne düşünüyor?" sorusuna en yakın cevaptır.

Yapay zekâ sağlayıcısıToplanan botlar≥ 1 botu engelleyen sitelerAnaliz edilebilirlerin %’si
Common CrawlCCBot1.178%16,25
OpenAIGPTBot, ChatGPT-User, OAI-SearchBot1.172%16,17
AnthropicClaudeBot, anthropic-ai1.111%15,33
ByteDanceBytespider1.082%14,93
MetaMeta-ExternalAgent, FacebookBot989%13,65
GoogleGoogle-Extended970%13,38
AmazonAmazonbot877%12,10
AppleApplebot-Extended859%11,85
Webz.io (Omgili)Omgili, Omgilibot731%10,09
Coherecohere-ai717%9,89
PerplexityPerplexityBot, Perplexity-User715%9,86
DiffbotDiffbot684%9,44
You.comYouBot563%7,77
AI2 (Allen AI)AI2Bot487%6,72
DuckDuckGoDuckAssistBot482%6,65

Common Crawl, tek başına en çok hedef alınan varlık — üstelik bir LLM işletmecisi değil, kâr amacı gütmeyen bir web arşivi. Sebep kaldıraç: CCBot, açık ağırlıklı modellerin neredeyse hepsine ve kapalı olanların da önemli bir kısmına veri sağlıyor. Önce CCBot’u engellemek, bir yayıncının yazabileceği en yüksek kapsama sahip kuraldır.

OpenAI, Anthropic, ByteDance %14–16 bandında. OpenAI’nin liderliği kısmen bir sayım etkisi (ByteDance’in bir botuna karşı OpenAI’ın üç botu var). Bytespider’ın %14,9’u, “Bytespider davranışı” etkisidir — 2024’ten beri robots.txt’yi yok saydığı belgelenmiştir ve yayıncılar onu TikTok’tan korktukları için değil, kamuya açık bir sinyal olarak engelliyor.

Meta, Google, Amazon, Apple %12–14 bandında — bunlar daha çok koruyucu biçimde yazılmış, bir pozisyon beyanı olmaktan çok savunma amaçlı kurallar. Küçük sağlayıcılar (Webz.io, Cohere, Perplexity, Diffbot, You.com, AI2, DuckDuckGo) %6–10 bandında; çoğu 3,8’lik genel taban nedeniyle yukarı çekiliyor, onlar için yazılmış açık kurallar ise %1–4 arasında.

xAI (Grok), Mistral ve Avrupa/Çin kökenli model laboratuvarlarının çoğu tabloda yok — belgelenmiş eğitim tarayıcısı kullanıcı aracısı yayımlamadılar. Mevcut robots.txt ekosistemi, kullanıcı aracısı yayınlayan ABD/Çin sağlayıcıları ile kural yazan ABD/AB yayıncıları arasındaki bir diyalog; UA yayınlamayan sağlayıcılar müzakerenin dışında kalıyor.


Bulgular 4 — Yeni yıldırım çubuğu GPTBot değil, CCBot

İlk 10k’de bot sıralaması şöyle:

most-blocked-ai-crawlers-vendors.webp

SıraBotEngelleme oranıAçık kural oranı
1CCBot (Common Crawl)%16,25%12,90
2GPTBot (OpenAI)%15,84%12,72
3Bytespider (ByteDance)%14,93%11,35
4ClaudeBot (Anthropic)%14,51%11,13
5Google-Extended%13,38%10,18
6Meta-ExternalAgent%12,38%8,95
7Amazonbot%12,10%8,66
8Applebot-Extended%11,85%8,72
9Omgilibot%10,09%5,31
10anthropic-ai (kullanımdan kaldırıldı)%9,99%6,55
11cohere-ai%9,89%6,42
12PerplexityBot%9,69%6,40
13Diffbot%9,44%5,95
14ChatGPT-User (çıkarım)%8,90%5,73
15YouBot (çıkarım)%7,77%4,29
16OAI-SearchBot (çıkarım)%6,83%3,66
tabanGooglebot%2,18
tabanBingbot%2,27

Bu tablonun anlattığı şey şu: kamusal web’in önce engellediği bot model markası değil, korpustur. Common Crawl’un 250 milyar sayfalık arşivi, GPT-3, GPT-4, Llama 1 / 2 / 3, Falcon, Mistral, BLOOM ve 2020’den bu yana yayımlanan açık ağırlıklı modellerin çoğu için tek en büyük eğitim girdisi oldu. “Bir sonraki sınır modeline dahil olmamak” isteyen bir site için en verimli yol, önce CCBot’u engellemektir — Common Crawl’da değilseniz, açık kaynak eğitim hattından fiilen ücretsiz olarak dışlanmış olursunuz. GPTBot ve ClaudeBot ikinci ve üçüncü sırada gelir; çünkü bunlar iki belirli ticari ürünün görünür ön yüzüdür. Yapısal hedef ise korpus düzeyindeki kullanıcı aracısıdır.

Tablodaki düşük sıralı yapay zekâ botları da öğreticidir. Omgilibot’un %10’da olması, pek çok okuyucunun hiç duymamış olacağı bir bot için alışılmadık derecede yüksektir — Webz.io tarafından işletilir, LLM sağlayıcılarına web arşivleri satan bir içerik-veri aracısıdır ve haber kuruluşlarının önemli bir bölümü dosyalarında onu açıkça adlandırmaya başladı. AI2Bot’un %6,7 olması (ve Squarespace sitelerinde karşılık gelen Ai2Bot-Dolma kuralı), akademik LLM topluluğunun da işaretlendiğini gösteriyor; çünkü yayıncılar “kâr amacı gütmeyen araştırma tarayıcısı” ile “ticari tarayıcı” arasında her zaman ayrım yapmıyor.

Çıkarım kümesi — ChatGPT-User, OAI-SearchBot, YouBot, Perplexity-User — eğitim kümesinin 4–8 puan altında kalıyor. Bu fark, uzun süredir süren bir politika sorusunun cevabı: evet, en yüksek trafik alan siteler gelecekteki model eğitimi için veri toplayan bot ile bir kullanıcının sorusunu o anda yanıtlamak üzere canlı arama yapan bot arasında ayrım yapıyor. Her zaman ayırmıyorlar (genel kurallar ayırmıyor), ama anlamlı bir kısım, eğitim tarafını özellikle hedefleyen kurallar yazıyor.


Bulgular 5 — %14, Googlebot’u açık tutarken CCBot’u engelliyor: "korpusu engelle, aramayı açık bırak" deseni

İlk 10k’de en çok benimsenen seçici kural:

website-crawler-blocking-stats.webp

Kural deseniSitelerAnaliz edilebilirlerin %’si
CCBot’u engelle, Googlebot’a izin ver1.023%14,11
Bytespider’ı engelle, Googlebot’a izin ver926%12,78
Google-Extended’ı engelle, Googlebot’a izin ver816%11,26
GPTBot’u engelle, OAI-SearchBot’a izin ver658%9,08
GPTBot’u engelle, ChatGPT-User’a izin ver525%7,24
CCBot’u engelle, PerplexityBot’a izin ver519%7,16
anthropic-ai’yi engelle, ClaudeBot’a izin ver59%0,81

En çok benimsenen desen (%14,1), "Common Crawl’u engelle, Google arama görünürlüğünü koru". İkinci sıradaki desen (%12,8), "Bytespider’ı engelle, Google arama görünürlüğünü koru" — yani ByteDance’in itibar açısından işaretli tarayıcısını engellerken meşru arama tabanını olduğu gibi bırakmak. Üçüncüsü (%11,3), Google’ın Google-Extended ile tam olarak tasarladığı ayrımı yansıtıyor: yayıncı, Bard / Gemini eğitiminden çıkıyor ama arama sıralamasını kaybetmiyor.

Bu üç rakam birlikte, ilk 10k web’de baskın politika duruşunu tarif ediyor: eğitim korpusu botlarını reddet, arama ve çıkarım botlarını dokunulmadan bırak. "Eğitimi reddet ama şu LLM’in canlı getirme botuna izin ver" — GPTBot ✗ / ChatGPT-User ✓, %7,2 — gibi azınlık deseni var; ama korpus düzeyindeki kesintilere kıyasla daha küçük.

anthropic-ai / ClaudeBot satırındaki %0,81, Anthropic’in 2024 UA kullanım dışı bırakma kararını yansıtıyor: ClaudeBot artık hem eğitim hem çıkarım için kullanılıyor; bu da eski anthropic-ai UA’sının izin verdiği, Claude için temiz "eğitimi engelle, alıntıya izin ver" ifadesini ortadan kaldırıyor. Bu, 2024–2025’in en az konuşulan UA tasarım kararlarından biri; robots.txt’den bütünüyle bir politika ifade sınıfını kaldırdı.


Bulgular 6 — Haber ayrıntıda: ülke ve dile göre

Haber kategorisini ülke kodlu TLD’ye göre böldüğümüzde — bunun, sunulan dil değil .de için Alman haberleri, .fr için Fransız haberleri anlamına geldiğini akılda tutarak — haber içi fark, haber ile geri kalan arasındaki farktan daha büyük:

news-blocking-country-tld.webp

Ülke (yalnızca haber)nHerhangi bir yapay zekâ engeliAçık
🇩🇪 Almanya (.de)25%88,0%88,0
🇫🇷 Fransa (.fr)15%80,0%80,0
🇬🇧 Birleşik Krallık (.co.uk)15%66,7%53,3
🇪🇸 İspanya (.es)5%60,0%60,0
🇮🇹 İtalya (.it)13%53,8%53,8
Küresel haberler (.com/.org/vb.)500%45,0%42,8
🇵🇱 Polonya (.pl)7%42,9%42,9
🇯🇵 Japonya (.jp)12%25,0%25,0
🇷🇺 Rusya (.ru)13%0,0%0,0
🇬🇷 Yunanistan (.gr)6%0,0%0,0

Alman haberleri, tüm veri kümesindeki en yüksek engelleme yapan alt segment; oran %88 ve bunun tamamı açık: ilk 10k’de AI eğitim tarayıcılarının arşivlerine ulaşmasına izin veren neredeyse hiç Alman haber sitesi yok. Küme Spiegel, Bild, Welt, Zeit, FAZ, Süddeutsche, Heise, Golem, Stern, Focus tarafından yönlendiriliyor — tüm ana akım Alman yayıncılık kurumu ve kuralları bağımsız yazan teknoloji yayıncıları. Bunun arkasındaki siyasi altyapı yoğun: VG Media, Alman yayıncıların toplu haklar kuruluşu, AB yapay zekâ telif davalarında en agresif davacı kümelerden biri oldu ve AB Direktifi’nin 4. maddesi Alman hukukunda açık makinece okunabilir vazgeçme diliyle §44b UrhG olarak uygulanıyor. Yapay zekâ sağlayıcıları geldiğinde, Alman yayıncılar bu hukuki duruşu robots.txt kurallarına çevirmeye en hazır ulusal küme durumundaydı.

Fransız haberleri %80 ile hemen arkasında. Fransız hukuki ortam benzer (2019/790 Direktifi Fransız hukukuna aktarıldı) ve kümenin davranışı da benzer — lemonde.fr, lefigaro.fr, liberation.fr, lequipe.fr, 20minutes.fr, ouest-france.fr engelliyor; Le Monde dosyası ayrıca Fransız droit du producteur de base de données’e (Fikri Mülkiyet Kanunu’nun L 342-1 maddesi) paralel bir iç hukuki temel olarak atıf yapıyor. Fransa’nın bir başka özelliği de 2024’te Paris ticaret mahkemesinin robots.txt temelli vazgeçmenin Madde 4 kapsamında yeterli bildirim olduğuna hükmetmesi; bu, başka hiçbir yargı alanının henüz yakalayamadığı doğrudan içtihat desteği sağlıyor.

Birleşik Krallık’ta %67 daha düşük; bunun nedeni birkaç büyük İngiliz yayıncının (thesun.co.uk, dailymail.co.uk, mirror.co.uk) yapay zekâya özgü kurallardan ziyade User-agent: * ile her şeyi reddeden bloklar kullanması ve bunun açık oranı %53’e çekmesi. Toplam etki aynı — bu siteler yapay zekâ taramasına izin vermiyor — ama politika, adlandırılmış bot yasaklarıyla değil, "şu arama motorları dışındaki tüm robotlar yasak" biçiminde ifade ediliyor. Hukuki altyapı da daha zayıf: Brexit sonrası Birleşik Krallık, Madde 4 mantığını devraldı ama karşılık gelen içtihat daha ince.

Rus haberlerinde %0 en şaşırtıcı satır. Örneklemdeki on üç Rus alan adlı haber sitesi (dzen.ru, rbc.ru, ria.ru, kommersant.ru, tass.ru, lenta.ru, gazeta.ru, interfax.ru, kp.ru, tass.com vb.) — hiçbiri herhangi bir yapay zekâ tarayıcısını engellemiyor. Muhtemel açıklama şu: Rusça LLM eğitimi Yandex’in kendi GPT tarzı modelleri tarafından domine ediliyor (Common Crawl değil, Yandex içi tarayıcılar kullanılıyor), Rus telif ortamı henüz Madde 4 benzeri bir düzenleme benimsemedi ve büyük Rus yayıncılar Batılı LLM’leri konu dışı görüyor (ABD ihracat kontrolleri zaten OpenAI/Anthropic hizmetlerini Rusya’da sınırlıyor), Yandex’i ise rakip değil, yerel bir paydaş olarak görüyor. Politika duruşu gerçekten farklı.

Japon haberlerinde %25 üçüncü bir model. Japonya’da iç telif hukukunda açık metin ve veri madenciliği istisnaları var (2018’de değiştirilen Japon Telif Hakkı Yasası’nın 30-4. maddesi) ve bunlar AB Direktifi’nin 4. maddesinden daha izin verici; AI eğitimi dâhil olmak üzere "haz alma dışı" amaçlar için TDM’ye, hak sahibinin rızasını gerektirmeden izin veriyor. Japon yayıncıların vazgeçme için daha az hukuki alanı var ve buna karşılık robots.txt oranları daha düşük. Engelleyen %25’lik grup ise çoğunlukla daha büyük, daha kozmopolit yayıncılardan (asahi.com, nikkei.com) oluşuyor; bunlar yerelden çok uluslararası konumlandırılıyor.

Ülke bazlı haber verisi, raporda hukuki rejimin, teknoloji ya da sektör ekonomisinden ziyade, yapay zekâ engellemesinin birincil sürücüsü olduğunun en temiz kanıtı. AB haber kümeleri %54 ile %88 arasında toplanıyor; AB dışı haber kümeleri (Rusya, Japonya, küresel .com kümesi) %0 ile %45 arasında değişiyor. %88 zirve, Madde 4 uygulamasının en gelişmiş olduğu ülkede; %0 taban ise fiilen yapay zekâ politikası hukuku olmayan ülkede.


Bulgular 7 — AB ile geri kalanı: 16 puanlık fark

Ülke merceğini bir üst seviyeye taşıdığımızda, geniş AB–geri kalan ayrımı net:

BölgenHerhangi bir yapay zekâ engeliAçık
AB ccTLD’leri (.fr, .de, .es, .it, .nl, .pl, .se, .dk, .fi, .be, .at, .cz, .hu, .ro, .gr, .pt, .ie, .sk, .bg)617%35,2%33,9
AB dışı ulusal ccTLD’ler (.uk, .jp, .kr, .cn, .ru, .br, .in, .au, .mx, .ca, .tr, .ar, .cl, .co, .pe)897%17,2%13,6
Küresel (.com, .net, .org vb.)5.734%19,2%15,7

AB ccTLD siteleri yapay zekâyı AB dışı ulusal kümelerin iki katı ve küresel .com tabanının neredeyse iki katı oranında engelliyor. Fark, AB üye devletleri arasında tutarlı (ortalama değeri tek bir ülke sürüklemiyor) ve sektörler arasında da tutarlı (.de haber %88, .de SaaS yaklaşık %12, .de e-ticaret yaklaşık %25 — hepsi küresel karşılıklarından yüksek).

İlk 10k içinde robots.txt yorumlarında 2019/790 Direktifi’ne açıkça atıf yapan 275 dosya bulduk — ayrıştırılabilir örneklemin yaklaşık %3,8’i. Küme AB yayıncılarının baskınlığında ama onlarla sınırlı değil: birkaç ABD haber markası (özellikle NYT, doğrudan "AB Direktifi’nin 4. maddesi"ne atıf yapıyor), bazı İngiliz siteleri ve birkaç büyük Avrupa e-ticaret sitesi de aynı hukuki dili tekrar ediyor. 87 dosya "TDM" ya da "text and data mining" ifadesini adlandırarak kullanıyor. 460 dosya, belirli bir yasa maddesine atıf yapmasa bile, telif saklama dili içeriyor ("açıkça vazgeçer", "tüm hakları saklıdır", "ticari kullanım yasaktır", "makine öğrenmesi yok").

Bu kesitten iki daha ince gözlem:

AB etkisi sadece haberle sınırlı değil. Haberleri sabit tuttuğumuzda bile, AB dışı olmayan siteler AI’yı AB dışı benzerlerine göre daha yüksek oranda engelliyor (kabaca %28’e karşı %14). AB’deki SaaS, e-ticaret ve akademinin küçük ama gerçek bir bölümü, kendi sektörleri için de Madde 4 çerçevesini içselleştirmiş durumda.

AB tonlu dil, AB dışında da fiili şablona dönüşüyor. Küresel ölçekte benimsenen Cloudflare Managed robots.txt şablonu, bölböl böl ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790 ifadesini içeriyor. Cloudflare’ın "Block AI Bots" ayarını açan bir ABD sitesi, bunu mutlaka bilmeden, AB usulü bir hak saklı tutma beyanı ortaya koyuyor. Bulduğumuz daha ilginç politika sürüklenmesi eserlerinden biri bu: Avrupa kökenli bir hukuki kavram, ABD’li bir altyapı sağlayıcısının ürün arayüzü üzerinden küreselleşiyor.


Bulgular 8 — Şablonlar ve şablon kökenleri

Ayrıştırılabilir bir robots.txt döndüren 6.638 sitenin şablon köken dağılımı:

robots-txt-ai-bot-analysis.webp

ŞablonSitelerPay
Hiç yapay zekâ botu belirtilmemiş (varsayılan Shopify tarzı, Yoast, yapay zekâ dikkate alınmadan el yazısı)5.024%75,7
Özel / kendi yazılmış yapay zekâ kuralları1.183%17,8
Cloudflare Managed (Content-Signal: search=yes,ai-train=no)302%4,5
GPTBot için açık Allow: /124%1,9
Squarespace varsayılanı (yol kısıtlı blokta 28 AI UA)5%0,1

Kendi yazılmış kurallar %17,8 ile baskın. Kendi kaleme aldığı engelleyiciler kümesinin başını tüm sosyal medya platformları (facebook.com, twitter.com, linkedin.com, whatsapp.com, tiktok.com, snapchat.com, pinterest.com, x.com, chatgpt.com’un kendisi), en büyük e-ticaret hedefleri (amazon.com, amazonvideo.com), büyük haber markaları (nytimes.com, cnn.com, bbc.com, theguardian.com, forbes.com, reuters.com, bbc.co.uk, t-online.de, weather.com), önemli streaming / medya (netflix.com, vimeo.com, soundcloud.com, imdb.com) ve profesyonel hizmet sitelerinin uzun kuyruğu (canva.com, medium.com) çekiyor.

Cloudflare Managed %4,5’te — eğrinin en tepesinde aynı şablonun sahip olduğundan çok daha yüksek, ama bu raporun kapsadığı aralığın dışındaki uzun kuyruktaki kullanımından daha düşük. Şablon, en çok 1001–10000 sıra diliminde (%4–5) kullanılıyor ve eğrinin en tepesinde neredeyse yok (İlk 100: 1 site kullanıyor; 101–1000: 5 site). Büyük küresel mülkler kuralları kendileri yazıyor; uzun kuyruk anahtarı kullanıyor.

Dikkate değer bazı Cloudflare Managed siteleri: cloudflare.com’un kendisi bu şablonu kullanıyor — tutarlı, çünkü Cloudflare kendi ürününü kendi alanında dogfood ediyor. theatlantic.com şablonu kullanıyor — kendi özel kuralını yazmayan tek büyük ABD haber markası. spankbang.com şablonu kullanıyor — Cloudflare enjekte edilmiş yapay zekâ engelini benimseyen en üst sıralı yetişkin sitesi. linktr.ee şablonu kullanıyor — Linktree üzerinde barınan içerik üretici ekonomisinin tamamında tek bir satıcı kararıyla yapay zekâ eğitimini engelliyor. launchpad.net, nexusmods.com, vinted.fr, cookielaw.org, rustdesk.com ve daha küçük medya mülklerinden oluşan uzun liste, görünür Cloudflare Managed kümesini tamamlıyor.

Cloudflare benimseme kalıbı, "web’in yapay zekâ politikasının" ne kadar büyük bir kısmının altyapı sağlayıcıları tarafından kararlaştırıldığının gördüğümüz en somut kanıtı. Mutlak pay küçük (%4,5) ama yapısal olarak önemli: şablon, Cloudflare’ın varsayılan olarak sunduğu şey ve önümüzdeki 12 ayda varsayılan açık gidişat yukarı yönlü. Cloudflare yeni hesaplarda anahtarı varsayılan açık yaparsa, tek tek yayıncıların herhangi bir karar vermesine gerek kalmadan küresel engelleme oranı anlamlı biçimde artar.

Squarespace varsayılanı (ilk 10k’de 5 site, ama örneklemimizin dışında daha büyük bir küme) farklı bir desen: Squarespace, tek blokta 28 AI UA’sını adlandıran bir robots.txt sunuyor, fakat bu botlar site çapında yasak almak yerine User-agent: * yol kısıtlarını devralıyor. Yapay zekâ tarayıcıları /, ana sayfayı, ürün sayfalarını ve blogu getirebilir. Sadece /config ya da /account alamazlar. Bunu daha önce Squarespace sitelerinde üçüncü taraf taramalarda yanlış pozitif "AI block" okumalarının kaynağı olarak işaretlemiştik; aynı uyarı burada da geçerli.


Bulgular 9 — Yapay zekâ politikası sıralama dağılımı boyunca uniform

Bu tür çalışmalarda klasik beklenti, en çok ziyaret edilen sitelerin en agresif yapay zekâ politikasına sahip olmasıdır — çünkü eğitim yer değiştirmesinden en çok onlar kaybeder, en fazla hukuki kapasiteye ve kamusal incelemeye onlar sahiptir. Veri bu beklentiyi desteklemiyor.

Sıra diliminHerhangi bir yapay zekâ engeliAçıkCloudflare Managed
İlk 10067%22,4%17,91 site
101–1.000598%22,9%19,25 site
1.001–5.0002.810%19,0%15,399 site
5.001–10.0003.773%20,8%17,8197 site

Dört dilim de %19 ile %23 arasında. İlk 100, 5001–10000 uzun kuyruğundan daha agresif değil. Başlıktaki oran, tek tek sitelerin büyüklüğünü ya da görünürlüğünü değil, 2026’daki kamusal web’in özelliğini yansıtıyor gibi görünüyor.

İki katkı faktörü var. Birincisi, eğrinin tepesinde altyapı / SaaS / arama / portal alanları (Microsoft, Apple, Google vb.) baskın ve bunların kendi yapay zekâ engelleme oranları zaten düşük. İkincisi, uzun kuyrukta bölgesel haber yayıncıları ve AB yargı yetkisine bağlı siteler yüksek paya sahip; bunlar da 6. ve 7. bulguların gösterdiği gibi, küresel ortalamanın üstünde yapay zekâ engelliyor. Bu iki etki birbirini büyük ölçüde dengeliyor ve net sonuç tek tip bir başlık oluyor.

Cloudflare Managed sütunu eğri boyunca değişiyor. İlk 1000’de 6 Cloudflare yönetimli site var (%1,0); 1001–10000 aralığında 296 var (%5,7). Büyük siteler kuralı kendileri yazıyor; uzun kuyruk satıcı anahtarını kullanıyor. Veri kümesindeki sıralama bağımlı tek anlamlı sinyal bu ve bize şunu söylüyor: web’in tepesinden uzun kuyruğa doğru indikçe, satıcı tarafından belirlenen yapay zekâ politikasının payı düzenli biçimde artıyor. Bu eğilimin ilk 10k’nin ötesinde, ilk 100k ve sonrasında da sürmesini bekliyoruz.


Bulgular 10 — Beş anatomi: robots.txt gerçekten bir politika olduğunda nasıl görünür?

Sayılar veri kümesinin şeklini anlatır; kamusal web’deki "yapay zekâ politikasının" gerçek karakteri ise belirli dosyaları okuyunca görülür. Aşağıda, politika alanını kapsayacak biçimde seçilmiş beş örnek var.

Anatomi 1 — New York Times (nytimes.com)

nytimes.com/robots.txt dosyasının ilk 14 satırı:

# New York Times içeriği, burada yer alan Hizmet Şartlarımıza bağlı olarak
# kişisel, ticari olmayan kullanımınız için sunulmaktadır:
# https://help.nytimes.com/hc/en-us/articles/115014893428-Terms-of-Service.
# İçeriği otomatik yollarla veri madenciliği yapmak ya da kazımak için tasarlanmış
# herhangi bir cihaz, araç veya süreç kullanımı, The New York Times Company’nin
# önceden yazılı izni olmaksızın yasaktır. Yasaklı kullanımlar şunları içerir, ancak bunlarla sınırlı değildir:
# (1) AB Dijital Tek Pazar Telif Direktifi’nin 4. maddesi kapsamındaki metin ve veri madenciliği faaliyetleri;
# (2) yazılım, makine öğrenmesi, yapay zekâ (AI) ve/veya büyük dil modellerinin (LLM’ler)
# geliştirilmesi;
# (3) içeriğimizi içeren arşivlenmiş veya önbelleğe alınmış veri kümelerinin başkalarına oluşturulması veya sağlanması; ve/veya
# (4) herhangi bir ticari amaç.
# Yardım için https://nytlicensing.com/contact/ adresine başvurun.

Bu, bir hukuki delil olarak robots.txt. Dosya, taraf olduğu NYT v. OpenAI davasında kanıt olarak kullanılabilecek biçimde yapılandırılmış. Bir ABD yayıncısının "AB Direktifi’nin 4. maddesi"ne atıf yapması, 7. bulgunun işaret ettiği gibi AB hukuki çerçevelerinin küresel söyleme sızdığını gösteriyor. "Arşivlenmiş veya önbelleğe alınmış veri kümeleri oluşturma" yasağı doğrudan Common Crawl’u hedef alıyor. Dosya 60+ satır uzunluğunda; GPTBot, OAI-SearchBot, ChatGPT-User, anthropic-ai, ClaudeBot, CCBot, Google-Extended, Applebot-Extended, Bytespider, Diffbot, Meta-ExternalAgent, Amazonbot, Omgili, Omgilibot ve bir düzineden fazla başka bot için ayrı User-agent blokları var — adı geçen her botun kendi Disallow: / kuralı mevcut.

Anatomi 2 — Der Spiegel (spiegel.de) — bölüm bazlı yapay zekâ izinlendirme

Der Spiegel, veri kümesinin tamamında bulduğumuz en operasyonel sofistike robots.txt dosyasına sahip. İlgili blok:

# TLP-6507: Seçilen bölümler için OpenAI arama tarayıcılarının test amaçlı açılması
User-agent: OAI-SearchBot
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

User-agent: ChatGPT-User
Allow: /ausland/
Allow: /partnerschaft/
Allow: /gesundheit/
Allow: /familie/
Allow: /reise/
Allow: /psychologie/
Allow: /stil/
Disallow: /

Yorum şu anlama geliyor: "Seçilen bölümler için OpenAI arama tarayıcılarının test amaçlı açılması." Spiegel, OpenAI’nin çıkarım UAs’ı için yedi belirli içerik kategorisini — uluslararası haberler, iş ortaklıkları, sağlık, aile, seyahat, psikoloji ve yaşam tarzı — beyaz listeye alırken geri kalan her şeyi engelliyor. Siyasi bölümler, Alman ulusal haberi ve araştırmacı gazetecilik açıkça dışarıda bırakılıyor. Common Crawl, Bytespider, Cohere, Webzio-Extended ve diğer eğitim UAs’larına dosyanın daha aşağısında tam Disallow: / veriliyor.

Bu, bölüm düzeyinde editoryal politika olarak robots.txt. Zımni teori şu: yaşam tarzı içeriğinin eğitim yer değiştirme riski daha düşük, çıkarım alıntısı getirisi daha yüksek; bu yüzden Spiegel AI’nin o bölümleri yüzeye çıkarmasına izin veriyor. Siyasi ve araştırmacı içerik ise hendek, bu yüzden AI dışarıda bırakılıyor. Başka hiçbir yerde bu deseni görmedik. Bu, editoryal, hukuki ve altyapı ekipleri arasında çoğu haber odasının ulaşamadığı bir koordinasyon düzeyine işaret ediyor. Bu tür ayrıntılı, bölüm bazlı politika ifadesinin 2026–2027 boyunca yayılmasını bekliyoruz — Spiegel’in dosyası neredeyse bir öncü gösterge.

Anatomi 3 — BBC (bbc.com) — politika beyanı biçimi

BBC’nin robots.txt dosyası şu şekilde başlıyor:

# sürüm: ec59bd036e5138eb4831a9ed44447b1ff310e235
# BBC Kullanım Şartları: https://www.bbc.co.uk/terms
# - Hizmetlerimizi kullanma kurallarını açıklar
# - İçeriğimizle neler yapabileceğinizi anlatır
#
# Kısacası: Sitemizi robot gibi değil, insan gibi kullanın.
# Yani:
# - İçeriğin kazınması, taranması veya sistematik çıkarımı yok
# - LLM’ler dâhil yapay zekâ modellerini eğitmek ya da ince ayar yapmak için BBC içeriğinin kullanımı yok
# - Retrieval-augmented generation (RAG), AI destekli arama, agentic AI veya
#   BBC içeriğiyle grounding yok
# - BBC içeriğinden veri kümeleri oluşturmak yok
# - AB Direktifi kapsamında telif üzerine metin ve veri madenciliği (TDM) yok
# - Kendi kullanımınız için özetler oluşturmak amacıyla BBC içeriğini kullanmak yok
# - İzin olmadan ticari kullanım yok
# - BBC, içeriğindeki tüm haklarını saklı tutar ve yasaların izin verdiği ölçüde,
#   metin ve veri madenciliğine ilişkin herhangi bir yargı alanındaki tüm yasal istisnalardan
#   açıkça vazgeçer
#
# Kısacası: Gez, oku, izle, keyfini çıkar — insan gibi.

BBC, robots.txt’sini sürüm numaralandırıyor (# version: ec59bd... bir git commit karmasıdır), BBC’nin hukukçularının izlediği sekiz belirli yapay zekâ kullanımını yasaklıyor ve markasının üzerine kurulu olduğu düzyazı tonunda tek satırlık bir özetle bitiriyor. "Herhangi bir yargı alanındaki yasal istisnalardan açıkça vazgeçer" ifadesi bilinçli bir küresel hak saklı tutmadır — yani tek bir hukuk rejiminin bize aradığımız korumayı vereceğine güvenmiyoruz; bu yüzden her yerde aynı anda vazgeçme beyan ediyoruz. Bu, veri kümesindeki en çok tasarlanmış robots.txt; bir yapılandırma dosyasından çok basın bülteni gibi okunuyor.

Anatomi 4 — WordPress.org — açık davet

Yukarıdakilerin hepsini wordpress.org ile karşılaştırın:

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: anthropic-ai
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Bytespider
Allow: /

User-agent: CCBot
Allow: /

User-agent: Copilot
Allow: /

WordPress.org, Bytespider, CCBot ve anthropic-ai dâhil olmak üzere dokuz yapay zekâ eğitim tarayıcısına açıkça izin veriyor; bunlar başka yerlerde en sık engellenenler. Zımni teori şu: WordPress dokümantasyonu ve eklenti ekosistemi, AI asistanlarının hakkında soruları yanıtlayabildiğinde değeri artan bir kamusal maldır. Birisi Claude’a "WordPress’te kalıcı bağlantıları nasıl yapılandırırım?" diye sorduğunda ve Claude wordpress.org/documentation/ üzerinde eğitildiyse, WordPress misyonu hizmet almış olur. Vakıf, her modelin eğitim korpusunda yer almanın stratejik bir artı olduğuna karar vermiş görünüyor ve bunu dosyanın ifade edici dilbilgisiyle söylemiş.

Anatomi 5 — The Verge (theverge.com) — sponsorlu hibrit

Göstermeye değer bir başka desen. The Verge yapay zekâ kurallarını Disallow: / \ Allow: /sp/ biçiminde yapılandırıyor:

User-agent: GPTBot
Allow: /

User-agent: Applebot
Allow: /

User-agent: Google-Extended
Disallow: /
Allow: /sp/

User-agent: anthropic-ai
Disallow: /
Allow: /sp/

User-agent: Bytespider
Disallow: /
Allow: /sp/

User-agent: CCBot
Disallow: /
Allow: /sp/

User-agent: ChatGPT-User
Disallow: /
Allow: /sp/

User-agent: ClaudeBot
Disallow: /
Allow: /sp/

/sp/ yolu, The Verge’in sponsorlu / iş ortağı içerik bölümüdür. Editoryal içerik AI eğitimine kapalıdır; sponsorlu içerik ise izinlidir. Ekonomik mantık nettir: sponsorlar içeriklerinin yapay zekâ üzerinden de bulunabilir olması için ödeme yapar; editoryal amiral gemisi ise hendektir. GPTBot tamamen açık (muhtemelen doğrudan OpenAI ilişkisi nedeniyle), Applebot bir arama tabanı olarak tamamen açık, geri kalanlar ise hibrit muamele görür. Bulduğumuz tek "kademeli AI erişimi" yapısı bu.

Bu beş dosya, mevcut robots.txt yapay zekâ politikası aralığını anlatıyor. İlk 10k’deki dosyaların çoğu bunların hiçbiri gibi değil — ya sessiz ya da satıcı şablonu kullanıyorlar. Bunlardan birine benzeyenler, dosyanın dikkatle okunmaya değer olduğuna karar vermiş kişiler tarafından yazılmış.

Dosya ölçeğine dair bir not: örneklemimizdeki medyan robots.txt gövdesi 858 bayt — anlamlı bir yapay zekâ politikası kodlamak için çok küçük. Kuralların yaşadığı yer sağ kuyruk: 1.005 site (%15,3) 5 KB’den büyük bir dosyaya, 273’ü 20 KB’den büyük bir dosyaya sahip ve en büyüğü 248 KB idi. 460 dosya telif saklama dili içeriyor; 275’i AB 2019/790’a ad vererek atıf yapıyor. 2026’da bir robots.txt, giderek daha fazla sürüm kontrollü, avukat gözden geçirmeli bir belge; yapılandırma satırı değil.


Bulgular 11 — 108 site GPTBot’u açıkça memnuniyetle karşılıyor

Küçük ama görünür bir küme, ters yönde bir User-agent: GPTBot \n Allow: / kuralı yazıyor — çok konuşulan "GPTBot’u engelle" yaklaşımının tersi. Örneklemimizde kök yolda GPTBot’a açık izin veren 108 site var. Tranco sıralamasına göre ilk 25’i:

gptbot-welcoming-sites.webp

SıraAlan adıSektör
42wordpress.orgGeliştirici araçları / CMS
133kaspersky.comGüvenlik
187avast.comGüvenlik
265hp.comDonanım OEM
624branch.ioMobil attribution SaaS
692sophos.comGüvenlik
782theverge.comHaber
905rambler.ruRus portalı
945kleinanzeigen.deAlman pazar yeri
948theatlantic.comHaber
1.092lge.comLG Electronics
1.300justdial.comHindistan yerel arama
1.332avira.comGüvenlik
1.412youm7.comMısır haberleri
1.530goodreturns.inHindistan finans
1.621publi24.roRomanya ilanları
1.807geocomply.comUyumluluk SaaS
1.908nba.comSpor
1.956oneindia.comHindistan haberleri
1.974mindbox.ruRus SaaS
2.009thesun.co.ukHaber
2.126vox.comHaber
2.140mgid.comYerel reklamcılık
2.314ninjarmm.comBT yönetimi SaaS
2.323norton.comGüvenlik

Bazı kalıplar:

Güvenlik şirketleri belirgin biçimde orantısız temsil ediliyor. Kaspersky, Avast, Sophos, Avira, Norton, NinjaRMM açıkça GPTBot’a izin veriyor. Bu bilinçli bir dağıtım hamlesi: bir kullanıcı ChatGPT’ye "Windows makinem için en iyi antivirüs hangisi?" diye sorduğunda, markanın modelin eğitim korpusunda yer alması öneriyi doğrudan etkiliyor. Güvenlik, AI aramasının SEO’nun yerini almaya başladığı birkaç B2C ürün kategorisinden biri; bu markalar ilk hareket edenler. Önümüzdeki 12 ay içinde güvenlik kümesinin geri kalanının da bunu izlemesini bekliyoruz.

Bazı büyük haber markaları listede engelleme tarafında değil. The Verge, The Atlantic, Vox, The Sun, NBA.com. Bu bir çelişki değil — bu yayıncılar ChatGPT araması içinde alıntılanabilir olmanın eğitimden korunmaktan daha değerli olduğuna karar vermiş görünüyor ve CDN ya da CMS’in gelecekte aşırı engellemesine karşı koymak için açık Allow kuralı yazmışlar. NYT / Reuters / BBC / Forbes / Guardian çizgisindeki açık Disallow yaklaşımıyla karşılaştırın. İki duruş da savunulabilir; haber sektörü yekpare değil.

The Sun’ın varlığı dikkat çekici, çünkü aynı site dosyanın başka yerinde User-agent: * ile her şeyi reddeden bir blok kullanıyor. The Sun’ın politikası en iyi şekilde "AI eğitimi yasak, AI araması serbest ve ChatGPT’nin The Sun’a atıf yaparak soru yanıtlayabilmesi için GPTBot’u açıkça istisna olarak beyaz listeye aldık" şeklinde okunur. Bu, GPTBot-Allow kuralları arasında en gelişmiş hukuki yapılandırmadır — bir vazgeçiş artı tek satıcıya açık izin.

WordPress.org’un varlığı, listedeki tek başına en önemli girdidir. Küresel açık kaynak CMS ekosisteminin hatırı sayılır bir kısmı ya dokümantasyon için WordPress.org’a yöneliyor ya da eklentileri oradan barındırıyor. WordPress Vakfı, wordpress.org/robots.txt üzerinden GPTBot’a açıkça izin vererek WordPress dokümantasyon ekosisteminin eğitim için açık olduğunu fiilen söylemiş oldu — bu da Claude, Gemini ve ChatGPT’nin WordPress hakkında "nasıl yaparım" sorularını ne kadar iyi yanıtladığına zincirleme etki yapar.

Kalan 83 site; bölgesel haberler, küçük güvenlik sağlayıcıları, İngilizce dışı pazarlardaki ilan platformları ve B2B SaaS’tan oluşan uzun kuyruk. Bildiğimiz kadarıyla sektörel çapta eşdeğer bir "GPTBot’a izin ver" koordinasyonu yok — kural, birer birer, korpus içinde yer almanın stratejik konum olduğuna karar veren operatörler tarafından benimseniyor.


Bulgular 12 — llms.txt bu ölçekte neredeyse bir söylenti

LLM dostu içerik keşfi için önerilen alternatif dosya biçimi llms.txt, 2024 sonlarından beri Mintlify, Anthropic, Vercel ve birkaç geliştirici aracı satıcısı tarafından savunulsa da örneklemimizin neredeyse hiçbir yerinde görünür benimsemeye sahip değil.

Ayrıştırılabilir bir robots.txt döndüren 6.638 sitenin 83’ü (%1,15) llms.txt’den söz ediyor — tipik olarak Sitemap: https://example.com/llms.txt satırıyla. Bu, Vercel ve Mintlify varsayılanlarının benimsemeyi şişirdiği geliştirici-ağırlıklı ticari örneklemlerde ölçülen aynı metrikten iki mertebe daha düşük.

llms-txt-robots-adoption-rate.webp

Kategori dökümü:

Sektörnllms.txt anma oranı
Altyapı47%4,3
Kumar100%3,0
SaaS369%3,0
Telekom33%3,0
E-ticaret224%1,8
Seyahat64%1,6
Geliştirici araçları129%1,6
Haber650%0,8
Yetişkin254%0,4
Kamu172%0,0
Akademi268%0,0
Arama12%0,0

llms.txt, geliştirici araçlarına bitişik SaaS, kumar (uyum ekipleri sayesinde ek meta veriyi katmanlama konusunda diğer düzenlemeli sektörlerden daha hızlı yeni sözcükleri benimser) ve B2B e-ticarette yoğunlaşıyor. Haber ve kamu alanlarında belirgin biçimde yok — oysa bu iki segment AI politikasıyla en çok meşgul olan ve standardın "satıcı deneyi"nden "web protokolü"ne geçmesi için benimsenmesinin gerekli olacağı alanlar. O zamana kadar llms.txt gerçek ama küçük; 2026 sonlarında yapılacak bir takip denetimi yararlı bir yeniden test olacaktır.

llms.txt’nin karşılaştığı yapısal sorun, herhangi bir IETF süreciyle standartlaştırılmamış olması ve büyük yapay zekâ sağlayıcılarının bunu kabul etmeyi taahhüt etmemiş olmasıdır. robots.txt kuralının etrafında 30 yıllık tarayıcı altyapısı var; llms.txt kuralının ise yok. En az bir büyük sağlayıcı (OpenAI, Anthropic, Google, Cloudflare) resmî destek açıklayana kadar dosya temelde Mintlify / Vercel ekosisteminin bir pazarlama nesnesi olmaktan öteye geçmiyor. Bunun 2026’da değişmesini beklemiyoruz.


Bulgular 13 — Erişilebilirlik: robots.txt hâlâ ilk web’in üçte ikisi tarafından okunabiliyor

Bulgulardan biri olması amaçlanmayan ama yan gözlem olarak kayda değer bir sonuç: ilk 10.000 sitenin %66’sı tek bir araştırma IP’sine ayrıştırılabilir bir robots.txt döndürdü ve 10.000’de yalnızca 7 site (%0,07) 429 Too Many Requests verdi. Bu, robots.txt’nin kamusal bir protokol olarak hâlâ sağlıklı olduğuna işaret ediyor.

Karşılaştırma için: iki ay önce 1.008 alan adından oluşan orta pazar e-ticaret örnekleminde aynı işlem hattı, çözümlenen alan adlarının %52’sinden 429 aldı — Shopify ve Cloudflare CDN’leri, büyük arama motoru dışındaki herhangi bir User-Agent’ı agresif biçimde hız sınırlıyordu. İlk trafik alan web çok daha dost canlısı: üst siteler ya (a) daha az agresif bot yönetim katmanlarına sahip ya da (b) bilinen araştırma tarayıcıları için açık beyaz listelere sahip, ya da her ikisi.

İlk 10k’deki %21 fetch_failed oranı, / altında web sunucusu çalıştırmayan CDN kök alanlarından (akamai.net, cloudfront.net, fastly.net, apple-dns.net, gtld-servers.net) kaynaklanıyor. Bizi engellemiyorlar; sunacak bir şeyleri yok. Bunlar hariç tutulduğunda, gerçekten "okumaya çalışıp okuyamadığımız" hata oranı düşük tek hanelerde.

Bu da, bu raporun gelecek sürümlerinin — çeyreklik anlık görüntüler, yıl bazında karşılaştırmalar — tek bir makinede ucuz ve yeniden üretilebilir şekilde çalıştırılabileceği anlamına geliyor. Denetim penceresi eğrinin tepesinde açık kalıyor. Asimetrik durum uzun kuyruk ve ticaret segmenti; CDN düzeyindeki kısıtlama, robots.txt’yi fiilen özelleştirmiş durumda. Bu ayrışmanın daha da büyümesini bekliyoruz: üst siteler okunabilir kalacak, çünkü arama motorları tarafından indekslenmek için okunabilir olmaları gerekiyor; uzun kuyruk e-ticareti ise Cloudflare’ın bot-fight katmanları daha agresif gönderildikçe daha az okunabilir hale gelecek. robots.txt’nin kamusal denetlenebilirliği, "görünür web" ile "operasyonel olarak korunan web"i ayıran çizgide ikiye ayrılıyor.


IV. Bütün bunlar ne anlama geliyor

Verinin en güçlü biçimde desteklediği sırayla dört iddia.

1. İnternetin küresel değil, sektör bazlı bir yapay zekâ politikası var. Haber ile telekom arasındaki 12 katlık fark tüm agregat sayıların önüne geçiyor. "Web’in X%’i AI’yı engelliyor" demek, sektörel kırılım olmadan SaaS/kamu/geliştirici araçlarını fazla, haber/seyahat/sosyal’i ise az gösterir. Dürüst çerçeve yalnızca sektör bazlı olandır.

2. AB Telif Direktifi’nin 4. maddesi sayıları görünür biçimde değiştiren tek hukuki rejim. AB ccTLD siteleri %35 ile engelliyor; küresel taban %19. ABD’deki dava süreci (NYT v. OpenAI, Telif Ofisi’nin Ocak 2025 raporu) ABD haber kümesini değiştirdi ama daha geniş ABD web’ini değil. AB çerçevesi ayrıca Cloudflare’ın şablonu üzerinden küresel olarak sızıyor; şablon müşterinin yargı yetkisine bakmaksızın 2019/790 Direktifi’ne atıf yapıyor.

3. İki paralel "yapay zekâ politikası" ifade ediliyor ve birbirleriyle tam örtüşmüyor. Bilinçli, el yazısı politika (%17,8; çoğunlukla haber/sosyal/seyahat/e-ticaret) ve devralınmış Cloudflare yönetimli politika (%4,5) özde örtüşse de meşruiyet açısından farklı. robots.txt’yi yok saymak için hukuki dayanak arayan AI operatörlerinin olduğu bir dünyada, "bunu biz yazdık ve gözden geçirdik" savunması, "ben sadece anahtarı açtım" savunmasından yapısal olarak daha güçlü. Dava teşviki, politikayı ikinci kategoriden birinciye taşımaktır.

4. Yayıncıların engellediği şey model değil, korpus. CCBot’un %16,3 ile model markası botlarından daha yüksek olması, bunun en açık ifadesi. OpenAI’yi reddetmek, bir yayıncıyı eğitimden çıkarmıyor; CCBot’u reddetmek çıkarıyor. İlk 10k web’in %14,1’i CCBot’u engellerken Googlebot’a izin veriyor. "Eğitimi engelle, aramayı açık bırak" deseni 2026’daki modal yapay zekâ kuralı.

Kendi duruşunu değerlendiren siteler için: baskın duruş sessizliktir — ilk 10k’nin %80’i AI hakkında hiçbir şey söylemiyor. Kural yazan %17’lik grup çoğunlukla Disallow etrafında kümeleniyor; ama küçük ama büyüyen bir kesim (başını güvenlik sağlayıcılarının çektiği açıkça Allow-GPTBot listesi, %1,5) tersini kamuya açık biçimde seçiyor. Sektör uzlaşısı yok ve önümüzdeki on iki ay içinde de olmayacak.

AI operatörleri için: robots.txt’nin eski, semantiği belirsiz bir protokol olduğu argümanını sürdürmek giderek zorlaşıyor; çünkü dünyanın en büyük sitelerinin %17’si botları tek tek adlandıran açık ve bilinçli kurallar yazmış durumda ve dosyaların %3,8’i belirli bir AB maddesine bölüm numarasıyla atıf yapıyor. Bu kurallara uyup uymamak bir iş kararıdır; bu kuralların var olup olmadığı ise artık deneysel bir gerçektir.


V. Görünüm: 2026 sonuna kadar ne bekliyoruz

Veri kümesinde görülebilen üç gidişat:

Cloudflare Managed payını iki kattan fazla artıracak; makul olarak ayrıştırılabilir ilk 10k’de %10+’a ulaşabilecek. Cloudflare’ın yol haritası, yeni hesaplar için varsayılan açık Block AI Bots’u kamuya açık biçimde tartışıyor. Anahtar varsayılan açık gelirse, küresel engelleme oranı hiçbir yayıncı kararı olmadan 5–8 puan yukarı çıkar. Bunun gerçekleştiğini, 5001–10000 sırasındaki Cloudflare Managed payı mevcut %5,7’nin üstüne çıktığında anlayacağız.

Bölüm bazlı yapay zekâ politikaları (Spiegel tarzı) büyük haber amiral gemileri arasında yayılacak. Ekonomik mantık — AI’nın düşük riskli içeriği alıntılamasına izin ver, hendek içeriğini koru — yeterince güçlü; bu yüzden en az 10 büyük haber odasının 2026 sonuna kadar bölüm bazlı kurallar yayınlamasını bekliyoruz. Önce Alman ve Fransız orta kademe basınına bakın; hukuki çerçeve orada denemeyi ödüllendiriyor.

Açıkça GPTBot’a izin veren küme büyüyecek; öncülüğü B2B SaaS ve geliştirici araçları yapacak. AI araması yazılım satıcıları için ölçülebilir bir edinim kanalına dönüştüğünde (güvenlikte olduğu gibi zaten öyle), marjinal CMO yanlışlıkla aşırı engellemeye karşı bağışıklık sağlamak için User-agent: GPTBot \n Allow: / yazacak. 108 sitelik listenin yıl sonuna kadar yaklaşık iki katına çıkmasını bekliyoruz.

Ne beklemiyoruz: sessiz çoğunluk payında anlamlı bir değişim. AI hakkında hiçbir şey söylemeyen web’in %80’i, kural yazmak için ekonomik gerekçesi olmayan ve bunu yapmak için hukuki baskı görmeyen sektörleri (kamu, telekom, altyapı, B2B SaaS) içeriyor. Evrensel yapay zekâ politikası gelmiyor.


VI. Sınırlamalar

  1. Tek anlık görüntü yanlılığı. Getirmeler 2026 Mayıs başında 36 saatlik bir pencerede yapıldı. İlk 100’de dosya her gün değişiyor; başlık rakamlarında çeyrek başına 1–2 puanlık kayma bekleyin.
  2. Sektör sınıflandırma boşlukları. 10.000 sitenin 6.593’ü dört katmanlı sınıflandırıcıdan sonra unknown kaldı. Sektör yüzdeleri, n büyük olduğunda sağlamdır (haber: 650, streaming: 440, saas: 369, akademi: 268, yetişkin: 254, e-ticaret: 224, kamu: 172, finans: 129, geliştirme: 129); n=30’un altında daha gürültülüdür. Ülke-haber kesiti de benzer biçimde sınırlıdır — DE/FR/UK için n≥15 var, Kore/İsveç/Çekya için n=20–25 düzeyi var.
  3. robots.txt isteğe bağlıdır. Bir Disallow engel değil, taleptir. Bytespider, PerplexityBot ve diğerlerinin kuralları yok saydığı belgelenmiştir. Politika beyanlarını ölçtük, yaptırımı değil.
  4. Tek IP, ABD tabanlı denetim. Çözümlenen alan adlarının %21’ini okuyamadık. Çoğu, web sunucusu olmayan CDN kökleri; küçük bir kısmı ise orijine ulaşmadan önce CDN’sinin bizi işaretlediği siteler. Bu, örneklemi biraz eski altyapı lehine, ülke bazlı coğrafi kısıtlamalı sitelere karşı ise az da olsa önyargılı hale getirir.
  5. Tranco listesi semantiği. Tranco istikrarı filtreler; gerçek kullanıcı davranışına dayalı bir sıralama değildir. Toplam rakamlar liste seçimine dayanıklıdır; belirli sıra konumları değildir.
  6. Trafik verisi yok. robots.txt politikasını ölçtük, gerçek AI bot hacmini değil. Politika ve trafik her zaman örtüşmez.

VII. Bunu yeniden üretin

Bu raporu üretmek için kullanılan her şey teslim klasöründe yer alıyor.

  • tranco_top10k.csv — girdi listesi
  • out/sites.csv — alan adı × sıra × sektör × dil × robots.txt durumu (10.000 satır)
  • out/fetch_meta.csv — her alan adına ait getirme sonucu (durum, şema, bayt, hata)
  • out/bot_status.csv — alan adı × bot ızgarası (250.000 satır: engelli, kural var, getirme durumu)
  • out/site_meta.csv — her site için tek analitik kayıt (şablon, özet boolean’lar)
  • out/analysis.json — raporda alıntılanan her metrik
  • 01_fetch_robots.py, 02_classify.py, 03_parse_and_analyze.py — tam Python işlem hattı

Tüm betikleri ve veri kümelerini indir


Metholoji düzeltmeleri, veri kümesi sorunları ve takip analizleri için support@thunderbit.com adresine yazabilirsiniz. Bu rapor, Thunderbit’in herhangi bir ticari konumundan bağımsız olarak yayımlanmıştır; biz yapay zekâ destekli bir web kazıyıcı geliştiriyoruz ve robots.txt’nin kamusal web’de anlamlı, makinece okunabilir bir sözleşme olarak kalmasında yapısal çıkarımız var. Bu rapordaki veriler kendi başına ayaktadır. — Thunderbit araştırma ekibi, Mayıs 2026.

Thunderbit AI Web Scraper’ı deneyin Get Started Free

Shuai Guan
Shuai Guan
Thunderbit CEO’su | AI Veri Otomasyonu Uzmanı Shuai Guan, Thunderbit’in CEO’su ve University of Michigan Mühendislik mezunudur. Teknoloji ve SaaS mimarisi alanındaki yaklaşık on yıllık deneyiminden güç alarak, karmaşık yapay zeka modellerini pratik, kod yazmadan kullanılabilen veri çıkarma araçlarına dönüştürme konusunda uzmanlaşmıştır. Bu blogda, daha akıllı ve veriye dayalı iş akışları kurmanıza yardımcı olmak için web kazıma ve otomasyon stratejileri üzerine filtresiz, sahada sınanmış içgörüler paylaşıyor. Veri iş akışlarını optimize etmediği zamanlarda ise aynı detay odaklı yaklaşımını fotoğrafçılık tutkusuna da yansıtıyor.
İçindekiler

Sadece sorarak bir web sayfasını çek

Ne istediğini düz İngilizceyle söyle. Hatta daha iyisi, hiçbir şey söyleme.

Thunderbit’i dene ücretsiz
Yapay Zeka ile Veri Çıkar
Verileri Google Sheets, Airtable veya Notion’a kolayca aktar
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week