Отчет | Как robots.txt превратился в хаотичную политику веба

Последнее обновление: July 9, 2026
Отчет | Как robots.txt превратился в хаотичную политику веба

Краткое резюме

Предыдущий отчет поднимал политический вопрос: сколько из самых посещаемых сайтов мира говорят AI-краулерам, что им можно и чего нельзя делать?

Этот материал продолжает тему и задает уже операционный вопрос: насколько надежен robots.txt как инфраструктура, на которую сегодня возлагают эту политику?

Ответ не слишком радужный. robots.txt по-прежнему работает, потому что он публичный, дешевый, машинно-читаемый и уже понятен краулерам. Но на него навесили куда больше задач, чем он был рассчитан выполнять изначально. В 2026 году в этом простом текстовом файле могут одновременно жить SEO-ограничения для краулинга, карты сайта, устаревшие расширения поисковых систем, отказы от обучения AI, словарь политик от Cloudflare, оговорки об авторских правах и юридические формулировки на случай будущих споров.

Это и есть конфигурационный долг.

В основе этого отчета лежит тот же краулинг Tranco Top 10,000, что и в исходном исследовании AI-краулеров. Из 10,000 доменов 6,638 вернули читаемый robots.txt; еще 610 вернули 404, что по протоколу считается неявным разрешением. В итоге для анализа доступа ботов есть 7,248 сайтов, а для анализа сложности конфигурации — 6,638 реальных файлов.

Особенно выделяются шесть наблюдений:

  1. Большинство файлов robots.txt очень маленькие, но правый хвост крайне сложен. Медианный файл занимает всего 834 байта и 31 строку. Но 1,005 файлов весят не меньше 5 КБ, 273 — не меньше 20 КБ, а 28 — не меньше 100 КБ. Самый большой файл в выборке — 248 КБ.

  2. Сотни крупных сайтов используют файлы, которые больше похожи на продакшен-конфигурацию, чем на краткие примечания к политике. Медианный файл содержит 9 директив Disallow. Но у 707 сайтов есть как минимум 100 правил Disallow, у 13 — как минимум 1,000, у 240 указано не менее 50 user-agent'ов, а у 110 — не менее 100 user-agent'ов.

  3. Отклонение от протокола — не теория. Среди 6,638 читаемых файлов 685 содержат Crawl-delay, 303 — Host, 200 — Clean-param, 9 — Request-rate, 5 — Visit-time, а 271 используют язык в стиле Cloudflare Content-Signal. Не все это части одного аккуратного стандарта. Это накопившийся краулерный фольклор.

  4. К Googlebot относятся как к особому гражданину. 562 анализируемых домена блокируют как минимум одного традиционного поискового краулера. В 404 из этих случаев Googlebot разрешен, хотя бы один другой поисковый краулер — заблокирован. Дискриминация AI-краулеров не возникла в нейтральной среде; robots.txt уже был носителем иерархии поисковых систем.

  5. AI-политика делает этот долг более заметным. 1,377 читаемых файлов содержат язык, связанный с AI-политикой; 719 — язык об авторских правах, условиях использования, лицензировании или разрешениях; а 501 — и то и другое. Файл стал одновременно машинным интерфейсом и юридическим артефактом. Это полезно, но хрупко.

  6. Самые рискованные файлы — не всегда самые анти-AI. В e-commerce, travel, social, finance, academia и news сложность файлов возникает по разным причинам: контроль crawl budget, устаревшие пути, пользовательский контент, оговорки о правах и исключения для отдельных ботов. На и без того запутанную основу накладываются новые AI-правила.

Главный вывод: robots.txt остается важнейшей публичной поверхностью для политики краулинга в вебе, но это слабый фундамент для серьезного AI-управления, если экосистема не стандартизирует идентичность краулеров, словарь использования AI и возможность аудита политики.


Методология

В этом отчете повторно используется набор данных из исходного анализа Thunderbit по политике AI-краулеров на доменах Tranco Top 10,000.

Использовались следующие исходные материалы:

  • tranco_top10k.csv — исходный список из 10,000 доменов Tranco.
  • out/fetch_meta.csv — статус загрузки, количество байтов, схема, результат редиректа и метаданные ошибок.
  • out/sites.csv — домен, ранг, категория, язык и статус robots.txt.
  • out/site_meta.csv — одна аналитическая строка на сайт, включая класс шаблона, флаги блокировки AI, размер файла и сводные поля политики ботов.
  • out/bot_status.csv — одна строка на домен и краулер, включая факт блокировки этого бота и наличие конкретного правила.
  • raw_robots/ — кэшированные тела robots.txt для 6,638 сайтов, вернувших статус 200.

Для этого продолжения каждый читаемый файл robots.txt проверялся на:

  • размер файла и количество строк;
  • активные строки без комментариев;
  • количество директив User-agent, Disallow, Allow и Sitemap;
  • устаревшие или второстепенные директивы, такие как Crawl-delay, Host, Clean-param, Request-rate и Visit-time;
  • словарь эпохи AI, включая Content-Signal, llms.txt, AI, LLM, machine learning, TDM и 2019/790;
  • юридическую лексику, такую как copyright, terms of service, licensing, permission и формулировки о сохранении прав;
  • отношение к поисковым краулерам: Googlebot, Bingbot, DuckDuckBot, Slurp, Baiduspider и YandexBot.

Также в отчете используется простая оценка конфигурационного долга для первичного отбора. Она объединяет размер файла, количество user-agent'ов, количество Disallow, количество Allow, число нестандартных директив и смесь AI-политики с юридической лексикой. Эта оценка не претендует на универсальную меру корректности. Она нужна, чтобы выявлять файлы, которые, скорее всего, трудно поддерживать, проверять и интерпретировать.

Все производные таблицы и графики включены в папку с поставкой.


Наблюдение 1: Медианный файл прост; хвост — нет

Типичный файл robots.txt в верхнем сегменте веба по-прежнему маленький.

robots-txt-analysis-may-2026.webp

Среди 6,638 читаемых файлов:

МетрикаМедианаP90P95P99Макс.
Размер файла834 байта6.7 КБ15.8 КБ76.0 КБ248.3 КБ
Строки312383321,0084,998
Активные строки231982828374,998
Директивы User-agent12139137823
Директивы Disallow91031764224,997
Директивы Allow1173369890

Такое распределение важно, потому что о robots.txt часто говорят так, будто это короткая декларация:

User-agent: *
Disallow: /private/

Для заметной доли высоконагруженного веба эта ментальная модель неверна.

В этом наборе данных:

robots-txt-complexity-thresholds.webp

Порог сложностиСайты
robots.txt размером не меньше 5 КБ1,005
Не меньше 20 КБ273
Не меньше 100 КБ28
Не менее 50 директив User-agent240
Не менее 100 директив User-agent110
Не менее 100 директив Disallow707
Не менее 1,000 директив Disallow13
Не менее 100 директив Allow40

Самые большие и сложные файлы — это не академические курьезы. Они принадлежат реальным, высоконагруженным площадкам:

ДоменРангКатегорияБайтыUser-agentDisallowAllow
linkedin.com17social114,341764,184281
runescape.com5,226unknown113,39314,9970
academia.edu832academia57,384632,044227
etsy.com286ecommerce51,32031,621120
thepaper.cn9,395news56,86711,4960
opentable.com4,137unknown70,494321,683176
alfabank.ru2,625finance73,15821,566133

Эти файлы больше похожи на продакшен-таблицы маршрутизации, чем на лозунги политики. В них закодированы годы запуска продуктов, устаревшие пути, шаблоны блокировки параметров, исключения для краулеров, SEO-эксперименты, решения CDN и теперь еще и правила для AI-краулеров.

Хвост — это не только история про AI. Из 273 файлов размером от 20 КБ и выше 131 содержат язык AI-политики, а 142 — нет. Из 707 файлов с минимум 100 директивами Disallow лишь 207 содержат AI-политику. Иными словами, AI не создал проблему больших файлов. Он пришел после многих лет обычной веб-операционной деятельности, которая уже заполнила файл правилами путей, ссылками на карты сайта и исключениями для краулеров.

Это важно, потому что поддерживаемость зависит от формы, а не только от намерения. Небольшой файл с прямым AI-блоком легко проверять. Файл на 70 КБ у e-commerce или travel-проекта может быть трудно проверить, даже если в нем вообще нет ничего про AI. Риск не в том, что каждый большой файл неправильный. Риск в том, что фактическая политика становится слишком сложной для проверки теми, кто за нее отвечает.

Операционный риск прост: по мере роста robots.txt становится все труднее ответить на базовый вопрос — что этот файл на самом деле разрешает?

Теперь этот вопрос уже не тривиален. При разборе в стиле RFC краулер может выбрать более специфическую группу user-agent вместо User-agent: *; более длинные совпадения по пути могут иметь приоритет над более короткими; директивы Allow и Disallow взаимодействуют по правилам приоритета; а универсальные правила запрета могут случайно захватывать новых краулеров, которых еще не существовало на момент написания файла.

Для файла на 30 строк человек еще может в этом разобраться. Для файла на 4,000 строк с десятками именованных ботов — уже никто не должен.


Наблюдение 2: robots.txt несет больше, чем правила краулинга

Спор вокруг AI-краулеров сделал robots.txt политически заметным, но сам файл и раньше обрастал несвязанными обязанностями.

Современный robots.txt для крупного сайта может включать:

  • управление путями для краулера;
  • обнаружение карты сайта;
  • расширения, специфичные для поисковых систем;
  • намеки на частоту краулинга;
  • подсказки по канонизации хоста;
  • подсказки по очистке параметров URL;
  • словарь политик, внедренный CDN;
  • текст о сохранении авторских прав;
  • отказы от использования для обучения AI;
  • комментарии в человеческом, а не машинном, стиле.

Набор данных хорошо показывает этот слой за слоем.

СигналФайлыДоля читаемых файлов
Crawl-delay68510.3%
Host3034.6%
Clean-param2003.0%
Content-Signal2714.1%
Request-rate90.1%
Visit-time50.1%
Упоминание llms.txt831.3%
Язык об авторских правах, условиях, лицензировании или разрешениях71910.8%
Язык AI-политики1,37720.7%

Некоторые из этих директив хорошо распознаются конкретными краулерами. Некоторые — наследие старых практик. Некоторые — специфичны для вендора. А некоторые вообще не являются директивами краулера, а представляют собой юридический или продуктовый текст в комментариях.

Вот так и выглядит расползание протокола.

Crawl-delay — полезный пример. Он знаком многим операторам сайтов, но поддержка у крупных краулеров неоднородна. Host и Clean-param исторически связаны с поведением Yandex. Content-Signal — часть словаря AI-эры Cloudflare. llms.txt — предложенный соседний формат обнаружения, а не повсеместно признанный стандарт. И все это встречается в одном и том же типе файла, зачастую рядом с классическими правилами User-agent и Disallow.

Числа также показывают, как старые и новые соглашения сосуществуют сегодня. Crawl-delay встречается в 685 файлах — это более чем вдвое больше, чем 271 файл с Content-Signal. Host есть в 303 файлах, а Clean-param — в 200, что в основном отражает conventions поисковой эпохи. llms.txt, несмотря на активное обсуждение в AI-search среде, упоминается лишь в 83 читаемых файлах. Живой веб не сходится к одному словарю. Он складывает словари друг на друга.

Проблема не в том, что какое-то одно расширение неверно. Проблема в том, что файл стал невоспроизводимым контейнером для нескольких пересекающихся систем управления.

Это создает три вида долга:

  1. Семантический долг. Разные краулеры могут по-разному интерпретировать один и тот же файл.
  2. Долг владения. У SEO, legal, инфраструктуры, безопасности и продуктовых команд могут быть свои причины править файл, но не быть одной команды, которая владеет всей политикой.
  3. Долг аудита. Сайт может публиковать политику, которая выглядит осознанной, хотя фактическое поведение способен определить только парсер.

AI делает это еще важнее, потому что ставки изменились. Когда игнорируется устаревший намек на частоту краулинга, результатом может быть лишь лишний трафик. Когда формулировка отказа от AI-обучения неоднозначна, это уже может стать доказательством в споре об авторских правах или лицензировании.


Наблюдение 3: Файл стал одновременно машинным интерфейсом и юридическим артефактом

В исходном отчете про AI-краулеров было показано, что у 17.0% анализируемых сайтов были явные правила, ориентированные на AI. Это продолжение смотрит на текстовую нагрузку, которую такие политики добавляют.

protocol-drift-signals-chart.webp

Среди 6,638 читаемых файлов robots.txt:

  • 1,377 содержат язык AI-политики;
  • 719 содержат язык об авторских правах, условиях, лицензировании, правах или разрешениях;
  • 271 содержат Content-Signal;
  • 83 упоминают llms.txt.

Самое интересное — это пересечение:

ai-policy-legal-rights-language-overlap.webp

Текстовый паттернФайлы
Язык AI-политики и юридический/правовой язык501
Язык AI-политики без юридического/правового языка876
Юридический/правовой язык без языка AI-политики218
Content-Signal с юридическим/правовым языком242
Явный AI-блок с юридическим/правовым языком424

Это уже новый тип файла.

Классический robots.txt адресован краулерам. robots.txt с юридическим прологом адресован минимум четырем аудиториям одновременно:

  • операторам краулеров, которым нужны машинно-читаемые директивы;
  • поставщикам поиска и AI, которым нужны сигналы политики;
  • юристам, которым нужно явное сохранение прав;
  • будущим аудиторам, судам или журналистам, которые могут читать комментарии как доказательство намерения.

Именно этот многослойный адресат объясняет, почему некоторые файлы теперь читаются как полноценные документы политики. Но это же и ослабляет четкое разделение между тем, что может разобрать краулер, и тем, что хочет декларировать человек-юрист.

876 файлов с AI-языком, но без юридической лексики, — это в основном машинно-политические файлы: имена ботов, блоки Disallow и шаблонные формулировки. 501 файл с и AI-, и юридическим языком — другое дело. Они одновременно пытаются быть инструкцией для краулера и оговоркой о правах. 218 файлов с юридическим языком, но без AI-лексики, показывают, что эта практика началась не с LLM; robots.txt уже использовался как место для обозначения условий, границ разрешений и претензий на права.

Например, комментарий может говорить, что машинное обучение запрещено, в то время как фактический блок директив лишь закрывает часть известных user-agent'ов. Сайт может заявлять права глобально, но называть лишь несколько краулеров. Шаблон CDN может внедрить AI-лексику в файл, текст которого оператор никогда не писал вручную. Сайт может задать широкое правило User-agent: *, которое случайно блокирует будущие краулеры.

С точки зрения управления robots.txt стал привлекательным именно потому, что он публичный и машинно-читаемый. Но чем больше политики он несет, тем важнее становятся его ограничения:

  • Нет слоя аутентификации, который доказывал бы, что конкретная политика была просмотрена правообладателем, а не унаследована от инфраструктуры.
  • Нет встроенной истории версий.
  • Нет структурированного поля для предполагаемого использования: обучение, retrieval, поисковая индексация, суммаризация, кэширование или оценка модели.
  • Нет универсального реестра идентичностей AI-краулеров.
  • Нет механизма принуждения к исполнению.

Это не делает файл бесполезным. Это делает его хрупким.

Более точная интерпретация такова: robots.txt превращается в слой уведомления — публичную, проверяемую декларацию предпочтений и намерений. Но сам по себе он не является полноценной системой управления правами.


Наблюдение 4: Поиск был неравным еще до прихода AI

Один из самых сильных выводов исходного отчета заключался в том, что многие издатели различают AI-краулеры для обучения и поисковые краулеры. Они блокируют CCBot, GPTBot или Google-Extended, но сохраняют видимость в Google Search.

Это продолжение добавляет другой аспект: традиционные поисковые краулеры тоже не равны друг другу.

Мы проверили шесть поисковых краулеров:

  • Googlebot;
  • Bingbot;
  • DuckDuckBot;
  • Slurp;
  • Baiduspider;
  • YandexBot.

Среди 7,248 анализируемых сайтов:

Тип отношения к поисковым краулерамСайты
Блокирует хотя бы один поисковый краулер562
Разрешает Googlebot, но блокирует хотя бы один другой поисковый краулер404
Блокирует все шесть проверенных поисковых краулеров152

Количество заблокированных ботов распределено неравномерно:

search-crawler-hierarchy.webp

Поисковый краулерСайтов, блокирующих его
Baiduspider424
YandexBot393
Slurp255
DuckDuckBot231
Bingbot204
Googlebot158

Googlebot — наименее часто блокируемый краулер в этой выборке. Baiduspider и YandexBot блокируются заметно чаще, и в большинстве этих случаев Googlebot остается разрешенным. Среди 404 сайтов, которые разрешают Googlebot, но блокируют другой поисковый краулер, 269 блокируют Baiduspider, а 240 — YandexBot.

Примеры известные:

ДоменЗаблокированные поисковые краулеры при разрешенном Googlebot
facebook.comBaiduspider, YandexBot
apple.comBaiduspider
twitter.comDuckDuckBot, Slurp, Baiduspider, YandexBot
netflix.comDuckDuckBot, Slurp
x.comDuckDuckBot, Slurp, Baiduspider, YandexBot
tiktok.comBaiduspider
baidu.comBingbot, DuckDuckBot, Slurp, YandexBot
washingtonpost.comYandexBot
wsj.comYandexBot
bilibili.comDuckDuckBot, Slurp, YandexBot
temu.comSlurp
t-mobile.comBaiduspider, YandexBot

Это важно для дискуссии об AI, потому что показывает: robots.txt не был нейтральным протоколом всеобщего доступа даже до появления LLM-краулеров. У публичного веба уже была иерархия:

  • Googlebot часто сохраняют, потому что трафик из Google слишком ценен, чтобы рисковать им.
  • Региональные или конкурирующие краулеры блокируются легче.
  • Некоторые сайты рассматривают доступ поисковых краулеров как решение по рынкам или по вендорам.

AI-краулеры пришли в экосистему, где дифференцированный доступ уже был нормой.

Так легче понять переход к новой политике. Когда издатель пишет «блокировать Google-Extended, разрешить Googlebot», он не изобретает новую форму дискриминации. Он переносит старый паттерн на новый класс краулеров: сохранить дистрибуцию, ограничить извлечение.

Открытый вопрос в том, масштабируется ли этот старый паттерн. В поиске было всего несколько экономически важных краулеров. В AI идентичность краулеров фрагментирована между вендорами моделей, retrieval-ботами, брокерами данных, академическими краулерами, синтетическими browser agents и инфраструктурными fetcher'ами. Число именованных user-agent'ов будет расти, если экосистема не сведет все к меньшему набору сигналов, основанных на цели использования.

Вот так и накапливается конфигурационный долг.


Наблюдение 5: Сложность различается по секторам, но не так, как уровень блокировки AI

В исходном отчете был показан большой разброс по секторам в блокировке AI: news блокирует часто; telecom, government и SaaS — редко.

Конфигурационная сложность режет веб по-другому.

Среди выбранных категорий, где было достаточно читаемых файлов robots.txt для полезного сравнения:

КатегорияnМедиана байтовP90 байтовМедиана DisallowP90 DisallowМедиана User-agentP90 User-agent
ecommerce2151,73810,38837164349
travel632,07427,36841779534
news6471,5347,03919114668
finance1211,0028,33717132223
academia2538393,9591475111
government1511,2273,263134614
SaaS36848512,606456110
dev tools1192739,255358110

P90 Disallow by category chart here<<<<<<<<<<<<<<<<<<<<<<<<<

News сложен политически, потому что в нем есть явные правила для AI и юридический текст. Но ecommerce и travel сложны операционно, потому что у них большие каталоги, фасетная навигация, страницы результатов поиска, фильтры, пути аккаунтов и параметризованные URL.

Это различие важно.

Travel — самый наглядный пример. В этой категории всего 63 читаемых файла, но P90 robots.txt здесь 27.4 КБ, а P90 по Disallow — 779, что намного выше news. Это не означает, что у travel-сайтов более развитая AI-политика. Это означает, что у них больше поверхностей, на которых краулер может зря тратить бюджет: поиск по датам, страницы доступности, пагинация отзывов, бронирование, комбинации фильтров и локализованные пути инвентаря.

SaaS — противоположный сюрприз. Медианный файл здесь всего 485 байт, но P90 подскакивает до 12.6 КБ. Большинство SaaS-сайтов открыты и легки, но у меньшей части есть длинные файлы контроля путей, часто потому, что документация, логин, маршруты приложения и маркетинговые страницы живут под одним доменом.

News занимает середину по операционной сложности, но ближе к вершине по политической. У него P90 по User-agent равен 68 — выше, чем у ecommerce, travel, finance, academia, government, SaaS и dev tools в этой таблице. Это признак политики, завязанной на конкретных ботах, а не только на гигиене путей.

Файл robots.txt у издателя может быть сложным из-за правовой политики. У маркетплейса — из-за управления crawl budget. У университета — из-за тысяч унаследованных путей в одном домене. У социальной платформы — потому что ей нужно одновременно открывать одни поверхности и скрывать другие в огромном масштабе.

AI-политика ложится поверх всего этого. Она не заменяет существующие причины сложности файла.

Это помогает объяснить, почему управление robots.txt в AI-эпоху нельзя решить универсальным списком блокировок. Базовые файлы решают разные задачи:

  • ecommerce управляет дублирующимися путями и страницами каталога;
  • travel управляет списками, календарями, отзывами и динамическими страницами поиска;
  • news управляет авторскими правами, архивами и лицензионной позицией;
  • SaaS и dev-tools часто хотят видимости в AI;
  • государственным сайтам нужен публичный доступ, но при этом им приходится исключать чувствительные системы;
  • социальные платформы управляют пользовательским контентом, профилями и рисками злоупотреблений.

Один и тот же AI-правило для краулера означает разное в каждой из этих сред.


Наблюдение 6: Индекс конфигурационного долга выявляет риск проверки, а не моральную ошибку

Для этого анализа был создан простой score конфигурационного долга, чтобы выделять файлы robots.txt, которые, вероятно, трудно проверять.

Score учитывает:

  • размер файла;
  • число директив User-agent;
  • число директив Disallow;
  • число директив Allow;
  • число второстепенных директив;
  • наличие языка AI-политики;
  • сочетание явной блокировки AI и юридического или авторско-правового языка.

Это не score корректности. Файл с высокой сложностью может быть полностью осознанным. Файл с низкой сложностью тоже может быть неправильным. Задача здесь — первичный отбор: если файл большой, перегружен политикой, ориентирован на отдельных ботов и полон исключений, он заслуживает более строгой дисциплины проверки.

configuration-debt-review-queue.webp

Распределение score резкое. Медианный читаемый файл получает 1.74. P90 — 13.29, P95 — 15.00, P99 — 27.57. Только 366 файлов имеют score не ниже 15, 80 — не ниже 25, а 41 — не ниже 30. Это и есть практическая очередь на ревью: не каждому сайту нужен governance-проект, но верхнему хвосту — нужен.

Вид по категориям тоже показывает, почему ярлык «AI-blocker» слишком грубый:

КатегорияМедианный scoreP90 score
travel4.9228.94
search2.9724.23
social2.2515.00
news4.9114.92
finance1.6712.61
SaaS0.9811.85
ecommerce3.8810.87
government1.576.38

Travel и search имеют самые высокие P90, потому что небольшая доля файлов становится очень большой и очень насыщенной правилами. News имеет одну из самых высоких медиан, потому что язык политики и бот-специфическая обработка встречаются в этой категории чаще. Ecommerce имеет высокую медиану Disallow, но его P90 по долгу ниже, чем у travel, потому что сложность там больше сосредоточена в path-правилах, а не в смешанном политико-юридическом слое.

Самые высоко оцененные файлы в этой выборке включают:

ДоменПочему score высокий
linkedin.comОчень большой файл, тысячи правил путей, много именованных user-agent'ов, явный язык AI-политики
lnkd.inТа же поверхность политики, что и у инфраструктуры коротких ссылок LinkedIn
fragrantica.comСотни блоков по именованным user-agent'ам плюс язык AI-политики
sovcombank.ruСотни блоков user-agent и юридический/политический язык
academia.eduБольшая матрица allow/disallow и явная политика блокировки AI
opentable.comБольшой набор правил путей, много директив sitemap, AI-связанная политическая поверхность
etsy.comБольшой e-commerce файл контроля путей с более чем 1,600 правилами Disallow
runescape.comПочти 5,000 директив Disallow под одной группой user-agent

Над ними не стоит смеяться за сложность. Часто она отражает реальные бизнес-потребности. Но именно они показывают, почему политике robots.txt нужна та же инженерная дисциплина, что и другой продакшен-конфигурации:

  • владение должно быть явным;
  • изменения должны проходить ревью;
  • сгенерированные разделы должны быть помечены;
  • юридические комментарии, где возможно, нужно отделять от машинных директив;
  • тест-кейсы должны проверять ожидаемый доступ ботов для критичных краулеров;
  • история версий должна сохраняться;
  • старые имена ботов должны быть выведены из использования или задокументированы;
  • обучение AI, retrieval AI, поисковая индексация и архивирование должны рассматриваться как разные цели.

Последний пункт — самый важный. Текущая грамматика строится вокруг user-agent: она просит операторов сайтов называть ботов. Потребность AI-эпохи — строить политику вокруг цели: она просит операторов сайтов указывать, какие именно использования разрешены.

Это не одно и то же.

Из-за этого несовпадения длинные списки блокировок не будут жить долго. Сегодня издатель может добавить GPTBot, ClaudeBot, CCBot, Google-Extended, Bytespider, Applebot-Extended и PerplexityBot, но завтра появится новое имя краулера, retrieval-агент или брокер датасетов. Политика, основанная на цели, позволила бы сайту сказать: «поисковая индексация — да, обучение AI — нет, извлечение по запросу пользователя — возможно», не превращая robots.txt в адресную книгу ботов.


Что это значит для AI-управления

Публичная дискуссия часто описывает robots.txt как либо значимый, либо устаревший. Данные подсказывают более практичный ответ:

robots.txt значим, но перегружен.

Он значим, потому что крупные сайты его используют, краулеры умеют его читать, а решения по политике видны исследователям, журналистам, вендорам и судам. Исходный отчет показал, что у 17.0% анализируемых топ-сайтов были сознательные AI-специфические правила. Это не символический шум.

Он перегружен, потому что теперь файл должен выражать больше, чем просто доступ бота:

  • «Не обучайте на этом контенте.»
  • «Вы можете использовать этот контент для поисковой индексации.»
  • «Вы можете использовать этот контент для live retrieval.»
  • «Вы не можете создавать кэшированные датасеты.»
  • «Эта юридическая оговорка действует в рамках европейского закона о text and data mining.»
  • «Этот сайт, управляемый CDN, отправляет Content-Signal: ai-train=no
  • «Этот сайт хочет Googlebot, но не YandexBot.»
  • «У этого сайта есть 1,000 устаревших URL-путей, которые не должны краулиться.»

Грамматика не была рассчитана на столько задач.

Снизить долг могли бы три изменения:

  1. Идентичности краулеров нужен реестр. Операторам сайтов не нужно вручную поддерживать бесконечно растущий список GPTBot, ClaudeBot, anthropic-ai, CCBot, Google-Extended, Applebot-Extended, Bytespider, OAI-SearchBot, ChatGPT-User и многих других. Без реестра политика всегда будет отставать от поведения краулеров.

  2. Использование AI нуждается в структурированном словаре. Обучение, retrieval, индексация, суммаризация, перепродажа датасетов, оценка модели и браузинг, инициированный пользователем, — это разные применения. Выражать их через имена user-agent'ов отдельных вендоров слишком хрупко.

  3. Политике нужна возможность аудита. Вебу нужен способ отличать вручную написанные оговорки о правах от унаследованных шаблонов CDN, сгенерированных CMS, устаревших правил и случайных catch-all блокировок. Это важно и для доверия, и для судебных споров.

Все это не означает, что robots.txt нужно немедленно заменить. Лучший путь — наслоение: оставить robots.txt как поверхность обнаружения и совместимости, но стандартизировать соседнюю машинно-читаемую политику для AI-специфических сценариев.

llms.txt — одна из попыток, но в этом наборе данных его распространенность пока минимальна: лишь 83 читаемых файла его упоминают. Content-Signal заметнее, потому что Cloudflare может распространять его через инфраструктуру, и все 271 файла с Content-Signal в этом сканировании также содержали язык AI-политики. Но распространенность — это не то же самое, что консенсус. Для устойчивого решения, вероятно, нужна скучная, но надежная стандартизация: четкие поля, четкая семантика, обязательства краулеров и публичные тестовые наборы.


Заключение

Борьба вокруг AI-краулеров превратила robots.txt в артефакт управления. Это и полезно, и рискованно.

Полезно — потому что файл публичный. Исследователи могут его проверять. Издатели могут его менять. Краулеры могут его соблюдать. Суды могут его читать. Провайдеры инфраструктуры могут разворачивать его в масштабе.

Рискованно — потому что он несет слишком много.

Медианный файл robots.txt в Tranco Top 10K по-прежнему достаточно мал, чтобы его можно было понять. Но длинный хвост высоконагруженного веба полон больших, старых, многослойных, вендор-специфичных и юридически нагруженных файлов. Сотни сайтов теперь поддерживают конфигурации robots.txt, которые лучше понимать как производственные системы политики, а не как простые подсказки для краулера.

Главный урок не в том, что robots.txt провалился. А в том, что веб продвинул его наверх, не рефакторя.

Если политика доступа для AI будет опираться на машинно-читаемые публичные декларации, следующий шаг — это не еще один более длинный список блокировок. Это лучшая инфраструктура политики: разрешения, основанные на целях; стабильная идентичность краулера; шаблоны, пригодные для ревью; и трассируемость изменений.

До тех пор слой управления AI в публичном вебе будет по-прежнему держаться на текстовом файле, который никогда не должен был нести такую нагрузку.


Примечания по воспроизводимости

В папке с поставкой находятся:

  • source_data/analysis.json — исходные агрегированные метрики.
  • source_data/site_meta.csv — исходная аналитическая таблица по сайтам.
  • source_data/bot_status.csv — исходная таблица политики по доменам и ботам.
  • source_data/fetch_meta.csv — исходные метаданные загрузки.
  • source_data/sites.csv — исходная таблица доменов, категорий и статусов.
  • derived_data/robots_complexity_by_site.csv — метрики сложности по сайтам, сгенерированные для этого отчета.
  • derived_data/search_bot_treatment.csv — матрица отношения к поисковым краулерам.
  • derived_data/category_complexity_summary.csv — сводка сложности по категориям.
  • derived_data/top_config_debt_sites.csv — топ сайтов по score первичного отбора, описанному выше.
  • derived_data/summary_metrics.json — все ключевые метрики, упомянутые в этом отчете.

Скачать все скрипты и наборы данных


Исправления методологии, замечания по набору данных и предложения по последующему анализу можно отправлять на support@thunderbit.com. Этот отчет опубликован независимо от любой коммерческой позиции Thunderbit; мы создаем AI-powered web scraper и имеем структурный интерес в том, чтобы robots.txt и дальше оставался значимым, машинно-читаемым договором в публичном вебе. Данные в этом отчете говорят сами за себя. — Исследовательская команда Thunderbit, май 2026.

Попробуйте Thunderbit для AI-скрейпинга веба Get Started Free

Shuai Guan
Shuai Guan
Генеральный директор Thunderbit | Эксперт по автоматизации данных с помощью ИИ Shuai Guan — генеральный директор Thunderbit и выпускник инженерного факультета Мичиганского университета. Опираясь почти на десятилетний опыт в сфере технологий и SaaS-архитектуры, он специализируется на том, чтобы превращать сложные модели ИИ в практичные no-code инструменты для извлечения данных. В этом блоге он делится честными, проверенными в деле инсайтами о веб-скрейпинге и стратегиях автоматизации, чтобы помочь вам выстраивать более умные, data-driven рабочие процессы. Когда он не занимается оптимизацией потоков данных, тот же внимательный подход к деталям он переносит в своё увлечение фотографией.
Содержание

Собирай страницу, просто задав вопрос

Скажи, что тебе нужно, простыми словами. А ещё лучше — ничего не говори.

Попробовать Thunderbit бесплатно
Извлекай данные с помощью ИИ
Легко передавай данные в Google Sheets, Airtable или Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week