Краткое резюме
Предыдущий отчет поднимал политический вопрос: сколько из самых посещаемых сайтов мира говорят AI-краулерам, что им можно и чего нельзя делать?
Этот материал продолжает тему и задает уже операционный вопрос: насколько надежен robots.txt как инфраструктура, на которую сегодня возлагают эту политику?
Ответ не слишком радужный. robots.txt по-прежнему работает, потому что он публичный, дешевый, машинно-читаемый и уже понятен краулерам. Но на него навесили куда больше задач, чем он был рассчитан выполнять изначально. В 2026 году в этом простом текстовом файле могут одновременно жить SEO-ограничения для краулинга, карты сайта, устаревшие расширения поисковых систем, отказы от обучения AI, словарь политик от Cloudflare, оговорки об авторских правах и юридические формулировки на случай будущих споров.
Это и есть конфигурационный долг.
В основе этого отчета лежит тот же краулинг Tranco Top 10,000, что и в исходном исследовании AI-краулеров. Из 10,000 доменов 6,638 вернули читаемый robots.txt; еще 610 вернули 404, что по протоколу считается неявным разрешением. В итоге для анализа доступа ботов есть 7,248 сайтов, а для анализа сложности конфигурации — 6,638 реальных файлов.
Особенно выделяются шесть наблюдений:
-
Большинство файлов
robots.txtочень маленькие, но правый хвост крайне сложен. Медианный файл занимает всего 834 байта и 31 строку. Но 1,005 файлов весят не меньше 5 КБ, 273 — не меньше 20 КБ, а 28 — не меньше 100 КБ. Самый большой файл в выборке — 248 КБ. -
Сотни крупных сайтов используют файлы, которые больше похожи на продакшен-конфигурацию, чем на краткие примечания к политике. Медианный файл содержит 9 директив
Disallow. Но у 707 сайтов есть как минимум 100 правилDisallow, у 13 — как минимум 1,000, у 240 указано не менее 50 user-agent'ов, а у 110 — не менее 100 user-agent'ов. -
Отклонение от протокола — не теория. Среди 6,638 читаемых файлов 685 содержат
Crawl-delay, 303 —Host, 200 —Clean-param, 9 —Request-rate, 5 —Visit-time, а 271 используют язык в стиле CloudflareContent-Signal. Не все это части одного аккуратного стандарта. Это накопившийся краулерный фольклор. -
К Googlebot относятся как к особому гражданину. 562 анализируемых домена блокируют как минимум одного традиционного поискового краулера. В 404 из этих случаев Googlebot разрешен, хотя бы один другой поисковый краулер — заблокирован. Дискриминация AI-краулеров не возникла в нейтральной среде;
robots.txtуже был носителем иерархии поисковых систем. -
AI-политика делает этот долг более заметным. 1,377 читаемых файлов содержат язык, связанный с AI-политикой; 719 — язык об авторских правах, условиях использования, лицензировании или разрешениях; а 501 — и то и другое. Файл стал одновременно машинным интерфейсом и юридическим артефактом. Это полезно, но хрупко.
-
Самые рискованные файлы — не всегда самые анти-AI. В e-commerce, travel, social, finance, academia и news сложность файлов возникает по разным причинам: контроль crawl budget, устаревшие пути, пользовательский контент, оговорки о правах и исключения для отдельных ботов. На и без того запутанную основу накладываются новые AI-правила.
Главный вывод: robots.txt остается важнейшей публичной поверхностью для политики краулинга в вебе, но это слабый фундамент для серьезного AI-управления, если экосистема не стандартизирует идентичность краулеров, словарь использования AI и возможность аудита политики.
Методология
В этом отчете повторно используется набор данных из исходного анализа Thunderbit по политике AI-краулеров на доменах Tranco Top 10,000.
Использовались следующие исходные материалы:
tranco_top10k.csv— исходный список из 10,000 доменов Tranco.out/fetch_meta.csv— статус загрузки, количество байтов, схема, результат редиректа и метаданные ошибок.out/sites.csv— домен, ранг, категория, язык и статусrobots.txt.out/site_meta.csv— одна аналитическая строка на сайт, включая класс шаблона, флаги блокировки AI, размер файла и сводные поля политики ботов.out/bot_status.csv— одна строка на домен и краулер, включая факт блокировки этого бота и наличие конкретного правила.raw_robots/— кэшированные телаrobots.txtдля 6,638 сайтов, вернувших статус200.
Для этого продолжения каждый читаемый файл robots.txt проверялся на:
- размер файла и количество строк;
- активные строки без комментариев;
- количество директив
User-agent,Disallow,AllowиSitemap; - устаревшие или второстепенные директивы, такие как
Crawl-delay,Host,Clean-param,Request-rateиVisit-time; - словарь эпохи AI, включая
Content-Signal,llms.txt, AI, LLM, machine learning, TDM и2019/790; - юридическую лексику, такую как copyright, terms of service, licensing, permission и формулировки о сохранении прав;
- отношение к поисковым краулерам: Googlebot, Bingbot, DuckDuckBot, Slurp, Baiduspider и YandexBot.
Также в отчете используется простая оценка конфигурационного долга для первичного отбора. Она объединяет размер файла, количество user-agent'ов, количество Disallow, количество Allow, число нестандартных директив и смесь AI-политики с юридической лексикой. Эта оценка не претендует на универсальную меру корректности. Она нужна, чтобы выявлять файлы, которые, скорее всего, трудно поддерживать, проверять и интерпретировать.
Все производные таблицы и графики включены в папку с поставкой.
Наблюдение 1: Медианный файл прост; хвост — нет
Типичный файл robots.txt в верхнем сегменте веба по-прежнему маленький.

Среди 6,638 читаемых файлов:
| Метрика | Медиана | P90 | P95 | P99 | Макс. |
|---|---|---|---|---|---|
| Размер файла | 834 байта | 6.7 КБ | 15.8 КБ | 76.0 КБ | 248.3 КБ |
| Строки | 31 | 238 | 332 | 1,008 | 4,998 |
| Активные строки | 23 | 198 | 282 | 837 | 4,998 |
Директивы User-agent | 1 | 21 | 39 | 137 | 823 |
Директивы Disallow | 9 | 103 | 176 | 422 | 4,997 |
Директивы Allow | 1 | 17 | 33 | 69 | 890 |
Такое распределение важно, потому что о robots.txt часто говорят так, будто это короткая декларация:
User-agent: *
Disallow: /private/
Для заметной доли высоконагруженного веба эта ментальная модель неверна.
В этом наборе данных:

| Порог сложности | Сайты |
|---|---|
robots.txt размером не меньше 5 КБ | 1,005 |
| Не меньше 20 КБ | 273 |
| Не меньше 100 КБ | 28 |
Не менее 50 директив User-agent | 240 |
Не менее 100 директив User-agent | 110 |
Не менее 100 директив Disallow | 707 |
Не менее 1,000 директив Disallow | 13 |
Не менее 100 директив Allow | 40 |
Самые большие и сложные файлы — это не академические курьезы. Они принадлежат реальным, высоконагруженным площадкам:
| Домен | Ранг | Категория | Байты | User-agent | Disallow | Allow |
|---|---|---|---|---|---|---|
linkedin.com | 17 | social | 114,341 | 76 | 4,184 | 281 |
runescape.com | 5,226 | unknown | 113,393 | 1 | 4,997 | 0 |
academia.edu | 832 | academia | 57,384 | 63 | 2,044 | 227 |
etsy.com | 286 | ecommerce | 51,320 | 3 | 1,621 | 120 |
thepaper.cn | 9,395 | news | 56,867 | 1 | 1,496 | 0 |
opentable.com | 4,137 | unknown | 70,494 | 32 | 1,683 | 176 |
alfabank.ru | 2,625 | finance | 73,158 | 2 | 1,566 | 133 |
Эти файлы больше похожи на продакшен-таблицы маршрутизации, чем на лозунги политики. В них закодированы годы запуска продуктов, устаревшие пути, шаблоны блокировки параметров, исключения для краулеров, SEO-эксперименты, решения CDN и теперь еще и правила для AI-краулеров.
Хвост — это не только история про AI. Из 273 файлов размером от 20 КБ и выше 131 содержат язык AI-политики, а 142 — нет. Из 707 файлов с минимум 100 директивами Disallow лишь 207 содержат AI-политику. Иными словами, AI не создал проблему больших файлов. Он пришел после многих лет обычной веб-операционной деятельности, которая уже заполнила файл правилами путей, ссылками на карты сайта и исключениями для краулеров.
Это важно, потому что поддерживаемость зависит от формы, а не только от намерения. Небольшой файл с прямым AI-блоком легко проверять. Файл на 70 КБ у e-commerce или travel-проекта может быть трудно проверить, даже если в нем вообще нет ничего про AI. Риск не в том, что каждый большой файл неправильный. Риск в том, что фактическая политика становится слишком сложной для проверки теми, кто за нее отвечает.
Операционный риск прост: по мере роста robots.txt становится все труднее ответить на базовый вопрос — что этот файл на самом деле разрешает?
Теперь этот вопрос уже не тривиален. При разборе в стиле RFC краулер может выбрать более специфическую группу user-agent вместо User-agent: *; более длинные совпадения по пути могут иметь приоритет над более короткими; директивы Allow и Disallow взаимодействуют по правилам приоритета; а универсальные правила запрета могут случайно захватывать новых краулеров, которых еще не существовало на момент написания файла.
Для файла на 30 строк человек еще может в этом разобраться. Для файла на 4,000 строк с десятками именованных ботов — уже никто не должен.
Наблюдение 2: robots.txt несет больше, чем правила краулинга
Спор вокруг AI-краулеров сделал robots.txt политически заметным, но сам файл и раньше обрастал несвязанными обязанностями.
Современный robots.txt для крупного сайта может включать:
- управление путями для краулера;
- обнаружение карты сайта;
- расширения, специфичные для поисковых систем;
- намеки на частоту краулинга;
- подсказки по канонизации хоста;
- подсказки по очистке параметров URL;
- словарь политик, внедренный CDN;
- текст о сохранении авторских прав;
- отказы от использования для обучения AI;
- комментарии в человеческом, а не машинном, стиле.
Набор данных хорошо показывает этот слой за слоем.
| Сигнал | Файлы | Доля читаемых файлов |
|---|---|---|
Crawl-delay | 685 | 10.3% |
Host | 303 | 4.6% |
Clean-param | 200 | 3.0% |
Content-Signal | 271 | 4.1% |
Request-rate | 9 | 0.1% |
Visit-time | 5 | 0.1% |
Упоминание llms.txt | 83 | 1.3% |
| Язык об авторских правах, условиях, лицензировании или разрешениях | 719 | 10.8% |
| Язык AI-политики | 1,377 | 20.7% |
Некоторые из этих директив хорошо распознаются конкретными краулерами. Некоторые — наследие старых практик. Некоторые — специфичны для вендора. А некоторые вообще не являются директивами краулера, а представляют собой юридический или продуктовый текст в комментариях.
Вот так и выглядит расползание протокола.
Crawl-delay — полезный пример. Он знаком многим операторам сайтов, но поддержка у крупных краулеров неоднородна. Host и Clean-param исторически связаны с поведением Yandex. Content-Signal — часть словаря AI-эры Cloudflare. llms.txt — предложенный соседний формат обнаружения, а не повсеместно признанный стандарт. И все это встречается в одном и том же типе файла, зачастую рядом с классическими правилами User-agent и Disallow.
Числа также показывают, как старые и новые соглашения сосуществуют сегодня. Crawl-delay встречается в 685 файлах — это более чем вдвое больше, чем 271 файл с Content-Signal. Host есть в 303 файлах, а Clean-param — в 200, что в основном отражает conventions поисковой эпохи. llms.txt, несмотря на активное обсуждение в AI-search среде, упоминается лишь в 83 читаемых файлах. Живой веб не сходится к одному словарю. Он складывает словари друг на друга.
Проблема не в том, что какое-то одно расширение неверно. Проблема в том, что файл стал невоспроизводимым контейнером для нескольких пересекающихся систем управления.
Это создает три вида долга:
- Семантический долг. Разные краулеры могут по-разному интерпретировать один и тот же файл.
- Долг владения. У SEO, legal, инфраструктуры, безопасности и продуктовых команд могут быть свои причины править файл, но не быть одной команды, которая владеет всей политикой.
- Долг аудита. Сайт может публиковать политику, которая выглядит осознанной, хотя фактическое поведение способен определить только парсер.
AI делает это еще важнее, потому что ставки изменились. Когда игнорируется устаревший намек на частоту краулинга, результатом может быть лишь лишний трафик. Когда формулировка отказа от AI-обучения неоднозначна, это уже может стать доказательством в споре об авторских правах или лицензировании.
Наблюдение 3: Файл стал одновременно машинным интерфейсом и юридическим артефактом
В исходном отчете про AI-краулеров было показано, что у 17.0% анализируемых сайтов были явные правила, ориентированные на AI. Это продолжение смотрит на текстовую нагрузку, которую такие политики добавляют.

Среди 6,638 читаемых файлов robots.txt:
- 1,377 содержат язык AI-политики;
- 719 содержат язык об авторских правах, условиях, лицензировании, правах или разрешениях;
- 271 содержат
Content-Signal; - 83 упоминают
llms.txt.
Самое интересное — это пересечение:

| Текстовый паттерн | Файлы |
|---|---|
| Язык AI-политики и юридический/правовой язык | 501 |
| Язык AI-политики без юридического/правового языка | 876 |
| Юридический/правовой язык без языка AI-политики | 218 |
Content-Signal с юридическим/правовым языком | 242 |
| Явный AI-блок с юридическим/правовым языком | 424 |
Это уже новый тип файла.
Классический robots.txt адресован краулерам. robots.txt с юридическим прологом адресован минимум четырем аудиториям одновременно:
- операторам краулеров, которым нужны машинно-читаемые директивы;
- поставщикам поиска и AI, которым нужны сигналы политики;
- юристам, которым нужно явное сохранение прав;
- будущим аудиторам, судам или журналистам, которые могут читать комментарии как доказательство намерения.
Именно этот многослойный адресат объясняет, почему некоторые файлы теперь читаются как полноценные документы политики. Но это же и ослабляет четкое разделение между тем, что может разобрать краулер, и тем, что хочет декларировать человек-юрист.
876 файлов с AI-языком, но без юридической лексики, — это в основном машинно-политические файлы: имена ботов, блоки Disallow и шаблонные формулировки. 501 файл с и AI-, и юридическим языком — другое дело. Они одновременно пытаются быть инструкцией для краулера и оговоркой о правах. 218 файлов с юридическим языком, но без AI-лексики, показывают, что эта практика началась не с LLM; robots.txt уже использовался как место для обозначения условий, границ разрешений и претензий на права.
Например, комментарий может говорить, что машинное обучение запрещено, в то время как фактический блок директив лишь закрывает часть известных user-agent'ов. Сайт может заявлять права глобально, но называть лишь несколько краулеров. Шаблон CDN может внедрить AI-лексику в файл, текст которого оператор никогда не писал вручную. Сайт может задать широкое правило User-agent: *, которое случайно блокирует будущие краулеры.
С точки зрения управления robots.txt стал привлекательным именно потому, что он публичный и машинно-читаемый. Но чем больше политики он несет, тем важнее становятся его ограничения:
- Нет слоя аутентификации, который доказывал бы, что конкретная политика была просмотрена правообладателем, а не унаследована от инфраструктуры.
- Нет встроенной истории версий.
- Нет структурированного поля для предполагаемого использования: обучение, retrieval, поисковая индексация, суммаризация, кэширование или оценка модели.
- Нет универсального реестра идентичностей AI-краулеров.
- Нет механизма принуждения к исполнению.
Это не делает файл бесполезным. Это делает его хрупким.
Более точная интерпретация такова: robots.txt превращается в слой уведомления — публичную, проверяемую декларацию предпочтений и намерений. Но сам по себе он не является полноценной системой управления правами.
Наблюдение 4: Поиск был неравным еще до прихода AI
Один из самых сильных выводов исходного отчета заключался в том, что многие издатели различают AI-краулеры для обучения и поисковые краулеры. Они блокируют CCBot, GPTBot или Google-Extended, но сохраняют видимость в Google Search.
Это продолжение добавляет другой аспект: традиционные поисковые краулеры тоже не равны друг другу.
Мы проверили шесть поисковых краулеров:
- Googlebot;
- Bingbot;
- DuckDuckBot;
- Slurp;
- Baiduspider;
- YandexBot.
Среди 7,248 анализируемых сайтов:
| Тип отношения к поисковым краулерам | Сайты |
|---|---|
| Блокирует хотя бы один поисковый краулер | 562 |
| Разрешает Googlebot, но блокирует хотя бы один другой поисковый краулер | 404 |
| Блокирует все шесть проверенных поисковых краулеров | 152 |
Количество заблокированных ботов распределено неравномерно:

| Поисковый краулер | Сайтов, блокирующих его |
|---|---|
| Baiduspider | 424 |
| YandexBot | 393 |
| Slurp | 255 |
| DuckDuckBot | 231 |
| Bingbot | 204 |
| Googlebot | 158 |
Googlebot — наименее часто блокируемый краулер в этой выборке. Baiduspider и YandexBot блокируются заметно чаще, и в большинстве этих случаев Googlebot остается разрешенным. Среди 404 сайтов, которые разрешают Googlebot, но блокируют другой поисковый краулер, 269 блокируют Baiduspider, а 240 — YandexBot.
Примеры известные:
| Домен | Заблокированные поисковые краулеры при разрешенном Googlebot |
|---|---|
facebook.com | Baiduspider, YandexBot |
apple.com | Baiduspider |
twitter.com | DuckDuckBot, Slurp, Baiduspider, YandexBot |
netflix.com | DuckDuckBot, Slurp |
x.com | DuckDuckBot, Slurp, Baiduspider, YandexBot |
tiktok.com | Baiduspider |
baidu.com | Bingbot, DuckDuckBot, Slurp, YandexBot |
washingtonpost.com | YandexBot |
wsj.com | YandexBot |
bilibili.com | DuckDuckBot, Slurp, YandexBot |
temu.com | Slurp |
t-mobile.com | Baiduspider, YandexBot |
Это важно для дискуссии об AI, потому что показывает: robots.txt не был нейтральным протоколом всеобщего доступа даже до появления LLM-краулеров. У публичного веба уже была иерархия:
- Googlebot часто сохраняют, потому что трафик из Google слишком ценен, чтобы рисковать им.
- Региональные или конкурирующие краулеры блокируются легче.
- Некоторые сайты рассматривают доступ поисковых краулеров как решение по рынкам или по вендорам.
AI-краулеры пришли в экосистему, где дифференцированный доступ уже был нормой.
Так легче понять переход к новой политике. Когда издатель пишет «блокировать Google-Extended, разрешить Googlebot», он не изобретает новую форму дискриминации. Он переносит старый паттерн на новый класс краулеров: сохранить дистрибуцию, ограничить извлечение.
Открытый вопрос в том, масштабируется ли этот старый паттерн. В поиске было всего несколько экономически важных краулеров. В AI идентичность краулеров фрагментирована между вендорами моделей, retrieval-ботами, брокерами данных, академическими краулерами, синтетическими browser agents и инфраструктурными fetcher'ами. Число именованных user-agent'ов будет расти, если экосистема не сведет все к меньшему набору сигналов, основанных на цели использования.
Вот так и накапливается конфигурационный долг.
Наблюдение 5: Сложность различается по секторам, но не так, как уровень блокировки AI
В исходном отчете был показан большой разброс по секторам в блокировке AI: news блокирует часто; telecom, government и SaaS — редко.
Конфигурационная сложность режет веб по-другому.
Среди выбранных категорий, где было достаточно читаемых файлов robots.txt для полезного сравнения:
| Категория | n | Медиана байтов | P90 байтов | Медиана Disallow | P90 Disallow | Медиана User-agent | P90 User-agent |
|---|---|---|---|---|---|---|---|
| ecommerce | 215 | 1,738 | 10,388 | 37 | 164 | 3 | 49 |
| travel | 63 | 2,074 | 27,368 | 41 | 779 | 5 | 34 |
| news | 647 | 1,534 | 7,039 | 19 | 114 | 6 | 68 |
| finance | 121 | 1,002 | 8,337 | 17 | 132 | 2 | 23 |
| academia | 253 | 839 | 3,959 | 14 | 75 | 1 | 11 |
| government | 151 | 1,227 | 3,263 | 13 | 46 | 1 | 4 |
| SaaS | 368 | 485 | 12,606 | 4 | 56 | 1 | 10 |
| dev tools | 119 | 273 | 9,255 | 3 | 58 | 1 | 10 |
P90 Disallow by category chart here<<<<<<<<<<<<<<<<<<<<<<<<<
News сложен политически, потому что в нем есть явные правила для AI и юридический текст. Но ecommerce и travel сложны операционно, потому что у них большие каталоги, фасетная навигация, страницы результатов поиска, фильтры, пути аккаунтов и параметризованные URL.
Это различие важно.
Travel — самый наглядный пример. В этой категории всего 63 читаемых файла, но P90 robots.txt здесь 27.4 КБ, а P90 по Disallow — 779, что намного выше news. Это не означает, что у travel-сайтов более развитая AI-политика. Это означает, что у них больше поверхностей, на которых краулер может зря тратить бюджет: поиск по датам, страницы доступности, пагинация отзывов, бронирование, комбинации фильтров и локализованные пути инвентаря.
SaaS — противоположный сюрприз. Медианный файл здесь всего 485 байт, но P90 подскакивает до 12.6 КБ. Большинство SaaS-сайтов открыты и легки, но у меньшей части есть длинные файлы контроля путей, часто потому, что документация, логин, маршруты приложения и маркетинговые страницы живут под одним доменом.
News занимает середину по операционной сложности, но ближе к вершине по политической. У него P90 по User-agent равен 68 — выше, чем у ecommerce, travel, finance, academia, government, SaaS и dev tools в этой таблице. Это признак политики, завязанной на конкретных ботах, а не только на гигиене путей.
Файл robots.txt у издателя может быть сложным из-за правовой политики. У маркетплейса — из-за управления crawl budget. У университета — из-за тысяч унаследованных путей в одном домене. У социальной платформы — потому что ей нужно одновременно открывать одни поверхности и скрывать другие в огромном масштабе.
AI-политика ложится поверх всего этого. Она не заменяет существующие причины сложности файла.
Это помогает объяснить, почему управление robots.txt в AI-эпоху нельзя решить универсальным списком блокировок. Базовые файлы решают разные задачи:
- ecommerce управляет дублирующимися путями и страницами каталога;
- travel управляет списками, календарями, отзывами и динамическими страницами поиска;
- news управляет авторскими правами, архивами и лицензионной позицией;
- SaaS и dev-tools часто хотят видимости в AI;
- государственным сайтам нужен публичный доступ, но при этом им приходится исключать чувствительные системы;
- социальные платформы управляют пользовательским контентом, профилями и рисками злоупотреблений.
Один и тот же AI-правило для краулера означает разное в каждой из этих сред.
Наблюдение 6: Индекс конфигурационного долга выявляет риск проверки, а не моральную ошибку
Для этого анализа был создан простой score конфигурационного долга, чтобы выделять файлы robots.txt, которые, вероятно, трудно проверять.
Score учитывает:
- размер файла;
- число директив
User-agent; - число директив
Disallow; - число директив
Allow; - число второстепенных директив;
- наличие языка AI-политики;
- сочетание явной блокировки AI и юридического или авторско-правового языка.
Это не score корректности. Файл с высокой сложностью может быть полностью осознанным. Файл с низкой сложностью тоже может быть неправильным. Задача здесь — первичный отбор: если файл большой, перегружен политикой, ориентирован на отдельных ботов и полон исключений, он заслуживает более строгой дисциплины проверки.

Распределение score резкое. Медианный читаемый файл получает 1.74. P90 — 13.29, P95 — 15.00, P99 — 27.57. Только 366 файлов имеют score не ниже 15, 80 — не ниже 25, а 41 — не ниже 30. Это и есть практическая очередь на ревью: не каждому сайту нужен governance-проект, но верхнему хвосту — нужен.
Вид по категориям тоже показывает, почему ярлык «AI-blocker» слишком грубый:
| Категория | Медианный score | P90 score |
|---|---|---|
| travel | 4.92 | 28.94 |
| search | 2.97 | 24.23 |
| social | 2.25 | 15.00 |
| news | 4.91 | 14.92 |
| finance | 1.67 | 12.61 |
| SaaS | 0.98 | 11.85 |
| ecommerce | 3.88 | 10.87 |
| government | 1.57 | 6.38 |
Travel и search имеют самые высокие P90, потому что небольшая доля файлов становится очень большой и очень насыщенной правилами. News имеет одну из самых высоких медиан, потому что язык политики и бот-специфическая обработка встречаются в этой категории чаще. Ecommerce имеет высокую медиану Disallow, но его P90 по долгу ниже, чем у travel, потому что сложность там больше сосредоточена в path-правилах, а не в смешанном политико-юридическом слое.
Самые высоко оцененные файлы в этой выборке включают:
| Домен | Почему score высокий |
|---|---|
linkedin.com | Очень большой файл, тысячи правил путей, много именованных user-agent'ов, явный язык AI-политики |
lnkd.in | Та же поверхность политики, что и у инфраструктуры коротких ссылок LinkedIn |
fragrantica.com | Сотни блоков по именованным user-agent'ам плюс язык AI-политики |
sovcombank.ru | Сотни блоков user-agent и юридический/политический язык |
academia.edu | Большая матрица allow/disallow и явная политика блокировки AI |
opentable.com | Большой набор правил путей, много директив sitemap, AI-связанная политическая поверхность |
etsy.com | Большой e-commerce файл контроля путей с более чем 1,600 правилами Disallow |
runescape.com | Почти 5,000 директив Disallow под одной группой user-agent |
Над ними не стоит смеяться за сложность. Часто она отражает реальные бизнес-потребности. Но именно они показывают, почему политике robots.txt нужна та же инженерная дисциплина, что и другой продакшен-конфигурации:
- владение должно быть явным;
- изменения должны проходить ревью;
- сгенерированные разделы должны быть помечены;
- юридические комментарии, где возможно, нужно отделять от машинных директив;
- тест-кейсы должны проверять ожидаемый доступ ботов для критичных краулеров;
- история версий должна сохраняться;
- старые имена ботов должны быть выведены из использования или задокументированы;
- обучение AI, retrieval AI, поисковая индексация и архивирование должны рассматриваться как разные цели.
Последний пункт — самый важный. Текущая грамматика строится вокруг user-agent: она просит операторов сайтов называть ботов. Потребность AI-эпохи — строить политику вокруг цели: она просит операторов сайтов указывать, какие именно использования разрешены.
Это не одно и то же.
Из-за этого несовпадения длинные списки блокировок не будут жить долго. Сегодня издатель может добавить GPTBot, ClaudeBot, CCBot, Google-Extended, Bytespider, Applebot-Extended и PerplexityBot, но завтра появится новое имя краулера, retrieval-агент или брокер датасетов. Политика, основанная на цели, позволила бы сайту сказать: «поисковая индексация — да, обучение AI — нет, извлечение по запросу пользователя — возможно», не превращая robots.txt в адресную книгу ботов.
Что это значит для AI-управления
Публичная дискуссия часто описывает robots.txt как либо значимый, либо устаревший. Данные подсказывают более практичный ответ:
robots.txt значим, но перегружен.
Он значим, потому что крупные сайты его используют, краулеры умеют его читать, а решения по политике видны исследователям, журналистам, вендорам и судам. Исходный отчет показал, что у 17.0% анализируемых топ-сайтов были сознательные AI-специфические правила. Это не символический шум.
Он перегружен, потому что теперь файл должен выражать больше, чем просто доступ бота:
- «Не обучайте на этом контенте.»
- «Вы можете использовать этот контент для поисковой индексации.»
- «Вы можете использовать этот контент для live retrieval.»
- «Вы не можете создавать кэшированные датасеты.»
- «Эта юридическая оговорка действует в рамках европейского закона о text and data mining.»
- «Этот сайт, управляемый CDN, отправляет
Content-Signal: ai-train=no.» - «Этот сайт хочет Googlebot, но не YandexBot.»
- «У этого сайта есть 1,000 устаревших URL-путей, которые не должны краулиться.»
Грамматика не была рассчитана на столько задач.
Снизить долг могли бы три изменения:
-
Идентичности краулеров нужен реестр. Операторам сайтов не нужно вручную поддерживать бесконечно растущий список
GPTBot,ClaudeBot,anthropic-ai,CCBot,Google-Extended,Applebot-Extended,Bytespider,OAI-SearchBot,ChatGPT-Userи многих других. Без реестра политика всегда будет отставать от поведения краулеров. -
Использование AI нуждается в структурированном словаре. Обучение, retrieval, индексация, суммаризация, перепродажа датасетов, оценка модели и браузинг, инициированный пользователем, — это разные применения. Выражать их через имена user-agent'ов отдельных вендоров слишком хрупко.
-
Политике нужна возможность аудита. Вебу нужен способ отличать вручную написанные оговорки о правах от унаследованных шаблонов CDN, сгенерированных CMS, устаревших правил и случайных catch-all блокировок. Это важно и для доверия, и для судебных споров.
Все это не означает, что robots.txt нужно немедленно заменить. Лучший путь — наслоение: оставить robots.txt как поверхность обнаружения и совместимости, но стандартизировать соседнюю машинно-читаемую политику для AI-специфических сценариев.
llms.txt — одна из попыток, но в этом наборе данных его распространенность пока минимальна: лишь 83 читаемых файла его упоминают. Content-Signal заметнее, потому что Cloudflare может распространять его через инфраструктуру, и все 271 файла с Content-Signal в этом сканировании также содержали язык AI-политики. Но распространенность — это не то же самое, что консенсус. Для устойчивого решения, вероятно, нужна скучная, но надежная стандартизация: четкие поля, четкая семантика, обязательства краулеров и публичные тестовые наборы.
Заключение
Борьба вокруг AI-краулеров превратила robots.txt в артефакт управления. Это и полезно, и рискованно.
Полезно — потому что файл публичный. Исследователи могут его проверять. Издатели могут его менять. Краулеры могут его соблюдать. Суды могут его читать. Провайдеры инфраструктуры могут разворачивать его в масштабе.
Рискованно — потому что он несет слишком много.
Медианный файл robots.txt в Tranco Top 10K по-прежнему достаточно мал, чтобы его можно было понять. Но длинный хвост высоконагруженного веба полон больших, старых, многослойных, вендор-специфичных и юридически нагруженных файлов. Сотни сайтов теперь поддерживают конфигурации robots.txt, которые лучше понимать как производственные системы политики, а не как простые подсказки для краулера.
Главный урок не в том, что robots.txt провалился. А в том, что веб продвинул его наверх, не рефакторя.
Если политика доступа для AI будет опираться на машинно-читаемые публичные декларации, следующий шаг — это не еще один более длинный список блокировок. Это лучшая инфраструктура политики: разрешения, основанные на целях; стабильная идентичность краулера; шаблоны, пригодные для ревью; и трассируемость изменений.
До тех пор слой управления AI в публичном вебе будет по-прежнему держаться на текстовом файле, который никогда не должен был нести такую нагрузку.
Примечания по воспроизводимости
В папке с поставкой находятся:
source_data/analysis.json— исходные агрегированные метрики.source_data/site_meta.csv— исходная аналитическая таблица по сайтам.source_data/bot_status.csv— исходная таблица политики по доменам и ботам.source_data/fetch_meta.csv— исходные метаданные загрузки.source_data/sites.csv— исходная таблица доменов, категорий и статусов.derived_data/robots_complexity_by_site.csv— метрики сложности по сайтам, сгенерированные для этого отчета.derived_data/search_bot_treatment.csv— матрица отношения к поисковым краулерам.derived_data/category_complexity_summary.csv— сводка сложности по категориям.derived_data/top_config_debt_sites.csv— топ сайтов по score первичного отбора, описанному выше.derived_data/summary_metrics.json— все ключевые метрики, упомянутые в этом отчете.
Скачать все скрипты и наборы данных
Исправления методологии, замечания по набору данных и предложения по последующему анализу можно отправлять на support@thunderbit.com. Этот отчет опубликован независимо от любой коммерческой позиции Thunderbit; мы создаем AI-powered web scraper и имеем структурный интерес в том, чтобы robots.txt и дальше оставался значимым, машинно-читаемым договором в публичном вебе. Данные в этом отчете говорят сами за себя. — Исследовательская команда Thunderbit, май 2026.
Попробуйте Thunderbit для AI-скрейпинга веба Get Started Free


