Я уже несколько недель то и дело возвращаюсь к сайту Kadoa — во многом потому, что их ребрендинг в июне 2026 года застал меня врасплох. Сначала они были просто «AI web scraper», а потом внезапно начали называть себя «Web Scraping OS». Это очень большой шаг — и он многое говорит о том, куда движется вся эта категория.
Так вот, вопрос, который мне постоянно задавали читатели и даже моя команда: можно ли по-прежнему сравнивать Kadoa с Thunderbit, или они уже окончательно ушли из ниши «быстрого инструмента для скрейпинга»? Короткий ответ: и да, и нет. Длинный — ниже.
Короткий ответ
Если вам нужен tl;dr до погружения в детали:
- Thunderbit создан для момента, когда вы смотрите на веб-страницу и думаете: «Мне просто нужны эти данные — прямо сейчас, в таблицу». Один клик, без схемы, без ожидания команды по данным.
- Kadoa создан для организаций, которым нужны управляемые, отслеживаемые и постоянно поддерживаемые датасеты в production — например, для финансовых команд, которые каждый день собирают альтернативные данные из десятков источников с аудит-треками.
- Ни один из них не является просто «AI-скрейпером» в противопоставлении «ручному скрейперу». Оба действительно agentic — разница в том, ради чего именно они используют агента.
Последний пункт важнее, чем кажется. Я часто вижу статьи-сравнения, где всё сводится к банальному чек-листу функций, хотя на деле это два продукта, которые просто разошлись в разные категории покупателей.
Сравнение в двух словах
| Параметр | Thunderbit | Kadoa |
|---|---|---|
| Основной пользователь | Бизнес-пользователи, маркетологи, соло-специалисты, разработчики | Enterprise- и finance-команды по данным, центральные data-отделы |
| Горизонт времени | Немедленно — извлечь данные со страницы, которую вы видите | Жизненный цикл production — собрать, утвердить, поддерживать pipeline |
| Сценарий запуска | Нажать One Click Extract → автоматический запуск | Запрос → предложение схемы → сборка/тест pipeline → утверждение → расписание и live-workflow |
| Модель выполнения | Agentic-анализ страницы в рамках каждой сессии | Детерминированная генерация pipeline с поддержкой агента для сопровождения |
| Поддержка | Повторный запуск пользователем на совместимых страницах | Автоматический мониторинг pipeline и self-healing (по описанию вендора) |
| Наблюдаемость | Предпросмотр таблицы, доработка | Success rate, MTTR, provenance, SLA-дашборды (по описанию вендора) |
| Способы доступа | Расширение браузера, веб-приложение, Open API, MCP Server, CLI | Платформа Web Scraping OS, enterprise-развертывание |
| Ценообразование | Публичные self-serve тарифы, см. страницу цен | Связь с отделом продаж; публичной таблицы self-serve цен на момент публикации нет |
| Лучше всего подходит для | Разовых, командных или умеренно повторяющихся задач | Управляемых, многоканальных, постоянно обновляемых enterprise-датасетов |
Честно скажу: на создание этой таблицы ушло больше времени, чем я ожидал, потому что большая часть материалов в духе «Thunderbit vs Kadoa» просто ставит обеим галочку возле «AI-powered» и на этом заканчивает. А это ровным счётом ничего не объясняет.
Что такое Thunderbit?
Вот реальный сценарий — ровно так, как это работает сейчас, а не в старом интерфейсе, который всё ещё описывают некоторые обзоры:

Вы открываете веб-страницу, к которой у вас есть доступ. Нажимаете One Click Extract. И всё — агент Thunderbit определяет структуру страницы, читает содержимое, понимает, какие поля важны, и начинает подготовку извлечения. Вы увидите кнопку Run Now, но, по сути, нажимать её даже не обязательно — если ничего не делать, процесс стартует автоматически. Один осознанный клик, ноль настройки схемы, ноль селекторов.
Я люблю описывать это так: «инструмент просто не мешает». При необходимости вы всё равно можете уточнить результат через обычный текст, если автоопределённые поля оказались не совсем точными, а на совместимых страницах он сам перейдёт по пагинации или соберёт данные с подстраниц. Помимо браузерного расширения, есть Web App, Open API для разработчиков, MCP Server для AI-агентов вроде Claude или Cursor и CLI для терминальных сценариев. Экспорт доступен в Excel, Google Sheets, Airtable или Notion.
Это не инструмент, который должен жить внутри data engineering-стека. Он создан для человека, которому данные нужны прямо сейчас, и который не хочет ради этого оформлять тикет.
Что такое Kadoa в 2026 году?
Вот здесь всё становится интереснее. В анонсе Kadoa за июнь 2026 года появилась концепция, которую они назвали Web Scraping OS, и работает она на том, что они называют «Kadoa Assistant». Описанный ими процесс выглядит так:

- Вы формулируете запрос на естественном языке — например: «Мне нужны данные о ценах с этих 12 сайтов конкурентов, с ежедневным обновлением»
- Kadoa исследует источники и выбирает самый надёжный способ извлечения данных — endpoint API, встроенный JSON, файл для скачивания, всё что окажется наиболее стабильным
- Он предлагает схему данных
- Он строит детерминированный pipeline — то есть уже сгенерированный код для извлечения, а не LLM, который каждый раз гадает заново — и тестирует его
- Вы просматриваете предпросмотр и утверждаете результат
- Далее всё запускается в production с расписанием, валидацией и уведомлениями
Формулировка «Web Scraping OS» добавляет автоматическое обслуживание pipeline, инфраструктурную готовность, дашборды наблюдаемости (success rate, mean time to repair, SLA tracking), data provenance и workflows для governance/compliance. Это уже язык enterprise-инфраструктуры, и их текущее позиционирование очень явно ориентировано на finance и альтернативные данные — например, на хедж-фонды и asset management-команды, которым нужны проверяемые и регулярно обновляемые датасеты из десятков источников.
Это действительно совсем другая продуктовая цель, чем «помоги мне вытащить данные со страницы». И здесь я хочу отдать Kadoa должное: переход от инструмента для скрейпинга к data infrastructure platform — это реальный стратегический ход, а не просто ребрендинг ради маркетинга.
Ключевое различие: мгновенное извлечение против жизненного цикла production-датасета
Однокликовая интерактивная задача в Thunderbit
Thunderbit оптимизирован под минимальную дистанцию между «я вижу данные на странице» и «у меня эти данные уже в таблице». Здесь нет шага согласования схемы, потому что агент определяет поля в реальном времени — прямо на той странице, которую вы открыли. Если вы соло-фаундер или sales-менеджер, вам нужен именно такой сценарий — в 16:00 во вторник вы не хотите тратить силы на «утверждение предпросмотра pipeline», когда вам просто нужны 200 лидов.

Утверждённый детерминированный pipeline в Kadoa
В workflow Kadoa специально встроены этапы ревью и утверждения до того, как что-либо попадёт в production. Это не недостаток, а суть подхода — если вы строите датасет для trading-модели или compliance-отчёта, вы хотите, чтобы человек утвердил схему, прежде чем она будет месяцами работать без присмотра.
Интерпретация во время выполнения против кода, сгенерированного и поддерживаемого агентом
Есть важная архитектурная тонкость: Kadoa прямо разделяет генерацию детерминированного кода для извлечения агентом (который потом работает без вызова LLM каждый раз) и прямое LLM-извлечение на каждой загрузке страницы. Их официальное объяснение про AI в web scraping подробно разбирает этот момент. Я не буду додумывать за рамками того, что они опубликовали, но суть такая: Kadoa пытается совместить надёжность детерминированного кода со скоростью настройки, которую даёт AI-assisted generation pipeline. Thunderbit, напротив, оставляет agentic-анализ в каждом интерактивном запуске, а не компилирует заранее долговечный pipeline-артефакт.
Практические сценарии
Покажу, как я реально использовал бы каждый инструмент, потому что абстрактные сравнения функций никогда не передают всей картины.

Разовая таблица для лидов / продуктов / исследования
Допустим, мне нужен список из 150 компаний с каталожного сайта, включая названия, сайты и email для связи. Я бы открыл страницу, нажал One Click Extract в Thunderbit и получил бы таблицу меньше чем за минуту. В мире, где я стал бы поднимать Kadoa pipeline, ждать утверждения схемы и запускать отложенный job ради одноразового списка, смысла просто нет. Это было бы чрезмерно.
Еженедельный датасет для мониторинга конкурентов
Теперь представим, что мне нужны данные по ценам с 15 сайтов конкурентов, обновляемые каждое утро понедельника и попадающие в дашборд, которому доверяет вся команда. Вот это уже гораздо ближе к сильной стороне Kadoa — этап утверждения, мониторинг и сценарий «что делать, если конкурент полностью переделал сайт» становятся действительно важными. Thunderbit технически тоже умеет отложенное извлечение на поддерживаемых тарифах и поверхностях, но весь смысл Kadoa как раз и строится вокруг такого повторяющегося многоканального сценария.
Мультиканальный workflow для инвестиций / альтернативных данных
Это уже родная территория Kadoa, если смотреть на их нынешнее позиционирование — сбор данных из десятков финансовых или альтернативных источников с отслеживанием provenance и аудит-треками. Я бы не стал использовать Thunderbit для такого кейса; это просто не его зона проектирования.
Интеграция с AI-агентом и доставка данных
Если я строю RAG-пайплайн или monitoring-agent, которому нужно программно вызывать инструмент извлечения, тогда на сцену выходят MCP Server и Open API Thunderbit — Claude, Cursor или любой совместимый AI-host может напрямую вызывать Thunderbit. На момент написания у меня нет подтверждения о публичном self-serve API или MCP-решении от Kadoa, поэтому если это жёсткое требование для вашего стека, лучше напрямую уточнить у Kadoa, прежде чем считать возможности эквивалентными.
Точность, сопровождение и наблюдаемость
Kadoa описывает source grounding, confidence scoring и проверки plausibility/completeness как часть валидации pipeline. Они также публиковали ранние показатели — например, заявления о более быстрой настройке и снижении затрат на поддержку — от клиентов early-access. Скажу прямо: это собственные цифры вендора, а не независимые бенчмарки, и я не видел контролируемого head-to-head теста Thunderbit против Kadoa по точности или трудозатратам на поддержку. Любые конкретные проценты из их маркетинга стоит воспринимать как утверждение, которое ещё нужно проверять, а не как установленный факт.

Со стороны Thunderbit история точности проще, потому что и workflow проще: у вас есть мгновенный предпросмотр таблицы, вы можете визуально проверить результат и тут же уточнить инструкции по полям, и вам не нужно бояться, что полугодовой pipeline тихо рассинхронизировался из-за редизайна сайта — потому что никакого полугодового pipeline изначально нет, вы каждый раз извлекаете свежие данные.
Одна честная оговорка, которая относится к обоим инструментам: ни один из них не гарантирует успех на каждом сайте. Login wall, агрессивная антибот-защита и радикальные изменения вёрстки — это реальные точки отказа. Агентный повторный анализ Thunderbit помогает на совместимых, авторизованных страницах, но «agentic» — это не волшебное слово, которое отменяет CAPTCHA.
API, MCP и способы развертывания
Разработческий контур Thunderbit хорошо документирован: Open API для программного доступа, MCP Server для интеграций с AI-агентами и CLI для терминальных и coding-agent сценариев — плюс браузерный и облачный режимы для интерактивной работы.
Текущая модель развертывания Kadoa строится вокруг enterprise-платформы Web Scraping OS с управляемой инфраструктурой pipeline и функциями governance/security для крупных организаций. На момент написания я не нашёл документации о публичном self-serve API или MCP-интеграции у Kadoa — если это критично для вашей оценки, лучше уточнить напрямую у их команды, а не предполагать паритет с developer-инструментами Thunderbit.
Цена и модель покупки
Здесь нужно честно обозначить ограничение: на текущих публичных страницах Kadoa после запуска в июне 2026 года нет self-serve таблицы цен. Их позиционирование предлагает связаться с отделом продаж или запросить тест. Так что если вы пытаетесь сравнить строку вида «$X/месяц» между двумя продуктами, у Kadoa вы упрётесь в стену — не потому, что я не захотел копать, а потому что это действительно не опубликовано.
У Thunderbit есть публичная страница цен с self-serve тарифами, которые можно посмотреть прямо сейчас.
Но при сравнении модели покупки реально важна не только цена на витрине — важнее трение в закупке. Thunderbit позволяет зарегистрироваться и начать извлекать данные за считанные минуты. Enterprise-модель Kadoa подразумевает разговор с продажами, онбординг и, вероятно, период proof-of-concept до выхода в production. Если у вашей компании уже есть процесс закупок под enterprise SaaS, это не проблема. Если же вы команда из двух человек, это ощутимая цена трения, которую стоит учитывать.
Что выбрать?
Выбирайте Thunderbit, если...
- Вы соло-маркетолог, фаундер или sales-менеджер и вам нужны данные с нескольких страниц уже сегодня, без ожидания
- Команде нужны регулярные выгрузки в Sheets или Airtable, но у вас нет data engineering-функции — и вы не хотите её нанимать
- Вы разработчик, который строит AI-агента, RAG-пайплайн или monitoring script и хочет программный доступ через API, MCP или CLI
- Для вас важнее получить рабочую таблицу в один клик, чем проходить формальный workflow согласования pipeline
Выбирайте Kadoa, если...
- Вы enterprise- или finance-команда по данным, которой нужны управляемые, многоканальные, постоянно обновляемые датасеты с аудит-треками
- Compliance, provenance и observability-дашборды — обязательные критерии при выборе
- У вас уже есть или вы строите процесс закупок, который подходит для enterprise-продукта с продажами и индивидуальным ценообразованием
- Сопровождение pipeline и self-healing-инфраструктура для вас важнее, чем скорость одного клика
Используйте оба, если...
- Ваши аналитики хотят быстро проверить идею с данными в Thunderbit, а центральная data-команда потом решает, стоит ли превращать это в устойчивый enterprise-pipeline в Kadoa. Я действительно видел такой сценарий в небольших компаниях, которые начинают быстро расти: сначала всё делается на коленке, потом формализуется.
Итог
Я всё время возвращаюсь к одной и той же формулировке: Thunderbit — это интерактивный agentic-скрейпер, созданный для скорости и доступности. Kadoa, особенно после ребрендинга, — это enterprise Web Scraping OS, построенная вокруг governance и масштаба. Если сравнивать их по обычному чек-листу функций, можно упустить главное — они решают совершенно разные задачи.
Если вы по-настоящему не можете выбрать между ними, мой честный совет — запустить небольшой proof of concept, а не полагаться на любую сравнительную статью, включая эту. Измерьте: сколько времени уходит до первого полезного результата, насколько надёжно извлечение переживает изменения сайта, насколько аудитируемым получается результат для вашего кейса и какова реальная total cost of ownership, если учесть время на настройку и сопровождение.
Для большинства людей, которые открыли эту страницу и смотрят на сайт в поисках способа вытащить данные без кода и без ожидания IT, браузерное расширение Thunderbit — вероятно, более быстрый путь к ответу. Начать можно бесплатно, и уже через пять минут вы поймёте, решает ли оно вашу задачу.
FAQ
Thunderbit и Kadoa оба agentic?
Да. Оба используют AI-агентов, чтобы понимать структуру страницы и извлекать данные без ручного написания селекторов. Thunderbit применяет agentic-анализ в рамках каждой интерактивной сессии на просматриваемой странице; Kadoa использует агентов для генерации и сопровождения детерминированных pipeline для production-датасетов.
Как работает Kadoa Assistant?
По официальному анонсу Kadoa вы описываете нужные данные на естественном языке, система исследует источники и предлагает схему, затем строит и тестирует детерминированный pipeline, а после вашего утверждения разворачивает его как расписанный и мониторимый workflow.
Нужны ли Thunderbit селекторы или настройка схемы?
Нет. Вы нажимаете One Click Extract на странице, и агент автоматически определяет поля; кнопка Run Now необязательна, потому что извлечение стартует само, если вы ничего не нажимаете.
Запускает ли Kadoa LLM-извлечение на каждой странице?
Не обязательно. Kadoa разделяет детерминированный код, сгенерированный агентом (который работает без вызова LLM каждый раз), и прямое LLM-извлечение. Их объяснение архитектуры подробнее разбирает это различие.
Что лучше для повторяющихся датасетов?
Зависит от масштаба и требований к governance. Thunderbit поддерживает отложенное извлечение на подходящих тарифах для умеренно повторяющихся задач. Kadoa изначально создавался для крупных, многоканальных, постоянно поддерживаемых датасетов с observability и compliance-контролем — его текущее позиционирование больше ориентировано на finance и enterprise-команды по данным.
Публичны ли цены Kadoa?
На момент написания — нет. На текущих страницах запуска Kadoa предлагает связаться с отделом продаж или запросить тест, а не показывает self-serve тарифы. У Thunderbit есть публичная страница цен, которую можно открыть напрямую.
Может ли любой из инструментов обработать любой сайт?
Нет. Оба инструмента лучше всего работают на совместимых и авторизованных страницах. Login walls, агрессивные антибот-системы и масштабные редизайны сайтов остаются реальными причинами сбоев для любого скрейпингового инструмента, agentic он или нет — к заявлениям любого вендора о том, что он «умеет всё», стоит относиться скептически.


