Jak obejít Cloudflare při scrapování (co stále funguje v roce 2026)

Poslední aktualizace May 29, 2026
Jak obejít Cloudflare při scrapování (co stále funguje v roce 2026)
AI shrnutí
Obejděte Cloudflare v roce 2026 tak, že zvolíte správnou techniku podle úrovně ochrany. Tento průvodce vám pomůže vybrat mezi interním API, prohlížečem nebo kódem.

Minulý týden jsem strávil 40 minut laděním dokonale funkčního Python skriptu, který bez problémů běžel na třech testovacích webech — jen abych nakonec zjistil, že čtvrtý web je za Cloudflare. Scraper se pořád točil na stránce „Checking your browser…“ a vracel jen challenge HTML. Zní vám to povědomě?

Pokud jste narazili na stejnou zeď, nejste sami. Více než 24 milionů aktivních webů dnes používá Cloudflare, včetně zhruba 22 % všech webů na internetu. To z Cloudflare dělá nejběžnější překážku pro každého, kdo chce sbírat webová data — ať už jde o generování leadů, monitorování cen, realitní průzkum nebo konkurenční analýzu.

Problém je v tom, že většina návodů nahází všechny metody obejití do jednoho seznamu, ale neřekne vám, kterou z nich máte zkusit jako první ve vaší situaci. Tento průvodce jde jinou cestou: nabízí rozhodovací strom s prioritami, upřímný odhad spolehlivosti a také bezkódovou variantu, kterou většina článků úplně ignoruje.

  • Obtížnost: Začátečník až středně pokročilý (podle zvolené metody)
  • Časová náročnost: přibližně 10–30 minut pro bezkódový postup; u kódových metod se liší
  • Co budete potřebovat: prohlížeč Chrome (pro bezkódový postup), volitelně Python 3.9+ (pro kódové metody) a cílovou URL

Co je Cloudflare Protection (a proč blokuje váš scraper)?

cloudflare-security-diagram.webp

Cloudflare funguje jako reverzní proxy mezi návštěvníkem a originálním serverem webu. Každý požadavek nejprve projde přes okrajovou síť Cloudflare a ta rozhodne, jestli stránku zobrazí, pošle návštěvníka na challenge, nebo ho rovnou zablokuje. Klíčové je pochopit, že Cloudflare nemusí vědět, že je váš scraper škodlivý. Stačí, že váš požadavek vyhodnotí jako dostatečně automatizovaný nebo podezřelý.

Systém Bot Management od Cloudflare používá více vrstev ochrany — není to jeden zámek, ale celé bezpečnostní stanoviště. Sleduje reputaci IP adresy, HTTP hlavičky, TLS otisky, spouštění JavaScriptu, fingerprint prohlížeče i vzorce chování. Když vaše Python requests pošle GET na stránku chráněnou Cloudflare, selže současně na více úrovních: nesedí TLS handshake, neproběhne JavaScript, nejsou cookies ani browser fingerprint. Proto jednoduché přetváření hlaviček přestalo fungovat už před lety.

Nejčastější příznaky, které uvidíte: 403 Forbidden, 503 s hláškou „Checking your browser…“, 1020 Access Denied, nekonečné challenge smyčky, Turnstile widgety, které se nikdy nedokončí, a HTML challenge stránky tam, kde jste čekali JSON.

Pasivní detekce: co Cloudflare kontroluje ještě před načtením stránky

Ještě než vůbec uvidíte stránku, pasivní vrstva Cloudflare už váš požadavek ohodnotila:

  • Reputace IP adresy: Datacentrové IP, cloudové rozsahy a známé proxy výstupy bývají označeny. Rezidenční a mobilní IP adresy jsou mnohem důvěryhodnější. Komunitní hlášení z roku 2026 opakovaně popisují, že lokální rezidenční prohlížení projde, zatímco Docker nebo VPS prostředí jsou blokována.
  • Analýza HTTP hlaviček: Cloudflare porovnává User-Agent, Accept-Language, pořadí hlaviček a verzi HTTP. Nesoulad — třeba když tvrdíte, že jste Chrome 136, ale váš TLS handshake jasně říká „Python“ — je okamžitě podezřelý.
  • TLS fingerprinting (JA3/JA4): Během TLS handshaku váš klient prozradí sadu podporovaných šifer, rozšíření a preferencí protokolů. JA3/JA4 to převádí na identifikátor. Skutečný Chrome a skript v Python requests zanechávají úplně jiný „tvar“.
  • HTTP/2 fingerprinting: Prohlížeče a HTTP knihovny se liší ve frames SETTINGS, pořadí pseudo-hlaviček a chování priority. Práce Cloudflare JA4 Signals jde dál než jen identita jednoho požadavku a sleduje vzory mezi požadavky v čase.
  • AI Labyrinth: Novější past Cloudflare. Místo přímého blokování podezřelých crawlerů je odvádí do AI generovaných honeypot stránek, které vypadají věrohodně, ale jen zbytečně spotřebovávají prostředky crawleru. Váš scraper si možná ani neuvědomí, že se chytil.

Aktivní detekce: challenge, které běží ve vašem prohlížeči

Když pasivní kontroly nestačí, Cloudflare přechází k aktivním challenge:

  • JavaScript challenge: Klasická mezistránka „Checking your browser…“. Funkce JavaScript Detections od Cloudflare spouští neviditelné skripty, aby odhalila automatizované požadavky.
  • Turnstile: Náhrada CAPTCHA od Cloudflare. Widgetové režimy Turnstile zahrnují Managed, Non-Interactive a Invisible. Analyzuje pohyb myši, prostředí prohlížeče, TLS fingerprint a další signály — a nemusí přitom ani zobrazit viditelnou hádanku.
  • Fingerprinting Canvas a WebGL: Tyto kontroly odhalí headless prohlížeče, které vykreslují jinak než skutečné prohlížeče.
  • Behaviorální signály: Časování požadavků, vzorce scrollování, sekvence kliknutí. Scraper, který stáhne 50 stránek za 3 sekundy bez jediného pohybu myši, se na člověka nepodobá ani náhodou.

Praktický závěr: pokud Cloudflare přešlo na aktivní challenge, obyčejní HTTP klienti jako requests, httpx nebo dokonce curl_cffi neprojdou. Potřebujete něco, co spustí skutečné prostředí prohlížeče.

Úrovně ochrany Cloudflare: proč stejný skript funguje na jednom webu a na jiném selže

Tohle je přesně to, co většina návodů na obejití úplně opomíjí. Ochrana Cloudflare není všude stejná. Web na free tarifu s „Security Level: Medium“ je úplně jiná liga než web na Enterprise s Bot Management a Turnstile. Stejný skript, který jeden web bez problémů obejde, narazí na jiném na zeď.

Úroveň CloudflareTypická ochranaObtížnost obejitíCo obvykle funguje
Free plán (nízká ochrana)Bot Fight Mode, základní WAF pravidla, reputace IP⭐ NízkáZjištění interní API, curl_cffi se správnými hlavičkami, skutečná browser session
Pro plán (střední)Super Bot Fight Mode, Managed Challenge, JavaScript detekce⭐⭐ StředníSkutečná browser session, stealth automatizace prohlížeče, rezidenční proxy
BusinessSilnější WAF, Bot Analytics, přísnější challenge na klíčových cestách⭐⭐⭐ Středně až vysokáExtrakce přes browser session, perzistence session, rezidenční/mobilní proxy, placená scraping API
Enterprise / Bot ManagementBot scores, JA3/JA4 pole, pravidla po endpointu, Turnstile, AI Labyrinth⭐⭐⭐⭐ VysokáInterní API (pokud je dostupné), nástroje se skutečnou uživatelskou session, scraping API na úrovni providerů

scraper-defense-tiers.webp

Stránka cen Cloudflare uvádí Free za 0 $, Pro za 20 $/měsíc, Business za 200 $/měsíc a Enterprise s individuální cenou. Bot Fight Mode je jednoduchý přepínač pro Free plán; Super Bot Fight Mode přidává více kontrol pro Pro/Business; Enterprise Bot Management přidává detailní bot scores a pravidla pro jednotlivé endpointy.

Jak přibližně poznat, s jakou úrovní ochrany máte co do činění: 403 s blokovací stránkou značky Cloudflare a bez challenge skriptu často znamená WAF nebo odmítnutí fingerprintu. Div cf-turnstile nebo skript challenges.cloudflare.com/turnstile/v0/api.js znamená Turnstile. Mezistránka s „Checking your browser“ značí Managed Challenge. Selhání jen na konkrétní cestě po úspěšném načtení domovské stránky často ukazuje na WAF nebo Bot Management pravidla pro daný endpoint.

Než zvolíte postup, zjistěte si úroveň ochrany. Ušetří vám to hodiny ladění.

Rozhodovací strom „zkus nejdřív tohle“ pro obejití Cloudflare

Místo náhodného zkoušení metod postupujte podle priorit. Začněte nejjednodušší a nejspolehlivější variantou a zhoršujte se jen tehdy, když je to nutné:

KrokZkuste jako prvníPročKdyž to selže →
1Zkontrolujte interní/nedokumentované APIÚplně obejde Cloudflare; nejrychlejší a nejspolehlivějšíKrok 2
2Použijte bezkódový nástroj se zabudovaným vykreslováním prohlížeče (např. Thunderbit)Bez nastavení, automaticky zvládá JS challengeKrok 3
3Emulace TLS fingerprintu (curl_cffi)Rychlé, lehké, bez potřeby prohlížečeKrok 4
4Stealth automatizace prohlížeče (SeleniumBase UC / Puppeteer stealth)Zvládá JS challenge i fingerprintingKrok 5
5FlareSolverr + DockerOpen-source, vhodné pro serverové nasazeníKrok 6
6Placené scraping API (ScrapingBee, ZenRows, Scrapfly apod.)Celý závod ve zbrojení přebírá provider

ig_032f01f85482924d016a195f104f4c819687991b1a00dd05b0_compressed.webp

Logika je jednoduchá: nejdřív bezplatné a nenáročné, kódově a placené až na konci. Přeskočte rovnou na krok, který odpovídá vaší situaci.

Komunitní benchmark z března 2026 uváděl, že curl_cffi prošlo 16 z 20 testovaných domén (80 %), FlareSolverr pokrýval zhruba 55–70 % a placené proxy agregátory dosahovaly průměrné úspěšnosti asi 97 % — ale stejný thread zároveň upozorňuje, že tato čísla se s aktualizacemi Cloudflare mění. Berte všechny úspěšnosti jako orientační, ne zaručené.

Krok 1: Vyhněte se boji — najděte interní API za Cloudflare

Čtyři různé diskusní vlákna, na která jsem narazil, doporučují místo přímého boje s Cloudflare najít interní API webu. A upřímně: to je nejchytřejší první tah. Pokud web má interní API, obejdete Cloudflare úplně — bez triků, bez spoofingu fingerprintu, bez stealth pluginů.

api-endpoint-json-data-flow.webp

Postupujte systematicky:

  1. Otevřete Chrome DevTools → přejděte na kartu Network → filtrujte podle XHR/Fetch.
  2. Interagujte se stránkou: vyhledávejte, filtrujte, stránkujte, scrollujte. Sledujte, jestli se v Network panelu objevují JSON odpovědi.
  3. Zkontrolujte URL požadavku a hlavičky. Často má endpoint API slabší ochranu než samotná frontendová stránka, nebo žádnou Cloudflare ochranu vůbec.
  4. Klikněte pravým tlačítkem na požadavek → Copy → Copy as cURL. Vložte ho do terminálu nebo Postmanu a otestujte.
  5. Replikujte požadavek v Pythonu (pomocí requests nebo curl_cffi) se stejnými hlavičkami, cookies a query parametry.

Pokud API vrací strukturovaný JSON, možná vůbec nepotřebujete tradiční scraper. Vlákno na Redditu z ledna 2026 popisovalo přesně tento scénář: uživatel zablokovaný Cloudflare i přes curl_cffi zjistil, že jediná funkční cesta je zachytit odpověď API přímo.

Praktický tip: Jakmile vám kopie cURL funguje, začněte odstraňovat nepotřebné hlavičky. Hlavičky jako sec-ch-ua, cookies, CSRF tokeny a referer mohou být nutné; běžné cache řídicí hlavičky prohlížeče většinou ne. Pokud přecházíte z browser cURL do kódu, udržujte TLS fingerprint konzistentní s User-Agentem.

Omezení: Ne každý web má dostupné API. Některá API vyžadují přihlášení, CSRF tokeny, podepsané parametry požadavku nebo cookies navázané na session. Ale když to vyjde, jde o metodu s úspěšností kolem 99 % a bez údržby.

Vyzkoušejte Thunderbit pro scrapování v prohlížeči

Krok 2: Bez kódu — obejděte Cloudflare pomocí rozšíření do prohlížeče (Thunderbit)

Každý konkurenční návod předpokládá, že čtenář píše v Pythonu nebo JavaScriptu. Jenže toto klíčové slovo hledají i obchodní týmy tvořící seznamy leadů, ecommerce operátoři sledující ceny konkurence a realitní analytici stahující údaje o nemovitostech. Tihle lidé nechtějí spouštět Docker kontejnery.

Obejděte Cloudflare pomocí rozšíření do prohlížeče Get Started Free

Chrome rozšíření jako Thunderbit přirozeně zvládá spoustu kontrol Cloudflare, protože běží přímo ve vašem skutečném prohlížečovém sezení. Dědí autentický TLS fingerprint Chrome, vaše cookies, přihlášení i signály chování — přesně to, čemu Cloudflare důvěřuje. Žádné stealth pluginy, žádné xvfb-run, žádné příkazy do terminálu.

data-scraping-workflow.webp

Postup krok za krokem

  1. Nainstalujte Thunderbit Chrome Extension z Chrome Web Store.
  2. Otevřete Cloudflare chráněnou stránku v Chrome. Pokud vás Cloudflare vyzve k challenge, projděte jí jako běžný uživatel — klikněte na Turnstile checkbox, počkejte, až zmizí stránka „Checking your browser“. Jste skutečný člověk ve skutečném prohlížeči; Cloudflare vás pustí dál.
  3. Klikněte na „AI Suggest Fields“ v bočním panelu Thunderbit. AI projde stránku a navrhne datové sloupce jako „Product Name“, „Price“, „Rating“ nebo cokoli jiného relevantního.
  4. Zkontrolujte navržená pole. Odstraňte, co nepotřebujete, a přidejte vlastní pole jednoduchým popisem v běžné angličtině.
  5. Klikněte na „Scrape“. Thunderbit vytáhne data z viditelné stránky.
  6. Exportujte do Google Sheets, Excelu, Airtable, Notionu, CSV nebo JSON.

U stránkovaných webů Thunderbit zvládá jak stránkování pomocí klikání, tak nekonečný scroll. U detailních stránek (například máte seznam odkazů na produkty a chcete z každé jednotlivé stránky vytáhnout specifikace) použijte subpage scraping — Thunderbit navštíví každý detailový odkaz a obohatí vaši tabulku.

Podle mé zkušenosti trvá tento workflow zhruba 5–10 minut od instalace po export tabulky u běžného datasetu o 50–100 řádcích.

Kdy je scrapování v prohlížeči nejlepší a kdy už ne

Chci být upřímný ohledně limitů. Scrapování v prohlížeči je vázané na rychlost session. Je ideální pro středně velké úlohy — stovky až nižší tisíce stránek. Pokud potřebujete pravidelně procházet miliony stránek, budete chtít kód nebo API.

Cloud Scraping v Thunderbit může práci zrychlit tím, že na veřejně dostupných webech scrapuje až 50 stránek najednou. A pro vývojářské workflow nebo větší rozsah nabízí Thunderbit Web Scraper API, které zvládá JavaScript rendering, anti-bot ochranu i rotaci proxy s dávkovým zpracováním až 50–100 URL na jeden request.

Pro business uživatele, kteří scrapují leady, cenová data nebo nabídky nemovitostí v rozumném rozsahu? To je často jediná metoda, kterou potřebujete. Žádný kód, žádné proxy, žádná údržba.

Krok 3: Emulace TLS fingerprintu s curl_cffi (lehké kódové řešení)

Pokud vám Python vyhovuje a bezkódový postup se nehodí do workflow, curl_cffi je nejlehčí kódová varianta. Jde o Python binding nad libcurl, který dokáže napodobit TLS fingerprint skutečných prohlížečů. Na rozdíl od requests nebo httpx váš TLS handshake vypadá jako z Chrome nebo Safari.

V roce 2026 mezi podporované profily impersonace patří chrome136, safari184 a mnoho historických profilů. Knihovna měla release na PyPI ještě v dubnu 2026, takže je aktivně udržovaná.

Kdy ji použít: Weby s Cloudflare ochranou Free nebo Pro úrovně, které spoléhají hlavně na pasivní fingerprinting — bez aktivní JavaScript challenge, bez Turnstile.

Základní příklad:

from curl_cffi import requests

url = "https://example.com/products"
resp = requests.get(
    url,
    impersonate="chrome136",
    headers={
        "accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
        "accept-language": "en-US,en;q=0.9",
    },
    timeout=30,
)
print(resp.status_code)
print(resp.text[:500])

Jedna častá chyba: Udržujte User-Agent konzistentní s cílovým profilem impersonace. Pokud impersonujete Chrome 136, neposílejte User-Agent pro Chrome 120. Nesoulad je signál.

Omezení: curl_cffi nespouští JavaScript. Pokud web vrací challenge „Checking your browser“ nebo Turnstile widget, tato metoda selže. Není také vhodná pro weby, které vyžadují session state založený na cookies z browser challenge. Berte ji jako rychlý a levný první pokus pro čistě pasivní ochranu.

Alternativy ze stejné rodiny: tls-client a curl-impersonate nabízejí podobné možnosti emulace TLS.

Krok 4: Stealth automatizace prohlížeče (Puppeteer Stealth a SeleniumBase UC)

TLS spoofing nestačí, pokud web vyžaduje spuštění JavaScriptu, aktivní challenge nebo Turnstile. V takovém případě potřebujete plnohodnotný prohlížeč. Dvě hlavní možnosti:

  • SeleniumBase UC Mode (Python): Dokumentace výslovně popisuje UC Mode jako způsob, jak aby automatizace působila lidštěji a vyhnula se anti-bot službám. Obsahuje i příklady práce s Cloudflare Turnstile.
  • Puppeteer s puppeteer-extra-plugin-stealth (Node.js): Stále se používá, ale v roce 2026 je čím dál křehčí. Komunitní zprávy popisují selhání kvůli detekci CDP (Chrome DevTools Protocol) a nesouladu profilů prohlížeče.

Oba nástroje spustí skutečný Chromium prohlížeč, ale upravují detekovatelné automatizační signály: navigator.webdriver, WebGL metadata, seznam pluginů a další.

Nastavení, na kterém opravdu záleží:

  • Používejte headed režim (ne headless). Dokumentace SeleniumBase upozorňuje, že UC Mode je v headless režimu detekovatelný. Na Linux serverech použijte virtuální displej.
  • Randomizujte velikost viewportu a User-Agent, ale držte je vzájemně konzistentní a v souladu s geolokací proxy.
  • Přidávejte realistická zpoždění mezi akcemi. Rozdíl 200 ms mezi načteními stránek působí jako bot.
  • Po úspěšném průchodu prvním challenge ukládejte cookies a profil prohlížeče. Nemusíte challenge řešit znovu na každý požadavek.
  • Kombinujte s rezidenčními proxy pro lepší reputaci IP.

Nevýhodou je údržba. Automatizační stacky se rozbíjejí, když Chrome aktualizuje, Cloudflare přidá nový signál, stealth plugin zaostane nebo cílový web přidá Turnstile na konkrétní cestu. Benchmark ScrapeOps ukázal, že mnoho stealth browser setupů padá na fingerprint testech kvůli „franken-fingerprint“ kombinacím — nesouladu časové zóny, jazyka a geografie proxy.

Tahleta metoda je silná, ale provozně drahá. Počítejte s průběžnými opravami.

Rotace proxy: proč je IP stejně důležitá jako fingerprint

I s dokonalým stealth browserem příliš mnoho požadavků z jedné IP vyvolá rate limit. Cloudflare důvěřuje rezidenčním a mobilním IP mnohem víc než datacentrovým.

  • Rezidenční proxy: v roce 2026 asi ~1,50–8+ $/GB při vstupních objemech. Důvěryhodnější, ale dražší.
  • Datacentrové proxy: levnější, ale na seriózních cílech s Cloudflare selhávají rychle.
  • Strategie rotace: Rotujte per session, ne per request. Rotace na každý požadavek rozbije session cookies a cf_clearance. V rámci jedné session udržujte IP, cookies i fingerprint konzistentní.

Neexistuje žádná kouzelná „minimální velikost proxy poolu“. Malý lead scrape může fungovat s několika sticky rezidenčními sessions; vysokofrekvenční monitor cen může potřebovat stovky výstupních bodů plus retry logiku.

Krok 5: FlareSolverr — open-source server pro obejití Cloudflare

FlareSolverr je open-source proxy server, který používá Chromium s undetected-chromedriverem v Docker kontejneru, aby vyřešil challenge Cloudflare a vrátil cookies/hlavičky pro další použití. Měl verzi 3.5.0 vydanou v květnu 2026, takže je stále aktivně udržovaný.

Kdy ho použít: Server-side scraping pipeline, kde potřebujete trvalou službu pro řešení challenge — například automatizovanou úlohu běžící každou noc, která potřebuje čerstvé cookies cf_clearance.

Jak funguje: Váš scraper pošle URL do API FlareSolverr. FlareSolverr otevře stránku v prohlížeči, pokusí se challenge vyřešit a vrátí HTML i cookies. Ty pak můžete znovu použít ve svém běžném HTTP klientovi pro další požadavky.

Přehled nastavení: Docker Compose, spuštění kontejneru, odesílání POST requestů na lokální API endpoint. ScrapeOps má slušný návod.

Omezení, která říkám na rovinu:

  • Nespolehlivě řeší interaktivní Turnstile challenge ani Enterprise Bot Management.
  • GitHub issues a diskuse na Redditu ukazují nekonzistentní chování: chyby v detekci challenge, timeouty Turnstile, pád stránek.
  • Vyžaduje Docker infrastrukturu a průběžnou údržbu.
  • Náročný na zdroje — každý pokus o vyřešení challenge spouští nový browser context.

Odhadovaná spolehlivost: 60–80 % na cílech se střední ochranou. U Enterprise nižší, u jednodušších challenge stránek vyšší. Pokud FlareSolverr nestačí, je čas zvážit placené API.

Krok 6: Placená scraping API, která Cloudflare vyřeší za vás

Někdy prostě matematika vyjde tak, že údržba vlastní stealth infrastruktury stojí na hodinách inženýrské práce víc než předplatné. Placené scraping API přehazují celý závod ve zbrojení na specializovaného poskytovatele — vy pošlete URL a on vyřeší fingerprinting, proxy, challenge i retry.

Jak je porovnat:

ProviderPodpora CloudflareVykreslování JSRezidenční proxyStrukturovaný výstupCenový model
ScrapingBeeAnoAnoAnoJen HTMLKredity za request
ZenRowsAno (tvrdí >99% úspěšnost)AnoAno (prémiově)HTML, částečné parsováníCPM s multiplikátory
ScrapflyAno (uvádí CF, Akamai, DataDome)AnoAnoHTML, částečné parsováníKreditový model
BrowserlessAnoAno (headless Chrome)Ano (vestavěné)HTML, screenshotyJednotkový model
Thunderbit APIAnoAnoAnoStrukturované JSON/CSV s AI schématemFree tier + placené plány

Kdy to dává smysl: vysoký objem scrapování, požadavky na enterprise spolehlivost, nebo když váš tým nechce udržovat scraping infrastrukturu. Cenové rozpětí: zhruba 30–500+ $/měsíc pro malé až střední použití, u enterprise objemů více.

Thunderbit API stojí za zvláštní zmínku, protože vrací strukturovaná data, ne jen surové HTML. Jeho Extract endpoint umí dávkově zpracovat až 50 URL na request a vrátit JSON/CSV podle AI schématu — hodí se, pokud potřebujete čistá data připravená pro analýzu, ne HTML, které si musíte parsovat sami.

Upřímná tabulka spolehlivosti: co opravdu funguje a co padá

Po celý rok 2025–2026 jsem sledoval komunitní hlášení, GitHub issues i tvrzení vendorů. Níže je upřímné srovnání. Jde o orientační odhady, ne laboratorní benchmarky:

reliability-scoreboard-responsible-use.webp

MetodaOdhad úspěšnostiNáročnost údržbyPadá, když…Cenové rozpětí
Interní API (pokud existuje)~90–99 %NízkáZmění se API, přidá se auth, tokeny se začnou podepisovatZdarma
Rozšíření v prohlížeči (Thunderbit)~85–95 % (skutečná session)Nízká (AI se přizpůsobí změnám layoutu)Web vyžaduje speciální auth flow, agresivní Turnstile po každé akciK dispozici free tier
curl_cffi / TLS spoofing~70–85 %Střední (aktualizace fingerprintu)Cloudflare změní JA3 kontroly, je potřeba aktivní JS challengeZdarma
Puppeteer + stealth plugin~70–90 %Vysoká (pluginy zaostávají)Detekce CDP, nové fingerprint signály, headless detekceZdarma + náklady na proxy
FlareSolverr~60–80 %Vysoká (Docker, drift závislostí)Enterprise ochrana, interaktivní TurnstileZdarma + náklady na infrastrukturu
Placené scraping API~85–95 %Nízká (udržuje provider)Provider neaktualizoval nebo je překročen rozpočet~30–500+ $/měsíc

Nejdůležitější sloupec není úspěšnost — je to „Padá, když…“. Každá metoda má svůj bod selhání. Nejlepší strategie je zvolit nejméně náročnou metodu, která pro váš cíl funguje, a mít záložní plán.

Neexistuje trvalé řešení. Cloudflare se neustále aktualizuje. Závod ve zbrojení je reálný.

Tipy, jak zůstat pod radarem Cloudflare (bez ohledu na metodu)

Ať už si vyberete jakýkoli postup, pár návyků vás udrží pod radarem Cloudflare déle:

  • Respektujte rate limity. Mezi požadavky dávejte realistické prodlevy — minimálně 2–5 sekund pro chování podobné uživateli. Tlačit na web strojovou rychlostí je nejrychlejší způsob, jak být zablokovaný.
  • Držte fingerprint konzistentní. User-Agent, TLS fingerprint, verze prohlížeče, časové pásmo, jazyk a geografie IP by měly vyprávět stejný příběh. Chrome 136 User-Agent z německé IP s locale en-US a Python TLS handshake je rozpor.
  • Po challenge znovu používejte cookies a session. Nepřepočítávejte challenge na každý request.
  • Neměňte IP uprostřed session. Cloudflare sleduje návaznost session.
  • Používejte rezidenční nebo mobilní IP, pokud to use case a rozpočet ospravedlňuje.
  • Sledujte měkké blokace: challenge HTML tam, kde jste čekali JSON, prázdné tabulky, přesměrování na login nebo stránky, které podezřele připomínají honeypoty AI Labyrinth.
  • Vyhněte se špičkám provozu, kdy správci webu mohou zpřísnit WAF pravidla.
  • Mějte záložní cesty: nejdřív API → pak browser session → nakonec placený provider.

Pro uživatele Thunderbit konkrétně platí, že AI se automaticky přizpůsobuje změnám layoutu stránky, takže trávíte méně času údržbou CSS selektorů a více času skutečným využitím dat.

Krátká poznámka k právním a etickým otázkám

Není to hlavní téma článku, ale je příliš důležité na to, abychom ho přeskočili.

Scrapování veřejně dostupných dat má v některých případech příznivou judikaturu v USA — odůvodnění hiQ v. LinkedIn podle CFAA obstálo i po vrácení Nejvyšším soudem, i když strany v roce 2022 uzavřely dohodu a celý obraz je složitější. V roce 2025 navíc Reddit zažaloval Anthropic kvůli údajnému scrapování uživatelských komentářů a později téhož roku Reddit žaloval i Perplexity a firmy zabývající se scrapingem dat.

V EU se GDPR uplatňuje vždy, když jsou ve hře osobní údaje, a AI Act EU přidává specifické povinnosti kolem necíleného scrapování pro trénink AI.

Praktická pravidla:

  • Vždy si zkontrolujte podmínky použití webu.
  • Ochrana Cloudflare je signál, že si vlastník webu přeje kontrolovat automatizovaný přístup — respektujte to.
  • Nesbírejte osobní údaje bez legitimního právního důvodu.
  • Pro komerční nebo velkoobjemové workflow dávejte přednost oficiálním API, licencovaným datům nebo písemnému souhlasu, pokud je k dispozici.
  • Pokud si nejste jistí, poraďte se s právníkem pro konkrétní use case a jurisdikci.

Thunderbit je navržený pro legitimní business use case — generování leadů, monitorování cen, průzkum trhu — nad veřejně dostupnými daty.

Závěr: co zkusit jako první a co jako další

Největší úspora času v celém článku není nástroj ani kódový snippet — je to zjištění úrovně ochrany ještě předtím, než začnete. Už to samo o sobě zabrání hodinám ladění metody, která nikdy neměla šanci fungovat.

Začněte tady:

  1. Zkontrolujte interní API (je zdarma, rychlé a často přehlížené).
  2. Pokud jste business uživatel, který nepíše kód, zkuste Thunderbit Chrome Extension — vaše skutečná browser session je proti Cloudflare vaše nejsilnější zbraň.
  3. Pokud jste vývojář a cílový web používá jen pasivní fingerprinting, zkuste curl_cffi.
  4. Ke stealth browserům, FlareSolverru nebo placeným API přistupujte až tehdy, když jednodušší metody selžou.

Žádná metoda není trvalá. Spojte správný nástroj s odpovídajícím rozsahem a záložním plánem a strávíte mnohem méně času civěním na 403 stránky.

Pokud chcete jít víc do hloubky, na blogu Thunderbit jsme psali o web scrapingu bez kódování, AI web scrapingu a nejlepších AI web scraperech. A pokud chcete vidět rozšíření v akci, podívejte se na Thunderbit YouTube channel s návodnými videi.

Vyzkoušejte Thunderbit na webech chráněných Cloudflare

Vyzkoušejte Thunderbit AI Web Scraper Get Started Free

Často kladené otázky

1. Dá se ochrana Cloudflare obejít úplně?

Žádná jednotlivá metoda nezaručí 100% úspěšnost, zejména proti Enterprise Bot Management s Turnstile, JA4 fingerprintingem a AI Labyrinth. Nejspolehlivější postupy kombinují skutečný browser fingerprint s dobrou reputací IP. Najít interní API je nejblíže „úplnému“ obejití, protože Cloudflare obejde úplně — ale ne každý web ho má.

2. Je obejití Cloudflare při scrapování legální?

Záleží na vaší jurisdikci, podmínkách webu a na tom, jaká data sbíráte. Scrapování veřejně dostupných dat má v některých kontextech příznivou judikaturu v USA (hiQ v. LinkedIn), ale obcházení technických přístupových kontrol, porušení ToS nebo sběr osobních údajů bez legitimního důvodu může představovat právní riziko. Pro komerční workflow preferujte oficiální API nebo licencovaná data, pokud jsou k dispozici, a v případě nejistoty se poraďte s právníkem.

3. Jaký je nejsnazší způsob, jak obejít Cloudflare bez programování?

Rozšíření do prohlížeče jako Thunderbit, které běží ve vaší skutečné Chrome session, zvládnou challenge Cloudflare automaticky — na webu pracujete jako běžný uživatel a potom necháte rozšíření data vytáhnout a exportovat. Žádný Python, žádný Docker, žádná konfigurace proxy.

4. Proč můj scraper funguje na některých webech s Cloudflare, ale na jiných ne?

Úroveň ochrany Cloudflare se dramaticky liší podle tarifu (Free, Pro, Business, Enterprise) i konfigurace. Metoda, která funguje proti základním JS challenge na Free webu, může selhat na Turnstile nebo plném Bot Managementu na Enterprise webu. Nejdřív vždy zjistěte úroveň ochrany — sledujte, jestli vidíte jednoduchou JS kontrolu, Managed Challenge nebo Turnstile widget — a teprve potom vyberte postup obejití.

5. Jak často metody obejití Cloudflare přestávají fungovat?

Kódové metody jako stealth pluginy a TLS spoofing mohou na těžších cílech ztrácet účinnost během několika týdnů až měsíců, protože Cloudflare průběžně aktualizuje detekci. Placené API a nástroje založené na skutečné browser session bývají odolnější, protože se přizpůsobují na úrovni infrastruktury nebo uživatelské session. Interní API se rozbíjejí jen zřídka, pokud web zásadně nepředělá backend nebo nezmění autentizační model. Nejbezpečnější dlouhodobá strategie je mít více záložních metod místo spoléhání na jediný postup.

Další čtení

Fawad Khan
Fawad Khan
Fawad se psaním živí a upřímně ho to docela baví. Roky zjišťoval, co dělá text zapamatovatelným — a co čtenáře přiměje scrollovat dál. Zeptejte se ho na marketing a bude o něm mluvit celé hodiny. Zeptejte se ho na carbonaru a bude mluvit ještě déle.
Obsah

Získej data z webu jen tím, že si o ně řekneš

Řekni, co potřebuješ, obyčejnou angličtinou. Nebo ještě lépe – neříkej nic.

Vyzkoušet Thunderbit zdarma
Získej data pomocí AI
Snadno přenes data do Google Sheets, Airtable nebo Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week