Každý seznam „nejlepších proxy API“ riskuje stejnou chybu: hází Bright Data, Thunderbit a Apify do jednoho pytle, jako by soutěžily o úplně stejný úkol. Nesoutěží. Jeden produkt může poskytovat směrované IP připojení, jiný vracet strukturované JSON a další spouštět naplánovaný scrapingový workflow. Porovnávat je podle jedné vstupní ceny je jako vybírat mezi zahradní hadicí a úpravnou vody.
Tento průvodce mapuje deset proxy, managed scraping, extrakčních a platformních produktů na základě oficiální dokumentace získané 10. srpna 2026. Nevyhlašuje univerzálního vítěze ani neopakuje přenosná tvrzení o úspěšnosti. Místo toho vám dává způsob, jak definovat validní výsledek, vytvořit užší shortlist podle kategorie a spustit autorizovaný pilot na vlastních cílech.
Proč „Proxy API“ neznamená jednu jedinou věc
V jádru každé debaty typu „které proxy API mám použít“ je jeden zásadní zmatek: tento pojem pokrývá nejméně čtyři skutečně odlišné produkty.
Surová proxy síť vám dá IP adresu a směrovací kontrolu — zbytek si řešíte sami: logiku požadavků, retry, renderování JavaScriptu v případě potřeby i parsování odpovědi. To je nejblíže učebnicové definici proxy: RFC 9110 ji popisuje jako zprostředkovatele přeposílání zpráv, kterého si klient zvolí, a nic víc.
Managed unblocking nebo browser API přebírá větší část životního cyklu požadavku. Pošlete URL, ono vybere IP, případně stránku vyrenderuje, zkusí znovu při chybě a vrátí HTML, screenshot nebo někdy Markdown.
Extrakční API jde o úroveň výš — místo surového HTML, které si musíte sami zpracovat, dostanete strukturované JSON nebo čistý text.
Scrapingová platforma obaluje všechno výše uvedené ještě plánováním, úložištěm a často i tržištěm hotových scraperů.
Proč na tom záleží v článku o výběru proxy API? Protože cena a „success rate“ se napříč těmito kategoriemi prostě nedají férově porovnávat. Residential síť účtovaná podle provozu a managed API účtované podle požadavků řeší jiné problémy. Liší se jmenovatelé, zahrnutá práce i význam výstupu — a žebříček podle hlavní ceny by tak byl zavádějící. Každý profil níže proto začíná kategorií produktu.
Ještě jedna důležitá věc: mít přístup k proxy neznamená, že můžete scrapovat cokoli chcete. Oprávnění, podmínky cílového webu a povinnosti kolem ochrany dat jsou samostatné téma od otázky „který vendor má největší IP pool“ — a žádné proxy API, jakkoli dobré, tuhle diskusi nevyřeší.
Jak hodnotit všech deset možností
Neexistuje poctivé fixní vážení, které by fungovalo pro každý tým. Archiv surového HTML, monitor cen citlivý na lokaci a workflow obohacování strukturovaných dat mají jiné požadavky. Začněte těmito kritérii, přiřaďte jim váhy, které dají dohromady 100, a skórujte pouze podle vlastního pilotu nebo zdokumentovaného požadavku:
| Kritérium | Co měřit |
|---|---|
| Míra validních výsledků | Procento pokusů, které projdou vaším semantickým validátorem, ne jen návratový kód HTTP 200 |
| Cena za validní výsledek | Veškeré náklady na požadavky, traffic, renderování, retry, parsování, úložiště a práci obsluhy dělené počtem validních výstupů |
| Vhodnost výstupu | Surová odpověď, vyrenderované HTML, screenshot, Markdown nebo data ve formě schématu |
| Kontrola připojení a geolokace | Region, město, ASN, session, rotace, hlavičky, cookies a protokolová kontrola, kterou skutečně potřebujete |
| Observabilita a limity | Request ID, hlavičky účtovaných jednotek, logy, replay, kontrola concurrency a rozpočtové stopky |
| Důkazy o souladu | Prohlášení o zdrojování, smlouvy, způsobilost cílového webu, auditovatelnost a proces podpory |
| Inženýrská náročnost | Integrace, údržba parserů, monitoring a čas na ruční opravy |

Nepodporované buňky nechte prázdné nebo je označte jako „nerelevantní“. Cílem je rozhodnutí pro konkrétní workload, ne skóre vytvářející falešnou přesnost.
1. Thunderbit
Thunderbit je v tomto seznamu výjimka, protože jde o sousední extrakční API, ne o surovou proxy síť, kterou připojíte do HTTP klienta. Ve veřejné API dokumentaci popisuje Distill pro Markdown, Extract pro JSON ve tvaru schématu a Batch pro asynchronní sady URL. Tato hranice může odstranit několik následných kroků, pokud je požadovaný výstup obsah nebo záznamy, nikoli proxy připojení.
Praktický rozdíl je vidět hned po odeslání požadavku. U tradičního proxy API vám úspěšné volání vrátí surové HTML — práce je teprve napůl hotová. U endpointu POST /extract v Thunderbit pošlete cílovou URL a JSON Schema popisující pole, která chcete získat, a zpět dostanete rovnou strukturované JSON odpovídající tomuto schématu. Žádné CSS selektory, žádná údržba parseru, když si web v Q3 přepracuje produktovou stránku.
Tohle produktové vymezení je hlavní praktický argument: volající může popsat výstupní schéma místo toho, aby udržoval samostatný stack pro proxy, renderer a parser. I tak je ale potřeba skutečný pilot. Před nasazením ověřte úplnost polí, podporu cílových webů, latenci, spotřebu jednotek, concurrency i chování při chybách na autorizovaných URL.
Klíčové vlastnosti:
- Strukturovaný výstup jako výchozí stav — JSON odpovídající vámi definovanému schématu, ne surové HTML
- Zdokumentované řízení renderování a směrování — posuzované v rámci extrakčního endpointu, ne jako samostatný surový proxy produkt
- HTTP API hranice — Distill, Extract a Batch pokrývají Markdown, strukturované JSON i asynchronní sady URL
- Batch režim pro asynchronní úlohy nad více URL, užitečný pro cokoli nad rámec několika stránek
- Extrakce ve tvaru schématu snižuje, ale úplně neodstraňuje, potřebu validace a údržby na úrovni polí
Účtovací jednotka: Distill a Extract používají zdokumentované jednotky za stránku, nikoli proxy bandwidth. Před rozpočtováním si zkontrolujte aktuální ceny Thunderbit a API dokumentaci, protože jednotky i plány se mohou měnit.
Nejlepší pro: vývojáře, kteří chtějí hned použitelné, strukturované a validované data a nechtějí sami stavět a udržovat pipeline pro rotaci proxy a parsování.
Kdy stále vyhrává tradiční proxy API: pokud potřebujete surové HTML pro vlastní pipeline, hromadnou archivaci nebo ne-HTTP protokol, model strukturovaného výstupu Thunderbit není správný nástroj — ve skutečnosti chcete jednu z následujících devíti možností.
2. Bright Data
Bright Data je tomuto odvětví asi nejblíž k zavedenému lídrovi: nabízí residential, datacentrové, ISP i mobilní proxy sítě a k tomu samostatný managed produkt Web Unlocker. To slovo „samostatný“ je důležité — Bright Data není jeden produkt, ale rodina produktů, a ceny i chování se výrazně liší podle toho, co přesně kupujete.
Dokumentace residential sítě uvádí cílení na zemi, region, město, ZIP i ASN. Web Unlocker je samostatná managed vrstva s účtováním „pay-per-success“ a měsíčním limitem útraty. To jsou užitečné kontroly, ale jejich přesnost a vhodnost je stejně nutné ověřit v pilotu kupujícího; tento průvodce neprováděl mezivendorový geo benchmark.
Klíčové vlastnosti:
- Residential, datacentrové, ISP a mobilní proxy typy s detailním geo cílením
- Managed API Web Unlocker s účtováním podle úspěchu a limity výdajů
- Zdokumentované prohlášení o opt-in zdrojování residential IP
- Debug pole (request ID, účtovaný stav, peer country) pro troubleshooting
Účtovací jednotka: surové proxy produkty a Web Unlocker používají různé jednotky. Před rozpočtováním si ověřte přesný produkt, závazek, způsobilost cíle i aktuální sazbu na oficiálních cenových stránkách.
Nejlepší pro: enterprise týmy, které potřebují dostupnost všech proxy typů a nevadí jim o něco komplexnější produktové portfolio výměnou za škálování.
3. Oxylabs
Oxylabs hraje ve stejné váhové kategorii jako Bright Data — residential, datacentrové, ISP i mobilní proxy sítě plus samostatný produkt Web Unblocker pro managed přístup. Jeho session handling používá vyhrazenou hlavičku X-Oxylabs-Session-Id, což vám dává kontinuitu IP v omezeném časovém okně, což je velmi užitečné pro vícekrokové flow, například stránkované výsledky hledání.
Klíčové vlastnosti:
- Více proxy typů s geokontrolami zdokumentovanými dodavatelem
- Web Unblocker pro renderování JS a managed unblocking, účtovaný podle GB v aktuálním ceníku
- Přetrvávání session pomocí session ID v hlavičce
- Hlavičky job/session jsou součástí ukázkových odpovědí pro debugging
Účtovací jednotka: stránka Web Unblocker získaná pro tento průzkum používala tarify založené na GB s rate limity specifickými pro plán; jiné produkty Oxylabs používají jiné jednotky. Zkontrolujte aktuální stránku vybraného produktu.
Nejlepší pro: operace s velkým objemem dat, které potřebují geo diverzitu a nevadí jim správa účtování podle GB napříč produkty.
4. ScrapingBee
ScrapingBee je managed HTML API: pošlete URL, dostanete obsah stránky a za následnou validaci a parsování obvykle zodpovídáte sami. Dokumentace odhaluje systém kreditů závislý na funkcích, Auto-Mode, hlavičky nákladů a parametr max_cost, který může omezit cenu jedné Auto-Mode requestu.
Klíčové vlastnosti:
- Auto-Mode, který automaticky stupňuje konfiguraci (úroveň proxy, renderování), dokud neuspěje
- Parametr
max_costpro zastropování výdajů na jeden požadavek - Neúspěšné Auto-Mode pokusy napříč všemi konfiguracemi stojí 0 kreditů
- Hlavičky pro využití a cenu v každé odpovědi pro sledování v reálném čase
Účtovací jednotka: kredity se liší podle renderování, proxy úrovně a dalších zapnutých funkcí. Místo toho, abyste základní plán brali jako cenu za request, zkontrolujte aktuální kreditovou stupnici a limity concurrency.
Nejlepší pro: menší až střední projekty, kde je důležitější rychlé nasazení než hluboká customizace — kreditový systém dělá cenu opravdu předvídatelnou, jakmile mu porozumíte.
5. ZenRows
ZenRows spojuje Universal Scraper API, Scraping Browser a residential proxy pod jednu střechu, s násobiteli požadavků pro JavaScript rendering a použití prémiových proxy. Jedna zvláštnost si zaslouží jasné upozornění: ZenRows počítá HTTP 404 a 410 jako „úspěšné“ pro účely účtování, což je dobrá připomínka, že „úspěch“ na faktuře vendoru a „úspěch“ ve vašem validátoru nejsou totéž.
Klíčové vlastnosti:
- Kombinovaný toolkit: scraper API, browser automation a residential proxy
- Více deklarovaných výstupních formátů (JSON, Markdown, screenshoty, plaintext)
- Managed renderovací a přístupové komponenty, jejichž aktuální chování je nutné ověřit na autorizovaných cílech
- Limity založené na URL, které pozastaví požadavky, dokud nepřikoupíte kapacitu
Účtovací jednotka: request kredity se zdokumentovanými násobiteli pro funkce jako JavaScript rendering a prémiové proxy. Ověřte aktuální plán a pravidla násobitelů.
Nejlepší pro: týmy, které chtějí z jednoho vendoru vyzkoušet scraper API, browser i proxy produkty a zároveň testovat každý vybraný produkt na autorizovaných cílech.
Jaké vzorce se zatím ukazují
Po pěti nástrojích je trend jasný: hranice produktu téměř nikdy neodpovídá marketingovému textu přesně. Bright Data i Oxylabs oddělují „raw proxy“ od „managed unblocking“ do samostatných produktů s odlišnými cenovými modely, takže homepage vendora sama o sobě neodpovídá na otázku „kolik mě to bude stát“ — nejdřív musíte vybrat konkrétní produkt. ScrapingBee i ZenRows používají účtování přes kredity s rostoucími násobiteli, což je transparentnější než cena podle GB, ale pořád si musíte přečíst drobný tisk o tom, co násobitel spouští.
Další opakující se motiv: „úspěšný požadavek“ definuje vendor, ne vy. To, že ZenRows počítá 404 jako zpoplatněné úspěchy, není zlý úmysl — je to prostě nesoulad definic, který vás doběhne, pokud předpokládáte, že „účtováno jako úspěšné“ znamená „data, která jsem potřeboval, tam skutečně byla“.
6. Scrape.do
Scrape.do provozuje managed Web Scraping API s modelem účtování „Successful API Credits“ — platíte pouze za aktuální hlavní endpoint, protože vlastní navigace cen uvádí samostatné proxy a scraping-browser produkty jako „coming soon“ (stojí za kontrolu, pokud předpokládáte, že Scrape.do dnes prodává surové proxy). API pokrývá geo cílení, session, hlavičky, cookies a přepínání mezi browser/proxy režimy.
Klíčové vlastnosti:
- Účtování přes kredity, které po dosažení měsíčního limitu zastaví požadavky (bez nečekaného překročení jako výchozí chování)
- Prémiový network switch dostupný pro způsobilé cíle
- Session a geo kontroly, které by se měly testovat proti přesné workload specifikaci
- Režim renderování v browseru pro stránky náročné na JS
Účtovací jednotka: balíčky úspěšných API kreditů s měsíčními limity; ověřte aktuální limity plánu, concurrency a pravidla pro dodatečnou kapacitu.
Nejlepší pro: týmy citlivé na rozpočet, které chtějí managed API bez závazku k účtování podle GB.
7. Smartproxy / Decodo
Smartproxy se přejmenoval na Decodo a jeho aktuální residential ceník uvádí plány podle GB i pay-as-you-go, s cílením až na úroveň ASN a s rotujícími i sticky session přes HTTP(S)/SOCKS5. Získaná stránka uvádí výkonové claimy od Proxyway. To je užitečný kontext, ale není to důkaz, že stejný výsledek přenese na jiný cíl, region, časové okno nebo konfiguraci účtu.
Klíčové vlastnosti:
- Residential, datacentrové, ISP a mobilní proxy typy
- Cílení na úrovni ASN a lokace
- Podpora rotujících i sticky session přes HTTP(S) a SOCKS5
- Výkonové claimy pocházející z externího výzkumu, nikoli z vlastního reportingu
Účtovací jednotka: residential stránka získaná pro tento průzkum dokumentuje varianty per-GB a pay-as-you-go. Ověřte aktuální sazby a zahrnuté kontroly na stránce vybraného produktu.
Nejlepší pro: monitoring e-commerce a operace středního rozsahu, které chtějí rozmanitost proxy bez enterprise cen.
8. Scrapfly
Scrapfly je managed scraping API s volitelnou funkcí Anti Scraping Protection (ASP). Jeho dokumentace výslovně říká, že obrany cílových webů se vyvíjejí, obnova po zablokování může trvat neurčitě dlouho a náklady související se zdroji se mohou měnit. Tahle poznámka je důležitá: managed přístup není záruka dlouhodobého přístupu.
Klíčové vlastnosti:
- ASP s dynamickým růstem nákladů podle obtížnosti cíle
- Parametr
cost_budgeta ochrana spravedlnosti při neúspěšném scrapingu (vyloučené status kódy se vám nepočítají proti rozpočtu) - Hlavičky s náklady na úrovni odpovědi a dashboard pro replay/debug požadavků
- Volitelné browser renderování a residential proxy pooly
Účtovací jednotka: kredity, jejichž cena se může měnit podle proxy poolu, renderování a konfigurace ASP. Hlavičky odpovědí, cost_budget a limity projektu pomáhají tuto cenu měřit a držet pod kontrolou.
Nejlepší pro: týmy, které konkrétně upřednostňují anti-detection nástroje a chtějí vidět, kolik je který požadavek skutečně stál v kreditech.
9. Zyte
Zyte (dříve Scrapinghub, pokud jste v tomhle prostoru dost dlouho na to, abyste si to pamatovali) nabízí API, které může podle požadavku vracet surové HTTP odpovědi, HTML vyrenderované v browseru, screenshoty nebo automaticky extrahované strukturované objekty. Ceny se určují podle cíle / úrovně requestu, nikoli paušálně, a — podobně jako u několika dalších nástrojů zde — neúspěšné odpovědi a rate-limited požadavky se neúčtují.
Klíčové vlastnosti:
- Více výstupních režimů: HTTP, browser, screenshot nebo auto-extrakce
- Nativní integrace se Scrapy pro Python týmy, které už tento ekosystém používají
- Limity výdajů a prahy blokování, které lze nastavit dopředu
- Ceny podle cíle / úrovně requestu, upravené podle obtížnosti webu
Cenový model: pay-as-you-go je k dispozici; přesná sazba závisí na úrovni cíle.
Nejlepší pro: týmy, které potřebují managed HTTP/browser/extrakční API, obzvlášť pokud už používají Scrapy. Vhodnost cíle a stabilitu tieru je nutné ověřit pilotem.
10. Apify
Apify je spíš plnohodnotná scrapingová platforma než proxy API — compute, předpřipravení „Actors“ (jejich termín pro balené scrapery), plánování, dataset storage i proxy služby jsou v jednom balíku, s odděleným účtováním každé položky. To je výhoda, pokud chcete tržiště hotových scraperů pro běžné weby; je to komplikace, pokud jste chtěli jen proxy a dostali jste platformu.
Klíčové vlastnosti:
- Tržiště předpřipravených Actorů pro běžné scrapingové cíle
- Residential, datacentrové a SERP proxy jako jedna z komponent
- Plánování, dataset storage a podpora webhooků pro automatizaci workflow
- Detailní diagnostické proxy status kódy pro debugging neúspěšných požadavků
Účtovací jednotka: předplacené využití platformy může zahrnovat oddělené poplatky za compute, Actor, proxy, dataset i úložiště. Modelujte celý workload, ne jen proxy položku.
Nejlepší pro: týmy, které chtějí spíš hotové scrapery a automatizaci workflow než jemnou kontrolu nad surovými proxy.
Skrytý nákladový problém: používejte cenu za validní výsledek
Ceníková cena je jen čitatel. Užitečný jmenovatel nejsou odeslané requesty, přenesené bajty ani HTTP 200 odpovědi. Je jím počet výstupů, které splňují váš vlastní semantický validátor.
Metriku si definujte před pilotem:
cost_per_1,000_valid = total_pilot_cost / valid_results * 1,000
total_pilot_cost by měl zahrnovat náklady, které se mezi kandidáty skutečně liší: jednotky za request nebo síť, násobitele za renderování a prémiové směrování, retry, parsování, compute, úložiště, monitoring a čas obsluhy. valid_results by měl počítat jen odpovědi s požadovanými poli, správnou lokalizací, přijatelnou čerstvostí a bez challenge nebo consent stránky maskované jako obsah.

Zvažte záměrně hypotetický příklad. Provider A stojí 3,00 USD za testovací dávku a vyprodukuje 600 validních záznamů; Provider B stojí 3,50 USD a vyprodukuje 950. Jejich normalizované náklady jsou 5,00 USD a zhruba 3,68 USD na 1 000 validních záznamů. Tato čísla slouží jen k ilustraci aritmetiky. Nejde o tvrzení o žádném poskytovateli, typu cíle ani ochranném systému.
U extrakčního API, jako je Thunderbit, zahrňte hodnotu i náklad získání dat ve tvaru schématu místo surového HTML. U surové proxy započítejte downstream parsování a údržbu. Ani jedna hranice není univerzálně levnější; odpověď závisí na tom, jaký výstup daný workload skutečně potřebuje.
Pokud chcete podrobněji pochopit, jak AI-based extrakce řeší tento problém jinak než scraping založený na selektorech, naše rozebrání AI web scrapingu popisuje základní přístup.
Proxy API vs. AI Scraping API: Potřebujete vůbec proxy?
Každý článek, který se umísťuje na předních příčkách v tomto tématu, předpokládá, že čtenář proxy potřebuje. Nikdo ten předpoklad nezpochybňuje — což je zvláštní, když dnes tolik lidí klade mnohem základnější otázku: potřebuji vůbec surové HTML, nebo jen data?
| Oblast | Tradiční Proxy API | AI Scraping API (např. Thunderbit) |
|---|---|---|
| Co dostanete zpět | Surové HTML, které parsujete sami | Strukturované JSON odpovídající vašemu schématu |
| Chování managed přístupu | Řízeno vaší proxy/client stack nebo samostatným managed produktem | Součást extrakční služby a omezeno její dokumentací |
| Parsování / extrakce | Parsery stavíte a udržujete sami | AI extrahuje pole podle schématu |
| Údržba při změně layoutu | Váš tým řeší změny selektorů a parserů | Služba přebírá víc extrakční logiky, ale váš tým stále validuje výstup |
| Nejvhodnější pro | Hromadnou archivaci HTML, vlastní pipeline, specifické protokoly | Strukturovaná data, RAG ingest, lead listy |
| Integrační hranice | Proxy endpoint nebo API providera | HTTP extrakční endpointy jako Distill, Extract a Batch |
Upřímný závěr: pokud vaše pipeline skutečně potřebuje surové HTML, kontrolu session na úrovni proxy nebo vlastní request stack, může být tradiční proxy API správná hranice. Pokud je požadovaný výstup strukturovaný produktový data set, lead záznamy nebo výsledky vyhledávání připravené pro tabulku či retrieval pipeline, může extrakční API přesunout routing, renderování i extrakci pod jednu služební hranici. Tím se rozhodování přeformuluje, aniž by se prokázalo, že jeden model je univerzálně lepší.
Pro týmy, které hledají hlavně leady nebo strukturované záznamy místo surových stránek, ukazují průvodce AI lead generation a AI for sales, jak vypadají workflow, kde jsou přirozeným výstupem právě strukturované řádky.
V úvahu musí přijít i compliance a zdrojování
Technický přístup a oprávnění jsou dvě různé věci. Před pilotem si zdokumentujte, jaké URL může organizace sbírat, jaká pole dat potřebujete, pravidla uchovávání, povinnosti v oblasti ochrany soukromí, příslušné podmínky cílového webu a kdo je zodpovědný za eskalaci. Předplatné proxy vaše oprávnění nerozšiřuje.
U residential sítí si od poskytovatele vyžádejte aktuální dokumentaci ke zdrojování a souhlasu, pravidla způsobilosti cíle, požadavky na identitu nebo KYC, auditní důkazy a proces reakce ve chvíli, kdy IP rozsah nebo cíl přestane být dostupný. Oficiální vendor statement je užitečný důkaz, ale není to nezávislý audit dodavatelského řetězce.
Během pilotu zaznamenávejte region a ASN tam, kde to dává smysl, ale nevyvozujte z jednoho lookupu zdrojování celé sítě. Nesrovnalosti berte jako otázky pro vendor a nákupní tým. Pokud se změní oprávnění, selže kontrola politiky, dosáhnete limitu retry nebo se aktivuje rozpočtový strop, test zastavte.
U extrakčních a platformních služeb odpovědnosti za zdrojování a přístup nezmizí; jen se přesunou za jinou služební hranici. Kupující by měl stále prověřit smlouvy, zásady povoleného použití, chování při chybách a práci s daty. Tento průvodce je technické hodnoticí doporučení, nikoli právní rada.
Srovnání na první pohled
| Nástroj | Hranice produktu | Typický výstup | Účtovací jednotka k ověření | Užitečná pilotní otázka |
|---|---|---|---|---|
| Thunderbit | Exktrakční API | Markdown nebo JSON ve tvaru schématu | Jednotky za stránku | Zůstávají požadovaná pole validní napříč šablonami cíle? |
| Bright Data | Rodiny surových proxy plus managed Unlocker | Připojení, surový obsah nebo managed výstup | Provoz nebo úspěšné requesty podle produktu | Který přesný produkt a jaké geo kontroly workload vyžaduje? |
| Oxylabs | Rodiny proxy plus Web Unblocker a scraper API | Připojení nebo managed obsah | Produktově specifická; zkoumaná stránka Unlocker byla založená na GB | Jak velikost odpovědi a kontinuita session ovlivňují cenu? |
| ScrapingBee | Managed HTML API | HTML | Kredity podle funkcí | Která konfigurace uspěje a kolik stojí za validní stránku? |
| ZenRows | Scraper API, browser a residential proxy | Více vendorově zdokumentovaných formátů | Requesty s násobiči funkcí | Jak se billing 404/410 chová ve vztahu k vašemu validátoru? |
| Scrape.do | Managed Web Scraping API | Obsah stránky | Successful API credits | Sedí prémiové, geo, session a browser kontroly na workload? |
| Decodo | Rodina proxy a scraping produktů | Připojení nebo výstup specifický pro produkt | GB nebo PAYG na zkoumané residential stránce | Jsou kontroly lokace, ASN, protokolu a sticky session dost přesné? |
| Scrapfly | Managed scraping API | Obsah stránky, browser výstup, volitelná extrakce | Kredity podle funkcí | Chovají se cost budgets, logy a ochrana proti chybám podle očekávání? |
| Zyte | Managed HTTP, browser, extrakční a Scrapy rozhraní | HTTP, vyrenderované HTML, screenshoty nebo objekty | Úroveň cíle / requestu plus volby | Je tier stabilní a sedí limity režimu requestu implementaci? |
| Apify | Scrapingová platforma a tržiště plus proxy | Datasety z Actorů nebo crawlerů | Poplatky za compute, Actor, proxy, storage a dataset | Oprávňuje workflow plnou cenu platformy? |
Kategorie a účtovací jednotky výše vycházejí z oficiálních stránek získaných 10. srpna 2026. Plány, limity, názvy i násobitele funkcí se mohou měnit, proto si před rozpočtováním vždy znovu ověřte konkrétní produkt.
Rozhodovací flowchart: Co vlastně scrapujete?
Nejčastější otázka ve fórech kolem proxy bývá ve stylu „nevím, co je nejlepší, má někdo doporučení?“ — a hned po ní přijde obecný seznam, který na to ve skutečnosti neodpovídá. Tady je pokus o něco blíž skutečné rozhodovací cestě.
Jaký výstup potřebujete?
- Potřebujete kontrolu nad proxy protokolem, surové odpovědi, vlastní hlavičky nebo vlastní parser? Vytvořte shortlist surových proxy produktů.
- Potřebujete vyrenderované HTML bez správy browser vrstvy a retry vrstvy? Vytvořte shortlist managed scraping nebo browser API.
- Potřebujete validovaná pole, záznamy nebo Markdown? Vytvořte shortlist extrakčních API, včetně dokumentovaných endpointů Distill a Extract od Thunderbit.
- Potřebujete plánování, storage, marketplace joby a týmový provoz? Vytvořte shortlist scrapingových platforem.
Které kontroly jsou nepřekročitelné? Sepište požadované regiony, délku session, chování rotace, metody requestů, cookies, hlavičky, renderování, screenshoty, tvar dat, concurrency, logy a limity výdajů. Když kandidát nesplní tvrdý požadavek, vyřaďte ho ještě před testováním měkkých preferencí.
O jakém objemu mluvíme? Nepoužívejte obecný práh počtu stránek k výběru providera. Objem souvisí s velikostí odpovědí, concurrency, násobiteli funkcí, mírou validních výsledků, sjednanými závazky i inženýrskou náročností. Modelujte očekávaný mix šablon cílových webů a spusťte pilot v reprezentativní concurrency.
Surové HTML, nebo strukturovaná data? Tohle je pořád hlavní rozcestí. Pokud potřebujete surové HTML pro vlastní pipeline, testujte proxy nebo managed-HTML produkty. Pokud je výstupem validované řádky, JSON nebo Markdown, testujte extrakční hranici jako samostatnou kategorii a nesnažte se z ní násilně dělat přímé srovnání s proxy.
Vytvořte si vlastní váženou hodnoticí kartu
Seznam funkcí nerozhodne, protože výkon i cena závisí na cílové sadě a konfiguraci. Udělejte si hodnoticí kartu podle vlastních požadavků a výsledků pilotu. Váhy níže jsou záměrně prázdné.
| Kritérium | Vaše váha | Skóre providera A (1–5) | Důkaz | Skóre providera B (1–5) | Důkaz |
|---|---|---|---|---|---|
| Míra validních výsledků | |||||
| Cena za validní výsledek | |||||
| Vhodnost výstupu | |||||
| Geo/session/request kontroly | |||||
| Observabilita a kontrola rozpočtu | |||||
| Compliance a důkazy o zdrojování | |||||
| Podpora a provozní vhodnost | |||||
| Inženýrská a údržbová náročnost | |||||
| Celkem | 100 |
Používejte skóre 1–5 jen tam, kde existují důkazy. „Nerelevantní“ držte odděleně od nuly. Váhy publikujte vedle výsledku, aby kolegové viděli, které předpoklady rozhodnutí ovlivnily.
Následující stručný příklad v Pythonu failuje uzavřeně při chybějících nebo neplatných vstupech. Minimum 30 pokusů je pouze pedagogické pravidlo pro tutoriál, nikoli univerzální tvrzení o statistické velikosti vzorku:
from dataclasses import dataclass
@dataclass(frozen=True)
class PilotResult:
attempts: int
valid_results: int
request_cost: float
engineering_cost: float = 0.0
def cost_per_1000_valid(self) -> float:
if self.attempts < 30:
raise ValueError("pilot needs at least 30 attempts for this tutorial")
if not 0 < self.valid_results <= self.attempts:
raise ValueError("valid_results must be between 1 and attempts")
if self.request_cost < 0 or self.engineering_cost < 0:
raise ValueError("costs cannot be negative")
total = self.request_cost + self.engineering_cost
return total / self.valid_results * 1000
def weighted_score(weights: dict[str, float], scores: dict[str, float]) -> float:
if set(weights) != set(scores):
raise ValueError("every weighted criterion needs a score")
if abs(sum(weights.values()) - 100.0) > 1e-9:
raise ValueError("weights must sum to 100")
if any(not 1 <= score <= 5 for score in scores.values()):
raise ValueError("scores must be in the 1–5 range")
return sum(weights[name] * scores[name] for name in weights) / 100
Spusťte alespoň dvě kola v různých časech za fixních podmínek. U každého pokusu zaznamenejte cílovou skupinu, region, konfiguraci, stav, výsledek semantického validátoru, latenci, retry, účtované jednotky, bajty, request nebo job ID a důvod neplatnosti. Větší nákupy potřebují vzorek odpovídající riziku týmu a diverzitě cílů; minimální hranice z tutoriálu nemůže nahradit vlastní návrh.

Pokud jste ve scrapingu noví a chcete si před porovnáváním vendorů nejdřív osvojit základy, náš úvod do what web scraping actually is a průvodce web scraping without coding jsou dobrým startem.
Výběr proxy API není ve skutečnosti otázka „který vendor je nejlepší“, ale spíš „která hranice produktu odpovídá mému požadovanému výstupu“ — a pak následuje pilot, který ověří, že marketingové sliby vendora obstojí na vašich skutečných cílech. Deset poskytovatelů, čtyři produktové kategorie a jeden vzorec (cena za validní výsledek) vás dostanou většinu cesty. Poslední úsek je jen o tom, že test opravdu spustíte, místo abyste věřili cizím benchmarkům.
Jestli je vaším skutečným cílem strukturovaná data, ne hromada HTML k parsování, můžete do shortlistu zařadit Thunderbit Chrome extension nebo API a před pilotem zkontrolovat aktuální limity trialu či plánu. Thunderbit YouTube kanál také nabízí produktové walkthroughs; berte je jako ukázky, ne jako nezávislý benchmark.
Další čtení
- Co je web scraping
- AI web scraping
- Web scraping bez kódování
- Alternativy k Instant Data Scraper
- Scraping LinkedIn
Časté dotazy
1. Jaký je skutečný rozdíl mezi proxy sítí a scraping API?
Surová proxy síť vám dá IP adresu a směrovací kontrolu — renderování, retry i parsování řešíte sami. Scraping API (managed nebo AI-based) přebírá větší část tohoto životního cyklu a vrací HTML, JSON nebo Markdown podle produktu. Nejde je zaměňovat a přímé porovnání cen většinou vede k zavádějícímu závěru.
2. Jak měřit „success rate“ tak, aby to opravdu dávalo smysl?
Nepočítejte HTTP 200 jako úspěch. Definujte úspěch jako „obsah nebo pole, které jsem skutečně potřeboval, byly přítomné a správné“, a pak testujte na reprezentativním vzorku skutečných cílů — ne na demo webu vendora.
3. Jak vypočítat cenu za úspěšný request?
Vydělte uvedenou cenu (za request nebo za GB) vámi naměřenou úspěšností na konkrétních cílech. Levnější provider s nižší úspěšností může po započtení retry snadno vyjít dráž — před koupí plánu si to přepočítejte.
4. Potřebuji proxy API, když chci jen strukturovaná data, ne surové HTML?
Ne nutně. Extrakční API jako Thunderbit mohou vrátit strukturované JSON a přesunout renderování i routing za služební hranici, takže možná nebudete potřebovat kupovat samostatnou surovou proxy pro tento workflow. Ověřte podporu cíle a validitu polí. Tradiční proxy produkt zůstává relevantní kategorií, když potřebujete surové odpovědi nebo kontrolu na úrovni proxy.
5. Co se mám před registrací ptát poskytovatele ohledně zdrojování IP?
Požádejte o aktuální dokumentaci k consentu a zdrojování residential IP, zásady podporovaného použití, důkazy o compliance, auditovatelnost a proces reakce, když subnet nebo cíl přestane být dostupný. Prohlášení od první strany by měla být podle rizika zkontrolována nákupem nebo právníkem; není to nezávislý audit dodavatelského řetězce.


