ChatGPT web scraping: co funguje, co se láme a co je lepší

Poslední aktualizace April 15, 2026
ChatGPT web scraping: co funguje, co se láme a co je lepší

Minulý týden mě kolega z obchodního týmu poprosil, jestli bych mu nepomohl vytáhnout kontaktní údaje z asi 200 stran business katalogu. Jeho plán? Všechno ručně kopírovat do tabulky. Navrhl jsem mu, ať zkusí ChatGPT a nechá si vygenerovat Python scraper. O dvacet minut později měl skript hotový. O třicet minut později mi psal do DM: „Fungovalo to na prvních pět stránek a pak to prostě… přestalo.“

Tenhle scénář je překvapivě častý. ChatGPT je fakt skvělý v psaní scrapingového kódu — dokud není. A většina návodů na internetu skončí ve chvíli „hele, funguje to na tomhle testovacím webu“, takže vás nechají ve štychu přesně ve chvíli, kdy narazíte na reálnou stránku s JavaScriptem, anti-bot ochranou nebo stránkováním. V tomhle průvodci ukážu, jak v praxi vypadá ChatGPT web scraping: celý workflow, pět znovupoužitelných šablon promptů, upřímný rozbor toho, kde se to láme, a co dělat, když se to rozbije — včetně no-code alternativ jako Thunderbit, které obejdou kód úplně.

Co je ChatGPT web scraping?

„ChatGPT web scraping“ znamená použít ChatGPT jako pomocníka při extrakci dat z webů. Je tu ale zásadní háček, který spousta lidí přehlíží: ChatGPT weby samo neprochází. Nedokáže otevřít URL, stáhnout HTML ani klikat přes další stránky. Umí ale vygenerovat kód — většinou v Pythonu — který to udělá, nebo zpracovat surové HTML, které mu vložíte do chatu, a vrátit strukturovaná data.

Existují dva hlavní přístupy:

  1. ChatGPT jako generátor kódu: Popíšete stránku a data, která chcete získat, a ChatGPT napíše Python skript (typicky s BeautifulSoup, Selenium nebo Playwrightem), který spustíte na vlastním počítači.
  2. ChatGPT jako parser dat: Zkopírujete surové HTML do chatu (nebo ho nahrajete přes Code Interpreter) a ChatGPT z něj vytáhne požadovaná pole do formátu JSON nebo CSV.

V obou případech jste to vy, kdo data načítá a celý proces spouští. ChatGPT je mozek, ne ruce. I s novějším prohlížečem ChatGPT Atlas (uvedeným v říjnu 2025), který umí web procházet konverzačně, dostanete odpovědi — ne strukturovanou CSV tabulku se 500 řádky produktů. Je to pomocník pro prohlížení, ne datová extrakční linka.

Proč používat ChatGPT na web scraping a pro koho to je

ChatGPT výrazně snižuje vstupní bariéru pro web scraping. Podle 2025 Stack Overflow Developer Survey84 % vývojářů AI nástroje používá nebo plánuje používat a ChatGPT vede s podílem 82 %. Publikum pro „ChatGPT web scraping“ ale nejsou jen vývojáři. Patří sem SDR, kteří skládají seznamy leadů, manažeři e-shopů sledující ceny konkurence, realitní analytici tahající data o nemovitostech i marketingové týmy, které agregují obsah.

Tady je rychlý přehled typických use caseů a kdo z nich těží:

Use CaseKdo z toho těžíCo se scrapuje
Extrakce obchodních leadůSDR, sales opsJména, e-maily, telefonní čísla z katalogů
Sledování cen konkurenceE-commerce, cenové týmyNázvy produktů, ceny, dostupnost, SKU
Průzkum trhuAnalytici, zakladateléFiremní informace, recenze, hodnocení, seznamy funkcí
Sběr realitních datMakléři, investořiCeny nemovitostí, adresy, počet pokojů/koupelen, údaje o makléři
Agregace obsahuMarketing, SEO týmyNázvy článků, URL, datum publikace, autoři

Ruční kopírování dat ze 100 stránek může zabrat 3–5 hodin. Skript vygenerovaný ChatGPT to může zvládnout za pár minut — pokud funguje. A právě to „pokud“ je pointa celého článku.

Gartner odhaduje, že do roku 2026 budou vývojáři mimo formální IT oddělení tvořit alespoň 80 % uživatelů low-code nástrojů. Lidé, kteří hledají „ChatGPT web scraping“, jsou čím dál častěji neprogramátoři, kteří chtějí data bez najímání inženýra. Pro ně je ChatGPT první zastávka — a nástroje jako Thunderbit jsou to, po čem sáhnou, když se skript odmítá rozběhnout.

Jak ChatGPT web scraping funguje: krok za krokem

Tady je celý workflow od začátku do konce, na příkladu stránky s business katalogem — ne na nějakém hračkovém webu.

  • Obtížnost: Střední (je potřeba základní jistota při spouštění Pythonu)
  • Čas potřebný: ~15–30 minut pro první scrapování
  • Co budete potřebovat: Chrome, Python prostředí (Python 3.10+), ChatGPT (stačí free verze) a cílovou URL

Krok 1: Prozkoumejte web a zjistěte, jaká data potřebujete

Otevřete stránku, kterou chcete scrapovat, v Chromu. Klikněte pravým na prvek s daty, která chcete získat (třeba název firmy), a zvolte Inspect. Tím se otevře Chrome DevTools a zvýrazní se HTML element.

Hledejte CSS selektory — třeba h2.business-name, span.phone, nebo a.website-link. Čím přesnější selektory, tím lepší bude výstup z ChatGPT. Zkopírujte si reprezentativní úryvek HTML (jednu „kartičku“ nebo „řádek“ dat), který vložíte do promptu.

Teď byste měli mít krátký seznam názvů polí (např. business_name, phone, website_url) a jejich odpovídající CSS selektory.

Krok 2: Napište detailní prompt pro ChatGPT

Tady většina návodů selhává — dají vám vágní prompt a doufají v zázrak. Kvalitní scraping prompt má šest částí:

  1. Jazyk a knihovna: „Napiš Python 3.11 skript pomocí BeautifulSoup 4.“
  2. Cílová URL: Přesná stránka, kterou chcete scrapovat.
  3. CSS selektory: U každého pole selektor z kroku 1.
  4. Formát výstupu: CSV, JSON nebo obojí.
  5. Speciální instrukce: Kódování, ošetření chyb, prodlevy.
  6. HTML úryvek: Vložte 20–40 řádků skutečného HTML stránky, aby ChatGPT viděl strukturu.

Tady je ukázkový prompt s poznámkami:

You are a senior Python engineer. Write a web scraper using Python 3.11 and BeautifulSoup 4.

Target URL: https://example.com/businesses
Goal: Extract every business card on the page and return one row per business.

Fields needed (CSS selectors in parentheses):
- business_name (h2.biz-name)
- phone (span.phone-number)
- website_url (a.biz-link, href)
- rating (div.stars[data-rating])

Output: save to businesses.csv with UTF-8 encoding and a header row.

Requirements:
- Use requests with a realistic User-Agent header
- Handle missing fields gracefully (None, not crash)
- Print the number of businesses extracted at the end
- Add a 1-second delay between requests if you loop

Here is a representative HTML snippet from the page (one business card):
<PASTE 20-40 LINES OF THE ACTUAL HTML HERE>

Tip: Přiložení HTML úryvku je jeden z největších faktorů přesnosti. ChatGPT neumí navštívit URL, takže tenhle snippet je jeho jediný zdroj pravdy.

Krok 3: Zkontrolujte a otestujte vygenerovaný kód

Nespouštějte kód z ChatGPT naslepo. Nejdřív si ho projděte. Hledejte:

  • Vymyšlené selektory: ChatGPT si občas vymyslí CSS třídy, které na stránce vůbec nejsou.
  • Chybějící knihovny: Ujistěte se, že máte pokrytý pip install requests beautifulsoup4 (nebo playwright, atd.).
  • Natvrdo zadané hodnoty: Zkontrolujte, že URL, názvy polí a cesty k souborům sedí.

Nastavte si Python virtuální prostředí, nainstalujte závislosti a spusťte skript nejdřív na malém vzorku (jedna nebo dvě stránky). Zkontrolujte CSV — jsou sloupce vyplněné? Nejsou tam prázdná místa tam, kde čekáte data?

Krok 4: Dolaďte to pomocí navazujících promptů

ChatGPT je silný v iteraci. Pokud první skript načte jen stránku 1, zeptejte se:

„Skript scrapuje jen první stránku. Můžeš doplnit stránkování, aby prošel všechny stránky? Web používá ?page=1, ?page=2 atd. Zastav se, když stránka vrátí nula výsledků, nebo po 50 stránkách.“

Když některá pole chybí, požádejte ChatGPT, aby přidal regex fallbacky pro e-maily nebo telefonní čísla. Pokud je web postavený na JS, chtějte verzi s Playwrightem. Každý navazující prompt staví na předchozím kódu — berte to jako párové programování s velmi rychlým, ale občas až příliš sebejistým kolegou.

5 kopírovatelných šablon promptů pro ChatGPT web scraping

Jiný průvodce s tímhle jsem zatím nenašel. Připravil jsem, otestoval a doladil pět prompt šablon podle scénáře. Zkopírujte je, vyměňte URL a HTML snippet a ChatGPT vám vrátí funkční kód na první pokus — nebo aspoň hodně blízko.

Šablona 1: Scraper pro listing stránku (katalogy produktů, adresáře)

Kdy použít: Jste na stránce s mnoha položkami (produkty, firmy, pracovní nabídky) a chcete jeden řádek na položku.

You are a senior Python engineer. Write a web scraper using Python 3.11 and BeautifulSoup 4.

Target URL: [YOUR URL]
Goal: Extract every item card on the page and return one row per item.

Fields needed (CSS selectors in parentheses — derived from Inspect):
- [field_1] ([selector_1])
- [field_2] ([selector_2])
- [field_3] ([selector_3])
- [field_4] ([selector_4, attribute if needed])

Output: save to items.csv with UTF-8 encoding and a header row.

Requirements:
- Use requests with a realistic User-Agent header
- Handle missing fields gracefully (None, not crash)
- Print the number of items extracted at the end
- Add a 1-second delay between requests if you loop

Here is a representative HTML snippet from the page (one item card):
[PASTE 20-40 LINES OF THE ACTUAL HTML HERE]

Očekávaný výstup: CSV soubor s jedním řádkem na položku a sloupci podle názvů polí.

Šablona 2: Scraper detailní stránky / podstránky (detail produktu nebo profilu)

Kdy použít: Máte jednu stránku s bohatým detailem (stránku produktu, profil osoby, detail nemovitosti) a chcete z ní vytáhnout všechno do jednoho strukturovaného záznamu.

Write a Python function `scrape_detail(url)` that takes a detail page URL and returns a dict with these keys:

- [field_1]
- [field_2]
- [field_3]
- [field_4]
- [field_5]

Use BeautifulSoup. Gracefully handle any missing field (return None for it).
Include regex fallbacks for email and phone — ne každá stránka je má zabalené ve stejných tagách.

Return the dict, and also append it as one row to details.csv (create the file with header on first call).

Reference HTML snippet from a real detail page:
[PASTE 40-60 LINES OF ONE DETAIL PAGE HTML]

Očekávaný výstup: Jedno dict na stránku a postupně rostoucí CSV se záznamem pro každou detailní stránku.

Šablona 3: Scraper pro dynamickou / JS renderovanou stránku (Playwright)

Kdy použít: Stránka načítá obsah přes JavaScript (React, Angular atd.) — ve zdrojovém HTML vidíte prázdný <div id="root">.

Write a Python web scraper using Playwright (sync API) for a JavaScript-rendered page.

Target URL: [YOUR URL]
Goal: extract all result cards that appear after the page finishes loading dynamically.

Requirements:
- Use `page.wait_for_selector('[YOUR CARD SELECTOR]', timeout=15000)` to wait for content
- Scroll to the bottom of the page twice with a 1-second pause between scrolls to trigger lazy-loaded results
- For each card extract: [field_1], [field_2], [field_3], [field_4]
- Save to results.json as a list of dicts, UTF-8
- Run headless=False first (so I can watch it) and add a 2-second pause at the end before closing

Do not use requests or BeautifulSoup — Playwright only.

Očekávaný výstup: JSON soubor s jedním objektem na výsledek, se všemi poli vyplněnými.

Šablona 4: Řešení stránkování (multi-page scraping)

Kdy použít: Už máte funkční scraper pro jednu stránku a potřebujete ho rozšířit na všechny stránky.

Take the existing BeautifulSoup scraper below and wrap it in a pagination loop that collects ALL pages, not just page 1.

The site uses URL-param pagination: ?page=1, ?page=2, etc.
Stop condition: when the current page yields zero items, OR when the response status is not 200, OR when you hit page 100 (safety cap).

Add:
- A 1.5-second polite delay between page requests
- A try/except around each request that logs the error and continues
- A progress print every 5 pages: "Page 15 → 300 items so far"
- Final save to items_all.csv

Existing scraper:
[PASTE YOUR CURRENT SINGLE-PAGE SCRAPER HERE]

Očekávaný výstup: Jedno CSV se všemi položkami ze všech stránek a výstup v konzoli ukazující průběh.

Šablona 5: Čištění a strukturování dat („vložit HTML“ přístup)

Kdy použít: Už máte surové HTML (z curl, z prohlížeče nebo ze souboru) a chcete, aby ho ChatGPT jen převedl na čistá strukturovaná data — bez psaní kódu.

I will paste raw HTML from a product detail page. You do not need to write code — just return the extracted data as a JSON object matching this schema:

{
  "name": string,
  "brand": string,
  "price": number,
  "currency": string (ISO 4217),
  "availability": "in_stock" | "out_of_stock" | "preorder" | "unknown",
  "rating": number (0-5) or null,
  "review_count": integer or null,
  "description": string (max 500 chars),
  "key_specs": [{"name": string, "value": string}]
}

Use null for anything you genuinely cannot find — do NOT hallucinate.
Return ONLY the JSON object, no prose, no markdown fence.

HTML:
[PASTE THE FULL PAGE HTML HERE]

Očekávaný výstup: Jediný JSON objekt připravený pro tabulku nebo databázi.

Kde ChatGPT web scraping selhává: upřímné limity

Většina návodů tuhle část úplně přeskakuje. Strávil jsem dost času laděním scraperů vygenerovaných ChatGPT, abych přesně věděl, kde to padá — a 2025 Stack Overflow survey potvrzuje, že jen 3 % vývojářů AI výstup „velmi důvěřuje“. Tady je proč.

JavaScriptové a dynamické weby

Více než 98,8 % webů používá JavaScript pro klientskou funkcionalitu. Jen React dnes běží na 7,2 % všech webů — ~67% nárůst za jediný rok. Když požádáte ChatGPT, aby „scrapoval tuhle stránku“, výchozí výstup bývá skript requests + BeautifulSoup. Ten stáhne syrové HTML — a u React nebo Angular webu je to HTML často jen prázdný <div id="root">. Skutečná data se načítají až po spuštění JavaScriptu, což requests nikdy neudělá.

ChatGPT může vygenerovat Selenium nebo Playwright kód, pokud si o něj řeknete, ale tyto skripty jsou pomalejší (Playwright má v průměru 2,9 sekundy na načtení stránky oproti podsekundovým časům u statického requests) a často vyžadují ladění wait podmínek, scroll triggerů a selektorů elementů, které ChatGPT uhádne špatně.

Anti-bot ochrany a CAPTCHA

Cloudflare chrání zhruba 20 % všech webů a služby jako DataDome tvrdí 99,9% přesnost detekce botů. Holý requests.get() s Python user-agentem je na rovinu učebnicový bot fingerprint. Skripty z ChatGPT neobsahují rotaci proxy, spoofing TLS fingerprintu, práci s cookies ani řešení CAPTCHA. Na jakémkoli komerčním webu s aspoň základní ochranou bude skript zablokovaný hned při prvním požadavku.

Stránkování a scraping ve velkém

Výchozí pagination loop v ChatGPT iteruje přes ?page=N nebo kliká na .next tlačítko. Reálné weby ale používají cursor-based stránkování, infinite scroll s IntersectionObserverem nebo GraphQL volání. ChatGPT neumí vygenerovat správný kód pro tyto případy, pokud mu neukážete přesné network call — a i pak bývají smyčky křehké. Oxylabs’ ChatGPT scraping guide i Decodo’s 2026 tutorial oba uvádějí stránkování jako místo číslo jedna, kde jejich ukázkové scrapers vyžadují druhý nebo třetí prompt.

Průběžné a plánované scrapování

ChatGPT vám dá jednorázový skript. Není tam žádný plánovač, žádná detekce změn, žádné alerty. Pokud chcete „každé ráno zkontrolovat ceny konkurence“, musíte se naučit cron, Airflow nebo Lambda — nic z toho ChatGPT ve své první odpovědi neřeší. Pro business uživatele, kteří potřebují opakovaná data, je to slepá ulička.

Problém rychlosti a nákladů

U JS-heavy webů se reálné časy na stránku při použití Selenium nebo Playwrightu pohybují ideálně kolem 3–10 sekund na stránku a při retrieích a anti-bot čekání i 40–60 sekund na stránku — frustrace, která je běžně popisovaná ve fórech a návodech.

Pokud použijete OpenAI API k parsování HTML (přístup „vložené HTML“ ve velkém), tokenové náklady rychle narostou. Při současné ceně GPT-4o (~2,50 USD / 1M vstupních tokenů, 10 USD / 1M výstupních) stojí parsování 1 000 produktových stránek zhruba 95–105 USD jen na tokenech. S GPT-4o mini je to asi 6,50 USD za stejný objem. Připočtěte náklady na proxy (3–10 USD/GB), údržbu crawleru a čas vývojáře a přístup „prostě použij ChatGPT“ začne vypadat draze.

MěřítkoOdhad nákladů na GPT-4o tokenyOdhad nákladů na GPT-4o Mini tokeny
100 stránek~$9,55~$0,65
1 000 stránek~$95,50~$6,50
10 000 stránek~$955~$65

Odhady předpokládají přibližně 50 tisíc vstupních tokenů a 2 tisíce výstupních tokenů na stránku. Skutečné náklady se liší podle velikosti stránky a složitosti výstupu.

ChatGPT web scraping vs. no-code AI scraper vs. vlastní kód: rozhodovací rámec

Ne každý scrapingový úkol potřebuje stejný nástroj. Tohle je rozhodovací rámec, který používám v Thunderbit po testování všech tří přístupů na reálných projektech.

ScénářChatGPT + PythonNo-code AI scraper (např. Thunderbit)Vlastní kód + proxy
Jednoduché statické stránky✅ Skvělé — rychlá generace✅ Funguje, ale může být zbytečně silné řešení⚠️ Zbytečně složité
JS renderovaný / dynamický obsah⚠️ Potřebuje Selenium/Playwright — kód často padá✅ Zvládá přes prohlížeč/cloud scraping✅ Plná kontrola
Weby s anti-bot / CAPTCHA❌ ChatGPT CAPTCHA nevyřeší✅ Cloud scraping infrastruktura zvládá mnoho případů✅ S rotací proxy
Stránkování (100+ stránek)⚠️ Křehké smyčky, nutné ladění✅ Vestavěná podpora stránkování✅ Robustní při správném engineeringu
Neprogramátor❌ Vyžaduje znalost Pythonu✅ 2 kliknutí, bez kódu❌ Vyžaduje programování
Pravidelné/plánované scrapování❌ Ruční znovuspouštění✅ Funkce plánovaného scrapperu✅ S cron/orchestrace
Export do Sheets/Airtable/Notion⚠️ Je potřeba další kód✅ Nativní export na kliknutí⚠️ Další integrační kód

Stručně: ChatGPT používejte pro rychlé jednorázové skripty a učení. No-code nástroj jako Thunderbit pro produkční, opakované nebo neprogramátorské scrapování. A vlastní kód + proxy pro enterprise projekty, kde potřebujete plnou kontrolu.

No-code alternativa: jak Thunderbit řeší scraping bez kódu

Pro čtenáře, kteří neprogramují — nebo už strávili dost večerů laděním ChatGPT skriptů — existuje úplně jiná cesta. ChatGPT generuje kód. Thunderbit ho vynechá.

Pracuji v Thunderbit týmu, takže to řeknu otevřeně. Ale zároveň si upřímně myslím, že je to pro většinu business uživatelů nejrychlejší cesta. Takhle ten workflow vypadá.

AI Suggest Fields: automatická detekce struktury dat na jakékoli stránce

Otevřete libovolnou webovou stránku, klikněte na Thunderbit Chrome extension a zvolte „AI Suggest Fields“. AI v Thunderbit přečte vykreslenou stránku — včetně obsahu načteného přes JS — a navrhne názvy sloupců i datové typy. Žádný Inspect, žádné CSS selektory, žádný prompt engineering. Pak už jen kliknete na „Scrape“.

Porovnejte to s přístupem přes ChatGPT: otevřít DevTools, najít selektory, napsat prompt, zkontrolovat kód, nainstalovat závislosti, spustit skript, ověřit výstup, iterovat. Thunderbit to všechno smrskne na dvě kliknutí.

Scraping podstránek pro automatické obohacení listingu

Po scrapnutí listing stránky klikněte na „Scrape Subpages“. Thunderbit navštíví detailní stránku každého řádku a doplní další pole — třeba e-mail, telefon nebo bio — do vaší existující tabulky. S ChatGPT byste potřebovali samostatný skript, smyčku, ošetření chyb pro každou podstránku a způsob, jak data sloučit. Thunderbit to zvládne v jednom kroku.

Export kamkoli: Google Sheets, Airtable, Notion, Excel

Thunderbit nabízí bezplatný export na kliknutí do Google Sheets, Airtable, Notion i Excelu — nejen do CSV. Skript vygenerovaný ChatGPT obvykle zapisuje lokální CSV nebo JSON. Poslat data do Sheets nebo Airtable znamená přidat další knihovny a autentizační kód.

Cloud scraping vs. browser scraping

Thunderbit nabízí dva režimy. Cloud scraping běží na serverech Thunderbit, zpracuje přibližně 50 stránek na dávku a je rychlý pro veřejné weby. Browser scraping využívá vaši přihlášenou relaci pro bráněné nebo přihlašovacím účtem chráněné stránky. S ChatGPT byste museli v kódu nastavovat proxy, cookies a session handling — a každá z těchto věcí je samostatné ladicí dobrodružství.

V pozadí Thunderbit přesměrovává přes více AI modelů (včetně ChatGPT, Gemini, Claude a dalších), aby vizuálně přečetl stránky a poznal, co je potřeba extrahovat. Takže do jisté míry Thunderbit už ChatGPT používá — plus tři další špičkové modely — a k tomu za vás řeší načítání, renderování, anti-bot ochranu, stránkování i export.

Reálné use casey: sales, e-commerce a reality

Většina návodů na ChatGPT scraping používá „Books to Scrape“ nebo jiný hračkový web. Tady je, jak vypadá skutečné business scrapování — a to jak přes ChatGPT, tak přes zkratku v Thunderbit.

Extrakce obchodních leadů z business katalogů

Scénář: Potřebujete jména, e-maily a telefonní čísla z business katalogu pro outbound sales.

Přístup s ChatGPT: Použijte Šablonu 1 (listing stránka) pro scrapování katalogu a pak Šablonu 2 (detailní stránka) pro návštěvu každého profilu kvůli kontaktním údajům. Budete potřebovat regex fallbacky pro e-maily a telefony, slušné prodlevy a deduplikaci. Počítejte s 30–60 minutami nastavení a ladění.

Přístup s Thunderbit: Otevřete katalog, klikněte na „AI Suggest Fields“, scrapujte listing a pak klikněte na „Scrape Subpages“, abyste vytáhli kontaktní údaje z každého profilu. Export do tabulky připravené pro CRM. Celkový čas: asi 3 minuty. Vestavěné email a phone extractory v Thunderbit zvládnou parsování automaticky.

Monitoring cen konkurence v e-commerce

Scénář: Chcete týdně sledovat ceny, dostupnost a SKU u konkurence.

Přístup s ChatGPT: Vygenerujete scraper pomocí Šablony 1, doplníte stránkování přes Šablonu 4 a každý týden ho ručně spustíte. Když konkurence změní layout stránky, selektory se rozbijí a začínáte znovu.

Přístup s Thunderbit: Nastavíte scraper jednou, použijete plánované cloud scrapingy v Thunderbit a výsledky exportujete do Google Sheets. AI si při každém spuštění znovu přečte strukturu stránky, takže změny layoutu nic nerozbijí. Více o tomhle workflow najdete v našem průvodci cenovým scrapingem.

Sběr realitních listing dat

Scénář: Potřebujete ceny nemovitostí, adresy, počet pokojů/koupelen a údaje o agentovi z realitního webu.

Přístup s ChatGPT: Většina realitních webů (styl Zillow) jsou React SPA s agresivní anti-bot ochranou. Skript requests + BeautifulSoup vrátí prázdnou stránku. Verze s Playwrightem se často během minut omezí rate limitem.

Přístup s Thunderbit: Cloud scraping s AI detekcí polí zvládá JS renderování a přizpůsobí se změnám layoutu. Realitní portály se často redesignují — AI v Thunderbit přečte stránku pokaždé znovu, takže nemusíte aktualizovat selektory. Podívejte se na náš průvodce scrapingem realitních webů.

Za hranicí jednorázového scrapování: ChatGPT API pipeline vs. Thunderbit Extract API

Pokud scraping zapojujete do produktu nebo pipeline, otázka se mění: ChatGPT API na parsování HTML, nebo specializované scraping API?

Použití ChatGPT API k parsování HTML

Postup: použijete lokální crawler (requests, Playwright) ke stažení HTML a pak ho pošlete přes OpenAI API, aby vrátil strukturovaný JSON. Je to škálovatelná varianta „vloženého HTML“.

Funguje to. Náklady a údržba jsou ale reálné. Při cenách GPT-4o stojí 1 000 stránek kolem 95 USD na tokenech. Musíte spravovat crawler, proxy, prompt engineering i výstupní schéma. Jakmile se web změní, prompt se rozbije a musíte ladit znovu.

Thunderbit Extract API: vytvořené přímo pro strukturovaná webová data

Open API v Thunderbit nabízí jiný model. Definujete JSON Schema, pošlete URL metodou POST a dostanete zpět strukturovaná data. JS renderování i anti-bot ochrana jsou součástí. Dávkové zpracování podporuje až 100 URL na request.

FunkceChatGPT API + vlastní kódThunderbit Extract API
Strukturovaný výstupSchéma je nutné ručně zadat do promptuDefinováno přes JSON Schema
JS renderováníŘešíte sami (Playwright atd.)Vestavěné (více render režimů)
Anti-bot / CAPTCHAŘešíte sami (proxy atd.)Řešeno automaticky
Dávkové zpracováníSmyčku si stavíte samiBatch endpoint (až 100 URL)
ÚdržbaPrompty se lámou, kód zastaráváSpravovaný AI engine

Pro týmy, které chtějí strukturovaná webová data jako službu bez údržby scraping pipeline, je API Thunderbit kratší cesta do produkce. Ceny kreditů za extrakci najdete v ceníku Thunderbit.

Tipy, jak z ChatGPT web scrapingu dostat lepší výsledky

Pár věcí, které jsem se naučil na vlastní kůži.

Buďte v promtech konkrétní. Vždy uveďte: programovací jazyk, knihovnu, cílovou URL, CSS selektory, formát výstupu a instrukce pro okrajové případy. Vágní prompt dává vágní kód.

Vkládejte HTML snippet, ne jen URL. ChatGPT neumí navštívit URL. HTML snippet je jeho jediný zdroj pravdy o struktuře stránky. I 20–40 řádků jedné datové kartičky dramaticky zlepší přesnost.

Požádejte ChatGPT o kontrolu a optimalizaci. Po vygenerování skriptu se zeptejte: „Zkontroluj tenhle kód na chyby, přidej error handling a optimalizuj ho pro výkon.“ Druhým průchodem si své chyby opravuje překvapivě dobře.

Vždy nejdřív testujte na malém vzorku. Spusťte skript na 1–2 stránkách, než ho pustíte ve velkém. Rozbitý selektor na první stránce vás zachrání před stovkami neúspěšných requestů.

Iterujte, nezačínejte od nuly. Pokud je první skript správný z 80 %, vložte výstup zpět a požádejte ChatGPT, aby opravilo zbývajících 20 %. Právě v iterativním dialogu je ChatGPT nejsilnější.

Etické a právní otázky při ChatGPT web scrapingu

Právní stránka je důležitá, takže stručně.

Podle současné americké judikatury není scrapování veřejně dostupných dat federálním počítačovým trestným činem. Ustanovil to rozsudek hiQ v. LinkedIn a rozhodnutí Meta v. Bright Data (leden 2024) to ještě posílilo — soudce dospěl k závěru, že scrapování veřejných, odhlášených dat z Facebooku a Instagramu neporušilo podmínky Meta, protože návštěvník bez účtu není „uživatel“ vázaný těmito podmínkami.

Scrapování dat za loginem nebo v chráněném rozhraní, případně porušení podmínek služby webu poté, co jste je odsouhlasili, ale stále může znamenat právní riziko. A když scrapujete osobní údaje (e-maily, telefonní čísla), platí bez ohledu na původ dat evropské a kalifornské zákony o ochraně osobních údajů (GDPR, CCPA).

Před scrapováním si vždy zkontrolujte robots.txt a podmínky služby. Respektujte rate limity. S osobními údaji zacházejte zodpovědně. A používejte nástroje s vestavěnými compliance funkcemi — Thunderbit například respektuje robots.txt a ve výchozím nastavení nabízí odpovědné zacházení s daty. Pro hlubší vhled se podívejte na náš právní průvodce web scrapingem.

Kdy použít ChatGPT na web scraping — a kdy sáhnout po něčem lepším

ChatGPT je fakt silný nástroj pro web scraping — generuje rychlé prototypy a pomáhá pochopit, jak scraping funguje zevnitř. Na rychlé jednorázové skripty na jednoduchých statických stránkách se mu těžko konkuruje.

Ale pro produkční, průběžné nebo rozsáhlé scrapování — zvlášť když nejsi vývojář — je purpose-built nástroj jako Thunderbit rychlejší, spolehlivější a bez údržby. A pro enterprise projekty s vlastním vývojem dává plnou kontrolu vlastní kód s proxy infrastrukturou.

Moje zjednodušené rozhodování:

  • Rychlé jednorázové použití, učení nebo prototyp: ChatGPT + Python
  • Business uživatelé, bez kódu, opakované scrapování: Thunderbit Chrome Extension
  • Vývojářské pipeline, strukturované API: Thunderbit API
  • Enterprise škála, plná kontrola: Vlastní kód + proxy + orchestrace

Pokud chceš zkusit no-code cestu, Thunderbit má bezplatný tarif, takže si můžeš vyzkoušet menší rozsah a vidět výsledky na vlastní oči. A pokud chceš vidět nástroj v akci, na našem YouTube kanálu najdeš návody pro různé use casey.

Vyzkoušejte Thunderbit pro AI web scraping Get Started Free

FAQ

Dokáže ChatGPT weby opravdu scrapovat samo?

Ne. ChatGPT generuje scrapingový kód nebo zpracuje HTML, které mu poskytneš, ale samo neotvírá URL, nestahuje stránky ani nespouští skripty. I ChatGPT Atlas (vestavěný prohlížeč uvedený v říjnu 2025) je konverzační pomocník pro prohlížení — umí stránku shrnout, ale nevrátí ti strukturované CSV se 500 řádky.

Je ChatGPT web scraping zdarma?

Free verze ChatGPT může zdarma vygenerovat scrapingový kód. Jeho spuštění ale vyžaduje Python a knihovny (zdarma), a pokud použiješ OpenAI API pro parsování HTML ve větším měřítku, zaplatíš za tokeny — zhruba 6,50 USD za 1 000 stránek s GPT-4o mini, nebo asi 95 USD s GPT-4o. Proxy a infrastruktura jsou navíc.

Jaká je nejlepší Python knihovna pro scrapers generované ChatGPT?

Pro statické HTML stránky je nejjednodušší a nejrychlejší BeautifulSoup s knihovnou requests. Pro JavaScriptem renderované stránky je moderní volba Playwright — je rychlejší než Selenium (průměrně asi 2,9 sekundy na načtení stránky oproti 4,8 sekundám) a má čistší API. Selenium dává smysl hlavně u starších projektů.

Můžu použít ChatGPT k extrakci dat bez programování?

Ne přímo. ChatGPT ti vygeneruje kód, který pak musíš spustit. Pokud chceš opravdu no-code variantu, nástroje jako Thunderbit umožňují scrapovat na dvě kliknutí — bez Pythonu, bez terminálu, bez ladění. Dostaneš AI navržená pole, export na kliknutí do Google Sheets nebo Airtable a vestavěné řešení pro JS renderování i anti-bot ochranu.

Je legální scrapovat weby pomocí kódu vygenerovaného ChatGPT?

Scrapování veřejně dostupných, odhlášených dat je podle současné americké judikatury obecně legální (hiQ v. LinkedIn, Meta v. Bright Data). Scrapování chráněného obsahu, porušení podmínek služby nebo špatné zacházení s osobními údaji (e-maily, telefonní čísla) ale může vytvořit právní riziko podle smluvního práva nebo předpisů o ochraně soukromí, jako je GDPR a CCPA. Před scrapováním si vždy zkontroluj robots.txt a podmínky webu.

Další informace

Shuai Guan
Shuai Guan
CEO ve společnosti Thunderbit | Expert na automatizaci dat s využitím AI Shuai Guan je CEO společnosti Thunderbit a absolvent inženýrského oboru na University of Michigan. Na základě téměř deseti let zkušeností v oblasti technologií a architektury SaaS se zaměřuje na převádění složitých modelů AI do praktických nástrojů pro extrakci dat bez nutnosti programování. Na tomto blogu sdílí nezkreslené a v praxi ověřené poznatky o web scrapingu a automatizačních strategiích, které vám pomohou vytvářet chytřejší datově řízené pracovní postupy. Když zrovna neoptimalizuje datové workflow, věnuje stejný důraz na detail také své vášni pro fotografii.
Obsah

Získej data z webu jen tím, že si o ně řekneš

Řekni, co potřebuješ, obyčejnou angličtinou. Nebo ještě lépe – neříkej nic.

Vyzkoušet Thunderbit zdarma
Získej data pomocí AI
Snadno přenes data do Google Sheets, Airtable nebo Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week