Neulich landete in unserem Postfach ein Screenshot: ein n8n-Workflow mit 14 Nodes, einer Handvoll Haftnotizen und einer Betreffzeile, die nur aus dem Wort „Hilfe“ bestand. Der Absender hatte ein populäres n8n-Tutorial zum Web Scraping durchgearbeitet, auf einer Testseite einen schicken Zehn-Zeilen-Demo-Workflow zum Laufen gebracht – und war dann daran gescheitert, echte Wettbewerberpreise über 200 Produktseiten hinweg einzusammeln. Das Resultat: eine zerbrochene Paginierungsschleife, eine 403-Fehlermauer und ein Scheduler, der nach dem ersten Dienstag wortlos den Dienst quittierte.
Genau in dieser Lücke – zwischen Demo und produktivem Pipeline-Betrieb – stranden die meisten n8n-Scraping-Projekte. Ich arbeite seit Jahren an Thunderbit und im Automatisierungsumfeld, und meine Erfahrung ist eindeutig: Das Scraping an sich ist selten das eigentliche Problem. Es ist alles, was nach dem ersten erfolgreichen Abruf kommt, woran die meisten verzweifeln. Paginierung, Zeitplanung, Anti-Bot-Schutz, Datenbereinigung, Export und – der Klassiker – Wartung, sobald die Website ihr Layout zum dritten Mal im Quartal umkrempelt. Dieser Leitfaden nimmt die komplette Pipeline auseinander: vom ersten HTTP-Request-Node bis zur wiederkehrenden, produktionsreifen n8n-Web-Scraping-Pipeline. Und überall dort, wo der Do-it-yourself-Weg von n8n an seine Grenzen kommt, zeige ich Ihnen, wo KI-gestützte Tools wie Thunderbit Ihnen Stunden – oder ganze Tage – an Frust ersparen.
Was n8n Web Scraping eigentlich ist (und warum die meisten Tutorials nur an der Oberfläche kratzen)
n8n ist eine quelloffene Automatisierungsplattform mit Low-Code-Ansatz. Denken Sie an eine visuelle Arbeitsfläche, auf der Sie „Nodes“ miteinander verbinden – jeder Node erledigt genau eine Aufgabe (eine Webseite abrufen, HTML parsen, eine Slack-Nachricht verschicken, in Google Sheets schreiben) – und daraus automatisierte Workflows zusammensetzen. Schweres Coding braucht es dafür nicht, auch wenn Sie bei Bedarf JavaScript einklinken können.
„n8n Web Scraping“ heißt: die integrierten HTTP-Request- und HTML-Nodes von n8n (plus Community-Nodes) verwenden, um Website-Daten innerhalb dieser Workflows abzurufen, zu parsen und weiterzuverarbeiten. Im Kern sind das zwei Schritte: Abrufen (der HTTP-Request-Node holt das rohe HTML einer URL) und Parsen (der HTML-Node zieht über CSS-Selektoren exakt die Datenpunkte heraus, die Sie wollen – Produktnamen, Preise, E-Mail-Adressen, was auch immer).
Die Plattform spielt mittlerweile in einer ganz anderen Liga: Stand April 2026 zählt n8n rund 184.000 GitHub-Stars, über 230.000 aktive Nutzer, mehr als 9.166 Community-Workflow-Vorlagen und veröffentlicht etwa im Wochentakt ein neues Minor-Release. Im März 2025 sammelte das Unternehmen 55 Mio. € in einer Series B ein. Hinter dem Projekt steckt also gehörig Schwung.
Es gibt allerdings einen blinden Fleck, über den kaum jemand redet. Das meistgelesene n8n-Scraping-Tutorial auf dev.to (von Lakshay Nasa, veröffentlicht unter der Organisation „Extract by Zyte“) versprach Paginierung in „Teil 2“. Teil 2 erschien tatsächlich – und das Fazit des Autors lautete sinngemäß: „N8N bietet im HTTP-Request-Node unter den Optionen einen Standard-Paginierungsmodus, und obwohl das praktisch klingt, hat er sich in meiner Erfahrung für typische Web-Scraping-Anwendungsfälle nicht zuverlässig verhalten.“ Letztlich leitete der Autor die Paginierung über eine kostenpflichtige Drittanbieter-API um. Parallel dazu berichten Nutzer im n8n-Forum immer wieder, dass „Paginierung, Throttling, Login“ genau der Moment sei, in dem n8n-Scraping „schnell kompliziert wird“. Diesen blinden Fleck räumt dieser Leitfaden aus.
Warum n8n Web Scraping für Sales-, Ops- und Ecommerce-Teams zählt
n8n Web Scraping ist kein Entwickler-Hobby, sondern ein Werkzeug fürs Geschäft. Der globale Markt für Web-Scraping-Software bewegt sich 2025 bei rund 1 bis 1,3 Milliarden US-Dollar (ca. 0,9 bis 1,2 Mrd. €) und soll bis 2030 auf 2 bis 2,3 Milliarden US-Dollar (ca. 1,8 bis 2,1 Mrd. €) zulegen. Allein dynamische Preisgestaltung nutzen schon etwa 30 % der E-Commerce-Unternehmen, und 65 % der Hedgefonds stützen sich inzwischen auf alternative Daten – viele davon aus dem Web gescraped. McKinsey beziffert den Effekt dynamischer Preisgestaltung für Anwender auf 2–5 % mehr Umsatz und 5–10 % bessere Margen.
Hier liegt die wahre Stärke von n8n: Es geht nicht bloß ums Daten-Einsammeln. Ausschlaggebend ist, was danach passiert. Mit n8n lässt sich Scraping mit Folgeaktionen in einem einzigen Workflow verketten – CRM-Updates, Slack-Warnungen, Tabellen-Exporte, KI-Analysen.
| Anwendungsfall | Wer profitiert | Was Sie scrapen | Geschäftlicher Nutzen |
|---|---|---|---|
| Lead-Generierung | Vertriebsteams | Branchenverzeichnisse, Kontaktseiten | CRM mit qualifizierten Leads fĂĽllen |
| Wettbewerber-Preisbeobachtung | Ecommerce-Operations | Produktlisten-Seiten | Preise in Echtzeit anpassen |
| Tracking von Immobilienangeboten | Immobilienmakler | Zillow, Realtor, lokale MLS-Seiten | Neue Objekte vor Wettbewerbern entdecken |
| Marktforschung | Marketing-Teams | Bewertungsportale, Foren, News | Trends und Kundenstimmung erkennen |
| Bestandsüberwachung von Lieferanten/SKUs | Supply-Chain-Teams | Produktseiten von Lieferanten | Engpässe vermeiden, Einkauf optimieren |
Die Zahlen belegen einen handfesten ROI: 92 % der Vertriebsorganisationen wollen ihre KI-Investitionen 2025 hochfahren, und automatisiertes Lead-Nurturing hat nachweislich geholfen, die Pipeline binnen neun Monaten um 61 % zu vergrößern. Wer im Team noch immer Daten per Copy-and-Paste aus Webseiten in Tabellen schaufelt, verschenkt bares Geld.
Ihr n8n-Web-Scraping-Werkzeugkasten: die wichtigsten Nodes und verfügbaren Lösungen
Bevor Sie loslegen, lohnt ein Blick in den Werkzeugkasten. Das sind die zentralen n8n-Nodes fĂĽrs Web Scraping:
- HTTP Request Node: Holt rohes HTML von jeder beliebigen URL. Funktioniert wie ein Browser, der eine Seite anfordert, liefert aber den Code statt der gerenderten Ansicht. UnterstĂĽtzt GET/POST, Header, Batching und theoretisch auch eine integrierte Paginierung.
- HTML Node (früher „HTML Extract“): Parst HTML über CSS-Selektoren, um gezielt Daten herauszuziehen – Titel, Preise, Links, Bilder, was immer Sie brauchen.
- Code Node: Erlaubt JavaScript-Snippets fĂĽr Datenbereinigung, URL-Normalisierung, Deduplizierung und individuelle Logik.
- Edit Fields (Set) Node: Strukturiert Daten um oder benennt Felder fĂĽr nachgelagerte Nodes neu.
- Split Out Node: Zerlegt Arrays in einzelne Elemente zur Weiterverarbeitung.
- Convert to File Node: Exportiert strukturierte Daten als CSV, JSON usw.
- Loop Over Items Node: Iteriert über Listen (entscheidend für Paginierung – dazu gleich mehr).
- Schedule Trigger: Startet Ihren Workflow nach Zeitplan.
- Error Trigger: Schlägt Alarm, wenn ein Workflow scheitert (im Produktivbetrieb unverzichtbar).
Für anspruchsvolleres Scraping – also Seiten mit JavaScript-Rendering oder hartnäckiger Anti-Bot-Abwehr – führt kein Weg an Community-Nodes vorbei:
| Ansatz | Am besten geeignet fĂĽr | Kenntnisstand | UnterstĂĽtzt JS-gerenderte Seiten | Anti-Bot-Handhabung |
|---|---|---|---|---|
| n8n HTTP Request + HTML-Nodes | Statische Seiten, APIs | Anfänger–Fortgeschrittene | Nein | Manuell (Header, Proxys) |
| n8n + ScrapeNinja/Firecrawl Community Node | Dynamische/geschĂĽtzte Seiten | Fortgeschrittene | Ja | Integriert (Proxy-Rotation, CAPTCHA) |
| n8n + Headless Browser (Puppeteer) | Komplexe JS-Interaktionen | Fortgeschritten | Ja | Teilweise (abhängig vom Setup) |
| Thunderbit (AI Web Scraper) | Jede Website, nicht-technische Nutzer | Anfänger | Ja (Browser- oder Cloud-Modus) | Integriert (übernimmt Browser-Sitzung oder Cloud-Verarbeitung) |
In n8n gibt es Stand v2.15.1 keinen nativen Headless-Browser-Node. Jedes Scraping von JS-gerenderten Seiten braucht also entweder einen Community-Node oder eine externe API.
Kurz zur Einordnung von Thunderbit: Das ist eine KI-gestützte Chrome-Erweiterung, die unser Team entwickelt hat. Sie klicken auf „AI Suggest Fields“, dann auf „Scrape“ und bekommen strukturierte Daten – ohne CSS-Selektoren, ohne Node-Konfiguration, ohne Wartungsaufwand. Im Lauf dieses Leitfadens zeige ich Ihnen, wo Thunderbit passt – und wo n8n die klügere Wahl bleibt.
Schritt fĂĽr Schritt: Ihren ersten n8n-Web-Scraper bauen
Der Werkzeugkasten ist sortiert – also bauen wir von Grund auf einen funktionierenden n8n-Web-Scraper. Als Beispiel dient eine Produktlisten-Seite, genau die Art von Seite, die man für Preisbeobachtung oder Wettbewerbsanalyse abgreift.
Bevor Sie anfangen:
- Schwierigkeitsgrad: Anfänger–Fortgeschrittene
- Benötigte Zeit: ca. 20–30 Minuten
- Was Sie brauchen: n8n (self-hosted oder Cloud), eine Ziel-URL, Chrome-Browser (zum Finden von CSS-Selektoren)
Schritt 1: Neuen Workflow erstellen und einen manuellen Trigger hinzufĂĽgen
Öffnen Sie n8n, klicken Sie auf „New Workflow“ und geben Sie ihm einen sprechenden Namen – etwa „Competitor Price Scraper“. Ziehen Sie einen Manual Trigger-Node hinein. (Später stellen wir auf einen geplanten Trigger um.)
Jetzt sollte ein einzelner Node auf Ihrer Arbeitsfläche liegen, startbereit, sobald Sie auf „Test Workflow“ klicken.
Schritt 2: Seite mit dem HTTP Request Node abrufen
FĂĽgen Sie einen HTTP Request-Node hinzu und verbinden Sie ihn mit dem Manual Trigger. Stellen Sie die Methode auf GET und tragen Sie Ihre Ziel-URL ein (z. B. https://example.com/products).
Jetzt kommt der entscheidende Schritt, den die meisten Tutorials unterschlagen: Setzen Sie einen realistischen User-Agent-Header. Standardmäßig sendet n8n axios/xx als User-Agent – für jeden Bot-Filter ein offenes Geständnis. Ergänzen Sie unter „Headers“ Folgendes:
| Header-Name | Wert |
|---|---|
| User-Agent | Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/124.0.0.0 Safari/537.36 |
| Accept | text/html,application/xhtml+xml,application/xml;q=0.9,/;q=0.8 |
Wenn Sie mehrere URLs scrapen, aktivieren Sie Batching (unter Optionen) und legen eine Wartezeit von 1–3 Sekunden zwischen den Requests fest. Das hält Sie unter den Rate Limits.
FĂĽhren Sie den Node aus. Im Ausgabefenster sollte rohes HTML auftauchen.
Schritt 3: Daten mit dem HTML Node parsen
Verbinden Sie einen HTML-Node mit der Ausgabe des HTTP Request Nodes. Stellen Sie die Operation auf Extract HTML Content.
Um die passenden CSS-Selektoren zu finden, öffnen Sie die Zielseite in Chrome, klicken mit der rechten Maustaste auf die gewünschte Information (z. B. einen Produkttitel) und wählen „Inspect“. Klicken Sie im Elements-Bereich mit der rechten Maustaste auf das hervorgehobene HTML-Element und wählen Sie „Copy → Copy selector“.
Konfigurieren Sie die Extraktionswerte so:
| SchlĂĽssel | CSS-Selektor | RĂĽckgabewert |
|---|---|---|
| product_name | .product-title | Text |
| price | .price-current | Text |
| url | .product-link | Attribut: href |
Führen Sie den Node aus. Im Output sollte jetzt eine Tabelle mit strukturierten Daten erscheinen – Produktnamen, Preise und URLs.
Schritt 4: Mit dem Code Node bereinigen und normalisieren
Rohdaten aus dem Scraping sind selten sauber. Preise schleppen zusätzliche Leerzeichen mit, URLs sind womöglich relativ, und Textfelder enden mit Zeilenumbrüchen. Fügen Sie einen Code-Node hinzu und verbinden Sie ihn mit dem HTML-Node.
Hier ein schlankes JavaScript-Snippet, das die Daten aufräumt:
return items.map(item => {
const d = item.json;
return {
json: {
product_name: (d.product_name || '').trim(),
price: parseFloat((d.price || '').replace(/[^0-9.]/g, '')),
url: d.url && d.url.startsWith('http') ? d.url : `https://example.com${d.url}`
}
};
});
Dieser Schritt ist für Daten in Produktionsqualität Pflicht. Lassen Sie ihn weg, und Ihre Tabelle füllt sich mit Einträgen wie „$ 29.99\n“.
Schritt 5: In Google Sheets, Airtable oder CSV exportieren
Verbinden Sie einen Google Sheets-Node (oder Airtable, oder Convert to File für CSV). Authentifizieren Sie sich mit Ihrem Google-Konto, wählen Sie Tabelle und Arbeitsblatt aus und ordnen Sie die Felder aus dem Code-Node den Spaltenüberschriften zu.
FĂĽhren Sie den kompletten Workflow aus. Die sauberen, strukturierten Daten sollten nun in Ihrer Tabelle landen.
Am Rande: Thunderbit bietet kostenlosen Datenexport nach Google Sheets, Airtable, Notion und Excel – ganz ohne Node-Setup. Wenn Sie den kompletten Workflow-Zweig gar nicht brauchen und nur die Daten wollen, ist das eine praktische Abkürzung.
Der Teil, den jedes n8n-Web-Scraping-Tutorial überspringt: vollständige Paginierungs-Workflows
Paginierung ist der größte blinde Fleck in n8n-Scraping-Inhalten – und der größte Frustfaktor in den n8n-Community-Foren.
Es gibt zwei Hauptmuster fĂĽr Paginierung:
- Klickbasierte / URL-inkrementierende Paginierung – Seiten wie
?page=1,?page=2usw. - Infinite Scroll – Inhalte laden nach, während Sie nach unten scrollen (man denke an Twitter, Instagram oder viele moderne Produktkataloge).
Klickbasierte Paginierung in n8n (URL-Inkrementierung mit Loop Nodes)
Die eingebaute Pagination-Option im Options-Menü des HTTP Request Nodes klingt bequem. In der Praxis ist sie unzuverlässig. Der Autor des bekanntesten n8n-Scraping-Tutorials (Lakshay Nasa) hat sie getestet und schrieb sinngemäß: „In meiner Erfahrung hat sie sich nicht zuverlässig verhalten.“ Im Forum berichten Nutzer, dass sie identische Seiten zurückliefert, endlos schleift und die letzte Seite nicht erkennt.

Der zuverlässige Weg: Die URL-Liste explizit in einem Code-Node erzeugen und anschließend mit Loop Over Items abarbeiten.
So geht’s:
- Einen Code-Node hinzufĂĽgen, der Ihre Seiten-URLs erzeugt:
const base = 'https://example.com/products';
const totalPages = 10; // oder dynamisch erkennen
return Array.from({length: totalPages}, (_, i) => ({
json: { url: `${base}?page=${i + 1}` }
}));
- Einen Loop Over Items-Node anhängen, um die Liste durchzugehen.
- Innerhalb der Schleife Ihren HTTP Request Node platzieren (URL auf
{{ $json.url }}setzen) und dahinter den HTML-Node zum Parsen. - Einen Wait-Node einbauen (1–3 Sekunden, zufällig), um 429-Rate-Limits aus dem Weg zu gehen.
- Nach der Schleife die Ergebnisse zusammenfĂĽhren und nach Google Sheets oder CSV exportieren.
Die komplette Kette lautet: Code (URLs bauen) → Loop Over Items → HTTP Request → HTML → Wait → (zurück zur Schleife) → Aggregieren → Exportieren.
Ein Haken: Der Loop Over Items-Node hat einen bekannten Bug, durch den verschachtelte Schleifen Elemente stillschweigend überspringen. Wenn Sie also gleichzeitig paginieren und Unterseiten anreichern, testen Sie gründlich – die „done“-Anzahl deckt sich womöglich nicht mit Ihrer Eingabezahl.
Infinite-Scroll-Paginierung: Warum die eingebauten n8n-Nodes an ihre Grenzen kommen
Infinite-Scroll-Seiten laden Inhalte per JavaScript nach, sobald Sie scrollen. Der HTTP Request Node holt nur das initiale HTML – er kann kein JavaScript ausführen und keine Scroll-Events anstoßen. Damit bleiben zwei Optionen:
- Einen Headless-Browser-Community-Node einsetzen (z. B. n8n-nodes-puppeteer oder n8n-playwright), um die Seite zu rendern und das Scrollen zu simulieren.
- Eine Scraping-API (ScrapeNinja, Firecrawl, ZenRows) mit aktiviertem JavaScript-Rendering verwenden.
Beides treibt die Komplexität spürbar nach oben. Pro Website sind 30–60+ Minuten Setup-Zeit realistisch, dazu kommt die laufende Wartung.
Wie Thunderbit Paginierung ohne Konfiguration meistert
Ich bin natĂĽrlich befangen, aber der Unterschied ist deutlich:
| Funktion | n8n (DIY-Workflow) | Thunderbit |
|---|---|---|
| Klickbasierte Paginierung | Manuelles Loop-Node-Setup, URL-Inkrementierung | Automatisch — erkennt und folgt der Paginierung |
| Infinite-Scroll-Seiten | Erfordert Headless Browser + Community-Node | Integrierte Unterstützung, keine Konfiguration nötig |
| Setup-Aufwand | 30–60 Min. pro Website | 2 Klicks |
| Seiten pro Batch | Nacheinander (eine nach der anderen) | 50 Seiten gleichzeitig (Cloud Scraping) |
Wenn Sie 200 Produktseiten über 10 paginierte Listen hinweg scrapen, geht mit n8n locker ein halber Arbeitstag drauf. Mit Thunderbit sind es etwa zwei Minuten. Das ist kein Seitenhieb gegen n8n – es ist schlicht das bessere Werkzeug für eine andere Aufgabe.
Einrichten und vergessen: Cron-getriebene n8n-Web-Scraping-Pipelines
Einmaliges Scraping ist nützlich, aber die eigentliche Stärke von n8n Web Scraping liegt in wiederkehrender, automatisierter Datenerfassung. Erstaunlicherweise behandelt fast kein n8n-Scraping-Tutorial den Schedule Trigger fürs Scraping – obwohl er zu den meistgewünschten Funktionen in der Community gehört.
Eine tägliche Preisüberwachungs-Pipeline bauen
Ersetzen Sie Ihren Manual Trigger durch einen Schedule Trigger-Node. Dafür können Sie entweder die n8n-Oberfläche nutzen („Every day at 8:00 AM“) oder einen Cron-Ausdruck (0 8 * * *).
Die komplette Workflow-Kette:
- Schedule Trigger (täglich um 8 Uhr)
- Code-Node (paginierte URLs erzeugen)
- Loop Over Items → HTTP Request → HTML → Wait (alle Seiten scrapen)
- Code-Node (Daten bereinigen, Preise normalisieren)
- Google Sheets (neue Zeilen anhängen)
- IF-Node (liegt irgendein Preis unter dem Schwellenwert?)
- Slack (bei Ja eine Warnung senden)
Bauen Sie daneben einen Error Trigger-Workflow auf, der bei jeder fehlgeschlagenen Ausführung anspringt und Slack anpingt. Sonst merken Sie erst drei Wochen später, dass die Selektoren hinüber sind – nämlich dann, wenn der Bericht leer bleibt.
Zwei Voraussetzungen, an die kaum jemand denkt:
- n8n muss rund um die Uhr laufen. Ein selbst gehosteter Laptop-Server löst nichts aus, wenn der Deckel zu ist. Setzen Sie auf einen Server, Docker oder n8n Cloud.
- Nach jeder Workflow-Änderung den Workflow einmal aus- und wieder einschalten. n8n Cloud hat ein bekanntes Problem, bei dem Scheduler nach Änderungen stillschweigend abgemeldet werden – ohne jede Fehlermeldung.
Eine wöchentliche Lead-Extraktions-Pipeline bauen
Gleiches Muster, anderes Ziel: Schedule Trigger (jeden Montag um 9 Uhr) → HTTP Request (Branchenverzeichnis) → HTML (Name, Telefon, E-Mail extrahieren) → Code (Deduplizierung, Format bereinigen) → Push an Airtable oder HubSpot.

Die Wartung ist hier der gern unterschätzte Kostenfaktor. Ändert das Verzeichnis-Portal sein Layout, brechen Ihre CSS-Selektoren, und der Workflow scheitert lautlos. HasData veranschlagt für jede selektorbasierte Pipeline 30–60 % der anfänglichen Build-Zeit pro Jahr an laufender Wartung. Sobald Sie rund 20 Websites betreuen, wird dieser Overhead spürbar.
Thunderbits Scheduled Scraper: die No-Code-Alternative
Mit Thunderbits Scheduled Scraper beschreiben Sie das Intervall in natürlicher Sprache (z. B. „jeden Montag um 9 Uhr“), tragen Ihre URLs ein und klicken auf „Schedule“. Er läuft in der Cloud – kein Hosting, keine Cron-Ausdrücke, keine stillen Abmeldungen.
| Dimension | n8n Scheduled Workflow | Thunderbit Scheduled Scraper |
|---|---|---|
| Zeitplanung einrichten | Cron-Ausdruck oder n8n-Schedule-UI | In natĂĽrlicher Sprache beschreiben |
| Datenbereinigung | Manueller Code-Node erforderlich | KI bereinigt/labelt/ĂĽbersetzt automatisch |
| Export-Ziele | Benötigt Integrations-Nodes | Google Sheets, Airtable, Notion, Excel (kostenlos) |
| Hosting-Anforderung | Self-hosted oder n8n Cloud | Keine — läuft in der Cloud |
| Wartung bei Website-Änderungen | Selektoren brechen, manuelle Korrektur nötig | KI liest die Seite jedes Mal neu ein |
Die letzte Zeile ist die wichtigste. Im Forum sagen es die Nutzer ganz offen: „Die meisten funktionieren gut, bis eine Seite ihr Layout ändert.“ Thunderbits KI-Ansatz nimmt genau diesen Schmerzpunkt heraus, weil er nicht auf starren CSS-Selektoren aufsetzt.
Wenn Ihr n8n-Web-Scraper blockiert wird: ein Leitfaden zur Anti-Bot-Fehlersuche
Blockiert zu werden ist nach der Paginierung der zweitgrößte Frustfaktor. Der Standardtipp – „füge einen User-Agent-Header hinzu“ – hilft ungefähr so viel wie ein Fliegengitter gegen einen Hurrikan.
Laut dem Imperva 2025 Bad Bot Report machen Bots inzwischen 51 % des gesamten Internet-Traffics aus, und 37 % davon sind bösartig. Anti-Bot-Anbieter (Cloudflare, Akamai, DataDome, HUMAN, PerimeterX) kontern mit TLS-Fingerprinting, JavaScript-Challenges und Verhaltensanalysen. Der n8n HTTP Request Node, der intern die Axios-Bibliothek nutzt, hinterlässt einen klar erkennbaren, browseruntypischen TLS-Fingerabdruck. Ein geänderter User-Agent-Header ändert daran nichts – der JA3/JA4-Hash verrät Sie, noch bevor überhaupt ein HTTP-Header gelesen wird.
Der Anti-Bot-Entscheidungsbaum
Hier ein systematischer Troubleshooting-Ansatz – statt bloß „User-Agent hinzufügen“:
Request blockiert?
- 403 Forbidden → User-Agent- + Accept-Header hinzufügen (siehe Schritt 2 oben) → Immer noch blockiert?
- Ja → Residential-Proxy-Rotation hinzufügen → Immer noch blockiert?
- Ja → Auf eine Scraping-API (ScrapeNinja, Firecrawl, ZenRows) oder einen Headless-Browser-Community-Node umsteigen
- Nein → Weiter
- Nein → Weiter
- Ja → Residential-Proxy-Rotation hinzufügen → Immer noch blockiert?
- CAPTCHA erscheint → Scraping-API mit integrierter CAPTCHA-Lösung nutzen (z. B. n8ns eigener Cloudflare-Turnstile-Bypass-Workflow)
- Leere Antwort (JS-gerenderter Inhalt) → Headless-Browser-Community-Node oder Scraping-API mit JavaScript-Rendering nutzen
- Rate-Limit erreicht (429-Fehler) → Batching im HTTP Request Node aktivieren, Wartezeit zwischen Batches auf 2–5 Sekunden setzen, Parallelität reduzieren
Noch ein Fallstrick: n8n hat einen bekannten HTTPS-Proxy-Bug, bei dem der HTTP Request Node HTTPS nicht sauber über einen HTTP-Proxy tunneln kann. Die Axios-Bibliothek scheitert am TLS-Handshake, während curl im selben Container anstandslos läuft. Wenn Sie einen Proxy nutzen und rätselhafte Verbindungsfehler bekommen, liegt es wahrscheinlich genau daran.
Warum Thunderbit den meisten Anti-Bot-Problemen aus dem Weg geht
Thunderbit bietet zwei Scraping-Modi:
- Browser Scraping: Läuft in Ihrem echten Chrome-Browser und übernimmt Ihre Session-Cookies, Ihren Login-Status und den Browser-Fingerabdruck. Das umgeht die meisten Anti-Bot-Maßnahmen, die serverseitige Requests blockieren – denn der Request ist ein echter Browser.
- Cloud Scraping: Für öffentlich zugängliche Websites übernimmt Thunderbits Cloud den Anti-Bot-Teil im großen Maßstab – 50 Seiten gleichzeitig.
Wer mehr Zeit mit Cloudflare als mit der Datenanalyse verbringt, findet hier die praxisnahe Alternative.
Ehrliche Einschätzung: Wann n8n Web Scraping funktioniert – und wann Sie etwas anderes nehmen sollten
n8n ist eine starke Plattform. Aber sie ist nicht für jeden Scraping-Job das richtige Werkzeug, und kein Wettbewerbsartikel ist darüber wirklich ehrlich. Im Forum fragen Nutzer ganz direkt: „Wie schwierig ist es, mit n8n einen Web-Scraper zu bauen?“ und „Welches Scraping-Tool funktioniert am besten mit n8n?“
Wo n8n Web Scraping glänzt
- Mehrstufige Workflows, die Scraping mit nachgelagerter Verarbeitung verbinden – CRM-Updates, Slack-Warnungen, KI-Analysen, Datenbank-Schreibvorgänge. Das ist n8ns Kernstärke.
- Anwendungsfälle, in denen Scraping nur ein Node in einer größeren Automatisierungskette ist – scrapen → anreichern → filtern → ins CRM senden.
- Technische Nutzer, die mit CSS-Selektoren und nodebasierter Logik vertraut sind.
- Szenarien mit individueller Datenumwandlung zwischen Scraping und Speicherung.
Wo n8n Web Scraping wehtut
- Nicht-technische Nutzer, die einfach schnell Daten brauchen. Node-Setup, das Finden von CSS-Selektoren und das Debugging sind fĂĽr Business-Anwender eine steile Lernkurve.
- Websites mit hartnäckigem Anti-Bot-Schutz. Proxy- und API-Add-ons treiben Kosten und Komplexität nach oben.
- Wartung bei Layout-Änderungen. CSS-Selektoren brechen, Workflows scheitern lautlos.
- Massen-Scraping ĂĽber viele unterschiedliche Seitentypen. Jede Website braucht ihre eigene Selektor-Konfiguration.
- Anreicherung von Unterseiten. Erfordert in n8n separate Teil-Workflows.
Direktvergleich: n8n vs. Thunderbit vs. Python-Skripte
| Faktor | n8n DIY Scraping | Thunderbit | Python-Skript |
|---|---|---|---|
| Benötigte technische Kenntnisse | Mittel (Nodes + CSS-Selektoren) | Keine (KI schlägt Felder vor) | Hoch (Programmierung) |
| Setup-Zeit pro neuer Website | 30–90 Min. | ca. 2 Min. | 1–4 Std. |
| Anti-Bot-Handhabung | Manuell (Header, Proxys, APIs) | Integriert (Browser-/Cloud-Modi) | Manuell (Bibliotheken) |
| Wartung bei Website-Änderungen | Selektoren manuell anpassen | Keine — KI passt sich automatisch an | Code manuell aktualisieren |
| Unterstützung für mehrstufige Workflows | Sehr gut (Kernstärke) | Export nach Sheets/Airtable/Notion | Benötigt eigenen Code |
| Kosten im groĂźen MaĂźstab | n8n-Hosting + Proxy/API-Kosten | Credit-basiert (ca. 1 Credit pro Zeile) | Server- + Proxy-Kosten |
| Anreicherung von Unterseiten | Manuell — separaten Teil-Workflow bauen | Unterseiten-Scraping mit 1 Klick | Eigenes Skript |
Die Kernaussage: Nutzen Sie n8n, wenn Scraping Teil einer komplexen, mehrstufigen Automatisierungskette ist. Nutzen Sie Thunderbit, wenn Sie schnell Daten brauchen, ohne Workflows bauen zu müssen. Nutzen Sie Python, wenn Sie maximale Kontrolle brauchen und Entwicklerressourcen haben. Das sind keine Konkurrenten – sie ergänzen sich.

Praxisnahe n8n-Web-Scraping-Workflows, die Sie wirklich übernehmen können
Im Forum kommt die Frage immer wieder: „Hat das schon jemand zu mehrstufigen Workflows verkettet?“ Drei konkrete Workflows – echte Node-Sequenzen, die Sie heute bauen können.
Workflow 1: Preismonitor fĂĽr Ecommerce-Wettbewerber
Ziel: Wettbewerberpreise täglich verfolgen und benachrichtigt werden, sobald sie sinken.
Node-Kette: Schedule Trigger (täglich, 8 Uhr) → Code (paginierte URLs erzeugen) → Loop Over Items → HTTP Request → HTML (Produktname, Preis, Verfügbarkeit extrahieren) → Wait (2 Sek.) → (zurück zur Schleife) → Code (Daten bereinigen, Preise normalisieren) → Google Sheets (Zeilen anhängen) → IF (Preis unter Schwelle?) → Slack (Warnung senden)
Komplexität: 8–10 Nodes, 30–60 Minuten Setup pro Wettbewerber-Website.
Thunderbit-Shortcut: Thunderbits Scheduled Scraper plus sofort nutzbare Vorlagen für beliebte Ecommerce-Seiten liefern in wenigen Minuten ähnliche Ergebnisse, samt kostenlosem Export nach Google Sheets.
Workflow 2: Pipeline zur Lead-Generierung im Vertrieb
Ziel: Wöchentlich ein Branchenverzeichnis scrapen, Leads bereinigen und kategorisieren, ins CRM pushen.
Node-Kette: Schedule Trigger (wöchentlich, Montag 9 Uhr) → HTTP Request (Verzeichnis-Listing-Seite) → HTML (Name, Telefon, E-Mail, Adresse extrahieren) → Code (Deduplizierung, Format bereinigen) → OpenAI/Gemini-Node (nach Branche kategorisieren) → HubSpot-Node (Kontakte erstellen)
Hinweis: n8n hat einen nativen HubSpot-Node – praktisch für CRM-Übertragungen. Die Scraping- und Bereinigungsschritte bleiben aber manuelle CSS-Selektor-Arbeit.
Thunderbit-Shortcut: Thunderbits kostenloser Email Extractor und Phone Number Extractor ziehen Kontaktdaten mit 1 Klick heraus, ohne dass Sie einen Workflow bauen müssen. Die KI-Labeling-Funktion kann Leads schon während der Extraktion kategorisieren. Wer die komplette Automatisierungskette nicht braucht, kann sich das n8n-Setup komplett sparen.
Workflow 3: Tracker fĂĽr neue Immobilienangebote
Ziel: Wöchentlich neue Inserate auf Zillow oder Realtor.com erkennen und eine Zusammenfassung per E-Mail verschicken.
Node-Kette: Schedule Trigger (wöchentlich) → HTTP Request (Listing-Seiten) → HTML (Adresse, Preis, Zimmer, Link extrahieren) → Code (Daten bereinigen) → Google Sheets (anhängen) → Code (mit den Daten der Vorwoche vergleichen, neue Inserate markieren) → IF (neue Inserate gefunden?) → Gmail/SendGrid (Digest senden)
Hinweis: Thunderbit hat sofort einsetzbare Scraper-Vorlagen für Websites wie Zillow – ganz ohne CSS-Selektoren. Wer die komplette Automatisierungskette (scrapen → vergleichen → alarmieren) braucht, fährt mit n8n; wer nur die Angebotsdaten benötigt, ist mit Thunderbit besser bedient.
Mehr Workflow-Ideen liefert die n8n-Community-Bibliothek mit Vorlagen fĂĽr PreisĂĽberwachung mit KI + Benachrichtigungen, Immobilien-Scraping mit Google Sheets und das Extrahieren beliebiger Webseiten in strukturiertes JSON mit ScrapeNinja + KI.
Tipps, damit Ihre n8n-Web-Scraping-Pipelines stabil laufen
Produktions-Scraping besteht zu 20 % aus Aufbau und zu 80 % aus Wartung.
Batching und Verzögerungen nutzen, um Rate Limits zu umgehen
Aktivieren Sie Batching im HTTP Request Node und setzen Sie eine Wartezeit von 1–3 Sekunden zwischen den Batches. Gleichzeitige Requests sind der schnellste Weg zur IP-Sperre. Ein bisschen Geduld erspart später jede Menge Ärger.
Workflow-AusfĂĽhrungen auf stille Fehler ĂĽberwachen
Nutzen Sie den Executions-Tab von n8n, um fehlgeschlagene Läufe zu prüfen. Gescrapte Daten können stillschweigend leer zurückkommen, wenn eine Website ihr Layout ändert – der Workflow läuft „erfolgreich“ durch, doch Ihre Tabelle füllt sich mit Leerfeldern.
Bauen Sie einen Error Trigger-Workflow auf, der bei jeder fehlgeschlagenen AusfĂĽhrung anspringt und eine Slack- oder E-Mail-Benachrichtigung schickt. FĂĽr produktive Pipelines ist das nicht verhandelbar.
CSS-Selektoren extern ablegen, um Updates zu erleichtern
Lagern Sie CSS-Selektoren in einem Google Sheet oder in n8n-Umgebungsvariablen aus, damit Sie sie aktualisieren können, ohne den Workflow selbst anzufassen. Ändert eine Website ihr Layout, passen Sie den Selektor nur an einer einzigen Stelle an.
Wissen, wann der Wechsel auf einen KI-gestützten Scraper fällig ist
Wenn Sie merken, dass Sie ständig CSS-Selektoren nachjustieren, gegen Anti-Bot-Maßnahmen ankämpfen oder mehr Zeit mit der Wartung von Scrapern als mit der Nutzung der Daten verbringen, lohnt ein Blick auf ein KI-gestütztes Tool wie Thunderbit, das die Seite jedes Mal frisch einliest und sich automatisch anpasst. Der komplementäre Stack-Ansatz hat sich bewährt: Thunderbit übernimmt die fragile Extraktionsschicht – also den Teil, der bei jedem <div>-Update zerbricht –, exportiert nach Google Sheets oder Airtable, und n8n greift die neuen Zeilen über den nativen Sheets-/Airtable-Trigger auf und übernimmt die Orchestrierung: CRM-Updates, Benachrichtigungen, bedingte Logik, Multi-System-Fan-out.
Fazit: Bauen Sie die Pipeline, die zu Ihrem Team passt
n8n Web Scraping ist stark, wenn Scraping nur ein Schritt in einem größeren Automatisierungs-Workflow ist. Dafür braucht es allerdings technisches Setup, laufende Wartung und Geduld bei Paginierung, Anti-Bot-Schutz und Zeitplanung. Dieser Leitfaden hat die komplette Pipeline abgedeckt: Ihren ersten Workflow, Paginierung (den Teil, den jedes Tutorial überspringt), Scheduling, Anti-Bot-Fehlersuche, eine ehrliche Einordnung von n8n und praxisnahe Workflows zum Kopieren.
So sehe ich das:
- Nutzen Sie n8n, wenn Scraping Teil einer komplexen, mehrstufigen Automatisierungskette ist – CRM-Updates, Slack-Warnungen, KI-Anreicherung, bedingtes Routing.
- Nutzen Sie Thunderbit, wenn Sie schnell Daten brauchen, ohne Workflows bauen zu müssen – KI übernimmt Felderkennung, Paginierung, Anti-Bot und Export mit 2 Klicks.
- Nutzen Sie Python, wenn Sie maximale Kontrolle brauchen und Entwicklerressourcen vorhanden sind.
Und ehrlich gesagt ist für viele Teams die beste Lösung beides: Thunderbit für die Extraktion, n8n für die Orchestrierung. Wenn Sie sehen wollen, wie sich KI-gestütztes Scraping in Ihrem n8n-Workflow schlägt, können Sie mit Thunderbits kostenloser Version im kleinen Rahmen experimentieren – und die Chrome-Erweiterung ist in Sekunden installiert. Video-Anleitungen und Workflow-Ideen finden Sie auf dem Thunderbit YouTube-Kanal.
Thunderbit fĂĽr KI-Web-Scraping testen Get Started Free
FAQs
Kann n8n Websites mit viel JavaScript scrapen?
Allein mit dem eingebauten HTTP Request Node nicht. Der HTTP Request Node holt rohes HTML und kann kein JavaScript ausfĂĽhren. FĂĽr JS-gerenderte Seiten brauchen Sie einen Community-Node wie n8n-nodes-puppeteer oder eine Scraping-API-Integration (ScrapeNinja, Firecrawl), die JavaScript serverseitig rendert. Thunderbit unterstĂĽtzt JS-lastige Websites nativ im Browser- und Cloud-Scraping-Modus.
Ist n8n Web Scraping kostenlos?
Die selbst gehostete Version von n8n ist kostenlos und Open Source. n8n Cloud hatte früher einen Free-Tarif, bietet Stand April 2026 aber nur noch eine 14-tägige Testphase – danach starten die Pläne bei 24 US-Dollar pro Monat (ca. 22 €/Monat) für 2.500 Ausführungen. Das Scrapen geschützter Websites kann zusätzlich kostenpflichtige Proxy-Dienste erfordern (5–15 US-Dollar/GB, ca. 4,50–14 €/GB, für Residential Proxies) oder Scraping-APIs (49–200+ US-Dollar/Monat, ca. 45–185+ €/Monat, je nach Volumen).
Wie unterscheidet sich n8n Web Scraping von Thunderbit?
n8n ist besser für mehrstufige Automatisierungen, bei denen Scraping nur ein Teil eines größeren Workflows ist (z. B. scrapen → anreichern → filtern → ins CRM pushen → per Slack alarmieren). Thunderbit ist besser für schnelle No-Code-Datenextraktion mit KI-gestützter Felderkennung, automatischer Paginierung und ohne Wartungsaufwand, wenn sich Websites ändern. Viele Teams kombinieren beides – Thunderbit für die Extraktion, n8n für die Orchestrierung.
Kann ich mit n8n Daten von Websites scrapen, die ein Login erfordern?
Ja, aber dafür müssen Cookies oder Session-Tokens im HTTP Request Node konfiguriert werden, was in der Wartung knifflig sein kann. Thunderbits Browser-Scraping-Modus übernimmt automatisch die eingeloggte Chrome-Sitzung des Nutzers – wenn Sie eingeloggt sind, kann Thunderbit das scrapen, was Sie sehen.
Was tun, wenn mein n8n-Scraper plötzlich keine Daten mehr liefert?
Prüfen Sie zuerst den Executions-Tab von n8n auf Fehler. Die häufigste Ursache ist eine Layout-Änderung der Website, durch die Ihre CSS-Selektoren kaputtgegangen sind – der Workflow läuft „erfolgreich“, gibt aber leere Felder zurück. Überprüfen Sie Ihre Selektoren mit dem Inspect-Tool in Chrome, aktualisieren Sie sie im Workflow (oder in Ihrem externen Selektor-Sheet) und testen Sie erneut. Wenn Sie gegen Anti-Bot-Sperren laufen, folgen Sie dem Troubleshooting-Entscheidungsbaum in diesem Leitfaden. Für langfristige Zuverlässigkeit lohnt ein KI-gestützter Scraper wie Thunderbit, der sich automatisch an Layout-Änderungen anpasst.
Mehr erfahren


