אולם חדשות כלשהו מפרסם כתבה כל כמה שניות, מתחרה מפיל הודעה לעיתונות בחצות, ודו"ח רגולטורי שאתם באמת צריכים לראות נקבר עכשיו בעמוד הרביעי באתר של רשות ממשלתית. אין לאף אחד עבודה לשמור על כל כך הרבה לשוניות דפדפן. בדיוק בגלל זה "news scraper" הפך לקטגוריית מוצר אמיתית — ובגלל זה גם רוב מדריכי הקנייה בנושא פשוט לא ממש מועילים.
הבעיה שחזרה אליי שוב ושוב בזמן המחקר היא כזו: רוב הרשימות של "best news scraper" בוחרות מסלול אחד ונשארות בו. מאמר אחד מדרג רק כלי SaaS ללא קוד. אחר עוסק רק בספריות Python, כאילו כל קורא בעולם יודע לכתוב Scrapy spider. אף אחת מהגישות האלה לא באמת עוזרת למי שמנסה להבין אם הוא צריך תוסף לדפדפן, API key, או סוף שבוע של pip install. לכן הרשימה הזו מחלקת את כל עשרת הכלים לשלושה מסלולים — ללא קוד/אייג'נטי, Managed API, וספריות קוד — ומאפשרת לכם לבחור לפי רמת המיומנות האמיתית שלכם וכמות המקורות שאתם צריכים לעקוב אחריהם, לא לפי מי שילם על המקום הראשון.
מה הופך News Scraper לטוב ביותר ב-2026?
יש כאן שישה דברים שבאמת חשובים, ואני משתמש בהם כמסגרת לבחינת כל כלי בהמשך:
- התאמה לקטגוריה — האם זה כלי של קליק-קליק, API מנוהל שמטפל בתשתית, או ספריית קוד שבונים עליה?
- קלות שימוש למי שאינם מפתחים — זה עולה שוב ושוב בדיוני פורום שמחפשים "web data scraper a non-engineer can actually use", וזה ממש לא נישה קטנה.
- יכולת לגדול בקנה מידה — האם הוא מסוגל להתמודד עם 20, 100 או 1,000 מקורות חדשות בלי שמישהו יצטרך לכתוב מחדש חוקים ידנית לכל מקור?
- טיפול אמיתי נגד בוטים ו-Rendering של JavaScript — לא טקסט שיווקי של "bypass מובטח", אלא מה באמת קורה כשאתר זורק עליו JavaScript, CAPTCHA או חומת תשלום.
- מודל תמחור — מנוי, קרדיטים, או תשלום לפי בקשה, והאם הכלכלה של היחידה בכלל הגיונית לנפחי חדשות.
- אפשרויות ייצוא — CSV, JSON, Sheets, Airtable, webhook — כל מה שיגרום לנתונים להגיע למקום הנכון.
אם כלי לא מצליח לעבור את רוב הסעיפים האלה במיוחד עבור שימוש של ניטור חדשות, לא משנה כמה טובים כוכבי ה-GitHub שלו נראים.
ללא קוד מול API מול קוד: איזה מסלול News Scraper מתאים לכם?

רוב רשימות ה-"top 10" מערבבות את שלוש הקטגוריות האלה כאילו הן מתחרות על אותה משרה. הן לא.
כלים ללא קוד/אייג'נטיים מיועדים למשתמשי עסק — מכירות, תפעול, מחקר, שיווק — שצריכים טבלה של כותרות וקישורים בלי לגעת בשורת קוד. Managed APIs מיועדים למפתחים שלא רוצים להפעיל בעצמם תשתיות proxy או דפדפנים headless; הם שולחים URL, מקבלים HTML או JSON, ובונים את שאר הצינור מעל זה. ספריות ומסגרות קוד מיועדות לאנשי הנדסה שרוצים שליטה מלאה על crawling, parsing, retries וכל היתר — במחיר של אחריות מלאה על התחזוקה.
Thunderbit הוא דוגמה די טובה למה שהמסלול ללא קוד באמת נראה ביום-יום. התוסף ל-Chrome של Thunderbit עובד דרך תהליך שנקרא One Click Extract — לוחצים עליו, הכלי קורא את הדף ומבין מה יש בו, ואז מציג Run Now. אם לוחצים, החילוץ מתחיל מיד. אם לא עושים כלום, הוא יתחיל לבד בכל מקרה. אין צורך לכתוב selector, ואין צורך להגדיר schema מראש. זו תשובה ישירה לתלונה על "non-engineer scraper" שרואים שוב ושוב בפורומים — אם כי, כמו כל כלי ברשימה הזו, הוא עובד רק על דפים שיש לכם הרשאה לגשת אליהם, והוא לא כלי לעקיפת paywalls.
למבט רחב יותר על איך הקטגוריה הזו התפתחה, שווה להסתכל על הפירוק שלנו של AI web scraping ועל מה "no-code" באמת אומר כש-scraper טוען שהוא כזה.
בדיקה ראשונה: האם כבר קיים RSS Feed או News API?
לפני שבונים או משלמים על משהו, כדאי לבדוק אם המפרסם כבר נותן את הנתונים בחינם. זה נשמע מובן מאליו. אנשים מדלגים על זה כל הזמן.
רוב אתרי החדשות עדיין תומכים ב-RSS או Atom feeds, שאפשר לאתר דרך תגיות <link rel="alternate"> סטנדרטיות שמוגדרות ב-WHATWG HTML spec — וה-RSS 2.0 specification עצמה ותיקה מספיק כדי, בלא מעט מדינות, להיות כבר בגיל שמותר לה לשתות. גם sitemap.xml של מפרסם, לפי Sitemaps protocol, יכול לתת לכם רשימת כתובות כתבות נקייה בלי לגעת אפילו בתפריט ניווט אחד.
מעבר למפרסמים בודדים, יש גם כמה אפשרויות אגרגציה:
- NewsAPI — API מסחרי לאיגום חדשות עם שכבת חינם למפתחים ותכניות בתשלום לייצור; בדקו את התנאים לפני שמעלים משהו שנבנה על השכבה החינמית.
- GDELT — מאגר עצום, חינמי, ראשון מסוגו, של חדשות ואירועים גלובליים עם DOC 2.0 API. הוא באמת שימושי לגילוי ולניתוח מגמות, אבל הפרויקט עצמו מפרסם הנחיות להגבלת קצב, אז לא להתייחס אליו כאל צינור בלתי מוגבל.
Scraping עדיין הוא הפתרון הנכון כשאין למקור feed, כשה-feed מדלג על השדות שאתם צריכים (למשל טקסט מלא), או כשאתם עוקבים אחרי כל כך הרבה מקורות שאתם צריכים צינור אחיד אחד במקום עשרה פורמטים שונים. רק תבדקו קודם. אלה עשר הדקות הכי זולות שתשקיעו בכל הפרויקט הזה.
סקירה מהירה של כלי ה-News Scraper הטובים ביותר
יחידות התמחור כאן לא שקולות זו לזו — קרדיטים, "successful requests", יחידות compute ומנויים קבועים מודדים דברים שונים. ודאו את המספרים העדכניים לפני שאתם מתחייבים לתקציב.
| כלי | קטגוריה | מתאים במיוחד ל | טיפול ב-JS/נגד בוטים | נדרש קוד | מודל תמחור |
|---|---|---|---|---|---|
| Thunderbit | ללא קוד / אייג'נטי | מי שאינם מפתחים וצריכים חילוץ מהיר מדפי חדשות פתוחים | נתמך בדפים תואמים ומורשים; ללא הבטחה לעקיפת paywalls קשוחים | אין | שכבה חינמית + תכניות בתשלום מבוססות קרדיטים, ראו תמחור עדכני |
| Octoparse | Scraper חזותי ללא קוד | תהליכי קליק-קליק עם תבניות | דפדפן מובנה, הגדרת AJAX ידנית | אין-נמוך | שכבה חינמית + רמות מנוי |
| Apify | פלטפורמת Actors | מפתחים שרוצים scrapers מוכנים מראש וגם מותאמים אישית בקנה מידה | תלוי ב-Actor (משתנה לפי Actor) | נמוך-בינוני | קרדיט שימוש חינם + רמות מנוי |
| Bright Data | Managed API/proxy | scraping ברמת enterprise על פני אזורים גאוגרפיים | Web Unlocker + Browser API נפרד | בינוני | תשלום לפי שימוש + רמות נפח |
| ScraperAPI | Managed API | קריאות API פשוטות ל-HTML/הרצת JS | Rendering אופציונלי, סבב proxy | נמוך (קריאת API) | רמות מנוי מבוססות קרדיטים |
| Oxylabs | Managed API/proxy | צרכי proxy בנפח גבוה ל-enterprise | Rendering + הוראות דפדפן | בינוני | תמחור לפי תוצאה |
| Crawlbase | Managed API | אתרים עתירי JS, חילוץ ממוקד-כתבה | רינדור עם token ל-JS + proxies | נמוך (קריאת API) | הקצאה חינמית + תמחור דינמי לפי דומיין |
| Scrapy | מסגרת קוד | crawlers מותאמים אישית עם שליטה גבוהה בפייתון | ידני (דורש middleware/שילוב דפדפן) | גבוה | חינמי, קוד פתוח |
| Beautiful Soup | ספריית קוד | parsing קליל של HTML לדפים סטטיים | אין (לשלב עם Requests) | גבוה | חינמי, קוד פתוח |
| Selenium | ספריית אוטומציית דפדפן | דפים שמרונדרים ב-JS או מוגנים בהתחברות | הרצת דפדפן אמיתית; ללא עקיפת CAPTCHA | גבוה | חינמי, קוד פתוח |
1. Thunderbit: News Scraper ללא קוד הטוב ביותר למי שאינם מפתחים

Thunderbit הוא כלי חילוץ מבוסס דפדפן, אייג'נטי, שנבנה עבור משתמשי עסק — צוותי מכירות, מחקר ותפעול — ולא עבור מפתחים שמחפשים צינור מותאם אישית. תהליך העבודה מכוון לפשטות: לוחצים על One Click Extract, נותנים לכלי לקרוא את הדף, ואז לוחצים Run Now (או שלא — הוא מתחיל לבד אחרי כמה שניות בכל מקרה).
תכונות מרכזיות:
- ללא צורך ב-selectors, schema או מיפוי שדות לפני הרצה
- תמיכה ב-pagination ובהעשרה של דפי משנה בדפים תואמים, שימושי במיוחד לדפוס של category page לכתבה
- ייצוא ל-Excel, Google Sheets, Airtable או Notion
- Open API נפרד לצוותים שיגדלו מעבר לזרימת העבודה בדפדפן בהמשך
התמחור כולל שכבה חינמית לצד תכניות בתשלום מבוססות קרדיטים — בדקו את עמוד התמחור הנוכחי, כי מכסות הקרדיטים ומגבלות העמודים משתנות לאורך זמן. ל-API הנפרד יש מבנה תמחור משלו, אז אל תניחו שקרדיטים של התוסף ויחידות API ניתנים להחלפה.
מתאים במיוחד ל: חוקר או אנליסט שצריך היום טבלה נקייה של נתוני חדשות, לא צינור קליטה מנוהל בעוד שישה שבועות.
יתרונות וחסרונות
יתרונות: אין צורך בקוד, הקמה מהירה, מסתגל למבנה הדף בלי כתיבה מחדש של selectors ידנית, מייצא ישירות לכלים שהצוות כבר משתמש בהם.
חסרונות: לא נבנה עבור מפתחים שרוצים שליטה גרעינית בבקשות או לוגיקת crawling מותאמת אישית. כמו כל כלי ברשימה הזו, הוא נתקע מול paywalls קשוחים ודפים שמוגנים ב-CAPTCHA — אין פתרון קסם, ולא אמור להיות. לצוותים ששוקלים אותו מול הקמה ידנית מלאה, המאמר שלנו על web scraping without coding מסביר את הפשרות בצורה עמוקה יותר.
2. Octoparse: News Scraper חזותי של קליק-קליק הטוב ביותר

Octoparse נותן למי שאינם כותבים קוד קנבס חזותי לבניית תהליכי scraping — קליקים, לולאות, כללי pagination ותנאי המתנה — בתוך דפדפן מובנה. הוא יושב רמה אחת מעל כלים אייג'נטיים מבחינת שליטה ידנית, ורמה אחת מתחת למסגרות קוד מבחינת מורכבות.
תכונות מרכזיות:
- דפדפן מובנה מבצע JavaScript ומטפל בתוכן שנטען דרך AJAX, אם כי לעיתים צריך להגדיר תזמונים ידנית
- ספריית תבניות שכוללת קטגוריית News & Media ותבנית CNN ייעודית
- ריצות מקומיות לבדיקה, לצד תזמון בענן למשימות חוזרות
- השכבה החינמית תומכת בשימוש מקומי עם עד 50,000 שורות מיוצאות בחודש במשימות מותאמות זכאיות
המחיר האמיתי הוא תחזוקה: בגלל שהתהליכים מקודדים קליקים ו-selectors ספציפיים, עיצוב מחדש של מפרסם יכול לשבור לולאה או שדה באותה צורה שבה הוא היה שובר כלל Scrapy שנכתב ידנית. התמחור כולל שכבת Local חינמית, Standard ב-$83 לחודש (או $69 לחודש בחיוב שנתי) עם שלושה תהליכי ענן במקביל, ו-Pro ב-$299 לחודש (או $249 בחיוב שנתי) עם 20 תהליכי ענן במקביל.
מתאים במיוחד ל: מי שאינם כותבי קוד שרוצים יותר שליטה מפורשת באינטראקציה עם הדף ממה שכלי אוטומטי לגמרי מציע, ושלא אכפת להם מתחזוקת תבניות מדי פעם.
3. Apify: פלטפורמת Scraping מבוססת Actors הטובה ביותר למפתחים

Apify פועל על מה שהוא קורא לו Actors — תכניות scraping ארוזות ומאוחסנות עם קלט ופלט מוגדרים. חלקן מתוחזקות על ידי Apify עצמו, אחרות על ידי הקהילה, ואפשר גם לבנות בעצמכם. זה הופך אותו פחות למוצר יחיד ויותר לשוק, וזה עובד לשני הכיוונים.
תכונות מרכזיות:
- ה-Website Content Crawler המתוחזק מייצר פלט טקסט/Markdown נקי שמתאים לחיפוש או לצינורות LLM
- קיימים Actors של Google News שנבנו על ידי הקהילה לצורכי discovery, אבל האמינות והתמחור משתנים לפי התחזוקה — כדאי לבדוק את ה-Actor המדויק לפני שבונים עליו
- Scheduling, webhooks ו-triggers דרך API למשימות חוזרות
- Dataset exports בפורמטים JSON, CSV, XML, Excel, HTML, RSS ו-JSONL
התמחור מתחיל חינם עם $5 שימוש חודשי כלולים, אחר כך Starter ב-$29 לחודש, Scale ב-$199, ו-Business ב-$999 — ועוד עלויות compute לפי שימוש ועלויות ייחודיות ל-Actor. ההוצאה הכוללת תלויה מאוד באילו Actors משתמשים והאם הם מריצים דפדפן מלא מאחורי הקלעים.
מתאים במיוחד ל: צוותים טכניים שנוח להם להעריך ולהחליף רכיבים במקום לקנות endpoint קבוע אחד.
4. Bright Data: תשתית Proxy ארגונית הטובה ביותר ל-News Scraping

Bright Data עדיף להבין כ-stack ולא כמוצר יחיד. מערכי נתונים של discovery מטפלים בחיפוש, Web Unlocker מטפל בשליפת דפים ציבוריים עם ניתוב וניהול גישה, ו-Browser API מספק דפדפן מרוחק לדפים עתירי JavaScript. אין כאן "News Scraper API" אוניברסלי אחד — אתם מרכיבים את החלקים.
תכונות מרכזיות:
- Geo-targeting רחב לגישה למהדורות אזוריות ספציפיות
- מוצרים נפרדים לשליפה ולדפדפן מלא, כך שצוותים יכולים להעלות עלות רק כשצריך
- מסירה דרך API ו-webhook לאינטגרציה בצינור
התמחור של Web Unlocker כולל 5,000 בקשות חינם בחודש, ואז תשלום לפי שימוש של $1.50 לכל 1,000 בקשות מוצלחות (ברמת $499 לחודש המחיר יורד ל-$1.30 לכל 1,000 עם 383,000 כלולים). Browser API מחויב לפי רוחב פס — החל מ-$8/GB בתשלום לפי שימוש. שווה לשים לב: בתנאים של Bright Data עצמה "successful" מוגדר לפי סטטוס תגובה, לא לפי תקינות הכתבה, אז תקצבו בהתאם.
מתאים במיוחד ל: צוותי enterprise שכבר מחזיקים לוגיקת חילוץ ואימות, וצריכים מתחתיה תשתית ניתוב חזקה.
5. ScraperAPI: ה-API הפשוט ביותר להגדלת נפח בקשות חדשות

ScraperAPI הוא שירות ה-fetch המנוהל הישיר ביותר בקבוצה הזו. שולחים URL, מקבלים HTML, טקסט או Markdown, עם אפשרות לרינדור JavaScript ולניתוב גיאוגרפי לאורך הדרך.
תכונות מרכזיות:
render=trueמפעיל Chrome headless עבור דפים שמרונדרים בצד הלקוח- קיימים parsers מובנים ליעדים מסוימים (למשל תוצאות חיפוש של Google News), אך אין parser אוניברסלי לכתבות ממפרסמים
- DataPipeline תומך במשימות מתוזמנות, low-code, שמקבלות עד 10,000 כתובות URL לריצה
- Batch requests מטפלות בעד 50,000 כתובות URL באופן אסינכרוני
התמחור מתחיל חינם עם 1,000 קרדיטים, ואז Hobby ב-$49 לחודש (100,000 קרדיטים, 20 מקביליות, ארה"ב/אירופה בלבד), ומטפס עד Business ב-$299 לחודש (3 מיליון קרדיטים, ניתוב גלובלי). חשוב לציין: עלות הקרדיטים משתנה לפי סוג הבקשה — דף רגיל עולה 1 קרדיט, אבל רינדור JavaScript עולה 10, ובקשת premium-plus-render עולה 25. ערימה של 404-ים שנכשלו יכולה לאכול בשקט את המכסה החודשית שלכם.
מתאים במיוחד ל: מפתחים שרוצים תחליף drop-in ל-HTTP requests ישירים בלי לנהל בעצמם תשתית proxy או דפדפן.
6. Oxylabs: שירות Proxy ארגוני בנפח גבוה הטוב ביותר

Oxylabs מציע את אחד ממשטחי העבודה הרחבים ביותר בין ה-APIs המנוהלים כאן: שליפת URL אוניברסלית, רינדור אופציונלי, browser instructions לקליקים ולהמתנות, parsing מותאם אישית, ו-scheduler מובנה עם תחביר cron.
תכונות מרכזיות:
- יעד מקור אוניברסלי לכתובות ציבוריות שרירותיות, לצד parser ייעודי ל-Google News לצורכי discovery
- response codes מפורטים שמבדילים בין הצלחה מלאה לבין תוכן חלקי או חסר — הרבה יותר שימושי מ-HTTP status גולמי
- מסירה לענן ל-S3, GCS ואחסון אובייקטים אחר
- ה-scheduler שלו מזהיר במפורש שתזמונים שלא נבדקו יכולים לצבור עלויות מהר, וזה חריג לטובה בעמוד תמחור
התמחור כולל תקופת ניסיון חינם (עד 2,000 תוצאות), Micro ב-$49 לחודש, Starter ב-$99 לחודש, ו-Business ב-$999 לחודש, עם ירידה במחיר לתוצאה ככל שהנפח גדל. מלכוד אחד: Oxylabs סופר כרגע תשובות 4xx כ"successful" מחייבות, כך שגם דף שלא מחזיר שום דבר שימושי עדיין יכול לעלות לכם כסף.
מתאים במיוחד ל: ארגונים שצריכים שליפה גמישה מבחינה גיאוגרפית, throughput גבוה, ומוכנים לנהל משטח API מורכב יותר.
7. Crawlbase: ה-API הטוב ביותר לפיענוח אתרי חדשות עתירי JavaScript

Crawlbase שם דגש על פלט ידידותי לכתבות יותר מרוב ה-APIs המנוהלים ברשימה הזו. ה-Crawling API מציע token רגיל לתוכן סטטי ו-token ל-JavaScript לרינדור מלא של דפדפן, בנוסף למצב readability.
תכונות מרכזיות:
md_readability=trueמחזיר Markdown שמסיר ניווטים נפוצים, סרגלי צד ועומס פרסומות, תוך ניסיון לשמור על גוף הכתבה המרכזי- Generic Extractor לחילוץ תוכן, כותרת ומטא-דאטה בלי תלות באתר
- selectors של קליקים, גלילה ושליטה בהמתנה עבור דפי JS אינטראקטיביים
- Enterprise Crawler מוסיף תור אסינכרוני עם retries עד 48 שעות — טוב ל-backfills, פחות אידיאלי להתראות חדשות דחופות
התמחור כולל עד 20,000 בקשות חינם, ולאחר מכן העלות תלויה במורכבות הדומיין היעד ולא בתעריף אחיד אחד — בדקו את המחשבון עם מקורות החדשות האמיתיים שלכם לפני תקצוב. תמיכה אסינכרונית ישירה מתועדת כרגע כ-LI-specific בלבד, אלא אם התמיכה מפעילה אותה במקומות אחרים, אז לא להניח שזה חל על כל דומיין מפרסם אקראי.
מתאים במיוחד ל: צוותים שרוצים פלט מרונדר ומבוסס-כתבה בלי לבנות parser readability בעצמם מאפס.
8. Scrapy: מסגרת הקוד הטובה ביותר לבוני News Crawlers מותאמים אישית

Scrapy הוא האופציה החזקה ביותר ברשימה הזו עבור מפתחים שרוצים באמת להחזיק crawler משלהם. זו מסגרת Python, נכון לעכשיו בגרסה 2.17.0, שמטפלת בתזמון בקשות, deduplication, retries, cookies ו-pipelines כברירת מחדל.
תכונות מרכזיות:
- CSS ו-XPath selectors דרך Parsel לחילוץ מדויק
- AutoThrottle ובקרות מקביליות לפי דומיין ל-crawling אדיב
- hooks של middleware לפרוקסי, headers ולוגיקת retry מותאמת אישית
- מדריך התוכן הדינמי שלו ממליץ לבדוק JSON מוטמע או structured data לפני שרצים לשילוב דפדפן מלא
תמחור: חינמי, קוד פתוח, בלי תשלום פר בקשה. העלות האמיתית היא חישוב, פריסה, ותורנויות on-call של מישהו. בקשות Scrapy רגילות לא מריצות JavaScript, כך שאתרים עתירי JS צריכים תוסף כמו scrapy-playwright — וכדאי לציין שגם התיעוד של Scrapy מזהיר מפני הפעלת דפדפן headless ישירות בתוך spider, כי זה יכול לעקוף middleware ו-deduplication.
מתאים במיוחד ל: צוותי הנדסה שבונים crawler ארוך-טווח, מרובה-דומיינים, שהם מתכוונים להחזיק ולתחזק בעצמם.
9. Beautiful Soup: הספרייה הקלה הטובה ביותר לדפי חדשות סטטיים

Beautiful Soup היא parser, לא crawler — הבחנה שהרבה רשימות "best scraper" מטשטשות. היא לוקחת HTML או XML שכלי אחר כבר שלף, ובונה מהם עץ שניתן לנווט בו. נכון לעכשיו היא בגרסה 4.15.0 ב-PyPI.
תכונות מרכזיות:
- תמיכה בכמה parsers (
html.parser,lxml,html5lib) עם איזונים שונים בין מהירות וסלחנות, לפי התיעוד הרשמי - תמיכה ב-CSS selectors דרך Soup Sieve בתחביר מוכר
- בדרך כלל משולבת עם ספריית Requests לצורך הבאת ה-HTTP בפועל
- מצוינת לניתוח JSON-LD או Open Graph metadata שכבר נמצאים ב-HTML הראשוני של הדף
תמחור: חינמי, קוד פתוח. אבל היא לא כוללת networking, retries, proxy rotation או ביצוע JavaScript — כי זה לא התפקיד שלה. זה הכלי הנכון כשכבר יש לצוות markup מותר ביד, ורק צריך לשלוף ממנו שדות מובנים.
מתאים במיוחד ל: מפתחים שבונים צינור קטן-עד-בינוני, כשמרכיב אחר כבר מטפל בשליפה.
10. Selenium: האוטומציה הטובה ביותר לדפדפן עבור חדשות שמרונדרות ב-JS או דורשות התחברות

Selenium מפעיל דפדפנים אמיתיים, ולכן הוא הבחירה הנכונה כש-content באמת קיים רק אחרי ש-JavaScript רץ, או כשמשימה דורשת session מורשה ומחובר. נכון לעכשיו הוא בגרסה 4.47.0.
תכונות מרכזיות:
- Selenium Manager מאתר ומאחסן אוטומטית browser drivers תואמים, וכך מפחית חיכוך בהתקנה
- אסטרטגיות המתנה מפורשות שמבוססות על תנאי הדף ולא על sleeps קבועים — דבר חשוב מאוד באתרי חדשות מודרניים שממשיכים להזריק תוכן אחרי הטעינה הראשונית
- תמיכה ב-Chrome headless דרך
--headless=newלהרצות צד שרת - יכול לפעול בתוך session מחובר ומורשה, כשהתנאים של המפרסם מאפשרים אוטומציה
תמחור: חינמי, קוד פתוח — אבל משאבי דפדפן, קונטיינרים ותחזוקת drivers הם עלויות תפעול אמיתיות, והפעלת מופע דפדפן אחד לכל כתבה היא ארכיטקטורה שגויה לכל דבר מעבר לתור חריגים קטן. תיעוד הבדיקות של Selenium עצמו ממליץ במפורש לא להפוך CAPTCHAs לאוטומטיים, וזה די מרענן לראות כלי שרוב האנשים מניחים שיכול פשוט לפרוץ כל דבר בכוח.
מתאים במיוחד ל: שכבת הסלמה צרה לדפים שתלויים ב-JS או בסשן מורשה — לא כערוץ ברירת מחדל למאות כתבות רגילות.
בקנה מידה של 100–1,000+ מקורות חדשות: למה selectors קבועים נשברים

חוקי CSS ו-XPath מקודדים הנחה: "הכותרת נמצאת במחלקה הזו." ההנחה הזו מחזיקה מעמד עד שהמפרסם משנה עיצוב, עורך A/B test לפריסה, או עובר מערכת ניהול תוכן — ואז הכלל נשבר בשקט, או גרוע יותר, מחזיר בשקט את הדבר הלא נכון. scraper יכול לדווח הצלחה ועדיין לאסוף teaser של כתבות קשורות במקום את גוף הכתבה, או את זמן העדכון במקום את זמן הפרסום המקורי. זה כשל הרבה יותר מפחיד מתוצאה ריקה, כי אף אחד לא שם לב עד שמישהו בהמשך מקבל החלטה על בסיס נתונים שגויים.
כלים מבוססי selectors סטטיים — Scrapy, Beautiful Soup, פלטפורמות ללא קוד מבוססות תבניות — כולם יורשים את הבעיה הזו. זיהוי שדות מבוסס AI או אייג'נטי, מהסוג ש-Thunderbit וכלים דומים משתמשים בו, מפחית את התלות בשמות class מדויקים על ידי ניתוח מחדש של מבנה הדף בכל ריצה במקום להסתמך על כלל קשיח. זה יתרון אמיתי בקנה מידה גדול. אבל זו לא הבטחה בלי תחזוקה — פשוט מחליפים החלטה דטרמיניסטית בהחלטה הסתברותית, ומחליפים סוג אחד של שגיאה באחר.
בקנה מידה אמיתי (100 עד 1,000+ מקורות), הפתרון הוא לא בחירת כלי קסם אחד. צריך לבנות registry של מקורות: אילו אתרים יש להם feeds, אילו צריכים scraping של HTML, אילו שדות צפויים, מגבלות קצב לכל דומיין, ומסלול בידוד לכל דבר שמחזיר דף challenge במקום כתבה. קודם feeds, אחר כך metadata מובנה, אחר כך חילוץ גנרי או מבוסס AI, ורק לבסוף חוקים ספציפיים למקור עבור החריגים החשובים ביותר, עם rendering בדפדפן שמור לדפים שבאמת צריכים אותו. גם התיעוד של Scrapy על content דינמי אומר בערך את אותו הדבר — בדקו structured data לפני שפונים לדפדפן.
אנטי-בוט ו-JS Rendering: מה כל גישה יכולה לעשות ומה לא
טקסט שיווקי בתחום הזה נוטה לטשטש חמש בעיות שונות לחלוטין לבעיה אחת: rendering בצד לקוח, מצבי אינטראקציה (קליקים, גלילה, באנרי הסכמה), בקרות קצב תעבורה, דרישות אימות, וזכויות רישוי לתוכן. רק השתיים הראשונות הן באמת בעיות rendering. לשאר אין קשר ל-JavaScript.
הנה הפירוק האמיתי, כלי אחר כלי: proxy rotation (Bright Data, Oxylabs) משנה ניתוב ויכול להפחית חיכוך של rate limiting, אבל לא מייצר הרשאה כשאין כזו. Managed rendering (Crawlbase, ScraperAPI) מריץ JavaScript כך שתוכן שמרונדר בצד לקוח אכן יופיע, אבל דף מרונדר עדיין יכול להחזיר חומת התחברות או בקשת מנוי — הרינדור רק הופך את האתגר לנראה במקום לעקוף אותו. אוטומציית דפדפן headless (Selenium) יכולה להפעיל אינטראקציות אמיתיות, אבל התיעוד של Selenium עצמו חד וברור שהוא לא נבנה כדי לעבור CAPTCHAs בכוח. גם הטיפול ברינדור ובגישה של Thunderbit עובד באותו אופן — רק דפים תואמים ומורשים, בלי שום יומרה לשבור paywall קשוח כמו אלה של אתרי מנויים גדולים.
אף אחד מעשרת הכלים במאמר הזה לא מבטיח גישה דרך CAPTCHA, חומת התחברות או paywall. מי שאומר לכם אחרת מוכר משהו שלא קיים. אם אתם ממשיכים להיתקל בחומה, הצעד הנכון הוא למצוא feed רשמי, API, או הסכם רישוי — לא להחריף את טכניקות ה-scraping שלכם.
האם זה חוקי לעשות Scrape לתוכן חדשות? זכויות יוצרים ותנאי שימוש

זו לא ייעוץ משפטי, והתוצאות באמת משתנות לפי תחום שיפוט ותרחיש שימוש — אבל יש כמה גבולות שכדאי להכיר לפני שבונים משהו.
עובדות בדרך כלל אינן מוגנות בזכויות יוצרים; ביטוי כן. U.S. Copyright Office Circular 33 ו-17 U.S.C. §102 משרטטים את הקו הזה בצורה ברורה. עובדה שפורסמה בכתבה לא הופכת מוגנת רק כי מפרסם פרסם אותה ראשון — אבל הניסוח, המבנה והצילום של המפרסם בדרך כלל כן מוגנים. זו הבחנה משמעותית במיוחד עבור news scraping, כי תוכן חדשותי (בניגוד למאגר נתונים פתוח או ספר עסקי) כמעט תמיד מוגן בצורה המובעת שלו.
Fair use הוא מבחן של כמה גורמים, לא סף של מספר מילים, לפי 17 U.S.C. §107. הסיכום של Copyright Office על Associated Press v. Meltwater הוא אזהרה מועילה כאן: שירות מסחרי לניטור חדשות שהעתיק קטעי כתבות לא הוכר כ-fair use על בסיס אותן נסיבות ספציפיות. זו לא כלל גורף נגד ניטור — זו תזכורת לכך ש"אנחנו רק מאנדקסים את זה" לא מנצח אוטומטית.
בצד דיני הגישה, פסק הדין של ה-Ninth Circuit ב-hiQ Labs v. LinkedIn והחלטת בית המשפט העליון ב-Van Buren צמצמו שניהם עד כמה חוק Computer Fraud and Abuse Act מגיע — אבל אף אחד מהם לא נותן רישיון כללי להתעלם מתנאי השימוש של מפרסם או לעקוף בקרות גישה טכניות. ו-robots.txt, שמוגדר תחת RFC 9309, מתואר במפורש כפרוטוקול, לא כמנגנון אבטחה — לכבד אותו זה נוהג טוב, אבל זו לא חותמת חוקית לכאן או לכאן.
Best practice מעשית: התמקדו בנתונים שהגישה אליהם ציבורית, הימנעו מפרסום מחדש של טקסט מלא של כתבות, שמרו על ייחוס מקור וקישורים קנוניים, והכניסו עורך דין לתמונה לפני שאתם עושים scrape לכל דבר שמאחורי paywall או בונים מוצר שמפיץ מחדש כתבות מלאות בקנה מידה.
איזה News Scraper כדאי לכם לבחור?
אם אתם לא מפתחים וצריכים מחר בבוקר טבלה של כותרות, התחילו
Learn More


