الويب يصير أعقد سنة بعد سنة، وفي المقابل تظل الفجوة بين "أحتاج هذه البيانات" و"أعرف كيف أجيبها" مزعجة بشكل واضح. بالنسبة للمبتدئ، يكون السؤال الأول غالبًا بسيطًا: هل لازم فعلًا أتعلم Python فقط عشان أستخرج أسعار المنتجات من موقع؟
والجواب، ولحسن الحظ، لا. لكن السؤال اللي يجي بعده—أي أداة أستخدم فعلًا؟—هنا تبدأ الحيرة. عندك تطبيقات سطح مكتب بدون كود، وملحقات للمتصفح، وأطر عمل لـ Python، ومكتبات لـ Go، وروبوتات SEO، وواجهات API مُدارة، ومشاريع مفتوحة المصدر كلها متداخلة مع بعضها. ومن بين عشر خيارات قوية متاحة في 2026، تبرز الأدوات اللي تهم المبتدئ فعلًا: كم تحتاج برمجة، كم بسرعة توصل إلى بيانات قابلة للاستخدام، هل تقدر تتعامل مع المواقع الثقيلة بـ JavaScript، ماذا تحصل مجانًا، وأي حالة استخدام تناسبك فعلًا. سواء ما كتبت سطر كود واحد من قبل أو كنت مطور مبتدئ تدور على أول إطار عمل للزحف، هنا بتلقى نقطة بداية مناسبة.
كيف اخترنا أفضل برامج زحف الويب للمبتدئين
"مبتدئ" ما يعني "غير تقني". المقصود هو أي شخص ما سبق له بنى سير عمل كامل لزحف الويب—وهذا يشمل حتى اللي يعرف يكتب Python أو JavaScript بسيط، لكنه ما تعامل قبل مع طابور عناوين URL أو ملف robots.txt.
تم تقييم كل أداة وفق ستة أبعاد ترتبط مباشرةً بالأسئلة اللي يسألها المبتدئون فعلًا في المنتديات:
- هل يتطلب كودًا؟ — لا، أو Python/JS أساسي، أو مستوى متوسط+
- صعوبة الإعداد — من لحظة التثبيت إلى أول بيانات مفيدة
- عرض JavaScript — هل يقدر يتعامل مع تطبيقات SPA والصفحات اللي تُحمَّل ديناميكيًا؟
- سخاء الخطة المجانية — وش تحصل قبل الدفع؟
- صيغ الإخراج — CSV، JSON، Excel، Google Sheets، وغيرها
- أفضل حالة استخدام — السيناريو اللي يبدع فيه هذا الخيار للمبتدئ
القائمة تمتد عبر ثلاث فئات مهارية: بدون كود (برمجة صفرية)، متوسط (Python أو JavaScript أساسي)، ومبتدئ متقدم (Go أو معرفة أعمق بالإطارات البرمجية). وحاولت أكون واضحًا جدًا في نقاط القوة والضعف لكل أداة—لأن اختيار الزاحف الخطأ بالنسبة لمستواك هو أسرع طريقة لتضييع فترة بعد الظهر.
اختر أول زاحف ويب لك: مخطط قرار سريع

قبل ما تقرأ عشر مراجعات للأدوات، جاوب عن ثلاثة أسئلة. تقاطع الإجابات بيوصلك إلى أداة أو أداتين مناسبين.
السؤال 1: كم أنت مرتاح مع البرمجة؟
- ولا شيء → انتقل إلى السؤال 2a
- Python أساسي → انتقل إلى السؤال 2b
- JavaScript/TypeScript → انتقل إلى السؤال 2c
- Go → Colly
السؤال 2a (بدون كود): ما هدفك الأساسي؟
- استخراج بيانات عامة (معلومات منتجات، قوائم عملاء محتملين، بحث) → Thunderbit أو Octoparse
- تدفقات معقدة متعددة الخطوات (تسجيل دخول، قوائم منسدلة، تمرير لا نهائي) → ParseHub أو Octoparse
- تدقيق SEO → Screaming Frog
السؤال 2b (Python): ما هدفك الأساسي؟
- خط أنابيب للـ AI/LLM (RAG، تدريب شات بوت) → Crawl4AI أو Firecrawl
- زحف منظم واسع النطاق لمواقع ثابتة غالبًا → Scrapy
- أتمتة المتصفح على مواقع ثقيلة بـ JS → Playwright (لكن جهّز نفسك تبني منطق الزحف بنفسك)
السؤال 2c (JavaScript/TypeScript): ما هدفك الأساسي؟
- زحف حديث لمواقع SPA مع تقليل الحظر → Crawlee
- تفاعل متقدم مع المتصفح (تسجيل دخول، نقرات، لقطات شاشة) → Playwright
- Markdown نظيف لإدخاله في أنظمة AI → Firecrawl (عبر API/SDK)
فلتر الميزانية: إذا كنت تحتاج أداة بتكلفة 0 دولار وتقدر تستضيفها بنفسك، فالأدوات مفتوحة المصدر هنا (Scrapy وCrawlee وCrawl4AI وPlaywright وColly) ما تفرض عليك حصة صفحات من المورّد، مع بقاء قيود الحوسبة وعرض النطاق والتخزين والصيانة والموقع المستهدف موجودة. أما إذا ما تقدر تستضيف بنفسك، فـ Octoparse وParseHub وThunderbit وFirecrawl وScreaming Frog كلها توفر مسارًا مجانيًا مع حدود مختلفة.
هذا المخطط وحده ممكن يوفر عليك ساعات من التنقل بين النوافذ. احفظه عندك.
أفضل برامج زحف الويب للمبتدئين في لمحة
هنا جدول المقارنة الكامل. يوضح "هل يتطلب كودًا" اللغة المطلوبة إن وجدت. و"JS Rendering" يبيّن إذا كانت الأداة تقدر تتعامل مع الصفحات اللي تُحمَّل عبر JavaScript. أما "الخطة المجانية" فتختصر ما تحصل عليه مجانًا. والمراجعات التفصيلية بعدها مباشرة.
| الأداة | مستوى المهارة | هل يتطلب كودًا | عرض JS | الخطة المجانية | الأفضل لـ |
|---|---|---|---|---|---|
| Octoparse | مبتدئ | لا شيء | ✅ مدمج | خطة مجانية: 10 مهام، تشغيل محلي فقط، 10 آلاف صف/تصدير | استخراج منظم بنظام النقر من مواقع ذات بنية واضحة |
| ParseHub | مبتدئ | لا شيء | ✅ مدمج | 5 مشاريع عامة، 200 صفحة لكل تشغيل، احتفاظ لمدة 14 يومًا | تدفقات معقدة متعددة الصفحات بدون كود |
| Thunderbit | مبتدئ | لا شيء | ✅ عبر المتصفح | مستوى مجاني (تحقق من الحدود الحالية) | استخراج بمساعدة AI من الصفحة التي تتصفحها |
| Crawl4AI | متوسط | Python | ✅ Chromium | مفتوح المصدر (استضافة ذاتية) | زحف جاهز للـ LLM من أجل مسارات RAG |
| Firecrawl | متوسط | API/SDK | ✅ مُدار | 1000 رصيد/شهر (سحابي) | إخراج Markdown نظيف لإدخاله في AI |
| Scrapy | متوسط | Python | ⚠️ يحتاج إضافة | مفتوح المصدر (BSD) | مشاريع زحف HTTP كبيرة وقابلة للتخصيص |
| Crawlee | متوسط | JS/TS أو Python | ✅ عبر Playwright | مفتوح المصدر (Apache) | زحف حديث بـ JS مع تقليل الحظر |
| Playwright | متوسط | Python/JS/Java/.NET | ✅ أصلي | مفتوح المصدر (Apache) | أتمتة المتصفح والتفاعل مع مواقع ثقيلة بـ JS |
| Screaming Frog | مبتدئ | لا شيء | ✅ (مدفوع فقط) | 500 عنوان URL/زحف (مجاني دائمًا) | تدقيق SEO والتحليل التقني للموقع |
| Colly | مبتدئ متقدم | Go | ⚠️ لا يوجد مدمج | مفتوح المصدر (Apache) | زحف HTTP سريع وخفيف ومتزامن |
والآن للتفاصيل.
1. Octoparse

Octoparse هو منشئ مهام سطح مكتب بدون كود مع تنفيذ سحابي مدفوع اختياري. كل اللي عليك تسويه هو لصق الرابط، ثم Auto-detect يلتقط تلقائيًا حقول البيانات المتكررة وأنماط التنقل، بعدها تراجع المعاينة، ثم تشغّل المهمة محليًا. المحرر المرئي يدعم سير العمل بالحلقات والفروع والترقيم والتمرير اللانهائي وAJAX والنماذج والقوائم المنسدلة—مع أن التدفقات الديناميكية قد تحتاج أحيانًا إلى ضبط يدوي للتوقيت.
الميزات الرئيسية:
- Auto-detect لحقول البيانات والتنقل بين الصفحات
- عرض JavaScript مدمج عبر المتصفح الداخلي
- مئات القوالب الجاهزة للمواقع الشائعة
- تدفقات عمل قابلة للتعديل مع حلقات وفروع وعناصر تحكم مخصصة للاختيار
- تصدير إلى Excel وCSV وHTML وJSON وXML وGoogle Sheets وقواعد البيانات (حسب الخطة)
التسعير: الخطة المجانية المحدودة تدعم التشغيل المحلي. أما التنفيذ السحابي والجدولة وتدوير IP والوصول إلى API فتحتاج خطة مدفوعة. تأكد من الأسعار الحالية قبل الالتزام، لأن حدود الخطط تتغير.
الأفضل لـ: المبتدئين اللي يبغون استخراجًا منظمًا ومتكررًا من مواقع التجارة الإلكترونية أو الأدلة أو القوائم، بدون كتابة كود. وهو أقل ملاءمة إذا كنت تحتاج سهولة ملحق المتصفح أو صيغ إخراج جاهزة للـ LLM.
2. ParseHub

ParseHub هو أداة استخراج مرئية قابلة للتنزيل لأنظمة Windows وmacOS وLinux (عبر AppImage). واجهته القائمة على شجرة أوامر تسمح لك بنمذجة التحديدات والنقرات ومدخلات النماذج والتمرير وقوالب الصفحات. ويدعم AJAX/JavaScript والقوائم المنسدلة والألسنة والنوافذ المنبثقة والترقيم ونماذج تسجيل الدخول والتمرير اللانهائي.
الميزات الرئيسية:
- شجرة أوامر مرئية لتدفقات الاستخراج متعددة الخطوات
- يتعامل مع AJAX وJavaScript والقوائم المنسدلة والألسنة والتمرير اللانهائي
- تطبيق سطح مكتب متعدد المنصات (Windows وmacOS وLinux)
- وصول إلى API لاسترجاع البيانات برمجيًا
- تصدير CSV وJSON
التسعير: توجد خطط مجانية ومدفوعة. قد تكون "الصفحة" المحتسبة قابلة للفوترة عبارة عن عنوان URL أو تحميل محتوى ديناميكي يتم تشغيله بنقرة أو تمرير، لذلك عدد الصفحات المسموح به ما يساوي دائمًا عدد عناوين URL نفسها. تحقق من حدود المشروع والتشغيل والاحتفاظ الحالية قبل اختيار الخطة.
تنبيه خصوصية: لا تحط بيانات اعتماد الإنتاج في زاحف تابع لطرف ثالث قبل ما تراجع كيف تخزن الأداة مدخلات تسجيل الدخول وبيانات المشروع. استخدم حساب اختبار محدود أثناء التقييم.
الأفضل لـ: المبتدئين الذين يحتاجون استخراج مواقع ديناميكية ومتعددة الخطوات—مثل المواقع ذات التنقل المعقد أو القوائم المنسدلة أو التحميل بالتمرير—بدون كتابة كود.
ParseHub مقابل Octoparse: الفروق الأساسية
كلاهما أدوات سطح مكتب بدون كود ويدعمان JavaScript. نموذج شجرة الأوامر في ParseHub يعطيك تحكمًا أوضح في التدفقات متعددة الخطوات—وهذا مفيد للتنقل المعقد، لكنه أصعب قليلًا في البداية للمهام البسيطة. أما Auto-detect في Octoparse فهو أسرع للمواقع المنظمة المباشرة، ويوفر حدود تصدير أكثر سخاءً في الخطة المجانية. إذا كان موقعك المستهدف يعتمد غالبًا على الجداول والقوائم، ابدأ بـ Octoparse. أما إذا كنت تحتاج لنمذجة سلسلة من النقرات وملء النماذج والتنقل الشرطي، فقد تكون طريقة ParseHub أوضح.
3. Thunderbit

Thunderbit هو ملحق متصفح ذكي لاستخراج بيانات الويب لـ Chrome وEdge، ومصمم لمستخدمي الأعمال غير التقنيين الذين يريدون استخراج البيانات من الصفحة اللي يشاهدونها أصلًا. (إفصاح كامل: أعمل في Thunderbit، لذلك بكون صريحًا بشأن نقاط القوة والقيود على حد سواء.)
الميزات الرئيسية:
- One Click Extract يكتشف الأعمدة تلقائيًا بناءً على محتوى الصفحة
- أوامر AI على مستوى الحقل للتصنيف والترجمة والتنسيق والتوحيد أثناء الاستخراج
- تصدير إلى Excel/CSV وGoogle Sheets وAirtable وNotion
- يعمل Browser Mode مع الجلسة المعروضة لدى المستخدم، ويتعامل مع المحتوى المحمّل بـ JavaScript على الصفحات المتوافقة
- لا حاجة لتثبيت برنامج إضافي خارج ملحق المتصفح
التسعير: الخطة المجانية الحالية تشمل 6 صفحات شهريًا بحد أقصى 30 رصيدًا لكل صفحة. خطة Starter بسعر 15 دولارًا/شهر أو 9 دولارات/شهر عند الدفع السنوي تضيف الترقيم، واستخراج الصفحات الفرعية، والاستخراج المجمع، والإثراء، والزواحف الجاهزة، والجداول الزمنية. تحقق من الأسعار الحالية هنا.
قيود مهمة: Thunderbit موجّه للصفحات/المخططات، وليس لزحف استكشاف كامل للنطاق. الترقيم واستخراج الصفحات الفرعية من مزايا Starter وليس الخطة المجانية. كما لازم دائمًا تراجع الحقول المقترحة بالذكاء الاصطناعي قبل تشغيل أي عملية استخراج—فالمقترحات جيدة، لكنها ليست معصومة.
الأفضل لـ: فرق المبيعات والعمليات والبحث التي تحتاج بيانات منظمة من الصفحة المفتوحة في المتصفح، مع مساعدة AI لتجاوز الإعداد اليدوي للحقول. إذا كنت تبحث عن طريقة سريعة لاستخراج جدول أو قائمة أو مجموعة سجلات من صفحة متوافقة وتصديرها إلى جدول بيانات، فهذا أسرع مسار أعرفه.
لمزيد من التفاصيل حول كيفية عمل الاستخراج بمساعدة AI عمليًا، راجع دليلنا عن استخراج الويب بالذكاء الاصطناعي.
تجاوز الكود وابدأ بنقرة واحدة يقرأ زاحف Thunderbit الذكي أي صفحة ويحدد الحقول بنفسه، بدون الحاجة إلى كود — خيار ممتاز كبداية للمبتدئين. Get Started Free
4. Crawl4AI

Crawl4AI هو زاحف Python مفتوح المصدر يعتمد على المتصفح أولًا، ومصمم لإنتاج مخرجات نظيفة لمسارات عمل نماذج اللغة الكبيرة. يخرج HTML الخام والنظيف، وعدة نسخ من Markdown، ومحتوى مستخرجًا منظّمًا، وروابط، ووسائط، وجداول، ولقطات شاشة، وPDF، وMHTML.
الميزات الرئيسية:
- AsyncWebCrawler مع Chromium/Playwright في الخلفية
- صيغ إخراج متعددة محسّنة لمسارات RAG وتدفقات الوكلاء
- زحف تكيفي يقيم التغطية والاتساق والتشبع لتحديد أولويات الروابط ذات الصلة والتوقف عند جمع ما يكفي من المعلومات
- استخراج اختياري باستخدام LLM محليًا عبر Ollama أو عبر APIs سحابية
- رخصة Apache-2.0 مع متطلب إضافي لنسبة المصدر
التسعير: مفتوح المصدر بالكامل—من دون رسوم لكل صفحة. أنت تستضيف البنية التحتية وتدفع فقط مقابل استدلال LLM إذا استخدمته (محليًا أو سحابيًا).
القيود: يتطلب معرفة بـ Python async وباعتماديات المتصفح. جودة الاستخراج تعتمد على نموذج LLM المستخدم إن وُجد. الزاحف التكيفي يفضل الروابط ذات الصلة باستخدام إشارات كفاية المعلومات—لكنه لا يتعلم بشكل دائم أو يصلح محددات CSS ذاتيًا.
الأفضل لـ: مستخدمي Python المتوسطين الذين يبنون خطوط بيانات AI ويريدون تحكمًا كاملًا وتكلفة صفرية لكل طلب من المورّد.
5. Firecrawl

Firecrawl هو API مُدار لبيانات الويب (مع SDKs لـ Python وNode.js) وقاعدة كود مفتوحة المصدر مرخصة AGPL للاستضافة الذاتية. خدمته السحابية تتكفل بعرض JavaScript وإرجاع Markdown والملخصات وHTML والروابط والصور ولقطات الشاشة وJSON وتتبع التغييرات.
الميزات الرئيسية:
- نقطة نهاية
/crawlمع مرشحات المسار، وعمق الاكتشاف، وخرائط الموقع، والحدود، والتأخيرات، وضوابط التزامن - عرض JavaScript تلقائيًا على السحابة المُدارة
- صيغ إخراج متعددة تشمل Markdown نظيفًا
- نقطة نهاية
/mapلاكتشاف بنية الموقع بسرعة - مسارات Browser/Interact وagent beta للتفاعل متعدد الخطوات (منفصلة عن الزحف الأساسي)
التسعير: الخطة السحابية المجانية تشمل 1000 رصيد شهريًا مع طلبين متزامنين وحدود معدل منخفضة. الخطط المدفوعة تعتمد على الرصيد/التزامن—راجع صفحة الأسعار للأرقام الحالية. أما الاستضافة الذاتية فتنقل البنية التحتية والصيانة عليك، ولا تشمل كل ميزات السحابة المُدارة.
القيود: الزحف الأساسي عبر /crawl يكتشف الروابط وخرائط الموقع بشكل تكراري، لكنه لا يضمن التعامل مع ترقيم يعتمد على النقرات بشكل عام. تتغير تكلفة الرصيد حسب نوع العملية. كما تختلف الميزات بين النسخة المستضافة ذاتيًا ونسخة السحابة.
الأفضل لـ: المستخدمين المتوسطين الذين يحتاجون إلى إدخال محتوى المواقع في LLMs أو الشات بوتات أو قواعد المعرفة، ويريدون خدمة مُدارة بدلًا من استضافة حزمة متصفح بأنفسهم.
Firecrawl مقابل Crawl4AI: أيهما أفضل لمسارات AI؟
Firecrawl يتفوق في تحويل Markdown المُدار عبر API بشكل نظيف—ترسل رابطًا وتستلم إخراجًا منظمًا. أما Crawl4AI فيتفوق عندما تريد تشغيلًا محليًا تتحكم فيه بالمتصفح وبـ LLM اختياري. إذا كنت تريد أقل قدر من إدارة البنية التحتية، فالسحابة في Firecrawl هي الأسهل. وإذا كنت تريد استضافة ذاتية كاملة بدون رسوم لكل صفحة، وتعرف تتعامل مع Python async، فإن Crawl4AI يمنحك تحكمًا أكبر.
6. Scrapy

Scrapy هو إطار العمل العريق في Python للزحف والاستخراج، بترخيص BSD، ومبني على محرك Twisted غير المتزامن. يوفر جدولة الطلبات، وتتبع الروابط، وإزالة التكرار، والوسائط البرمجية، وإعادة المحاولة، وتحديد السرعة، ومسارات المعالجة، وتصدير الخلاصات إلى JSON وJSON Lines وCSV وXML وpickle وmarshal.
الميزات الرئيسية:
- معالجة غير متزامنة للطلبات، مناسبة لعمليات الزحف الكبيرة والمحدودة بعناية
- منظومة غنية من الوسائط البرمجية (proxies، إعادة المحاولة، تقليل السرعة، رؤوس مخصصة)
- بنية مسارات منظمة لتنظيف البيانات وتخزينها
- مجتمع ضخم وتوثيق وإضافات خارجية كثيرة
- مفتوح المصدر بالكامل (ترخيص BSD)
القيود: ما فيه عرض JavaScript مدمج. وإرشادات المحتوى الديناميكي الرسمية توصي بالعثور على مصدر البيانات الأساسي عندما يكون ممكنًا، أو دمج مكوّن متصفح/عرض بشكل مقصود (مثل scrapy-playwright). كما أن البنية—spiders والوسائط البرمجية وitem pipelines والإعدادات—تحتاج تعلّم حقيقي.
التسعير: مجاني. أنت تستضيفه بنفسك.
الأفضل لـ: مستخدمي Python المتوسطين الذين يحتاجون إلى زحف واسع النطاق لمواقع ثابتة أو معروضة من الخادم في الغالب.
البدء مع Scrapy: شرح سريع مع تعليقات
هذا هو المسار الأدنى من التثبيت إلى أول بيانات:
pip install scrapy
scrapy startproject beginner_crawl
cd beginner_crawl
scrapy genspider example example.com
افتح beginner_crawl/spiders/example.py وعدّل الملف:
import scrapy
class ExampleSpider(scrapy.Spider):
name = "example"
allowed_domains = ["example.com"] # ابقَ ضمن هذا النطاق فقط
start_urls = ["https://example.com"] # رابط البداية
custom_settings = {
"ROBOTSTXT_OBEY": True, # احترام robots.txt
"DOWNLOAD_DELAY": 2, # الانتظار ثانيتين بين الطلبات
"CLOSESPIDER_PAGECOUNT": 10, # التوقف بعد 10 صفحات (حد أمان)
"USER_AGENT": "Beginner-Crawl-Bot (+https://yoursite.com/bot-info)",
}
def parse(self, response):
yield {
"title": response.css("title::text").get(),
"url": response.url,
}
# اتبع الروابط الموجودة في الصفحة (ضمن allowed_domains)
for link in response.css("a::attr(href)").getall():
yield response.follow(link, callback=self.parse)
شغّله:
scrapy crawl example -o output.json
اختبر المحددات أولًا باستخدام scrapy shell "https://example.com" قبل التوسع. ووقت الإعداد يختلف حسب خبرتك في Python—فلا تتوقع تنجزه في عشر دقائق إذا كنت جديد على البيئات الافتراضية وأوامر الطرفية.
7. Crawlee

Crawlee هو مكتبة زحف مرخصة Apache لـ JavaScript/TypeScript وPython، وتطوّرها Apify. يوفر أصنافًا تعتمد على HTTP فقط مثل CheerioCrawler، إلى جانب زواحف متصفح Playwright/Puppeteer، وطوابير طلبات، ومجموعات بيانات، ومعالجة الجلسات، وإعادة المحاولة، وضوابط الحدود.
الميزات الرئيسية:
- اختر بين HTTP-first (CheerioCrawler) أو المتصفح الكامل (PlaywrightCrawler) بحسب المشروع
- طابور طلبات مدمج، وإزالة تكرار، وتخزين مجموعات البيانات
- إدارة الجلسات، وبصمات المتصفح، وإعادة المحاولة، وضوابط حدود الطلبات
- TypeScript أولًا مع دعم مستقر لـ Python
- البدء السريع الرسمي يوصي بـ HTTP-first عندما يحتوي HTML على البيانات
التسعير: مجاني. مفتوح المصدر ومستضاف ذاتيًا.
القيود: يتطلب معرفة بـ JavaScript/TypeScript أو Python. توثيقه المجتمعي أقل من Scrapy. ميزات تقليل الحظر لا تمنح إذنًا ولا تضمن الوصول—هي تقلل احتمال الاكتشاف لكنها لا تجعل الزحف غير المصرح به مسموحًا.
الأفضل لـ: مطوري JavaScript المتوسطين الذين يحتاجون إلى زحف تطبيقات SPA الحديثة والمواقع المعروضة بـ JS مع إدارة طوابير مدمجة وتقليل الحظر.
بدء سريع مع Crawlee: من التثبيت إلى أول بيانات
npx crawlee create my-crawler
cd my-crawler
اختر قالب Playwright عند ظهور رسالة الإعداد.
عدّل المعالج في src/routes.ts لاستخراج ما تحتاجه، ثم:
npm start
ستظهر النتائج كملفات JSON داخل مجلد مجموعة البيانات المحلي. أضف maxRequestsPerCrawl وحدود العمق وقواعد النطاق نفسه وحدًا معقولًا للتزامن قبل التوسع خارج تجربة الاختبار.
8. Playwright

Playwright هو إطار أتمتة المتصفح من Microsoft بترخيص Apache، ويدعم Python وNode.js وJava و.NET. وهو يتحكم بمتصفحات حقيقية من Chromium وFirefox وWebKit—وهذا يجعله ممتازًا للصفحات التي تُحمَّل عبر JavaScript، أو تتطلب تسجيل دخول، أو فيها تفاعلات معقدة.
الميزات الرئيسية:
- عرض أصلي داخل متصفح حقيقي عبر ثلاثة محركات
- يتعامل مع تطبيقات SPA، وتدفقات تسجيل الدخول، والنقرات، وملء النماذج، وتنزيل الملفات، ولقطات الشاشة، وPDF
- دعم متعدد اللغات (Python وJS/TS وJava و.NET)
- توثيق ممتاز وتطوير نشط
- اعتراض الشبكة ومحاكاة الطلبات
ما ليس Playwright: ليس زاحفًا كاملًا. فهو ما يوفر frontier لعناوين URL، ولا طابور إزالة تكرار، ولا سياسة حسن السلوك، ولا نموذج إعادة محاولة، ولا مُصدّر خلاصات بيانات. عليك تبني هذه الأجزاء بنفسك—أو تدمجه مع إطار مثل Crawlee الذي يوفرها.
التسعير: مجاني. مفتوح المصدر.
الأفضل لـ: المطورين المتوسطين الذين يحتاجون إلى أتمتة تفاعل المتصفح على مواقع ثقيلة بـ JS أو محمية بتسجيل دخول، ويقدرون يبنون منطق الزحف الخاص بهم حوله.
9. Screaming Frog

Screaming Frog SEO Spider هو زاحف SEO تقني لسطح المكتب يعمل على Windows وmacOS وLinux. وهو ليس أداة استخراج بيانات عامة—بل هو الزاحف المفضل لتدقيق SEO، واكتشاف الروابط المعطلة، وسلاسل التحويل، والمحتوى المكرر، والميتا داتا المفقودة، ومئات المشكلات التقنية الأخرى في SEO.
الميزات الرئيسية:
- يزحف حتى 500 عنوان URL مجانًا (دائمًا، وليس تجربة مؤقتة)
- يحدد الروابط المعطلة وسلاسل التحويل والمحتوى المكرر والميتا داتا المفقودة
- تبويبات مفصلة لعناوين الصفحات والوصف التعريفي والعناوين والصور والمزيد
- النسخة المدفوعة تضيف عرض JavaScript، وحفظ عمليات الزحف، والاستخراج المخصص، وتكاملات GA/GSC، وتكاملات AI (OpenAI وGemini وAnthropic وOllama)
التسعير: النسخة المجانية دائمة بحد 500 عنوان URL لكل زحف لكنها تستثني عرض JavaScript والإعدادات المتقدمة والاستخراج المخصص والتكاملات. الترخيص 199 جنيهًا إسترلينيًا / 279 دولارًا / 245 يورو لكل مستخدم سنويًا.
القيود: منحنى تعلم حاد لغير المتخصصين في SEO. يستهلك موارد الجهاز المحلي (ويصير مقيدًا بالذاكرة في المواقع الكبيرة). ما فيه خطة شهرية. وهو غير مصمم لاستخراج البيانات العامة—بل أداة تدقيق.
الأفضل لـ: المبتدئين المهتمين بتدقيق SEO والتحليل التقني للموقع. إذا كنت تحتاج استخراج بيانات منتجات أو بناء قوائم عملاء محتملين، فدور في مكان آخر.
10. Colly

Colly هو إطار زحف/استخراج HTTP بلغة Go، بترخيص Apache، ويعتمد على واجهة برمجية قائمة على callbacks، مع ضوابط للتزامن، والجلسات/الكوكيز، والطوابير، والتخزين المؤقت، وخلفيات تخزين قابلة للاستبدال.
الميزات الرئيسية:
- زحف HTTP متزامن سريع مع استهلاك منخفض للموارد
- واجهة برمجية نظيفة تعتمد على callbacks
- معالجة مدمجة للكوكيز/الجلسات والتخزين المؤقت
- تحديد معدل على مستوى النطاق عبر LimitRule
- التثبيت الحالي:
go get github.com/gocolly/colly/v2
تحذير مهم للمبتدئين: الشيفرة الحالية في Colly تُعيّن IgnoreRobotsTxt = true افتراضيًا. لازم تضبطها صراحةً على false وتُهيئ LimitRule مع التأخير والتوازي المناسبين. بدون ذلك، Colly بيتجاهل ملف robots.txt وقد يرهق الخادم المستهدف بسهولة.
التسعير: مجاني. مفتوح المصدر.
القيود: يتطلب معرفة ببرمجة Go. ما فيه عرض JavaScript مدمج ولا مُصدّر خلاصات شامل—عليك تسلسل الإخراج بنفسك. مجتمعه أصغر من أدوات Python.
الأفضل لـ: المبتدئين المتقدمين اللي يعرفون Go ويحتاجون زاحف HTTP سريع وخفيف للمواقع الثابتة أو الـ APIs—على أن يضبطوا robots ومعدلات الطلب بوضوح.
مقارنة الخطة المجانية: ماذا تحصل فعلًا قبل الدفع
هذا هو الجدول اللي يدور عليه المبتدئون الحريصون على التكلفة. كل أداة أدناه تنقسم إلى فئتين: منتجات freemium (محدودة لكن بلا بنية تحتية) وأدوات مفتوحة المصدر (صفحات غير محدودة لكنك تستضيف كل شيء).
الخطط المجانية / freemium على سطح المكتب
| الأداة | الحد المجاني | حد المشاريع/المهام | قيود التصدير | هل هي محددة بزمن؟ | أهم القيود |
|---|---|---|---|---|---|
| Octoparse | صفحات/زحف غير محدودة | 10 مهام | 10 آلاف صف/تصدير؛ 50 ألف صف/شهر | لا (دائمة) | السحابة، الجدولة، تدوير IP، API |
| ParseHub | 200 صفحة/تشغيل | 5 مشاريع عامة | CSV/JSON | لا (دائمة) | قد تكون المشاريع/البيانات عامة؛ احتفاظ 14 يومًا |
| Thunderbit | 6 صفحات/شهر | غير منطبق | Excel/CSV وSheets وAirtable وNotion | لا (دائمة) | الترقيم والصفحات الفرعية والاستخراج المجمع والجداول ضمن Starter |
| Firecrawl | 1000 رصيد/شهر | غير منطبق | جميع الصيغ | لا (دائمة) | طلبان متزامنان؛ حدود معدل منخفضة |
| Screaming Frog | 500 عنوان URL لكل زحف | تشغيل غير محدود | تصدير محدود | لا (دائمة) | عرض JS، حفظ الزحف، الاستخراج المخصص، التكاملات |
الأدوات مفتوحة المصدر (استضافة ذاتية)
| الأداة | حد الصفحات | الترخيص | ما الذي تدفع مقابله |
|---|---|---|---|
| Scrapy | لا شيء | BSD | الحوسبة، عرض النطاق، التخزين، تكامل متصفح اختياري |
| Crawlee | لا شيء | Apache | الحوسبة، عرض النطاق، عمليات المتصفح |
| Crawl4AI | لا شيء | Apache-2.0 + نسبة المصدر | الحوسبة، عمليات المتصفح، استدلال LLM اختياري |
| Playwright | لا شيء | Apache | الحوسبة، عمليات المتصفح (CPU/ذاكرة مرتفعة) |
| Colly | لا شيء | Apache | الحوسبة، عرض النطاق |
إذا كانت ميزانيتك البرمجية صفرًا وتقدر تبرمج، فالأدوات مفتوحة المصدر تتجنب حصة الصفحات المفروضة من المورّد، لكن البنية التحتية وقيود الموقع المستهدف وتكاليف التشغيل تبقى موجودة. ما تقدر تبرمج؟ Octoparse وParseHub وThunderbit كل واحد منها يقدّم مسارًا مجانيًا—فقط راقب الحدود وشروط الخصوصية.
أول 10 دقائق لك: خطوات بدء سريعة لثلاثة مستويات مهارية

النظرية ممتازة، لكن التطبيق أفضل. هنا كيف تنتقل من الصفر إلى أول تصدير للبيانات في ثلاث أدوات تمثل كل مستوى مهاري.
المسار بدون كود: البدء مع Thunderbit
- ثبّت ملحق Thunderbit للمتصفح
- انتقل إلى صفحة مستهدفة (مثل صفحة قائمة منتجات أو دليل أو نتائج بحث)
- انقر على أيقونة Thunderbit واختر One Click Extract — يقرأ AI الصفحة، يفهم بنيتها، يحدد الأعمدة اللي لازم تُسحب، ثم يستخرجها دفعة واحدة
- راجع النتائج داخل الملحق — أعد تسمية الأعمدة أو احذفها أو أضفها، وتقدر تضيف Field AI Prompts إذا أردت تعدّل أي شيء — ثم صدّر إلى Excel أو Google Sheets أو Airtable أو Notion
على صفحة متوافقة، هذا مصمم يكون إعداد سريع بدل ما يكون مشروع برمجة.
ولخطوات أكثر تفصيلًا، راجع دليلنا عن استخراج البيانات من صفحات الويب باستخدام Thunderbit.
مسار مبتدئ Python: البدء مع Scrapy
ارجع إلى البدء السريع المشروح في قسم Scrapy فوق. الأوامر الأساسية هي pip install scrapy وscrapy startproject، ثم عدّل spider مع ROBOTSTXT_OBEY = True وDOWNLOAD_DELAY، ثم scrapy crawl example -o output.json. اختبر المحددات في scrapy shell قبل التوسع. ووقتك يختلف حسب خبرتك في إعداد Python.
مسار JavaScript: البدء مع Crawlee
ارجع إلى البدء السريع لـ Crawlee فوق. شغّل npx crawlee create my-crawler، واختر قالب Playwright، وعدّل المعالج، ثم npm start. ستظهر النتائج بصيغة JSON في مجلد مجموعة البيانات المحلي. أضف maxRequestsPerCrawl وقيود النطاق قبل التوسع.
وللحصول على شرح أطول يركّز على Python ويبيّن كيف يتكوّن مشروع الزاحف، هذه الدورة رفيق مفيد:
جرّبه مجانًا، بدون بطاقة ائتمان الخطة المجانية تغطي 6 صفحات شهريًا، لذا تقدر تتدرب على استخراج البيانات قبل الالتزام بأداة مدفوعة. Get Started Free
5 أخطاء للمبتدئين تقتل أول عملية زحف لك (وكيف تتجنبها)

هذه الأخطاء تظهر باستمرار في المنتديات، ومع ذلك غالبًا ما تتجاهلها المقالات الأولى كقسم مستقل.
الخطأ 1: استخدام زاحف HTTP فقط على موقع يعرض المحتوى عبر JavaScript
المشكلة: كثير من المواقع الحديثة تحمل البيانات عبر JavaScript بعد استجابة HTML الأولية. طلب HTTP بسيط يرجع صفحة هيكلية مع <div> فارغة—بدون بيانات.
الحل: قبل اختيار الأداة، افتح الصفحة المستهدفة، ثم انقر بالزر الأيمن واختر View Source. إذا ما كانت البيانات اللي تحتاجها موجودة في HTML الخام، فأنت تحتاج أداة تعرض المتصفح: Playwright، أو PlaywrightCrawler في Crawlee، أو أداة بدون كود مثل Thunderbit أو Octoparse التي تعرض المحتوى داخل المتصفح. لكن لا تفترض المتصفح افتراضيًا إذا كان HTTP كافيًا—لأنه يرفع التكلفة والتعقيد.
الخطأ 2: تجاهل robots.txt وقواعد Crawl-Delay
المشكلة: robots.txt هو معيار يوضح أي المسارات يقدر رمز زاحف مُسمّى يزور. تجاهل سياسة الزحف لدى الموقع قد يؤدي إلى الحظر، ومشاكل تشغيلية، ومخاطر امتثال.
الحل: تحقق دائمًا من yoursite.com/robots.txt قبل الزحف، وتأكد من الإعداد الافتراضي الفعلي للأداة المختارة. القيم الافتراضية تختلف؛ مثلًا Colly يعيّن IgnoreRobotsTxt = true ويتطلب إعدادًا صريحًا. وانتبه أن robots.txt إشارة للتحكم بالزحف، وليست ترخيصًا قانونيًا. فالمسار المسموح لا يعني بالضرورة إذنًا بجمع البيانات أو إعادة استخدامها لأي غرض.
الخطأ 3: إرسال عدد كبير جدًا من الطلبات بدون تحديد معدل
المشكلة: إرسال مئات الطلبات في الثانية ممكن يرهق الخادم المستهدف، ويؤدي إلى حظر عنوان IP، وهذا سلوك سيئ أصلًا.
الحل: اضبط تأخيرًا موجبًا. في Scrapy استخدم DOWNLOAD_DELAY = 2 وCONCURRENT_REQUESTS_PER_DOMAIN منخفضًا. وفي Colly، اضبط LimitRule مع التأخير والتوازي. الأدوات السحابية/بدون كود عادة تتولى هذا تلقائيًا، لكن تحقق من إعداداتها. ابدأ بطلب واحد جارٍ لكل نطاق ثم زد تدريجيًا فقط إذا سمح سلوك الموقع وشروطه بذلك.
الخطأ 4: اختيار أداة بمستوى مؤسسي لمشروع صغير
المشكلة: إعداد عنقود Scrapy موزع مع تدوير proxies وطابور رسائل لمشروع من 500 صفحة يشبه استئجار شاحنة ضخمة عشان تشتري البقالة.
الحل: ارجع إلى مخطط القرار. طابق تعقيد الأداة مع حجم المشروع. للاستخراجات الصغيرة لمرة واحدة، يكون ملحق المتصفح أو السكربت البسيط هو الاختيار الصحيح غالبًا.
الخطأ 5: عدم التحقق من صحة البيانات الناتجة
المشكلة: كثير من المبتدئين يصدّرون البيانات بدون مراجعتها، ثم يكتشفون لاحقًا أن نصف الصفوف فارغة أو مكررة أو مشوهة.
الحل: افحص دائمًا أول 10 إلى 20 صفًا يدويًا قبل تشغيل زحف كامل. ابحث عن الحقول الفارغة، ومشاكل الترميز (mojibake)، والصفوف المكررة، والقيم غير المتوقعة. حدد البنية المتوقعة قبل البدء—ما الأعمدة اللي لازم توجد، وش نوعها، وأي الحقول إلزامية. نجاح عملية الزحف ما يعني تلقائيًا أن البيانات صحيحة.
ماذا يعني "إخراج جاهز للـ LLM" ولماذا يهم حتى لو ما كنت تبني AI
تظهر عبارة "LLM-ready" في كل مكان في تسويق أدوات الزحف في 2026. ومعظم الشروحات تفترض أنك أصلًا تعرف ما هي قاعدة البيانات المتجهية. هنا التوضيح بلغة بسيطة.
الإخراج الجاهز للـ LLM هو نص نظيف ومنظم يقدر نموذج AI مثل GPT أو Claude يدخله بدون تنظيف يدوي. تخيله مثل الفرق بين أنك تعطي شخص جدول بيانات مرتب بعناية، وبين أنك تسلمه رزمة صفحات ويب مطبوعة لا تزال فيها الإعلانات وقوائم التنقل ولافتات الكوكيز.
ليش هذا يهمك حتى لو ما كنت تبني شات بوت؟ لأن الأدوات المصممة لإخراج LLM-ready تميل تنتج بيانات أنظف وأكثر قابلية للاستخدام للجميع. معالجة لاحقة أقل، وأعمدة غير مفيدة أقل، ومشاكل ترميز أقل. البيانات النظيفة تظل بيانات نظيفة، سواء قرأها إنسان أو آلة.
وش الأدوات في هذه القائمة التي تنتج إخراجًا جاهزًا للـ LLM أصلًا؟
- Firecrawl → Markdown نظيف، ملخصات، JSON منظّم
- Crawl4AI → عدة نسخ Markdown، ومقاطع منظمة، وجداول
- Thunderbit → حقول منظمة مقترحة بالـ AI مع توحيد قائم على الأوامر
إليك مثالًا سريعًا قبل/بعد. قد يبدو HTML الخام من صفحة منتج هكذا:
<div class="product-card">
<span class="price">$29.99</span>
<h2 class="title">Wireless Mouse</h2>
<p class="desc">Ergonomic design, 2.4GHz...</p>
<a href="/buy" class="btn">Add to Cart</a>
</div>
مخرجات Markdown الجاهزة للـ LLM من Firecrawl:
## Wireless Mouse
- **Price:** $29.99
- **Description:** Ergonomic design, 2.4GHz
إخراج منظم من Thunderbit:
| اسم المنتج | السعر | الوصف |
|---|---|---|
| Wireless Mouse | $29.99 | Ergonomic design, 2.4GHz |
كلاهما قابل للاستخدام فورًا—بدون تحليل HTML أو إزالة الإعلانات أو ربط الأعمدة يدويًا. ولمعرفة كيف يقارن الاستخراج المعتمد على الذكاء الاصطناعي بالاستخراج التقليدي، راجع نظرتنا العامة عن أفضل أدوات استخراج الويب بالذكاء الاصطناعي.
زحف ويب مسؤول: نصائح سريعة حول الأخلاقيات والامتثال
أخلاقيات زحف الويب والامتثال لها مهمة جدًا وما ينبغي تجاوزها:
- تحقق من robots.txt قبل الزحف لأي موقع. فهو إشارة التحكم القياسية بالزحف (RFC 9309)، لكنه ليس إذنًا قانونيًا ولا حدًا أمنيًا.
- احترم حدود السرعة ورؤوس Retry-After. خفّض السرعة أو توقف عند ردود 429 و503.
- استخدم فقط البيانات المتاحة للعامة أو المصرح بها. ويفضل استخدام API رسمي أو تصدير رسمي إذا كان يفي بالغرض.
- راجع شروط استخدام الموقع. الظهور العام لا يعني تلقائيًا ترخيصًا عامًا للجمع أو إعادة الاستخدام.
- انتبه للبيانات الشخصية. قلّل الجمع، وضع قواعد للاحتفاظ/الحذف، واحصل على مراجعة مختصة عند الاستخدامات الحساسة. تنطبق GDPR ولوائح مشابهة بغض النظر عن الأداة التي تستخدمها.
كثير من الأدوات توفر إعدادات تدعم زحفًا مسؤولًا، لكن الإعداد ما ينقل المسؤولية بعيدًا عن المشغّل. وللنظر بعمق أكبر إلى العملية نفسها، راجع شرحنا عن ما هو web scraping.
بأي زاحف ويب يجب أن تبدأ؟
ملخص سريع حسب مستوى المهارة:
- بدون كود: Thunderbit لاستخراج الصفحات بمساعدة AI، Octoparse لبناء التدفقات المرئية، ParseHub للتدفقات المعقدة متعددة الخطوات، Screaming Frog لتدقيق SEO
- Python متوسط: Scrapy لعمليات الزحف HTTP الكبيرة، Crawl4AI لمسارات LLM
- JavaScript متوسط: Crawlee لزحف SPA الحديثة، Playwright لأتمتة المتصفح المعقدة
- Go: Colly لزحف HTTP سريع (مع ضبط صريح للـ robots ومعدل الطلب)
- API مُدارة: Firecrawl لإخراج Markdown نظيف بدون استضافة ذاتية
أفضل زاحف هو اللي يناسب بياناتك، وتصاريحك، ومستوى مهارتك، وحدود التشغيل عندك. ابدأ ببساطة، وجرّب تشغيلًا صغيرًا، ولا تضف التعقيد إلا لما تحتاجه فعلًا. وإذا أردت تجربة الاستخراج بمساعدة AI، فإن ملحق Thunderbit للمتصفح يقدم مسارًا بدون كود من صفحة متوافقة إلى جدول بيانات.
اعرف المزيد
- استخراج الويب بالذكاء الاصطناعي
- استخراج بيانات الويب بدون برمجة
- ما هو web scraping
- بدائل Instant Data Scraper
- استخراج بيانات LinkedIn
جرّب زاحف Thunderbit الذكي Get Started Free
الأسئلة الشائعة
1. ما هو زاحف الويب وكيف يختلف عن أداة استخراج البيانات من الويب؟
الزاحف يكتشف الصفحات ويجلبها—يتبع الروابط، ويدير طابور عناوين URL، ويتعامل مع إزالة التكرار وحدود العمق. أما أداة الاستخراج فتستخرج بيانات منظمة محددة من تلك الصفحات—تحلل HTML، وتختار الحقول، وتُخرج سجلات. معظم الأدوات الحديثة تقوم بالأمرين بدرجات متفاوتة، وغالبًا تُستخدم المصطلحات بالتبادل، لكن الفرق مهم عند اختيار الأداة: فبعض الأدوات مثل Playwright ممتازة في عرض الصفحات لكنها لا توفر بنية الزحف، بينما توفر أدوات أخرى مثل Scrapy خط أنابيب الزحف الكامل لكنها تحتاج إلى إضافة لعرض JavaScript.
2. ما أفضل زاحف ويب لمن لا يملك مهارات برمجة؟
Thunderbit وOctoparse وParseHub هي أفضل الخيارات بدون كود للاستخراج العام للبيانات. يستخدم Thunderbit AI لاقتراح الحقول ويعمل كملحق للمتصفح؛ ويقدّم Octoparse منشئ تدفقات مرئية مع Auto-detect؛ أما ParseHub فيتفوق في التدفقات المعقدة متعددة الخطوات. وللاستخدامات الخاصة بـ SEO فقط، تزحف النسخة المجانية من Screaming Frog حتى 500 عنوان URL بدون أي كود.
3. هل برامج زحف الويب مجانية؟
هناك فئتان. الأدوات مفتوحة المصدر بالكامل (Scrapy وCrawlee وCrawl4AI وPlaywright وColly) ما تفرض رسومًا لكل صفحة، لكنك تستضيف البنية التحتية وتدفع تكاليف الحوسبة وعرض النطاق والتخزين. أما أدوات freemium (Octoparse وParseHub وThunderbit وFirecrawl وScreaming Frog) فتقدم خططًا مجانية مع حدود مختلفة على الصفحات أو المشاريع أو التصدير أو الميزات. راجع جدول المقارنة الخاص بالخطة المجانية فوق للتفاصيل.
4. هل يمكن لبرامج الزحف التعامل مع المواقع الثقيلة بـ JavaScript؟
نعم، لكن ليس كلها. الأدوات التي تملك عرض متصفح مدمجًا—مثل Playwright وCrawlee (PlaywrightCrawler) وOctoparse وParseHub وCrawl4AI وThunderbit (عبر Browser Mode)—تقدر تتعامل مع المحتوى المحمّل بـ JavaScript. أما Scrapy وColly فهما HTTP-first ويتطلبان تكاملات متصفح منفصلة لعرض JS. يدعم Screaming Frog عرض JavaScript فقط في النسخة المدفوعة. افحص دائمًا إذا كانت الصفحة المستهدفة تحتاج فعلًا إلى متصفح عبر عرض HTML المصدر أولًا.
5. هل زحف الويب قانوني؟
ما فيه جواب عام بنعم أو لا. يعتمد التحليل القانوني على البيانات، وطريقة الوصول، والغرض من الاستخدام، وشروط الموقع، والعقود، وقواعد الملكية الفكرية، والتزامات الخصوصية مثل GDPR، والولاية القضائية المعنية. robots.txt هو إشارة للتحكم بالزحف، وليس إذنًا قانونيًا، والظهور العام ما يعني ترخيصًا شاملًا. وفي الحالات الخاصة—خصوصًا اللي تتضمن بيانات شخصية أو محتوى محميًا بحقوق النشر أو مصادقة أو إعادة استخدام تجارية—استشر مختصًا قانونيًا مؤهلًا.


