يبدو Craigslist وكأنه لم يتغير منذ 2003، لكن البيانات المختبئة داخل تلك الإعلانات النصية البسيطة ذات قيمة كبيرة بشكل مفاجئ. ومع حوالي 127 مليون زيارة شهرية وعشرات الملايين من المنشورات الجديدة كل شهر، ما يزال واحدًا من أكبر منصات الإعلانات المبوبة في الولايات المتحدة — ولا توجد واجهة API عامة يمكن الاعتماد عليها.
لقد أمضيت سنوات في بناء أدوات الأتمتة في Thunderbit، وأحد أكثر الأشياء التي أسمعها باستمرار من فرق المبيعات والعمليات والعقارات هو: «أحتاج بيانات Craigslist في جدول بيانات، ولا أريد النسخ واللصق لمدة ثلاث ساعات». المشكلة أن معظم أدلة «أفضل أداة لاستخراج Craigslist» إما قديمة، أو تتجاهل الأجزاء الصعبة (مثل حماية مكافحة الروبوتات)، أو تكتفي بسرد الأدوات دون مقارنة حقيقية بينها.
لذلك جمعت هذا الدليل الذي يضم 10 أدوات ما تزال تعمل فعلًا في 2026 — من إضافات Chrome بدون كود إلى منصات البروكسي المؤسسية إلى مكتبات Python مفتوحة المصدر. سواء كنت مستخدمًا تجاريًا لم تكتب سطرًا من الكود في حياتك أو مطورًا يحلم بـ Python، ستجد هنا ما يفيدك.
لماذا نستخدِم استخراج بيانات Craigslist في 2026؟ أهم حالات الاستخدام لفرق الأعمال
قد يبدو Craigslist قديم الطراز، لكن هذا جزء من سحره — ومن قيمته. ما يزال يحتل المرتبة الثالثة عالميًا بين مواقع الإعلانات المبوبة، ويعمل عبر 416 إدخالًا أمريكيًا وإقليميًا في دليله الرسمي. هذا يعني كثيرًا من المخزون المحلي شديد التحديد الذي لا يتوفر في مكان واحد آخر.
إليك حالات الاستخدام التي أرى الفرق تعود إليها مرارًا وتكرارًا:
- توليد العملاء المحتملين: منشورات الخدمات والأعمال الحرة غالبًا ما تتضمن وصفًا للنشاط والموقع وطريقة تواصل وسيطة عبر Craigslist — وهو ما يكفي لفِرَق المبيعات لبناء قائمة عملاء محتملين محليين.
- مراقبة العقارات: صفحات السكن تكشف الإيجار والحي وعدد الغرف/الحمامات والمساحة الزمنية للنشر — وهي مثالية لمقارنة الإيجارات وتتبع التوفر.
- تسعير تنافسي: إعلانات البيع تعرض العنوان والسعر والحالة والموقع، وهي معلومات ذهبية لأبحاث إعادة البيع أو المراجحة.
- التوظيف ومراقبة سوق العمل: فئتا الوظائف والأعمال الحرة تبرز التعويض ونوع الوظيفة ووصف الدور لتحليل سوق المواهب المحلي.
- تحليل السوق متعدد المناطق: بما أن Craigslist مقسّم حسب النطاق الفرعي والمدينة، يمكنك الاستعلام منطقةً منطقة لمعرفة الأسعار والحجم ومزيج الفئات.
- أتمتة سير العمل: كثير من المستخدمين يريدون فقط تدفق بيانات Craigslist إلى CSV أو Google Sheets أو Airtable أو نظام CRM — من دون تصفح يدوي.
أفاد أحد المستخدمين أن عملية استخراج Craigslist اليومية التي كانت تستغرق 60–90 دقيقة انخفضت إلى حوالي 5 دقائق مع الأتمتة. وهذا نوع التوفير في الوقت الذي يتراكم بسرعة.
استخرج بيانات Craigslist باستخدام الذكاء الاصطناعي Get Started Free
كيف اخترنا أفضل أدوات استخراج Craigslist: معايير التقييم لدينا
ليست كل أدوات استخراج Craigslist متساوية، و«الأفضل» يعتمد كثيرًا على من أنت وما الذي تحتاجه. قيّمت كل أداة عبر ستة أبعاد:
- سهولة الإعداد — هل هي مناسبة للمبتدئين (بدون كود)، أم تحتاج إلى مطوّر؟
- التعامل مع حماية Craigslist ضد الروبوتات — هل تتضمن تدوير البروكسيات تلقائيًا، أو معالجة CAPTCHA، أو بصمة متصفح؟
- فئة التسعير — مجانية، مجانية جزئيًا، مدفوعة، أم مؤسسية؟
- خيارات التصدير — CSV، Excel، Google Sheets، Airtable، Notion، JSON، قاعدة بيانات؟
- دعم المناطق المتعددة — هل يمكنها استخراج البيانات عبر جميع مواقع Craigslist الأمريكية الـ 416، أم تقتصر على مدينة واحدة في كل مرة؟
- جهد الصيانة — هل تتعطل الأداة عندما يغيّر Craigslist تخطيط صفحته، أم تتكيف تلقائيًا؟
لم أجد أي مقال منافس يقدم مقارنة جنبًا إلى جنب بهذه المعايير المتسقة — لذا إذا كنت قد سئمت من قوائم «أفضل 10» المبهمة، فهذا الدليل لك.
أفضل 10 أدوات لاستخراج Craigslist في لمحة سريعة
قبل أن نتعمق في كل أداة، إليك جدول المقارنة الرئيسي. جمعت الأدوات في ثلاثة مسارات: أدوات بدون كود لمستخدمي الأعمال، ومنصات مؤسسية للتوسّع، ومكتبات مفتوحة المصدر للمطورين.
| الأداة | النوع | هل توجد خطة مجانية؟ | دعم البروكسي / مكافحة الروبوتات | معالجة CAPTCHA | صيغ التصدير | الأفضل لـ |
|---|---|---|---|---|---|---|
| Thunderbit | إضافة Chrome بدون كود | نعم (6 صفحات/شهر) | وضع المتصفح (لا حاجة لبروكسي في التشغيلات المتوسطة) | غير متوفر (جلسة المتصفح) | Excel، Sheets، Airtable، Notion، CSV، JSON | مستخدمو الأعمال غير التقنيين |
| Bright Data | أداة استخراج مؤسسية + بروكسي + بيانات | تجربة | إلغاء حظر مُدار، بروكسيات، محاولات إعادة، عرض الصفحات | نعم (حل تلقائي) | JSON، NDJSON، CSV، Parquet، XLSX، API | جمع البيانات على نطاق مؤسسي |
| Oxylabs | واجهة API + مجموعة بروكسيات | تجربة | إلغاء حظر مُدار، بروكسيات سكنية/ISP | نعم | HTML، لقطة شاشة، مخرجات API | المطورون الذين يحتاجون بنية مؤسسية |
| Apify | سوق وكلاء سحابة | نعم (رصيد 5 دولارات/شهر) | تدوير البروكسيات (يعتمد على الوكيل) | جزئي / حسب الوكيل | JSON، CSV، XML، Excel، JSONL | أتمتة سحابية مرنة منخفضة الكود |
| ParseHub | أداة استخراج مرئية بدون كود | نعم | تدوير بروكسي مدفوع، تشغيلات سحابية | ليست ميزة أساسية | CSV، JSON، API/S3/Dropbox (مدفوع) | مستخدمو بدون كود ذوو الميزانية المحدودة |
| Phantombuster | منصة أتمتة سحابية | نعم (محدودة) | دعم للبروكسي متوفر | عبر الرصيد / بناءً على سير العمل | CSV، JSON (مدفوع) | أتمتة المبيعات متعددة المنصات |
| Scrapy | زاحف Python مفتوح المصدر | مجاني (مفتوح المصدر) | أحضر بروكسياتك/الوسيط البرمجي بنفسك | لا | JSON، JSONL، CSV، XML، قاعدة بيانات | الزواحف الإنتاجية |
| Playwright | أتمتة متصفح مفتوحة المصدر | مجاني (مفتوح المصدر) | أحضر المتصفح/البروكسي بنفسك | لا | تصدير مخصص | التحكم على مستوى المتصفح |
| Selenium | أتمتة متصفح مفتوحة المصدر | مجاني (مفتوح المصدر) | أحضر المتصفح/البروكسي بنفسك | لا | تصدير مخصص | المكدسات القديمة متعددة اللغات |
| BeautifulSoup | محلل HTML مفتوح المصدر | مجاني (مفتوح المصدر) | لا يوجد بحد ذاته | لا | تصدير مخصص | التحليل الخفيف |
تظهر هنا ثلاثة مسارات بوضوح:
- الأدوات بدون كود (Thunderbit، ParseHub، Phantombuster) لمستخدمي الأعمال الذين يريدون البيانات من دون عبء هندسي.
- المنصات المؤسسية (Bright Data، Oxylabs، Apify) للفرق التي تحتاج إلى نطاق واسع وبنية مكافحة الروبوتات وتسليم مُدار.
- أدوات المطورين مفتوحة المصدر (Scrapy، Playwright، Selenium، BeautifulSoup) لمن يريد أقصى تحكم — على حساب الإعداد والصيانة وإدارة البروكسيات.
والآن، التفاصيل.
1. Thunderbit
Thunderbit هي إضافة Chrome مدعومة بالذكاء الاصطناعي، صُممت للأشخاص الذين يريدون بيانات منظمة من أي موقع — بما في ذلك Craigslist — من دون كتابة كود أو إعداد بروكسيات.
أنا منحاز هنا قليلًا (فنحن من بنيناها)، لكن سبب وضع Thunderbit أولًا هو أنها تحل نقاط الألم المحددة التي يخلقها استخراج Craigslist للمستخدمين غير التقنيين: اختلاف تخطيطات الصفحات بين الفئات، وإثراء صفحات التفاصيل، والتعطل المستمر عندما تتغير محددات CSS.
كيف تعمل على Craigslist:
- ثبّت إضافة Thunderbit على Chrome وافتح أي صفحة قوائم في Craigslist (مثل الشقق في مدينتك).
- انقر "اقترح الحقول بالذكاء الاصطناعي" — يقرأ الذكاء الاصطناعي في Thunderbit الصفحة ويقترح أعمدة مناسبة لما هو موجود فعلًا عليها. بالنسبة إلى السكن ستحصل على العنوان والسعر والمساحة وعدد الغرف والموقع وتاريخ النشر والرابط. وبالنسبة إلى الوظائف ستحصل على العنوان والتعويض ونوع الوظيفة وما إلى ذلك. من دون أي إعداد يدوي للمحددات.
- انقر "استخراج" وشاهد البيانات وهي تُملأ في جدول منظم.
- تعامل مع التصفح الصفحي — تعمل Thunderbit مع التصفح القائم على النقر في Craigslist.
- استخدم "استخراج الصفحات الفرعية" لزيارة كل إعلان على حدة واستخراج الحقول الموجودة فقط في صفحة التفاصيل: الوصف الكامل، جميع الصور، معلومات التواصل المضمنة، والمزيد.
- صدّر إلى Google Sheets أو Excel أو Airtable أو Notion أو CSV — مجانًا.
الميزات الرئيسية:
- اكتشاف الحقول بالذكاء الاصطناعي: يتكيف تلقائيًا مع فئات Craigslist المختلفة — السكن يحصل على أعمدة المساحة/عدد الغرف، والوظائف تحصل على أعمدة التعويض/نوع الوظيفة، والبيع يحصل على الحالة/السعر. لا حاجة لأي عمل يدوي على CSS.
- استخراج الصفحات الفرعية: بعد استخراج صفحة النتائج، يزور كل إعلان على حدة لسحب حقول صفحة التفاصيل (الوصف الكامل، الصور، معلومات التواصل).
- وضع استخراج قائم على المتصفح: يعمل داخل جلسة Chrome الخاصة بك، لذا لا حاجة إلى بروكسي في الأحجام المتوسطة. وهذا وحده يقلل طبقة كبيرة من التكلفة والتعقيد.
- صيانة صفرية: يقرأ الذكاء الاصطناعي الصفحة من جديد في كل مرة. عندما يغيّر Craigslist تخطيطه (وهو يفعل ذلك)، لا تتعطل أداتك.
- تصدير مجاني: Excel وGoogle Sheets وAirtable وNotion وCSV وJSON — من دون حظر مدفوع على التصدير.
التسعير: خطة مجانية (6 صفحات/شهر)، تجربة مجانية (10 صفحات)، وخطط مدفوعة للحجم الأكبر.
الأفضل لـ: فرق المبيعات التي تستخرج العملاء المحتملين من خدمات/أعمال Craigslist، وفرق العقارات التي تراقب أسعار الإيجارات، وفرق العمليات التي تحتاج إلى بيانات منظمة من Craigslist من دون دعم مطور، وأي شخص يريد الاستخراج والتوسيم والتصدير في خطوة واحدة.
جرّب Thunderbit لاستخراج Craigslist
2. Bright Data
Bright Data هي الخيار المؤسسي الثقيل. إنها المنصة الوحيدة في هذه القائمة التي تمتلك صفحة منتج مخصصة لاستخراج Craigslist بالإضافة إلى سوق مجموعة بيانات Craigslist.
إذا كنت بحاجة إلى استخراج آلاف قوائم Craigslist يوميًا عبر جميع مناطق الولايات المتحدة، فـ Bright Data مصممة لهذا النطاق. تتعامل Web Unlocker مع عناوين IP وإعادة المحاولة وعرض الصفحات والحظر — بما في ذلك حل CAPTCHA تلقائيًا افتراضيًا. ويتيح Web Scraper IDE بناء تدفقات عمل مخصصة لجمع بيانات Craigslist، ويمكنك التكرار برمجيًا عبر جميع عناوين المواقع الإقليمية الـ 416.
الميزات الرئيسية:
- شبكة بروكسي سكنية ضخمة (ملايين عناوين IP)
- حل CAPTCHA مدمج وتجاوز مكافحة الروبوتات
- منتجات مخصصة لاستخراج Craigslist ومجموعات بياناته
- التصدير: JSON، NDJSON، CSV، Parquet، XLSX، تسليم عبر API، Webhooks
التسعير: يعمل مستخرج Craigslist بسعر 0.5 دولار لكل 1000 تحميل صفحة بنظام الدفع حسب الاستخدام، مع خطط مثل 380 ألف تحميل صفحة مقابل 499 دولارًا. تبدأ البروكسيات السكنية من 4 دولارات/GB بنظام الدفع حسب الاستخدام. توجد تجربة مجانية لألف طلب لمدة أسبوع واحد.
الأفضل لـ: فرق المؤسسات التي تحتاج إلى جمع بيانات Craigslist بكثافة عالية وعلى عدة مناطق مع ضمان التوفر ودعم مخصص. أما الفرق الصغيرة الحساسة للميزانية، فالأفضل أن تنظر إلى خيارات أخرى.
3. Oxylabs
Oxylabs هي مزود متميز للبروكسيات وبنية الاستخراج، ولديها واجهة API مخصصة لاستخراج Craigslist وصفحة بروكسيات Craigslist.
Oxylabs موجّهة للمطورين أكثر من نهج Bright Data الشامل. تدعم Web Scraper API وWeb Unblocker عرض JavaScript وإعادة المحاولة وإدارة الجلسات وتوليد البصمة ومعالجة أوسع لمكافحة الروبوتات. وتصل التجربة المجانية لواجهة Craigslist Scraper API إلى 2000 نتيجة.
الميزات الرئيسية:
- مجموعات بروكسي سكنية وISP (السكنية من 6 دولارات/GB، وISP من 0.60 دولار/IP)
- Web Unblocker مع بصمة تلقائية وإدارة للجلسات
- نقطة نهاية API مخصصة لـ Craigslist
- تجربة مجانية لمدة 7 أيام
التسعير: تبدأ واجهة Scraper API لمواقع أخرى من نحو 0.15 دولار/1000 نتيجة من دون JavaScript، و0.35 دولار/1000 مع JavaScript. وتبدأ فئة Web Unblocker الصغرى من نحو 75 دولارًا/شهر. ويمكن أن تكلف البروكسيات السكنية على نطاق واسع نحو 0.50 دولار/GB عند 1 تيرابايت.
الأفضل لـ: فرق المطورين التي تريد بنية بروكسي مُدارة وسير عمل قائم على API لاستخراج Craigslist بشكل مستمر. أما الفرق التي تستخدم أصلًا بروكسيات Oxylabs لمشاريع أخرى فستجد إضافة Craigslist سهلة.
4. Apify
Apify منصة سحابية لاستخراج الويب والأتمتة، مع سوق من «Actors» الجاهزة — وهي قوالب استخراج يمكنك تشغيلها من دون كتابة كود.
مشهد Craigslist على Apify مثير للاهتمام: هناك عدة Actors تديرها مجتمعات مختلفة وبجودة متفاوتة جدًا. فـ actor الخاص بـ ivanvs/craigslist-scraper لديه 829 مستخدمًا إجماليًا وتقييم 5.0، بينما automation-lab/craigslist-scraper لديه 44 مستخدمًا وتقييم 1.0. الجودة غير متسقة، لذا ستحتاج إلى الاختبار قبل الالتزام.
الميزات الرئيسية:
- توفر عدة Actors لـ Craigslist (بعضها يستخرج حوالي 120 إعلانًا لكل صفحة مع فواصل مدمجة)
- تنفيذ سحابي، وتشغيلات مجدولة، ووصول إلى API، وتكامل Webhook
- تدوير البروكسيات متاح
- التصدير: JSON، CSV، XML، Excel، JSONL
التسعير: خطة مجانية مع رصيد 5 دولارات/شهر، وخطط مدفوعة تبدأ من نحو 49 دولارًا/شهر. قد تقفز التسعيرات حسب الحوسبة مع الاستخدام الكثيف — راقب استهلاكك من CU.
الأفضل لـ: الفرق التي تريد حلًا مستضافًا سحابيًا من دون إدارة بنية تحتية، والمستخدمين المريحين مع إعداد منخفض الكود، والفرق التي تحتاج إلى عمليات استخراج Craigslist مجدولة ومتكررة.
5. ParseHub
ParseHub هي أداة استخراج ويب مرئية على سطح المكتب، حيث تنقر على عناصر الصفحة لتحديد ما تريد استخراجه.
لإعداد استخراج Craigslist في ParseHub، تنقر على عناوين الإعلانات والأسعار والروابط لتعليم الأداة ما الذي تلتقطه. وهي تتعامل مع التصفح الصفحي عبر حلقات نقر AJAX وتدعم التشغيلات السحابية في الخطط المدفوعة. تمنحك الخطة المجانية ما يصل إلى 5 مشاريع، وهو أمر جيد لعمل Craigslist صغير النطاق.
الميزات الرئيسية:
- منشئ سير عمل مرئي بنمط النقر والتحديد
- دعم التصفح الصفحي والمحتوى الديناميكي
- تشغيلات سحابية وجدولة في الخطط المدفوعة
- التصدير: CSV، Excel، JSON
التسعير: خطة مجانية (5 مشاريع)، وخطط مدفوعة تبدأ من حوالي 189 دولارًا/شهر للمزيد من الصفحات والتشغيلات المجدولة.
القيود: قد تكون بطيئة في عمليات الاستخراج الكبيرة، وتشغيلاتها المجدولة محدودة في الخطة المجانية، والأهم أنها تعتمد على محددات CSS، لذا تحتاج إلى صيانة يدوية عندما يغيّر Craigslist تخطيطه.
الأفضل لـ: المستخدمون الفرديون أو الفرق الصغيرة ذات الاحتياجات المتوسطة الذين يريدون أداة مرئية بدون كود، لكنهم لا يحتاجون إلى اكتشاف الحقول بالذكاء الاصطناعي.
6. Phantombuster
Phantombuster منصة أتمتة سحابية اشتهرت في الأصل لاستخراج LinkedIn ووسائل التواصل الاجتماعي. ليست أداة أصلية لـ Craigslist، لكن Web Element Extractor فيها يمكنه استخراج الصفحات العامة باستخدام محددات CSS.
إعداد استخراج Craigslist في Phantombuster يحتاج جهدًا أكبر من أداة مخصصة — ستحتاج إلى تحديد المحددات وبناء سير العمل وإعداد الجدولة. لكن إذا كنت تستخدم Phantombuster بالفعل لتوليد العملاء المحتملين من LinkedIn أو وسائل التواصل الاجتماعي، فإن إضافة Craigslist إلى خطك مسألة مباشرة.
الميزات الرئيسية:
- قوالب أتمتة جاهزة وتنفيذ سحابي
- الجدولة وتكاملات CRM
- دعم للبروكسيات ورصيد لحل CAPTCHA متوفر
- التصدير: CSV وJSON في الخطط المدفوعة (الخطة المجانية تحدّه بـ 10 صفوف)
التسعير: خطة مجانية مع 5 خانات، و2 ساعة/شهر، وحد تصدير 10 صفوف. تبدأ الخطط السنوية المدفوعة من حوالي 56 دولارًا/شهر عند الفوترة السنوية.
الأفضل لـ: فرق المبيعات التي تستخدم أصلًا Phantombuster لتوليد العملاء المحتملين متعدد المنصات وتريد إضافة Craigslist إلى سير عملها.
7. Scrapy
Scrapy هو أشهر إطار عمل Python مفتوح المصدر لاستخراج الويب، وهو الخيار الواضح لفرق المطورين التي تريد أقصى تحكم في الزحف عبر Craigslist.
أحدث نسخة مستقرة هي 2.15.0 (9 أبريل 2026). يدعم Scrapy الزحف متعدد المناطق (بالتكرار عبر جميع عناوين المواقع الإقليمية)، وجدولة الطلبات وتحديد السرعة مدمجين، ووسطاء التنزيل لتدوير البروكسيات، وتصدير الخلاصات إلى CSV وJSON وJSONL وXML وخطوط أنابيب قواعد البيانات. وتضيف الإضافة scrapy-playwright عرضًا على مستوى المتصفح عند الحاجة.
الميزات الرئيسية:
- زاحف قابل للتخصيص بدرجة عالية وجاهز للإنتاج
- وسيط برمجي للبروكسيات وإعادة المحاولة والكوكيز وتدوير user-agent
- تصدير الخلاصات: JSON وJSONL وCSV وXML وخطوط أنابيب قواعد البيانات
- مجاني ومفتوح المصدر
التكلفة الخفية: Scrapy نفسه مجاني، لكن تشغيله على Craigslist على نطاق واسع يعني اشتراكات بروكسي (50–500+ دولار/شهر)، وتكاليف استضافة/خادم، وصيانة مستمرة عندما يغيّر Craigslist بنية HTML الخاصة به.
الأفضل لـ: فرق المطورين ذات خبرة Python التي تحتاج إلى أقصى مرونة، وبنية بروكسي موجودة، وزحف Craigslist عالي الحجم ومتعدد المناطق.
8. Playwright
Playwright مكتبة حديثة لأتمتة المتصفح من Microsoft تتحكم في Chromium وFirefox وWebKit برمجيًا. وتيرة الإصدارات الحالية نشطة — فقد صدر v1.59.1 في 1 أبريل 2026.
تزداد Playwright ترشيحًا على Selenium في مجتمعات المطورين لاستخراج Craigslist. فهي أسرع وأكثر موثوقية، ولديها تخفٍ أفضل ضد الاكتشاف مع إضافات مجتمعية مثل playwright-extra. وتدعم الوضعين headless وheaded، والانتظار التلقائي للعناصر، واعتراض الشبكة، والتقاط الصور/PDF.
الميزات الرئيسية:
- يدعم Python وJavaScript/TypeScript وJava و.NET
- أوضاع متصفح headless وheaded
- انتظار تلقائي للعناصر، واعتراض الشبكة
- مجاني ومفتوح المصدر
ميزة Craigslist: تستطيع Playwright محاكاة سلوك المستخدم الحقيقي بشكل أكثر إقناعًا من طلبات HTTP الخام، مما يقلل خطر الحظر. وتميل آراء Reddit باستمرار إلى Playwright بدل Selenium للمشاريع الجديدة.
التكاليف الخفية: هي نفسها تقريبًا مثل Scrapy — تكاليف البروكسي والاستضافة والصيانة عندما تتعطل المحددات.
الأفضل لـ: المطورون الذين يحتاجون إلى تحكم دقيق في المتصفح، والفرق التي تبني أدوات استخراج تتعامل مع المحتوى المعروض بجافاسكريبت، وأي شخص يفضّل بديلًا حديثًا لـ Selenium.
9. Selenium
Selenium هو إطار أتمتة المتصفح العريق واسع الاستخدام. أحدث إصدار هو 4.43.0 (10 أبريل 2026)، وما يزال يتوسع في قدرات BiDi والتحكم بالشبكة.
يدعم Selenium لغات متعددة (Python وJava وC# وJavaScript) وجميع المتصفحات الرئيسية. ويمكنه محاكاة جلسات متصفح كاملة، والتعامل مع تسجيل الدخول عند الحاجة، والتمرير عبر الصفحات. لكن مقارنةً بـ Playwright، فهو أبطأ وأكثر إسهابًا، وأسهل في الاكتشاف كبوت من دون مكتبات تخفٍ إضافية مثل undetected-chromedriver.
الميزات الرئيسية:
- دعم متعدد اللغات (Python وJava وC# وJavaScript)
- محاكاة كاملة لجلسة المتصفح
- منظومة ناضجة مع توثيق واسع
- مجاني ومفتوح المصدر
القيود: تميل آراء المجتمع في 2026 إلى Playwright للمشاريع الجديدة. وأشار أحد نقاشات Reddit إلى أن Cloudflare كان لا يزال يكتشف Selenium «حتى مع استخدام بروكسيات سكنية» — أي أن التخفي أصعب افتراضيًا.
الأفضل لـ: فرق المطورين المستثمرة أصلًا في Selenium ولا تريد الانتقال، والمشاريع التي تحتاج إلى دعم متعدد اللغات (Java وC#)، وإعدادات الاستخراج القديمة.
10. BeautifulSoup
BeautifulSoup مكتبة Python خفيفة لتحليل HTML وXML. النسخة الحالية على PyPI هي 4.14.3 (30 نوفمبر 2025).
توضيح مهم: BeautifulSoup هي محلل وليست أداة استخراج كاملة. فهي لا تجلب صفحات الويب ولا تتعامل مع أتمتة المتصفح. تُستخدم معها مكتبة requests لجلب HTTP، ثم تحلل HTML الذي تقدمه لها. وهذا يجعلها أسهل نقطة انطلاق للمطورين، لكنه أيضًا الأكثر محدودية.
الميزات الرئيسية:
- سهلة جدًا في التعلم — تتطلب أقل قدر من الكود
- ممتازة للاستخراج الصغير أو لمرة واحدة من Craigslist
- مجانية ومفتوحة المصدر
القيود: لا يوجد دعم مدمج للتصفح الصفحي، ولا عرض JavaScript، ولا تدوير بروكسيات — كل ذلك يجب إضافته يدويًا. وإذا غيّر Craigslist بنية HTML، ستتعطل المحددات لديك وتصلحها يدويًا.
الأفضل لـ: مبتدئو Python الذين يريدون تجربة استخراج Craigslist بإعداد بسيط جدًا، وسحب بيانات سريع لمرة واحدة من فئة أو منطقة واحدة، والمطورون الذين يحتاجون فقط إلى محلل خفيف.
دليل الحماية من الحظر في Craigslist: البروكسيات وحدود السرعة وما الذي يؤدي إلى الحظر
هذا هو القسم الذي تتجاهله معظم أدلة استخراج Craigslist، وهو الأهم فعلًا. تصنف اختبارات Scraperly في أبريل 2026 Craigslist كهدف صعوبة 3/5، مع الإشارة إلى CAPTCHA مخصص، وتحديد المعدل، وحظر IP. وتدفع دروس Bright Data المستخدمين إلى Web Unlocker أو Scraping Browser مبني على Playwright بدلًا من HTTP العادي. وتقول صفحة بروكسيات Oxylabs إن Craigslist قد يكتشف البروكسيات وأن البروكسيات السكنية هي الخيار الأفضل.
إليك ما يعمل فعليًا:
| الاستراتيجية | الفعالية على Craigslist | التكلفة | التعقيد |
|---|---|---|---|
| البروكسيات السكنية | ✅ عالية | $$ (4–6 دولارات/GB) | متوسطة |
| بروكسيات ISP | ✅ عالية | $ (0.60–0.80 دولار/IP) | متوسطة |
| بروكسيات مراكز البيانات | ⚠️ منخفضة (غالبًا تُحظر) | $ (0.20–0.40 دولار/IP) | منخفضة |
| استخراج قائم على المتصفح (جلسة خاصة بك) | ✅ متوسطة إلى عالية | مجاني | منخفضة |
| تحديد المعدل + تأخيرات عشوائية | ✅ أساس ضروري | مجاني | منخفضة |
نصائح عملية:
- فواصل بين الطلبات: 2–5 ثوانٍ على الأقل بين الطلبات. تقترح Scraperly البقاء عند 5–10 طلبات/دقيقة لكل IP وتدويرها بعد 20–30 طلبًا.
- تدوير الجلسات: دوّر user agents وبصمات المتصفح. أنماط الزحف المتوقعة تُكتشف بسرعة.
- تجنب بروكسيات مراكز البيانات: هي رخيصة لكنها تُحظر سريعًا على Craigslist.
- الاستخراج القائم على المتصفح يلغي مشكلة البروكسي تمامًا في الأحجام المتوسطة. يعمل وضع المتصفح في Thunderbit داخل جلسة Chrome الخاصة بك — لا إعداد بروكسي، لا تدوير IP، لا تكلفة. بالنسبة لمعظم مستخدمي الأعمال الذين يستخرجون بضع مئات من الإعلانات، فهذا أكثر من كافٍ.
وهناك زاوية الصيانة التي يغفل عنها معظم الناس: عندما يغيّر Craigslist CSS الخاص به (وهو يفعل ذلك دوريًا)، تتعطل كل أداة تعتمد على محددات CSS. عليك فحص الصفحة، والعثور على المحددات الجديدة، وتحديث الكود، وإعادة الاختبار. الأدوات المدعومة بالذكاء الاصطناعي مثل Thunderbit تتجنب هذا تمامًا — فالذكاء الاصطناعي يقرأ بنية الصفحة من جديد في كل مرة، لذا فإن تغييرات التخطيط لا تكسر سير عملك.
الكود مقابل بدون كود: شرحان كاملان لاستخراج Craigslist
أعرف أن جمهور هذا المقال منقسم تقريبًا بنسبة 50/50: مستخدمو الأعمال غير التقنيين الذين يريدون البيانات فقط، والمطورون المبتدئون إلى المتوسطين الذين يريدون كودًا يعمل. لذا إليك المساران جنبًا إلى جنب.
بدون كود: كيف تستخرج Craigslist باستخدام Thunderbit (خطوة بخطوة)
- ثبّت إضافة Thunderbit على Chrome من متجر Chrome الإلكتروني.
- انتقل إلى صفحة قوائم Craigslist — مثلًا، الشقق في مدينتك (
https://yourcity.craigslist.org/search/apa). - انقر "اقترح الحقول بالذكاء الاصطناعي" — يقرأ الذكاء الاصطناعي في Thunderbit الصفحة ويقترح أعمدة مناسبة للفئة. بالنسبة إلى السكن، سترى العنوان والسعر والمساحة وعدد الغرف والموقع وتاريخ النشر والرابط.
- راجع الأعمدة المقترحة وعدّلها إذا لزم الأمر. أضف الحقول أو أزلها بنقرة واحدة.
- انقر "استخراج" — وشاهد البيانات تُملأ في جدول منظم.
- تعامل مع التصفح الصفحي — تنقل بين الصفحات أو دع Thunderbit يتولى ذلك.
- استخدم "استخراج الصفحات الفرعية" لزيارة كل إعلان على حدة وإثرائه بحقول صفحة التفاصيل: الوصف الكامل، جميع الصور، ومعلومات التواصل المضمنة.
- صدّر إلى Google Sheets أو Excel أو Airtable أو Notion أو CSV — مجانًا.
تستغرق العملية بأكملها حوالي دقيقتين لصفحة نتائج واحدة. لا محددات CSS، ولا بروكسيات، ولا كود.
مسار الكود: كيف تستخرج Craigslist باستخدام Python + Playwright
تُعد Playwright المكتبة الأكثر ترشيحًا لاستخراج Craigslist في منتديات المطورين في 2026. إليك مقطع Python عملي يستخرج صفحة نتائج سكن في Craigslist، ويأخذ العنوان والسعر والرابط، ويتعامل مع التصفح الصفحي، ويُخرج النتائج.
النهج: جرّب أولًا البيانات المنظمة JSON-LD (فـ Craigslist يضمّن مخطط ItemList في بعض الصفحات)، ثم انتقل إلى محددات DOM عند الحاجة. يتم التنقل الصفحي عبر s=120.
import asyncio, json
from urllib.parse import urlparse, parse_qs, urlencode, urlunparse
from playwright.async_api import async_playwright
def next_page_url(url, step=120):
p = urlparse(url)
qs = parse_qs(p.query)
offset = int(qs.get("s", ["0"])[0]) + step
qs["s"] = [str(offset)]
return urlunparse((p.scheme, p.netloc, p.path, "", urlencode(qs, doseq=True), ""))
async def scrape_page(page, url):
await page.goto(url, wait_until="domcontentloaded")
await page.wait_for_timeout(1500)
data = []
# Try JSON-LD first
for raw in await page.locator('script[type="application/ld+json"]').all_text_contents():
try:
obj = json.loads(raw)
except Exception:
continue
if isinstance(obj, dict) and obj.get("@type") == "ItemList":
for item in obj.get("itemListElement", []):
thing = item.get("item", {})
data.append({
"title": thing.get("name"),
"price": thing.get("offers", {}).get("price"),
"link": thing.get("url"),
})
if data:
return data
# Fallback: DOM selectors
cards = page.locator("div.cl-search-result, li.cl-static-search-result")
count = await cards.count()
for i in range(count):
card = cards.nth(i)
title = await card.locator("a.posting-title, a.titlestring").first.text_content()
link = await card.locator("a.posting-title, a.titlestring").first.get_attribute("href")
price = (await card.locator(".price, .result-price").first.text_content()
if await card.locator(".price, .result-price").count() else None)
data.append({"title": (title or "").strip(), "price": (price or "").strip(), "link": link})
return data
async def main():
start_url = "https://newyork.craigslist.org/search/apa?query=studio"
async with async_playwright() as p:
browser = await p.chromium.launch(headless=True)
page = await browser.new_page()
url = start_url
all_rows = []
for _ in range(3): # scrape 3 pages
rows = await scrape_page(page, url)
if not rows:
break
all_rows.extend(rows)
url = next_page_url(url)
await browser.close()
for row in all_rows[:10]:
print(row)
asyncio.run(main())
ما الذي ستحتاجه إلى جانب هذا السكربت: تثبيت Playwright (pip install playwright && playwright install)، وإعداد البروكسي للتشغيلات ذات الحجم الكبير، والتعامل اليدوي مع CAPTCHA إذا صادفت قيود المعدل. هذه هي المقايضة: تحكم كامل، لكن مسؤولية كاملة أيضًا.
مجاني مقابل مدفوع: تفصيل صريح للتكلفة لكل أداة استخراج Craigslist
هذا هو الجدول الذي كنت أتمنى لو كان موجودًا عندما بدأت أبحث في هذا الموضوع. كلمة «مجاني» كلمة محمّلة في عالم استخراج الويب.
| الأداة | مجانية بالكامل؟ | حدود الخطة المجانية | السعر الابتدائي المدفوع | التكاليف الخفية |
|---|---|---|---|---|
| Thunderbit | خطة مجانية | 6 صفحات/شهر؛ التجربة المجانية = 10 صفحات | خطط مدفوعة للحجم الأكبر | لا شيء — التصدير مجاني |
| Scrapy | ✅ مفتوح المصدر | غير محدود | 0 دولار | تكاليف البروكسي والاستضافة والصيانة |
| BeautifulSoup | ✅ مفتوح المصدر | غير محدود | 0 دولار | تكاليف البروكسي والاستضافة والصيانة |
| Playwright | ✅ مفتوح المصدر | غير محدود | 0 دولار | تكاليف البروكسي والاستضافة والصيانة |
| Selenium | ✅ مفتوح المصدر | غير محدود | 0 دولار | تكاليف البروكسي والاستضافة والصيانة |
| ParseHub | خطة مجانية | 5 مشاريع | نحو 189 دولارًا/شهر | تشغيلات مجدولة محدودة في الخطة المجانية |
| Apify | خطة مجانية | رصيد 5 دولارات/شهر مجانًا | نحو 49 دولارًا/شهر | قد تقفز التسعيرة حسب الحوسبة |
| Phantombuster | خطة مجانية | 5 خانات، 2 ساعة/شهر، تصدير 10 صفوف | نحو 56 دولارًا/شهر (سنويًا) | تسعير حسب الخانة |
| Bright Data | تجربة فقط | 1000 طلب / أسبوع واحد | نحو 500+ دولار/شهر | تكاليف البروكسي إضافية |
| Oxylabs | تجربة فقط | 2000 نتيجة / 1GB | نحو 75+ دولارًا/شهر (Unblocker) | تسعير مؤسسي |
الملاحظة الكبيرة على أدوات المصدر المفتوح «المجانية»: Scrapy وPlaywright وSelenium وBeautifulSoup تكلف 0 دولار للتثبيت، لكن تشغيلها على Craigslist على نطاق واسع يعني ساعات من وقت المطورين للإعداد، و50–500+ دولار/شهر للبروكسيات السكنية، وصيانة مستمرة في كل مرة يغيّر فيها Craigslist HTML الخاص به. يقرأ Thunderbit الصفحة من جديد في كل مرة (صيانة صفرية)، والتصدير مجاني، والاستخراج القائم على المتصفح يلغي تكاليف البروكسي للأحجام المتوسطة. وهذه ميزة حقيقية لغير المطورين.
ما الذي يمكنك استخراجه فعليًا: حقول بيانات Craigslist حسب الفئة
تختلف فئات Craigslist جذريًا في بنية البيانات. إعلان سكن لا يشبه إعلان وظيفة. إليك ما يمكنك استخراجه بواقعية من كل قسم رئيسي:
| فئة Craigslist | الحقول القابلة للاستخراج | هل تتوفر معلومات التواصل؟ |
|---|---|---|
| السكن / الشقق | العنوان، السعر، المساحة، عدد غرف النوم، عدد الحمامات، الموقع، التاريخ، الصور، الوصف، رابط الخريطة، التوفر، سياسة الحيوانات الأليفة، الغسيل/المواقف | ⚠️ أحيانًا (تحويل بريد إلكتروني مجهول) |
| للبيع | العنوان، السعر، الحالة، الموقع، التاريخ، الصور، الوصف، الصنع/الطراز/السنة (تختلف) | ⚠️ أحيانًا |
| الوظائف | العنوان، الشركة، التعويض، الموقع، نوع الوظيفة، مستوى الخبرة، التاريخ، الوصف | نادرًا (رابط التقديم فقط) |
| الخدمات | العنوان، الموقع، الوصف، الصور | ⚠️ أحيانًا |
| الأعمال الحرة | العنوان، التعويض، الموقع، التاريخ، الوصف | ⚠️ أحيانًا |
بعض الملاحظات المهمة:
- معلومات التواصل: يستخدم Craigslist تحويلات بريد إلكتروني مجهولة تحديدًا لمنع استخراج البريد الإلكتروني المباشر. الأدوات التي تزعم «استخراج البريد الإلكتروني» غالبًا ما تلتقط عنوان التحويل (
reply+randomstring@craigslist.org) وليس البريد الحقيقي للناشر. - حقول صفحة التفاصيل مثل الوصف الكامل وجميع الصور ومعلومات التواصل المضمنة لا تظهر إلا عند زيارة كل إعلان على حدة — وليس في صفحة نتائج البحث.
- "اقترح الحقول بالذكاء الاصطناعي" في Thunderbit يكتشف تلقائيًا الحقول المتاحة في الصفحة الحالية ويقترح البنية الصحيحة للأعمدة. المستخدم الذي يستخرج السكن يحصل على أعمدة المساحة/عدد الغرف؛ والمستخدم الذي يستخرج الوظائف يحصل على أعمدة التعويض/نوع الوظيفة — من دون أي إعداد يدوي. ثم يقوم استخراج الصفحات الفرعية بزيارة كل إعلان لالتقاط حقول صفحة التفاصيل فقط.
مراجعة قانونية: شروط استخدام Craigslist، قضية 3Taps، وما الذي يجب أن تعرفه
لست محاميًا، وهذا ليس نصيحة قانونية. لكني أعلم أن المستخدمين قلقون بشأن هذا، ويستحق جوابًا مباشرًا.
السابقة الأهم: في Craigslist ضد 3Taps (2013)، حصل Craigslist على أمر قضائي ضد 3Taps بسبب استخراج الإعلانات وإعادة نشرها بعد إرسال إنذار بوقف النشاط. ويُزعم أن 3Taps تجاوزت حظر IP باستخدام خوادم بروكسي، وتعاملت المحكمة مع الوصول بعد الحظر على أنه قد يكون «من دون إذن». وأشارت EFF إلى أن القضية تمت تسويتها في 2015.
شروط استخدام Craigslist تحظر صراحةً استخدام «robots أو spiders أو scripts أو scrapers أو crawlers أو أي مكافئ آلي أو يدوي» للتفاعل مع الموقع. كما يحددون تعويضات مصفاة بقيمة 0.25 دولار لكل صفحة بعد أول 1000 مشاهدة صفحة خلال 24 ساعة في حال المخالفة.
إرشاد عملي:
- ✅ استخرج بيانات الإعلانات العامة لأغراض بحثية أو شخصية
- ✅ احترم robots.txt وحدود المعدل
- ⚠️ لا تعِد نشر الإعلانات المستخرجة على نطاق واسع
- ⚠️ لا تستخدم بيانات التواصل المستخرجة للتسويق غير المرغوب
- ❌ لا تتجاوز قيود الوصول التقنية بعد الحظر
الفرق مهم: استخراج البيانات العامة المرئية لتحليلك الخاص يختلف عن إعادة النشر على نطاق واسع أو جمع الإيميلات من أجل السبام. لكن كن على علم بأن Craigslist تاريخيًا انتقل من فرض الشروط إلى حظر IP ثم إلى الإجراءات القانونية.
ما أداة استخراج Craigslist الأفضل لك؟
بعد اختبار وتقييم الأدوات العشر كلها، هذه هي توصياتي حسب السيناريو:
- مستخدم أعمال غير تقني يحتاج بيانات Craigslist بسرعة → Thunderbit. لا كود، اكتشاف حقول بالذكاء الاصطناعي، صيانة صفرية، تصدير مجاني. أسرع طريق من «أحتاج هذه البيانات» إلى «هي في جدول البيانات الآن».
- فريق مؤسسي يستخرج آلاف الإعلانات يوميًا عبر جميع المناطق → Bright Data. مستخرج مخصص لـ Craigslist، بنية بروكسي ضخمة، حل تلقائي لـ CAPTCHA، ودعم مخصص.
- فريق مطورين يحتاج إلى بنية API/Proxy مُدارة → Oxylabs لسير العمل القائم على البروكسي أولًا، وApify لمرونة سوق الـ Actors.
- مطور يريد تحكمًا وتخصيصًا كاملين → Scrapy + Playwright. مفتوح المصدر ومرن إلى أقصى حد، لكن أحضر بروكسياتك وصيانتك الخاصة.
- مستخدم حساس للميزانية مع احتياجات متوسطة → الخطة المجانية في Apify (رصيد 5 دولارات/شهر) أو الخطة المجانية في ParseHub (5 مشاريع).
- فريق مبيعات يستخدم بالفعل أدوات توليد العملاء المحتملين متعددة المنصات → Phantombuster. أضف Craigslist إلى خطك الحالي.
- مبتدئ Python يقوم باستخراج لمرة واحدة → BeautifulSoup + requests. كود بسيط، إعداد بسيط، وقدرات بسيطة.
بالنسبة لمعظم مستخدمي الأعمال غير التقنيين، يقدم Thunderbit أفضل توازن بين السهولة والدقة والتكلفة. وللمطورين، فإن Scrapy + Playwright هو المزيج الأقوى. أما على مستوى المؤسسات، فمن الصعب التغلب على Bright Data.
إذا أردت أن ترى كيف يبدو استخراج Craigslist المدعوم بالذكاء الاصطناعي عمليًا، جرّب Thunderbit — فخطته المجانية كافية لتجربته على حالتك الخاصة. وإذا أردت التعمق أكثر في تقنيات استخراج الويب، فاطّلع على أدلتنا حول كيفية الاستخراج إلى Google Sheets، وأفضل أدوات استخراج الويب المؤتمتة، واستخراج الويب من دون التعرض للحظر. يمكنك أيضًا استكشاف قناتنا على YouTube للحصول على شروحات فيديو خطوة بخطوة.
استخراجًا سعيدًا — ولتكن بياناتك دائمًا نظيفة ومنظمة وجاهزة للعمل.
الأسئلة الشائعة
هل من القانوني استخراج قوائم Craigslist؟
شروط استخدام Craigslist تحظر صراحةً الاستخراج الآلي، وتُعد قضية Craigslist ضد 3Taps أبرز سابقة قانونية في هذا المجال. يُعامل استخراج بيانات الإعلانات العامة للاستخدام الشخصي أو التحليلي عادةً بشكل مختلف عن إعادة النشر على نطاق واسع أو السبام، لكن عليك دائمًا احترام حدود المعدل وقواعد الموقع — وهذا ليس نصيحة قانونية.
هل يمكنني استخراج Craigslist من دون برمجة؟
نعم. أدوات مثل Thunderbit وParseHub وApify توفر خيارات بدون كود أو منخفضة الكود لاستخراج بيانات Craigslist. يجعل اكتشاف الحقول بالذكاء الاصطناعي في Thunderbit الأمر سهلًا جدًا — فقط انقر «اقترح الحقول بالذكاء الاصطناعي» ثم «استخراج».
ما هي أفضل أداة مجانية لاستخراج Craigslist؟
للمطورين، Scrapy أو BeautifulSoup مجانيان بالكامل ومفتوحا المصدر (مع أن تكاليف البروكسي والصيانة تتراكم). لغير المبرمجين، تعد الخطة المجانية في Thunderbit (6 صفحات/شهر) أفضل نقطة بداية، مع الخطة المجانية في ParseHub (5 مشاريع) كخيار آخر.
كيف أتجنب الحظر أثناء استخراج Craigslist؟
استخدم تحديد المعدل (تأخيرات 2–5 ثوانٍ على الأقل)، ودوّر user agents، وتجنب بروكسيات مراكز البيانات (البروكسيات السكنية أو بروكسيات ISP تعمل أفضل بكثير على Craigslist)، ولا تتبع أنماط زحف متوقعة. وللأحجام المتوسطة، تتجنب أدوات الاستخراج القائمة على المتصفح مثل Thunderbit مشكلة البروكسي بالكامل عبر العمل داخل جلسة Chrome الخاصة بك.
هل يمكنني استخراج جميع مناطق Craigslist دفعة واحدة؟
مع أدوات المطورين مثل Scrapy أو Playwright، يمكنك برمجيًا التكرار عبر جميع عناوين المناطق الأمريكية/الإقليمية الـ 416. أما أدوات المؤسسات مثل Bright Data وOxylabs فلديها استخراج متعدد المناطق مدمج. ومع Thunderbit، يمكنك فتح كل موقع إقليمي واستخراجه بنفس سير العمل — فالذكاء الاصطناعي يتكيف مع كل صفحة تلقائيًا.
جرّب Thunderbit لاستخراج Craigslist Get Started Free
اعرف المزيد


