دعني أعود بك إلى أول مرة حاولت فيها استخراج بيانات المنتجات من موقع تجارة إلكترونية. كان معي Python، وفنجان قهوة، وحلم واحد: بناء متتبّع أسعار لـ Amazon. وبعد بضع ساعات، تحوّل “مشروعي السريع” إلى خليط معقّد من محددات XPath، ومشكلات في الترقيم الصفحي، وكمية من التصحيح البرمجي أكثر مما أحب أن أعترف به. إذا سبق لك أن حاولت تطويع بيانات الويب بالكود، فأنت تعرف هذا الشعور على الأرجح: حماس من جهة، و«لماذا هذا معقّد إلى هذا الحد؟» من جهة أخرى.
والحقيقة أن استخراج بيانات الويب لم يعد حكرًا على علماء البيانات أو المهندسين. لقد أصبح مهارة أساسية لفرق المبيعات، ومديري التجارة الإلكترونية، والمسوقين، وكل من يريد تحويل فوضى الويب إلى ذكاء أعمال. في الواقع، بلغ سوق برمجيات استخراج الويب 1.01 مليار دولار في 2024 ومن المتوقع أن يصل إلى 2.49 مليار دولار بحلول 2032، وما زال المنحنى في تصاعد. لكن رغم أن Python وأطر العمل مثل Scrapy لا تزال المعيار الذهبي للمشاريع المخصصة واسعة النطاق، فإنها ليست سهلة تمامًا للمبتدئين. لذلك، في هذا الدليل، سأشرح لك Scrapy خطوة بخطوة — باستخدام حالة عملية حقيقية تتعلق بـ Amazon — وأيضًا سأعرض لك بديلًا أسهل بكثير يعمل بالذكاء الاصطناعي لمن لا يكتبون الكود: Thunderbit.
ما هو Scrapy Python؟ أداتك القوية لاستخراج بيانات الويب
لنبدأ من الأساسيات. Scrapy هو إطار عمل مفتوح المصدر بلغة Python صُمم خصيصًا لزحف الويب واستخراج البيانات منه. فكّر فيه كمجموعة أدوات متكاملة لبناء عناكب مخصصة — وهو الاسم الذي يطلقه Scrapy على برامج الزحف — قادرة على التنقل بين المواقع، وتتبع الروابط، والتعامل مع الترقيم الصفحي، واستخراج البيانات المنظمة على نطاق واسع.
بماذا يختلف Scrapy عن مجرد استخدام requests وBeautifulSoup في Python؟ حسنًا، بينما تكون هذه المكتبات ممتازة للاستخراجات البسيطة أو لمرة واحدة، فإن Scrapy مُصمم للمشاريع الكبيرة والمعقدة — من النوع الذي تحتاج فيه إلى:
- الزحف عبر آلاف الصفحات (مثل: كل منتج في كتالوج تجارة إلكترونية)
- تتبع الروابط والتعامل مع الترقيم الصفحي تلقائيًا
- معالجة البيانات بشكل غير متزامن لزيادة السرعة
- تنظيم البيانات وتنظيفها وتصديرها بطريقة قابلة للتكرار
باختصار، Scrapy أشبه بسكين الجيش السويسري لاستخراج بيانات الويب — قوي، ومرن، ومربك قليلًا للمبتدئين، سواء أحببنا ذلك أم لا.
لماذا تستخدم Scrapy Python لاستخراج بيانات الويب؟
إذًا، لماذا يواصل المطورون وفرق البيانات اللجوء إلى Scrapy؟ إليك ملخصًا سريعًا لما يجعله مميزًا:
| حالة الاستخدام | نقاط قوة Scrapy | القيمة التجارية |
|---|---|---|
| مراقبة الأسعار | يتعامل مع الترقيم الصفحي، والطلبات غير المتزامنة، والجدولة | التقدم على المنافسين، والتسعير الديناميكي |
| استخراج كتالوج المنتجات | يتتبع الروابط، ويستخرج بيانات منظمة | بناء قواعد بيانات المنتجات، وتغذية التحليلات |
| تحليل المنافسين | قابل للتوسع، ومتين أمام تغييرات الموقع | تتبع الاتجاهات، والإطلاقات الجديدة، ومستويات المخزون |
| أبحاث السوق | خطوط معالجة معيارية لتنظيف البيانات وتحويلها | تجميع المراجعات، وتشغيل تحليل المشاعر |
يعني المحرك غير المتزامن في Scrapy (المبني على Twisted) أنه يستطيع جلب صفحات متعددة بالتوازي، ما يجعله سريعًا وقابلًا للتوسع. كما تسمح لك بنيته المعيارية بإضافة منطق مخصص بسهولة، مثل البروكسيات، أو وكلاء المستخدم، أو خطوات تنظيف البيانات. ومع خطوط المعالجة يمكنك معالجة البيانات والتحقق منها وتصديرها بالطريقة التي تريدها — CSV أو JSON أو قواعد بيانات، سمِّ ما شئت.
بالنسبة للفرق التي تمتلك مهارات في Python، يُعد Scrapy أداة جبارة. لكن لنكن صريحين: فهو ليس من نوع الأدوات التي تعمل بمجرد “التوصيل والتشغيل” للمستخدم التجاري العادي.

إعداد بيئة Scrapy Python
هل أنت مستعد للبدء؟ إليك كيفية إعداد Scrapy من الصفر:
1. تثبيت Scrapy
أولًا، تأكد من تثبيت Python 3.10+ (إذ أوقف Scrapy 2.15.x دعم 3.9 في 2026). ثم افتح الطرفية ونفّذ:
pip install scrapy
تحقق من التثبيت باستخدام:
scrapy version
إذا كنت على Windows أو تستخدم Anaconda، فقد ترغب في إعداد بيئة افتراضية لتجنب التعارضات. يعمل Scrapy على Windows وmacOS وLinux.
2. إنشاء مشروع Scrapy جديد
لنبدأ مشروعًا جديدًا باسم amazonscraper:
scrapy startproject amazonscraper
ستحصل على بنية مجلدات مثل هذه:
amazonscraper/
├── scrapy.cfg
├── amazonscraper/
│ ├── __init__.py
│ ├── items.py
│ ├── pipelines.py
│ ├── middlewares.py
│ ├── settings.py
│ └── spiders/
ماذا تفعل هذه الملفات؟
scrapy.cfg: إعدادات المشروع (نادراً ما تحتاج إلى لمسها)items.py: تعريف نماذج البيانات لديك (مثل منتج يحتوي على الاسم والسعر وما إلى ذلك)pipelines.py: هنا تنظف بياناتك وتتحقق منها وتصدرهاmiddlewares.py: أمور متقدمة (بروكسيات، رؤوس مخصصة)settings.py: تعديل سلوك Scrapy (التوازي، التأخيرات، إلخ)spiders/: هنا يعيش منطق الاستخراج الفعلي
إذا بدأت تشعر الآن ببعض الإرهاق، فأنت لست وحدك. هذا هو الموضع الذي يبدأ فيه كثير من غير المبرمجين بالتوتر.
بناء أداة استخراج Python: استخراج بيانات منتجات Amazon باستخدام Scrapy
لنمر على مثال واقعي: استخراج بيانات المنتجات من نتائج البحث في Amazon. (تنبيه: شروط خدمة Amazon لا تسمح بالاستخراج، كما أنهم صارمون جدًا في آليات مكافحة الروبوتات. هذا لأغراض تعليمية فقط!)
1. إنشاء Spider
داخل مجلد spiders/، أنشئ ملفًا باسم amazon_spider.py:
import scrapy
class AmazonSpider(scrapy.Spider):
name = "amazon_example"
allowed_domains = ["amazon.com"]
start_urls = ["https://www.amazon.com/s?k=smartphones"]
def parse(self, response):
products = response.xpath("//div[@data-component-type='s-search-result']")
for product in products:
yield {
'name': product.xpath(".//span[@class='a-size-medium a-color-base a-text-normal']/text()").get(),
'price': product.xpath(".//span[@class='a-price-whole']/text()").get(),
'rating': product.xpath(".//span[@aria-label]/text()").get()
}
next_page = response.xpath("//li[@class='a-last']/a/@href").get()
if next_page:
yield scrapy.Request(url=response.urljoin(next_page), callback=self.parse)
ماذا يحدث هنا؟
- نبدأ من صفحة نتائج بحث في Amazon لكلمة “smartphones”.
- لكل منتج، نستخرج الاسم والسعر والتقييم باستخدام محددات XPath.
- نبحث عن رابط “الصفحة التالية” ونخبر Scrapy بمتابعته لاستخراج المزيد من المنتجات.
2. تشغيل Spider الخاص بك
من جذر المشروع، نفّذ:
scrapy crawl amazon_example -o products.json
وبذلك سيزحف Scrapy عبر نتائج البحث، ويتابع الترقيم الصفحي، ويحفظ بياناتك في ملف JSON.
التعامل مع الترقيم الصفحي والمحتوى الديناميكي
الدعم المدمج في Scrapy لتتبع الروابط والتعامل مع الترقيم الصفحي هو أحد نقاط قوته. لكن ماذا عن المحتوى الديناميكي — الصفحات التي تُحمّل البيانات عبر JavaScript؟ افتراضيًا، لا يرى Scrapy إلا HTML الثابت. إذا احتجت إلى استخراج محتوى يُحمَّل بواسطة JavaScript (مثل التمرير اللانهائي أو المراجعات المنبثقة)، فستحتاج إلى دمجه مع أدوات مثل Selenium أو Splash. وهذا موضوع آخر تمامًا.
معالجة البيانات وتصديرها باستخدام Scrapy Python
بعد استخراج البيانات، ستحتاج غالبًا إلى تنظيفها وتصديرها إلى مكان مفيد.
- خطوط المعالجة: في
pipelines.pyيمكنك كتابة أصناف Python لتنظيف بياناتك أو التحقق منها أو إثرائها (مثل تحويل الأسعار إلى أرقام، أو حذف الصفوف غير المكتملة، أو حتى استدعاء واجهة ترجمة). - التصدير: يمكن لـ Scrapy التصدير مباشرة إلى CSV أو JSON أو XML باستخدام الخيار
o. أما التصديرات الأكثر تقدمًا (مثل الدفع إلى Google Sheets)، فستحتاج إلى كتابة كود إضافي أو استخدام مكتبات خارجية.
هل تريد تنفيذ تحليل مشاعر أو ترجمة أوصاف المنتجات؟ ستحتاج إلى الدمج مع واجهات برمجة التطبيقات الخارجية أو مكتبات Python — لا شيء من ذلك مدمج افتراضيًا.
التكاليف الخفية: تحديات Scrapy Python لمستخدمي الأعمال
لنكن واقعيين: Scrapy قوي، لكنه ليس سهل الاستخدام لغير المطورين. إليك ما يربك معظم المستخدمين التجاريين:
- منحنى تعلّم حاد: تحتاج إلى معرفة Python وHTML ومحددات XPath/CSS وبنية مشروع Scrapy. وقد يستغرق الأمر أيامًا أو حتى أسابيع لتشعر بالارتياح.
- مشكلات الإعداد: تثبيت Python وإدارة الاعتمادات وحل الأخطاء قد يكون مرهقًا — خصوصًا على Windows.
- لا توجد واجهة مرئية: كل شيء يعتمد على الكود. لا يمكنك ببساطة النقر على الصفحة لاختيار البيانات.
- الصيانة: إذا تغيّر الموقع، يتعطل spider الخاص بك. وستكون أنت المسؤول عن إصلاحه.
- لا يوجد ذكاء اصطناعي مدمج: هل تريد الترجمة أو التلخيص أو تحليل المشاعر؟ كل ذلك يحتاج إلى كود إضافي.

إليك مقارنة سريعة:
| التحدي | Scrapy (Python) | احتياج المستخدم التجاري |
|---|---|---|
| الحاجة إلى البرمجة | نعم | يفضَّل عدم الحاجة إلى كود |
| وقت الإعداد | ساعات (أو أيام) | دقائق |
| الصيانة | مستمرة (عند تغيّر الموقع) | قليلة جدًا |
| تصدير البيانات | CSV/JSON (استيراد يدوي إلى Sheets/Excel) | مباشرة إلى Excel/Sheets/Notion |
| ميزات الذكاء الاصطناعي | لا شيء (تكامل بنفسك) | ترجمة/تحليل مشاعر مدمجان |
إذا كنت مسوقًا منفردًا، أو مندوب مبيعات، أو مدير عمليات، فقد يبدو Scrapy وكأنك جلبت مدفعًا ضخمًا لمعارك البالونات المائية.
تعرّف على Thunderbit: البديل بلا كود لـ Scrapy Python
وهنا يأتي دور Thunderbit. وبصفتي شخصًا أمضى سنوات في بناء أدوات الأتمتة، أستطيع أن أقول لك: معظم المستخدمين التجاريين لا يريدون البرمجة — إنهم يريدون البيانات بسرعة فحسب.
Thunderbit هو أداة استخراج ويب بالذكاء الاصطناعي تُقدَّم على شكل إضافة لمتصفح Chrome. وهي مصممة للمستخدمين غير التقنيين الذين يريدون:
- استخراج البيانات من أي موقع ببضع نقرات
- استخدام اللغة الطبيعية لوصف ما يريدونه («اسم المنتج، السعر، التقييم»)
- التعامل تلقائيًا مع الترقيم الصفحي والصفحات الفرعية
- تصدير البيانات مباشرة إلى Excel أو Google Sheets أو Airtable أو Notion
- الترجمة أو التلخيص أو تحليل المشاعر فورًا
لا Python. لا محددات. لا صداع الصيانة.
كيفية استخراج بيانات أي موقع باستخدام الذكاء الاصطناعي Get Started Free
Thunderbit مصمم لمستخدمي الأعمال الذين يريدون التحرك بسرعة وترك الذكاء الاصطناعي يتولى العمل الشاق.
Thunderbit مقابل Scrapy Python: مقارنة مباشرة
لنضعهما وجهًا لوجه:
| الجانب | Scrapy (Python) | Thunderbit (أداة ذكاء اصطناعي) |
|---|---|---|
| المهارات المطلوبة | Python وHTML والمحددات | لا شيء — نقر ونقر، ولغة طبيعية |
| وقت الإعداد | ساعات (تثبيت، كود، تصحيح) | دقائق (تثبيت إضافة Chrome، تسجيل الدخول) |
| هيكلة البيانات | يدوية (تعريف items وخطوط المعالجة) | الذكاء الاصطناعي يكتشف الأعمدة ويقترح الحقول تلقائيًا |
| الترقيم الصفحي/الصفحات الفرعية | يتطلب كود | بنقرة واحدة (يتعامل معه الذكاء الاصطناعي) |
| الترجمة | كود مخصص أو دمج مع واجهة برمجة تطبيقات | مدمجة — فقط فعّل “Translate” |
| تحليل المشاعر | مكتبة/واجهة خارجية | مدمج — أضف عمود “Sentiment” |
| خيارات التصدير | CSV/JSON (استيراد يدوي إلى Sheets/Excel) | تصدير بنقرة واحدة إلى Excel وGoogle Sheets وAirtable وNotion |
| الصيانة | يدوية (تحديث الكود إذا تغيّر الموقع) | يتكيف الذكاء الاصطناعي تلقائيًا مع التغييرات البسيطة في الموقع |
| النطاق | الأفضل للمشاريع الكبيرة والمستمرة | الأفضل للمهام السريعة، والنطاق المتوسط (مئات/آلاف الصفوف) |
| التكلفة | مجاني (لكن يستهلك الوقت وموارد المطورين) | خطة مجانية + خطط مدفوعة (تبدأ من 9 دولارات/شهر، لكنها توفر وقتًا ومشاكل كثيرة) |
متى تختار Scrapy Python ومتى تختار Thunderbit لاستخراج بيانات الويب؟
هذه هي قاعدتي المختصرة:
- استخدم Scrapy إذا:
- كنت مطورًا أو لديك مطور في فريقك
- تحتاج إلى استخراج عشرات الآلاف من الصفحات، أو بناء خط إنتاج مخصص ومستمر
- كان الموقع معقدًا جدًا أو يتطلب منطقًا متقدمًا
- أردت تحكمًا كاملًا (ولا تمانع الصيانة)
- استخدم Thunderbit إذا:
- كنت لا تبرمج (أو لا تريد ذلك)
- كنت تحتاج البيانات بسرعة، لمهمة تجارية لمرة واحدة أو متكررة
- كنت تريد ترجمة أو تحليل مشاعر أو إثراء بيانات مدمجًا
- كنت تقدّر السرعة والمرونة أكثر من التخصيص الخام

إليك مسار قرار سريع:
- هل تستطيع البرمجة بلغة Python؟
- نعم → Scrapy أو Thunderbit (للنتائج السريعة)
- لا → Thunderbit
- هل مشروعك ضخم ومستمر؟
- نعم → Scrapy
- لا → Thunderbit
- هل تحتاج إلى ترجمة أو تحليل مشاعر؟
- نعم → Thunderbit
- لا → أيٌّ منهما
خطوة بخطوة: استخراج بيانات منتجات Amazon باستخدام Thunderbit (من دون كود)
لنعد إلى مثال Amazon — لكن هذه المرة بالطريقة السهلة.
1. ثبّت Thunderbit
- حمّل إضافة Thunderbit لمتصفح Chrome
- سجّل حسابًا (تتوفر خطة مجانية)
جرّب إضافة Thunderbit على Chrome مجانًا
2. اذهب إلى Amazon وابحث عن منتجك
- افتح Amazon.com وابحث عن “laptops” (أو أي منتج آخر)
3. شغّل Thunderbit على الصفحة
- انقر على أيقونة Thunderbit في المتصفح
- ستفتح اللوحة الجانبية، وسيتم التعرف على صفحة Amazon
4. استخدم اقتراح الحقول بالذكاء الاصطناعي
- انقر “AI Suggest Fields”
- سيفحص ذكاء Thunderbit الاصطناعي الصفحة ويقترح أعمدة مثل “اسم المنتج” و“السعر” و“التقييم” و“عدد المراجعات”
- أضف الأعمدة أو احذفها حسب الحاجة (هل تريد “رابط المنتج” أو “أهلية Prime”؟ فقط اكتبها)
5. فعّل الترقيم الصفحي واستخراج الصفحات الفرعية
- فعّل Pagination: سيضغط Thunderbit تلقائيًا على “التالي” ويستخرج كل الصفحات
- فعّل Subpage Scraping: سيزور Thunderbit صفحة تفاصيل كل منتج ويجلب معلومات إضافية (مثل الأوصاف أو أرقام ASIN)
6. شغّل عملية الاستخراج
- انقر Scrape
- شاهد Thunderbit وهو يجمع البيانات في الوقت الفعلي، صفحة بعد صفحة
7. ترجم وحلل المشاعر (اختياري)
- هل تريد ترجمة أوصاف المنتجات؟ فعّل “Translate” لذلك العمود
- هل تريد تحليل مشاعر المراجعات؟ أضف عمود “Sentiment” — وسيملؤه ذكاء Thunderbit الاصطناعي
8. صدّر بياناتك
- انقر Export
- اختر Excel أو Google Sheets أو Airtable أو Notion
- ستكون بياناتك جاهزة للاستخدام — بلا استيراد يدوي، ولا تعقيدات CSV
9. جدولة الاستخراجات المتكررة (اختياري)
- أعد جدولًا زمنيًا (مثلًا: يوميًا الساعة 8 صباحًا)
- سيشغّل Thunderbit الاستخراج تلقائيًا ويحدّث الوجهة التي اخترتها
هذا كل شيء. لا كود، لا محددات، لا صيانة. فقط بيانات جاهزة للأعمال.
نصائح إضافية: الحصول على المزيد من مشاريع استخراج بيانات الويب
سواء كنت تستخدم Scrapy أو Thunderbit أو أي أداة أخرى، فهذه بعض أفضل الممارسات التي تعلمتها بالطريقة الصعبة:
- تحقق من صحة بياناتك: تأكد دائمًا من القيم المفقودة أو الغريبة (مثل أسعار 0 دولار أو أسماء فارغة)
- التزم بالامتثال: راجع شروط خدمة الموقع، واحترم
robots.txt، ولا تُرهق الخوادم - أتمتة بذكاء: استخدم الجدولة للحفاظ على حداثة البيانات، لكن لا تستخرج أكثر من الحاجة
- استفد من الأدوات المجانية: يتضمن Thunderbit أدوات مجانية لاستخراج البريد الإلكتروني وأرقام الهاتف والصور — ممتازة لتوليد العملاء المحتملين أو تنسيق المحتوى
- نظّم لأجل التحليل: صدّر مباشرة إلى Sheets/Excel لتتمكن من التصفية والجدولة والتحليل البصري بسرعة
لمزيد من النصائح، راجع مدونة Thunderbit أو دليلهم لاستخراج أي موقع باستخدام الذكاء الاصطناعي.
كيفية استخراج بيانات المواقع إلى Excel باستخدام الذكاء الاصطناعي Get Started Free
لمزيد من النصائح، راجع مدونة Thunderbit أو دليلهم لاستخراج أي موقع باستخدام الذكاء الاصطناعي.
الخلاصة: جعل استخراج بيانات الويب بسيطًا — اختر الأداة المناسبة لفريقك
إليك الزبدة: Scrapy أداة جبارة للمطورين، لكنها مبالغة بالنسبة لمعظم مستخدمي الأعمال. إذا كنت مرتاحًا مع Python وتحتاج إلى بناء أداة استخراج مخصصة وواسعة النطاق، فـ Scrapy خيار ممتاز. أما إذا كنت تريد التحرك بسرعة، وتجاوز الكود، والحصول على البيانات (مع الترجمة وتحليل المشاعر مدمجين)، فـ Thunderbit هو الطريق الأفضل.
لقد رأيت بنفسي مقدار الوقت والإحباط الذي يوفره Thunderbit للفرق غير التقنية. يمكنك الانتقال من “أتمنى لو كانت لدي هذه البيانات” إلى “ها هي في جدول البيانات” خلال دقائق — لا ساعات أو أيام. ومع ميزات مثل AI Suggest Fields، واستخراج الصفحات الفرعية، والتصدير بنقرة واحدة، لم يكن تحويل الويب إلى ذكاء أعمال أسهل من الآن.
لذا، في المرة القادمة التي تحتاج فيها إلى استخراج بيانات المنتجات أو مراقبة الأسعار أو بناء قائمة عملاء محتملين، اسأل نفسك: هل تريد كتابة Python، أم تريد نتائج؟ جرّب الخطة المجانية من Thunderbit واكتشف مدى سهولة استخراج بيانات الويب.
هل ترغب في معرفة المزيد؟ اطلع على الموقع الرسمي لـ Thunderbit، حمّل إضافة Chrome، أو تعمّق أكثر في أفضل ممارسات استخراج الويب على مدونة Thunderbit.
قراءات إضافية:
- ما هو استخراج البيانات وكيف تقوم به في 2026
- كيفية استخراج بيانات المواقع إلى Excel باستخدام الذكاء الاصطناعي
- أفضل أدوات وبرامج استخراج بيانات الويب في 2026
- تقرير حالة استخراج بيانات الويب
إخلاء مسؤولية: احرص دائمًا على أن تتوافق أنشطة استخراج بيانات الويب مع شروط المواقع والقوانين المحلية. وعند الشك، استشر مستشارًا قانونيًا — فلا أحد يريد أن يكون “المستخرج” الذي تصله رسالة وقف وكف بسبب جدول بيانات.
كتبها شواي جوان، الشريك المؤسس والرئيس التنفيذي في Thunderbit. لقد أمضيت سنوات في SaaS والأتمتة والذكاء الاصطناعي — حتى لا تضطر أنت إلى ذلك.
جرّب أداة استخراج الويب بالذكاء الاصطناعي Get Started Free


