สัปดาห์ก่อน เพื่อนร่วมงานในทีมขายมาขอให้ผมช่วยดึงข้อมูลติดต่อจากหน้าไดเรกทอรีธุรกิจประมาณ 200 หน้า แผนของเขาคือก็อปแล้ววางทีละหน้าเข้าไปในสเปรดชีต ผมเลยแนะนำให้ลองให้ ChatGPT ช่วยสร้างสคริปต์ Python สำหรับดึงข้อมูลดู อีก 20 นาทีต่อมา เขาก็ได้สคริปต์มาเรียบร้อย แต่พอผ่านไปอีกแค่ 30 นาที เขาก็ทัก DM มาหาผมว่า: “มันใช้ได้แค่ 5 หน้าแรก แล้วหลังจากนั้นก็…หยุดเลย”
เรื่องแบบนี้เกิดขึ้นบ่อยกว่าที่คิด ChatGPT เก่งมากในการช่วยเขียนโค้ดสำหรับดึงข้อมูลจากเว็บ—จนกระทั่งมันไม่เวิร์กอีกต่อไป และบทความสอนส่วนใหญ่บนอินเทอร์เน็ตก็มักจบอยู่แค่ตรง “ดูสิ มันใช้ได้กับเว็บตัวอย่าง” แล้วทิ้งให้คุณไปเจอปัญหาจริงบนหน้าเว็บที่มี JavaScript, ระบบกันบอท หรือการแบ่งหน้าเอาเอง ในคู่มือนี้ ผมจะพาไปดูว่า ChatGPT web scraping ในการใช้งานจริงหน้าตาเป็นยังไง: ตั้งแต่ขั้นตอนครบจบในตัว, เทมเพลต prompt ที่เอาไปใช้ซ้ำได้ 5 แบบ (ไม่ใช่แค่ตัวอย่างเดียว), ข้อจำกัดแบบตรงไปตรงมาว่ามันพังตรงไหน, และควรทำยังไงต่อเมื่อมันพัง—including ทางเลือกแบบไม่ต้องเขียนโค้ดอย่าง Thunderbit ที่ช่วยข้ามขั้นตอนโค้ดไปเลย
ChatGPT Web Scraping คืออะไร?
“ChatGPT web scraping” หมายถึงการใช้ ChatGPT ช่วยดึงข้อมูลจากเว็บไซต์ แต่มีจุดที่คนชอบเข้าใจผิดอยู่หนึ่งอย่าง: จริง ๆ แล้ว ChatGPT ไม่ได้เป็นตัว scrape เว็บด้วยตัวเอง มันเปิด URL เองไม่ได้, ดึง HTML เองไม่ได้, และคลิกไล่หน้าเว็บเองไม่ได้ สิ่งที่มัน ทำได้ คือช่วยสร้างโค้ดที่ทำงานแทนมันได้ (ส่วนมากเป็น Python) หรือช่วยอ่าน HTML ดิบที่คุณแปะเข้าไปในแชต แล้วแปลงออกมาเป็นข้อมูลที่มีโครงสร้าง
โดยทั่วไปมี 2 วิธีหลัก:
- ใช้ ChatGPT เป็นตัวสร้างโค้ด: คุณอธิบายหน้าเว็บและข้อมูลที่ต้องการ แล้ว ChatGPT จะเขียนสคริปต์ Python (มักใช้ BeautifulSoup, Selenium หรือ Playwright) ให้คุณเอาไปรันบนเครื่องตัวเอง
- ใช้ ChatGPT เป็นตัวแยกข้อมูล: คุณคัดลอก HTML ดิบไปวางในแชต (หรืออัปโหลดผ่าน Code Interpreter) แล้วให้ ChatGPT แยกฟิลด์ที่ต้องการออกมาเป็น JSON หรือ CSV
ไม่ว่าจะใช้แบบไหน คุณก็ยังต้องเป็นคนดึงหน้าเว็บและรันโค้ดเอง ChatGPT คือสมอง ไม่ใช่มือ ต่อให้มี ChatGPT Atlas browser เวอร์ชันใหม่กว่า (เปิดตัวเดือนตุลาคม 2025) ที่ท่องเว็บแบบโต้ตอบได้ มันก็ยังตอบออกมาเป็นคำตอบ—not ตาราง CSV แบบมีโครงสร้าง 500 แถว มันคือผู้ช่วยในการท่องเว็บ ไม่ใช่สายการผลิตข้อมูล
ทำไมถึงควรใช้ ChatGPT กับการดึงข้อมูลจากเว็บ และเหมาะกับใคร
ChatGPT ช่วยลดกำแพงการเริ่มต้นเว็บสแครปปิงลงได้เยอะมาก ตาม 2025 Stack Overflow Developer Survey มี 84% ของนักพัฒนาที่ตอนนี้ใช้หรือวางแผนจะใช้ AI tools ในงานประจำวัน และ ChatGPT ก็ติดอันดับต้น ๆ ด้วยส่วนแบ่ง 82% แต่คนที่ค้นหา “ChatGPT web scraping” ไม่ได้มีแค่นักพัฒนาเท่านั้น ยังมี SDR ที่ต้องสร้างรายชื่อ prospect, ผู้จัดการ ecommerce ที่คอยติดตามราคาคู่แข่ง, นักวิเคราะห์อสังหาที่ดึงข้อมูลประกาศขาย, และทีมการตลาดที่รวบรวมคอนเทนต์ด้วย
ลองดูตัวอย่างการใช้งานยอดนิยมและคนที่ได้ประโยชน์:
| Use Case | Who Benefits | What You’re Scraping |
|---|---|---|
| การดึงลีดสำหรับงานขาย | SDRs, sales ops | ชื่อ อีเมล เบอร์โทร จากไดเรกทอรี |
| ติดตามราคาคู่แข่ง | ทีม Ecommerce, ทีม pricing | ชื่อสินค้า ราคา สต็อก SKU |
| วิจัยตลาด | นักวิเคราะห์, ผู้ก่อตั้ง | ข้อมูลบริษัท รีวิว เรตติ้ง รายการฟีเจอร์ |
| รวบรวมข้อมูลอสังหา | นายหน้า, นักลงทุน | ราคาทรัพย์สิน ที่อยู่ ห้องนอน/ห้องน้ำ ข้อมูลเอเยนต์ |
| รวมคอนเทนต์ | ทีมการตลาด, ทีม SEO | ชื่อบทความ URL วันที่เผยแพร่ ผู้เขียน |
การก็อปข้อมูลจาก 100 หน้าแบบทำมืออาจกินเวลา 3–5 ชั่วโมง แต่สคริปต์ที่ ChatGPT สร้างให้สามารถทำงานเดียวกันได้ในไม่กี่นาที—ถ้ามันใช้ได้จริง และคำว่า “ถ้า” นี่แหละคือหัวใจของบทความนี้
Gartner คาดว่าภายในปี 2026 นักพัฒนาที่อยู่นอกแผนก IT แบบดั้งเดิมจะคิดเป็นอย่างน้อย 80% ของผู้ใช้ low-code tools ทั้งหมด คนที่ค้นหา “ChatGPT web scraping” มากขึ้นเรื่อย ๆ คือคนที่ไม่ใช่นักพัฒนาแต่ต้องการข้อมูลโดยไม่อยากจ้างวิศวกร สำหรับคนกลุ่มนี้ ChatGPT มักเป็นจุดเริ่มต้น—and ถ้าสคริปต์ไม่ยอมรัน เครื่องมืออย่าง Thunderbit ก็มักเป็นทางออกถัดไป
ChatGPT Web Scraping ทำงานอย่างไร: คู่มือทีละขั้นตอน
นี่คือเวิร์กโฟลว์แบบครบถ้วน ตั้งแต่ต้นจนจบ โดยใช้หน้ารายการในไดเรกทอรีธุรกิจเป็นตัวอย่าง—not เว็บตัวอย่างง่าย ๆ
- ระดับความยาก: ปานกลาง (ต้องพอรัน Python ได้)
- เวลาที่ใช้: ประมาณ 15–30 นาทีสำหรับการ scrape ครั้งแรก
- สิ่งที่ต้องมี: เบราว์เซอร์ Chrome, Python environment (Python 3.10+), ChatGPT (ใช้เวอร์ชันฟรีได้), และ URL เป้าหมาย
ขั้นตอนที่ 1: ตรวจสอบเว็บไซต์และระบุข้อมูลที่ต้องการ
เปิดหน้าที่อยาก scrape ใน Chrome คลิกขวาที่ข้อมูลที่ต้องการ เช่น ชื่อธุรกิจ แล้วเลือก Inspect เครื่องมือ Chrome DevTools จะเปิดขึ้นและไฮไลต์องค์ประกอบ HTML ให้
มองหา CSS selectors เช่น h2.business-name, span.phone, หรือ a.website-link ยิ่ง selector เฉพาะเจาะจงมากเท่าไหร่ ผลลัพธ์จาก ChatGPT ก็ยิ่งแม่นขึ้นเท่านั้น คัดลอก HTML ตัวอย่างสั้น ๆ ของการ์ดหนึ่งใบหรือหนึ่งแถว เพื่อใช้วางใน prompt
ตอนนี้คุณควรมีรายชื่อฟิลด์แบบคร่าว ๆ แล้ว เช่น business_name, phone, website_url พร้อม CSS selector ที่สอดคล้องกัน
ขั้นตอนที่ 2: เขียน prompt ให้ ChatGPT อย่างละเอียด
ตรงนี้คือจุดที่บทความสอนหลายชิ้นพลาด—พวกเขาให้ prompt แบบกว้าง ๆ แล้วหวังให้มันออกมาดีเอง prompt สำหรับงาน scrape ที่ดีควรมี 6 ส่วน:
- ภาษาและไลบรารี: “เขียนสคริปต์ Python 3.11 โดยใช้ BeautifulSoup 4”
- URL เป้าหมาย: หน้าที่ต้องการ scrape แบบระบุชัด
- CSS selectors: สำหรับแต่ละฟิลด์ ใช้ selector ที่เจอจากขั้นตอนที่ 1
- รูปแบบผลลัพธ์: CSV, JSON หรือทั้งสองแบบ
- คำสั่งพิเศษ: encoding, การจัดการ error, การหน่วงเวลา
- HTML snippet: วาง HTML จริงของหน้า 20–40 บรรทัด เพื่อให้ ChatGPT เห็นโครงสร้าง
ตัวอย่าง prompt (พร้อมคำอธิบาย):
You are a senior Python engineer. Write a web scraper using Python 3.11 and BeautifulSoup 4.
Target URL: https://example.com/businesses
Goal: Extract every business card on the page and return one row per business.
Fields needed (CSS selectors in parentheses):
- business_name (h2.biz-name)
- phone (span.phone-number)
- website_url (a.biz-link, href)
- rating (div.stars[data-rating])
Output: save to businesses.csv with UTF-8 encoding and a header row.
Requirements:
- Use requests with a realistic User-Agent header
- Handle missing fields gracefully (None, not crash)
- Print the number of businesses extracted at the end
- Add a 1-second delay between requests if you loop
Here is a representative HTML snippet from the page (one business card):
<PASTE 20-40 LINES OF THE ACTUAL HTML HERE>
เคล็ดลับ: การใส่ HTML snippet คือสิ่งที่ช่วยเพิ่มความแม่นยำได้มากที่สุด ChatGPT เข้าเว็บเองไม่ได้ ดังนั้น snippet คือแหล่งข้อมูลจริงเพียงอย่างเดียวของมัน
ขั้นตอนที่ 3: ตรวจสอบและทดสอบโค้ดที่ได้
อย่าเพิ่งรันโค้ดที่ ChatGPT สร้างมาแบบไม่อ่านก่อน ให้ไล่ดูโค้ดก่อนว่า:
- selector ที่หลอนขึ้นมา: บางครั้ง ChatGPT จะสร้าง CSS class ที่ไม่มีอยู่จริงบนหน้าเว็บ
- ไลบรารีที่ลืมติดตั้ง: ตรวจว่า
pip install requests beautifulsoup4(หรือplaywrightฯลฯ) ถูกใส่มาแล้ว - ค่าที่ hardcode: เช็กว่า URL ชื่อฟิลด์ และ path ของไฟล์ถูกต้อง
สร้าง virtual environment ของ Python ติดตั้ง dependencies แล้วลองรัน


