คลังความรู้

หาคำตอบเกี่ยวกับการดึงข้อมูล การสร้างลีด และฟีเจอร์ของ Thunderbit แหล่งความรู้หลักของคุณสำหรับการใช้งาน data entry และ web scraping

lxml รีวิว: เครื่องมือ XPath ที่ยังเอาชนะตัวแปลง HTML ใน Python ได้อยู่

lxml รีวิว: เครื่องมือ XPath ที่ยังเอาชนะตัวแปลง HTML ใน Python ได้อยู่

ทุกไม่กี่เดือนจะมี HTML parser ที่เร็วกว่าโผล่มา เบนช์มาร์กถูกพูดถึงกันอีกรอบ แล้วก็มีคนประกาศว่าเครื่องมือรุ่นเก่าหมดสมัย แต่พอคุณต้องเลือกทุกย่อหน้าที่มีคำบางคำอยู่ หรือดึง parent ของโหนดที่ตรงเงื่อนไขกลับมา คุณก็จะนึกได้ว่า [lxml](https://github.com/lxml/lxml) ยังเปิดค้างอยู่ในแท็บอีกอันของคุณ

by Ke17 min read
ตัวแยกบทความที่ไม่ต้องเปิดเบราว์เซอร์ — แต่ก็ยังเก็บหน้าเทสต์ของฉันได้สะอาดหมดจด

ตัวแยกบทความที่ไม่ต้องเปิดเบราว์เซอร์ — แต่ก็ยังเก็บหน้าเทสต์ของฉันได้สะอาดหมดจด

เครื่องมือสแครปส่วนใหญ่ที่กำลังเป็นกระแสในปีนี้มักต้องพึ่งเบราว์เซอร์ แต่ [trafilatura](https://github.com/adbar/trafilatura) ไม่ได้ทำแบบนั้น มันเป็นไลบรารี Python ล้วนที่อ่าน HTML แบบคงที่ แยกให้ได้ว่าบล็อกไหนคือเนื้อหาบทความจริง แล้วทิ้งส่วนที่เหลือทั้งหมด...

by Ke13 min read
ฉันทดสอบสแครปเปอร์โอเพนซอร์ส 9 ตัวบนม้านั่งทดสอบเดียวกัน และคำตอบที่ใช่กลับกลายเป็นว่าต้องถามก่อนว่าใช้งานแบบไหน

ฉันทดสอบสแครปเปอร์โอเพนซอร์ส 9 ตัวบนม้านั่งทดสอบเดียวกัน และคำตอบที่ใช่กลับกลายเป็นว่าต้องถามก่อนว่าใช้งานแบบไหน

เกือบทุกบทสรุป “สแครปเปอร์โอเพนซอร์สดีที่สุด” มีจุดบอดเงียบ ๆ อยู่ข้อหนึ่ง: ไม่มีใครเอาเครื่องมือเหล่านั้นไปทดสอบกับหน้าเว็บชุดเดียวกันเลย Scrapy มักถูกทดสอบกับบทความข่าว, Playwri...

by Ke14 min read
ดึงข้อมูลด้วย AI
ส่งข้อมูลไปยัง Google Sheets, Airtable หรือ Notion ได้อย่างง่ายดาย
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week