한국에서 미국 Craigslist 데이터를 수집할 때 쓰는 스크래퍼 10선

최종 업데이트: July 15, 2026
한국에서 미국 Craigslist 데이터를 수집할 때 쓰는 스크래퍼 10선

Craigslist를 처음 보는 사람들은 비슷한 반응이에요. 「2003년에 만든 사이트가 아직도 살아 있다고요?」 그런데 이 단순한 텍스트 리스트 안에 있는 데이터는 생각보다 값어치가 커요. 월 방문자 약 1억 2,700만 명, 신규 게시물은 매달 수천만 건이에요. 미국 분류 광고 시장에서 여전히 손꼽히는 플랫폼인데, 공식 API는 없어요.

Thunderbit에서 자동화 도구를 만든 지 꽤 됐는데, 영업·운영·부동산 팀에서 듣는 요청은 거의 똑같아요. 「Craigslist 게시물을 스프레드시트로 옮기고 싶은데, 세 시간씩 복붙은 못 하겠어요.」 문제는 「Craigslist 스크래퍼 추천」 가이드 대부분이 낡았거나, 봇 차단 같은 진짜 어려운 부분은 빼버리거나, 비교 없이 도구 이름만 나열한다는 점이에요.

그래서 2026년 시점에 진짜로 돌아가는 도구만 10가지 추렸어요. 노코드 크롬 확장부터 엔터프라이즈 프록시 플랫폼, 오픈소스 Python 라이브러리까지 골고루 담았어요. 코딩 한 줄 안 해본 마케터든, Python으로 사고하는 개발자든, 자기에게 맞는 도구는 이 안에 있을 거예요.

한국 독자를 위한 맥락: Craigslist는 한국 로컬 생활 정보 사이트가 아니에요. 국내 중고거래나 지역 상권을 보려면 당근, 중고나라, 번개장터, 네이버 카페 같은 채널이 더 자연스럽죠. 그래도 한국 팀이 미국 부동산, 유학생 렌트, 현지 채용, 중고차·중고가구 가격, 지역별 서비스 광고를 조사해야 할 때는 Craigslist 데이터가 여전히 쓸모 있어요. 따라서 이 글은 「한국 시장용 분류광고 스크래퍼」가 아니라, 한국에서 미국 Craigslist 공개 데이터를 모니터링할 때의 도구 비교로 읽는 것이 정확해요.

수집 범위도 공개 게시물의 제목, 지역, 가격, 게시일, 카테고리, 연락 방식처럼 페이지에 보이는 정보로 제한해야 해요. 개인 연락처를 별도 결합하거나 자동 연락에 쓰는 방식은 개인정보보호법(PIPA), 현지 법규, Craigslist 약관 리스크가 커요.

왜 2026년에 Craigslist 데이터가 필요할까: 팀별 활용 시나리오

겉보기엔 옛날 사이트 같지만, 사실 그게 강점이에요. 분류 광고 사이트 글로벌 3위 자리를 지키고 있고, 공식 디렉터리 기준 미국 본토와 지역 합쳐 416개 사이트로 운영돼요. 한 곳에서 보기 힘든 초로컬 매물이 이만큼 모이는 곳이 흔치 않아요.

실무에서 가장 자주 보는 활용 사례는 이래요.

  • 리드 발굴: 서비스·아르바이트 카테고리에는 사업 소개, 지역, Craigslist 릴레이 이메일까지 들어 있어서 지역 영업 리드 목록을 짜기에 좋아요.
  • 부동산 모니터링: 주거용 페이지는 임대료, 동네, 침실·욕실 수, 면적, 게시일이 다 노출돼서 임대 시세 비교나 공급량 추적에 딱이에요.
  • 경쟁 가격 분석: 판매 게시물에는 제목·가격·상태·위치가 함께 보여서 재판매나 차익 거래 리서치에 쓰기 좋아요.
  • 채용·노동 시장 추적: 채용과 아르바이트 카테고리에서 보수, 고용 형태, 직무 설명을 확인하면 지역 인력 시장 흐름이 잡혀요.
  • 다지역 시장 비교: 도시별 서브도메인 구조라서 지역마다 가격대·물량·카테고리 비중을 따로 볼 수 있어요.
  • 업무 흐름 자동화: 많은 분들이 결국 원하는 건 단순해요. Craigslist 데이터를 손으로 옮기지 말고 CSV, Google Sheets, Airtable, CRM으로 흘러 들어가게 만들고 싶은 거죠.

실제 사용자 한 분은 매일 하던 Craigslist 작업이 예전엔 60~90분 걸렸는데, 자동화 도입 뒤 5분 안팎으로 줄었다고 알려줬어요. 매일 한 시간씩 절약되면 한 달이면 꽤 큰 차이예요.

AI로 Craigslist 데이터 스크래핑 Get Started Free

어떤 기준으로 골랐나: 평가 항목 6가지

Craigslist 스크래퍼라고 다 같은 게 아니에요. 「최고」라는 표현도 결국 누가 어디에 쓰느냐에 따라 답이 달라지죠. 그래서 각 도구를 아래 6가지 잣대로 같이 놓고 봤어요.

  1. 진입 장벽 — 노코드로 바로 가능한지, 아니면 개발자가 필요한지
  2. 봇 차단 대응 — 프록시 로테이션, CAPTCHA 처리, 브라우저 지문이 내장돼 있는지
  3. 요금 구조 — 무료, 프리미엄, 종량제, 엔터프라이즈
  4. 데이터 내보내기 — CSV, Excel, Google Sheets, Airtable, Notion, JSON, DB 지원 범위
  5. 다지역 커버리지 — 미국 416개 Craigslist 사이트를 한 번에 도는지, 한 도시씩만 가능한지
  6. 유지보수 부담 — Craigslist 레이아웃이 바뀌면 깨지는지, 알아서 따라가는지

같은 기준으로 도구를 줄 세운 경쟁 가이드는 거의 없어요. 「톱 10」 리스트가 늘 두루뭉술했다면 이 글이 도움이 될 거예요.

한눈에 보는 Craigslist 스크래퍼 톱 10

세부 설명에 들어가기 전에 비교표부터 정리했어요. 크게 세 부류로 나눴어요. 비기술 사용자용 노코드 도구, 대규모 운영용 엔터프라이즈 플랫폼, 개발자용 오픈소스 라이브러리예요.

도구유형무료 요금제?프록시 / 봇 차단 지원CAPTCHA 처리내보내기 형식추천 대상
Thunderbit노코드 크롬 확장 프로그램예(월 6페이지)브라우저 모드(중간 규모 실행은 프록시 불필요)해당 없음(브라우저 세션)Excel, Sheets, Airtable, Notion, CSV, JSON비기술 비즈니스 사용자
Bright Data엔터프라이즈 스크래퍼 + 프록시 + 데이터셋체험판관리형 차단 해제, 프록시, 재시도, 렌더링예(자동 해결)JSON, NDJSON, CSV, Parquet, XLSX, API엔터프라이즈 규모 수집
OxylabsAPI + 프록시 스택체험판관리형 차단 해제, 주거용/ISP 프록시HTML, 스크린샷, API 출력엔터프라이즈 인프라가 필요한 개발자
Apify클라우드 액터 마켓플레이스예($5/월 크레딧)프록시 로테이션(액터에 따라 다름)부분적 / 액터별JSON, CSV, XML, Excel, JSONL유연한 로우코드 클라우드 자동화
ParseHub노코드 시각적 스크래퍼유료 프록시 로테이션, 클라우드 실행핵심 기능 아님CSV, JSON, API/S3/Dropbox(유료)예산형 노코드 사용자
Phantombuster클라우드 자동화 플랫폼예(제한적)프록시 지원 있음크레딧 / 워크플로 기반CSV, JSON(유료)멀티플랫폼 영업 자동화
Scrapy오픈소스 Python 크롤러무료(오픈소스)자체 프록시/미들웨어 필요없음JSON, JSONL, CSV, XML, DB프로덕션 크롤러
Playwright오픈소스 브라우저 자동화무료(오픈소스)자체 브라우저/프록시 필요없음맞춤형 내보내기브라우저 수준 제어
Selenium오픈소스 브라우저 자동화무료(오픈소스)자체 브라우저/프록시 필요없음맞춤형 내보내기기존 다국어 스택
BeautifulSoup오픈소스 HTML 파서무료(오픈소스)자체 지원 없음없음맞춤형 내보내기가벼운 파싱

표만 봐도 세 갈래가 또렷해요.

  • 노코드 도구(Thunderbit, ParseHub, Phantombuster)는 엔지니어링 리소스 없이 데이터만 빨리 챙기고 싶은 비즈니스 사용자용이에요.
  • 엔터프라이즈 플랫폼(Bright Data, Oxylabs, Apify)은 대량 수집, 봇 차단 인프라, 관리형 전송이 필요한 팀용이에요.
  • 오픈소스 개발자 도구(Scrapy, Playwright, Selenium, BeautifulSoup)는 제어권 최대치이지만, 설정·유지보수·프록시는 본인이 떠안아야 해요.

이제 도구별로 살펴볼게요.

1. Thunderbit

thunderbit-ai-web-scraper.webp Thunderbit은 Craigslist를 비롯해 어느 웹사이트에서든 구조화된 데이터를, 코드도 프록시 설정도 없이 뽑고 싶은 사람들을 위해 만든 AI 기반 크롬 확장이에요.

자사 제품이라 약간의 편향은 있을 수 있어요. 그래도 1번에 둔 이유는 명확해요. 비기술 사용자가 Craigslist에서 부딪히는 핵심 문제—카테고리마다 다른 레이아웃, 상세 페이지 보강, CSS가 바뀔 때마다 깨지는 스크래퍼—를 정조준한 도구거든요.

Craigslist에서 쓰는 방식:

  1. Thunderbit 크롬 확장을 깔고 Craigslist 목록 페이지로 이동(예: 내 도시 아파트 페이지).
  2. 「AI Suggest Fields」 클릭하면 AI가 페이지를 읽고 컬럼을 제안해요. 주거용이면 제목·가격·면적·침실 수·위치·게시일·링크가, 채용이면 제목·보수·고용 형태가 잡혀요. 선택자 작업 없어요.
  3. 「Scrape」 클릭. 구조화된 표로 채워져요.
  4. 페이지 넘김 처리. Craigslist의 클릭형 페이지 이동까지 알아서 따라가요.
  5. 「Scrape Subpages」로 게시물을 하나씩 열어 상세 필드—전체 설명, 모든 이미지, 임베드된 연락처—까지 보강해요.
  6. Google Sheets, Excel, Airtable, Notion, CSV로 무료 내보내기.

주요 기능:

  • AI 필드 감지: 카테고리별로 컬럼 구성이 자동으로 달라져요. CSS 작업 0.
  • 서브페이지 스크래핑: 목록을 긁은 뒤 각 게시물로 들어가 상세 필드(전체 설명, 이미지, 연락처)까지 가져와요.
  • 브라우저 기반 모드: Chrome 세션 안에서 돌아가니 중간 규모까지는 프록시 불필요. 비용·복잡도 한 단계 내려가요.
  • 유지보수 0: AI가 페이지를 매번 새로 읽어서 레이아웃 변경에도 잘 안 깨져요.
  • 무료 내보내기: Excel, Google Sheets, Airtable, Notion, CSV, JSON—추가 과금 없음.

요금: 무료 요금제(월 6페이지), 무료 체험(10페이지), 더 많은 사용량을 위한 유료 요금제.

누구에게 잘 맞나: 서비스·아르바이트 카테고리에서 리드 모으는 영업팀, 임대료 추적 부동산 팀, 개발자 도움 없이 구조화 데이터를 받아야 하는 운영팀, 스크래핑·라벨링·내보내기를 한 흐름에서 끝내고 싶은 모든 분.

Craigslist 스크래핑에 Thunderbit 사용해 보기

2. Bright Data

Screenshot 2026-04-22 at 12.27.50 PM_compressed.webp Bright Data는 이 목록에서 가장 무거운 엔터프라이즈급 선택지예요. 전용 Craigslist Scraper 제품 페이지와 Craigslist Dataset 마켓플레이스를 동시에 운영하는 유일한 플랫폼이기도 해요.

미국 전역에서 하루 수천 건씩 수집해야 하는 규모라면, Bright Data가 그런 작업에 맞춰 설계된 도구예요. Web Unlocker가 IP·재시도·렌더링·차단을 다 처리하고, CAPTCHA도 기본값으로 자동 해결해줘요. Web Scraper IDE로 수집 워크플로를 직접 짜고, 416개 지역 URL을 프로그램으로 순회할 수도 있어요.

주요 기능:

  • 수백만 IP 규모의 주거용 프록시 네트워크
  • CAPTCHA 자동 해결과 봇 차단 우회 내장
  • Craigslist 전용 스크래퍼 및 데이터셋 제품
  • 내보내기: JSON, NDJSON, CSV, Parquet, XLSX, API 전송, 웹훅

요금: Craigslist 스크래퍼는 페이지 로드 1,000건당 0.5달러(약 700원) 종량제로 시작하고, 38만 페이지 로드에 499달러(약 67만 원) 같은 패키지가 있어요. 주거용 프록시는 GB당 4달러(약 5,400원)부터 종량제예요. 1주일 1,000 요청 무료 체험도 제공해요.

누구에게 잘 맞나: 고가용성과 전담 지원이 같이 따라오는 대용량 다지역 Craigslist 수집이 필요한 엔터프라이즈 팀. 예산이 빠듯한 소규모 팀이라면 다른 선택지가 더 합리적이에요.

3. Oxylabs

oxylabs-data-for-ai-proxies.webp Oxylabs는 프리미엄 프록시·스크래핑 인프라 제공사예요. 전용 Craigslist Scraper APICraigslist proxies page를 운영해요.

Bright Data가 전부 떠받쳐 주는 올인원 스타일이라면, Oxylabs는 개발자 친화 쪽으로 한 발 더 가 있어요. Web Scraper API와 Web Unblocker에 JS 렌더링, 재시도, 세션 처리, 지문 생성, 봇 차단 대응이 다 들어 있어요. Craigslist Scraper API 무료 체험은 최대 2,000 결과까지 가능해요.

주요 기능:

요금: 기타 사이트용 스크래퍼 API는 JS 미포함 1,000 결과당 약 0.15달러(약 200원), JS 포함이면 0.35달러(약 470원)부터예요. Web Unblocker 마이크로 요금제는 월 약 75달러(약 10만 원)부터예요. 대규모 주거용 프록시는 1TB 단위로 가면 GB당 0.50달러(약 670원) 수준까지 떨어지기도 해요.

누구에게 잘 맞나: 관리형 프록시 인프라와 API 기반 워크플로로 Craigslist를 꾸준히 긁어야 하는 개발팀. 이미 다른 프로젝트에서 Oxylabs를 쓰고 있다면 Craigslist 추가가 거의 끼워 넣기 수준이에요.

4. Apify

apify-web-data-scrapers.webp Apify는 클라우드 기반 웹 스크래핑·자동화 플랫폼이에요. 코드 없이 돌릴 수 있는 사전 제작 「Actor」 마켓플레이스가 핵심이죠.

Apify의 Craigslist 생태계는 좀 재미있어요. 커뮤니티 actor가 여러 개인데 품질 편차가 커요. ivanvs/craigslist-scraper는 사용자 829명·평점 5.0, automation-lab/craigslist-scraper는 사용자 44명·평점 1.0이에요. 도입 전에 테스트 한 사이클은 꼭 돌려보세요.

주요 기능:

요금: 월 5달러(약 6,700원) 크레딧이 포함된 무료 요금제, 유료는 월 49달러(약 6만 6천 원)부터 시작해요. 사용량이 커지면 컴퓨트 단위(CU) 요금이 빠르게 뛸 수 있으니 CU 소모량 모니터링은 챙겨야 해요.

누구에게 잘 맞나: 인프라까지 직접 떠안고 싶지 않은 팀, 로우코드 설정이 익숙한 사용자, 그리고 Craigslist 스크래핑을 일회성이 아니라 정기적으로 돌려야 하는 팀.

5. ParseHub

parsehub.com-homepage-1920x1080_compressed.webp ParseHub은 데스크톱형 시각적 웹 스크래핑 도구예요. 페이지 요소를 클릭해 추출할 데이터를 알려주는 방식이죠.

ParseHub로 Craigslist를 잡으려면 목록 제목·가격·링크를 클릭해서 「이걸 가져와」라고 지정하면 돼요. AJAX 클릭 루프로 페이지 넘김 처리, 유료에서는 클라우드 실행도 가능해요. 무료는 프로젝트 5개까지라 소규모 작업엔 쓸 만해요.

주요 기능:

  • 포인트 앤 클릭 방식의 비주얼 워크플로 빌더
  • 페이지 넘김과 동적 콘텐츠 처리
  • 유료 요금제의 클라우드 실행 및 예약 기능
  • 내보내기: CSV, Excel, JSON

요금: 무료 요금제(프로젝트 5개), 페이지를 더 돌리거나 예약 실행이 필요하면 월 약 189달러(약 25만 원)부터 시작하는 유료 요금제로 가요.

한계: 대규모로 가면 속도가 처지고, 무료 요금제의 예약 실행은 제한적이에요. 결정적인 단점은 CSS 선택자 기반이라, Craigslist 레이아웃이 바뀌면 직접 손봐야 해요.

누구에게 잘 맞나: 중간 규모 스크래핑이 필요한 개인이나 소규모 팀 중에서, 비주얼 노코드 도구를 원하되 AI 기반 필드 감지까지는 필요 없는 경우.

6. Phantombuster

phantombuster-website-screenshot.webp Phantombuster는 원래 LinkedIn과 소셜 미디어 스크래핑으로 알려진 클라우드 자동화 플랫폼이에요. Craigslist 전용 도구는 아니지만, Web Element Extractor로 CSS 선택자를 지정해 공개 페이지를 긁을 수 있어요.

Phantombuster에서 Craigslist 워크플로 세팅은 전용 도구보다 손이 더 가요. 선택자·워크플로 구성·예약을 다 직접 해야 해요. 다만 LinkedIn이나 소셜 리드 발굴에 이미 Phantombuster를 쓰고 있다면, Craigslist를 그 파이프라인에 얹는 건 큰 일이 아니에요.

주요 기능:

  • 사전 제작 자동화 템플릿과 클라우드 실행
  • 예약 기능과 CRM 연동
  • 프록시 지원, CAPTCHA 해결 크레딧 제공
  • 내보내기: 유료에서 CSV·JSON(무료 요금제는 10행 제한)

요금: 무료 요금제는 슬롯 5개, 월 2시간, 내보내기 10행 제한이 걸려 있어요. 유료 연간 요금제는 연 청구 기준 월 약 56달러(약 7만 5천 원)부터 시작해요.

누구에게 잘 맞나: 이미 Phantombuster로 멀티플랫폼 리드 발굴을 돌리고 있고, Craigslist까지 같은 파이프라인에 합치고 싶은 영업팀.

7. Scrapy

scrapy.org-homepage-1920x1080_compressed.webp Scrapy는 가장 널리 쓰이는 오픈소스 Python 웹 스크래핑 프레임워크예요. Craigslist 크롤링을 끝까지 제어하고 싶은 개발팀에게는 가장 자연스러운 출발점이에요.

최신 안정 버전은 2.15.0(2026년 4월 9일)이에요. Scrapy는 다지역 크롤링, 내장 요청 스케줄링·속도 제한, 프록시 로테이션용 다운로더 미들웨어, CSV·JSON·JSONL·XML·DB 파이프라인으로의 피드 내보내기를 다 지원해요. 필요하면 scrapy-playwright 플러그인으로 브라우저 렌더링까지 얹을 수 있어요.

주요 기능:

  • 커스터마이징 폭이 큰 프로덕션급 크롤러
  • 프록시·재시도·쿠키·User-Agent 로테이션용 미들웨어
  • 피드 내보내기: JSON, JSONL, CSV, XML, DB 파이프라인
  • 무료 오픈소스

숨은 비용: Scrapy 자체는 무료지만, Craigslist에서 규모를 키우려면 프록시 구독비(월 50500달러, 약 6만 7천 원67만 원 이상), 호스팅비, 그리고 Craigslist HTML 구조 변경에 따라가는 유지보수 비용이 같이 따라와요.

누구에게 잘 맞나: Python 경험이 있고, 최대한의 유연성과 기존 프록시 인프라, 대용량 다지역 Craigslist 크롤링이 필요한 개발팀.

8. Playwright

playwright.dev-homepage-1920x1080_compressed.webp Playwright는 Microsoft가 만든 현대적인 브라우저 자동화 라이브러리예요. Chromium·Firefox·WebKit을 프로그램으로 제어하죠. 릴리스 주기도 매우 활발해서 v1.59.1이 2026년 4월 1일에 나왔어요.

커뮤니티 분위기도 Craigslist 스크래핑에서 Selenium보다 Playwright 쪽으로 기울어 있어요. 속도, 안정성, playwright-extra 같은 플러그인 기반 탐지 회피력이 한 단계 위예요. 헤드리스/헤드풀 모드, 요소 자동 대기, 네트워크 가로채기, 스크린샷·PDF 캡처까지 다 지원해요.

주요 기능:

Craigslist에서의 강점: 단순 HTTP 요청보다 실제 사용자 행동을 훨씬 그럴듯하게 흉내 낼 수 있어서 차단 위험을 낮춰줘요. Reddit의 커뮤니티 흐름도 새 프로젝트라면 Selenium보다 Playwright를 더 미는 분위기예요.

숨은 비용: Scrapy와 같아요. 프록시 요금, 호스팅, 선택자가 깨질 때마다 따라오는 유지보수 작업이에요.

누구에게 잘 맞나: 세밀한 브라우저 제어가 필요한 개발자, JavaScript로 렌더링되는 콘텐츠를 다뤄야 하는 스크래퍼 팀, Selenium의 현대적 대안을 찾는 모든 분.

9. Selenium

selenium.dev-homepage-1920x1080_compressed.webp Selenium은 가장 오래 살아남은 브라우저 자동화 프레임워크 중 하나예요. 최신 릴리스는 4.43.0(2026년 4월 10일)이고, BiDi와 네트워크 제어 기능을 계속 넓혀가고 있어요.

Selenium은 여러 언어(Python, Java, C#, JavaScript)와 주요 브라우저를 다 다룰 수 있어요. 전체 브라우저 세션을 시뮬레이션해서 로그인·스크롤까지 처리하죠. 단점은 Playwright 대비 속도가 처지고, 코드가 길어지고, undetected-chromedriver 같은 은닉 라이브러리 없이는 봇으로 잘 잡힌다는 점이에요.

주요 기능:

  • 다국어 지원(Python, Java, C#, JavaScript)
  • 전체 브라우저 세션 시뮬레이션
  • 방대한 문서와 성숙한 생태계
  • 무료 오픈소스

한계: 2026년 커뮤니티 분위기는 새 프로젝트면 Playwright 쪽으로 확실히 기울어 있어요. 한 Reddit 스레드에서는 주거용 프록시를 써도 Cloudflare가 여전히 Selenium을 잡아낸다는 보고가 있었어요. 기본 상태의 은닉성에서 한 단계 더 손을 봐야 한다는 뜻이죠.

누구에게 잘 맞나: Selenium에 이미 깊게 투자해서 옮기기 부담스러운 개발팀, 다국어 지원(Java, C#)이 필수인 프로젝트, 기존 레거시 스크래핑 환경을 유지해야 하는 경우.

10. BeautifulSoup

crummy.com-homepage-1920x1080_compressed.webp BeautifulSoup은 HTML과 XML을 파싱하는 가벼운 Python 라이브러리예요. 현재 PyPI 버전은 4.14.3(2025년 11월 30일)이에요.

여기서 짚고 갈 포인트가 하나 있어요. BeautifulSoup은 파서지 완전한 스크래퍼가 아니에요. 웹페이지를 받아오거나 브라우저 자동화를 처리하지 않아요. 보통 requests 라이브러리랑 짝지어 써서 HTTP로 받아온 HTML을 파싱하는 식이에요. 그래서 개발자 입장에서는 진입 장벽이 가장 낮지만, 기능 폭은 가장 좁아요.

주요 기능:

  • 배우는 데 시간이 거의 안 들어요—최소한의 코드로 시작 가능
  • 소규모·일회성 Craigslist 스크래핑에 적합
  • 무료 오픈소스

한계: 페이지 넘김 처리 미내장, JavaScript 렌더링 미지원, 프록시 로테이션 없음—전부 직접 붙여야 해요. Craigslist HTML 구조가 바뀌면 선택자도 깨지고, 그때마다 수동으로 손봐야 해요.

누구에게 잘 맞나: 최소 세팅으로 Craigslist 스크래핑을 처음 맛보고 싶은 Python 입문자, 카테고리 하나·지역 하나에서 일회성으로 데이터를 뽑고 싶은 경우, 가벼운 파서만 있으면 되는 개발자.

차단을 피하는 법: 프록시, 요청 제한, 그리고 왜 차단되는가

이 부분이 대부분의 Craigslist 가이드가 슬쩍 넘기는 곳이에요. 그런데 사실 가장 중요한 영역이기도 해요. Scraperly의 2026년 4월 테스트에서 Craigslist는 난이도 3/5로 분류돼요. 커스텀 CAPTCHA, 속도 제한, IP 차단이 같이 작동한다는 거죠. Bright Data 튜토리얼도 일반 HTTP 대신 Web Unlocker나 Playwright 기반 Scraping Browser를 권해요. Oxylabs 프록시 페이지도 Craigslist가 프록시를 잡아낼 수 있고, 주거용 프록시가 제일 안전하다고 정리해요.

현장에서 실제로 먹히는 패턴은 이래요.

전략Craigslist에서의 효과비용복잡도
주거용 프록시✅ 높음$$ (GB당 4~6달러)중간
ISP 프록시✅ 높음$ (IP당 0.60~0.80달러)중간
데이터센터 프록시⚠️ 낮음(자주 차단됨)$ (IP당 0.20~0.40달러)낮음
브라우저 기반 스크래핑(자체 세션)✅ 중간~높음무료낮음
요청 제한 + 랜덤 지연✅ 필수 기본값무료낮음

실전 팁:

  • 요청 지연: 요청 사이에 최소 25초는 두세요. Scraperly는 IP당 분당 510건 수준을 유지하고, 20~30건마다 IP를 갈아주라고 권해요.
  • 세션 로테이션: User-Agent와 브라우저 지문을 바꿔주세요. 패턴이 너무 일정하면 금방 찍혀요.
  • 데이터센터 프록시 회피: 저렴해서 끌리지만 Craigslist에서는 쉽게 막혀요.
  • 브라우저 기반 스크래핑은 중간 규모까지는 프록시 이슈 자체를 없애줘요. Thunderbit 브라우저 모드는 사용자의 Chrome 세션 안에서 돌아가니까, 프록시 설정도 IP 로테이션도 추가 비용도 없어요. 게시물 수백 개 수준이면 비즈니스 사용자 대부분에게 이걸로 충분해요.

그리고 많은 분이 놓치는 유지보수 포인트가 하나 있어요. Craigslist는 CSS를 주기적으로 바꿔요(실제로 자주 바뀌어요). 그때마다 CSS 선택자 기반 스크래퍼는 한꺼번에 깨져요. 페이지 검사로 새 선택자 찾고, 코드 고치고, 다시 테스트해야 하죠. Thunderbit 같은 AI 기반 도구는 이 함정을 피해요. AI가 페이지 구조를 매번 새로 읽으니까 레이아웃이 바뀌어도 워크플로가 그대로 굴러가요.

코드 vs 노코드: Craigslist 스크래핑 두 갈래 길

이 글의 독자층은 거의 반반이라고 봐요. 데이터만 빨리 받고 싶은 비기술 비즈니스 사용자와, 실제로 돌아가는 코드를 원하는 초·중급 개발자. 그래서 두 경로를 나란히 정리했어요.

노코드 경로: Thunderbit로 Craigslist 스크래핑하기(단계별)

  1. Chrome Web Store에서 Thunderbit 크롬 확장을 설치해요.
  2. Craigslist 목록 페이지로 이동해요. 예를 들어 내 도시의 아파트 페이지(https://yourcity.craigslist.org/search/apa).
  3. 「AI Suggest Fields」 클릭. Thunderbit AI가 페이지를 읽고 카테고리에 맞는 컬럼을 제안해요. 주거용이면 제목·가격·면적·침실 수·위치·게시일·링크가 잡혀요.
  4. 제안된 컬럼을 검토하고 필요하면 살짝 조정해요. 클릭으로 필드 추가·삭제 가능해요.
  5. 「Scrape」 클릭. 구조화된 표로 데이터가 채워지는 걸 확인해요.
  6. 페이지 넘김 처리. 직접 페이지를 넘겨도 되고 Thunderbit에 맡겨도 돼요.
  7. 「Scrape Subpages」로 각 게시물을 열어 전체 설명·이미지·임베드된 연락처 같은 상세 필드까지 보강해요.
  8. Google Sheets, Excel, Airtable, Notion, CSV로 무료 내보내기.

결과 페이지 한 장 기준 전체 흐름이 2분쯤 걸려요. CSS 선택자도, 프록시도, 코드도 없어요.

코드 경로: Python + Playwright로 Craigslist 스크래핑하기

2026년 개발자 포럼에서 Craigslist 스크래핑 추천 1위는 Playwright예요. 아래는 Craigslist 주거용 결과 페이지를 긁어 제목/가격/링크를 뽑고, 페이지 넘김을 처리한 뒤 결과를 출력하는 동작 가능한 Python 예시예요.

접근 방식은 이래요. 먼저 JSON-LD 구조화 데이터를 확인하고(Craigslist는 일부 페이지에 ItemList 스키마를 끼워 넣어요), 없으면 DOM 선택자로 폴백해요. 페이지 이동은 s=120 단위로 해요.

import asyncio, json
from urllib.parse import urlparse, parse_qs, urlencode, urlunparse
from playwright.async_api import async_playwright

def next_page_url(url, step=120):
    p = urlparse(url)
    qs = parse_qs(p.query)
    offset = int(qs.get("s", ["0"])[0]) + step
    qs["s"] = [str(offset)]
    return urlunparse((p.scheme, p.netloc, p.path, "", urlencode(qs, doseq=True), ""))

async def scrape_page(page, url):
    await page.goto(url, wait_until="domcontentloaded")
    await page.wait_for_timeout(1500)
    data = []
    # Try JSON-LD first
    for raw in await page.locator('script[type="application/ld+json"]').all_text_contents():
        try:
            obj = json.loads(raw)
        except Exception:
            continue
        if isinstance(obj, dict) and obj.get("@type") == "ItemList":
            for item in obj.get("itemListElement", []):
                thing = item.get("item", {})
                data.append({
                    "title": thing.get("name"),
                    "price": thing.get("offers", {}).get("price"),
                    "link": thing.get("url"),
                })
            if data:
                return data
    # Fallback: DOM selectors
    cards = page.locator("div.cl-search-result, li.cl-static-search-result")
    count = await cards.count()
    for i in range(count):
        card = cards.nth(i)
        title = await card.locator("a.posting-title, a.titlestring").first.text_content()
        link = await card.locator("a.posting-title, a.titlestring").first.get_attribute("href")
        price = (await card.locator(".price, .result-price").first.text_content()
                 if await card.locator(".price, .result-price").count() else None)
        data.append({"title": (title or "").strip(), "price": (price or "").strip(), "link": link})
    return data

async def main():
    start_url = "https://newyork.craigslist.org/search/apa?query=studio"
    async with async_playwright() as p:
        browser = await p.chromium.launch(headless=True)
        page = await browser.new_page()
        url = start_url
        all_rows = []
        for _ in range(3):  # scrape 3 pages
            rows = await scrape_page(page, url)
            if not rows:
                break
            all_rows.extend(rows)
            url = next_page_url(url)
        await browser.close()
        for row in all_rows[:10]:
            print(row)

asyncio.run(main())

이 스크립트 외에 챙길 것: Playwright 설치(pip install playwright && playwright install), 대량 실행 시 프록시 설정, 속도 제한에 걸렸을 때의 수동 CAPTCHA 처리. 트레이드오프가 분명하죠. 제어권을 다 가져가는 대신 책임도 같이 떠안는 구조예요.

무료 vs 유료: Craigslist 스크래퍼 실비용 정리

리서치할 때 이런 표가 진작 있었으면 했어요. 웹 스크래핑에서 「무료」라는 단어는 보기보다 무겁거든요.

도구완전 무료?무료 요금제 제한유료 시작가숨겨진 비용
Thunderbit무료 요금제(6페이지)월 6페이지; 무료 체험 = 10페이지더 많은 사용량용 유료 요금제없음—내보내기 무료
Scrapy✅ 오픈소스무제한$0프록시 비용, 호스팅, 유지보수
BeautifulSoup✅ 오픈소스무제한$0프록시 비용, 호스팅, 유지보수
Playwright✅ 오픈소스무제한$0프록시 비용, 호스팅, 유지보수
Selenium✅ 오픈소스무제한$0프록시 비용, 호스팅, 유지보수
ParseHub무료 요금제5개 프로젝트월 약 189달러무료 요금제의 예약 실행 제한
Apify무료 요금제월 5달러 크레딧 제공월 약 49달러컴퓨트 단위 요금이 급증할 수 있음
Phantombuster무료 요금제5개 슬롯, 월 2시간, 10행 내보내기월 약 56달러(연간)슬롯별 과금
Bright Data체험판만 제공1주일/1,000 요청월 500달러+프록시 비용 별도
Oxylabs체험판만 제공2,000 결과 / 1GB월 약 75달러+(Unblocker)엔터프라이즈 가격 정책

오픈소스 도구의 「무료」에는 큰 별표가 붙어요. Scrapy·Playwright·Selenium·BeautifulSoup은 라이선스 비용이 0원이지만, Craigslist에서 규모를 키우려면 세팅 개발 시간, 주거용 프록시비(월 50500달러, 약 6만 7천 원67만 원 이상), 그리고 Craigslist HTML 변경에 따라가는 유지보수 비용이 같이 따라와요. 반면 Thunderbit은 매번 페이지를 새로 읽어서 유지보수 부담이 없고, 내보내기는 무료이며, 브라우저 기반 스크래핑이 중간 규모까지는 프록시 비용을 통째로 없애줘요. 비개발자 입장에서는 꽤 큰 차이예요.

카테고리별로 뭘 뽑을 수 있나: Craigslist 데이터 필드 정리

Craigslist는 카테고리마다 데이터 구조가 완전히 달라요. 주거용 게시물과 채용 공고는 완전히 다른 세상이죠. 각 주요 섹션에서 현실적으로 뽑을 수 있는 항목은 이래요.

Craigslist 카테고리추출 가능 필드연락처 정보 제공?
주거 / 아파트제목, 가격, 면적, 침실 수, 욕실 수, 위치, 날짜, 이미지, 설명, 지도 링크, 가능 여부, 반려동물 정책, 세탁/주차⚠️ 경우에 따라 다름(익명 이메일 릴레이)
판매제목, 가격, 상태, 위치, 날짜, 이미지, 설명, 제조사/모델/연식(가변적)⚠️ 경우에 따라 다름
채용제목, 회사, 보수, 위치, 직무 유형, 경력 수준, 날짜, 설명드묾(지원 링크만 제공)
서비스제목, 위치, 설명, 이미지⚠️ 경우에 따라 다름
아르바이트제목, 보수, 위치, 날짜, 설명⚠️ 경우에 따라 다름

몇 가지 짚어둘 포인트가 있어요.

  • 연락처 정보: Craigslist는 직접 이메일 스크래핑을 막으려고 익명 이메일 릴레이를 써요. 「이메일 추출」을 내세우는 도구도 실제로는 진짜 이메일이 아니라 릴레이 주소(reply+randomstring@craigslist.org)를 가져오는 경우가 많아요.
  • 상세 페이지 전용 필드인 전체 설명, 모든 이미지, 임베드된 연락처 정보는 검색 결과 페이지가 아니라 각 게시물 페이지를 열어야 보여요.
  • **Thunderbit의 「AI Suggest Fields」**는 지금 보고 있는 페이지에서 추출 가능한 필드를 자동으로 잡아 컬럼 구성까지 제안해줘요. 주거용을 긁으면 면적·침실 수 컬럼이, 채용을 긁으면 보수·고용 형태 컬럼이 알아서 잡혀요. 수동 세팅이 필요 없어요. 이후 서브페이지 스크래핑으로 각 게시물에 들어가 상세 필드까지 보강해요.

법적 현실 체크: Craigslist 이용약관, 3Taps 사건, 알아둘 점

저는 변호사가 아니고, 이 글은 법률 자문이 아니에요. 다만 이 부분을 신경 쓰는 분이 많다는 걸 알아서, 짚고 갈게요.

핵심 판례: Craigslist v. 3Taps (2013). Craigslist는 중지 요청 이후에도 게시물을 긁어 재게시한 3Taps를 상대로 금지 명령을 받아냈어요. 3Taps가 프록시 서버로 IP 차단을 우회한 정황이 있었고, 법원은 차단 이후 접근을 「허가 없는 접근」으로 볼 여지가 있다고 판단했죠. EFF는 이 사건이 2015년에 합의로 끝났다고 정리해요.

Craigslist 이용약관은 사이트와 상호작용할 때 「로봇, 스파이더, 스크립트, 스크래퍼, 크롤러 또는 이와 유사한 자동/수동 수단」 사용을 명시적으로 금지해요. 24시간 동안 첫 1,000페이지를 넘긴 뒤에는 위반당 페이지마다 0.25달러(약 340원)의 손해배상액까지 적어두고 있죠.

실무 가이드라인:

  • ✅ 공개 게시물 데이터를 시장 조사나 개인 분석용으로 스크래핑
  • ✅ robots.txt와 요청 제한 존중
  • ⚠️ 스크래핑한 게시물을 대량 재게시하지 않기
  • ⚠️ 스크래핑한 연락처 정보를 무분별한 마케팅에 쓰지 않기
  • ❌ 차단된 뒤 기술적 접근 제한 우회하지 않기

핵심은 결국 결이 다른 두 행동을 구분하는 거예요. 공개된 데이터를 본인 분석용으로 긁는 것과, 그 데이터를 대량 재게시하거나 스팸 메일링 리스트로 활용하는 건 전혀 다른 얘기예요. 한국에서는 개인정보보호법(PIPA) 관점에서도 연락처 정보 수집·활용에 대한 별도 검토가 필요할 수 있어요. Craigslist가 약관 집행에서 IP 차단을 넘어 법적 대응까지 단계적으로 수위를 높여 왔다는 점도 같이 기억해두세요.

그래서 어떤 Craigslist 스크래퍼가 나에게 맞을까?

10개 도구를 다 돌려보고 평가한 결론을 상황별로 정리하면 이래요.

  • 비기술 비즈니스 사용자가 Craigslist 데이터를 빨리 받아야 할 때Thunderbit. 코드 0, AI 필드 감지, 유지보수 0, 무료 내보내기. 「이 데이터가 필요해」에서 「스프레드시트에 들어옴」까지 가장 빠른 동선이에요.
  • 전 지역에서 하루 수천 건을 긁어야 하는 엔터프라이즈Bright Data. Craigslist 전용 스크래퍼, 대규모 프록시 인프라, 자동 CAPTCHA 해결, 전담 지원까지.
  • 관리형 API·프록시 인프라가 필요한 개발팀 → 프록시 중심 워크플로면 Oxylabs, 액터 마켓플레이스의 유연성을 원하면 Apify.
  • 완전한 제어와 커스터마이징이 필요한 개발자Scrapy + Playwright. 오픈소스, 최대 유연성, 다만 프록시와 유지보수는 본인이 챙겨야 해요.
  • 예산은 빠듯하고 요구사항은 중간 정도 → Apify 무료 요금제(월 5달러 크레딧)나 ParseHub 무료 요금제(프로젝트 5개).
  • 이미 멀티플랫폼 리드 발굴 도구를 쓰는 영업팀Phantombuster. 기존 파이프라인에 Craigslist만 끼워 넣으면 돼요.
  • Python 입문자가 한 번만 긁어보고 싶은 경우BeautifulSoup + requests. 코드 적고, 세팅 적고, 기능 최소.

비기술 비즈니스 사용자에게는 Thunderbit이 편의성·정확성·비용의 균형이 가장 잘 맞아요. 개발자라면 Scrapy + Playwright 조합이 가장 강력해요. 엔터프라이즈 규모면 Bright Data를 이기기 어려워요.

AI 기반 Craigslist 스크래핑이 실제로 어떤 느낌인지 보고 싶다면 Thunderbit를 한 번 써보세요. 무료 요금제만으로도 본인 사례에 맞는지 충분히 검증할 수 있어요. 웹 스크래핑 기법을 더 깊이 파고 싶다면 Google Sheets로 스크래핑하는 방법, 최고의 자동 웹 스크래핑 도구, 차단 없이 웹 스크래핑하는 방법 가이드도 추천해요. 단계별 영상은 YouTube 채널에 정리돼 있어요.

데이터가 늘 깨끗하고 바로 쓸 수 있는 상태로 도착하길 바랄게요.

자주 묻는 질문

Craigslist 게시물을 스크래핑하는 게 합법인가요?

Craigslist 이용약관은 자동 스크래핑을 명시적으로 금지하고, Craigslist v. 3Taps 사건이 대표 판례예요. 공개 게시물 데이터를 개인 또는 분석용으로 긁는 것은 대량 재게시나 스팸과는 다르게 다뤄지는 경향이 있지만, 요청 제한과 사이트 규칙은 반드시 지켜야 해요. 그리고 이건 법률 자문이 아닙니다.

코딩 없이 Craigslist를 스크래핑할 수 있나요?

네. Thunderbit, ParseHub, Apify 같은 도구가 노코드·로우코드 옵션을 제공합니다. 특히 Thunderbit의 AI 필드 감지는 정말 간단해요. 「AI Suggest Fields」와 「Scrape」 두 번 누르면 끝이에요.

무료 Craigslist 스크래퍼 중 최고는?

개발자라면 ScrapyBeautifulSoup이 완전 무료 오픈소스예요(단, 프록시·유지보수 비용은 따로 쌓일 수 있어요). 비개발자라면 Thunderbit 무료 요금제(월 6페이지)가 가장 좋은 출발선이고, ParseHub 무료 요금제(프로젝트 5개)도 대안이에요.

Craigslist에서 차단당하지 않으려면?

요청 제한(최소 2~5초 지연)을 걸고, User-Agent를 바꾸고, 데이터센터 프록시는 피하세요(Craigslist에선 주거용이나 ISP 프록시 쪽이 훨씬 잘 통합니다). 그리고 예측 가능한 크롤링 패턴은 만들지 마세요. 중간 규모라면 Thunderbit 같은 브라우저 기반 도구는 본인 Chrome 세션에서 돌아가니까 프록시 이슈 자체를 비켜갈 수 있어요.

Craigslist 전 지역을 한 번에 긁을 수 있나요?

Scrapy나 Playwright 같은 개발자 도구로 미국·지역 416개 URL을 프로그램으로 순회할 수 있어요. Bright Data, Oxylabs 같은 엔터프라이즈 도구는 다지역 스크래핑이 기본 탑재예요. Thunderbit이라면 각 지역 사이트를 열어 같은 워크플로로 돌리면 되고, AI가 페이지마다 자동으로 맞춰줘요.

Craigslist 스크래핑에 Thunderbit 사용해 보기 Get Started Free

더 알아보기

Shuai Guan
Shuai Guan
Thunderbit CEO | AI 데이터 자동화 전문가 Shuai Guan은 Thunderbit의 CEO이자 University of Michigan 공학과 출신입니다. 10년 가까운 기술 및 SaaS 아키텍처 경험을 바탕으로, 복잡한 AI 모델을 누구나 바로 활용할 수 있는 노코드 데이터 추출 도구로 바꾸는 데 전문성을 갖고 있습니다. 이 블로그에서는 웹 스크래핑과 자동화 전략에 대한 필터링 없는 실전 경험과 검증된 인사이트를 공유하며, 더 똑똑하고 데이터 중심적인 워크플로를 만드는 데 도움을 드립니다. 데이터 워크플로를 최적화하지 않을 때는, 같은 꼼꼼함으로 사진이라는 취미에 몰두합니다.
목차

말 한마디로 웹페이지를 스크래핑하세요

원하는 걸 평범한 영어로 말하면 됩니다. 아니면 아무 말도 안 해도 괜찮아요.

Thunderbit 사용해보기 무료
AI로 데이터 추출하기
Google Sheets, Airtable, Notion으로 데이터를 손쉽게 منتقل하세요
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week