Craigslistの一覧を手作業でスプレッドシートへ転記すると、営業、オペレーション、不動産調査の担当者に大きな負担がかかります。見た目は「2003年で時間が止まったよう」と形容されることもありますが、月間約1億2,700万回の訪問と毎月数千万件の新規投稿があるとされ、米国最大級のクラシファイド広告として利用されています。一般向けの公開APIが用意されていないため、一覧データを業務で使うには別の取得手段が必要です。
私はThunderbitで自動化ツールづくりに長く携わってきました。営業・オペレーション・不動産の現場では、「Craigslistのデータをシートに入れたいが、何時間もコピー&ペーストしたくない」という要望が繰り返し寄せられます。一方、既存の比較記事には、情報が古い、ボット対策や保守負担が十分に扱われていない、異なる種類のツールが同じ基準で並べられている、といった課題があります。
本記事では、2026年時点の候補として10本を取り上げます。ノーコードのChrome拡張、エンタープライズ向けのプロキシ基盤、オープンソースのPythonライブラリに分け、導入方法、ボット対策、出力先、複数地域への対応、保守負担を比較します。コードを使わずに業務データを取得したい人と、Pythonで収集基盤を設計したい開発者では適した選択肢が異なるため、用途別に判断できるよう整理します。
2026年にCraigslistをスクレイピングする主な理由と活用例
Craigslistは旧来型の画面構成を保ちながら、現在も地域別のクラシファイド広告として利用されています。掲載情報ではクラシファイド系サイトで世界第3位とされ、公式ディレクトリ上では米国と各地域の416サイトに分かれています。この地域別構造により、単一の全国サイトでは集めにくい、エリアごとの在庫、価格、求人、サービス情報を比較できます。
主な業務用途は次のとおりです。
- リード獲得: サービスやギグの投稿に記載された事業内容、対応エリア、Craigslist経由の返信ルートを、地域別の候補リスト作成に利用する。
- 不動産モニタリング: 住宅ページに掲載された賃料、エリア、ベッド数/バス数、面積、投稿日時を、賃料比較や空室動向の把握に利用する。
- 競合価格調査: 売り物件のタイトル、価格、状態、所在地を、再販や価格調査の材料にする。
- 採用・労働市場の把握: Jobs と gigs に掲載された報酬、雇用形態、職務内容から、地域の求人傾向を調べる。
- 複数地域の市場分析: サブドメインと都市単位の構造を使い、エリアごとの価格、件数、カテゴリ構成を比較する。
- ワークフロー自動化: Craigslistの公開情報を、用途に応じてCSV、Google Sheets、Airtable、CRMへ取り込み、手作業の転記を減らす。
本記事で参照したユーザー事例では、毎日60〜90分かかっていた作業が、自動化後は5分前後になったと報告されています。短縮効果は対象ページ、取得件数、設定、手作業で残す工程によって変わるため、自社の処理時間を記録して比較することが重要です。
AIでCraigslistデータをスクレイピング Get Started Free
Craigslistスクレイパーの選び方:6つの評価基準
適したツールは、利用者の技術力、取得規模、対象地域、運用方法によって変わります。本記事では、異なる種類の製品を一つの総合点だけで決めず、まずノーコード、エンタープライズ基盤、オープンソースの3グループに分けたうえで、次の6項目を比較します。
- 導入のしやすさ — ノーコードで利用できるか、開発者による実装が必要か。
- Craigslistのボット対策への対応 — プロキシ自動切替、CAPTCHA処理、ブラウザ指紋対策を製品側が提供するか、利用者側で構築するか。
- 価格帯 — 無料、フリーミアム、有料、エンタープライズのどれに該当し、利用量に応じて費用がどう変わるか。
- データ出力先 — CSV、Excel、Google Sheets、Airtable、Notion、JSON、データベースなど、必要な保存先に対応するか。
- 複数地域への対応 — 米国と各地域の416サイトを横断する設計が可能か、地域ごとの実行が必要か。
- 保守負担 — Craigslistのレイアウト変更時に、セレクタやコードの修正がどの程度必要か。
選定時は、まず必須の出力先、処理量、運用担当者の技術力で候補を絞り、その後に価格と保守負担を比較すると判断しやすくなります。製品ごとの採点結果だけでなく、どの条件で候補になるかを以下で説明します。
10個のおすすめCraigslistスクレイパー一覧
個別の解説に入る前に、掲載時点の公開情報を共通項目で整理します。無料枠、CAPTCHA処理、出力先、プロキシ機能は、製品、プラン、Actor、設定によって異なります。ビジネスユーザー向けのノーコードツール、スケール重視のエンタープライズ基盤、開発者向けのオープンソースライブラリという3グループ内で比較してください。
| ツール | 種類 | 無料枠 | プロキシ / ボット対策 | CAPTCHA対応 | 出力形式 | 最適な用途 |
|---|---|---|---|---|---|---|
| Thunderbit | ノーコードのChrome拡張 | あり(月6ページ、掲載時点) | ブラウザモード(自分のブラウザセッションで動かす構成では、処理量やアクセス条件によりプロキシを使わない運用も可能) | サイト側の表示状況に依存(ブラウザセッション) | Excel、Sheets、Airtable、Notion、CSV、JSON(対応範囲はプラン・仕様による) | 非技術系のビジネスユーザー |
| Bright Data | エンタープライズ向けスクレイパー + プロキシ + データセット | トライアル(提供条件による) | 管理型のブロック解除、プロキシ、再試行、レンダリング(契約製品・設定による) | 対応製品では自動処理(契約範囲による) | JSON、NDJSON、CSV、Parquet、XLSX、API(製品・プランによる) | エンタープライズ規模の収集 |
| Oxylabs | API + プロキシ基盤 | トライアル(提供条件による) | 管理型のブロック解除、住宅回線/ISPプロキシ(契約製品による) | 対応製品・設定による | HTML、スクリーンショット、API出力(製品による) | エンタープライズ基盤を必要とする開発者 |
| Apify | クラウドのActorマーケットプレイス | あり($5/月分のクレジット、掲載時点) | プロキシ自動切替(Actor・設定依存) | 部分的 / Actorごと | JSON、CSV、XML、Excel、JSONL(Actor・設定による) | 柔軟なローコードのクラウド自動化 |
| ParseHub | ノーコードのビジュアルスクレイパー | あり(掲載時点) | 有料プランのプロキシ自動切替、クラウド実行(プランによる) | 主要機能ではない | CSV、JSON、API/S3/Dropbox(有料プラン・仕様による) | 予算重視のノーコードユーザー |
| Phantombuster | クラウド自動化プラットフォーム | あり(掲載時点・制限付き) | プロキシ対応(プラン・設定による) | クレジット / ワークフロー依存 | CSV、JSON(有料プラン・仕様による) | マルチプラットフォームの営業自動化 |
| Scrapy | オープンソースのPythonクローラー | 無料(OSS本体) | 自前のプロキシ / ミドルウェアを用意 | 標準機能にはなし | JSON、JSONL、CSV、XML、DB(実装による) | 本番環境向けクローラー |
| Playwright | オープンソースのブラウザ自動化 | 無料(OSS本体) | 自前のブラウザ / プロキシを用意 | 標準機能にはなし | カスタム出力 | ブラウザレベルの制御 |
| Selenium | オープンソースのブラウザ自動化 | 無料(OSS本体) | 自前のブラウザ / プロキシを用意 | 標準機能にはなし | カスタム出力 | 旧来のマルチ言語スタック |
| BeautifulSoup | オープンソースのHTMLパーサー | 無料(OSS本体) | 単体ではなし | 単体ではなし | カスタム出力 | 軽量なパース処理 |
候補は、主な運用方法によって次の3グループに分かれます。
- ノーコードツール(Thunderbit、ParseHub、Phantombuster)は、エンジニアに依頼せず、担当者自身でデータ取得を設定したい場合の候補です。
- エンタープライズ向け基盤(Bright Data、Oxylabs、Apify)は、処理規模、ボット対策、配信方法を管理したいチームに向いています。ApifyはActorごとの差も評価対象になります。
- オープンソースの開発者向けツール(Scrapy、Playwright、Selenium、BeautifulSoup)は、設計の自由度が高い一方、導入、保守、プロキシ管理を自社で担う必要があります。
以下では、各製品が候補になる条件と運用上の制約を説明します。
1. Thunderbit
Thunderbitは、CraigslistなどのWebページから構造化データを取得するための、AI搭載Chrome拡張です。基本操作はコードなしで進められますが、プロキシ利用の要否は対象サイト、処理量、アクセス条件によって変わります。
身内びいきは認めます(作っているのは私たちなので)。先頭に据えた理由は、非技術ユーザーがCraigslistでつまずきやすい三つの作業、すなわちカテゴリごとに異なるページ構成への対応、詳細ページからの追加取得、セレクタ変更時の保守を、AIによる項目提案とサブページ取得で軽減できるためです。ただし、抽出結果やページ変化への追従性は対象ページごとに検証する必要があります。
Craigslistでの使い方:
- Thunderbit Chrome拡張機能をインストールし、Craigslistの一覧ページ(たとえば自分の街のアパート一覧)を開きます。
- **「AIで項目を提案」**をクリックします。ThunderbitのAIがページを読み込み、住宅ならタイトル・価格・面積・ベッド数・所在地・投稿日・リンク、求人ならタイトル・報酬・職種など、ページ内容に応じた列候補を提案します。必要に応じて列を調整します。
- **「スクレイピング」**を押すと、取得結果が構造化テーブルに入ります。
- ページ送りを設定します。Craigslistのページ構成によっては、クリック式ページネーションを利用できます。
- **「サブページをスクレイピング」**で各一覧を開き、詳細ページに表示される本文、画像、連絡先情報などを追加します。取得できる項目は投稿内容と表示状態によって異なります。
- 対応する出力先とプランの範囲で、Google Sheets、Excel、Airtable、Notion、CSVへ無料でエクスポートできます。
主な機能:
- AIによる項目自動検出: Craigslistのカテゴリに応じて列候補を提案し、CSSセレクタを手動で設定する作業を減らします。
- サブページスクレイピング: 検索結果の各投稿を開き、本文、画像、表示されている連絡先情報などを追加取得できます。
- ブラウザベースのスクレイピングモード: 自分のChromeセッション内で動かす構成では、対象ページや件数によってプロキシを使わずに運用できる場合があります。
- 保守負担の軽減: AIがページ構造を読み直して項目を提案するため、固定セレクタだけに依存する方法より修正作業を抑えやすい設計です。
- 無料出力: 対応するプランと仕様の範囲で、Excel、Google Sheets、Airtable、Notion、CSV、JSONへの出力に追加料金がかからない構成です。
価格: 掲載時点では、無料枠(月6ページ)、無料トライアル(10ページ)、大容量向けの有料プランがあります。
最適な用途: Craigslistのサービス/ギグから候補リストを作る営業チーム、賃料を調べる不動産チーム、開発者に依頼せず一覧データを構造化したいオペレーションチーム。大規模な分散収集、独自のプロキシ制御、複雑なAPI基盤が必要な場合は、開発者向けまたはエンタープライズ向け製品も比較対象になります。
まずは一覧1ページで、必要な列が取得できるか、データの精度と出力形式が業務に合うかを確かめてから対象地域や件数を広げると判断しやすくなります。
CraigslistスクレイピングにThunderbitを試す
2. Bright Data
Bright Dataは、大規模収集向けのプロキシ、スクレイパー、データセットを提供する企業向けサービスです。本記事で比較した10製品のうち、掲載時点で専用のCraigslist Scraper製品ページとCraigslist Datasetマーケットプレイスの両方を確認できた製品です。
米国の複数地域を横断し、毎日何千件もの一覧を処理する要件がある場合の候補になります。Web Unlockerは、契約する製品と設定の範囲でIP、再試行、レンダリング、ブロック処理を管理します。CAPTCHAもデフォルトで自動解決されるという製品説明がありますが、対象サイト、契約、設定によって処理結果は異なります。Web Scraper IDEを使えば収集ワークフローを構築でき、地域URLをプログラムで巡回する設計も可能です。
主な機能:
- 契約範囲に応じた住宅回線プロキシネットワーク
- 対応製品・設定におけるCAPTCHA処理とブロック対策
- Craigslist専用のスクレイパーとデータセット製品
- 出力: JSON、NDJSON、CSV、Parquet、XLSX、API配信、webhook(製品・プランによる)
価格: 掲載時点の製品ページでは、Craigslistスクレイパーは1,000ページ読み込みあたり0.5ドルの従量課金で、38万ページ読み込み499ドルのプランが案内されています。住宅回線プロキシは1GBあたり4ドルからとされ、1週間の1,000リクエスト無料トライアルも案内されています。実際の料金は契約条件と利用量で変わります。
最適な用途: 高い処理量、複数地域の収集、管理型のプロキシ機能、企業向けサポートが必要なチーム。小規模な単発収集では、費用と設定負担が要件に見合うか比較する必要があります。
3. Oxylabs
Oxylabsは、プロキシとスクレイピング基盤を提供する企業で、掲載時点では専用のCraigslist Scraper APIとCraigslistプロキシページを公開しています。
Bright Dataの複数製品を組み合わせる構成と比べ、APIやプロキシを開発ワークフローへ組み込みたいチーム向けの選択肢です。Web Scraper APIとWeb Unblockerは、利用する製品と設定に応じてJSレンダリング、再試行、セッション管理、指紋生成、ボット対策を提供します。掲載時点では、Craigslist Scraper APIの無料トライアルで最大2,000件の結果まで試せると案内されています。
主な機能:
- 住宅回線とISPのプロキシプール(掲載時点では、住宅回線は1GBあたり6ドルから、ISPは1IPあたり0.60ドルから)
- 対応プランにおける自動指紋生成とセッション管理付きのWeb Unblocker
- Craigslist専用APIエンドポイント
- 掲載時点では7日間の無料トライアルあり
価格: 掲載時点では、「その他サイト」向けのスクレイパーAPIはJSなしで1,000件あたり約0.15ドル、JSありで1,000件あたり約0.35ドルから、Web Unblockerのマイクロプランは約月75ドルからと案内されています。大規模な住宅回線プロキシでは、契約量が1TBの場合に1GBあたり0.50ドル程度になることがあります。
最適な用途: 管理型のプロキシ基盤とAPIベースのワークフローで、Craigslistを継続的に収集したい開発チーム。既存のOxylabs契約へ追加する場合も、Craigslist向けAPIの仕様、費用、必要な実装を比較して判断します。
4. Apify
Apifyは、クラウド型のWebスクレイピング/自動化プラットフォームで、コードを書かずに設定できるスクレイパーテンプレート「Actors」のマーケットプレイスを備えています。
Craigslist向けにはコミュニティ製Actorが複数あり、作成者、更新状況、設定によって品質が異なります。掲載時点では、ivanvs/craigslist-scraper Actorは総ユーザー829人で評価5.0、automation-lab/craigslist-scraperはユーザー44人で評価1.0と表示されていました。評価だけで決めず、必要な項目、ページ送り、失敗率、実行コストを自分の対象ページでテストする必要があります。
主な機能:
- 複数のCraigslist Actorが利用可能(Actorによっては1ページあたり約120件を、組み込みの遅延付きで取得すると説明されています)
- 対応するActorとプランで、クラウド実行、定期実行、APIアクセス、webhook連携を利用可能
- Actorと設定に応じてプロキシ自動切替に対応
- 出力: JSON、CSV、XML、Excel、JSONL(Actorとストレージ設定による)
価格: 掲載時点では、月5ドル分のクレジット付き無料枠があり、有料プランは月約49ドルからと案内されています。使用量課金ではActorの処理内容やCU消費量によって費用が変わるため、試験実行時の消費量を記録して見積もります。
最適な用途: インフラを自前で運用せずクラウドで実行したいチーム、ローコード設定に慣れたユーザー、Craigslistを定期的に収集したいチーム。採用前にActorの更新状況と対象ページでの結果を比較できる場合に向いています。
5. ParseHub
ParseHubは、ページ要素をクリックして取得対象を指定する、デスクトップ型のビジュアルWebスクレイピングツールです。
Craigslistでは、一覧タイトル、価格、リンクを順に選択して抽出ルールを設定します。ページ構成に応じてAJAXベースのページ送りをループで処理でき、対応する有料プランではクラウド実行も利用できます。掲載時点の無料枠では最大5プロジェクトまで作成できますが、処理ページ数、実行頻度、必要な保守を含めて小規模用途に足りるか判断します。
主な機能:
- ビジュアルなポイント&クリック式のワークフロー作成
- 対象ページの構成に応じたページ送りと動的コンテンツへの対応
- 対応する有料プランでクラウド実行とスケジューリング
- 出力: CSV、Excel、JSON(プラン・仕様による)
価格: 掲載時点では無料枠(5プロジェクト)があり、より多くのページ数と定期実行が必要な場合の有料プランは月約189ドルからと案内されています。
制限: 処理規模が大きくなると実行時間や運用負担が増える場合があり、無料枠では定期実行に制限があります。CSSセレクタに依存する設定では、Craigslistのレイアウト変更時に手動修正が必要になる可能性があります。
最適な用途: 小〜中規模の取得を想定する個人または小規模チームで、ビジュアルなノーコード設定を使い、自分で抽出ルールを調整できる場合。
6. Phantombuster
Phantombusterは、LinkedInやSNSを含む複数サービス向けのクラウド型自動化プラットフォームです。Craigslist専用製品ではありませんが、掲載時点ではWeb Element Extractorを使い、CSSセレクタで公開ページから項目を取得する構成が可能です。
Craigslist向けには、セレクタの指定、ワークフローの組み立て、スケジューリングの設定が必要です。すでにLinkedInやSNSのリード獲得でPhantombusterを運用しているチームであれば、既存パイプラインへ追加する候補になりますが、対象ページでの動作と利用規約を別途検証する必要があります。
主な機能:
- 対応するプランでの自動化テンプレートとクラウド実行
- プラン・連携先に応じたスケジューリングとCRM連携
- プランと設定に応じたプロキシ対応とCAPTCHA処理用クレジット
- 出力: 有料プランでCSV、JSON(掲載時点の無料枠は10行まで)
価格: 掲載時点の無料枠は5スロット、月2時間、10行の出力上限付きです。年額課金の有料プランは、年払い換算で月約56ドルからと案内されています。
最適な用途: 複数プラットフォームでのリード獲得にすでにPhantombusterを利用し、既存の運用へCraigslistも組み込みたい営業チーム。Craigslistだけを対象にする場合は、設定工数と専用ツールの費用を比較します。
7. Scrapy
Scrapyは、オープンソースのPython Webスクレイピングフレームワークです。Craigslistのクロール処理、出力、再試行、スロットリングを自社要件に合わせて実装したい開発チームの候補になります。
掲載時点の安定版は2.17.0(2026年7月7日)です。複数地域のURLを順に処理するクロール、組み込みのリクエストスケジューリングとスロットリング、プロキシ切替用のダウンローダーミドルウェア、CSV、JSON、JSONL、XML、データベースパイプラインへのフィード出力を構成できます。ブラウザレンダリングが必要な場合は、scrapy-playwrightなどの追加実装も選択肢になります。
主な機能:
- 要件に合わせて拡張できる、本番運用向けのクローラー基盤
- プロキシ、再試行、Cookie、User-Agent切替のためのミドルウェア
- フィード出力: JSON、JSONL、CSV、XML、データベースパイプライン
- 無料かつオープンソース(運用費用は別途)
見えにくいコスト: Scrapy本体は無料でも、大規模に運用する場合はプロキシ契約(月50〜500ドル超になる例)、ホスティング/サーバー費用、CraigslistのHTML構造変更に伴う保守工数が発生します。実際の費用は処理量、契約、実装方式によって変わります。
最適な用途: Python経験のある開発チームで、既存のプロキシ基盤、大量の複数地域クロール、独自の出力処理が必要な場合。
8. Playwright
Playwrightは、Microsoft製のブラウザ自動化ライブラリで、Chromium、Firefox、WebKitをプログラムから操作できます。掲載時点では更新が継続しており、最新の安定版はv1.61系です。
Craigslistスクレイピングでは、ブラウザ操作、要素の待機、ネットワーク制御が必要な開発チームの候補です。本記事で参照した開発者コミュニティでは、新規実装でSeleniumよりPlaywrightを選ぶ意見も見られます。playwright-extraなどのコミュニティプラグインを利用する場合も、検知挙動は対象サイト、設定、更新状況によって異なります。ヘッドレス/ヘッド付きモード、要素の自動待機、ネットワークインターセプト、スクリーンショット/PDF取得を組み合わせられます。
主な機能:
- Python、JavaScript/TypeScript、Java、.NETをサポート
- ヘッドレス/ヘッド付きブラウザモード
- 要素の自動待機、ネットワークインターセプト
- 無料かつオープンソース(運用環境の費用は別途)
Craigslistでの強み: 単純なHTTPリクエストでは扱いにくいブラウザ操作を再現できます。ただし、ブラウザを使うだけでブロックを防げるわけではなく、アクセス頻度、対象サイトの規則、プロキシやセッションの設計が結果に影響します。
見えにくいコスト: Scrapyと同様、運用方法に応じてプロキシ費用、ホスティング、セレクタ変更時の保守が必要です。
最適な用途: きめ細かいブラウザ制御を求める開発者、JavaScriptで描画されるコンテンツ向けのスクレイパーを作るチーム、Selenium以外の選択肢を検討している人。
9. Selenium
Seleniumは、長年利用されているブラウザ自動化フレームワークです。掲載時点の最新リリースは4.46.0(2026年7月11日)で、BiDiとネットワーク制御機能の拡張も続いています。
Python、Java、C#、JavaScriptなど複数言語と主要ブラウザに対応し、ブラウザセッション、ログイン処理、ページスクロールを実装できます。Playwrightと比べた実行速度や記述量は、言語、構成、用途によって異なります。Seleniumをundetected-chromedriverなどの追加ライブラリなしで標準構成として実行する場合、対象サイト側のボット対策、ブラウザ設定、実行環境によっては自動操作として検知されることがあります。追加ライブラリを組み込んだ構成でも、対象サイト側の対策内容やブラウザ設定との組み合わせごとに動作と検知結果が異なります。
主な機能:
- マルチ言語対応(Python、Java、C#、JavaScript)
- ブラウザセッションの再現
- 豊富なドキュメントを持つ成熟したエコシステム
- 無料かつオープンソース(運用環境の費用は別途)
制限: 本記事で参照した2026年のコミュニティ投稿では、新規実装でPlaywrightを選ぶ意見が見られます。また、あるRedditスレッドには、住宅回線プロキシを使用してもCloudflareにSeleniumが検知されたという報告があります。いずれも個別環境の報告であり、すべての構成に当てはまるものではありません。
最適な用途: すでにSeleniumを利用している開発チーム、JavaやC#を含む複数言語対応が必要なプロジェクト、既存のブラウザ自動化環境を継続利用する場合。
10. BeautifulSoup
BeautifulSoupは、HTMLとXMLを解析する軽量なPythonライブラリです。掲載時点のPyPI版は4.15.0(2026年6月7日)です。
BeautifulSoupはパーサーであり、単体でWebページの取得やブラウザ操作を行うスクレイパーではありません。HTTP取得をrequestsなどのライブラリで行い、受け取ったHTMLをBeautifulSoupで解析します。構成を理解しやすい一方、取得、ページ送り、再試行、プロキシ、出力は用途に応じて実装する必要があります。
主な機能:
- Python初心者でも基本的なHTML解析を学びやすい
- 小規模・単発のCraigslistデータ解析に利用しやすい
- 無料かつオープンソース(取得環境の費用は別途)
制限: ページ送りの自動処理、JavaScriptレンダリング、プロキシ自動切替は単体では提供されず、別のライブラリや実装が必要です。CraigslistのHTML構造が変わった場合は、利用しているセレクタを見直します。
最適な用途: 最小限の構成でHTML解析を試したいPython初心者、1カテゴリまたは1地域からの単発データ取得、軽量なパーサーだけで要件を満たせる開発者。
Craigslistのブロックリスクを抑えるための実践ガイド:プロキシ、レート制限、主な原因
Craigslistの収集では、取得機能だけでなく、アクセス頻度、IPブロック、CAPTCHA、対象サイトの規則を運用条件に含める必要があります。Scraperlyの2026年4月のテストでは、カスタムCAPTCHA、レート制限、IPブロックを理由に、Craigslistは難易度3/5と評価されています。Bright DataのチュートリアルはWeb UnlockerまたはPlaywrightベースのScraping Browserを案内し、Oxylabsのプロキシページは住宅回線プロキシを推奨しています。これらは各ベンダーの説明であり、すべての構成で同じ結果になるとは限りません。
主な対策と判断条件は次のとおりです。
| 戦略 | Craigslistでの有効性 | コスト | 複雑さ |
|---|---|---|---|
| 住宅回線プロキシ | 構成によって有効な場合がある | $$(掲載時点では1GBあたり4〜6ドル) | 中程度 |
| ISPプロキシ | 構成によって有効な場合がある | $(掲載時点では1IPあたり0.60〜0.80ドル) | 中程度 |
| データセンタープロキシ | ブロックされる場合があり、対象条件との相性を検証 | $(掲載時点では1IPあたり0.20〜0.40ドル) | 低い |
| ブラウザベースのスクレイピング(自分のセッション) | 件数、アクセス頻度、サイト側の判定に依存 | ソフトウェアや構成による | 低い |
| レート制限 + ランダム遅延 | 基本的な負荷調整策。適切な値は対象条件による | 追加費用なし | 低い |
運用時に設定する項目:
- リクエスト間隔: Scraperlyは2〜5秒の間隔、IPごとに1分あたり5〜10リクエスト程度、20〜30リクエストごとの切り替えを推奨しています。固定値として採用せず、対象サイトの規則、応答、処理量に合わせて調整します。
- セッションの設計: User-Agentやセッションの扱いを記録し、同一パターンでの高頻度アクセスを避けます。技術設定だけで利用規約上の許可が得られるわけではありません。
- プロキシの選定: データセンター、ISP、住宅回線では、価格、契約条件、対象サイトでの結果が異なります。短いテストで成功率と費用を比較します。
- ブラウザベースの運用: 中程度の件数では、自分のブラウザセッションを使う方法も候補になります。Thunderbitのブラウザモードは、対象ページと処理量によってはプロキシ設定やIPローテーションを使わずに実行できる場合がありますが、ブロック回避や無料運用を保証するものではありません。
保守方法も比較対象です。CraigslistのHTMLやCSSが変わると、固定セレクタに依存するスクレイパーでは修正と再テストが必要になる場合があります。ThunderbitのようにAIでページ構造を読み取るツールは、項目の再提案によって保守作業を減らせる可能性がありますが、レイアウト変更後もワークフローが継続するかは実ページで検証します。
コード/ノーコード別:Craigslistスクレイピングの実装方法
Craigslistデータを業務で利用したい非技術系ユーザーと、収集コードを自分で管理したい初級〜中級の開発者では、適した進め方が異なります。以下では、ノーコードとPythonの二つの方法を手順別に示します。
ノーコード:ThunderbitでCraigslistをスクレイピングする手順
- ChromeウェブストアからThunderbit Chrome拡張機能をインストールします。
- Craigslistの一覧ページへ移動します。たとえば、自分の街のアパート一覧(
https://yourcity.craigslist.org/search/apa)。 - **「AIで項目を提案」**をクリックします。ThunderbitのAIがページを読み取り、住宅ならタイトル、価格、面積、ベッド数、所在地、投稿日、リンクなど、カテゴリに応じた列候補を提案します。
- 提案された列を見直し、必要な項目を追加・削除します。
- **「スクレイピング」**をクリックし、取得結果を構造化テーブルで確認します。
- 対象ページの構成に応じてページ送りを設定します。自動処理の可否はページ構造と現在の製品仕様によって異なります。
- **「サブページをスクレイピング」**を使って各投稿を開き、本文、画像、表示されている連絡先情報などを追加取得します。
- 対応するプランと出力先の範囲で、Google Sheets、Excel、Airtable、Notion、CSVへ出力します。
対象が1ページの場合は短時間で試せますが、所要時間はページの件数、応答速度、追加項目によって変わります。コードやCSSセレクタを手動で用意せずに始められる一方、プロキシの要否や取得精度は対象ページと運用規模に左右されます。まず1ページで列、欠損、出力形式を検証してからページ送りやサブページ取得へ進みます。
Python + PlaywrightでCraigslistをスクレイピングする方法
2026年時点で、PlaywrightはCraigslistのブラウザ操作を実装する際の有力な候補の一つです。以下は、住宅一覧ページからタイトル、価格、リンクを抽出し、ページ送りを行うPythonの例です。CraigslistのHTML、JSON-LD、ページ送り仕様が変わると動作しない可能性があるため、実行前に対象ページでセレクタと利用条件を検証します。
この例では、まずJSON-LD構造化データを試し、一部ページでItemListスキーマが見つからない場合はDOMセレクタへフォールバックします。ページ送りにはs=120を使用します。
import asyncio, json
from urllib.parse import urlparse, parse_qs, urlencode, urlunparse
from playwright.async_api import async_playwright
def next_page_url(url, step=120):
p = urlparse(url)
qs = parse_qs(p.query)
offset = int(qs.get("s", ["0"])[0]) + step
qs["s"] = [str(offset)]
return urlunparse((p.scheme, p.netloc, p.path, "", urlencode(qs, doseq=True), ""))
async def scrape_page(page, url):
await page.goto(url, wait_until="domcontentloaded")
await page.wait_for_timeout(1500)
data = []
# まずJSON-LDを試す
for raw in await page.locator('script[type="application/ld+json"]').all_text_contents():
try:
obj = json.loads(raw)
except Exception:
continue
if isinstance(obj, dict) and obj.get("@type") == "ItemList":
for item in obj.get("itemListElement", []):
thing = item.get("item", {})
data.append({
"title": thing.get("name"),
"price": thing.get("offers", {}).get("price"),
"link": thing.get("url"),
})
if data:
return data
# フォールバック: DOMセレクタ
cards = page.locator("div.cl-search-result, li.cl-static-search-result")
count = await cards.count()
for i in range(count):
card = cards.nth(i)
title = await card.locator("a.posting-title, a.titlestring").first.text_content()
link = await card.locator("a.posting-title, a.titlestring").first.get_attribute("href")
price = (await card.locator(".price, .result-price").first.text_content()
if await card.locator(".price, .result-price").count() else None)
data.append({"title": (title or "").strip(), "price": (price or "").strip(), "link": link})
return data
async def main():
start_url = "https://newyork.craigslist.org/search/apa?query=studio"
async with async_playwright() as p:
browser = await p.chromium.launch(headless=True)
page = await browser.new_page()
url = start_url
all_rows = []
for _ in range(3): # 3ページ取得
rows = await scrape_page(page, url)
if not rows:
break
all_rows.extend(rows)
url = next_page_url(url)
await browser.close()
for row in all_rows[:10]:
print(row)
asyncio.run(main())
このスクリプトに加えて必要なもの: Playwrightのインストール(pip install playwright && playwright install)、実行量に応じたプロキシやレート制限の設計、CAPTCHAが表示された場合の停止・対応手順です。コードベースの方法は制御範囲が広い一方、動作検証、保守、対象サイトの規則への対応を実装者が担います。
無料枠と有料プラン:Craigslistスクレイパーのコスト比較
ツールの費用は、ソフトウェア料金だけでなく、プロキシ、ホスティング、開発、保守、実行量を含めて比較する必要があります。以下は掲載時点の公開情報を整理したもので、プラン内容と価格は変更される可能性があります。
| ツール | ソフトウェア利用料の扱い | 無料枠の制限 | 有料の開始価格 | 隠れたコスト |
|---|---|---|---|---|
| Thunderbit | 無料枠あり(6ページ、掲載時点) | 月6ページ、無料トライアルは10ページ | 高容量向けの有料プラン | 出力料金は不要(対応先・プラン条件による) |
| Scrapy | OSS本体は無料 | プラン上限なし(運用環境の制約あり) | $0(ソフトウェア本体) | プロキシ費用、ホスティング、保守 |
| BeautifulSoup | OSS本体は無料 | プラン上限なし(運用環境の制約あり) | $0(ソフトウェア本体) | プロキシ費用、ホスティング、保守 |
| Playwright | OSS本体は無料 | プラン上限なし(運用環境の制約あり) | $0(ソフトウェア本体) | プロキシ費用、ホスティング、保守 |
| Selenium | OSS本体は無料 | プラン上限なし(運用環境の制約あり) | $0(ソフトウェア本体) | プロキシ費用、ホスティング、保守 |
| ParseHub | 無料枠あり | 5プロジェクト(掲載時点) | 月約189ドル〜(掲載時点) | 無料枠では定期実行が制限 |
| Apify | 無料枠あり | 月5ドル分のクレジット(掲載時点) | 月約49ドル〜(掲載時点) | Actorと使用量により課金が増加 |
| Phantombuster | 無料枠あり | 5スロット、月2時間、10行の出力(掲載時点) | 年払い換算で月約56ドル〜(掲載時点) | スロットごとの課金(プランによる) |
| Bright Data | トライアルのみ(掲載時点) | 1週間で1,000リクエスト(掲載時点) | 月500ドル超〜(掲載時点・契約による) | プロキシ費用は契約製品によって別途 |
| Oxylabs | トライアルのみ(掲載時点) | 2,000件の結果 / 1GB(製品・試用条件による) | 月75ドル超〜(Unblocker、掲載時点) | エンタープライズ価格(契約による) |
オープンソースの「無料」は、ソフトウェア本体の利用料を指します。Scrapy、Playwright、Selenium、BeautifulSoupを大規模に運用する場合は、開発工数、住宅回線プロキシに月50〜500ドル超かかる例、HTML変更に伴う保守を見積もる必要があります。Thunderbitは、AIによる項目提案とブラウザモードによって固定セレクタの保守やプロキシ費用を抑えられる場合がありますが、効果は対象ページ、処理量、プランによって異なります。非開発者は、月額だけでなく、設定と保守に使う時間も含めて比較すると判断しやすくなります。
実際に抽出できるもの:カテゴリ別Craigslistデータ項目
Craigslistはカテゴリによって、一覧と詳細ページに表示される項目が異なります。以下は各カテゴリで取得候補になりうる項目であり、すべての投稿に同じ情報が含まれるわけではありません。
| Craigslistカテゴリ | 抽出できる項目 | 連絡先情報は取得可能? |
|---|---|---|
| 住宅 / アパート | 投稿に含まれる範囲で、タイトル、価格、面積、ベッド数、バス数、所在地、日付、画像、本文、地図リンク、空室状況、ペット規定、洗濯/駐車場 | ⚠️ 投稿と表示状態による(匿名メール転送) |
| 売り物件 | 投稿に含まれる範囲で、タイトル、価格、状態、所在地、日付、画像、本文、メーカー/モデル/年式 | ⚠️ 投稿と表示状態による |
| 求人 | 投稿に含まれる範囲で、タイトル、会社名、報酬、所在地、職種、経験レベル、日付、本文 | まれ(応募リンクのみの場合あり) |
| サービス | 投稿に含まれる範囲で、タイトル、所在地、本文、画像 | ⚠️ 投稿と表示状態による |
| ギグ | 投稿に含まれる範囲で、タイトル、報酬、所在地、日付、本文 | ⚠️ 投稿と表示状態による |
主な注意点は次のとおりです。
- 連絡先情報: Craigslistでは匿名化されたメール転送が使われる場合があります。「メール抽出」を掲げるツールが取得する値は、投稿者本人のメールではなく、転送用アドレス(
reply+randomstring@craigslist.org)である可能性があります。 - 詳細ページの項目――本文、全画像、表示されている連絡先情報など――は、検索結果ページに含まれず、各投稿を開いた場合に取得できることがあります。
- **Thunderbitの「AIで項目を提案」**は、開いているページから列候補を提示します。住宅では面積/ベッド数、求人では報酬/職種などが候補になりますが、表示されていない情報を生成する機能ではありません。続くサブページスクレイピングで各投稿を開き、詳細ページに表示される項目を追加できます。
法的・規約上の注意点:Craigslistの利用規約と3Taps事件
以下は一般的な情報であり、法的助言ではありません。適法性は、取得地域、データの種類、利用目的、アクセス方法、契約関係によって異なるため、実運用では対象法域の専門家と自社の法務・コンプライアンス方針に基づいて判断します。
重要な先例: Craigslist v. 3Taps(2013年)では、停止要求後も投稿を取得して再公開した3Tapsに対し、Craigslist側に差し止め命令が認められました。3TapsはプロキシサーバーでIPブロックを回避したとされ、裁判所はブロック後のアクセスを「権限なし」と評価しうると判断しました。EFFによれば、本件は2015年に和解しています。
Craigslistの利用規約は、サイトとのやり取りに「robots、spiders、scripts、scrapers、crawlers、またはそれに相当する手段」を用いることを禁止しています。また、規約には、24時間で最初の1,000ページ閲覧を超える一定の違反について、1ページあたり0.25ドルの違約金条項が記載されています。条項の適用は事案と法域によって異なります。
実務上のリスク管理:
- ✅ 取得前に、対象データ、利用目的、保存期間、社内利用者を定義する
- ✅ robots.txt、利用規約、アクセス頻度、サーバー負荷を検討する
- ⚠️ 取得データの大量再公開には、規約、著作権、契約上の追加リスクがある
- ⚠️ 連絡先情報を営業に使う場合は、プライバシー、迷惑行為、適用法を確認する
- ❌ 停止要求や技術的ブロックを受けた後に、制限回避を継続しない
公開ページに表示されているデータでも、取得方法や再利用方法が無条件に許可されるわけではありません。とくに再公開、連絡先の大量収集、ブロック後の継続アクセスは、自社内の分析とは異なるリスクを伴います。
用途別に選ぶCraigslistスクレイパー
10本の比較結果を、主な利用条件別にまとめます。以下は無条件の勝者ではなく、要件から候補を絞るための目安です。
- 短時間で一覧データを試したい非技術系ビジネスユーザー → Thunderbit。ノーコード、AIによる項目提案、複数の出力先を重視する場合の候補です。まず対象ページで列と欠損を検証します。
- 全地域で毎日何千件も処理するエンタープライズチーム → Bright Data。Craigslist向け製品、大規模プロキシ基盤、CAPTCHA処理、企業向けサポートが契約要件に合う場合に比較します。
- 管理型API/プロキシ基盤が必要な開発チーム → プロキシ重視のワークフローなら Oxylabs、Actorマーケットプレイスの柔軟性なら Apify。契約条件またはActorごとの品質を評価します。
- 細かな制御とカスタマイズが必要な開発者 → Scrapy + Playwright。オープンソースで構成を調整しやすい一方、プロキシ、保守、監視を自社で実装できることが前提です。
- 予算を抑えて中程度の用途を試すユーザー → Apifyの無料枠(月5ドル分のクレジット)か、ParseHubの無料枠(5プロジェクト)。無料条件と必要な実行量が合うか比較します。
- すでに複数プラットフォームのリード獲得ツールを使っている営業チーム → Phantombuster。既存パイプラインへ組み込める場合の候補です。
- Python初心者の単発スクレイピング → BeautifulSoup + requests。HTML解析の基本を試せますが、取得、ページ送り、プロキシ、保守は別途実装します。
非技術系チームが小〜中規模の一覧を表にしたい場合はThunderbit、独自実装を管理できる開発チームはScrapyとPlaywright、管理型の大規模基盤が必要な企業はBright Dataが、それぞれ有力な候補になります。最終判断では、対象ページでの成功率、必要項目、運用費用、規約対応を比較してください。
AIによるCraigslistスクレイピングの挙動を確かめる場合は、まず1ページを対象にThunderbitを試してみてください。必要な列の取得精度、欠損、出力形式を見たうえで、無料枠の範囲と継続運用の費用を比較できます。Webスクレイピング技術をさらに調べる場合は、ウェブサイトのデータをGoogle スプレッドシートに簡単に取り込む方法、おすすめの自動Webスクレイピングツール、ブロックされずにWebスクレイピングする方法も参考になります。YouTubeチャンネルでは、手順付きの動画解説も公開しています。
用途と運用条件に合う候補を絞り、実ページでの結果を比較してから導入範囲を決めてください。
FAQ
Craigslistの一覧をスクレイピングする際の法的・規約上の注意点は?
Craigslistの利用規約は自動スクレイピングを禁止しており、Craigslist v. 3Taps事件は関連する代表的な事例です。公開一覧データであっても、取得方法、利用目的、再公開、連絡先の利用、法域によって評価は異なります。対象サイトの規則、アクセス頻度、適用法を検討し、必要に応じて専門家へ相談してください。これは法的助言ではありません。
コードなしでCraigslistをスクレイピングできますか?
はい。Thunderbit、ParseHub、Apifyなどは、製品、Actor、対象ページの条件に応じて、ノーコードまたはローコードでデータを抽出できます。Thunderbitでは、**「AIで項目を提案」で列候補を作り、必要な項目を見直してから「スクレイピング」**を実行します。ページ送りや詳細ページの取得可否は、現在の製品仕様とページ構成によって異なります。
無料で試せるCraigslistスクレイパーの候補は?
開発者向けでは、ScrapyやBeautifulSoupのソフトウェア本体を無償で利用できます。ただし、プロキシ、ホスティング、開発、保守には費用が発生する場合があります。ノーコードでは、掲載時点でThunderbitに月6ページの無料枠、ParseHubに5プロジェクトの無料枠があります。必要なページ数、定期実行、出力先を比べて候補を選びます。
Craigslistでブロックされるリスクを抑えるには?
アクセス間隔、実行量、セッション、プロキシ、対象サイトの規則を一体で設計します。2〜5秒の遅延は一つの参考値ですが、特定の間隔でブロックを防げる保証はありません。User-Agentの扱い、予測可能な高頻度アクセス、データセンタープロキシとの相性も対象環境で検証します。中程度の件数では、Thunderbitのように自分のChromeセッション内で動くブラウザベースのツールも候補になりますが、プロキシが不要か、ブロックを回避できるかはページ、件数、アクセス条件によって異なります。停止要求や技術的制限を受けた場合は、回避を続けないでください。
Craigslistの複数地域をまとめてスクレイピングできますか?
ScrapyやPlaywrightのような開発者向けツールでは、米国/地域の416 URLを順に処理するプログラムを構築できます。Bright DataやOxylabsでは、契約する製品、プラン、API仕様に応じて複数地域の収集を構成できます。Thunderbitでは地域サイトごとに同じワークフローを利用できますが、ページ構成への適応、連続実行、処理可能な件数は現在の仕様と設定によって異なります。全地域へ広げる前に、数地域で列の一致、重複、欠損、実行時間を比較します。
日本ではCraigslistの代わりに何を対象にできますか?
日本ではCraigslistの利用は限定的で、地域のクラシファイド広告としてはジモティー(jmty.jp)が広く使われています。売買品、不動産、求人、サービス、地域の募集などをエリア単位で扱う点はCraigslistと近く、掲載時点では全国の都道府県に対応しています。本記事で挙げたツールの多くは特定サイト専用ではないため、Thunderbitの**「AIで項目を提案」**や、Scrapy/Playwrightのような開発者向けツールを、ジモティーの一覧ページへ向けて同様に試せます。ただし、取得可否、精度、ページ送りの挙動は対象ページごとに異なり、ジモティー側の利用規約、robots.txt、アクセス頻度も個別に確認する必要があります。
CraigslistスクレイピングにThunderbitを試す Get Started Free
詳しく見る


