Googleで「scraper plugin」と検索すると、ツールバーのボタンと、5分で完成するスプレッドシートが出てくると思うはずです。ところが実際に表示されるのは、開発者向けAPIの説明、コード例、「プロキシローテーション」や「同時実行ワーカー」といった言葉が並ぶ料金ページばかり。多くの業務ユーザーは、そのギャップの中で結局あきらめて、手作業でコピペすることになります。
この混乱は偶然ではありません。カテゴリーの切り分けができていないことが原因です。多くの「おすすめスクレイパー」比較記事は、ブラウザ拡張機能、デスクトップアプリ、クラウドAPIをひとまとめにして、Chrome拡張機能の導入とREST APIの連携を同じ判断のように扱っています。でも、実際はまったく違います。そこで今回は、まず導入形態で分類し、次に用途で整理しました。これで、あなたに必要なのがプラグインなのか、アプリなのか、それとも開発者に依頼すべきなのかを、30秒ほどで見極められるはずです。
何をもって「本当の」スクレイパープラグインと呼ぶのか?(拡張機能 vs. デスクトップアプリ vs. クラウドAPI)

実際に使える判定方法はこれです。バックエンド連携を先に作らなくても、いま開いているページ上でそのまま動き、ブラウザ内にインストールして使えるツールかどうか。もしそうなら、実用上は「本物のブラウザプラグイン」です。別のプログラムをダウンロードして起動する必要があるなら、それはデスクトップアプリ。コードを書いてエンドポイントを叩くなら、それはクラウドAPIです。便利ではありますが、常識的な意味でプラグインとは言えません。
| カテゴリー | 動作場所 | 操作方法 | 強み | 制約 |
|---|---|---|---|---|
| 真のブラウザ拡張機能 | いま開いている Chrome/Edge のページ内 | ツールバー、サイドバー、ポイント&クリック | 導入障壁が最も低く、見えている画面そのものを扱える | 開いているタブに依存し、スケジューリングや大規模処理には弱い |
| デスクトップアプリ | 追加でインストールする独立したプログラム(独自ブラウザ付き) | ビジュアルなプロジェクトビルダー | ナビゲーション制御やローカル案件の自由度が高い | インストールと初期設定の手間がある |
| クラウド自動化プラットフォーム | ホスト型サービス。場合によっては拡張機能を併用 | テンプレート、ロボット、スケジューラ | 再現性が高く、PCを開いたままにしなくてよい | アカウントやクレジット管理がやや複雑 |
| クラウドAPI/プラットフォーム | ベンダー側のインフラをコードから呼び出す | HTTPリクエスト、SDK、CLI | スケールしやすく、再実行も容易 | 開発者が必要 |
この区別が大事なのは、ハイブリッド型のツールが境界をあいまいにしがちだからです。Octoparse は拡張機能のように見えるテンプレートモードがありますが、本質はクラウド層を備えたデスクトップアプリです。PhantomBuster はブラウザ拡張機能を持っていますが、中心はクラウド型のソーシャル自動化です。ブラウザ要素があるからといって何でも「プラグイン」と呼ぶのは、まさに今回の混乱を生んでいる“カテゴリーの混同”そのものです。
ベストなスクレイパープラグインの選び方
私は各ツールを6つの基準で評価しました。導入の手軽さ(本当に拡張機能か、デスクトップか、APIか)、ノーコードかコード必須か、JavaScript描画と対ボット対策への対応、出力先、料金の分かりやすさ、そして——多くのレビューが見落としがちな——対象サイトのレイアウト変更時の保守負担です。
最後の点は特に重要です。ここに挙げた selector ベースのツールはすべて、公式ヘルプセンターで「サイトがリニューアルしたら何が起こるか」を案内しています。たとえば、列のずれ、空行、重複、あるいは静かに失敗するケースなどです。Octoparse のトラブルシューティングページには、ページの読み飛ばしや最終ページの無限ループが通常の失敗例として載っています。ParseHub のエラーコードには、セレクターが一致しなくなると「selected no elements」があります。これはツールの欠点を責めているのではなく、固定されたHTML要素を指し示す方式の物理的な限界です。毎回ページ構造を読み直すツールと、6か月前のCSSパスを記憶しているだけのツールとでは、日々の保守負担がまったく違います。
一目でわかるおすすめスクレイパープラグイン
| ツール | カテゴリー | 最適な用途 | 設定 | JS/対ボット対応 | 出力先 | 料金体系 |
|---|---|---|---|---|---|---|
| Thunderbit | AIネイティブなブラウザ拡張機能 | セレクター不要のワンクリック抽出 | クリックで実行、対応ページではスキーマ設定不要 | 対応・許可されたページでのエージェント型ページ解析 | Excel、Google Sheets、Airtable、Notion、ダウンロード | クレジット制(最新情報要確認) |
| Instant Data Scraper | 従来型のヒューリスティック拡張機能 | 無料で手早い表・一覧の抽出 | ポイント&クリック、自動で表を検出 | 動的読み込みと無限スクロールへの対応を明記。プロキシやCAPTCHA管理はなし | XLS/XLSX/CSV | 無料 |
| Web Scraper | ルールベースの拡張機能 | 構造化された再利用可能なスクレイピングルール | 手動で sitemap/selector を設定 | ローカルではJS/ページ送りを制御。Cloudではプロキシと再試行を追加 | CSV、XLSX(ローカル)、JSON/API(Cloud) | ローカル無料 + Cloud有料 |
| Octoparse | デスクトップアプリ + クラウド層 | 動的ページでより高機能なノーコード運用 | テンプレート + ポイント&クリックのデスクトップ操作 | Chrome/Phantom モードとクラウド抽出で比較的強い | CSV、Excel、DB、API | 無料 + サブスク |
| ParseHub | デスクトップのポイント&クリック型 | 複雑な入れ子のページ送り | デスクトップアプリをインストール | 内蔵ブラウザでJSに対応。デバッグ用のサーバースナップショットあり | CSV、JSON、Google Sheets(スクリプト経由) | 無料 + 有料プラン |
| Browse AI | クラウドロボット + 監視機能 | 定期監視とアラート | ロボットテンプレート(拡張機能は現在非推奨) | 記録した操作には強い。プレミアムサイトには最小クレジットが必要 | CSV、JSON、S3、API、Sheets、Airtable | クレジット/タスク課金 |
| PhantomBuster | クラウド自動化 + 連携拡張機能 | 対応済みのソーシャル/リード獲得自動化 | 事前構築済みの「Phantom」 | 自分のログイン済みアカウント経由で実行 | HubSpot は検証済み。他の出力は要確認 | 実行時間ベースのクレジット(詳細価格は非公開) |
| Firecrawl | クラウドのコンテキストAPI | 大規模・JS多用のクロール | API/SDK/CLI、開発者向け | ホスト型レンダリング、スマート待機、FirecrawlAgent の robots.txt を尊重 | Markdown、HTML、スクリーンショット、JSON | クレジット制(Scrape/Crawl/Map/Monitor は1ページ1クレジット) |
| ScraperAPI | クラウドのプロキシ/スクレイピングAPI | 大規模運用でIPブロックを避けたい場合 | API/コード必須 | プロキシローテーション、CAPTCHA処理、ブラウザレンダリング、地域指定 | JSON(構造化エンドポイント)。コアAPIは生レスポンス | 従量課金(詳細非公開) |
「今日、この表をExcelに入れたい」だけなら、Thunderbit か Instant Data Scraper を選んでください。もし仕事が「開発者が、ブロックされずに1万URLへ安定してアクセスできる仕組みを作る」なら、Firecrawl か ScraperAPI に一気に飛びましょう。それ以外の方はこのまま読み進めてください。このリストの中ほどに、実際の業務用途の多くが収まっています。
セレクター不要でワンクリック抽出したいなら: Thunderbit

Thunderbit は、技術に詳しくない人でもCSSセレクターを描かずに使えるよう設計された、AIネイティブの Chrome / Edge 拡張機能です。対象ページを開いて One Click Extract を押すだけで、Thunderbit がページを読み取り、何を抽出すべきかを判断し、その後すぐに Run Now ボタンで処理を開始できます。
これは、旧来の「AI Suggest Fields → 確認 → Scrape」という流れとはかなり違います。現在のデフォルトは、むしろ「1クリックで完了」に近い動きです。何も設定したくないからこそ「scraper plugin」と検索した、という人には大きな意味があります。
主な機能:
- CSSセレクターを手で作らずに、AIが列を推定。自然言語でフィールド調整も可能
- サブページ/深掘り抽出:詳細ページへ自動で移動し、追加項目を取得
- ページ送り、URL一括投入、無限スクロールに対応(対応ページのみ)
- ログイン済みページではブラウザモード、公開ページではクラウド実行
- Excel、CSV、Google Sheets、Airtable、Notion、JSON へ出力
料金(最新は公式ページで確認してください): 無料プランは月6ページ、Starter は月15ドルで500クレジット、Pro は月38ドルで3,000クレジットです。Thunderbit の規約ではクレジットは出力行ごとに消費されるため、Starter は1,000行あたり約30ドル、Pro は約12.67ドル相当になります。ただし、これは請求額そのものではなく、クォータからの概算です。予算を組む前に料金ページを必ず確認してください。
こんな人に最適: セレクターとは何かを学ばずに、今日中にWebページをスプレッドシート化したい営業・オペレーション・マーケティング担当者。
正直な制約もあります。ここにある他の拡張機能と同じく、Thunderbit が使えるのは対応済みで許可されたページだけです。すべての CAPTCHA や対ボット対策を突破できるとは約束していませんし、利用規約でもアクセス制御の回避は禁止されています。そんなことを本当に安定してできるツールはありません。もしそう言う人がいたら、何かを売りつけたいだけです。
一回だけの表抽出を無料で素早く済ませたいなら: Instant Data Scraper

Instant Data Scraper は無料のヒューリスティック型 Chrome 拡張機能で、ページ上の表や一覧を自動検出し、プレビュー、微調整、出力ができます。知っておくべき点として、Chrome Web Store 上の現在の提供元は Web Robots ではなく Flavr Technology です。Web Robots はこの拡張機能を作成しましたが、現在は所有もサポートもしていないと明言しています。そのため、旧サイトのチュートリアルは、現在のプライバシー約束ではなく、過去のワークフロー参照として扱うのが安全です。
得意なこと:
- きれいで静的なディレクトリ型ページを、ほぼ即座に CSV/Excel へ出力
- 動的読み込みや無限スクロールを検出し、クロール間隔も調整可能
- セットアップ費用がゼロ。本当に無料で、アカウントも不要
向いていないこと: スケジューラもAPIも JSON 出力もなく、CAPTCHA の管理機能もありません。そして本当に注目すべきなのは、現在の提供元のプライバシーポリシー(2026年7月更新)が、"your data stays local" という宣伝文句より広い範囲で、ブラウジング、検索、ECの行動情報を収集すると開示している点です。抽出した行データがブラウザ外へ出るわけではありませんが、機密性の高いログインセッションに最初から使うツールとしては、私はあまり勧めません。
こんな人に最適: きれいな公開リストページから、一度だけゼロコスト・ゼロ手間でデータを抜きたいとき。
再利用できるスクレイピング手順を作りたいなら: Web Scraper

Web Scraper は、2つの製品にきれいに分かれています。ひとつは無料で無制限に使えるローカル拡張機能で、セレクターを使ったポイント&クリックの「sitemap」で操作します。もうひとつは有料の Web Scraper Cloud で、スケジューリング、API、webhook、管理されたブロック回避機能が追加されます。
sitemap 方式は、Thunderbit や Instant Data Scraper よりも事前設定が必要です。ナビゲーションとデータのセレクターを手動で定義する必要があるからです。ただ、その手間の見返りとして、ヒューリスティック型にはないものが得られます。それは、毎回同じように動く、文書化され再利用可能なレシピです(サイトが変わらなければ)。Web Scraper の公式ドキュメントもこのトレードオフを率直に説明しており、自動ポイント&クリック選択は「常に十分ではない」とし、複数行を扱う selector には明示的なラッパー要素が必要で、そうしないと行がずれると警告しています。
- ローカル版: 無料、無制限、CSV/XLSX 出力、アカウント不要
- Cloud版: スケジューリング(日次/間隔/CRON)、API、JSON出力、プロキシ、CAPTCHA対応機能
- Cloud の料金は月50ドル(年払い)からで、5,000 URLクレジット付き。1クレジットは読み込んだ1ページ分なので、1ページあたり何件取れるかで1行あたりのコストは大きく変わります
こんな人に最適: 毎週同じ複数ページのスクレイピングを確実に回したいチームで、最初の設定に時間をかける意欲がある場合。
動的ページをノーコードで扱うなら: Octoparse

Octoparse は、デスクトップアプリにクラウド実行層を足したもの、と考えるのが一番近いです。Web版はなく、Linux や Chromebook では動作しません。ブラウザ拡張機能に対して優位なのは、インストール済みの Chrome を直接操作する Chrome Mode があり、CAPTCHA や Cloudflare が強いサイトに対応できること、ヘッドレスでローカル実行する Phantom Mode があること、そしてノートPCを閉じても止まりにくい本当のクラウド抽出層があることです。
- 動的コンテンツ向けの AJAX 検出と待機タイムアウト設定
- Next ボタン、Load More、無限スクロールの明示的なページ送り処理
- 有料プランでは Excel、CSV、JSON、XML、Google Sheets、SQLデータベース、クラウドストレージへ出力可能
料金は契約前に要確認です。今回確認した時点の料金ページでは Standard が月69ドル〜、Professional が約199ドルでしたが、Octoparse のヘルプセンターの比較ページには、ライブの料金カードとは別の数字が載っています。請求切り替えや現在のキャンペーンを必ず確認してください。
こんな人に最適: シンプルな拡張機能では物足りず、コードを書かずに本当に動的なページを視覚的に制御したい人。
複雑で入れ子になったページ送りなら: ParseHub

ParseHub はブラウザプラグインではなく、内蔵ブラウザを使うポイント&クリック型のデスクトップアプリです。特に特徴的なのはコマンドの階層で、Select、Relative Select、Click に加え、祖先の選択に再帰的に戻る Jump という非常に賢いコマンドがあります。ParseHub の公式ドキュメントでも、深く入れ子になったコメントスレッドに対してこの Jump が推奨されています。
これは「複雑で入れ子のページ送り」に対する本物の答えです。このリストの多くのツールには、Jump に相当する機能がありません。その代わり、設定はやや難しくなります。ParseHub の階層ガイドでは、次ページのクリックを間違った親要素の下に置くと、2ページ目を何度も再スクレイプするループに陥ると注意しています。
もうひとつ知っておきたい癖があります。テスト実行ではローカルIPが使われますが、本番実行ではプロジェクトをアップロードし、ParseHub のサーバー上で別IPから動きます。つまり、テストでは完璧でも、本番では結果が変わったりブロックされたりすることがあります。その差を調べるために、ParseHub は「Server Snapshot」機能を用意しています。
こんな人に最適: コメントスレッドやカテゴリツリーのような、多段で深いページ送りが必要なケース。
定期監視とアラートに最適: Browse AI

Browse AI は、静かにブラウザ拡張機能からクラウドファーストの監視プラットフォームへ移行しました。2026年3月付の公式ヘルプセンターでは、Chrome拡張機能は「Robot Studio」に置き換えられたと明記されています。(一方で、料金FAQページでは今も新規ユーザーに拡張機能のインストールを案内しており、製品の方向転換がマーケティング文に追いついていない時にありがちな不一致が見られます。)
得意なのは、記録した「ロボット」を1時間ごと、毎日、毎週、または任意間隔で実行できること、変更履歴、メール通知、webhook連携です。クレジット体系も細かく、リストの10行で1クレジット、1タスク最低1クレジット。さらに「プレミアムサイト」(セキュリティが強い、または動的要素が複雑)はタスクあたり2〜10クレジット以上かかります。
こんな人に最適: 一回きりの出力ではなく、価格追跡、競合監視、「変わったら通知してほしい」といった継続監視。
ソーシャル/リード獲得の自動化に最適: PhantomBuster

PhantomBuster は、連携用ブラウザ拡張機能を備えたクラウド自動化プラットフォームで、LinkedIn のリード発掘、情報補完、アウトリーチなどに向けた事前設定済みの「Phantoms」を中心に設計されています。ベンダーのFAQには、ひとつ大事な点がはっきり書かれています。つまり、自分のアカウント経由で自動化し、自分がすでに見られるデータ以上にはアクセスしない、ということです。
それ自体は妥当な設計思想ですが、より難しい問いには答えていません。たとえば、その自動化頻度や操作内容が対象プラットフォームの利用規約に違反しないのか、という点です。読み取りだけの抽出と、接続リクエスト送信、メッセージ、いいねのようなアカウント操作では、リスクがまったく違います。しかも PhantomBuster のトップページは、その両方を行えると宣伝しています。「自分のアカウント経由で動く」というのは安全の保証ではなく、あくまで調査の出発点だと考えてください。
こんな人に最適: 一般的なページスクレイパーの代わりではなく、対応済みの LinkedIn やソーシャル系リード獲得フローを回す営業チーム。
JS が重い大規模クロールのクラウド代替に最適: Firecrawl

Firecrawl は、自らを「大規模にウェブを検索・スクレイプ・操作するためのコンテキストAPI」と説明していますが、これは実態にかなり合っています。これはプラグインではなく、開発者向けのインフラです。Python、Node.js、Go、Rust、Java、Elixir 用の SDK があり、AIエージェント向けの公式 MCP サーバーもあります。
ブラウザ拡張機能では物理的に対応しきれなくなったときに使うツールです。たとえば、1万ページのクロールでノートPCを開きっぱなしにできない場合や、CSV ではなく LLM パイプライン向けにきれいな Markdown / JSON が欲しい場合などです。Firecrawl の Crawl エンドポイントは、FirecrawlAgent ディレクティブ向けに書かれた robots.txt ルールを尊重します。これは小さいながらも具体的なガバナンス上のサインで、多くの競合が明示していない点です。
課金はクレジット制です。Scrape、Crawl、Map、Monitor は1ページ1クレジット、Search は10件ごとに2クレジット、Interact(複数ステップのブラウザ操作)は1ブラウザ分あたり2クレジットです。無料プランには月1,000クレジットが含まれます。有料のドル価格は調査時点で確定できなかったため、最新の料金ページを確認してください。
こんな人に最適: 定期クロールを構築する開発者、または構造化されたWebコンテンツを AI/RAG パイプラインに流し込みたい人。
IPブロック回避のクラウド代替に最適: ScraperAPI

ScraperAPI は明確に「公開ウェブサイトからデータを収集するためのWebスクレイピングAPI」です。ブラウザもデスクトップアプリもなく、すでに自作しているスクレイパーの裏側で、プロキシローテーション、CAPTCHA解決、ブラウザレンダリングを処理するエンドポイントだけがあります。会社は、50か国以上にまたがる4,000万超のプロキシを持ち、Amazon や Google Search のような特定対象向けには、生のHTMLではなく解析済みJSONを返す構造化エンドポイントも用意していると案内しています。
これは、「ページの解析方法が分からない」という問題ではなく、「解析方法は分かっているのに、IPブロックや CAPTCHA で止められる」という問題に向いたツールです。「どんなサイトでも」よりもずっと狭く、正直なポジショニングだと考えています。私ならその狭い定義のまま使います。ScraperAPI の公式サイトも、対象をログイン不要の公開ウェブサイトに限定しています。
調査時点では、現行の正確な料金階層は公開情報だけでは確定できませんでした。ベンダーは主要な紹介ページで細かなリクエスト単価を公開していないため、導入前に見積もりを取るか、最新の料金ページを確認してください。
こんな人に最適: すでにスクレイパーはあるが、ボトルネックが抽出ロジックではなくIPブロックであるチーム。
スクレイパープラグインが失敗したりブロックされたりする理由

空の出力と「ブロックされた」出力は、ユーザーから見るとどちらも同じに見えますが、実際には原因も対処法も異なります。
| 失敗の種類 | 何が起きているか | 最初に確認すること |
|---|---|---|
| DOM/セレクターのずれ | サイト改修で対象フィールドの位置が変わった | 再検出を実行し、レシピを更新する |
| JSのタイミング問題 | 内容がAPI呼び出しや操作の後に読み込まれる | 待機を追加し、描画後の状態を確認する |
| 無限スクロール/仮想リスト | DOM上に見えている行しか一度に存在しない | スクロール動作と重複排除を確認する |
| ページ送り/ナビゲーション状態 | 次ページ処理が正しく追従していない | ループの範囲と停止条件を確認する |
| ログイン/セッションの制限 | コンテンツがCookieやトークンに依存している | 権限とセッション範囲を確認する |
| レート制限/IP制御 | リクエスト頻度が原因で制限やCAPTCHAが発生 | 速度を落とし、対象サイトのポリシーを確認する |
セレクター依存のツール(Instant Data Scraper のヒューリスティック検出や、Web Scraper の固定 sitemap など)は、構造を記憶しているだけで毎回読み直さないため、最初の失敗タイプに最も弱いです。Thunderbit のようなエージェント型ツールは毎回ページ構造を再解析するので、この種の失敗を減らせますが、完全には防げません。レート制限、CAPTCHA、ログイン壁には効きませんし、このリストのどのベンダーも、Thunderbit を含めて、それを真面目に突破できるとは言っていません。レート制限やIP制御、あるいは重いJS描画が一時的な面倒ではなく継続的なボトルネックになってきたら、Firecrawl や ScraperAPI のようなクラウド代替、または Octoparse の有料クラウド抽出モードに切り替えるサインです。
実際のコスト比較: これらのスクレイパープラグインはいくらかかるのか? 1,000行あたりで見る
価格だけで比較するのが難しい理由は、各ツールが同じ単位で課金していないからです。Thunderbit は出力行ごと、Web Scraper Cloud は読み込んだURLごと(0行のことも1000行のこともある)、Firecrawl は Scrape/Crawl/Map/Monitor でページごと、Browse AI は10行ごとに課金し、しかも1タスク最低1クレジットが小規模案件では支配的になります。PhantomBuster と ScraperAPI は、1,000行あたりの単価を計算するのに十分な細かい価格情報を公開していません。
| ツール | 確認できる課金単位 | 概算の正規化コスト | 注意点 |
|---|---|---|---|
| Thunderbit | 出力行あたりクレジット | 約30ドル/1K行(Starter)、約12.67ドル/1K行(Pro) | エージェント操作でクレジット消費が変動する |
| Instant Data Scraper | 無料 | 0ドル/1K行 | クリーニング時間やスケジューラは含まれない |
| Web Scraper(Cloud) | 読み込んだURLあたりクレジット | 10ドル/1K URL(Project)、5ドル/1K URL(Professional) | URLあたりの行数が大きく変わる |
| Browse AI | 10行=1クレジット、1タスク最低1クレジット | 約1.90〜20.90ドル/1K行(詳細ページ利用状況による) | 詳細ページや高セキュリティサイトで実コストが膨らむ |
| Firecrawl | 1ページあたり1クレジット | 無料枠で月1,000ページ | ページ数と行数は別物。有料のドル価格は調査時点で非公開 |
| Octoparse, ParseHub, PhantomBuster, ScraperAPI | 変動 / 完全非公開ではない | 正確な算出は困難 | 予算化の前に最新の請求ドキュメントを確認すること |
「1,000行あたりXドル」という主張は、私の上の試算を含めて、そのツールの料金ページを見て、実際の行密度で計算しない限り信じないでください。ページごと課金のツールは、一見安そうでも、1ページあたり10行しか取れないのか100行取れるのかで全然違います。
どの用途にどのスクレイパープラグインを合わせるべきか
| 必要なこと | 最初に選ぶもの | 理由 |
|---|---|---|
| 1ページだけ、最小設定、コード不要 | Thunderbit | ワンクリックでAIが項目を推定 |
| 無料で一回だけ、きれいな静的表を取りたい | Instant Data Scraper | 無料、設定不要 |
| 毎週回す再現性のあるレシピが必要 | Web Scraper | 明示的でバージョン管理しやすいセレクター制御 |
| 動的ページでデスクトップ制御が必要 | Octoparse | Chrome/Phantomモード + クラウド層 |
| 複雑な入れ子ページ送り | ParseHub | Jump コマンドが専用設計 |
| 定期監視 + アラート | Browse AI | ロボット + クラウドスケジュール、変更履歴 |
| 対応済みのソーシャル/リード獲得フロー | PhantomBuster | 事前構築済みのアカウント連携自動化 |
| JSが重い大規模な定期クロールをAI/RAGへ流したい | Firecrawl | Markdown/JSON出力、SDK、MCP |
| 既存スクレイパーがIPブロックされ続ける | ScraperAPI | 管理されたプロキシ/CAPTCHA層 |
問題を解くのに必要な、できるだけ小さな運用モデルにツールを合わせてください。開発者APIの方が高機能そうだからといって、いきなりそれを選ばないでください。逆に、スケジュールで回すべき処理のためにブラウザタブをずっと開きっぱなしにするのも避けましょう。
スクレイパープラグインは合法なのか? 利用規約とプライバシーに関する短い注意

私は弁護士ではありませんし、これは法律相談でもありません。ただ、実務上の考え方はこうです。公開されているデータ、または明確に許可されたデータだけを扱ってください。繰り返しスクレイピングする前に、対象サイトの利用規約と robots.txt を確認しましょう。特にログインセッション内で動作するツールには注意が必要です。Thunderbit のブラウザモード、Web Scraper のログイン状態設定、PhantomBuster のアカウントベース自動化はいずれもこの範囲に入ります。
技術的な壁を越えられること(CAPTCHA やログイン壁を突破できること)は、許可を得ていることとは別です。PhantomBuster のFAQには、自分のアカウントで見えるデータだけにアクセスすると書かれています。それ自体は妥当な設計思想ですが、だからといって、見られるからといって勝手に再公開したり転売したり、大量連絡したりする権利があるわけではありません。収集する個人データは最小限にし、目的を明確にし、必要以上に保持しないでください。
このリストのどのツールも——料金ページで「コンプライアント」といった表現を掲げるものを含めて——、あなたの具体的な用途を自動的に合法にしてくれるわけではありません。それは対象サイト、収集するデータ、そして収集後の扱い方によって決まります。
結論: どのスクレイパープラグインを使うべきか?
今日中にきれいなスプレッドシートが1つ欲しくて、セレクターを考えたくないなら、本物のブラウザ拡張機能を入れてください。AIが項目を推定し、ビジネスツールへ出力したいなら Thunderbit。ページがきれいで無料がよければ Instant Data Scraper。毎週同じスクレイピングを回すなら、Web Scraper のレシピ方式か Octoparse のデスクトップワークフローが、設定の手間と引き換えに再現性をくれます。問題が本当に入れ子のページ送りなら、ParseHub のコマンドツリーがそのために作られています。やりたいことが「これを監視して通知してほしい」なら Browse AI。もしそれ以上の規模、つまり何千ものURL、JSが重いサイト、あるいは繰り返すIPブロック問題なら、開発者に Firecrawl か ScraperAPI を渡してください。
レビュー済みの、一回きりで、自分で操作する用途にはプラグインが適しています。手放しで、大規模に、開発者主導で流すパイプラインにはAPIが適しています。名前に「scraper」と入っているというだけで、この2つを混同しないでください。
FAQ
スクレイパープラグイン/拡張機能は、ログインが必要なWebサイトでも安全に使えますか?
そのデータにアクセスする権限があり、ツールがセッションをどう扱うかを確認している場合に限ります。広いブラウザ権限が求められるのは、スクレイパーが任意のページを読む必要があるからです。それだけでデータがブラウザ外へ出るとは限りませんが、だからこそ各ツールのプライバシーポリシーを確認し、勝手に決めつけないことが重要です。PhantomBuster のメッセージ機能のようなアカウント変更操作は、単純な読み取り抽出とは別のリスクとして扱ってください。
スクレイパープラグインとスクレイパーAPIの違いは何ですか?
プラグインは、いま開いているページに対してブラウザ内で動きます。コード不要で設定も最小、セッションに紐づきます。APIは、自分またはベンダーのインフラ上で動き、パイプライン向けにプログラム経由でデータを返します。ParseHub や Octoparse のようなデスクトップアプリはその中間で、プラグインよりは設定が必要ですが、素のAPIよりは視覚的に扱えます。
スクレイパープラグインが突然、空データや壊れたデータを返すのはなぜですか?
よくある原因は限られています。サイトのレイアウト変更でセレクターが合わなくなった、ツールがチェックした時点ではまだJSで内容が読み込まれていなかった、ページ送りが新しいタイプのページを処理できていなかった、ログインCookieが切れていた、などです。Thunderbit のように毎回ページ構造を再解析するツールは、特にセレクターずれによる失敗を減らせますが、このリストのどれもレート制限や CAPTCHA を完全に消すことはできません。
無料のスクレイパープラグインで、定期実行のスクレイピングはできますか?
安定してはできません。Instant Data Scraper やローカル版の Web Scraper 拡張機能のような無料ツールには、文書化されたスケジューラがありません。ブラウザを開いてボタンを押した時だけ動きます。本当に手放しで繰り返し実行したいなら、有料層が必要です。たとえば Thunderbit の定時スクレイパー、Web Scraper Cloud、Octoparse のクラウド抽出、Browse AI の監視機能などです。
さらに詳しく知る


