「うちのサイト、結局いま何ページあるんだっけ?」——この問いに即答できる担当者は、意外なほど少ないものです。トップページから辿れる分はわかっても、過去のキャンペーン用に作ったランディングページ、どこからもリンクされていない孤立ページ、CMSの奥に眠る古い記事まで含めた「全部」となると、途端に怪しくなります。コンテンツ監査やサイト移行のたびに、サイトマップやGoogle検索、CMSのエクスポートを何時間もかき集め、それでも抜けが出る。WordPressのURLを丸ごと書き出す作業を手伝って、コーヒーを飲み過ぎた経験のある方なら、この面倒さは身に染みているはずです。
ただ、いまはもう延々とかくれんぼを続ける必要はありません。この記事では、サイトのURLを集める代表的な手段を、昔ながらのやり方から最新の方法まで順に整理します。あわせて、ThunderbitのようなAIツールを使うと、この作業がどれだけ速く、漏れなく、しかも気楽になるかも具体的にお見せします。マーケターでも開発者でも、あるいは「とにかく全URLをまとめておいて」と頼まれてしまった担当者でも、実例と率直な比較から、自分のチームに合うやり方が見えてくるはずです。
サイトのページ一覧が必要になる場面:実際のユースケース
手段の話に入る前に、そもそもなぜ全URLが要るのかを押さえておきましょう。これはSEOだけの話ではありません。マーケティング、営業、IT、オペレーションのどこにいても、定期的にぶつかるニーズです。代表的なものを挙げてみます。
- SEOのコンテンツ監査と戦略: いまやコンテンツ監査は定例業務で、61%のマーケターが年2回以上実施しています。URLを漏れなく洗い出すことが、評価・改稿・順位改善の出発点です。実際、49%のマーケターが古い記事の更新でトラフィック改善を実感したと答えています。
- リニューアルと移行: 68%のマーケターはサイトを1〜3年ごとに作り直すべきだと考えています)。移行のたびに旧URLと新URLを対応付けないと、リンク切れやSEO評価の喪失につながります。
- コンプライアンスと保守: オペレーション側は、孤立ページや陳腐化したページを見つける役割を担います。何年も前のキャンペーン用マイクロサイトが公開されたまま放置されている、というのもよくある話です。
- 競合調査: 営業やマーケは競合サイトをクロールし、製品ページ・料金ページ・記事を一覧化して、機会やリードの手がかりを探します。
- リード獲得とアプローチ: 営業チームは、店舗検索・販売店一覧・会員ページなどをまとめ、アプローチ用リストの素材にします。
- コンテンツの棚卸し: コンテンツ担当は、記事・LP・PDFを継続的に管理し、重複を避けて資産価値を高めます。
整理すると、次の表のようになります。
| シナリオ | 必要とする人 | 完全なページ一覧が重要な理由 |
|---|---|---|
| SEO監査 / コンテンツ監査 | SEO担当者、コンテンツマーケター | すべてのコンテンツを評価できる。ページ漏れは分析不完全や最適化機会の見逃しにつながる |
| サイト移行 / リニューアル | Web開発者、SEO、IT、マーケティング | 旧URLと新URLを対応付け、リダイレクトを設定し、リンク切れとSEO損失を防ぐ |
| 競合分析 | マーケティング、営業 | 競合ページをすべて確認してインサイトを得る。隠れページが機会を示すこともある |
| リード獲得 | 営業チーム | 連絡先ページや資料ページを集めてアプローチに活用する。潜在リードの取りこぼしを防ぐ |
| コンテンツ棚卸し | コンテンツマーケティング | 最新の保管庫を維持し、抜け漏れを特定し、重複を避け、古いページを見直せる |
では、ページが抜けたり隠れたりすると、どこまで響くのでしょうか。これが案外大きいんです。リニューアルの最中に、まだ成果を出していたランディングページの存在を忘れてしまう。あるいは監査で未インデックスのページを見落とし、全体の5%が分析対象から漏れる。こうした抜けは、売上の取りこぼしやSEOのペナルティ、思わぬPRトラブルに直結します。
サイトURLを集める定番の方法:従来手法を整理する
では本題です。実際のところ、みなさんはどうやってサイトのページを集めているのでしょう。定番の手段はいくつかあり、手早いものもあれば、徹底できる代わりに手間のかかるものもあります。順に見ていきます。
Google検索と検索演算子
やり方:
Googleで site:yourwebsite.com と打ち込みます。すると、そのドメインでインデックスされているページが並びます。site:yourwebsite.com/blog のように、キーワードやサブディレクトリで絞り込むこともできます。
得られるもの:
インデックス済みページの一覧、つまり「Googleが把握しているあなたのサイト」です。
限界:
- インデックスされたものしか出ず、実在する全ページは出ません
- Google自身が、「site:」演算子はインデックス済みページの一部しか返さず、すべてを網羅するわけではないと説明しています
- 大きなサイトでも、たいてい数百件で頭打ちになります
- 新規ページや隠しページ、意図的に非インデックスにしたページは拾えません
向いている場面:
小規模サイトのざっくり確認には便利ですが、本格的な監査には力不足です。
robots.txt と sitemap.xml を確認する
やり方:
yourwebsite.com/robots.txt を開いて「Sitemap:」の行を探し、そこからサイトマップ(多くは yourwebsite.com/sitemap.xml か /sitemap_index.xml)にアクセスします。サイトマップには、運営者がインデックスさせたいURLが並んでいます。
得られるもの:
主要ページの一覧で、記事や商品ページが含まれることが多いです。約80%のサイトはサイトマップを持っています。
限界:
- 載るのは運営者がインデックスさせたいページだけで、隠しページや孤立ページは抜けがちです
- 再生成されていないと、内容が古いままのこともあります
- サイトマップが複数に分かれていて、探し回るはめになる場合もあります
向いている場面:
自社サイトの確認や、競合の主要ページをざっと眺めるのに最適です。ただし「見えているのは運営者が見せたいものだけ」という前提は忘れないでください。
SEOクローラー(スパイダー系ツール)
やり方:
Screaming Frog、Sitebulb、DeepCrawlといったツールは、検索エンジンのクローラーを模します。サイトのURLを入れると、内部リンクをたどって発見したページを一覧化してくれます。
得られるもの:
サイト内でリンクされているほぼ全ページに加え、ステータスコードやメタタグなどのデータも手に入ります。
限界:
- どこからもリンクされていない孤立ページは、手で与えない限り取りこぼします
- ヘッドレスブラウジングに非対応のツールだと、動的ページやJavaScript生成のページを見逃すことがあります
- 大規模サイトのクロールは時間がかかり、PCのメモリも食います
- 設定と一定の技術知識が前提になります
向いている場面:
深い監査をするSEO担当者や開発者には最適ですが、非技術系の人にはやや敷居が高めです。
Google Search Console と Analytics
やり方:
サイトの権限があるなら、Google Search Console(GSC)とAnalyticsからURL一覧を書き出せます。
- GSC: インデックス登録と検索パフォーマンスのレポートで、インデックス済みURLと除外URLを確認できます(エクスポートは1回最大1,000件、APIならさらに多く取得可能)。
- Analytics: 指定期間にトラフィックのあったページをすべて表示します(GA4なら1回のエクスポートで最大10万行まで)。
限界:
- 表示されるのは、Googleが認識しているページか、トラフィックを得たページに限られます
- エクスポートには上限があります(GSCは1,000行、GA4は10万行)
- サイト所有権の確認が必須で、競合調査には使えません
- トラフィックゼロのページや未インデックスのページは出てきません
向いている場面:
自社サイト、とくに移行や監査の前段階に向いています。競合分析には不向きです。
CMSのダッシュボード
やり方:
WordPress、Shopify、その他のCMSで運用しているなら、管理画面からページや投稿の一覧を直接エクスポートできることが多いです(プラグインが要る場合もあります)。
得られるもの:
ページ・投稿・商品など、すべてのコンテンツ項目の一覧です。
限界:
- 管理者権限が必要です
- コンテンツ以外のページや動的ページは含まれないことがあります
- ブログ・ショップ・ドキュメントで別々の仕組みを使っているなら、エクスポートを統合する手間が生じます
向いている場面:
コンテンツの棚卸しやバックアップをしたい運営者に最適です。競合調査には役立ちません。
従来手法でサイトのページ一覧を作るときの限界
率直に言って、どの方法も万能ではありません。主な弱点を手短にまとめます。
- 技術的なハードル: 多くの手段は技術スキルや専用ツールを前提とします。非技術系のメンバーにとっては、これがかなり高い壁です。手作業の監査は、大規模サイトなら数週間から数か月かかることもあります。
- 網羅性の不足: どの方法にも死角があります。Googleのインデックスは未インデックスや新規ページを、サイトマップは孤立ページを、クローラーは未リンクや動的ページを、CMSエクスポートはシステム外のものを取りこぼします。
- 手作業と時間: 多くの場合、複数ソースを突き合わせ、重複を除き、整形する必要があります。手間がかかるうえ、ミスも出やすい工程です。サイトマップをExcelにコピペする、コマンドラインで処理する、といった裏技まで出回っているほどです。
- すぐ古くなる: リストは鮮度が落ちるのが早く、サイトが変わるたびに作り直しが要ります。
- 権限の壁: 管理者権限やサイト所有権を要する手段は、そもそも競合調査には使えません。
- 情報過多: SEOクローラーは、ただURL一覧が欲しいだけのときでも、大量の技術データを返してきます。
要するに、従来のやり方は「レシピが毎回変わり、ときどきオーブンから締め出されながらケーキを焼くようなもの」です。あるコンテンツ戦略担当者の実感を借りた表現ですが、苦労した人ほど深くうなずける比喩ではないでしょうか。
Thunderbitという選択肢:AIでサイトURLを集める
ThunderbitのAIでサイトのURLをすべて取得 Get Started Free
ここからが本題です。「このサイトを見て、全ページを一覧にして」とアシスタントに頼むだけで、本当にやってくれたら——コードも込み入った設定もなしに。それを実現するのがThunderbitです。
Thunderbitは、非技術系の人でも使えるように設計されたAIウェブスクレイパーのChrome拡張機能で、プロの実務にも耐える性能を備えています。AIがサイトを読み取ってデータを構造化し、隠れページ・動的ページ・サブページまで含めて、すべてのサイトURLを書き出してくれます。コードを書く必要も、複雑な設定をいじる必要もありません。サイトを開いて「AIで項目を提案」を押せば、あとの重い処理はThunderbitが引き受けます。
Thunderbitが選ばれる理由:
- コードもセットアップも不要: AIが案内する自然言語ベースの操作なので、チームの誰でも扱えます。
- とにかく速い: 数時間ではなく数分で結果が出ます。
- 網羅性が高い: 動的コンテンツ、ページネーション、無限スクロール、サブページに対応します。
- 構造化された出力: Google Sheets、Excel、Airtable、Notion、CSV、JSONへそのまま出せるきれいな表になります。
- 保守が軽い: サイトの変更にAIが自動で合わせるため、調整の手間がほとんどかかりません。
- クラウドでもブラウザでも: ワークフローに合わせて、スクレイピング方式を選べます。
- 無料枠あり: いきなり契約せずに試せます。

Thunderbitでサイトのページ一覧を手早く作る手順
実際の流れを追ってみましょう。「サイトのページを全部一覧にしたい」という状態から「はい、スプレッドシートです」と言えるところまで、ほんの数クリックです。
ステップ1:Thunderbitを入れて起動する
Thunderbit Chrome拡張機能をダウンロードし、ブラウザにピン留めします。集めたいサイト(まずはトップページなど)を開き、Thunderbitアイコンを押してインターフェースを立ち上げます。
ヒント: Thunderbitは新規ユーザーに無料クレジットを用意しているので、カード情報を入れずに試せます。
ステップ2:データソースを決める
Thunderbitは標準では現在開いているページを対象にしますが、特定のセクションから始めたいなら、サイトマップやカテゴリページのようなURLの一覧を入力することもできます。
- 多くのサイトでは、トップページかサイトマップページを起点にするのがおすすめです。
- ECサイトなら、カテゴリページや商品一覧ページから始めるのも有効です。
ステップ3:「AIで項目を提案」でURLを検出する
ここでAIが本領を発揮します。「AIで項目を提案」(または「AIで列を提案」)を押すと、ThunderbitのAIがページを走査し、パターンを見抜いて、見つけたリンクごとに「ページタイトル」「ページURL」といった列を提案します。提案は自由に調整できます。
- トップページなら、ナビゲーション・フッター・注目リンクが拾われるかもしれません。
- サイトマップなら、整ったURL一覧が得られます。
- 列の追加や削除、抽出内容の絞り込みも可能です。
面倒な部分はThunderbitのAIが処理するので、XPathやCSSセレクターを書く必要はありません。こちらの意図を汲んでくれる、優秀なロボットのインターンがいるような感覚です。
ステップ4:サブページのスクレイピングをオンにする
多くのサイトは、全ページをトップに並べているわけではありません。そこで活きるのがThunderbitのサブページスクレイピングです。URL列を「たどる」リンクとして指定すると、Thunderbitは各リンクをクリックし、その先のページからさらにURLを集めます。階層の深いサイト向けに、入れ子のテンプレートも組めます。
- ページネーション付きの一覧や「もっと見る」ボタンがある場合は、ページネーションとスクロールを有効にすると、Thunderbitが最後まで進み続けます。
- サブドメインに分かれたサイト(たとえば blog.example.com のブログなど)でも、必要ならそこまでたどれます。
ステップ5:スクレイピングを走らせる
「スクレイプ」を押せばThunderbitが動き出し、URLや選んだ項目をリアルタイムで表に埋めていきます。大きなサイトなら、バックグラウンドで走らせて、終わったころに戻ってくれば十分です。
ステップ6:確認してエクスポートする
完了したら結果を見直します。Thunderbit内で並べ替え・フィルター・重複削除ができ、そのままGoogle Sheets、Excel、CSV、Airtable、Notion、JSONへワンクリックで書き出せます。コピペも、崩れた書式の手直しも、もう要りません。
所要時間の目安は? 小〜中規模サイトなら、ゼロから完全なURL一覧を作るまで10分とかかりません。大規模サイトでも、複数ソースを寄せ集めるやり方よりずっと速く、ストレスも軽く済みます。
Thunderbitで隠れページや動的ページを拾う
Thunderbitで個人的に気に入っているのが、従来ツールが取りこぼしがちなページへの強さです。
- JavaScriptで描画されるコンテンツ: Thunderbitは実際のブラウザ上で動くので、無限スクロールの求人サイトや商品一覧のような動的ページも取得できます。
- 孤立ページや未リンクページ: サイトマップや検索機能といった手がかりがあれば、どこからもリンクされていないページも見つけられます。
- サブドメインやセクション: 必要に応じてサブドメインをまたいでリンクをたどれるので、サイト全体を俯瞰できます。
- 人間らしい操作: 検索ボックスに入力したり、フィルターを押して隠れページを表示させたりする必要がありますか? ThunderbitのAIオートフィルなら、そこも任せられます。
実例: あるマーケティングチームは、過去のランディングページをすべて洗い出す必要に迫られていました。その多くはどこからもリンクされていないのに、まだ生きていたのです。ThunderbitでGoogle検索結果をスクレイピングし、わかっているURLパターンを入力したところ、忘れ去られていたページが何十件も見つかり、混乱と後々の頭痛を未然に防げました。
Thunderbitと従来手法を比べる:速度・手軽さ・網羅性
Thunderbitと従来手法を、横並びで見てみましょう。
| 項目 | Googleの「site:」検索 | XMLサイトマップ | SEOクローラー(Screaming Frog) | Google Search Console | CMSエクスポート | Thunderbit AIスクレイパー |
|---|---|---|---|---|---|---|
| 速度 | 非常に速いが制限あり | あれば即時 | 変動あり(数分〜数時間) | 小規模サイトなら速い | 小規模サイトなら即時 | 速い。数分で設定でき、スクレイピングは自動化 |
| 使いやすさ | とても簡単 | 簡単 | 中程度(設定が必要) | 中程度 | 簡単(管理者権限があれば) | とても簡単、コーディング不要 |
| 網羅性 | 低い(インデックス済みのみ) | 目的のページには高い | リンク済みページには高い | インデックス済みには高いが、エクスポートは限定的 | 中程度(コンテンツのみ) | 非常に高い、動的ページとサブページに対応 |
| 出力と連携 | 手動コピペ | XML(解析が必要) | 多量の追加データ付きCSV | CSV/Excel、最大1,000行 | CSV/XML、整形が必要な場合あり | きれいな表、SheetsやExcelなどへワンクリック出力 |
| 保守性 | 毎回手動で実行 | 更新が必要 | サイト変更のたびに再クロール | 定期的なエクスポートが必要 | 変更後に再エクスポート | 低い。AIが適応し、定期スクレイピングも可能 |
総じて、Thunderbitは手軽さ・網羅性・連携のしやすさで頭ひとつ抜けています。従来手法にもそれぞれ強みはありますが、結果をまとめて最新に保つには、どうしても手数が増えます。ThunderbitのAIはサイト変更に追随するので、設定を頻繁にいじったり、手動エクスポートを何度もやり直したりせずに済みます。
結局どれを選ぶ?:タイプ別のおすすめ
AIであらゆるウェブサイトをスクレイピングする方法 Get Started Free
では、あなたには何が合うでしょうか。長年いろいろなチームのサイトデータ整理を手伝ってきた経験から、私見をお伝えします。
- SEO担当者・開発者: メタタグやリンク切れといった深い技術データが要る場合や、大規模なエンタープライズサイトを監査するなら、クローラーや自作スクリプトはいまも有効です。それでも、Thunderbitで素早くURL一覧を作って他のツールに渡す、という使い方は十分に役立ちます。
- マーケター・コンテンツ戦略担当・PM: Thunderbitはまさに救世主です。ITにスクリプト実行やエクスポート統合を頼んで待つ必要はなく、コンテンツ棚卸しや競合分析、簡易監査なら自分の手で完結できます。
- 営業・リード獲得: Thunderbitなら、どんなサイトからでも店舗一覧・イベントページ・会員ディレクトリを手軽に抜き出せます。もちろんコーディングは不要です。
- 小規模サイト・ちょっとした作業: 小さなサイトなら、手動確認やサイトマップで足りることもあります。とはいえThunderbitはセットアップが速いので、見落としを避ける保険として使う価値は十分にあります。
- 予算面: 従来手法は、時間を別にすれば低コストです。Thunderbitには無料枠があり、有料プランも多くの企業にとって手頃です。自分の時間にも値段がついている、という点はお忘れなく。
- かなり特殊なデータ要件: 相当に特定のデータや複雑なロジックが必要なら、自作スクレイパーが必要になるかもしれません。ただ、たいていのユースケースはThunderbitのAIで最小限の設定でこなせます。
選び方のヒント:
- 自社サイトで1,000ページ未満なら、まずGoogle Search Consoleのエクスポートを試し、抜けがないか必ず確認してください。
- サイトにアクセスできない、または競合データが必要なら、Thunderbitかクローラーが頼りになります。
- 時間を惜しみたい、拡張性のある仕組みが欲しい——そんなときThunderbitは非常に強力です。
- チームで共有するなら、ThunderbitのGoogle Sheetsへの直接エクスポートは大きな武器になります。
多くの組織はハイブリッドで運用しています。短納期の作業や非技術メンバーの支援はThunderbitに、深い監査は従来ツールに、という役割分担です。
おさえておきたいポイント:あらゆる業務に効くページ一覧の取得
最後に要点を整理します。
- サイトのページを完全に一覧化することは、SEO・コンテンツ戦略・移行・営業調査の土台です。 想定外のトラブルやリンク切れ、機会損失を防げます。いまや多くのマーケターが、少なくとも年1回はコンテンツ監査を実施しています(出典)。
- 従来手法は数あれど、どれも死角を抱えています。 単独で完全かつ最新の一覧が確実に手に入る方法はなく、たいてい技術知識と複数出力の統合作業が必要になります。
- AIスクレイピング(Thunderbit)が現代的な答えです。 Thunderbitは「考える」処理とクリック作業を肩代わりし、誰でもウェブスクレイピングを扱えるようにします。動的コンテンツやサブページに対応し、すぐ使える形でデータを書き出すので、時間もミスも大きく減らせます。実際、数時間かかっていた作業が数分で済むことも多く、学習コストもほとんどありません(詳しくはこちら)。
- 方法はニーズとチームに合わせて選びましょう。 大規模サイトなら手持ちのツールを総動員するのもありですが、多くのビジネスユーザーにはThunderbitだけで十分なケースが少なくありません。
- 定期的に更新しましょう。 監査を習慣にすれば問題を早めに拾え、サイトを軽く効果的に保てます。Thunderbitはスケジュール実行に対応しているので無理なく続けられますが、手作業はどうしても後回しになりがちです。
ひとこと: 「自分のサイトに何があるかわからない」「競合のページを把握しきれていない」——そんな言い訳は、もう必要ありません。適切な方法を選べば、全ページを漏れなく把握し、その知見をSEO・UX・事業戦略の改善に活かせます。力任せにやるより、賢く進める。重い作業はAIに任せて、1ページも取りこぼさないようにしましょう。
次のステップ
「全URLをまとめておいて」という作業に疲れているなら、まずはThunderbitをダウンロードして、自社サイトや競合サイトで試してみてください。どれだけ時間と気力が浮くか、きっと驚くはずです。ウェブスクレイピングをもっと掘り下げたいなら、Thunderbit Blog の他のガイドもどうぞ。AIであらゆるウェブサイトをスクレイピングする方法 や、私が実際に使っているWebスクレイパー6選:正直な比較(2026年) から読むのがおすすめです。
よくある質問
1. なぜサイト内の全ページ一覧が必要になるのですか?
SEO・マーケティング・営業・ITの各チームは、コンテンツ監査やサイト移行、リード獲得、競合分析などのために、サイトURLの完全な一覧を必要とすることがよくあります。正確で漏れのない一覧があれば、リンク切れを防ぎ、コンテンツの重複や見落としを避け、隠れた機会も見つけやすくなります。
2. 全サイトURLを見つける従来の方法には何がありますか?
代表的なのは、Googleの site: 検索、sitemap.xml と robots.txt の確認、Screaming FrogのようなSEOツールでのクロール、WordPressのようなCMSからのデータエクスポート、Google Search ConsoleやAnalyticsからのインデックス済み・トラフィックページの取得です。ただし、どれも網羅性や使いやすさの面で限界があります。
3. 従来のURL取得方法の限界は何ですか?
従来手法は、動的ページや孤立ページ、未インデックスのページを見逃しがちです。技術知識が要ったり、データの統合や整形に何時間もかかったり、大規模サイトや繰り返しの監査に対して拡張しにくかったりします。サイト所有権や管理者権限が前提となる場合もあり、つねに使えるとは限りません。
4. Thunderbitは、全ページを見つける作業をどう楽にするのですか?
ThunderbitはAIスクレイパーで、人間のようにサイトを巡回し、サブページをクリックしてたどり、JavaScriptにも対応しながら、データを自動で構造化します。コーディングは不要で、Chrome拡張機能として動き、きれいなURL一覧をGoogle Sheets、Excel、CSVなどへ数分で書き出せます。
5. Thunderbitと従来ツールは、それぞれ誰向きですか?
Thunderbitは、手間をかけずに速く完全なURL一覧が欲しいマーケター、コンテンツ戦略担当、営業チーム、非技術系ユーザーに向いています。一方、従来ツールは、深いメタデータや独自スクリプトが必要な技術的監査に適しています。多くのチームは両方を使い分けており、速さと手軽さはThunderbit、詳細分析は従来ツール、という具合に役割を分けています。
Thunderbit AIウェブスクレイパーを無料で試す Get Started Free


