AIでドメイン内の全URLリストを抽出する方法

最終更新日 June 3, 2026
AIでドメイン内の全URLリストを抽出する方法

サイト全体のURLを一覧化する——言葉にすると単純そうですが、いざ手を動かすと、これがなかなか終わりません。メニューを開いては開き、リンクを一つずつスプレッドシートに貼り、気づけば半日が溶けている。コンテンツ監査、見込み客リスト作成、競合サイトの棚卸しなどでサイト内のページを洗い出す経験のある方なら、この地味なしんどさに覚えがあるはずです。手間がかかるうえ抜け漏れも起きやすく、せっかくのスキルと時間を消耗します。

ただ、いまはこのやり方を続ける必要はありません。Thunderbit のようなAI搭載ツールが、専門知識のない担当者でもドメイン内の全URLを取得する作業を数分で片付けられる時代だからです。AIスクレイピングを取り入れた企業からは、作業時間が30〜40%短縮できたという報告があり、手作業比で最大80%の削減に達した例もあります。これは数字の話にとどまらず、何時間、何日分もの時間が手元に戻るという意味なんです。

この記事では、サイト内の全ページを洗い出すのがなぜ難しいのか、GPT や Claude といった汎用AIではなぜ力不足なのか、そして Thunderbit のような専用AIエージェントがこの作業をどこまで楽にするのかを順に見ていきます。最後には、コードを書けない方でも必要なURLを取り出せる手順もご紹介します。

ドメイン内の全URLを取得するのが難しい理由

そもそもウェブサイトは、自分が抱えるページの全リストをきれいに差し出すようには作られていません。訪問者が読むためのものであって、一括でページ一覧を吸い出したい人向けではないのです。何がネックになるのか、整理してみましょう。

  • コピペの単純作業が延々と続く: メニューや一覧、ディレクトリを片っ端からクリックしてURLを一件ずつ写す作業は、手首にも精神にも負担が大きく、半分ほどのページを取りこぼす温床になります。
  • ページ送りと無限スクロール: コンテンツを複数ページに分けたり、スクロールに応じて後から読み込んだりするサイトは珍しくありません。「次へ」を一つ見落とすだけで、まるごと一区画が消えます。
  • ページごとにばらばらの構造: 同じサイトでも、ページによってリンクの並べ方やレイアウトがばらばら、ということがよくあります。これを人力で追うのは、正直しんどい話です。
  • 埋もれたページ・孤立したページ: すべてのページがメインメニューからたどれるわけではありません。サイトマップや内部検索からしか届かない、深く眠ったページもあります。
  • どうしても出るヒューマンエラー: 対象ページが増えるほど、URLの重複や打ち間違い、純粋な見落としが積み重なります。

image.png

数百、数千ページ規模のサイトともなれば、手作業という選択肢はもう成り立ちません。あるデータチームの言葉を借りれば、ごく小規模なケースを越えたら自動化に頼るしかないのです。

「サイト内の全ページを洗い出す」とはどういうことか

具体策に入る前に、何を集めようとしているのかを言葉にしておきましょう。

  • 内部URL: 同一ドメイン内のページを指すリンク(/about-us や /products/widget-123 など)です。コンテンツ監査、リード獲得、商品ウォッチといった業務では、たいていこれが主役になります。
  • 外部URL: 別サイトへ飛ぶリンクです。外部リンクそのものを一覧化したい場合を除けば、基本は対象外でかまいません。
  • 一覧ページと詳細ページ: 多くのサイトには、カテゴリ、ブログアーカイブ、ディレクトリといった「ハブ」となる一覧ページがあり、そこから商品やプロフィールなどの詳細ページへリンクが伸びています。本当にサイト内の全ページを集めるには、こうした一覧をたどり、その先の詳細ページまで一つずつ拾う必要があります。
  • 孤立ページ: どこからも明確にはリンクされていないページです。サイトマップや内部検索で偶然見つかっても、取りこぼしやすい存在です。

つまりドメイン内の全URLを取得するとは、トップページから一番奥の記事や商品ページまで、内部ページのURLをもれなく、できればスプレッドシートのように扱いやすい形でまとめることです。

ドメイン内の全URLを集める従来の手法

昔ながらのやり方もいくつかありますが、それぞれに固有の悩みがついて回ります。

手作業のコピペとブラウザ拡張

いわば力任せのアプローチです。リンクをひたすらクリックし、URLをコピーしてスプレッドシートに貼り、取りこぼしがないことを祈る。表示中のページのリンクをまとめて取れるブラウザ拡張もありますが、結局ページごとに同じ操作を繰り返すことになり、ページ送りや隠れた区画は自力で対処するしかありません。5ページ程度ならまだしも、それを超えると手に負えなくなります。

内部検索とサイトマップの活用

  • Google の site: 検索: 検索窓に site:yourdomain.com と入れれば、インデックス済みのページがいくつか出てきます。ただし表示されるのはインデックスされたものだけで、通常は1,000件あたりで打ち止めになります。新しいページ、隠れたページ、評価の低いページはこぼれ落ちる仕組みです。Google 自身のドキュメントも、これが万能の手段ではないと認めています。
  • XML サイトマップ: /sitemap.xml に主要URLをまとめているサイトは多く、内容が新しく網羅的なら頼れる味方になります。とはいえサイトマップ自体がないサイトもあり、複数ファイルに分割されている場合もあります。孤立ページが含まれないことも少なくありません。

技術系のクローラーとスクリプト

  • SEOツール(Screaming Frog など): 検索エンジンのようにサイトを巡回し、URL一覧を出力してくれます。頼もしい反面、初期設定や調整が必要で、大規模サイトでは有料ライセンスを求められることもあります。
  • Python スクリプト(Scrapy など): 開発者であれば、巡回と抽出を担うスクリプトを自作できます。ただ、コードに不慣れな人はこの時点で脱落ですし、サイトのレイアウトが変わるたびにスクリプトは壊れ、保守に追われ続けることになります。

まとめると: 従来の手法は、手間がかかりすぎるか、網羅性に欠けるか、技術的なハードルが高すぎるかのいずれかで、業務担当者にはどうにも噛み合いません。途中で投げ出す人が後を絶たないのも、無理のない話です。

汎用AIでURL抽出を完全自動化できない理由

「ChatGPT や Claude にサイトのページを全部探させればいいのでは」と思うかもしれません。私もそうであってほしかったのですが、現実はそう甘くありません。

  • リアルタイムで閲覧できない: GPT や Claude のような汎用AIは、実際にウェブを今この瞬間に巡回しているわけではありません。サイトの現状を「見て」いるのではなく、学習データや貼り付けられた情報をもとに答えを返しているだけです。
  • ウェブ操作ができない: プラグインや閲覧機能が付いていても、LLM は「次へ」を押したり、無限スクロールを扱ったり、サイト内のリンクを体系立ててたどったりはできません。
  • もっともらしい嘘を作る: 汎用AIにドメイン内の全URLを尋ねると、実在しないのにいかにもありそうなリンクを生成することがよくあります(/about-us が存在しないサイトに、それを勝手にこしらえる場面を何度も見てきました)。
  • 動的なコンテンツに弱い: JavaScript で中身を読み込むサイト、ログインが要るサイト、入り組んだナビゲーションを持つサイトは、汎用LLMには荷が重いのが実情です。

image 1.png

Rayobyte のガイドも、こう言い切っています。「数百、数千ページをスクレイピングしたいなら……ChatGPT だけでは力不足です」。この作業のために設計された専用ツールこそが必要なのです。

垂直型AIエージェントが本命である理由

ここで、SaaS や自動化の現場で積んできた経験が効いてきます。垂直型AIエージェント——つまりウェブデータ抽出のような特定領域に絞って作られたAI——だけが、業務で求められる信頼性とスケールを両立できる、というのが私の見立てです。理由はこうです。

  • 汎用LLMは文章作成や検索には長けていますが、もっともらしい嘘を出しやすく、企業が必要とする安定性で複数ステップの再現可能なフローを回すのは苦手です。
  • 業務向けSaaSは、繰り返し発生する定型タスクを大量に自動化することが求められます。 ここで真価を発揮するのが垂直型AIエージェントで、一つの仕事を高い精度でやり切るように設計されています。
  • 業界をまたいだ実例には事欠きません。 ウェブデータ抽出なら Thunderbit、ソフトウェア開発なら Devin AI、営業自動化なら Alta、教育分野では Infinity Learn の IL VISTA、人事なら Rippling、法務なら Harvey——数え上げればきりがありません。

要するに、サイト内の全ページを確実に押さえたいなら、汎用チャットボットではなく、その目的のために生まれた垂直型AIエージェントを選ぶべきなのです。

Thunderbit とは:誰でも扱えるAI搭載のURL抽出

AI を使ってあらゆるウェブサイトからデータを抽出 Get Started Free

そこで出番になるのが Thunderbit です。AIウェブスクレイパーの Chrome 拡張機能で、業務担当者が使うことを前提に設計されています。コードを書く必要も、込み入った設定もなく、ただ結果が返ってくる。どこが違うのか、見ていきましょう。

  • 自然言語で指示できる: 「このサイトのページURLを全部一覧にして」のように普段の言葉で伝えるだけで、Thunderbit のAIが抽出方法を組み立てます。
  • AIが項目を提案: Thunderbit がページを読み解き、「ページURL」のような列名を自動で提示します。CSSセレクタや XPath と格闘する必要はありません。
  • ページ送り・無限スクロールに対応: 「次へ」のクリックも、下までの自動スクロールも Thunderbit が引き受けるので、ページの取りこぼしが起きません。
  • 詳細ページへの掘り下げ: さらに深く取りたいときは、リンク先の詳細ページまでたどって、その中身も拾ってきます。
  • 構造化したまま書き出し: 取得結果は Google Sheets、Excel、Notion、Airtable、CSV へワンクリックで無料エクスポートできます。
  • コード不要: ウェブサイトを開いて見られるなら、それだけで Thunderbit は使えます。

しかも Thunderbit は垂直型AIエージェントなので、安定性と再現性を軸に作られています。同じ作業を何度も自動で回したい担当者には、ぴったりの選択肢です。

手順解説:Thunderbit でドメイン内の全URLを取得する方法

それでは実際の流れを見ていきましょう。ここでは、技術知識のない方でも必要なURLをまとめて取り出せる手順を順に説明します。

1. Thunderbit の Chrome 拡張機能を入れる

最初に Chrome ウェブストアから Thunderbit を入手 しましょう。Chrome、Edge、Brave など Chromium 系のブラウザで動きます。すぐ呼び出せるよう、ツールバーにピン留めしておくのがおすすめです。

Thunderbit を無料で試す

2. 対象の一覧ページやディレクトリを開く

URLを取り出したいサイトを開きます。トップページ、サイトマップ、ディレクトリ、あるいは目的のページへつながる一覧ページなら、どれでも出発点になります。

3. Thunderbit を立ち上げて項目を決める

Thunderbit のアイコンをクリックして拡張機能を開き、新しいスクレイパーのテンプレートを作りましょう。ここからが本番です。

  • 「AI Suggest Fields」を押します。 Thunderbit のAIがページを解析して列を提案するので、「Page URL」「Link」といった項目を探してください。
  • ちょうどいい項目が出てこなくても、「Page URL」という列を自分で足せば問題ありません(しっくりくる別の名前でも構いません)。Thunderbit のAIはこうした用語を理解するよう学習しており、適切なデータに結びつけてくれます。

4. 必要ならページ送りかスクロールをオンにする

対象ページが複数ページにまたがる場合(「1、2、3…」や「もっと見る」ボタンなど)は、Thunderbit でページ送りを有効にしましょう。

  • 「次へ」ボタンがあるサイトなら 「Click Pagination」、スクロールで追加読み込みされるサイトなら 「Infinite Scroll」 に切り替えます。
  • Thunderbit が「次へ」ボタンやスクロール領域の指定をうながすので、そこをクリックすれば、あとはAIが処理を進めます。

5. スクレイピングを実行して結果を見る

「Scrape」 ボタンを押します。Thunderbit が各ページを巡回し、見つけたURLをまとめて集めてくれます。結果は拡張機能内の表にその場で並んでいきます。大規模サイトでは数分かかることもありますが、手作業とは比べものにならない速さです。

6. URL一覧を書き出す

スクレイピングが終わったら Export をクリック。データは次の宛先へ直接送れます。

  • Google Sheets
  • Excel/CSV
  • Notion
  • Airtable

エクスポートは無料で、書式もそのまま保たれます。コピペに頭を悩ませる日々とはお別れです。

Thunderbit と他のURL抽出手段を比べる

方法使いやすさ精度と網羅性拡張性出力オプション
手作業のコピペつらい低い(見落としやすい)なし手動(Excel など)
ブラウザのリンク抽出ツール1ページなら可中程度低い手動
Google site: 検索簡単中程度(完全ではない)約1,000件で上限手動
XML サイトマップ簡単(あれば)良い(最新なら)良い手動/スクリプト
SEOツール(Screaming Frog など)技術的高い高い(有料)CSV、Excel
Python スクリプト(Scrapy など)非常に技術的高い高いカスタム
Thunderbitとても簡単非常に高い高いGoogle Sheets、CSV など

Thunderbit は、専用クローラーに匹敵する精度と拡張性を、ブラウザ拡張ならではの手軽さでまとめて届けてくれます。コードも設定もいらず、得られるのは結果だけです。

応用編:Thunderbit でURL以外も取り出す

下層ページスクレイピングについて学ぶ Get Started Free

ここからがおもしろいところです。Thunderbit はURL専用のツールではありません。次のような情報も取り出せます。

  • タイトル
  • メールアドレス
  • 電話番号
  • 画像
  • ページ上の構造化データ全般

image 2.png

たとえば見込み客リストを作るなら、ディレクトリの各エントリからプロフィールURL、氏名、メールアドレス、電話番号を一度の処理でまとめて取得できます。商品監査であれば、商品URL、商品名、価格、在庫状況を一気に抜き出せます。Thunderbit は下層ページスクレイピングにも対応しているので、リンク先を一つずつ開いて詳細情報を引き出すことも可能です。

おまけに、Thunderbit のメールアドレス抽出と電話番号抽出は完全無料です。営業やマーケティングのチームにとっては、これがなかなか大きな魅力なんです。

まとめ:AIでサイト内の全ページを洗い出すには

要点をおさらいしておきましょう。

  • ドメイン内の全URLを集めるのは、手作業や汎用ツールでは骨が折れます。
  • GPT のような汎用AIは、ウェブ操作もページ送りも動的コンテンツの処理もこなせません。
  • Thunderbit のような垂直型AIエージェントは、ウェブデータ抽出に特化して設計されており、安定して再現性が高く、業務担当者にも扱いやすい仕上がりです。
  • Thunderbit を使えば手順はシンプルです。 拡張機能を入れ、AIに項目を提案させ、ページ送りをオンにし、スクレイピングして書き出す。それだけで、コードも面倒も要りません。
  • URL以外も取り出せます。 タイトル、メールアドレス、電話番号など、リード獲得にも監査にも調査にもうってつけです。

リンクのコピペにうんざりしている方、技術系のクローラーに振り回されている方は、ぜひ一度 Thunderbit を試してみてください。無料プランがあるので、どれだけ時間と気力が浮くかを自分の目で確かめられます。

Amazon商品のスクレイピングデータをExcelに抽出する方法Google検索結果のスクレイピング など、Thunderbit の他の使い方が気になる方は、実践的なガイドやヒントを集めた Thunderbit ブログ ものぞいてみてください。

手作業のデータ収集に奪われた時間を、そろそろ取り戻しませんか。 ウェブデータ抽出のこれからを担うのは垂直型AIエージェントであり、Thunderbit はその最前線を走っています。次の監査も、リードリストも、リサーチも、いままでで一番ラクなものにしてみてください。

Thunderbit であらゆるウェブサイトからURLを抽出

さらに読む

追伸:1,000件のURLを手でコピペしたくなったときは、思い出してください。いまはそれを肩代わりしてくれるAIがあります。あなたの手首も、上司も、きっと喜んでくれるはずです。

AIウェブスクレイパーを試す Get Started Free

Topics
自動化ウェブスクレイピングツールAIウェブスクレイパー

Thunderbitを試す

リードやその他のデータをわずか2クリックで取得。AI搭載。

Thunderbitを入手 無料です
AIでデータを抽出
データをGoogle Sheets、Airtable、Notionへ簡単に転送
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week