GitHubで「tiktok scraper」と検索すると、339件のリポジトリが表示されます。一方、そのうち約48%は1年以上更新が止まっており、少なくとも4件はアーカイブ済みと明記されています。
スター数や知名度だけでは、現在の動作状況を判断できません。GitHubで最も★が多いTikTokスクレイパー drawrowfly/tiktok-scraper は、いまも5,000を超えるスターを集めていますが、Issueトラッカーには、#812:「このすごいツール、まだ動いてますか?」 や #824:「まだ動く?」 のように、出力がゼロだったという報告が残っています。
私はThunderbitで何か月もTikTokスクレイピング系リポジトリの状態を追ってきました。その観察では、TikTok側の変更によって短期間で動作しなくなり、修正されないリポジトリも少なくありません。本記事では、更新状況、Issue、認証・セッション要件を短時間で評価する方法を整理し、公式API、GitHubスクレイパー、ノーコードツールのどれを選ぶべきかを用途別に解説します。
GitHub上のTikTokスクレイパーが継続的な保守を必要とする理由
TikTokは、スクレイピングの難度が高い対象です。静的なEC商品ページやディレクトリ一覧とは異なり、エンドポイント、ボット対策のフィンガープリント、ページの描画方法、セッションやトークンの要件が頻繁に変わります。前回の変更から数週間で、既存の実装が動かなくなる場合もあります。
オープンソースのメンテナは、多くの場合ボランティアです。TikTok側の更新でリクエスト経路が使えなくなっても、修正まで数日から数週間かかったり、そのまま更新が止まったりすることがあります。これは個々のメンテナの問題というより、変更頻度の高いプラットフォームと、限られた時間で保守されるプロジェクトとの構造的な差によるものです。
そのため、TikTokスクレイパーを採用する際は、導入時の動作評価だけでなく、障害時の切り分け方法と代替手段もあらかじめ決めておく必要があります。
TikTokのボット対策:何を相手にしているのか
- レート制限。 TikTokの公式開発者ドキュメントには、承認済み連携にもリクエスト上限が明記されています。非公式スクレイパーでは、より早い段階で制限を受ける場合があります。
- Cookieとセッションのゲート。 davidteather/TikTok-Api のような最近のリポジトリは
ms_tokenを要求します。drawrowfly/tiktok-scraper のような古いものでは、例にtt_webid_v2が出てきます。Evil0ctal/Douyin_TikTok_Download_API はmsToken、ttwid、X-Bogus、A_Bogusをドキュメント化しています。これらは、リクエストが有効な閲覧セッションから送られたものかを判定する際に使われます。 - ブラウザフィンガープリント。 ScrapFlyのボット対策ガイドは、サイトがヘッダー、Cookie、TLSシグネチャ、JavaScript経由のブラウザ特性を実ユーザーの通信と照合する仕組みを説明しています。ブラウザフィンガープリントの解説では、Canvas、WebGL、WebRTC、フォント、ランタイムシグナルが取り上げられています。ブラウザ、Cookie、タイミング、ネットワークの情報に不整合があると、コンテンツが返る前にリクエストが拒否される場合があります。
- 行動検知。 TikTokスクレイピングに関するRedditのスレッドでは、新規のPlaywrightセッションでCAPTCHAが表示されるという報告があります。2025〜2026年のコミュニティ投稿では、IPの使い回しに加え、操作のタイミングやインタラクションも判定要素になり得ると指摘されています。
- 暗号化/署名付きリクエストパラメータ。 Evil0ctalは
X-BogusとA_Bogusを文書化しています。古いコミュニティのGistでも、URL署名やトークン生成が主要な論点でした。TikTokのブラウザやアプリと同様の署名を求める実装が、非公式ツールの保守を難しくしています。 - CAPTCHAと検証フロー。 TikTok専用CAPTCHAソルバーのリポジトリや、パズル認証についてのRedditスレッドからも、CAPTCHAへの対応が継続的な課題であることが分かります。
なぜオープンソースのメンテナは追いつけないのか
典型的には、スクレイパーの公開後に利用者が増え、TikTok側の変更で動作しなくなり、メンテナが修正するか、更新が止まるという経過をたどります。
この違いを確認できるリポジトリが2つあります。
- drawrowfly/tiktok-scraper はいまも5,052スター、889フォークを抱えていますが、最後のpushは2023年5月19日です。GitHubで最も★が多い「tiktok scraper」の完全一致リポジトリですが、現在の実運用候補というより、過去の実装を参照するための資料として見るのが適切です。
- davidteather/TikTok-Api は、6,301スター、1,177フォーク、最後のpushは2026年4月1日です。リリース履歴には、2025年4月、7月、10月、2026年4月の更新があり、ユーザー動画の取得やプロキシ/セッション制御の修正も含まれています。ただし、この比較的活発なプロジェクトでも、TikTokによるリクエストのブロックに対応するため、プロキシ、Playwright、独自のセッションロジックが必要になる場合があると案内しています。
判断の目安は次のとおりです。
- 更新が長期間止まったTikTokスクレイパーは、現行環境で動作しない可能性が高くなります。
- 更新が続くスクレイパーでも、TikTok側の変更によって一時的に動作しなくなる場合があります。
- 実用性を判断する際は、スター数だけでなく、最近の修正状況とIssueへの対応を確認する必要があります。
60秒でできるリポジトリ健全性チェック:TikTokスクレイパーをどう見極めるか
リポジトリをクローンする前に、次の項目を初期判断の目安として確認します。短時間で、明らかに更新が止まっている候補や、用途が合わない候補を除外できます。
| サイン | 🟢 健全性が高い | 🟡 追加検証が必要 | 🔴 現行利用には不向き |
|---|---|---|---|
| 最後の意味のあるpush | 3か月以内 | 3〜12か月前 | 12か月以上前 |
| Open issue数 | 少なく、最近のIssueには回答あり | Issueが増えており、メンテナ対応は一部のみ | 「壊れた/ブロックされた/動かない」という未回答報告が多い |
| 最近のユーザー苦情 | 主にセットアップ質問 | セットアップと不具合報告が混在 | 「出力ゼロ」「403」「まだ動く?」が繰り返される |
| 現在の認証/セッションモデル | セッション/Cookieの流れが文書化されている | トークン依存だが文書あり | 古いWebエンドポイントに依存し、現在の認証ガイドがない |
| インストールのしやすさ | 再現可能で、検証済みのセットアップ | 手動手順がいくつかある | 古い依存関係、現代的なセットアップ説明なし |
| CI/テスト | テストがあり、最新である | テストはあるがカバレッジが不明 | テストなし、またはActionsが古い |
| データ範囲の適合 | 実際の用途に合っている | 用途の一部しか対応しない | そもそも別問題を解いている |
各サインを60秒以内で確認する手順
- 最後のpush日時:GitHubのリポジトリヘッダーを見ます。「last pushed 2 years ago」と表示されている場合は、現行環境での動作報告を優先して調べます。
- Open issues:Issuesタブを開き、直近のタイトルを確認します。
not working、403、blocked、captcha、zero outputを検索します。 - ユーザー苦情:上位5件のOpen issueに動作不能の報告が集中している場合は、導入前に再現テストが必要です。
- 認証/セッションモデル:READMEを開きます。
ms_token、Playwrightの設定、プロキシの注意など、現在の案内があるか確認します。READMEが2023年のエンドポイントを参照している場合は、最近のIssueやリリースも調べます。 - インストールのしやすさ:requirementsファイル、Docker対応、明確なセットアップ手順があるかを見ます。READMEが「npm install」だけで、最後にテストされたNodeが14なら、現在の環境で再現できるかを検証します。
- CI/テスト:Actionsタブを見ます。テストが失敗している、またはテスト自体がない場合は、自分の用途に近いサンプルで動作を確かめます。
- データ範囲:必要なデータ型(プロフィール、動画メタデータ、コメント、ハッシュタグ)が明記されているかを見ます。動画ダウンロードだけに対応し、構造化データ抽出には対応していないリポジトリもあります。
利用を見送る判断材料となるレッドフラッグ
- リポジトリがアーカイブされている。
- READMEに「no longer maintained」とある。
- 最後のコミットが、2年以上前のTikTok APIバージョンを参照している。
- Issueに「動かない」という報告が多く、メンテナから何か月も反応がない。
- スター数は多い一方で、最近のフォークやプルリクエストがない。
Issuesタブで is:issue is:open "not working" または is:issue is:open "403" を検索します。最近の報告が多数見つかる場合は、そのリポジトリを採用する前に、現在の環境で再現テストを行う必要があります。
人気のTikTokスクレイパーGitHubリポジトリ:稼働状況の比較(2026年)

GitHubで「tiktok scraper」と検索したときに見つかる主なリポジトリを、更新状況、Issue、利用条件、保守負荷の観点から比較しました。
| リポジトリ | 最後のpush | スター数 | Open issues | 判定 | 補足 |
|---|---|---|---|---|---|
| drawrowfly/tiktok-scraper | 2023-05-19 | 5,052 | 58 | 🔴 現行利用には不向き/参考用 | まだ有名だが、2026年の実運用には古すぎる |
| davidteather/TikTok-Api | 2026-04-01 | 6,301 | 134 | 🟡 更新継続中だが保守負荷が高い | OSSとして最有力の候補。Playwright、トークン、しばしばプロキシを前提にする |
| scrapfly/scrapfly-scrapers/tiktok-scraper | 2026-04-21 | 938(親リポジトリ) | 約0(モノレポ) | 🟡 更新継続中だが純粋なOSSではない | 現在も使えるが、ScrapFlyのAPIキーが必要 |
| Evil0ctal/Douyin_TikTok_Download_API | 2025-10-12 | 17,397 | 135 | 🟡 更新継続中で機能は広いが複雑 | 機能豊富なマルチプラットフォームプロジェクト。上級者向けプラットフォームに近い |
| naseif/tiktok-scraper | 2024-07-26 | 107 | 13 | 🟡 追加検証が必要 | ユーザー情報やハッシュタグ処理に関する不満が出ている小規模リポジトリ |
| loewehancara1rmyv/Tiktok-scraper | 2026-01-12 | 4 | 0 | 🔴 利用実績が不足 | コミュニティで実証されたものではなく、見本用のリポジトリ |
drawrowfly/tiktok-scraper
長らく、このTypeScript製スクレイパー/ダウンローダーは「tiktok scraper github」の代表的な選択肢でした。ユーザー、トレンド、ハッシュタグ、音楽フィードを扱えました。2026年のいまは、現行運用に採用するより、過去の実装を参照する用途に向いています。最後のpushは2023年5月で、Issueキューには2023〜2025年の未解決の 「まだ動いている?」 と 「出力ゼロ」 の報告が残っています。導入を検討する場合は、スター数ではなく、現在の環境での再現結果を判断材料にしてください。
davidteather/TikTok-Api
2026年のいまも、今回確認したオープンソースのTikTokデータ用ラッパーの中では、もっとも信頼できる候補です。更新が続いており、最近のリリースもあります。Playwrightのセットアップ、非同期利用、トークン処理、プロキシ対応、セッション復旧も文書化されています。
ただし、クローン直後から設定なしで使えるツールではありません。READMEには EmptyResponseException は通常TikTokによるブロックを意味すると書かれており、議論履歴には ms_token、コメント取得、KeyError: 'ItemModule'、エンドポイント固有の失敗に関する相談があります。更新状況は比較的良好ですが、開発者による継続的な保守を前提とする候補です。
その他の注目リポジトリ
- scrapfly/scrapfly-scrapers/tiktok-scraper:更新が続いており、技術的な参考になります。ただし、READMEでは
SCRAPFLY_KEYが必要とされています。管理型スクレイピング基盤向けのコード例であり、無料の単体ツールとは利用条件が異なります。 - Evil0ctal/Douyin_TikTok_Download_API:TikTokとDouyinの両方をカバーし、署名ロジック(
X-Bogus、A_Bogus、msToken)を文書化しています。コメント、フォロワー、プレイリストなどにも対応します。技術的な難度が高く、有料APIへの参照も含まれます。Issueトラッカーには2026年時点でも、動画リンクやユーザー情報エンドポイントに関する不具合報告があります。機能範囲を重視し、自分で保守できる開発者向けの候補です。 - naseif/tiktok-scraper:小規模なリポジトリで、公開された不具合報告もあります。本番利用を検討する場合は、必要なデータ範囲で事前検証が必要です。
- loewehancara1rmyv/Tiktok-scraper:スター4、Issue0で、コミュニティでの利用実績はまだ限られています。紹介記事だけで判断せず、コード、更新履歴、出力結果を検証する必要があります。
TikTok公式API vs GitHubスクレイパー vs ノーコードツール:選び方のフレームワーク

TikTokデータの取得方法は、申請資格、必要なデータ範囲、保守を担当できる人材、利用規約への対応によって選択肢が変わります。次の表で3つの方法を同じ観点から比較します。
| 要素 | TikTok Research API | GitHubスクレイパー | ノーコードツール(例:Thunderbit) |
|---|---|---|---|
| アクセスの壁 | 学術/業務用途の申請が必要。承認まで約4週間 | Git clone+セットアップ | ブラウザ拡張のインストール |
| データ範囲 | 承認済みエンドポイントのみ(アカウント、動画、コメント、ショップ) | 広い(プロフィール、動画、コメント、ハッシュタグ、ショップ) | 画面上で見えるデータ(プロフィール、動画、エンゲージメント、ハッシュタグ) |
| 保守負荷 | API仕様と認証要件の変更確認が必要 | 高い(TikTok更新で壊れやすい) | 提供側の更新対応に依存し、対象ページごとの検証が必要 |
| 利用条件・ブロックの注意 | 承認範囲とAPI利用条件に従う | 規約、アクセス制限、ブロックへの対応が必要 | ブラウザベースでも規約、アクセス頻度、表示範囲の確認が必要 |
| コスト | 無料(承認されれば) | 無料(ただし時間コストが大きい) | 無料プランあり;月額15ドルからのクレジット制プラン |
| コーディングの必要性 | あり(Python/R) | あり(Python/Node.js) | なし |
| 向いている対象 | 申請資格を満たす研究者、学術機関、承認済み組織 | 保守を継続できる開発者 | 画面上のデータをノーコードで表にしたいマーケター、営業、オペレーション担当者 |
TikTok Research APIが向いているケース
申請条件を満たす場合は、TikTokのResearch APIが公式の選択肢になります。米国、欧州、ブラジルの対象研究者は、公開コンテンツとアカウントデータの調査を申請できます。利用できるデータカテゴリには、アカウント、フォロワー/フォロー中、いいね済み動画、固定動画、再投稿動画、コンテンツ、コメント、ショップが含まれます。コードブックでは、video_description、view_count、like_count、comment_count、share_count といった項目や、コメントレベルの text、reply_count、create_time などのフィールドが公開されています。
ただし、対象は学術機関、特定地域の適格な非営利/独立研究者、さらにEUのDSAプロセスで認定された研究者に限られます。申請資格を満たさないチームや、短期間で運用データを必要とする代理店には適合しません。
TikTokにはCommercial Content APIもあり、広告や広告主コンテンツのデータに使えます。透明性調査には利用できますが、一般的なスクレイピング用途とは目的が異なります。
それでもGitHubスクレイパーが向いているケース
公式APIの承認範囲外にある公開データが必要で、実装と継続保守を自分で担当できる開発者には、GitHubスクレイパーが候補になります。たとえば、表示されているプロフィールグリッド、ハッシュタグ、コメント、プレイリスト、動画メタデータを自社のパイプラインに取り込みたい場合です。リポジトリをフォークし、仕様変更に合わせて修正できることが前提になります。
導入時だけでなく、継続的な保守工数も見積もる必要があります。2026年でもっとも信頼性が高い部類の davidteather/TikTok-Api でさえ、Playwright、Cookie/トークン、プロキシ、独自のページ/セッション生成が必要になる場合があると案内しています。
Thunderbitのようなノーコードツールが向いているケース
AIでTikTokデータを抽出 Get Started Free
開発環境の構築やGitHubリポジトリの継続保守を避けたいチームでは、ブラウザベースのAIツールが候補になります。
私たちは Thunderbit を、Chrome拡張として動くAIウェブスクレイパーとして作りました。TikTok上では、表示されているページ(プロフィール、動画、ハッシュタグ、検索結果)を読み取り、「AIで項目を提案」で列を提案し、「スクレイプ」を押して構造化データを取得する流れです。TikTokスクレイパーツールページ では、投稿日、動画の長さ、いいね数、シェア数、保存数、コメント数、閲覧数、ハッシュタグなどの項目を案内しています。画像スクレイパーテンプレート では、投稿サムネイル、URL、キャプション、作成者ハンドル、エンゲージメント指標をプロフィールページから集める方法を示しています。ハッシュタグスクレイパーテンプレート では、動画URL、作成者ユーザー名、説明文、投稿時刻、閲覧数、いいね数、コメント数、シェア数、音源、カバー画像URLを扱います。
サブページスクレイピングを使えば、プロフィール一覧から各動画ページへ進み、表示されるエンゲージメント指標、キャプション、ハッシュタグを追加できます。インフルエンサーデータベースの作成や競合コンテンツ監査など、非開発者がWeb上の情報を表にまとめたい場面に向いています。
GitHubスクレイパーと比べると、ローカル依存関係の調整やコード保守を減らしやすく、AIがレイアウト変更への対応を支援します。Googleスプレッドシート、Excel、Airtable、Notion、CSV、JSONへのエクスポートは無料です。ただし、取得できる項目はページの表示状態やアクセス条件によって変わるため、まず1ページで抽出結果と出力形式を検証してください。対象サイトの利用規約とデータの利用目的も事前に見直す必要があります。
TikTokスクレイパーのインストール時によくある5つの問題と切り分け方
TikTokスクレイパーの導入では、実行環境、依存関係、ブラウザ設定などが原因でインストールに失敗することがあります。ここでは、代表的な5つの原因と切り分け方を整理します。
Node.jsのバージョン衝突
問題: 古いTikTokスクレイパーの多く(とくに drawrowfly/tiktok-scraper)は Node.js 14〜16 向けに作られています。Node 20以降で動かすと、npm install が静かに失敗したり、互換性のないバイナリを吐いたりします。
解決策: nvm(Node Version Manager)で適切なバージョンを入れて切り替えます。
nvm install 16
nvm use 16
npm install
リポジトリがNodeのバージョンを明記していないなら、package.json の engines フィールドを見るか、CI設定を確認してください。
Python依存関係の問題とPlaywrightのセットアップ
問題: davidteather/TikTok-Api は Python 3.9以上 と、特定のブラウザバイナリを伴うPlaywrightを必要とします。「browser not found」や依存関係の衝突といったエラーに当たる人が多いです。
解決策: 必ず仮想環境を使い、そのうえでPlaywrightのブラウザを明示的に入れます。
python -m venv .venv
source .venv/bin/activate # Windowsでは: .venv\Scripts\activate
pip install TikTokApi
python -m playwright install
playwright install が失敗するなら、OSのパッケージマネージャで不足しているシステム依存関係(Ubuntuなら libnss3 など)を確認してください。
Linux/Ubuntuの権限エラー
問題: sudo pip install を使うとシステムのPython環境が壊れ、依存関係の問題が連鎖します。
解決策: sudo pip install は避け、先に仮想環境を作ります。
python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
これで、スクレイパーの依存関係をシステムPythonから切り離せます。
Windowsのパスとエンコーディングの問題
問題: WindowsのCMDでは、文字エンコーディングやパス長の影響で、スクレイパーのインストールに失敗する場合があります。Playwrightがブラウザバイナリを深い階層へダウンロードする構成では、特に切り分けが必要です。
解決策: CMDで解決しない場合は、WSL(Windows Subsystem for Linux)またはGit Bashを比較します。WSLを導入する場合は、次のコマンドを使用します。
wsl --install
WSLインストール後の手順
インストールが完了したらWSLターミナルを開き、対象リポジトリのLinux向けセットアップ手順に従います。
Dockerで依存関係を分離する
問題: ホストOS上のPython、ブラウザ、システムライブラリの組み合わせによって、環境差分が発生することがあります。
解決策: Dockerに慣れている場合は、スクレイパー環境をコンテナ化できます。PythonベースのTikTokスクレイパー向けの基本的なDockerfileは次のとおりです。
FROM python:3.11-slim
RUN apt-get update && apt-get install -y libnss3 libatk-bridge2.0-0 libdrm2 libxcomposite1 libxdamage1 libxrandr2 libgbm1 libasound2
RUN pip install TikTokApi playwright && python -m playwright install --with-deps chromium
WORKDIR /app
COPY . .
CMD ["python", "scrape.py"]
コンテナ化すると、使用するランタイムと依存関係を固定しやすくなります。Dockerでは動作し、ホストOS上では失敗する場合は、環境差分を優先して調べます。
トラブルシューティングの流れ:
- リポジトリ自身のサンプルは成功するか? → 失敗するなら実行時バージョンを確認。
- 実行時バージョンは正しいか? → ブラウザ/Playwrightのインストールを確認。
- ブラウザは入っているか? → トークン/Cookieを確認。
- トークン/Cookieは有効か? → TikTokがセッションをブロックしていないか確認。
- すべて確認しても失敗する場合 → リポジトリ側の不具合報告を調べ、別のツールも比較する。
TikTokスクレイピング時のアクセス負荷とブロック対策
TikTokスクレイピングでは、アカウント制限やアクセス拒否に関する相談が多く見られます。ただし、技術的に検知を避けられることと、利用規約上許可されていることは別の問題です。ここでは、各手法の費用と注意点を整理します。

| 対策 | 難易度 | 費用 | 注意点 |
|---|---|---|---|
| ランダムなリクエスト遅延(2〜8秒のジッター) | 簡単 | 無料 | アクセス負荷を抑える一助になるが、許可や成功を保証しない |
| セッション/Cookieのローテーション | 中 | 無料 | 認証条件と利用規約を確認し、無許可の回避に使わない |
| ログアウト状態の公開ページだけを対象にする | 簡単 | 無料 | 公開表示されていても取得・再利用が許可されるとは限らない |
robots.txt とレート制限ヘッダーを尊重する | 簡単 | 無料 | 最低限の運用条件であり、利用規約の代替にはならない |
| ヘッドレスブラウザのフィンガープリントをランダム化する(Playwright) | 中 | 無料 | 検知回避を目的とする利用は規約に抵触する可能性がある |
| TikTokのモバイルAPIエンドポイントを使う(検知されにくい) | 難しい | 無料 | 非公開・未承認のエンドポイントは仕様変更と規約上のリスクが高い |
| 住宅用プロキシのローテーション | 中 | 月20〜100ドル | 費用に加え、アクセス許可、提供元、個人情報の扱いを審査する必要がある |
アクセス負荷を抑える基本的な運用
ランダムなリクエスト遅延。 リクエストを短い間隔で連続送信せず、各リクエストの間に2〜8秒のランダムな間隔を入れます。これはアクセス負荷を抑えるための一例であり、ブロックを回避できる保証はありません。
import time, random
time.sleep(random.uniform(2, 8))
セッションとCookieの再利用。 リクエストごとに新しいセッションを起動するのではなく、許可された範囲でCookieとセッション状態を再利用します。最近のリポジトリが stateless なスクレイピングを約束せず、ms_token を求める背景には、セッション要件があります。
ログアウト状態の公開ページを取得する。 TikTok-Apiは明示的に ユーザー認証済みルートをサポートせず、ログアウト時に見えるデータでのみ動くとしています。ただし、公開表示されていることだけで、自動取得や二次利用が許可されるとは限りません。
robots.txt を尊重する。 TikTokの現在のrobots.txt は多くのエージェントをブロックし、一般的なクロールで許可されるパスを限定しています。robots.txtへの準拠に加え、利用規約、アクセス頻度、データの利用目的も別途検討する必要があります。
中級手法を採用する前の注意点
ヘッドレスブラウザのフィンガープリントをランダム化する。 Playwrightでは、ビューポート、User-Agent、タイムゾーン、ロケールを変更できます。ただし、検知回避を目的として実ユーザーを装う運用は、対象サービスの利用規約やアクセス制限に抵触する可能性があります。採用前に、許可された検証環境かどうかを確認する必要があります。
TikTokのモバイルAPIエンドポイントを使う。 コミュニティでは、Webフロントエンド以外のエンドポイントに関する報告もありますが、文書が少なく、仕様変更の影響を受けやすい手法です。公式に提供・承認されたAPIでない場合は、安定性だけでなく利用条件も確認し、無許可のアクセスには使用しないでください。
プロキシが必要になる場面と、比較的手頃な選択肢
取得規模が大きくなり、無料の手法だけでは足りない場合、大量のTikTokスクレイピングでは、住宅用またはモバイル用プロキシをリクエストごとにローテーションする方法が選択肢になります。ここで特定の有料プロキシサービスを推すことはしませんが、一般論としては、データセンタープロキシより住宅用またはモバイル用のプロキシプールを比較対象にし、必要な規模、ローテーション方式、提供元、費用、個人情報の扱いを見比べます。どの方式でも、TikTokの利用規約やアクセス制限への対応が不要になるわけではありません。
一方、Thunderbit のようなブラウザベースのツールは、利用者のブラウザセッション内で動くため、別途プロキシ基盤を構築せず、数十〜数百ページ規模の一般的なマーケティング調査から始めたい場合に向いています。ただし、数百万ページ規模の取得や、検知・制限の回避を保証するものではありません。対象ページで取得精度とアクセス状況を検証し、より大規模または継続的な取得が必要なら、プロキシ構成も含めて選ぶのが現実的です。
TikTokスクレイパーで取得できる主なデータ例
ツールを比較する際は、必要なデータ項目に対応しているかを先に確認します。以下に、ソースドキュメントに基づく代表的なフィールド構成を示します。
プロフィールデータ
| ユーザー名 | 表示名 | フォロワー数 | フォロー数 | 総いいね数 | 自己紹介 | 認証済み | プロフィールURL |
|---|---|---|---|---|---|---|---|
| @examplecreator | Jane Doe | 1,240,000 | 312 | 48,700,000 | "料理+コメディ 🍳" | ✅ | tiktok.com/@examplecreator |
| @travelwithmark | Mark S. | 890,000 | 150 | 22,100,000 | "旅のVlogger 🌍" | ❌ | tiktok.com/@travelwithmark |
| @fitnessmaya | Maya L. | 2,100,000 | 88 | 91,300,000 | "ワークアウトとウェルネス" | ✅ | tiktok.com/@fitnessmaya |
取得元: GitHubスクレイパー(TikTok-Api、Evil0ctal)、Research API、Thunderbit(表示されているプロフィールページから)。
動画メタデータ
| 動画URL | キャプション | 閲覧数 | いいね数 | コメント数 | シェア数 | 音楽 | ハッシュタグ | 投稿日 | 長さ |
|---|---|---|---|---|---|---|---|---|---|
| tiktok.com/@ex/video/123 | "史上最高のパスタのコツ 🍝" | 4,200,000 | 312,000 | 8,400 | 21,000 | "Italian Vibes – DJ Marco" | #pasta #cooking #hack | 2026-03-15 | 0:42 |
| tiktok.com/@ex/video/456 | "POV:猫に見下されるあなた" | 9,100,000 | 1,100,000 | 23,000 | 55,000 | "Original Sound" | #cat #pov #funny | 2026-04-01 | 0:18 |
| tiktok.com/@ex/video/789 | "誰も求めていない朝のルーティン" | 1,800,000 | 98,000 | 3,200 | 7,500 | "Chill Morning – LoFi" | #routine #morning | 2026-04-10 | 1:02 |
取得元: GitHubスクレイパー(TikTok-Api、Evil0ctal)、Research API(video_description、view_count、like_count、comment_count、share_count、music_id、hashtag_names、video_duration など)、Thunderbit(動画レベルの項目)。
コメントデータ
| 投稿者 | コメント本文 | いいね数 | タイムスタンプ | 返信数 |
|---|---|---|---|---|
| @user_abc | "これを試したら本当に動いた 😂" | 1,200 | 2026-03-16T08:12:00Z | 14 |
| @chef_dan | "次はガーリックを足して、信じていい" | 890 | 2026-03-16T09:45:00Z | 7 |
| @randomfan99 | "こういうコンテンツを見に来たんだ" | 340 | 2026-03-16T11:30:00Z | 2 |
取得元: GitHubスクレイパー(TikTok-Api、Evil0ctal)、Research API(text、like_count、reply_count、create_time など)、Thunderbit(表示されているコメント欄から)。
ハッシュタグと検索データ
| ハッシュタグ | 上位動画URL | 総閲覧数 | トレンド中 |
|---|---|---|---|
| #pasta | tiktok.com/@ex/video/123 | 4,200,000 | はい |
| #cooking | tiktok.com/@chef/video/321 | 11,000,000 | はい |
| #hack | tiktok.com/@tips/video/654 | 2,900,000 | いいえ |
取得元: GitHubスクレイパー(リポジトリによって異なる)、Thunderbit(ハッシュタグスクレイパーテンプレート)。
注意:1つのリポジトリですべての項目が常に取れるわけではありません。TikTokのレスポンス構造は変わり続けており、メンテナ自身もそれを警告しています。ここでの例は、あくまで代表例として見てください。
Thunderbitで2クリックでTikTokデータを抽出する方法(ステップごと)
GitHubリポジトリの環境構築や保守を避けたい場合は、次の手順でノーコードの方法を試せます。
- Thunderbit Chrome拡張機能 をインストールします。
- 抽出したいTikTokページへ移動します — プロフィール、検索結果ページ、ハッシュタグページ、個別動画など、ブラウザ上で表示できるページを開きます。
- 「AIで項目を提案」をクリックします。 ThunderbitのAIがページを読み取り、ユーザー名、フォロワー数、動画キャプション、いいね数、ハッシュタグなどの列を提案します。
- 必要なら項目を調整してから、「スクレイプ」をクリックします。 データが構造化された表に入ります。
- サブページスクレイピングでデータを補完します。 プロフィール一覧から各動画を開き、ページ上に表示されるキャプション、音楽情報、コメント数、シェア数などを追加します。
- Googleスプレッドシート、Excel、Airtable、Notionへエクスポート — すべて無料です。
ローカルの依存関係やコードを管理せずに始められ、AIがレイアウト変更への対応を支援します。まず1ページで提案された列、抽出精度、出力形式を検証してから、サブページや複数ページへ範囲を広げてください。
サブページスクレイピングでTikTokデータを広げる
プロフィールやハッシュタグページから動画一覧を取得した後、「サブページをスクレイプ」を使うと、各動画ページに表示される追加項目を表へ加えられます。インフルエンサーデータベースの作成や競合コンテンツ監査で、動画単位のエンゲージメント情報をまとめたい場合に向いています。対象ページ数を増やす前に、必要な列が取得できるかを数ページで検証してください。
TikTokデータのエクスポートと活用
Thunderbitは、利用中のプランで対応している範囲内で、Googleスプレッドシート、Excel、Airtable、Notion、CSV、JSON へ無料でエクスポートできます。よくある活用例は次のとおりです。
- データをスプレッドシートに入れてエンゲージメント分析をする。
- Airtableに送って、CRM風のインフルエンサートラッカーを作る。
- Notionに入れて、チームでコンテンツ調査を共同作業する。
出力先は、その後の分析方法やチームの共同作業に合わせて選びます。まずサンプルデータを出力し、列構成やデータ型が後続作業に合うかを確かめてから運用範囲を広げるとスムーズです。
ThunderbitがWebデータ抽出をどう扱うのかをもっと知りたいなら、ウェブスクレイピング入門ガイド を読むか、ThunderbitのYouTubeチャンネル のチュートリアルをご覧ください。
TikTokの利用規約とスクレイピングで確認すべき事項
TikTokのスクレイピングに関するプライバシーブログ では、利用規約が情報収集や無許可でのサービス操作を行う自動スクリプトを禁じ、アクセス制限の回避も禁じていると説明されています。TikTokのコミュニティガイドラインでも、自動スクリプトやWebクロールを使った不正な情報取得が禁止対象として示されています。
実務では、少なくとも次の点を検討する必要があります。
- 公開範囲と利用許可を分けて考える。 公開されているコンテンツでも、自動取得や二次利用が許可されるとは限りません。ログイン必須・非公開コンテンツは対象にしないでください。
- アクセス頻度を管理する。 レート制限を守り、TikTokのサーバーへ過度な負荷をかけないようにします。
- データ保護法を順守する。 個人データを収集、保存、分析する場合は、改正個人情報保護法、GDPR、CCPAなど、適用される法令を確認します。
- 対象ならResearch APIを使う。 申請資格を満たす場合は、承認された範囲で公式APIを利用する方法を優先します。
- これは法律相談ではありません。 取得するデータ、利用目的、対象地域によって判断が変わるため、個別の状況は専門家に相談してください。
法的な全体像については、Webスクレイピングの法的論点 のガイドもご覧ください。
TikTokスクレイパーのGitHubリポジトリが使えない場合の選択肢
判断の順序は次のとおりです。
- GitHubのTikTokスクレイパーをクローンする前に、60秒のリポジトリ健全性チェックを実行する。 更新が止まっている候補や、現在の環境に合わない候補を先に除外します。
- 選択肢を用途別に比較する。 公式API、GitHubスクレイパー、ノーコードツールは、申請資格、必要なデータ、保守能力によって向き不向きが異なります。
- GitHub路線を選ぶ場合は、 インストールの切り分け、仕様変更への対応、継続的な保守に必要な時間を見積もります。
- 必要な出力項目を先に決める。 スター数だけでなく、プロフィール、動画、コメント、ハッシュタグなど、必要なデータを取得できるかを検証します。
- 開発環境を保守しない場合は、 Thunderbit のようなノーコードツールも候補に入れます。まず1ページで、2クリックの操作フロー、構造化結果、エクスポート形式が用途に合うかを試します。
重要なのは、スクレイパーの保守に使える時間と、必要なデータの範囲を分けて考えることです。候補を絞ったら、小規模な取得で精度、運用負荷、利用条件を比較してから採用方法を決めてください。
よくある質問
2026年でもGitHubで動くTikTokスクレイパーはありますか?
ありますが、現在も保守されている候補は限られます。davidteather/TikTok-Api は、2026年4月時点でメンテナンスが続いており、今回確認したオープンソース候補の中では最も信頼できる選択肢です。Evil0ctal/Douyin_TikTok_Download_API も更新されていますが、構成はより複雑です。最もスターの多い drawrowfly/tiktok-scraper は2023年5月以降更新がありません。どの候補でも、導入前に更新履歴、最近のIssue、必要なデータ項目を確認し、現在の環境で再現テストを行ってください。
TikTokをスクレイピングするのは合法ですか?
TikTokの利用規約では、自動スクレイピングやアクセス制限の回避が禁止されています。一方、公開データの取得に関する法的評価は、法域、取得方法、データの種類、利用目的によって異なります。対象研究者であれば、公式のResearch APIを承認範囲内で利用する方法があります。公開データを扱う場合も、アクセス条件とレート制限を守り、GDPR、CCPAなど適用される法令を確認してください。これは法律相談ではありません。個別事情は専門家に相談してください。
コーディングなしでTikTokをスクレイピングできますか?
はい。Thunderbit のようなブラウザベースのAIツールを使うと、コードを書かずに、ページ上に表示されるプロフィール、動画メタデータ、ハッシュタグ、エンゲージメント指標を構造化できます。TikTok Research APIは、承認された申請者が公式のデータへアクセスする方法ですが、利用にはAPI操作が必要です。非開発者が環境構築と継続保守を減らしたい場合は、ノーコードツールが比較候補になります。
TikTokスクレイパーでどんなデータが取れますか?
代表的なデータ型には、プロフィール情報(ユーザー名、フォロワー数、自己紹介、認証済みかどうか)、動画メタデータ(キャプション、閲覧数、いいね数、コメント数、シェア数、音楽、ハッシュタグ、長さ、投稿日)、コメント(本文、いいね数、タイムスタンプ、返信)、ハッシュタグ/検索データ(上位動画、総閲覧数、トレンド中かどうか)があります。実際に取れる項目はツールと方法で変わります。詳しくは上の出力例セクションを参照してください。
なぜ私のTikTokスクレイパーはいつもブロックされるのですか?
TikTokは、レート制限、Cookie/セッションのゲート、ブラウザフィンガープリント、行動検知、暗号化されたリクエストパラメータ、CAPTCHAフローなど、複数の仕組みでアクセスを制御しています。短時間に多数のリクエストを送る、新しいセッションを繰り返し作る、通常と異なるブラウザ設定やネットワークを使うと、制限を受ける場合があります。まずリクエスト頻度、セッション設定、エラーログを調べ、対象サービスの利用規約と許可範囲を見直してください。上のボット対策セクションでは、各手法の技術的な注意点とコンプライアンス上の境界を整理しています。


