在 GitHub 上搜尋「tiktok scraper」,會跳出 339 個儲存庫。大概有 48% 在一年多以前就沒再更新,至少還有 4 個明確標示為 archived。
如果你曾經複製過某個熱門的 TikTok 爬蟲 repo,花了一個小時跟各種依賴套件硬碰硬,最後卻完全沒有任何輸出——你真的不是唯一一個。GitHub 上星標最高的 TikTok 爬蟲 drawrowfly/tiktok-scraper,到現在還有超過 5,000 顆星;但它的 issue 區卻滿是像 #812:「這個很棒的工具還能用嗎?」 和 #824:「現在還能運作嗎?」 這類討論,而且兩個都回報沒有任何輸出。過去幾個月,我在 Thunderbit 持續追蹤 TikTok 爬蟲 repo 的現況,結論非常清楚:這些工具壞得很快,而且大多數都沒人修。這篇文章就是我當初開始評估這些 repo 時,希望有人能寫給我的實戰生存指南。我們會一起看看哪些還活著、哪些已經死透、還能怎麼替代,以及怎麼別再把時間浪費在那些在你找到它之前就已經壞掉的程式碼上。
為什麼 GitHub 上大多數 TikTok 爬蟲都會壞,而且一直壞下去
TikTok 並不是一般的爬取目標。它的網頁端一直在改。跟靜態的電商商品頁或目錄清單不同,TikTok 會輪換端點、更新反機器人指紋辨識、改變頁面渲染方式,還會加入新的 session / token 要求——有時候甚至在上一次變更後幾週內又改一次。
開源維護者多半是志工。當 TikTok 推出更新、讓爬蟲的請求路徑失效時,repo 可能會壞好幾天、好幾週,甚至直接停擺。這不是在怪維護者,而是快節奏、資源充足的平台,和有正職工作的無償開發者之間,本來就存在結構性落差。
就算是最好的 TikTok 爬蟲 repo,通常也只是卡在「壞掉→修復→再壞掉」的循環。只要你打算使用,就一定要有一套評估、排錯,還有備援方案。
TikTok 的反機器人防禦:你真正面對的是什麼
- 速率限制。 TikTok 的 官方開發者文件 明確說明,就算是核准的整合也有請求額度限制。非官方爬蟲更快就會撞上這些限制。
- Cookie 與 session 門檻。 像 davidteather/TikTok-Api 這類新 repo 需要
ms_token;像 drawrowfly/tiktok-scraper 這類舊 repo 的範例裡還會出現tt_webid_v2;Evil0ctal/Douyin_TikTok_Download_API 則把msToken、ttwid、X-Bogus和A_Bogus都文件化了。TikTok 會檢查你的請求,看起來像不像真實瀏覽 session 的一部分。 - 瀏覽器指紋辨識。 ScrapFly 的反機器人指南 解釋了網站如何把 headers、cookies、TLS 簽章,以及 JavaScript 能讀到的瀏覽器特徵,和真實使用者流量做比對。他們的 瀏覽器指紋辨識解析 也涵蓋 Canvas、WebGL、WebRTC、字型與 runtime 訊號。這就像 TikTok 在看你的瀏覽器身分證——如果瀏覽器、cookie、時間點和網路特徵對不上,請求在內容回來之前就會被判定為假流量。
- 行為偵測。 Reddit 討論串 常提到,剛建立的 Playwright session 很容易觸發 CAPTCHA。來自 2025–2026 的社群文章也越來越常描述,偵測不只看 IP 是否重複,還會看操作節奏與互動品質。
- 加密/簽章式請求參數。 Evil0ctal 文件中有
X-Bogus和A_Bogus;更早期的社群 gist 則圍繞 URL signing 和 token 產生。TikTok 越來越期待請求帶著和它自家瀏覽器/App 流量相同的「印記」。 - CAPTCHA 與驗證流程。 有 TikTok 專用 CAPTCHA 解題 repo 和 Reddit 上關於拼圖驗證的討論,足以證明 CAPTCHA 仍然是反機器人防線的一部分。
為什麼開源維護者根本追不上
整個生命週期幾乎都一樣。某個開發者做出一個 TikTok 爬蟲,然後在 GitHub 爆紅。TikTok 一修補,它就壞了;維護者要嘛修好,要嘛離開。
下面兩個 repo 最能代表這個模式:
- drawrowfly/tiktok-scraper 目前仍有 5,052 顆星和 889 次 fork,但它的 最後一次推送是在 2023 年 5 月 19 日。它是 GitHub 上以精確關鍵字搜尋「TikTok 爬蟲」時星標最高的 repo,卻更像歷史文物:曝光高、信任高,但沒有持續維護。
- davidteather/TikTok-Api 顯示有 6,301 顆星、1,177 次 fork,且最後一次推送是 2026 年 4 月 1 日。它的 release 動態 顯示在 2025 年 4 月、2025 年 7 月、2025 年 10 月與 2026 年 4 月都有實質維護——包含修正影片爬取與新的 proxy / session 控制。不過,即使是這個相對健康的專案,也公開警告 TikTok 會封鎖請求,而且使用者可能需要 proxy、Playwright 與自訂 session 邏輯。
這個模式其實很簡單:
- 過時的 TikTok 爬蟲 repo,多半已經死了。
- 還活著的 TikTok 爬蟲 repo,多半仍然很脆弱。
- 真正的差別,只在於這個月還有沒有人幫你修補壞掉的部分。
60 秒 repo 健康檢查清單:如何評估 GitHub 上任何 TikTok 爬蟲
在你 clone 任何東西之前,先跑這份清單。不到一分鐘,能幫你省下好幾個小時的挫折。
| 訊號 | 🟢 健康 | 🟡 有風險 | 🔴 已死亡 |
|---|---|---|---|
| 最近一次有意義的推送 | 3 個月內 | 3–12 個月前 | 12 個月以上 |
| 開放 issue 數量 | 少,且近期 issue 有回覆 | issue 越堆越多,但仍有維護者活動 | 大量未回覆的「壞掉/被封/不能用」回報 |
| 最近使用者抱怨 | 主要是安裝或設定問題 | 安裝問題 + 壞掉問題混雜 | 一再出現「沒有輸出」、「403」、「還能用嗎?」 |
| 目前的 auth/session 模型 | 文件有寫明 session/cookie 流程 | 需要 token,但有文件 | 依賴舊的 web 端點,沒有現行 auth 指引 |
| 安裝門檻 | 可重現、經過測試的安裝流程 | 需要一些手動步驟 | 舊依賴、沒有現代化安裝說明 |
| CI/測試 | 有測試,而且是最新的 | 有測試,但覆蓋範圍不明 | 沒測試,或 actions 已經過時 |
| 資料範圍是否符合需求 | 和你的實際用途一致 | 只支援部分需求 | 根本解決的是別的問題 |
60 秒內逐項檢查的方法
- 最後推送日期: 看 GitHub repo header。如果寫著「last pushed 2 years ago」,可以直接跳過。
- 開放 issue: 點進 Issues 分頁,快速掃描最新標題。搜尋
not working、403、blocked、captcha或zero output。 - 使用者抱怨: 如果前 5 個開放 issue 都是在說「這個現在不能用了」,答案就很明顯了。
- auth/session 模型: 打開 README,找
ms_token、Playwright 設定或 proxy 說明這類現行指引。如果還在引用 2023 的端點,就直接放棄。 - 安裝門檻: 看有沒有 requirements 檔、Docker 支援,或清楚的安裝步驟。如果 README 只寫「npm install」,而最後測試的 Node 版本還是 14,那就要有心理準備。
- CI/測試: 看 Actions 分頁。如果測試失敗或根本沒有測試,壞掉就只能靠猜。
- 資料範圍: repo 真的有寫出你需要的資料型態嗎(個人頁、影片中繼資料、留言、標籤)?很多 repo 只能下載影片,根本不是結構化資料擷取。
看到這些紅旗就該立刻離開
- repo 已經 archived。
- README 寫著「no longer maintained」。
- 最後一次 commit 引用的是兩年以上前的 TikTok API 版本。
- issue 裡全是「不能用」的回報,而且維護者好幾個月沒回應。
- repo 星標很多,但最近幾乎沒有 fork 或 pull request。
小技巧:在 Issues 分頁搜尋 is:issue is:open "not working" 或 is:issue is:open "403"。如果結果很多而且很新,repo 大概率已經壞了。
熱門 TikTok 爬蟲 GitHub repo:誠實狀態檢查(2026)

下面把 Repo 健康檢查清單套用到你在 GitHub 搜尋「tiktok scraper」時最可能看到的幾個 repo:
| Repo | 最後推送 | 星標 | 開放 issue | 判定 | 備註 |
|---|---|---|---|---|---|
| drawrowfly/tiktok-scraper | 2023-05-19 | 5,052 | 58 | 🔴 已死/僅供參考 | 以前很有名,但到 2026 年已經太舊,不適合生產環境 |
| davidteather/TikTok-Api | 2026-04-01 | 6,301 | 134 | 🟡 還活著,但維護成本高 | OSS 方案裡最強;需要 Playwright、token,常常還要 proxy |
| scrapfly/scrapfly-scrapers/tiktok-scraper | 2026-04-21 | 938(母 repo) | 約 0(monorepo) | 🟡 還活著,但不是純開源 | 目前仍可用,但需要 ScrapFly API key |
| Evil0ctal/Douyin_TikTok_Download_API | 2025-10-12 | 17,397 | 135 | 🟡 還活著,功能廣但複雜 | 功能很完整的多平台專案;更像進階使用者平台 |
| naseif/tiktok-scraper | 2024-07-26 | 107 | 13 | 🟡 有風險 | 小型 repo,使用者對個人資訊與 hashtag 流程有不少抱怨 |
| loewehancara1rmyv/Tiktok-scraper | 2026-01-12 | 4 | 0 | 🔴 太新,不值得信任 | 示範型 repo,不是經過社群驗證的工具 |
drawrowfly/tiktok-scraper
這個 TypeScript scraper / downloader 好幾年來一直是搜尋「tiktok scraper github」時的標準答案——可抓使用者、趨勢、標籤與音樂串流。到了 2026 年,最好把它當成歷史文件來看。它的 最後推送是 2023 年 5 月,而 issue 區裡仍留著 2023–2025 年未解決的 「還能用嗎?」 和 「沒有輸出」 回報。如果你因為 clone 了這個 repo 卻什麼都抓不到才來看這篇文章,那你並不孤單。
davidteather/TikTok-Api
截至 2026 年,這大概仍是最可信的開源 TikTok 資料 wrapper,而且還活著。它持續更新、有最新 release,也明確文件化 Playwright 設定、非同步使用、token 處理、proxy 支援,以及 session 恢復功能。不過,它不是「複製就能跑」的工具。它自己的 README 就寫明,EmptyResponseException 通常代表 TikTok 阻擋了請求,而 討論紀錄 也顯示使用者反覆遇到 ms_token、留言擷取失敗、KeyError: 'ItemModule' 與特定端點失效等問題。結論:還活著、很有用、只適合開發者,而且維護負擔不小。
其他值得注意的 repo
- scrapfly/scrapfly-scrapers/tiktok-scraper: 目前版本、技術上也相關,但 README 要求
SCRAPFLY_KEY。這是託管爬取平台的程式範例,不是免費的獨立工具。 - Evil0ctal/Douyin_TikTok_Download_API: 同時涵蓋 TikTok 與抖音,會文件化簽章邏輯(
X-Bogus、A_Bogus、msToken),也支援留言、追蹤者、播放清單等功能。技術門檻高,而且和付費 API 參考資料越來越綁定在一起。issue tracker 在 2026 年仍持續有影片連結與使用者資訊端點的錯誤回報。還活著、功能很多,但很複雜。 - naseif/tiktok-scraper: 規模較小,且有開放抱怨。拿來生產環境風險高。
- loewehancara1rmyv/Tiktok-scraper: 4 顆星、0 個 issue、太新,不值得信任。帶動它曝光的 Medium 文章也沒有做嚴謹驗證。
TikTok 官方 API vs. GitHub 爬蟲 vs. 無程式碼工具:決策框架

大多數競品文章不是忽略 TikTok 的官方存取路徑,就是直接從「用 GitHub」跳到「買我們的服務」。下面是三種路徑的中立比較:
| 因素 | TikTok Research API | GitHub 爬蟲 | 無程式碼工具(例如 Thunderbit) |
|---|---|---|---|
| 存取門檻 | 需要學術/商業申請;核准約需 4 週 | git clone + 設定 | 安裝瀏覽器擴充功能 |
| 資料範圍 | 僅限 核准端點(帳號、影片、留言、商店) | 範圍廣(個人檔案、影片、留言、hashtag、商店) | 可見頁面資料(個人頁、影片、互動、hashtag) |
| 維護負擔 | 低(官方、穩定) | 高(TikTok 一更新就壞) | 幾乎沒有(AI 會自動適應版面變動) |
| 被封風險 | 無(授權使用) | 高 | 低(以瀏覽器為基礎,模擬真實使用者) |
| 成本 | 免費(若核准) | 免費(但耗時) | 有免費方案;點數方案每月 15 美元起 |
| 是否需要寫程式 | 需要(Python/R) | 需要(Python/Node.js) | 不需要 |
| 最適合誰 | 研究者、學術單位、已核准組織 | 能接受維護成本的開發者 | 行銷、業務、營運、非工程人員 |
TikTok Research API 什麼時候最適合
如果你符合資格,TikTok 的 Research API 是最乾淨的官方路徑。美國、歐洲與巴西的合格研究者可透過 申請流程 研究公開內容與帳號資料。可用資料類別包含帳號、粉絲/追蹤中、喜歡的影片、置頂影片、轉發影片、內容、留言與商店。其 codebook 會暴露像 video_description、view_count、like_count、comment_count、share_count 這類欄位,也有留言層級的 text、reply_count 和 create_time。
缺點是:資格只限學術機構、特定地區內合格的非營利/獨立研究者,以及 歐盟 DSA 流程下經審核的研究者。如果你是成長團隊或代理商,想快速拿到營運數據,這不是最適合你的路徑。
TikTok 另外也提供 Commercial Content API,可用於廣告與廣告主內容資料,適合透明度研究,但不適合一般爬取需求。
GitHub 爬蟲什麼時候還是有意義
如果你是開發者,需要繞過官方 API 核准門檻,取得公開資料的非官方存取,而且願意維護整套程式,GitHub 爬蟲仍然有意義。像是抓可見的個人頁格狀列表、hashtag、留言、播放清單,或是把影片中繼資料放進自訂 pipeline,這類情境都可能接受 fork repo 並自行修補。
但要誠實提醒:這不是一次性安裝就結束。即使是 2026 年最可靠的 repo,davidteather/TikTok-Api 仍然在提醒使用者可能需要 Playwright、cookies/tokens、proxy,以及自訂 page/session factory。
什麼時候該用像 Thunderbit 這種無程式碼工具
用 AI 抓取 TikTok 資料 Get Started Free
如果你不是工程師,或者已經受夠這種反覆修修補補的循環,那麼,瀏覽器型 AI 工具就是取得結構化 TikTok 資料最快的路徑。
我們打造 Thunderbit 作為一款以 Chrome 擴充功能形式運作的 AI 網頁爬蟲。在 TikTok 上,它可以讀取任何可見頁面(個人頁、影片、hashtag、搜尋結果),透過「AI Suggest Fields」推薦欄位,然後你只要按下「Scrape」就能擷取結構化資料。TikTok 爬蟲工具頁 有列出發文日期、影片長度、按讚數、分享數、收藏數、留言數、瀏覽數與 hashtag 等欄位。圖片爬蟲範本 示範了如何從個人頁收集貼文縮圖、URL、文案、創作者帳號與互動訊號。hashtag 爬蟲範本 則涵蓋影片 URL、創作者帳號、描述、發佈時間、瀏覽數、按讚數、留言數、分享數、音樂/音訊與封面圖 URL。
透過子頁面爬取,你可以從個人頁清單逐一進入每支影片頁面,把互動數據、文案與 hashtags 補齊,這對建立 influencer 資料庫或做競品內容稽核特別有用。
不用維護、不用安裝排錯、也不用設定反封鎖策略。AI 會自動適應版面變化。匯出到 Google Sheets、Excel、Airtable、Notion、CSV 或 JSON 也都免費。
如果你已經在壞掉的 GitHub repo 上浪費了好幾個小時,這是一個正當的替代方案,不是在硬推產品。
安裝排錯:修復 TikTok 爬蟲 GitHub 設定最常見的 5 種失敗
安裝失敗是 TikTok 爬取論壇裡第三常被提到的痛點,而大多數主流指南都沒真的教你怎麼修。下面是常見問題。
Node.js 版本衝突
問題: 很多舊的 TikTok 爬蟲 repo(尤其是 drawrowfly/tiktok-scraper)是為 Node.js 14–16 打造的。如果你在跑 Node 20+,npm install 可能會默默失敗,或產生不相容的二進位檔。
解法: 用 nvm(Node Version Manager)安裝並切換到正確版本:
nvm install 16
nvm use 16
npm install
如果 repo 沒有指定 Node 版本,可以看 package.json 的 engines 欄位,或檢查 CI 設定。
Python 依賴問題與 Playwright 設定
問題: davidteather/TikTok-Api 需要 Python 3.9+ 與特定瀏覽器二進位檔的 Playwright。使用者常看到像「browser not found」或依賴衝突這類錯誤。
解法: 一定要先建立虛擬環境,再明確安裝 Playwright 瀏覽器:
python -m venv .venv
source .venv/bin/activate # Windows:.venv\Scripts\activate
pip install TikTokApi
python -m playwright install
如果 playwright install 失敗,請檢查系統套件管理器是否缺少必要依賴(例如 Ubuntu 上的 libnss3)。
Linux / Ubuntu 權限錯誤
問題: 使用 sudo pip install 會破壞系統 Python 環境,並引發連鎖依賴問題。
解法: 千萬不要用 sudo pip install。先建立虛擬環境:
python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
這樣可以把爬蟲依賴和系統 Python 隔離開來。
Windows 路徑與編碼問題
問題: Windows CMD 會有編碼問題和路徑長度限制,這會弄壞爬蟲安裝,特別是 Playwright 把瀏覽器二進位檔下載到很深的資料夾時。
解法: 改用 WSL(Windows Subsystem for Linux)或 Git Bash,不要用 CMD。WSL 能讓你在 Windows 裡直接用完整 Linux 環境:
wsl --install
# 接著打開 WSL 終端機,照著 Linux 安裝步驟做
Docker 快捷方式:直接跳過所有依賴問題
問題: 上面那些全部都可能遇到。
解法: 如果你熟悉 Docker,就把爬蟲環境容器化。Python-based TikTok 爬蟲的基本 Dockerfile 大概長這樣:
FROM python:3.11-slim
RUN apt-get update && apt-get install -y libnss3 libatk-bridge2.0-0 libdrm2 libxcomposite1 libxdamage1 libxrandr2 libgbm1 libasound2
RUN pip install TikTokApi playwright && python -m playwright install --with-deps chromium
WORKDIR /app
COPY . .
CMD ["python", "scrape.py"]
這能保證不管你的主機作業系統是什麼,都有一個可重現的環境。如果爬蟲在 Docker 裡能跑,容器外失敗通常就是環境問題,不是程式碼問題。
排錯流程圖:
- repo 自帶範例能正常跑嗎?→ 如果不行,先查 runtime 版本。
- runtime 版本對嗎?→ 檢查 browser / Playwright 安裝。
- 瀏覽器有安裝嗎?→ 檢查 token / cookie。
- token / cookie 有效嗎?→ 檢查 TikTok 是否封鎖 session。
- 以上都失敗?→ 先假設是 repo 壞了,不是使用者操作錯誤。直接換工具。
TikTok 爬取的反封鎖最佳做法(不用花錢買 proxy)
論壇使用者常抱怨被封跟被偵測:「它們會把你的帳號搞到被封,等於又多一筆成本」以及「不想用 Apify 或昂貴的付費 API」。下面提供一些免費、實用、不需要付費 proxy 訂閱的替代方案。

| 做法 | 難度 | 成本 | 效果 |
|---|---|---|---|
| 隨機請求延遲(2–8 秒抖動) | 容易 | 免費 | 中等 |
| Session / cookie 輪換 | 中等 | 免費 | 中等 |
| 只抓登出狀態下的公開頁面 | 容易 | 免費 | 中等 |
遵守 robots.txt + rate-limit headers | 容易 | 免費 | 基本盤 |
| 無頭瀏覽器指紋隨機化(Playwright) | 中等 | 免費 | 高 |
| 使用 TikTok 的手機 API 端點(較不易被偵測) | 困難 | 免費 | 高 |
| Residential proxy 輪換 | 中等 | 每月 $20–100 | 高 |
真正有幫助的免費技巧
隨機請求延遲。 不要用密集迴圈狂送請求。在每次請求之間加上 2–8 秒的隨機抖動。這是你最容易立刻做到的改善:
import time, random
time.sleep(random.uniform(2, 8))
Session 與 cookie 重用。 不要每次請求都建立全新的 session。應該在一批請求之間重用 cookies 和 session 狀態,之後再輪換。這也是為什麼現代 repo 會要求 ms_token,而不是承諾可以無狀態爬取。
只抓登出狀態下的公開頁面。 TikTok-Api 明確說明 它不支援登入後路由,只能處理登出後可見的資料。登出狀態的爬取,比帶登入態的 session 更不容易被偵測。
尊重 robots.txt。 TikTok 目前的 robots.txt 會直接封鎖很多 agent,且只允許有限的公開路徑進行一般爬取。這不是大規模激進爬取的綠燈,但遵守它能降低立刻被 IP 黑名單的機率。
提高成功率的進階技巧
無頭瀏覽器指紋隨機化。 如果你用的是 Playwright,可以針對每個 session 隨機化 viewport 尺寸、user-agent、時區與地區設定。這樣看起來像不同真人在使用,而不是一個換了 IP 的 bot。
使用 TikTok 的手機 API 端點。 有些社群成員回報,改用手機版風格的端點,比 web 前端更不容易被偵測。這做法較難實作,也較少文件,但對進階使用者來說確實可行。
什麼時候你真的需要 proxy(以及較平價的選項)
如果規模大了,免費技巧通常不夠。Residential proxy 輪換是大規模 TikTok 爬取的標準作法。這裡我不特別推薦某一家付費 proxy 服務,但一般建議是:避開 datacenter proxies(TikTok 會更積極標記),找住宅或行動 proxy pool,並支援每次請求輪換。
或者,像 Thunderbit 這類瀏覽器工具可以直接繞過 proxy 問題,因為它是在你自己的瀏覽器 session 中執行,模擬真實使用者。這不代表它在大規模情境下完全不會被偵測,但對一般行銷或研究用途(幾十到幾百頁,不是數百萬頁)來說,路徑簡單很多。
你實際能抓到什麼資料?TikTok 爬蟲的真實輸出範例
使用者在決定工具之前,最想知道的是:到底能拿到什麼資料——但大多數指南完全跳過這一段。下面是根據來源文件整理出的代表性欄位結構。
個人檔案資料
| 使用者名稱 | 顯示名稱 | 粉絲數 | 追蹤中 | 總按讚數 | 簡介 | 已驗證 | 個人頁 URL |
|---|---|---|---|---|---|---|---|
| @examplecreator | Jane Doe | 1,240,000 | 312 | 48,700,000 | "Cooking + comedy 🍳" | ✅ | tiktok.com/@examplecreator |
| @travelwithmark | Mark S. | 890,000 | 150 | 22,100,000 | "Travel vlogger 🌍" | ❌ | tiktok.com/@travelwithmark |
| @fitnessmaya | Maya L. | 2,100,000 | 88 | 91,300,000 | "Workouts & wellness" | ✅ | tiktok.com/@fitnessmaya |
可從以下工具取得: GitHub 爬蟲(TikTok-Api、Evil0ctal)、Research API、Thunderbit(來自可見的個人頁)。
影片中繼資料
| 影片 URL | 文案 | 觀看數 | 按讚數 | 留言數 | 分享數 | 音樂 | Hashtags | 發文日期 | 長度 |
|---|---|---|---|---|---|---|---|---|---|
| tiktok.com/@ex/video/123 | "Best pasta trick ever 🍝" | 4,200,000 | 312,000 | 8,400 | 21,000 | "Italian Vibes – DJ Marco" | #pasta #cooking #hack | 2026-03-15 | 0:42 |
| tiktok.com/@ex/video/456 | "POV: your cat judges you" | 9,100,000 | 1,100,000 | 23,000 | 55,000 | "Original Sound" | #cat #pov #funny | 2026-04-01 | 0:18 |
| tiktok.com/@ex/video/789 | "Morning routine nobody asked for" | 1,800,000 | 98,000 | 3,200 | 7,500 | "Chill Morning – LoFi" | #routine #morning | 2026-04-10 | 1:02 |
可從以下工具取得: GitHub 爬蟲(TikTok-Api、Evil0ctal)、Research API(欄位包含 video_description、view_count、like_count、comment_count、share_count、music_id、hashtag_names、video_duration)、Thunderbit(影片層級欄位)。
留言資料
| 留言者 | 留言內容 | 按讚數 | 時間戳 | 回覆數 |
|---|---|---|---|---|
| @user_abc | "I tried this and it actually works 😂" | 1,200 | 2026-03-16T08:12:00Z | 14 |
| @chef_dan | "Add garlic next time, trust me" | 890 | 2026-03-16T09:45:00Z | 7 |
| @randomfan99 | "This is the content I'm here for" | 340 | 2026-03-16T11:30:00Z | 2 |
可從以下工具取得: GitHub 爬蟲(TikTok-Api、Evil0ctal)、Research API(欄位包含 text、like_count、reply_count、create_time)、Thunderbit(來自可見的留言區)。
Hashtag 與搜尋資料
| Hashtag | 頂部影片 URL | 累積觀看數 | Trending |
|---|---|---|---|
| #pasta | tiktok.com/@ex/video/123 | 4,200,000 | Yes |
| #cooking | tiktok.com/@chef/video/321 | 11,000,000 | Yes |
| #hack | tiktok.com/@tips/video/654 | 2,900,000 | No |
可從以下工具取得: GitHub 爬蟲(依 repo 而異)、Thunderbit(hashtag 爬蟲範本)。
注意:沒有任何單一 repo 能保證所有欄位都永遠可用。TikTok 的回應結構會變,就連維護者也會提醒這件事。請把這些資料視為代表性範例,而不是絕對保證。
如何用 Thunderbit 兩下就抓 TikTok 資料(逐步教學)
已經受夠這種壞掉→修復的循環了嗎?下面是無程式碼路徑——給所有曾經嘗試 GitHub repo 但失敗的人一條退路。
- 安裝 Thunderbit Chrome Extension。
- 前往你要爬取的 TikTok 頁面——個人頁、搜尋結果頁、hashtag 頁,或單支影片頁。
- 點擊「AI Suggest Fields」。 Thunderbit 的 AI 會讀取頁面並建議欄位:使用者名稱、粉絲數、影片文案、按讚數、hashtags 等。
- 視需要調整欄位,然後點擊「Scrape」。 資料會以結構化表格填入。
- 使用子頁面爬取補充資料。 從個人頁清單點進每支影片,擷取更多欄位:完整文案、音樂資訊、留言數、分享數。
- 免費匯出到 Google Sheets、Excel、Airtable 或 Notion。
不用維護、不用安裝排錯、也不用設定反封鎖策略。AI 會自動適應 TikTok 版面變動。
用子頁面爬取補強 TikTok 資料
當你從個人頁或 hashtag 頁抓到一串影片後,點擊「Scrape Subpages」,讓 AI 逐一進入每支影片頁並抓取額外欄位。這對正在建立 influencer 資料庫或做競品內容稽核的行銷人員特別有用——你可以直接拿到完整的影片互動資料表,不需要手動點進幾十個頁面。
匯出與使用你的 TikTok 資料
Thunderbit 可免費匯出到 Google Sheets、Excel、Airtable、Notion、CSV 或 JSON。常見用途包括:
- 把資料放進試算表做互動分析。
- 匯入 Airtable 當成 CRM 式的 influencer 追蹤器。
- 推到 Notion,讓團隊協作做內容研究。
如果你想更深入了解 Thunderbit 如何處理網頁資料擷取,可以看看我們的 網頁爬蟲新手指南,或到 Thunderbit YouTube 頻道 看教學影片。
合法使用:TikTok 服務條款與爬取合規性
TikTok 的法律立場非常清楚。平台的 關於爬取的隱私部落格 指出,服務條款禁止以自動化腳本收集資訊,或以未授權方式與服務互動,並明確提到繞過存取限制。TikTok 的 社群規範 也禁止透過自動化腳本或網頁爬行,以欺騙方式取得資訊。
實務建議:
- 只抓公開可見資料。 不要爬私人內容或登入後才能看到的內容。
- 尊重速率限制。 不要狂打 TikTok 的伺服器。
- 遵守資料隱私法規。 如果你正在收集、儲存或分析個資,GDPR 與 CCPA 仍然適用。
- 符合資格時使用 Research API。 從合規角度來看,這是最安全的路。
- 這不是法律意見。 請針對你的具體情況諮詢專業人士。
想了解更多法律面內容,可以參考我們的 網頁爬取法律影響 指南。
當你的 TikTok 爬蟲 GitHub repo 壞掉時,該怎麼辦
簡短版:
- 在 clone 任何 GitHub TikTok 爬蟲之前,先跑 60 秒 Repo 健康檢查清單。 大多數 repo 其實早就死了。
- 先搞清楚自己的選項。 官方 API、GitHub 爬蟲、無程式碼工具各自適合不同使用者與場景。
- 如果你選 GitHub 路線, 就要預留安裝排錯與反封鎖設定的時間。後續維護幾乎不可避免。
- 在決定工具前,先確認你實際能拿到哪些資料。 看輸出欄位,不要只看星標數。
- 如果你不是開發者(或者你已經受夠壞掉的 repo),可以試試像 Thunderbit 這樣的無程式碼工具——兩下就能拿到結構化資料,而且可免費匯出。
你需要的 TikTok 資料其實是能取得的。真正的問題是:你想把時間花在維護爬蟲上,還是直接使用資料。選一個最符合你的技能與用途的方法,別再讓一個已經死掉的 GitHub repo 浪費你整個下午。
常見問題
2026 年還有能用的 GitHub TikTok 爬蟲嗎?
有,但選擇不多。davidteather/TikTok-Api 是截至 2026 年 4 月仍持續維護、最可信的開源選項。Evil0ctal/Douyin_TikTok_Download_API 也還活著,但更複雜。星標最多的 drawrowfly/tiktok-scraper 自 2023 年 5 月後就沒更新了,基本上已死。投資時間前,一定要先跑 Repo 健康檢查清單。
爬 TikTok 合法嗎?
TikTok 的服務條款明確禁止自動化爬取。公開可見資料在法律上屬於灰色地帶,且會依司法管轄區而不同。最安全的路徑是給符合資格的研究者使用官方 Research API。如果你要爬公開資料,請只抓公開可存取的內容、遵守速率限制,並符合 GDPR/CCPA。這不是法律意見,請諮詢專業人士。
不寫程式也能爬 TikTok 嗎?
可以。像 Thunderbit 這類瀏覽器型 AI 工具,可以讓你不用寫任何程式,就抓取結構化的 TikTok 資料(個人頁、影片中繼資料、hashtags、互動數據)。TikTok Research API 對獲准申請者來說也只需要少量程式碼。對非開發者而言,無程式碼工具通常最快也最穩定。
TikTok 爬蟲可以抓到哪些資料?
常見資料類型包括:個人資訊(使用者名稱、粉絲數、簡介、驗證狀態)、影片中繼資料(文案、觀看數、按讚數、留言數、分享數、音樂、hashtags、長度、發文日期)、留言(內容、按讚數、時間戳、回覆數),以及 hashtag/搜尋資料(熱門影片、總觀看數、是否正在趨勢中)。實際欄位取決於工具與方法——細節可以參考上面的輸出範例區塊。
為什麼我的 TikTok 爬蟲一直被封?
TikTok 使用多層反機器人防禦:速率限制、cookie / session 門檻、瀏覽器指紋辨識、行為偵測、加密請求參數,以及 CAPTCHA 流程。常見的被封原因包括請求太快、每次請求都用全新乾淨 session、使用預設指紋的無頭瀏覽器,或使用 datacenter proxy。上面的反封鎖最佳做法區段有提供免費與付費的解法。


