在 GitHub 上搜索 “tiktok scraper”,会返回 339 个仓库。其中大约 48% 已经超过一年没有更新,至少 4 个 明确处于归档状态。
如果你曾经克隆过某个热门的 TikTok 爬虫仓库,花了一个小时和各种依赖死磕,最后却什么都没抓到——你并不孤单。GitHub 上星标最多的 TikTok 爬虫 drawrowfly/tiktok-scraper 到现在仍然有 5,000 多颗星,但它的 Issues 里到处都是像 #812:“这个神奇工具还在工作吗?” 和 #824:“它现在还能用吗?” 这样的帖子——反馈全都是没有输出。我在 Thunderbit 跟踪 TikTok 爬虫仓库的状态已经几个月了,规律非常明显:这类工具坏得很快,而且大多数坏了也没人修。这篇文章就是我刚开始评估这些仓库时最希望有人写给我的实战生存指南。我们会讲清楚哪些仓库还能用、哪些已经凉了、替代方案是什么,以及如何避免把时间浪费在那些在你找到之前就已经失效的代码上。
为什么 GitHub 上大多数 TikTok 爬虫都会坏,而且会一直坏下去
TikTok 不是一个普通的爬取目标。它的网页端变化非常快。和静态的电商商品页或目录页不同,TikTok 会轮换接口、更新反爬指纹、改变页面渲染方式,还会引入新的会话/令牌要求——有时距离上一次改动才几周。
开源维护者大多是志愿者。一旦 TikTok 推出更新,导致爬虫请求路径失效,仓库可能几天、几周,甚至永久都处于损坏状态。这不是在否定维护者,而是一个结构性矛盾:一边是快速迭代、资金雄厚的平台,另一边是有本职工作的无偿开发者。
即使是最好的 TikTok 爬虫仓库,也长期处在“修了又坏、坏了再修”的循环里。如果你一定要用,最好先准备好评估方法、排障思路和备用方案。
TikTok 的反爬防线:你面对的是什么
- 限流。 TikTok 的 官方开发者文档 明确写了请求配额,即使是已获批准的集成也有次数限制。非官方爬虫触发限制的速度会更快。
- Cookie 和会话校验。 像 davidteather/TikTok-Api 这样的现代仓库要求
ms_token;像 drawrowfly/tiktok-scraper 这样的老仓库示例里还会出现tt_webid_v2;Evil0ctal/Douyin_TikTok_Download_API 则记录了msToken、ttwid、X-Bogus和A_Bogus。TikTok 会判断你的请求看起来像不像真实浏览会话。 - 浏览器指纹识别。 ScrapFly 的反爬指南 解释了为什么网站会把请求头、Cookie、TLS 特征,以及 JavaScript 暴露的浏览器属性,与真实用户流量进行比对。他们的 浏览器指纹解析 还覆盖了 Canvas、WebGL、WebRTC、字体和运行时信号。指纹识别就像 TikTok 在查你的浏览器身份证——如果浏览器、Cookie、时间节奏和网络特征对不上,请求在内容返回之前就会被判定为可疑。
- 行为检测。 Reddit 上关于 TikTok 爬取的帖子 经常提到,刚启动的 Playwright 会话就会触发验证码。来自 2025–2026 的社区内容越来越多地描述一种检测方式:它不只看 IP 是否重复,还会看操作节奏和交互质量。
- 加密/签名请求参数。 Evil0ctal 文档中提到
X-Bogus和A_Bogus;更早的社区 gist 则围绕 URL 签名和令牌生成展开。TikTok 越来越希望请求带着和它自己的浏览器/APP 流量相同的“印章”。 - 验证码和验证流程。 TikTok 专用验证码破解器仓库 和 关于拼图挑战的 Reddit 讨论 说明,验证码仍然是反爬体系的一部分。
为什么开源维护者追不上节奏
生命周期总是差不多。有人做了一个 TikTok 爬虫,它在 GitHub 上火了。TikTok 一改接口,它坏了。维护者要么修,要么离开。
下面两个仓库最能说明这种模式:
- drawrowfly/tiktok-scraper 依然有 5,052 颗星和 889 个 Fork,但它的 最后一次更新是在 2023 年 5 月 19 日。它是 GitHub 上按精确短语搜索 “TikTok scraper” 时星标最多的仓库,但现在看起来更像历史文档:可见度高、信任度高、却没有持续维护。
- davidteather/TikTok-Api 显示有 6,301 颗星、1,177 个 Fork,最后一次更新在 2026 年 4 月 1 日。它的 Release 记录 显示 2025 年 4 月、7 月、10 月以及 2026 年 4 月都有实际维护——包括用户视频抓取和新的代理/会话控制修复。但即便是这个更健康的项目,也明确警告 TikTok 会拦截请求,用户可能需要代理、Playwright 和自定义会话逻辑。
规律很简单:
- 一个久未更新的 TikTok 爬虫仓库,大概率已经死了。
- 一个还在更新的 TikTok 爬虫仓库,大概率依然脆弱。
- 唯一的区别是,这个月是否还有人愿意继续补漏洞。
60 秒仓库体检清单:如何评估 GitHub 上任何 TikTok 爬虫
在克隆任何仓库之前,先跑一遍这个清单。不到一分钟,但能省下你几个小时的折腾。
| 信号 | 🟢 健康 | 🟡 有风险 | 🔴 已失效 |
|---|---|---|---|
| 最近一次有效更新 | 3 个月内 | 3–12 个月前 | 12 个月以上 |
| 开放 Issue 数量 | 少,且最近的问题有回应 | 问题越来越多,维护者偶尔出现 | 很多“坏了/被拦/不能用”的问题没人答 |
| 最近用户抱怨 | 主要是安装/配置问题 | 安装问题和失效反馈混杂 | 反复出现“零输出”“403”“还能用吗?” |
| 当前认证/会话模型 | 文档清楚说明会话/Cookie 方案 | 依赖令牌但有说明 | 还在用旧网页接口,没有当前认证指引 |
| 安装难度 | 可复现、已测试的安装流程 | 需要一些手动步骤 | 旧依赖、没有现代安装说明 |
| CI/测试 | 有测试且是最新的 | 有测试,但覆盖范围不清楚 | 没有测试或自动化流程过时 |
| 数据范围匹配度 | 和你的实际需求一致 | 只覆盖部分需求 | 解决的是别的问题 |
60 秒内逐项检查的方法
- 看最后更新日期: 直接看 GitHub 仓库头部。如果显示“2 年前更新”,可以直接放弃。
- 看开放 Issues: 点进 Issues 标签,浏览最近的标题,搜索
not working、403、blocked、captcha或zero output。 - 看用户抱怨: 如果前 5 个开放 Issue 都是在变着法说“现在不能用了”,答案已经很明显。
- 看认证/会话模型: 打开 README,找有没有
ms_token、Playwright 配置或代理说明这类当前方案。如果 README 还在写 2023 年的接口,那就别继续了。 - 看安装复杂度: 检查有没有 requirements 文件、Docker 支持,或者清晰的安装步骤。如果 README 只写了 “npm install”,而最后测试的 Node 版本还是 14,那就准备踩坑吧。
- 看 CI/测试: 进 Actions 标签。测试要么失败,要么没有,都会让排查只能靠猜。
- 看数据范围: 仓库是否真的说明了你需要的数据类型(个人主页、视频元数据、评论、话题标签)?很多仓库只会下载视频,并不做结构化数据提取。
这些红旗意味着“赶紧走人”
- 仓库已归档。
- README 里写着“no longer maintained(不再维护)”。
- 最后一次提交引用的是 2 年前的 TikTok API 版本。
- Issues 里全是“不能用”的反馈,而且维护者几个月都没回应。
- 仓库星标很多,但最近没有新的 Fork 或 Pull Request。
小技巧:在 Issues 里搜索 is:issue is:open "not working" 或 is:issue is:open "403"。如果结果很多而且很新,这个仓库大概率已经坏了。
热门 TikTok 爬虫 GitHub 仓库:2026 年真实状态检查

下面是把“仓库体检清单”应用到你在 GitHub 搜索 “tiktok scraper” 时最可能遇到的仓库:
| 仓库 | 最后更新 | 星标 | 开放 Issues | 结论 | 说明 |
|---|---|---|---|---|---|
| drawrowfly/tiktok-scraper | 2023-05-19 | 5,052 | 58 | 🔴 已失效 / 仅供参考 | 依然很有名,但对 2026 年生产使用来说太老了 |
| davidteather/TikTok-Api | 2026-04-01 | 6,301 | 134 | 🟡 还活着,但维护成本高 | 开源里最强的选择;依赖 Playwright、令牌,通常还要代理 |
| scrapfly/scrapfly-scrapers/tiktok-scraper | 2026-04-21 | 938(父仓库) | ~0(单体仓库) | 🟡 还活着,但不是纯开源 | 当前可用且有参考价值,但需要 ScrapFly API Key |
| Evil0ctal/Douyin_TikTok_Download_API | 2025-10-12 | 17,397 | 135 | 🟡 还活着,功能广,复杂度高 | 功能很丰富的多平台项目,更像给重度用户准备的平台 |
| naseif/tiktok-scraper | 2024-07-26 | 107 | 13 | 🟡 有风险 | 规模较小,关于用户信息和标签流的抱怨不少 |
| loewehancara1rmyv/Tiktok-scraper | 2026-01-12 | 4 | 0 | 🔴 太新,不值得信任 | 展示型仓库,不是经过社区验证的工具 |
drawrowfly/tiktok-scraper
很多年里,这个 TypeScript 的抓取/下载仓库一直是搜索 “tiktok scraper github” 时的默认答案——能处理用户流、趋势流、话题标签和音乐流。到了 2026 年,它更适合被当作历史资料而不是生产工具。最后更新是在 2023 年 5 月,而 Issues 队列里到现在还有 2023–2025 年间没解决的 “还能用吗?” 和 “零输出” 报告。如果你是因为克隆了这个仓库却一无所获才看到这篇文章,那你并不孤单。
davidteather/TikTok-Api
到 2026 年仍然存活、可信度最高的开源 TikTok 数据封装库。它还在持续更新,有 最新 Release,并且明确记录了 Playwright 安装、异步用法、令牌处理、代理支持和会话恢复能力。但它不是“克隆下来就能跑”的工具。它自己的 README 就写明,EmptyResponseException 通常意味着 TikTok 正在拦截请求,而 讨论记录 里也反复出现 ms_token、评论抓取失效、KeyError: 'ItemModule' 和特定接口失败等问题。结论:还活着、很有用、适合开发者、但维护成本高。
其他值得关注的仓库
- scrapfly/scrapfly-scrapers/tiktok-scraper: 当前仍然有技术参考价值,但 README 要求
SCRAPFLY_KEY。这更像是托管爬取平台的代码示例,而不是免费独立工具。 - Evil0ctal/Douyin_TikTok_Download_API: 同时覆盖 TikTok 和抖音,记录了签名逻辑(
X-Bogus、A_Bogus、msToken),支持评论、粉丝、播放列表等多种功能。技术门槛较高,而且越来越多地和付费 API 引用绑定在一起。Issues 在 2026 年仍持续出现关于视频链接和用户信息接口的 bug 报告。还活着、功能多,但很复杂。 - naseif/tiktok-scraper: 规模较小,投诉较多。用于生产环境风险较大。
- loewehancara1rmyv/Tiktok-scraper: 4 颗星、0 个 Issues,太新,不值得信任。推广它的 Medium 文章也缺乏严谨判断。
TikTok 官方 API vs GitHub 爬虫 vs 无代码工具:决策框架

很多竞品文章要么完全忽略 TikTok 官方的访问路径,要么直接从“用 GitHub”跳到“买我们的服务”。下面给你一个三种路线都包含的中立对比:
| 因素 | TikTok Research API | GitHub 爬虫 | 无代码工具(例如 Thunderbit) |
|---|---|---|---|
| 获取门槛 | 需要学术/商业申请;审批大约 4 周 | Git 克隆 + 配置 | 安装浏览器扩展 |
| 数据范围 | 仅限 获批端点(账号、视频、评论、商店) | 范围广(主页、视频、评论、标签、商店) | 可见页面数据(主页、视频、互动、标签) |
| 维护负担 | 低(官方、稳定) | 高(TikTok 一更新仓库就坏) | 无(AI 会适应页面变化) |
| 封禁风险 | 无(授权访问) | 高 | 低(基于浏览器,模拟真实用户) |
| 成本 | 免费(如果获批) | 免费(但耗时) | 有免费层;付费方案从每月 15 美元起 |
| 是否需要编码 | 需要(Python/R) | 需要(Python/Node.js) | 不需要 |
| 最适合谁 | 研究人员、学术机构、获批组织 | 能接受长期维护的开发者 | 市场、销售、运营、非技术用户 |
什么时候 TikTok Research API 最合适
如果你符合条件,TikTok 的 Research API 是最干净、最官方的路径。美国、欧洲和巴西的合格研究者可以通过 申请流程 研究公开内容和账号数据。可用的数据类别包括账号、关注者/关注中、点赞视频、置顶视频、转发视频、内容、评论和商店。它的 codebook 还会暴露 video_description、view_count、like_count、comment_count、share_count 以及评论级字段如 text、reply_count 和 create_time。
缺点是:资格限制很严格,只有学术机构、特定地区的合格非营利组织或独立研究者,以及 欧盟 DSA 流程下经过审核的研究者 才能使用。如果你是需要快速拿到运营数据的增长团队或代理公司,这条路并不适合你。
TikTok 还提供了一个 Commercial Content API,用于广告和广告主内容数据,这对透明度研究很有帮助,但不适用于通用爬取。
什么时候 GitHub 爬虫仍然值得用
如果你是开发者,需要在官方 API 审批之外获取公开数据,而且愿意维护整套技术栈,那么 GitHub 爬虫仍然有意义。这包括抓取可见的个人主页网格、话题标签、评论、播放列表或视频元数据等场景;如果你接受 fork 仓库并自己修补,它完全可以融入自定义流程。
但要坦白一点:这不是一次性配置。即使是 2026 年最靠谱的仓库 davidteather/TikTok-Api,也仍然在提示用户可能需要 Playwright、Cookie/令牌、代理以及自定义页面/会话工厂。
什么时候像 Thunderbit 这样的无代码工具更合适
使用 AI 抓取 TikTok 数据 Get Started Free
你不是开发者?或者你已经受够了“修好又坏、坏了再修”的循环?那基于浏览器的 AI 工具就是获取结构化 TikTok 数据最快的方式。
我们开发的 Thunderbit 是一款 AI 网页爬虫,以 Chrome 扩展的形式运行。在 TikTok 上,它能读取任何可见页面(个人主页、视频页、话题页、搜索结果页),通过“AI Suggest Fields”自动建议字段,然后你只需点击“Scrape”即可提取结构化数据。TikTok 爬虫工具页面 记录了发布日期、视频时长、点赞、分享、收藏、评论、浏览量和话题标签等字段。图片爬虫模板 展示了如何从主页抓取帖子缩略图、URL、标题、创作者账号和互动信号。话题标签爬虫模板 则覆盖了视频 URL、创作者用户名、描述、发布时间、浏览量、点赞、评论、分享、音频/配乐和封面图 URL。
借助子页面抓取,你还可以从主页列表进入每个视频页面,补充互动数据、标题和话题标签——这对搭建网红数据库或做竞品内容审计的营销人员尤其有用。
无需维护、无需安装排障、无需配置反封禁参数。AI 会自动适应页面变化。结果可免费导出到 Google Sheets、Excel、Airtable、Notion、CSV 或 JSON。
如果你已经在坏掉的 GitHub 仓库上浪费了很多时间,这确实是一个正经替代方案,而不是硬推产品。
安装排障:修复 TikTok 爬虫 GitHub 仓库最常见的 5 种安装失败
安装失败是 TikTok 爬取论坛里第三常见的痛点,但几乎没有哪篇指南真正帮你解决。下面说说最常见的问题。
Node.js 版本冲突
问题: 很多老的 TikTok 爬虫仓库(尤其是 drawrowfly/tiktok-scraper)都是按 Node.js 14–16 构建的。如果你用的是 Node 20+,npm install 可能会静默失败,或者生成不兼容的二进制文件。
解决办法: 使用 nvm(Node Version Manager)安装并切换到正确版本:
nvm install 16
nvm use 16
npm install
如果仓库没有明确写 Node 版本,去看 package.json 里的 engines 字段,或者检查 CI 配置。
Python 依赖问题和 Playwright 配置
问题: davidteather/TikTok-Api 需要 Python 3.9+ 和特定浏览器二进制文件的 Playwright。用户常见报错包括“找不到浏览器”或依赖冲突。
解决办法: 一定要先创建虚拟环境,然后显式安装 Playwright 浏览器:
python -m venv .venv
source .venv/bin/activate # Windows 上:.venv\Scripts\activate
pip install TikTokApi
python -m playwright install
如果 playwright install 失败,检查系统包管理器里是否缺少系统依赖(例如 Ubuntu 上的 libnss3)。
Linux/Ubuntu 权限错误
问题: 运行 sudo pip install 会污染系统 Python 环境,进而引发连锁依赖问题。
解决办法: 不要用 sudo pip install。先创建虚拟环境:
python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
这样可以把爬虫依赖和系统 Python 隔离开。
Windows 路径与编码问题
问题: Windows CMD 有编码问题和路径长度限制,会破坏爬虫安装,尤其是当 Playwright 把浏览器二进制下载到很深的嵌套目录时。
解决办法: 用 WSL(Windows Subsystem for Linux)或 Git Bash 代替 CMD。WSL 可以让你在 Windows 里直接使用完整的 Linux 环境:
wsl --install
# 然后打开 WSL 终端,按 Linux 环境的步骤继续
Docker 速通方案:直接跳过依赖问题
问题: 上面所有这些。
解决办法: 如果你会用 Docker,就把爬虫环境容器化。一个基于 Python 的 TikTok 爬虫的基础 Dockerfile 大概是这样:
FROM python:3.11-slim
RUN apt-get update && apt-get install -y libnss3 libatk-bridge2.0-0 libdrm2 libxcomposite1 libxdamage1 libxrandr2 libgbm1 libasound2
RUN pip install TikTokApi playwright && python -m playwright install --with-deps chromium
WORKDIR /app
COPY . .
CMD ["python", "scrape.py"]
这样可以保证无论宿主机是什么系统,环境都是可复现的。如果在 Docker 里能跑,出了 Docker 反而不行,那就是环境问题,不是代码问题。
排障流程图:
- 仓库自己的示例能跑通吗?→ 如果不能,先看运行时版本。
- 运行时版本对吗?→ 看浏览器/Playwright 是否安装好。
- 浏览器装了吗?→ 检查令牌/Cookie。
- 令牌/Cookie 有效吗?→ 看 TikTok 是否在拦截这个会话。
- 上面全都失败?→ 直接假设是仓库坏了,而不是用户操作失误。换工具。
TikTok 爬取的反封禁最佳实践(无需花钱买代理)
论坛用户总是抱怨封禁和检测:“他们会把你的账号封掉,这又是一笔额外开销”以及“又不能用 Apify 或昂贵的付费 API”。下面这些是免费、实用、而且不需要付费代理订阅的办法。

| 做法 | 难度 | 成本 | 效果 |
|---|---|---|---|
| 随机请求延迟(2–8 秒抖动) | 简单 | 免费 | 中等 |
| 会话/Cookie 轮换 | 中等 | 免费 | 中等 |
| 只抓取已登出状态下的公开页面 | 简单 | 免费 | 中等 |
遵守 robots.txt + 限流头 | 简单 | 免费 | 基础 |
| 无头浏览器指纹随机化(Playwright) | 中等 | 免费 | 高 |
| 使用 TikTok 移动端 API 接口(更低检测率) | 困难 | 免费 | 高 |
| 家宽代理轮换 | 中等 | 每月 20–100 美元 | 高 |
真正有用的免费技巧
随机请求延迟。 不要在循环里连续狂发请求。每次请求之间加 2–8 秒的随机抖动。这是你能做的最简单、最有效的方法:
import time, random
time.sleep(random.uniform(2, 8))
会话和 Cookie 复用。 不要每次请求都创建全新的会话。应该在一批请求中复用 Cookie 和会话状态,然后再轮换。这也是为什么现代仓库会要求你提供 ms_token,而不是承诺无状态抓取。
只抓取已登出状态下的公开页面。 TikTok-Api 明确说明 它不支持需要用户登录的路由,只能抓取登出时可见的数据。和登录会话相比,登出状态下的抓取更不容易触发检测。
遵守 robots.txt。 TikTok 的 当前 robots.txt 会直接屏蔽很多爬虫,并且只允许少量公开路径用于一般爬取。这不是鼓励你激进抓取,但尊重它能降低被立刻拉黑 IP 的风险。
提高成功率的进阶技巧
无头浏览器指纹随机化。 如果你用的是 Playwright,每个会话都随机化窗口尺寸、User-Agent、时区和语言环境。这样你的爬虫看起来更像不同的真实用户,而不是一个换了 IP 的同一个机器人。
使用 TikTok 移动端 API 接口。 有些社区成员反馈,针对移动端风格接口而不是网页前端时,检测率更低。这个方法更难实现、文档也更少,但对高级用户来说确实是一种真实可用的技巧。
什么时候你真的需要代理,以及有哪些相对便宜的选择
当规模上去之后,免费技巧就不够用了。大批量 TikTok 爬取的标准做法就是家宽代理轮换。这里我不推荐具体的付费代理服务,但通用建议是:避开数据中心代理(TikTok 对它们的标记很激进),找支持按请求轮换的家宽或移动代理池。
另外,像 Thunderbit 这样的浏览器工具可以绕开代理问题,因为它直接运行在你的浏览器会话里,行为更像真实用户。这并不意味着它在大规模场景下完全不会被识别,但对于常见的营销或研究用途(几十到几百页,而不是几百万页)来说,这条路简单得多。
你到底能抓到什么数据?TikTok 爬虫的真实输出样本
用户在选择工具之前,最想知道的就是自己到底能拿到什么数据——而大多数指南根本不讲这个。下面是基于源文档整理出的代表性字段结构。
主页数据
| 用户名 | 显示名称 | 粉丝数 | 关注数 | 总点赞数 | 简介 | 是否认证 | 主页 URL |
|---|---|---|---|---|---|---|---|
| @examplecreator | Jane Doe | 1,240,000 | 312 | 48,700,000 | "Cooking + comedy 🍳" | ✅ | tiktok.com/@examplecreator |
| @travelwithmark | Mark S. | 890,000 | 150 | 22,100,000 | "Travel vlogger 🌍" | ❌ | tiktok.com/@travelwithmark |
| @fitnessmaya | Maya L. | 2,100,000 | 88 | 91,300,000 | "Workouts & wellness" | ✅ | tiktok.com/@fitnessmaya |
可获取来源: GitHub 爬虫(TikTok-Api、Evil0ctal)、Research API、Thunderbit(从可见主页页面抓取)。
视频元数据
| 视频 URL | 标题/文案 | 播放量 | 点赞 | 评论 | 分享 | 音乐 | 话题标签 | 发布时间 | 时长 |
|---|---|---|---|---|---|---|---|---|---|
| tiktok.com/@ex/video/123 | "Best pasta trick ever 🍝" | 4,200,000 | 312,000 | 8,400 | 21,000 | "Italian Vibes – DJ Marco" | #pasta #cooking #hack | 2026-03-15 | 0:42 |
| tiktok.com/@ex/video/456 | "POV: your cat judges you" | 9,100,000 | 1,100,000 | 23,000 | 55,000 | "Original Sound" | #cat #pov #funny | 2026-04-01 | 0:18 |
| tiktok.com/@ex/video/789 | "Morning routine nobody asked for" | 1,800,000 | 98,000 | 3,200 | 7,500 | "Chill Morning – LoFi" | #routine #morning | 2026-04-10 | 1:02 |
可获取来源: GitHub 爬虫(TikTok-Api、Evil0ctal)、Research API(字段包括 video_description、view_count、like_count、comment_count、share_count、music_id、hashtag_names、video_duration)、Thunderbit(视频级字段)。
评论数据
| 评论者 | 评论内容 | 点赞数 | 时间戳 | 回复数 |
|---|---|---|---|---|
| @user_abc | "I tried this and it actually works 😂" | 1,200 | 2026-03-16T08:12:00Z | 14 |
| @chef_dan | "Add garlic next time, trust me" | 890 | 2026-03-16T09:45:00Z | 7 |
| @randomfan99 | "This is the content I'm here for" | 340 | 2026-03-16T11:30:00Z | 2 |
可获取来源: GitHub 爬虫(TikTok-Api、Evil0ctal)、Research API(字段包括 text、like_count、reply_count、create_time)、Thunderbit(从可见评论区抓取)。
话题标签和搜索数据
| 话题标签 | 热门视频 URL | 总播放量 | 是否趋势中 |
|---|---|---|---|
| #pasta | tiktok.com/@ex/video/123 | 4,200,000 | 是 |
| #cooking | tiktok.com/@chef/video/321 | 11,000,000 | 是 |
| #hack | tiktok.com/@tips/video/654 | 2,900,000 | 否 |
可获取来源: GitHub 爬虫(取决于仓库)、Thunderbit(话题标签爬虫模板)。
注意:没有任何一个仓库能一直保证所有字段都可用。TikTok 的响应结构会变化,连维护者自己也会提醒这一点。所以上面这些只能视为代表性示例,不是绝对保证。
如何用 Thunderbit 两步抓取 TikTok 数据(逐步说明)
受够了反复修 bug 的循环?下面是无代码方案——如果你试过 GitHub 仓库但没成功,这就是你的逃生通道。
- 安装 Thunderbit Chrome 扩展。
- 打开你要抓取的 TikTok 页面——个人主页、搜索结果页、话题页,或单个视频页。
- 点击“AI Suggest Fields”。 Thunderbit 的 AI 会读取页面并自动建议字段:用户名、粉丝数、视频标题、点赞、话题标签等。
- 按需调整字段,然后点击“Scrape”。 数据会以结构化表格形式填充出来。
- 使用子页面抓取丰富数据。 从主页列表进入每个视频,抓取更多字段:完整标题、音乐信息、评论数、分享数。
- 导出到 Google Sheets、Excel、Airtable 或 Notion——完全免费。
无需维护、无需安装排障、无需配置反封禁。AI 会自动适应 TikTok 页面变化。
通过子页面抓取丰富 TikTok 数据
从主页或话题页抓取一批视频后,点击“Scrape Subpages”,让 AI 访问每个视频页面并提取更多字段。这对搭建网红数据库或做竞品内容审计的营销人员尤其有价值——你能得到完整的视频级互动数据表,而不用手动点开几十个页面。
导出并使用你的 TikTok 数据
Thunderbit 可免费导出到 Google Sheets、Excel、Airtable、Notion、CSV 或 JSON。常见用途包括:
- 把数据放进表格里做互动分析。
- 导入 Airtable,做成类似 CRM 的网红追踪表。
- 推送到 Notion,方便团队协作做内容研究。
如果你想更深入了解 Thunderbit 如何处理网页数据提取,可以看看我们的 网页爬虫新手指南 或在 Thunderbit YouTube 频道 观看教程。
保持合规:TikTok 服务条款与爬取合规性
TikTok 的法律立场很明确。平台关于爬取的 隐私博客 说明,其服务条款禁止使用自动化脚本收集信息或以未经授权的方式与服务交互,并明确提到绕过访问限制。TikTok 的 社区规范 也禁止通过自动化脚本或网页爬虫使用欺骗性手段获取信息。
实用建议:
- 只抓取公开可见的数据。 不要抓私有内容或登录后才能看到的内容。
- 尊重限流。 不要猛烈轰炸 TikTok 服务器。
- 遵守数据隐私法律。 如果你在收集、存储或分析个人数据,GDPR 和 CCPA 依然适用。
- 符合资格时优先使用 Research API。 从合规角度看,这是最安全的路径。
- 这不是法律意见。 具体情况请咨询专业人士。
如果你想进一步了解法律层面,可以看我们的 网页爬取法律影响 指南。
当你的 TikTok 爬虫 GitHub 仓库死掉时该怎么办
简短版:
- 在克隆 GitHub 上任何 TikTok 爬虫之前,先跑 60 秒仓库体检清单。 大多数仓库其实已经死了。
- 先弄清楚你的选择。 官方 API、GitHub 爬虫和无代码工具服务的是不同用户和不同场景。
- 如果你坚持走 GitHub 路线, 就要预留安装排障和反封禁配置的时间。后续维护是常态。
- 在决定使用某个工具前,先确认你到底能拿到什么数据。 看输出字段,不要只看星标数。
- 如果你不是开发者(或者你已经受够了坏掉的仓库),可以试试像 Thunderbit 这样的无代码工具——两步操作、结构化数据、免费导出。
你需要的 TikTok 数据其实是可以拿到的。问题只是:你想把时间花在维护爬虫上,还是直接使用数据。选择最符合你技能水平和使用场景的方法,别再让一个失效的 GitHub 仓库白白浪费你一个下午。
常见问题
2026 年还有能用的 GitHub TikTok 爬虫吗?
有,但名单很短。到 2026 年 4 月,最可信的开源选择是 davidteather/TikTok-Api,而且还在持续维护中。Evil0ctal/Douyin_TikTok_Download_API 也还活着,但更复杂。星标最多的仓库 drawrowfly/tiktok-scraper 自 2023 年 5 月后就没再更新,实际上已经死了。投入时间之前,一定要先跑一遍仓库体检清单。
抓取 TikTok 合法吗?
TikTok 的服务条款明确禁止自动化爬取。公开可见数据在法律上通常处于灰色地带,且会因司法管辖区而异。最稳妥的方式是,符合资格的研究者优先使用官方 Research API。如果你要抓取公开数据,只抓公开可访问内容、尊重限流,并遵守 GDPR/CCPA。这里不构成法律建议——请根据你的具体情况咨询专业人士。
不会写代码也能抓 TikTok 吗?
可以。像 Thunderbit 这样的浏览器 AI 工具,可以让你无需编写任何代码,就提取结构化 TikTok 数据(主页、视频元数据、话题标签、互动指标)。TikTok Research API 虽然也很官方,但获批后仍需要少量编码。对非开发者来说,无代码工具是最快、也最稳定的路径。
TikTok 爬虫通常能拿到哪些数据?
常见数据类型包括:主页信息(用户名、粉丝数、简介、认证状态)、视频元数据(标题、播放量、点赞、评论、分享、音乐、话题标签、时长、发布日期)、评论(内容、点赞、时间戳、回复数),以及话题标签/搜索数据(热门视频、总播放量、是否热门)。具体字段取决于工具和方法——详情请看上面的输出样本部分。
为什么我的 TikTok 爬虫老是被拦?
TikTok 使用了多层反爬机制:限流、Cookie/会话校验、浏览器指纹识别、行为检测、加密请求参数和验证码流程。常见的被拦原因包括:请求过快、每次都用全新干净的会话、无头浏览器指纹过于默认、或者使用数据中心代理。有关免费和付费绕过方案,请参考上面的反封禁最佳实践部分。


