Una búsqueda en GitHub de "tiktok scraper" devuelve 339 repositorios. Aproximadamente el 48% de ellos no ha recibido cambios en más de un año, y al menos 4 están archivados de forma explícita.
Si alguna vez clonaste un repo popular de TikTok scraper, te pasaste una hora peleándote con dependencias y al final no obtuviste ningún resultado, no eres el único. El TikTok scraper con más estrellas en GitHub, drawrowfly/tiktok-scraper, todavía supera las 5.000 estrellas. Pero su sistema de issues está lleno de hilos como #812: "is this amazing tool still working?" y #824: "Is this still working?", ambos reportando salida vacía. En Thunderbit llevo meses siguiendo el estado de los repos de scraping de TikTok, y el patrón es clarísimo: estas herramientas se rompen rápido y la mayoría nunca se arreglan. Este artículo es la guía práctica de supervivencia que me habría gustado tener cuando empecé a evaluar estos repos. Veremos cuáles siguen vivos, cuáles ya no sirven, qué alternativas existen y cómo dejar de perder horas con código que dejó de funcionar antes incluso de que lo encontraras.
Por qué la mayoría de los TikTok Scrapers en GitHub se rompen (y siguen rompiéndose)
TikTok no es un objetivo de scraping cualquiera. Su superficie web cambia todo el tiempo. A diferencia de una página estática de producto en e-commerce o un listado de directorio, TikTok rota endpoints, actualiza su huella anti-bots, modifica la forma de renderizar páginas e introduce nuevos requisitos de sesión o tokens — a veces en cuestión de semanas desde el último cambio.
Los mantenedores de código abierto son voluntarios. Cuando TikTok lanza una actualización que rompe la ruta de solicitudes del scraper, el repositorio puede quedarse roto durante días, semanas o para siempre. No es una crítica a los mantenedores: es una incompatibilidad estructural entre una plataforma rápida y bien financiada y desarrolladores no remunerados que además tienen otros trabajos.
Incluso los mejores repos de TikTok scraper viven en un ciclo constante de arreglar y volver a romper. Si vas a usar uno, necesitas una estrategia para evaluarlo, depurarlo y tener un plan B.
Defensas anti-bot de TikTok: contra lo que te enfrentas
- Límites de frecuencia. La documentación oficial para desarrolladores de TikTok deja claros los cupos de solicitudes incluso para integraciones aprobadas. Los scrapers no oficiales llegan a esos límites mucho antes.
- Bloqueo por cookies y sesión. Repos modernos como davidteather/TikTok-Api requieren un
ms_token; repos más antiguos como drawrowfly/tiktok-scraper muestrantt_webid_v2en sus ejemplos; Evil0ctal/Douyin_TikTok_Download_API documentamsToken,ttwid,X-BogusyA_Bogus. TikTok comprueba si tu solicitud parece venir de una sesión real de navegación. - Huella del navegador. La guía anti-bot de ScrapFly explica por qué los sitios comparan cabeceras, cookies, firmas TLS y rasgos del navegador expuestos por JavaScript con tráfico real. Su desglose de browser fingerprinting cubre Canvas, WebGL, WebRTC, fuentes y señales de ejecución. El fingerprinting es como si TikTok revisara el DNI de tu navegador: si el navegador, las cookies, el timing y la firma de red no cuadran, la petición parece falsa antes de que llegue cualquier contenido.
- Detección de comportamiento. En hilos de Reddit sobre scraping de TikTok se menciona a menudo que sesiones nuevas de Playwright disparan CAPTCHAs. Publicaciones de la comunidad de 2025–2026 describen cada vez más una detección basada en el ritmo de las acciones y la calidad de la interacción, no solo en la reutilización de IP.
- Parámetros cifrados o firmados. Evil0ctal documenta
X-BogusyA_Bogus; antiguos gists de la comunidad giran en torno a la firma de URL y la generación de tokens. TikTok espera cada vez más que las solicitudes lleguen con los mismos "sellos" que llevaría el tráfico de su propio navegador o app. - CAPTCHA y flujos de verificación. La existencia de repositorios específicos para resolver CAPTCHAs de TikTok y hilos en Reddit sobre desafíos tipo puzzle confirma que los CAPTCHA siguen formando parte de la capa anti-bot.
Por qué los mantenedores open source no pueden seguir el ritmo
El ciclo siempre es el mismo. Un desarrollador crea un TikTok scraper. Se vuelve viral en GitHub. TikTok lo parchea. El mantenedor lo arregla o se va.
Dos repos ilustran el patrón a la perfección:
- drawrowfly/tiktok-scraper sigue teniendo 5.052 estrellas y 889 forks, pero su último push fue el 19 de mayo de 2023. Es el TikTok scraper de frase exacta con más estrellas en GitHub, y hoy se lee como una pieza histórica: muy visible, aparentemente fiable, pero sin mantenimiento real.
- davidteather/TikTok-Api muestra 6.301 estrellas, 1.177 forks y un último push el 1 de abril de 2026. Su feed de releases muestra mantenimiento real en abril de 2025, julio de 2025, octubre de 2025 y abril de 2026, incluyendo correcciones para crawling de vídeos de usuarios y nuevos controles de proxy/sesión. Pero incluso este proyecto más sano advierte abiertamente que TikTok bloquea solicitudes y que los usuarios quizá necesiten proxies, Playwright y lógica personalizada de sesión.
El patrón es simple:
- Un repo obsoleto de TikTok scraper probablemente está muerto.
- Un repo activo de TikTok scraper probablemente sigue siendo frágil.
- La única diferencia real es si todavía hay alguien disponible para parchear el fallo este mes.
La checklist de 60 segundos para evaluar cualquier TikTok Scraper en GitHub
Antes de clonar nada, usa esta lista. Tarda menos de un minuto y te ahorra horas de frustración.
| Señal | 🟢 Saludable | 🟡 Riesgoso | 🔴 Muerto |
|---|---|---|---|
| Último push relevante | Hace menos de 3 meses | Entre 3 y 12 meses | Hace más de 12 meses |
| Número de issues abiertos | Bajo, y los issues recientes reciben respuesta | Crece, con algo de actividad del mantenedor | Muchos reportes sin respuesta de "roto/bloqueado/no funciona" |
| Quejas recientes de usuarios | Sobre todo dudas de configuración | Mezcla de dudas y fallos | "Salida cero", "403", "sigue funcionando?" de forma repetida |
| Modelo actual de auth/sesión | Documenta flujo de sesión/cookies | Basado en tokens pero bien explicado | Depende de endpoints web antiguos sin guía de autenticación actual |
| Superficie de instalación | Setup reproducible y probado | Algunos pasos manuales | Dependencias antiguas, sin notas de instalación modernas |
| CI/tests | Hay tests y están actualizados | Hay tests, pero no queda clara la cobertura | No hay tests o las acciones están desactualizadas |
| Ajuste con el alcance de datos | Encaja con tu caso real | Solo cubre parte del caso | Resuelve un problema distinto por completo |
Cómo comprobar cada señal en menos de 60 segundos
- Fecha del último push: Mira la cabecera del repo en GitHub. Si dice "last pushed 2 years ago", ya tienes la respuesta.
- Issues abiertos: Haz clic en la pestaña Issues. Revisa los títulos más recientes. Busca
not working,403,blocked,captchaozero output. - Quejas de usuarios: Si los 5 issues abiertos más recientes son variaciones de "esto ya no funciona", ahí está tu respuesta.
- Modelo de auth/sesión: Abre el README. Busca indicaciones actuales como
ms_token, configuración de Playwright o notas sobre proxies. Si el README sigue hablando de endpoints de 2023, sigue adelante. - Superficie de instalación: Comprueba si hay un archivo de requisitos, soporte para Docker o instrucciones claras de instalación. Si el README solo dice "npm install" y la última versión de Node probada es la 14, espera problemas.
- CI/tests: Revisa la pestaña Actions. Si los tests fallan o no existen, depurar se vuelve una apuesta.
- Alcance de datos: ¿El repo realmente describe los tipos de datos que necesitas (perfiles, metadatos de vídeos, comentarios, hashtags)? Muchos repos solo descargan vídeos, no extraen datos estructurados.
Señales de alerta que significan "aléjate"
- El repositorio está archivado.
- El README dice "no longer maintained".
- El último commit hace referencia a una versión de la API de TikTok de hace más de 2 años.
- Los issues están inundados de reportes de "no funciona" y el mantenedor no responde desde hace meses.
- El repo tiene muchas estrellas pero pocos forks o pull requests recientes.
Consejo: busca en Issues is:issue is:open "not working" o is:issue is:open "403". Si los resultados son numerosos y recientes, probablemente el repo esté roto.
Repos populares de TikTok Scraper en GitHub: una revisión honesta del estado actual (2026)

Aquí tienes la checklist aplicada a los repos que realmente encontrarás al buscar "tiktok scraper" en GitHub:
| Repo | Último push | Estrellas | Issues abiertos | Veredicto | Nota |
|---|---|---|---|---|---|
| drawrowfly/tiktok-scraper | 2023-05-19 | 5,052 | 58 | 🔴 Muerto / solo como referencia | Sigue siendo famoso, pero demasiado obsoleto para producción en 2026 |
| davidteather/TikTok-Api | 2026-04-01 | 6,301 | 134 | 🟡 Vivo pero de alto mantenimiento | La mejor opción OSS; espera Playwright, tokens y, a menudo, proxies |
| scrapfly/scrapfly-scrapers/tiktok-scraper | 2026-04-21 | 938 (parent) | ~0 (monorepo) | 🟡 Vivo, pero no es OSS puro | Actual y útil, pero requiere clave de API de ScrapFly |
| Evil0ctal/Douyin_TikTok_Download_API | 2025-10-12 | 17,397 | 135 | 🟡 Vivo, amplio y complejo | Proyecto multiplataforma muy completo; más cercano a una plataforma para usuarios avanzados |
| naseif/tiktok-scraper | 2024-07-26 | 107 | 13 | 🟡 Riesgoso | Repo pequeño con quejas abiertas sobre datos de usuario y flujos de hashtags |
| loewehancara1rmyv/Tiktok-scraper | 2026-01-12 | 4 | 0 | 🔴 Demasiado nuevo para confiar | Repo de demostración, no validado por la comunidad |
drawrowfly/tiktok-scraper
Durante años, este scraper/descargador en TypeScript fue la respuesta por defecto a "tiktok scraper github" — cubriendo feeds de usuarios, tendencias, hashtags y música. En 2026, conviene tratarlo como documentación histórica. El último push fue en mayo de 2023, y la cola de issues sigue teniendo reportes sin resolver de "still working?" y "zero output" de 2023–2025. Si estás leyendo este artículo porque clonaste este repo y no obtuviste nada, estás en buena compañía.
davidteather/TikTok-Api
La envoltura open source de datos de TikTok más creíble que sigue viva en 2026. Está activa, tiene releases recientes y documenta explícitamente la configuración de Playwright, el uso asíncrono, la gestión de tokens, el soporte de proxies y funciones de recuperación de sesión. Pero no es una herramienta de "clonar y listo". Su propio README dice que EmptyResponseException normalmente significa que TikTok está bloqueando la solicitud, y el historial de discusiones muestra problemas repetidos con ms_token, extracción rota de comentarios, KeyError: 'ItemModule' y fallos específicos de endpoint. Veredicto: vivo, útil, pensado para desarrolladores y con bastante mantenimiento.
Otros repositorios destacables
- scrapfly/scrapfly-scrapers/tiktok-scraper: Actual y técnicamente relevante, pero el README exige una
SCRAPFLY_KEY. Es un ejemplo de código para una plataforma de scraping gestionada, no una herramienta gratuita e independiente. - Evil0ctal/Douyin_TikTok_Download_API: Cubre TikTok y Douyin, documenta lógica de firmado (
X-Bogus,A_Bogus,msToken) y admite comentarios, seguidores, playlists y más. Es técnicamente exigente y cada vez más dependiente de referencias de API de pago. El issue tracker muestra bugs activos en 2026 relacionados con enlaces de vídeo y endpoints de información de usuario. Vivo y muy completo, pero complejo. - naseif/tiktok-scraper: Más pequeño, con quejas abiertas. Riesgoso para producción.
- loewehancara1rmyv/Tiktok-scraper: 4 estrellas, 0 issues, demasiado nuevo para confiar. El artículo de Medium que lo promovió lo hizo sin demasiada crítica.
API oficial de TikTok vs. scrapers de GitHub vs. herramientas no-code: un marco de decisión

La mayoría de artículos de la competencia ignoran las vías oficiales de acceso de TikTok o saltan directamente de "usa GitHub" a "compra nuestro servicio". Aquí tienes una comparación neutral de las tres rutas:
| Factor | TikTok Research API | Scrapers de GitHub | Herramientas no-code (p. ej., Thunderbit) |
|---|---|---|---|
| Barrera de acceso | Requiere solicitud académica o empresarial; ~4 semanas para aprobación | Git clone + configuración | Instalación de extensión de navegador |
| Alcance de datos | Solo endpoints aprobados (cuentas, vídeos, comentarios, tiendas) | Amplio (perfiles, vídeos, comentarios, hashtags, tiendas) | Datos visibles de la página (perfiles, vídeos, engagement, hashtags) |
| Carga de mantenimiento | Baja (oficial y estable) | Alta (los repos se rompen cuando TikTok actualiza) | Ninguna (la IA se adapta a cambios de diseño) |
| Riesgo de baneo | Ninguno (autorizado) | Alto | Bajo (basado en navegador, imita a un usuario real) |
| Coste | Gratis (si aprueban la solicitud) | Gratis (pero consume mucho tiempo) | Hay plan gratuito; planes por créditos desde $15/mes |
| Requiere programar | Sí (Python/R) | Sí (Python/Node.js) | No |
| Ideal para | Investigadores, académicos, organizaciones aprobadas | Desarrolladores cómodos con el mantenimiento | Equipos de marketing, ventas, operaciones y perfiles no técnicos |
Cuándo tiene sentido la TikTok Research API
La Research API de TikTok es la vía oficial más limpia si cumples los requisitos. Los investigadores elegibles en EE. UU., Europa y Brasil pueden solicitar acceso para estudiar contenido público y datos de cuentas. Las categorías disponibles incluyen cuentas, seguidores/seguidos, vídeos marcados como favoritos, vídeos fijados, vídeos republicados, contenido, comentarios y tiendas.
El codebook expone campos como video_description, view_count, like_count, comment_count, share_count y, a nivel de comentario, text, reply_count y create_time.
La desventaja es clara: la elegibilidad se limita a instituciones académicas e investigadores independientes o sin ánimo de lucro en regiones concretas, además de investigadores verificados bajo el proceso DSA de la UE. Si eres un equipo de growth o una agencia que necesita datos operativos rápidos, esta no es tu vía.
TikTok también ofrece una Commercial Content API para anuncios y datos de contenido de anunciantes, útil para investigación de transparencia, pero no para scraping general.
Cuándo todavía tiene sentido un scraper de GitHub
Los scrapers de GitHub siguen teniendo sentido para desarrolladores que necesitan acceso no oficial a datos públicos más allá del filtro de aprobación de la API oficial y están dispuestos a mantener la pila. Esto incluye casos de uso como extraer grids visibles de perfiles, hashtags, comentarios, playlists o metadatos de vídeos en un pipeline personalizado donde forkar el repo y parchearlo sea aceptable.
La advertencia honesta: esto no es una configuración de una sola vez. Incluso el repo más fiable de 2026, davidteather/TikTok-Api, sigue avisando a los usuarios de que quizá necesiten Playwright, cookies/tokens, proxies y fábricas personalizadas de páginas/sesiones.
Cuándo tiene sentido una herramienta no-code como Thunderbit
Extrae datos de TikTok con IA Get Started Free
¿No eres desarrollador? ¿O sí lo eres, pero ya estás cansado del ciclo de arreglar y romper? Una herramienta de IA basada en navegador es la forma más rápida de obtener datos estructurados de TikTok.
Construimos Thunderbit como un ai web scraper que funciona como extensión de Chrome. En TikTok, lee cualquier página visible (perfil, vídeo, hashtag, resultados de búsqueda), sugiere columnas mediante "AI Suggest Fields" y te permite hacer clic en "Scrape" para extraer datos estructurados. La página de la herramienta TikTok scraper documenta campos como fecha de publicación, duración del vídeo, likes, shares, guardados, comentarios, visualizaciones y hashtags. La plantilla de image scraper muestra cómo recopilar miniaturas, URLs, descripciones, cuentas del creador y señales de engagement desde páginas de perfil. La plantilla de hashtag scraper cubre URL del vídeo, nombre de usuario del creador, descripción, hora de publicación, visualizaciones, likes, comentarios, shares, sonido/audio e URL de la imagen de portada.
El scraping de subpáginas te permite entrar a cada página de vídeo desde un listado de perfil y enriquecer la tabla con métricas de engagement, captions y hashtags — muy útil para marketers que crean bases de datos de influencers o auditorías de contenido de la competencia.
Sin mantenimiento, sin problemas de instalación, sin configuración anti-bot. La IA se adapta automáticamente a los cambios de diseño. La exportación a Google Sheets, Excel, Airtable, Notion, CSV o JSON es gratis.
Si ya has perdido horas con repos rotos de GitHub, esta es una alternativa real, no un simple discurso comercial.
Probar Thunderbit para scraping de TikTok
Triage de instalación: cómo arreglar los 5 fallos más comunes al configurar TikTok Scrapers de GitHub
Los fallos de instalación son el tercer punto de dolor más mencionado en los foros de scraping de TikTok, y ninguna guía importante ayuda de verdad a solucionarlos. Esto es lo que suele salir mal.
Conflictos de versión de Node.js
Problema: Muchos repos antiguos de TikTok scraper, especialmente drawrowfly/tiktok-scraper, se construyeron para Node.js 14–16. Si usas Node 20+, npm install puede fallar en silencio o generar binarios incompatibles.
Solución: Usa nvm (Node Version Manager) para instalar y cambiar a la versión correcta:
nvm install 16
nvm use 16
npm install
Si el repo no especifica una versión de Node, revisa el campo engines en package.json o la configuración de CI.
Problemas con dependencias de Python y configuración de Playwright
Problema: davidteather/TikTok-Api requiere Python 3.9+ y Playwright con binarios específicos del navegador. Los usuarios se encuentran con errores como "browser not found" o conflictos de dependencias.
Solución: Usa siempre un entorno virtual y luego instala explícitamente los navegadores de Playwright:
python -m venv .venv
source .venv/bin/activate # En Windows: .venv\Scripts\activate
pip install TikTokApi
python -m playwright install
Si playwright install falla, revisa el gestor de paquetes de tu sistema por dependencias faltantes (por ejemplo, libnss3 en Ubuntu).
Errores de permisos en Linux/Ubuntu
Problema: Ejecutar sudo pip install corrompe el entorno Python del sistema y provoca problemas en cascada con las dependencias.
Solución: Nunca uses sudo pip install. Crea siempre primero un entorno virtual:
python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
Así aislas las dependencias del scraper del Python del sistema.
Problemas de rutas y codificación en Windows
Problema: CMD de Windows tiene problemas de codificación y límites de longitud de rutas que rompen la instalación de scrapers, especialmente cuando Playwright descarga binarios del navegador en directorios muy anidados.
Solución: Usa WSL (Windows Subsystem for Linux) o Git Bash en lugar de CMD. WSL te da un entorno Linux completo dentro de Windows:
wsl --install
# Luego abre una terminal WSL y sigue los pasos de configuración en Linux
El atajo con Docker: evita por completo los problemas de dependencias
Problema: Todo lo anterior.
Solución: Si te sientes cómodo con Docker, contenediza el entorno del scraper. Un Dockerfile básico para un TikTok scraper en Python sería así:
FROM python:3.11-slim
RUN apt-get update && apt-get install -y libnss3 libatk-bridge2.0-0 libdrm2 libxcomposite1 libxdamage1 libxrandr2 libgbm1 libasound2
RUN pip install TikTokApi playwright && python -m playwright install --with-deps chromium
WORKDIR /app
COPY . .
CMD ["python", "scrape.py"]
Esto garantiza un entorno reproducible independientemente del sistema operativo anfitrión. Si el scraper funciona en Docker, cualquier fallo fuera de Docker es un problema de entorno, no de código.
Flujograma de depuración:
- ¿El repo puede ejecutar su propio ejemplo con éxito? → Si no, revisa la versión de ejecución.
- ¿La versión de ejecución es correcta? → Comprueba la instalación del navegador/Playwright.
- ¿El navegador está instalado? → Revisa tokens/cookies.
- ¿Tokens/cookies válidos? → Comprueba si TikTok está bloqueando la sesión.
- ¿Todo lo anterior falla? → Asume que el repo está roto, no que el usuario se equivocó. Cambia de herramienta.
Buenas prácticas anti-baneo para scraping de TikTok (sin pagar proxies)
Los usuarios de foros se quejan una y otra vez de baneos y detección: "te terminan baneando las cuentas, lo que supone un gasto extra" y "sin usar Apify o APIs de pago caras". Aquí tienes alternativas prácticas y gratuitas que no requieren suscripción a un proxy de pago.

| Práctica | Dificultad | Coste | Eficacia |
|---|---|---|---|
| Retrasos aleatorios entre solicitudes (jitter de 2–8 s) | Fácil | Gratis | Media |
| Rotación de sesión/cookies | Media | Gratis | Media |
| Extraer solo páginas públicas sin iniciar sesión | Fácil | Gratis | Media |
Respetar robots.txt + cabeceras de rate limit | Fácil | Gratis | Base |
| Aleatorización de fingerprint en navegador sin interfaz (Playwright) | Media | Gratis | Alta |
| Usar endpoints móviles de TikTok (menos detección) | Difícil | Gratis | Alta |
| Rotación de proxies residenciales | Media | 20–100 USD/mes | Alta |
Técnicas gratuitas que sí ayudan
Retrasos aleatorios entre solicitudes. No lances peticiones en bucle cerrado. Añade un jitter aleatorio de 2 a 8 segundos entre cada una. Es la forma más fácil de mejorar tu scraping:
import time, random
time.sleep(random.uniform(2, 8))
Reutilización de sesión y cookies. No crees una sesión nueva para cada solicitud. Reutiliza cookies y estado de sesión en un lote de peticiones y luego rota. Por eso los repos modernos piden ms_token en vez de prometer scraping sin estado.
Extrae solo páginas públicas sin iniciar sesión. TikTok-Api dice explícitamente que no admite rutas autenticadas y que solo funciona con datos visibles cuando no has iniciado sesión. El scraping sin sesión autenticada tiene un perfil de detección más bajo que las sesiones autenticadas.
Respeta robots.txt. El robots.txt actual de TikTok bloquea muchos agentes por completo y solo permite un conjunto limitado de rutas públicas para crawling general. No es un permiso para hacer scraping agresivo, pero respetarlo reduce la probabilidad de un bloqueo inmediato de IP.
Técnicas intermedias para aumentar la tasa de éxito
Aleatorización de fingerprint en navegador sin interfaz. Si usas Playwright, aleatoriza el tamaño de viewport, el user-agent, la zona horaria y la configuración regional en cada sesión. Así tu scraper parece un usuario real distinto cada vez, en vez del mismo bot con una IP nueva.
Uso de endpoints móviles de TikTok. Algunos miembros de la comunidad reportan menores tasas de detección al apuntar a endpoints de estilo móvil en lugar del frontend web. Es más difícil de implementar y está menos documentado, pero es una técnica real para usuarios avanzados.
Cuándo sí necesitas un proxy (y opciones asequibles)
A escala, las técnicas gratuitas no bastan. La rotación de proxies residenciales es el enfoque estándar para scraping de TikTok en grandes volúmenes. No voy a recomendar un proveedor concreto aquí, pero el consejo general es: evita proxies de datacenter (TikTok los marca de forma agresiva) y busca pools de proxies residenciales o móviles con rotación por solicitud.
Como alternativa, herramientas basadas en navegador como Thunderbit evitan por completo la cuestión del proxy porque se ejecutan en tu propia sesión del navegador, imitando a un usuario real. Eso no las hace inmunes a la detección a gran escala, pero para casos de uso típicos de marketing o investigación (decenas o cientos de páginas, no millones), es una vía mucho más simple.
¿Qué datos obtienes realmente? Ejemplos reales de salida de TikTok Scrapers
Los usuarios quieren saber qué datos van a obtener antes de comprometerse con una herramienta, y la mayoría de guías se salta esta parte por completo. Aquí tienes estructuras de campos representativas basadas en la documentación fuente.
Datos de perfil
| Nombre de usuario | Nombre visible | Seguidores | Siguiendo | Me gusta totales | Bio | Verificado | URL del perfil |
|---|---|---|---|---|---|---|---|
| @examplecreator | Jane Doe | 1,240,000 | 312 | 48,700,000 | "Cooking + comedy 🍳" | ✅ | tiktok.com/@examplecreator |
| @travelwithmark | Mark S. | 890,000 | 150 | 22,100,000 | "Travel vlogger 🌍" | ❌ | tiktok.com/@travelwithmark |
| @fitnessmaya | Maya L. | 2,100,000 | 88 | 91,300,000 | "Workouts & wellness" | ✅ | tiktok.com/@fitnessmaya |
Disponible desde: scrapers de GitHub (TikTok-Api, Evil0ctal), Research API, Thunderbit (desde páginas de perfil visibles).
Metadatos de vídeo
| URL del vídeo | Caption | Visualizaciones | Me gusta | Comentarios | Compartidos | Música | Hashtags | Fecha de publicación | Duración |
|---|---|---|---|---|---|---|---|---|---|
| tiktok.com/@ex/video/123 | "Best pasta trick ever 🍝" | 4,200,000 | 312,000 | 8,400 | 21,000 | "Italian Vibes – DJ Marco" | #pasta #cooking #hack | 2026-03-15 | 0:42 |
| tiktok.com/@ex/video/456 | "POV: your cat judges you" | 9,100,000 | 1,100,000 | 23,000 | 55,000 | "Original Sound" | #cat #pov #funny | 2026-04-01 | 0:18 |
| tiktok.com/@ex/video/789 | "Morning routine nobody asked for" | 1,800,000 | 98,000 | 3,200 | 7,500 | "Chill Morning – LoFi" | #routine #morning | 2026-04-10 | 1:02 |
Disponible desde: scrapers de GitHub (TikTok-Api, Evil0ctal), Research API (los campos incluyen video_description, view_count, like_count, comment_count, share_count, music_id, hashtag_names, video_duration), Thunderbit (campos a nivel de vídeo).
Datos de comentarios
| Usuario que comenta | Texto del comentario | Me gusta | Marca de tiempo | Respuestas |
|---|---|---|---|---|
| @user_abc | "I tried this and it actually works 😂" | 1,200 | 2026-03-16T08:12:00Z | 14 |
| @chef_dan | "Add garlic next time, trust me" | 890 | 2026-03-16T09:45:00Z | 7 |
| @randomfan99 | "This is the content I'm here for" | 340 | 2026-03-16T11:30:00Z | 2 |
Disponible desde: scrapers de GitHub (TikTok-Api, Evil0ctal), Research API (campos como text, like_count, reply_count, create_time), Thunderbit (desde secciones de comentarios visibles).
Datos de hashtags y búsqueda
| Hashtag | URL del vídeo principal | Visualizaciones acumuladas | Tendencia |
|---|---|---|---|
| #pasta | tiktok.com/@ex/video/123 | 4,200,000 | Sí |
| #cooking | tiktok.com/@chef/video/321 | 11,000,000 | Sí |
| #hack | tiktok.com/@tips/video/654 | 2,900,000 | No |
Disponible desde: scrapers de GitHub (varía según el repo), Thunderbit (plantilla de hashtag scraper).
Nota: ningún repo garantiza todos los campos todo el tiempo. La estructura de respuesta de TikTok cambia, y hasta los mantenedores lo advierten. Tómalos como ejemplos representativos, no como garantías.
Cómo extraer datos de TikTok en 2 clics con Thunderbit (paso a paso)
¿Cansado del ciclo de arreglar y romper? Aquí va la ruta no-code — la salida de emergencia para cualquiera que haya probado repos de GitHub y haya fracasado.
- Instala la extensión de Chrome de Thunderbit.
- Abre la página de TikTok que quieras extraer — un perfil, una página de resultados de búsqueda, una página de hashtags o un vídeo individual.
- Haz clic en "AI Suggest Fields". La IA de Thunderbit lee la página y sugiere columnas: nombre de usuario, seguidores, caption del vídeo, likes, hashtags, etc.
- Ajusta los campos si hace falta y luego pulsa "Scrape". Los datos se vuelcan en una tabla estructurada.
- Usa el scraping de subpáginas para enriquecer los datos. Entra en cada vídeo desde un listado de perfil y extrae campos adicionales: caption completo, detalles de la música, número de comentarios, número de compartidos.
- Exporta a Google Sheets, Excel, Airtable o Notion — completamente gratis.
Sin mantenimiento, sin problemas de instalación, sin configuración anti-bot. La IA se adapta automáticamente a los cambios de diseño de TikTok.
Enriquecer datos de TikTok con scraping de subpáginas
Después de extraer una lista de vídeos desde un perfil o una página de hashtags, haz clic en "Scrape Subpages" para que la IA visite cada página de vídeo y capture campos adicionales. Es especialmente útil para marketers que crean bases de datos de influencers o hacen auditorías de contenido de la competencia: obtienes una tabla completa de engagement a nivel de vídeo sin tener que abrir manualmente decenas de páginas.
Exportar y usar tus datos de TikTok
Thunderbit exporta a Google Sheets, Excel, Airtable, Notion, CSV o JSON — todo gratis. Casos de uso comunes:
- Volcar los datos en una hoja de cálculo para analizar el engagement.
- Enviarlos a Airtable para un tracker de influencers estilo CRM.
- Pasarlos a Notion para colaborar en equipo en la investigación de contenido.
Para profundizar en cómo Thunderbit maneja la extracción de datos web, consulta nuestra guía para principiantes de web scraping o mira tutoriales en el canal de YouTube de Thunderbit.
Mantenerse dentro de la ley: términos de servicio de TikTok y cumplimiento en scraping
La postura legal de TikTok es clara. El blog de privacidad sobre scraping de la plataforma dice que sus Términos de Servicio prohíben scripts automatizados que recopilen información o interactúen con el servicio de forma no autorizada, y menciona explícitamente eludir restricciones de acceso. Las Normas de la comunidad de TikTok también prohíben intentos engañosos de obtener información mediante scripts automatizados o crawling web.
Guía práctica:
- Limítate a datos públicos. No extraigas contenido privado ni protegido por login.
- Respeta los límites de frecuencia. No bombardees los servidores de TikTok.
- Cumple las leyes de privacidad de datos. GDPR y CCPA siguen aplicando si recopilas, almacenas o analizas datos personales.
- Usa la Research API cuando seas elegible. Es la vía más segura desde el punto de vista de cumplimiento.
- Esto no es asesoramiento legal. Consulta a un profesional para tu caso concreto.
Para más información sobre el panorama legal, revisa nuestra guía sobre implicaciones legales del web scraping.
Qué hacer cuando tu repo de TikTok Scraper en GitHub muere
Resumen rápido:
- Ejecuta siempre la checklist de 60 segundos del estado del repo antes de clonar cualquier TikTok scraper de GitHub. La mayoría de repos ya está muerta.
- Entiende tus opciones. La API oficial, los scrapers de GitHub y las herramientas no-code sirven a usuarios y casos distintos.
- Si eliges GitHub, reserva tiempo para resolver la instalación y configurar la protección anti-baneo. Espera mantenimiento continuo.
- Sabe qué datos vas a obtener realmente antes de comprometerte con una herramienta. Revisa los campos de salida, no solo el número de estrellas.
- Si no eres desarrollador (o estás cansado de repos rotos), prueba una herramienta no-code como Thunderbit — dos clics, datos estructurados, exportación gratis.
Los datos de TikTok que necesitas sí son accesibles. La pregunta es si quieres gastar tu tiempo manteniendo un scraper o usando realmente los datos. Elige el enfoque que encaje con tu nivel y tu caso de uso, y no dejes que un repo muerto de GitHub te arruine otra tarde.
Probar Thunderbit para datos de TikTok
FAQs
¿Hay algún TikTok scraper en GitHub que siga funcionando en 2026?
Sí, pero la lista es corta. davidteather/TikTok-Api es la opción open source más creíble con mantenimiento activo a abril de 2026. Evil0ctal/Douyin_TikTok_Download_API también sigue vivo, pero es más complejo. El repo con más estrellas, drawrowfly/tiktok-scraper, no se actualiza desde mayo de 2023 y en la práctica está muerto. Ejecuta siempre la checklist de estado del repo antes de invertir tiempo en cualquiera.
¿Es legal extraer datos de TikTok?
Los Términos de Servicio de TikTok prohíben explícitamente el scraping automatizado. Los datos visibles públicamente ocupan una zona legal gris que varía según la jurisdicción. La vía más segura es la Research API oficial para investigadores elegibles. Si extraes datos públicos, limítate a contenido accesible públicamente, respeta los límites de frecuencia y cumple con GDPR/CCPA. Esto no es asesoramiento legal: consulta a un profesional para tu caso.
¿Puedo extraer datos de TikTok sin programar?
Sí. Herramientas de IA basadas en navegador como Thunderbit te permiten extraer datos estructurados de TikTok (perfiles, metadatos de vídeo, hashtags, métricas de engagement) sin escribir código. La TikTok Research API también requiere muy poco código para quienes son aprobados. Para perfiles no técnicos, las herramientas no-code son la vía más rápida y fiable.
¿Qué datos puedo obtener con un TikTok scraper?
Los tipos de datos más comunes incluyen información de perfil (nombre de usuario, seguidores, bio, estado de verificación), metadatos de vídeo (caption, visualizaciones, likes, comentarios, compartidos, música, hashtags, duración, fecha de publicación), comentarios (texto, likes, marca de tiempo, respuestas) y datos de hashtags/búsqueda (vídeos principales, visualizaciones acumuladas, estado de tendencia). Los campos exactos dependen de la herramienta y del método; mira la sección de ejemplos de salida arriba para más detalles.
¿Por qué mi TikTok scraper sigue siendo bloqueado?
TikTok usa varias capas de defensa anti-bot: límites de frecuencia, bloqueo por cookies/sesión, fingerprinting del navegador, detección de comportamiento, parámetros cifrados en las solicitudes y flujos con CAPTCHA. Las causas más comunes del bloqueo son enviar solicitudes demasiado rápido, usar una sesión limpia/nueva para cada petición, ejecutar un navegador sin interfaz con fingerprints por defecto o usar proxies de datacenter. Consulta la sección de buenas prácticas anti-baneo para ver alternativas gratuitas y de pago.


