La maggior parte degli scraper TikTok su GitHub è morta — ecco cosa fare

Ultimo aggiornamento il July 8, 2026
La maggior parte degli scraper TikTok su GitHub è morta — ecco cosa fare

Una ricerca su GitHub per "tiktok scraper" restituisce 339 repository. Circa il 48% non riceve aggiornamenti da oltre un anno e almeno 4 sono esplicitamente archiviati.

Se hai mai clonato un repo molto popolare per lo scraping di TikTok, perso un’ora a litigare con le dipendenze e poi ottenuto zero risultati, sappi che non sei il solo. Il TikTok scraper con più stelle su GitHub, drawrowfly/tiktok-scraper, ha ancora oltre 5.000 stelle. Però nella sezione issue compaiono thread come #812: "is this amazing tool still working?" e #824: "Is this still working?", entrambi con output pari a zero. In Thunderbit seguiamo da mesi lo stato dei repository per TikTok scraping, e il quadro è chiarissimo: questi strumenti si rompono in fretta e quasi mai vengono sistemati. Questo articolo è la guida pratica che avrei voluto trovare quando ho iniziato a valutare questi repo. Vedremo cosa è ancora vivo, cosa è ormai morto, cosa usare al posto loro e come smettere di buttare ore su codice che aveva già smesso di funzionare prima ancora che tu lo trovassi.

Perché la maggior parte dei TikTok Scraper su GitHub si rompe e continua a rompersi

TikTok non è un bersaglio da scraping come gli altri. La sua superficie web cambia di continuo. A differenza di una pagina prodotto statica di e-commerce o di un elenco di directory, TikTok ruota gli endpoint, aggiorna i sistemi anti-bot basati sul fingerprinting, modifica il rendering delle pagine e introduce nuovi requisiti di sessione e token, a volte nel giro di poche settimane dall’ultimo cambiamento.

Chi mantiene un progetto open source lo fa nel tempo libero. Quando TikTok rilascia un aggiornamento che manda in crisi il percorso di richiesta del scraper, il repository può restare rotto per giorni, settimane o per sempre. Non è una critica ai maintainer: è uno scontro strutturale tra una piattaforma veloce e ben finanziata e sviluppatori non retribuiti che hanno anche un lavoro.

Anche i migliori repository per TikTok scraper vivono in un ciclo continuo di rotture e correzioni. Se vuoi usarne uno, ti serve una strategia per valutarlo, risolvere i problemi e avere un piano B.

Le difese anti-bot di TikTok: contro cosa stai lavorando

  • Rate limiting. La documentazione ufficiale per sviluppatori di TikTok indica chiaramente quote di richieste anche per le integrazioni autorizzate. Gli scraper non ufficiali raggiungono questi limiti molto più in fretta.
  • Protezione tramite cookie e sessione. I repository moderni, come davidteather/TikTok-Api, richiedono un ms_token; repo più vecchi come drawrowfly/tiktok-scraper mostrano tt_webid_v2 negli esempi; Evil0ctal/Douyin_TikTok_Download_API documenta msToken, ttwid, X-Bogus e A_Bogus. TikTok controlla se la tua richiesta assomiglia davvero a una normale sessione di navigazione.
  • Browser fingerprinting. La guida anti-bot di ScrapFly spiega perché i siti confrontano header, cookie, firme TLS e segnali del browser esposti da JavaScript con il traffico reale degli utenti. Il loro approfondimento sul fingerprinting copre Canvas, WebGL, WebRTC, font e segnali runtime. In pratica, TikTok controlla la “carta d’identità” del tuo browser: se browser, cookie, tempi e firma di rete non combaciano, la richiesta appare falsa ancora prima che venga restituito qualsiasi contenuto.
  • Rilevamento comportamentale. I thread su Reddit sullo scraping di TikTok citano spesso sessioni Playwright appena create che fanno scattare CAPTCHA. I post della community del 2025–2026 descrivono sempre più spesso sistemi di rilevamento che analizzano tempistiche e qualità delle interazioni, non solo il riuso dell’IP.
  • Parametri di richiesta cifrati/firmati. Evil0ctal documenta X-Bogus e A_Bogus; nei vecchi gist della community si parla soprattutto di signing degli URL e generazione di token. TikTok si aspetta sempre più spesso richieste con gli stessi “timbri” che porterebbe il traffico del suo browser o della sua app.
  • CAPTCHA e flussi di verifica. L’esistenza di repo per resolver CAPTCHA specifici per TikTok e di thread su Reddit con puzzle challenge conferma che il CAPTCHA fa ancora parte della superficie anti-bot.

Perché i maintainer open source non riescono a stare al passo

Il ciclo è sempre lo stesso. Uno sviluppatore crea un TikTok scraper. Su GitHub esplode di popolarità. TikTok lo patcha. Il maintainer lo sistema oppure passa oltre.

Due repository mostrano perfettamente questo schema:

  • drawrowfly/tiktok-scraper ha ancora 5.052 stelle e 889 fork, ma il suo ultimo push risale al 19 maggio 2023. È il repository con più stelle per la query esatta “tiktok scraper” su GitHub, ma oggi somiglia più a un reperto storico: molto visibile, molto fidato in passato, ma non più mantenuto.
  • davidteather/TikTok-Api mostra 6.301 stelle, 1.177 fork e l’ultimo push al 1 aprile 2026. Il suo feed delle release mostra manutenzione concreta ad aprile 2025, luglio 2025, ottobre 2025 e aprile 2026, inclusi fix per il crawling dei video utente e nuovi controlli su proxy e sessioni. Ma anche questo progetto più sano avverte apertamente che TikTok blocca le richieste e che potrebbero servire proxy, Playwright e logica di sessione personalizzata.

Il modello è semplice:

  • Un repository TikTok scraper datato è probabilmente morto.
  • Un repository TikTok scraper attivo è probabilmente ancora fragile.
  • L’unica vera differenza è se c’è ancora qualcuno che lo può patchare questo mese.

La checklist dei vitali del repository in 60 secondi: come valutare qualsiasi TikTok Scraper su GitHub

Prima di clonare qualunque cosa, usa questa checklist. Richiede meno di un minuto e ti evita ore di frustrazione.

Segnale🟢 Sano🟡 Rischioso🔴 Morto
Ultimo push significativo< 3 mesi fa3–12 mesi faOltre 12 mesi fa
Numero di issue aperteBasso, e quelle recenti ricevono rispostaCrescente, con qualche attività del maintainerMolti report senza risposta tipo "broken/blocked/not working"
Reclami recenti degli utentiSoprattutto domande di configurazioneMiscela di setup e rottureRipetuti "zero output", "403", "still working?"
Modello attuale di auth/sessionePercorso sessione/cookie documentatoMolti token, ma documentatiSi basa su vecchi endpoint web senza guida aggiornata
Superficie di installazioneSetup riproducibile e testatoAlcuni passaggi manualiVecchie dipendenze, nessuna nota moderna di setup
CI/testI test esistono e sono attualiI test esistono ma la copertura è poco chiaraNessun test o action obsolete
Aderenza al tuo caso d’usoCoincide con ciò che ti serve davveroCopre solo una parte del caso d’usoRisolve un problema diverso

Come controllare ogni segnale in meno di 60 secondi

  1. Data dell’ultimo push: guarda l’intestazione del repository su GitHub. Se dice “last pushed 2 years ago”, puoi già fermarti.
  2. Issue aperte: apri la scheda Issues. Scorri i titoli più recenti. Cerca not working, 403, blocked, captcha o zero output.
  3. Reclami degli utenti: se le prime 5 issue aperte sono tutte varianti di “non funziona più”, hai già la risposta.
  4. Modello auth/sessione: apri il README. Cerca indicazioni attuali come ms_token, setup di Playwright o note sui proxy. Se il README cita endpoint del 2023, lascia perdere.
  5. Superficie di installazione: controlla se c’è un file requirements, supporto Docker o istruzioni chiare. Se il README dice “npm install” e l’ultima versione di Node testata è 14, preparati ai problemi.
  6. CI/test: controlla la scheda Actions. Se i test falliscono o non ci sono, i problemi diventano solo ipotesi.
  7. Aderenza ai dati: il repo descrive davvero i tipi di dati che ti servono (profili, metadati dei video, commenti, hashtag)? Molti repo scaricano solo i video e non estraggono dati strutturati.

Campanelli d’allarme che significano “lascia perdere”

  • Il repository è archiviato.
  • Il README dice “no longer maintained”.
  • L’ultimo commit cita una versione dell’API TikTok vecchia di più di 2 anni.
  • Le issue sono piene di report “doesn't work” e il maintainer non risponde da mesi.
  • Il repo ha molte stelle ma pochi fork recenti o pull request.

Suggerimento utile: cerca nella scheda Issues is:issue is:open "not working" oppure is:issue is:open "403". Se i risultati sono numerosi e recenti, il repository è probabilmente rotto.

I repository GitHub più popolari per TikTok scraper: controllo onesto dello stato nel 2026

tiktok_scraper_repo_status_v1_a5c4a7a45c.png

Ecco la checklist dei vitali del repository applicata ai repo che troverai davvero cercando “tiktok scraper” su GitHub:

RepoUltimo pushStelleIssue aperteVerdettoNota
drawrowfly/tiktok-scraper2023-05-195,05258🔴 Morto / solo riferimentoAncora famoso, ma troppo datato per un uso in produzione nel 2026
davidteather/TikTok-Api2026-04-016,301134🟡 Vivo ma impegnativoLa scelta OSS più solida; richiede Playwright, token e spesso proxy
scrapfly/scrapfly-scrapers/tiktok-scraper2026-04-21938 (parent)~0 (monorepo)🟡 Vivo, ma non puro OSSAttuale e utile, ma richiede una chiave API ScrapFly
Evil0ctal/Douyin_TikTok_Download_API2025-10-1217,397135🟡 Vivo, ampio, complessoProgetto multi-piattaforma ricco di funzionalità; più vicino a una piattaforma per power user
naseif/tiktok-scraper2024-07-2610713🟡 RischiosoRepo più piccolo con reclami aperti su user info e flussi hashtag
loewehancara1rmyv/Tiktok-scraper2026-01-1240🔴 Troppo nuovo per fidarsiRepo vetrina, non validato dalla community

drawrowfly/tiktok-scraper

Per anni, questo scraper/downloader in TypeScript è stato la risposta di default alla query “tiktok scraper github”, gestendo feed utente, trend, hashtag e musica. Nel 2026 è meglio considerarlo documentazione storica. L’ultimo push è di maggio 2023 e la coda delle issue contiene ancora report irrisolti come “still working?” e “zero output” tra il 2023 e il 2025. Se stai leggendo questo articolo perché hai clonato questo repo e non ottieni nulla, sei in buona compagnia.

davidteather/TikTok-Api

Il wrapper open source per i dati TikTok più credibile ancora attivo nel 2026. È vivo, ha release recenti e documenta chiaramente setup di Playwright, uso asincrono, gestione dei token, supporto ai proxy e funzioni di recupero della sessione. Ma non è uno strumento “clona e vai”. Il suo stesso README dice che EmptyResponseException in genere significa che TikTok sta bloccando la richiesta, e la cronologia delle discussion mostra problemi ricorrenti con ms_token, estrazione commenti rotta, KeyError: 'ItemModule' e fallimenti legati a endpoint specifici. Verdetto: vivo, utile, pensato per sviluppatori e con manutenzione impegnativa.

Altri repository degni di nota

  • scrapfly/scrapfly-scrapers/tiktok-scraper: attuale e tecnicamente rilevante, ma il README richiede una SCRAPFLY_KEY. È un esempio di codice per una piattaforma gestita di scraping, non uno strumento standalone gratuito.
  • Evil0ctal/Douyin_TikTok_Download_API: copre TikTok e Douyin, documenta la logica di signing (X-Bogus, A_Bogus, msToken) e supporta commenti, follower, playlist e altro. È tecnicamente impegnativo e sempre più intrecciato con riferimenti a API a pagamento. Nel tracker delle issue compaiono ancora bug nel 2026 su link video ed endpoint user-info. Vivo e ricco di funzionalità, ma complesso.
  • naseif/tiktok-scraper: più piccolo, con reclami aperti. Rischioso per l’uso in produzione.
  • loewehancara1rmyv/Tiktok-scraper: 4 stelle, 0 issue, troppo nuovo per fidarsi. L’articolo su Medium che lo promuoveva lo faceva senza spirito critico.

TikTok API ufficiale vs scraper GitHub vs strumenti no-code: un framework decisionale

tiktok_scraper_decision_framework_v1_590e6b1852.png

Molti articoli concorrenti ignorano i percorsi ufficiali di accesso a TikTok o saltano direttamente da “usa GitHub” a “compra il nostro servizio”. Ecco un confronto neutrale tra tutte e tre le opzioni:

FattoreTikTok Research APIScraper GitHubStrumenti no-code (es. Thunderbit)
Barriera di accessoRichiesta accademica o business; circa 4 settimane per l’approvazioneGit clone + configurazioneInstallazione estensione browser
Ambito dei datiSolo endpoint approvati (account, video, commenti, shop)Ampio (profili, video, commenti, hashtag, shop)Dati visibili della pagina (profili, video, engagement, hashtag)
Carico di manutenzioneBasso (ufficiale, stabile)Alto (i repo si rompono quando TikTok aggiorna)Nessuno (l’AI si adatta ai cambi di layout)
Rischio di banNessuno (autorizzato)AltoBasso (basato sul browser, simula un utente reale)
CostoGratis, se approvatoGratis, ma richiede molto tempoPiano gratuito disponibile; piani a crediti da 15$/mese
Serve programmareSì (Python/R)Sì (Python/Node.js)No
Ideale perRicercatori, accademici, organizzazioni approvateSviluppatori disposti a fare manutenzioneMarketing, sales, operations, non sviluppatori

Quando ha senso la TikTok Research API

La Research API di TikTok è il percorso ufficiale più pulito, se rientri nei requisiti. I ricercatori idonei negli Stati Uniti, in Europa e in Brasile possono candidarsi per studiare contenuti pubblici e dati degli account. Le categorie disponibili includono account, follower/following, video messi mi piace, video fissati, video ripubblicati, contenuti, commenti e shop. Il codebook espone campi come video_description, view_count, like_count, comment_count, share_count e, a livello di commento, campi come text, reply_count e create_time.

Il limite principale: l’accesso è riservato a istituzioni accademiche, ricercatori indipendenti o nonprofit idonei in regioni specifiche, oltre ai ricercatori verificati nel processo DSA dell’UE. Se sei un team growth o un’agenzia e ti servono dati operativi in tempi rapidi, questa non è la tua strada.

TikTok offre anche una Commercial Content API per annunci e dati dei contenuti pubblicitari, utile per la ricerca sulla trasparenza ma non per lo scraping generale.

Quando ha ancora senso uno scraper GitHub

Gli scraper GitHub hanno ancora senso per gli sviluppatori che hanno bisogno di accesso non ufficiale ai dati pubblici oltre il perimetro di approvazione dell’API ufficiale e sono disposti a mantenere lo stack. Parliamo di casi come scraping di griglie profilo visibili, hashtag, commenti, playlist o metadati video in una pipeline personalizzata in cui fare fork del repo e patcharlo è accettabile.

La nota onesta: non si tratta di una configurazione “una volta e via”. Anche il repository più affidabile del 2026, davidteather/TikTok-Api, continua ad avvisare che potrebbero servire Playwright, cookie/token, proxy e factory personalizzate per pagine/sessioni.

Quando ha senso uno strumento no-code come Thunderbit

Estrai dati TikTok con l'AI Get Started Free

Non sei uno sviluppatore? O sei uno sviluppatore stanco del ciclo continuo di rotture e correzioni? Uno strumento AI basato sul browser è il modo più veloce per ottenere dati TikTok strutturati.

Abbiamo creato Thunderbit come AI web scraper che funziona come estensione Chrome. Su TikTok legge qualsiasi pagina visibile (profilo, video, hashtag, risultati di ricerca), suggerisce le colonne con “AI Suggest Fields” e ti permette di cliccare “Scrape” per estrarre dati strutturati. La pagina dello strumento TikTok scraper documenta campi come data di pubblicazione, durata video, like, condivisioni, salvataggi, commenti, visualizzazioni e hashtag. Il template image scraper mostra come raccogliere miniature dei post, URL, caption, handle del creator e segnali di engagement dalle pagine profilo. Il template hashtag scraper copre URL del video, username del creator, descrizione, orario di pubblicazione, visualizzazioni, like, commenti, condivisioni, audio/suono e URL dell’immagine di copertina.

Lo scraping delle sottopagine ti consente di aprire ogni pagina video partendo da un elenco profilo e arricchire la tabella con metriche di engagement, caption e hashtag — utile per i marketer che costruiscono database di influencer o fanno audit dei contenuti dei competitor.

Nessuna manutenzione, nessun triage di installazione, nessuna configurazione anti-ban. L’AI si adatta automaticamente ai cambi di layout. L’esportazione è gratuita verso Google Sheets, Excel, Airtable, Notion, CSV o JSON.

Se hai già perso ore su repository GitHub rotti, questa è un’alternativa reale, non una spinta commerciale forzata.

Prova Thunderbit per lo scraping di TikTok

Triage di installazione: come risolvere i 5 problemi più comuni nella configurazione di un TikTok scraper GitHub

I problemi di installazione sono il terzo punto dolente più citato nei forum sullo scraping di TikTok, e nessuna guida importante aiuta davvero a risolverli. Ecco cosa va storto.

Conflitti con la versione di Node.js

Problema: molti repository più vecchi per TikTok scraper, soprattutto drawrowfly/tiktok-scraper, sono stati sviluppati per Node.js 14–16. Se usi Node 20+, npm install può fallire in silenzio o generare binari incompatibili.

Soluzione: usa nvm (Node Version Manager) per installare e passare alla versione corretta:

nvm install 16
nvm use 16
npm install

Se il repository non specifica la versione di Node, controlla il campo engines in package.json oppure la configurazione CI.

Problemi con le dipendenze Python e il setup di Playwright

Problema: davidteather/TikTok-Api richiede Python 3.9+ e Playwright con specifici browser binary. Gli utenti vedono errori come “browser not found” o conflitti tra dipendenze.

Soluzione: usa sempre un ambiente virtuale, poi installa esplicitamente i browser di Playwright:

python -m venv .venv
source .venv/bin/activate   # Su Windows: .venv\Scripts\activate
pip install TikTokApi
python -m playwright install

Se playwright install fallisce, controlla il gestore pacchetti del sistema per eventuali dipendenze mancanti, ad esempio libnss3 su Ubuntu.

Errori di permessi su Linux/Ubuntu

Problema: eseguire sudo pip install rovina l’ambiente Python di sistema e causa problemi a cascata con le dipendenze.

Soluzione: non usare mai sudo pip install. Crea sempre prima un ambiente virtuale:

python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt

Così isoli le dipendenze dello scraper dal Python di sistema.

Problemi di path ed encoding su Windows

Problema: CMD su Windows ha problemi di encoding e limiti sulla lunghezza dei percorsi che interrompono l’installazione degli scraper, soprattutto quando Playwright scarica i browser in directory molto annidate.

Soluzione: usa WSL (Windows Subsystem for Linux) oppure Git Bash al posto di CMD. WSL ti offre un ambiente Linux completo dentro Windows:

wsl --install
# Poi apri un terminale WSL e segui i passaggi di configurazione Linux

La scorciatoia Docker: evita del tutto i problemi di dipendenze

Problema: tutti quelli sopra.

Soluzione: se sai usare Docker, containerizza l’ambiente dello scraper. Un Dockerfile base per uno scraper TikTok in Python è questo:

FROM python:3.11-slim
RUN apt-get update && apt-get install -y libnss3 libatk-bridge2.0-0 libdrm2 libxcomposite1 libxdamage1 libxrandr2 libgbm1 libasound2
RUN pip install TikTokApi playwright && python -m playwright install --with-deps chromium
WORKDIR /app
COPY . .
CMD ["python", "scrape.py"]

Questo garantisce un ambiente riproducibile indipendentemente dal sistema operativo host. Se lo scraper funziona in Docker, qualsiasi errore fuori da Docker è un problema di ambiente, non di codice.

Flusso di troubleshooting:

  1. Il repository riesce a eseguire il proprio esempio? → Se no, controlla la versione di runtime.
  2. La versione di runtime è corretta? → Controlla l’installazione di browser/Playwright.
  3. Il browser è installato? → Controlla token e cookie.
  4. Token e cookie sono validi? → Controlla se TikTok sta bloccando la sessione.
  5. Fallisce tutto? → Considera il repo rotto, non un errore dell’utente. Cambia strumento.

Best practice anti-ban per lo scraping di TikTok senza pagare proxy

Gli utenti dei forum si lamentano spesso di ban e rilevamento: “ti fanno bannare gli account, quindi è un costo aggiuntivo” e “senza usare Apify o API a pagamento costose”. Ecco alcuni workaround gratuiti e pratici che non richiedono un abbonamento proxy a pagamento.

tiktok_scraper_antiban_playbook_v1_3f3a302f6b.png

PraticaDifficoltàCostoEfficacia
Ritardi casuali tra richieste (jitter 2–8s)FacileGratisMedia
Rotazione di sessioni/cookieMediaGratisMedia
Scraping solo di pagine pubbliche e logoutFacileGratisMedia
Rispetto di robots.txt + header di rate limitFacileGratisBase
Randomizzazione del fingerprint del browser headless (Playwright)MediaGratisAlta
Uso di endpoint API mobile di TikTok (meno rilevabili)DifficileGratisAlta
Rotazione di proxy residentialMedia20–100$/meseAlta

Tecniche gratuite che aiutano davvero

Ritardi casuali tra richieste. Non mandare richieste in un loop serrato. Aggiungi un jitter casuale di 2–8 secondi tra una richiesta e l’altra. È la cosa più semplice che puoi fare:

import time, random
time.sleep(random.uniform(2, 8))

Riutilizzo di sessione e cookie. Non creare una sessione nuova per ogni richiesta. Riutilizza cookie e stato di sessione su un batch di richieste, poi ruota. È esattamente il motivo per cui i repository moderni chiedono ms_token invece di promettere scraping stateless.

Scraping solo di pagine pubbliche senza login. TikTok-Api afferma esplicitamente di non supportare le route con autenticazione utente e di funzionare solo sui dati visibili quando non si è loggati. Lo scraping da sessione anonima ha un profilo di rilevamento inferiore rispetto a quello autenticato.

Rispetta robots.txt. Il robots.txt attuale di TikTok blocca completamente molti agenti e consente solo un insieme limitato di percorsi pubblici per il crawling generale. Non è un via libera allo scraping aggressivo, ma rispettarlo riduce il rischio di blacklisting immediato dell’IP.

Tecniche intermedie per aumentare il tasso di successo

Randomizzazione del fingerprint del browser headless. Se usi Playwright, randomizza viewport, user-agent, timezone e locale per ogni sessione. Così il tuo scraper assomiglia a un utente reale diverso ogni volta, invece che allo stesso bot con un IP nuovo.

Uso degli endpoint API mobile di TikTok. Alcuni membri della community riportano tassi di rilevamento più bassi quando si usano endpoint in stile mobile invece del frontend web. È più difficile da implementare e meno documentato, ma per utenti avanzati è una tecnica reale.

Quando serve davvero un proxy e quali opzioni sono accessibili

Su larga scala, le tecniche gratuite non bastano. La rotazione di proxy residential è l’approccio standard per lo scraping TikTok ad alto volume. Non consiglierò un servizio proxy a pagamento specifico, ma il consiglio generale è: evita i proxy datacenter (TikTok li segnala in modo aggressivo) e cerca pool residential o mobile con rotazione per richiesta.

In alternativa, strumenti basati sul browser come Thunderbit evitano del tutto il problema dei proxy perché lavorano nella tua sessione browser, simulando un utente reale. Questo non li rende immuni al rilevamento su larga scala, ma per i casi d’uso tipici di marketing o ricerca (decine o centinaia di pagine, non milioni) è una strada molto più semplice.

Che dati ottieni davvero? Esempi reali di output dai TikTok scraper

Gli utenti vogliono sapere quali dati otterranno davvero prima di impegnarsi in uno strumento, e la maggior parte delle guide salta completamente questo passaggio. Ecco strutture di campi rappresentative basate sulla documentazione delle fonti.

Dati profilo

UsernameNome visualizzatoFollowerSeguitiMi piace totaliBioVerificatoURL profilo
@examplecreatorJane Doe1,240,00031248,700,000"Cooking + comedy 🍳"tiktok.com/@examplecreator
@travelwithmarkMark S.890,00015022,100,000"Travel vlogger 🌍"tiktok.com/@travelwithmark
@fitnessmayaMaya L.2,100,0008891,300,000"Workouts & wellness"tiktok.com/@fitnessmaya

Disponibili da: scraper GitHub (TikTok-Api, Evil0ctal), Research API, Thunderbit (dalle pagine profilo visibili).

Metadati video

URL videoCaptionVisualizzazioniMi piaceCommentiCondivisioniMusicaHashtagData pubblicazioneDurata
tiktok.com/@ex/video/123"Best pasta trick ever 🍝"4,200,000312,0008,40021,000"Italian Vibes – DJ Marco"#pasta #cooking #hack2026-03-150:42
tiktok.com/@ex/video/456"POV: your cat judges you"9,100,0001,100,00023,00055,000"Original Sound"#cat #pov #funny2026-04-010:18
tiktok.com/@ex/video/789"Morning routine nobody asked for"1,800,00098,0003,2007,500"Chill Morning – LoFi"#routine #morning2026-04-101:02

Disponibili da: scraper GitHub (TikTok-Api, Evil0ctal), Research API (campi come video_description, view_count, like_count, comment_count, share_count, music_id, hashtag_names, video_duration), Thunderbit (campi a livello di video).

Dati commenti

Autore commentoTesto commentoMi piaceTimestampRisposte
@user_abc"I tried this and it actually works 😂"1,2002026-03-16T08:12:00Z14
@chef_dan"Add garlic next time, trust me"8902026-03-16T09:45:00Z7
@randomfan99"This is the content I'm here for"3402026-03-16T11:30:00Z2

Disponibili da: scraper GitHub (TikTok-Api, Evil0ctal), Research API (campi come text, like_count, reply_count, create_time), Thunderbit (dalle sezioni commenti visibili).

Dati hashtag e ricerca

HashtagURL del video principaleVisualizzazioni aggregateIn tendenza
#pastatiktok.com/@ex/video/1234,200,000
#cookingtiktok.com/@chef/video/32111,000,000
#hacktiktok.com/@tips/video/6542,900,000No

Disponibili da: scraper GitHub (varia in base al repo), Thunderbit (template hashtag scraper).

Nota: nessun singolo repository garantisce tutti i campi, sempre. La struttura delle risposte di TikTok cambia, e persino i maintainer lo avvertono. Considerali esempi rappresentativi, non dati garantiti.

Come estrarre dati TikTok in 2 clic con Thunderbit, passo dopo passo

Stanco del ciclo continuo di rotture e correzioni? Ecco il percorso no-code: la via d’uscita per chi ha provato e fallito con i repo GitHub.

  1. Installa la estensione Chrome di Thunderbit.
  2. Vai alla pagina TikTok che vuoi estrarre — un profilo, una pagina risultati di ricerca, una pagina hashtag o un singolo video.
  3. Clicca su “AI Suggest Fields”. L’AI di Thunderbit legge la pagina e propone le colonne: username, follower, caption del video, like, hashtag e così via.
  4. Se serve, modifica i campi e poi clicca “Scrape”. I dati vengono popolati in una tabella strutturata.
  5. Usa lo scraping delle sottopagine per arricchire i dati. Apri ogni video dalla lista del profilo e recupera campi aggiuntivi: caption completa, dettagli della musica, numero di commenti, numero di condivisioni.
  6. Esporta in Google Sheets, Excel, Airtable o Notion — completamente gratis.

Nessuna manutenzione, nessun triage di installazione, nessuna configurazione anti-ban. L’AI si adatta automaticamente ai cambi di layout di TikTok.

Arricchire i dati TikTok con lo scraping delle sottopagine

Dopo aver estratto una lista di video da un profilo o da una pagina hashtag, clicca “Scrape Subpages” per far sì che l’AI visiti ogni pagina video e raccolga campi aggiuntivi. È particolarmente utile per i marketer che costruiscono database di influencer o fanno audit dei contenuti dei competitor: ottieni una tabella completa con dati di engagement a livello di video senza dover aprire manualmente decine di pagine.

Esportare e usare i tuoi dati TikTok

Thunderbit esporta verso Google Sheets, Excel, Airtable, Notion, CSV o JSON — tutto gratis. Casi d’uso comuni:

  • Inserire i dati in un foglio di calcolo per analizzare l’engagement.
  • Inviare tutto ad Airtable per un tracker di influencer in stile CRM.
  • Passare i dati in Notion per la collaborazione del team sulla ricerca contenuti.

Per approfondire come Thunderbit gestisce l’estrazione dei dati web, leggi la nostra guida per principianti al web scraping o guarda i tutorial sul canale YouTube di Thunderbit.

Restare nel legale: termini di servizio di TikTok e conformità allo scraping

La posizione legale di TikTok è chiara. Il blog sulla privacy dedicato allo scraping afferma che i Termini di Servizio vietano script automatizzati che raccolgono informazioni o interagiscono con il servizio in modi non autorizzati, e cita esplicitamente il superamento delle restrizioni di accesso. Anche le Community Guidelines vietano tentativi ingannevoli di ottenere informazioni tramite script automatizzati o crawling del web.

Indicazioni pratiche:

  • Attieniti ai dati pubblicamente disponibili. Non fare scraping di contenuti privati o protetti da login.
  • Rispetta i rate limit. Non martellare i server di TikTok.
  • Conformati alle leggi sulla privacy dei dati. GDPR e CCPA si applicano comunque se raccogli, archivi o analizzi dati personali.
  • Usa la Research API quando sei idoneo. È la strada più sicura dal punto di vista della compliance.
  • Questo non è un parere legale. Per la tua situazione specifica, consulta un professionista.

Per maggiori informazioni sul quadro normativo, vedi la nostra guida sulle implicazioni legali del web scraping.

Cosa fare quando il tuo repository GitHub per TikTok scraper muore

Versione breve:

  1. Esegui sempre la checklist dei vitali del repository in 60 secondi prima di clonare qualsiasi TikTok scraper da GitHub. La maggior parte dei repo è già morta.
  2. Capisci quali opzioni hai. API ufficiale, scraper GitHub e strumenti no-code servono utenti e casi d’uso diversi.
  3. Se scegli GitHub, metti in conto tempo per il troubleshooting dell’installazione e la configurazione anti-ban. Aspettati manutenzione continua.
  4. Sapere quali dati otterrai davvero prima di impegnarti in uno strumento è fondamentale. Controlla i campi di output, non solo il numero di stelle.
  5. Se non sei uno sviluppatore (o sei stufo di repo rotti), prova uno strumento no-code come Thunderbit: due clic, dati strutturati, esportazione gratuita.

I dati TikTok di cui hai bisogno sono accessibili. La vera domanda è se vuoi spendere il tuo tempo a mantenere uno scraper o a usare davvero quei dati. Scegli l’approccio più adatto al tuo livello e al tuo caso d’uso, e non lasciare che un repo GitHub morto ti rovini un altro pomeriggio.

Prova Thunderbit per i dati TikTok

FAQ

Esistono ancora TikTok scraper su GitHub che funzionano nel 2026?

Sì, ma l’elenco è breve. davidteather/TikTok-Api è l’opzione open source più credibile con manutenzione attiva ad aprile 2026. Anche Evil0ctal/Douyin_TikTok_Download_API è vivo, ma più complesso. Il repository con più stelle, drawrowfly/tiktok-scraper, non viene aggiornato da maggio 2023 ed è di fatto morto. Esegui sempre la checklist dei vitali del repository prima di investire tempo in qualunque repo.

È legale fare scraping di TikTok?

I Termini di Servizio di TikTok vietano esplicitamente lo scraping automatizzato. I dati visibili pubblicamente si trovano in una zona grigia legale che varia in base alla giurisdizione. La strada più sicura è la Research API ufficiale, per i ricercatori idonei. Se fai scraping di dati pubblici, limita l’attività ai contenuti accessibili pubblicamente, rispetta i rate limit e conformati a GDPR/CCPA. Questo non è un parere legale: per il tuo caso consulta un professionista.

Posso fare scraping di TikTok senza programmare?

Sì. Strumenti AI basati su browser come Thunderbit ti permettono di estrarre dati TikTok strutturati — profili, metadati video, hashtag, metriche di engagement — senza scrivere codice. Anche la TikTok Research API richiede solo una quantità minima di codice per i richiedenti approvati. Per chi non sviluppa, gli strumenti no-code sono la strada più veloce e affidabile.

Quali dati posso ottenere da uno scraper TikTok?

I tipi di dati più comuni includono informazioni sul profilo (username, follower, bio, stato di verifica), metadati video (caption, visualizzazioni, like, commenti, condivisioni, musica, hashtag, durata, data di pubblicazione), commenti (testo, like, timestamp, risposte) e dati di hashtag/ricerca (video principali, visualizzazioni aggregate, stato trending). I campi esatti dipendono dallo strumento e dal metodo: vedi la sezione degli esempi di output sopra per i dettagli.

Perché il mio TikTok scraper continua a essere bloccato?

TikTok usa più livelli di difesa anti-bot: rate limiting, protezione tramite cookie/sessione, browser fingerprinting, rilevamento comportamentale, parametri di richiesta cifrati e flussi CAPTCHA. Le cause più comuni dei blocchi sono richieste troppo rapide, uso di una sessione nuova e pulita per ogni richiesta, browser headless con fingerprint predefiniti o proxy datacenter. Vedi la sezione sulle best practice anti-ban qui sopra per i workaround gratuiti e a pagamento.

Ke
Ke
CTO di Thunderbit | Senior Data Scientist ed esperto di ML Con quasi un decennio di esperienza nel machine learning e nella data science, Ke Shen è un ex studente della Columbia University ed ex Senior Data Scientist presso Walmart Labs. Grazie a una profonda competenza, riconosciuta dai suoi pari, in Python, R, Java e statistica, condivide insight collaudati sul passaggio di algoritmi AI complessi dalla teoria a un'architettura pronta per la produzione.
Indice dei contenuti

Estrai una pagina web semplicemente chiedendo

Dì in italiano semplice ciò che ti serve. O ancora meglio, non dire nulla.

Prova Thunderbit gratis
Estrai dati con l’AI
Trasferisci facilmente i dati su Google Sheets, Airtable o Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week