GitHub에서 "tiktok scraper"를 검색하면 저장소 339개가 쏟아져 나와요. 그런데 이 중 약 48%는 1년 넘게 푸시가 끊겼고, 최소 4개는 대놓고 아카이브 처리돼 있어요.
별 많은 TikTok 스크래퍼를 클론해 놓고 한 시간을 의존성과 씨름하다 출력 한 줄 못 본 경험이 있다면 — 혼자가 아니에요. GitHub에서 가장 별이 많은 drawrowfly/tiktok-scraper는 지금도 별이 5,000개를 넘어요. 그런데 이슈 트래커엔 #812: "is this amazing tool still working?", #824: "Is this still working?" 같은 글이 가득해요. 둘 다 "출력이 안 나온다"는 보고죠. Thunderbit에서 몇 달째 이 저장소들을 추적해 봤는데 패턴은 분명해요. 금세 깨지고, 대부분 끝내 안 고쳐져요. 이 글은 제가 처음 이걸 평가하던 시절 누가 미리 줬으면 했던 실전 생존 가이드예요. 지금 살아 있는 것, 죽은 것, 대신 뭘 해야 하는지, 멈춘 코드에 몇 시간 날리지 않는 법까지 다뤄요.
GitHub의 TikTok 스크래퍼가 깨지는 이유, 그리고 계속 깨지는 이유
TikTok은 만만한 대상이 아니에요. 웹 표면이 쉴 새 없이 바뀌거든요. 정적인 이커머스 상품 페이지나 디렉터리와 달리, TikTok은 엔드포인트를 바꾸고, 안티봇 지문 인식을 갱신하고, 렌더링 방식을 손보고, 새 세션/토큰 요구를 더해요. 마지막 변경 후 몇 주도 안 돼 또 바뀌기도 하고요.
오픈소스 유지관리자는 자원봉사자예요. TikTok이 업데이트로 요청 경로를 망가뜨리면, 저장소는 며칠, 몇 주, 심지어 영구히 깨진 채 남을 수 있어요. 유지관리자 탓이 아니에요. 빠르고 자금도 넉넉한 플랫폼과, 본업이 따로 있는 무급 개발자 사이의 구조적 체급 차이일 뿐이죠.
최고 수준의 저장소조차 결국 고장-수정의 쳇바퀴 위에 있어요. 하나 쓰려면 평가, 문제 해결, 백업 계획이 다 필요하고요.
TikTok의 안티봇 방어: 맞서야 할 것들
- 요청 제한. TikTok의 공식 개발자 문서는 승인된 연동에도 요청 쿼터를 못 박아 둬요. 비공식 스크래퍼는 이 한도에 훨씬 빨리 부딪히고요.
- 쿠키 및 세션 게이팅. davidteather/TikTok-Api 같은 최신 저장소는
ms_token을 요구하고, drawrowfly/tiktok-scraper 같은 옛날 저장소는 예제에tt_webid_v2를 쓰며, Evil0ctal/Douyin_TikTok_Download_API는msToken,ttwid,X-Bogus,A_Bogus를 문서화해요. TikTok은 그 요청이 진짜 브라우징 세션에서 온 건지 따져요. - 브라우저 지문 인식. ScrapFly의 안티봇 가이드는 사이트가 헤더, 쿠키, TLS 시그니처, JavaScript로 드러나는 브라우저 특성을 실제 사용자 트래픽과 대조하는 이유를 설명해요. 브라우저 지문 인식 분석에서는 Canvas, WebGL, WebRTC, 폰트, 런타임 신호까지 짚고요. 지문 인식은 TikTok이 브라우저의 신분증을 확인하는 것과 같아요. 브라우저, 쿠키, 타이밍, 네트워크 시그니처가 안 맞으면, 콘텐츠가 돌아오기도 전에 그 요청은 가짜처럼 보여요.
- 행동 기반 탐지. TikTok 스크래핑에 관한 Reddit 스레드에는 새 Playwright 세션이 CAPTCHA를 부른다는 언급이 자주 나와요. 2025~2026년 커뮤니티 글은 IP 재사용뿐 아니라 행동 타이밍과 상호작용 품질까지 보는 탐지가 점점 늘고 있다고 해요.
- 암호화/서명된 요청 파라미터. Evil0ctal은
X-Bogus와A_Bogus를 문서화하고, 오래된 커뮤니티 gist들은 URL 서명과 토큰 생성에 매달려요. TikTok은 갈수록 자사 브라우저/앱 트래픽이 들고 오는 것과 같은 "도장"이 찍힌 요청을 기대해요. - CAPTCHA 및 검증 흐름. TikTok 전용 CAPTCHA 해결 저장소와 퍼즐 챌린지를 다룬 Reddit 스레드가 존재한다는 사실만으로도, CAPTCHA가 여전히 안티봇 표면의 일부라는 걸 알 수 있어요.
오픈소스 유지관리자가 따라잡지 못하는 이유
흐름은 늘 똑같아요. 개발자가 TikTok 스크래퍼를 만들고, GitHub에서 크게 퍼지고, TikTok이 패치하고, 유지관리자가 고치거나 손을 떼요.
두 저장소가 이 패턴을 정확히 보여줘요.
- drawrowfly/tiktok-scraper는 여전히 별 5,052개, 포크 889개를 보유하고 있어요. 하지만 마지막 푸시가 2023년 5월 19일이에요. GitHub에서 정확히 이 이름으로 가장 별이 많은 TikTok 스크래퍼지만, 지금은 높은 가시성과 높은 신뢰만 남고 현재 유지관리는 없는 역사적 유물에 가까워요.
- davidteather/TikTok-Api는 별 6,301개, 포크 1,177개, 마지막 푸시 2026년 4월 1일을 기록 중이에요. 릴리스 피드를 보면 2025년 4월·7월·10월, 2026년 4월에 의미 있는 유지보수가 있었고, 사용자 비디오 크롤링과 새 프록시/세션 제어 수정도 들어 있어요. 다만 이만큼 건강한 프로젝트조차도, TikTok이 요청을 차단할 수 있고 프록시·Playwright·커스텀 세션 로직이 필요할 수 있다고 대놓고 경고해요.
패턴은 간단해요.
- 오래된 TikTok 스크래퍼 저장소는 아마 죽었어요.
- 살아 있는 TikTok 스크래퍼 저장소도 아마 여전히 불안정해요.
- 진짜 차이는 이번 달 깨진 부분을 고칠 사람이 아직 남아 있느냐, 그것뿐이에요.
60초 저장소 생체 신호 체크리스트: 어떤 TikTok 스크래퍼든 평가하는 법
아무거나 클론하기 전에 이 체크리스트부터 돌려 보세요. 1분도 안 걸리는데 몇 시간의 좌절을 막아 줘요.
| 신호 | 🟢 건강함 | 🟡 위험함 | 🔴 죽음 |
|---|---|---|---|
| 마지막 의미 있는 푸시 | 3개월 이내 | 3~12개월 전 | 12개월 이상 전 |
| 열린 이슈 수 | 적고, 최근 이슈에 답변이 있음 | 쌓여 가지만 일부 유지관리 활동이 있음 | "깨짐/차단됨/작동 안 함" 보고가 많이 쌓이고 답변이 없음 |
| 최근 사용자 불만 | 대부분 설정 질문 | 설정 질문과 깨짐 불만이 섞여 있음 | "출력 없음", "403", "아직 작동하나요?"가 반복됨 |
| 현재 인증/세션 모델 | 세션/쿠키 방식이 문서화됨 | 토큰 의존도가 높지만 문서화됨 | 현재 인증 안내 없이 오래된 웹 엔드포인트에 의존함 |
| 설치 난이도 | 재현 가능하고 테스트된 설정 | 수동 단계가 일부 있음 | 오래된 의존성, 현대적인 설정 노트 없음 |
| CI/테스트 | 테스트가 있고 최신임 | 테스트는 있지만 커버리지가 불명확함 | 테스트 없음 또는 오래된 액션 |
| 데이터 범위 적합성 | 실제 사용 사례와 맞음 | 사용 사례의 일부만 지원함 | 아예 다른 문제를 해결함 |
각 신호를 60초 안에 확인하는 법
- 마지막 푸시 날짜: GitHub 저장소 헤더를 보세요. "마지막 푸시 2년 전"이면 거기서 끝이에요.
- 열린 이슈: Issues 탭을 누르세요. 최근 제목을 훑고
not working,403,blocked,captcha,zero output을 검색하세요. - 사용자 불만: 열린 이슈 상위 5개가 죄다 "이제 안 돼요"의 변주라면, 답은 이미 나온 거예요.
- 인증/세션 모델: README를 여세요.
ms_token, Playwright 설정, 프록시 노트 같은 최신 안내가 있는지 보세요. README가 2023년 엔드포인트를 들먹이면 넘어가세요. - 설치 난이도: requirements 파일, Docker 지원, 명확한 설정 지침을 확인하세요. README에 "npm install"만 적혀 있고 마지막 테스트 Node 버전이 14라면, 문제가 생길 확률이 높아요.
- CI/테스트: Actions 탭을 보세요. 테스트가 실패 중이거나 아예 없으면, 깨졌는지 여부는 추측일 뿐이에요.
- 데이터 범위: 저장소가 실제로 필요한 데이터 유형(프로필, 비디오 메타데이터, 댓글, 해시태그)을 다루나요? 많은 저장소는 비디오 다운로드만 하고 구조화된 데이터 추출은 못 해요.
"그냥 포기하세요"를 뜻하는 빨간 신호
- 저장소가 아카이브돼 있음.
- README에 "더 이상 유지보수하지 않음"이라고 적혀 있음.
- 마지막 커밋이 2년도 더 된 TikTok API 버전을 참조함.
- 이슈가 "작동 안 함" 보고로 넘쳐나는데 유지관리자가 몇 달째 묵묵부답.
- 별은 많은데 최근 포크나 풀 리퀘스트가 없음.
팁: Issues 탭에서 is:issue is:open "not working"이나 is:issue is:open "403"을 검색하세요. 결과가 많고 최신이라면, 그 저장소는 아마 깨진 상태예요.
인기 TikTok 스크래퍼 GitHub 저장소: 솔직한 상태 점검(2026)

GitHub에서 "tiktok scraper"를 검색하면 실제로 만나게 될 저장소들에, 생체 신호 체크리스트를 적용해 봤어요.
| 저장소 | 마지막 푸시 | 별 | 열린 이슈 | 판정 | 메모 |
|---|---|---|---|---|---|
| drawrowfly/tiktok-scraper | 2023-05-19 | 5,052 | 58 | 🔴 죽음 / 참고용 | 아직 유명하지만, 2026년 프로덕션용으로는 너무 오래됨 |
| davidteather/TikTok-Api | 2026-04-01 | 6,301 | 134 | 🟡 살아 있지만 유지보수 부담 큼 | 가장 강력한 오픈소스 선택지; Playwright, 토큰, 종종 프록시가 필요함 |
| scrapfly/scrapfly-scrapers/tiktok-scraper | 2026-04-21 | 938 (상위 저장소) | ~0 (모노레포) | 🟡 살아 있지만 순수 오픈소스는 아님 | 최신이고 유용하지만 ScrapFly API 키가 필요함 |
| Evil0ctal/Douyin_TikTok_Download_API | 2025-10-12 | 17,397 | 135 | 🟡 살아 있음, 범위 넓음, 복잡함 | 기능이 많은 멀티플랫폼 프로젝트; 고급 사용자용 플랫폼에 가까움 |
| naseif/tiktok-scraper | 2024-07-26 | 107 | 13 | 🟡 위험함 | 사용자 정보와 해시태그 흐름에 대한 불만이 있는 소규모 저장소 |
| loewehancara1rmyv/Tiktok-scraper | 2026-01-12 | 4 | 0 | 🔴 너무 새로워서 신뢰하기 어려움 | 커뮤니티 검증을 거치지 않은 쇼케이스용 저장소 |
drawrowfly/tiktok-scraper
이 TypeScript 스크래퍼/다운로더는 수년간 "tiktok scraper github" 하면 떠오르는 기본 답이었어요. 사용자, 트렌드, 해시태그, 음악 피드를 다 처리했거든요. 2026년에는 역사 자료로 보는 게 가장 정확해요. 마지막 푸시가 2023년 5월이고, 이슈 큐에는 2023~2025년의 미해결 "still working?", "zero output" 보고가 그대로 남아 있어요. 이 저장소를 클론했다가 아무것도 못 얻어서 이 글을 읽고 있다면, 당신 잘못이 아니에요.
davidteather/TikTok-Api
2026년에도 살아 있는 오픈소스 TikTok 데이터 래퍼 중 가장 믿을 만해요. 활성 상태에, 최근 릴리스도 있고, Playwright 설정, 비동기 사용, 토큰 처리, 프록시 지원, 세션 복구를 대놓고 문서화해요. 하지만 "클론하고 바로 끝" 도구는 아니에요. README 스스로 EmptyResponseException은 보통 TikTok이 요청을 차단하고 있다는 뜻이라고 말하고, 토론 기록에는 ms_token, 깨진 댓글 추출, KeyError: 'ItemModule', 엔드포인트별 실패에 대한 반복되는 고통이 보여요. 판정: 살아 있고, 유용하고, 개발자 전용이고, 유지보수 부담이 큼.
그 밖에 짚어 둘 저장소
- scrapfly/scrapfly-scrapers/tiktok-scraper: 최신이고 기술적으로도 잘 맞지만, README가
SCRAPFLY_KEY를 요구해요. 무료 독립 도구가 아니라 관리형 스크래핑 플랫폼의 코드 예시예요. - Evil0ctal/Douyin_TikTok_Download_API: TikTok과 Douyin을 둘 다 다루고, 서명 로직(
X-Bogus,A_Bogus,msToken)을 문서화하며, 댓글·팔로워·재생목록까지 지원해요. 기술 난도가 높고, 유료 API 참조와도 점점 얽히고 있어요. 이슈 트래커에는 2026년에도 비디오 링크와 사용자 정보 엔드포인트 버그 보고가 계속 올라와요. 살아 있고 기능도 많지만 복잡해요. - naseif/tiktok-scraper: 더 작고 공개 불만도 있어요. 프로덕션용으로는 위험해요.
- loewehancara1rmyv/Tiktok-scraper: 별 4개, 이슈 0개, 너무 새로워서 믿기 어려워요. 이걸 띄운 Medium 글은 비판 없이 소개만 했고요.
TikTok 공식 API vs GitHub 스크래퍼 vs 노코드 도구: 의사결정 프레임워크

대부분의 경쟁 글은 TikTok 공식 경로를 무시하거나, 곧장 "GitHub를 써라"에서 "우리 서비스를 사라"로 건너뛰어요. 아래는 세 경로를 중립적으로 비교한 표예요.
| 요소 | TikTok 연구 API | GitHub 스크래퍼 | 노코드 도구(예: Thunderbit) |
|---|---|---|---|
| 접근 장벽 | 학술/비즈니스 신청 필요; 승인까지 약 4주 | Git 클론 + 설정 | 브라우저 확장 설치 |
| 데이터 범위 | 승인된 엔드포인트만 (계정, 비디오, 댓글, 상점) | 넓음(프로필, 비디오, 댓글, 해시태그, 상점) | 보이는 페이지 데이터(프로필, 비디오, 참여도, 해시태그) |
| 유지보수 부담 | 낮음(공식, 안정적) | 높음(TikTok 업데이트 시 저장소가 깨짐) | 없음(AI가 레이아웃 변경에 적응) |
| 차단 위험 | 없음(승인됨) | 높음 | 낮음(브라우저 기반, 실제 사용자처럼 동작) |
| 비용 | 무료(승인 시) | 무료(하지만 시간 소모 큼) | 무료 요금제 있음; 월 $15부터 크레딧 기반 플랜 |
| 코딩 필요 여부 | 예(Python/R) | 예(Python/Node.js) | 아니요 |
| 가장 적합한 대상 | 연구자, 학계, 승인된 조직 | 유지보수에 익숙한 개발자 | 마케터, 세일즈 팀, 운영팀, 비개발자 |
TikTok 연구 API가 맞는 경우
TikTok의 Research API는 자격만 된다면 가장 깔끔한 공식 경로예요. 미국, 유럽, 브라질의 적격 연구자가 공개 콘텐츠와 계정 데이터를 연구 목적으로 신청할 수 있어요. 다룰 수 있는 데이터 범주에는 계정, 팔로워/팔로잉, 좋아요한 비디오, 고정 비디오, 다시 게시한 비디오, 콘텐츠, 댓글, 상점이 들어가요. 코드북은 video_description, view_count, like_count, comment_count, share_count 같은 필드와 댓글 수준의 text, reply_count, create_time 같은 필드를 줘요.
단점은 자격이 특정 지역의 학술 기관, 자격을 갖춘 비영리/독립 연구자, 그리고 EU DSA 절차를 통과한 검증된 연구자로 제한된다는 점이에요. 성장팀이나 에이전시처럼 빠른 운영 데이터를 원한다면 맞는 길이 아니에요.
TikTok은 광고·광고주 콘텐츠 데이터용 Commercial Content API도 제공해요. 투명성 연구에는 유용하지만 일반 스크래핑과는 거리가 멀어요.
GitHub 스크래퍼가 여전히 통하는 경우
GitHub 스크래퍼는, 공식 API 승인 장벽을 못 넘는 공개 데이터에 비공식으로 접근해야 하고 스택 유지보수까지 감당할 수 있는 개발자에게는 여전히 의미가 있어요. 저장소를 포크해 패치하는 게 허용되는 자체 파이프라인에서, 보이는 프로필 그리드, 해시태그, 댓글, 재생목록, 비디오 메타데이터를 긁는 경우가 여기 해당해요.
솔직한 주의점은, 이게 한 번 세팅하면 끝나는 작업이 아니라는 거예요. 2026년 기준 가장 믿을 만한 저장소 중 하나인 davidteather/TikTok-Api조차도, Playwright·쿠키/토큰·프록시·커스텀 페이지/세션 팩토리가 필요할 수 있다고 사용자에게 못 박아요.
Thunderbit 같은 노코드 도구가 맞는 경우
AI로 TikTok 데이터 스크래핑 Get Started Free
개발자가 아니신가요? 아니면 고장 나면 고치기를 무한 반복하는 사이클에 지치셨나요? 브라우저 기반 AI 도구가 구조화된 TikTok 데이터로 가는 가장 빠른 길이에요.
저희는 Thunderbit을 Chrome 확장 프로그램으로 동작하는 AI 웹 스크래퍼로 만들었어요. TikTok에서 Thunderbit은 보이는 어떤 페이지(프로필, 비디오, 해시태그, 검색 결과)든 읽고, "AI 필드 제안"으로 열을 추천한 뒤, "스크래핑"을 누르면 구조화된 데이터를 뽑아 줘요. TikTok 스크래퍼 도구 페이지에는 게시 날짜, 비디오 길이, 좋아요, 공유, 저장, 댓글, 조회수, 해시태그 같은 필드가 문서화돼 있어요. 이미지 스크래퍼 템플릿은 프로필 페이지에서 게시물 썸네일, URL, 캡션, 작성자 핸들, 참여 신호를 모으는 법을 보여 주고요. 해시태그 스크래퍼 템플릿은 비디오 URL, 작성자 사용자 이름, 설명, 게시 시간, 조회수, 좋아요, 댓글, 공유, 소리/오디오, 커버 이미지 URL을 다뤄요.
서브페이지 스크래핑을 쓰면 프로필 목록에서 각 비디오 페이지로 들어가 참여 지표, 캡션, 해시태그를 보강할 수 있어요. 인플루언서 데이터베이스를 만들거나 경쟁사 콘텐츠 감사를 하는 마케터에게 특히 좋아요.
유지보수 없음, 설치 트리아주 없음, 안티봇 설정 없음. AI가 레이아웃 변경에 알아서 적응해요. Google Sheets, Excel, Airtable, Notion, CSV, JSON으로 무료 내보내기도 돼요.
깨진 GitHub 저장소에 몇 시간을 태워 봤다면, 이건 억지로 끼워 넣은 제품 홍보가 아니라 진짜 대안이에요.
TikTok 스크래핑에 Thunderbit 사용해 보기
설치 트리아주: 가장 흔한 TikTok 스크래퍼 설정 실패 5가지 잡기
설치 실패는 TikTok 스크래핑 포럼에서 세 번째로 자주 나오는 문제인데, 정작 주요 가이드 중 실제로 도움 되는 건 거의 없어요. 뭐가 어디서 어긋나는지 짚어 볼게요.
Node.js 버전 충돌
문제: 오래된 TikTok 스크래퍼 저장소(특히 drawrowfly/tiktok-scraper)는 Node.js 14~16용으로 만들어진 게 많아요. Node 20 이상을 쓰고 있다면 npm install이 조용히 실패하거나, 호환 안 되는 바이너리를 만들 수 있어요.
해결: nvm(Node Version Manager)으로 맞는 버전을 설치하고 전환하세요.
nvm install 16
nvm use 16
npm install
저장소가 Node 버전을 안 적어 뒀다면 package.json의 engines 필드를 보거나 CI 설정을 확인하세요.
Python 의존성 문제와 Playwright 설정
문제: davidteather/TikTok-Api는 Python 3.9+와 특정 브라우저 바이너리가 포함된 Playwright가 필요해요. 사용자들은 "browser not found" 같은 오류나 의존성 충돌을 겪고요.
해결: 항상 가상 환경을 먼저 만든 뒤, Playwright 브라우저를 명시적으로 설치하세요.
python -m venv .venv
source .venv/bin/activate # Windows에서는: .venv\Scripts\activate
pip install TikTokApi
python -m playwright install
playwright install이 실패하면, 시스템 패키지 관리자에서 빠진 시스템 의존성(예: Ubuntu의 libnss3)을 확인하세요.
Linux/Ubuntu 권한 오류
문제: sudo pip install을 돌리면 시스템 Python 환경이 망가지고 연쇄적인 의존성 문제가 따라와요.
해결: sudo pip install은 절대 쓰지 마세요. 항상 가상 환경부터 만드세요.
python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
이렇게 하면 스크래퍼 의존성이 시스템 Python과 분리돼요.
Windows 경로 및 인코딩 문제
문제: Windows CMD는 인코딩 문제와 경로 길이 제한 탓에, 특히 Playwright가 중첩된 디렉터리에 브라우저 바이너리를 받을 때 설치가 깨질 수 있어요.
해결: CMD 대신 WSL(Windows Subsystem for Linux)이나 Git Bash를 쓰세요. WSL은 Windows 안에서 완전한 Linux 환경을 줘요.
wsl --install
# 그다음 WSL 터미널을 열고 Linux 설정 단계를 따르세요
Docker로 한 방에 넘기기: 의존성 문제 통째로 건너뛰기
문제: 위의 전부.
해결: Docker를 편하게 다룰 수 있다면, 스크래퍼 환경을 컨테이너화하세요. Python 기반 TikTok 스크래퍼용 기본 Dockerfile은 이래요.
FROM python:3.11-slim
RUN apt-get update && apt-get install -y libnss3 libatk-bridge2.0-0 libdrm2 libxcomposite1 libxdamage1 libxrandr2 libgbm1 libasound2
RUN pip install TikTokApi playwright && python -m playwright install --with-deps chromium
WORKDIR /app
COPY . .
CMD ["python", "scrape.py"]
이렇게 하면 호스트 OS와 상관없이 재현 가능한 환경이 보장돼요. Docker에서는 되는데 밖에서만 실패한다면, 문제는 코드가 아니라 환경이에요.
문제 해결 플로우차트:
- 저장소 자체 예제가 잘 돌아가나요? → 아니면 런타임 버전을 확인하세요.
- 런타임 버전이 맞나요? → 브라우저/Playwright 설치를 확인하세요.
- 브라우저가 설치됐나요? → 토큰/쿠키를 확인하세요.
- 토큰/쿠키가 유효한가요? → TikTok이 세션을 차단하는지 확인하세요.
- 위가 전부 실패하나요? → 사용자 실수보다 저장소 자체의 깨짐을 의심하고, 도구를 바꾸세요.
TikTok 스크래핑 안티밴 플레이북(프록시 비용 없이)
포럼 사용자들은 차단과 탐지를 입에 달고 살아요. "계정이 차단돼서 추가 비용이 든다", "Apify나 비싼 유료 API 없이는 안 된다"는 식이죠. 아래는 유료 프록시 구독 없이도 가능한 무료 실전 우회책이에요.

| 방법 | 난이도 | 비용 | 효과 |
|---|---|---|---|
| 무작위 요청 지연(2~8초 지터) | 쉬움 | 무료 | 보통 |
| 세션/쿠키 회전 | 보통 | 무료 | 보통 |
| 로그인되지 않은 공개 페이지만 스크래핑 | 쉬움 | 무료 | 보통 |
robots.txt + rate-limit 헤더 준수 | 쉬움 | 무료 | 기본 |
| 헤드리스 브라우저 지문 랜덤화(Playwright) | 보통 | 무료 | 높음 |
| TikTok 모바일 API 엔드포인트 사용(탐지 감소) | 어려움 | 무료 | 높음 |
| 주거용 프록시 회전 | 보통 | 월 $20~100 | 높음 |
진짜로 도움 되는 무료 기법
무작위 요청 지연. 요청을 빡빡하게 연달아 쏘지 마세요. 요청 사이에 2~8초의 무작위 지터를 넣으세요. 가장 손쉽게 할 수 있는 방법이에요.
import time, random
time.sleep(random.uniform(2, 8))
세션과 쿠키 재사용. 요청할 때마다 완전히 새 세션을 만들지 마세요. 여러 요청에 걸쳐 쿠키와 세션 상태를 재사용하고, 주기적으로 회전하세요. 최신 저장소들이 ms_token을 요구하면서 무상태 스크래핑을 보장하지 않는 이유가 바로 이거예요.
로그아웃된 공개 페이지 스크래핑. TikTok-Api는 대놓고 사용자 인증 경로를 지원하지 않으며, 로그인하지 않았을 때 보이는 데이터에서만 작동한다고 말해요. 로그아웃 상태 스크래핑은 인증된 세션보다 탐지 가능성이 낮아요.
robots.txt 준수. TikTok의 현재 robots.txt는 많은 에이전트를 아예 막고, 일반 크롤링에 열어 둔 공개 경로도 제한적이에요. 공격적인 스크래핑이 괜찮다는 뜻은 아니지만, 이를 지키면 즉시 IP 블랙리스트에 오를 확률은 줄어들어요.
성공률을 끌어올리는 중간 단계 기법
헤드리스 브라우저 지문 랜덤화. Playwright를 쓴다면 세션마다 뷰포트 크기, 사용자 에이전트 문자열, 시간대, 로케일을 랜덤화하세요. 그러면 같은 봇이 새 IP로 다시 오는 것보다, 매번 다른 실제 사용자처럼 보일 수 있어요.
TikTok 모바일 API 엔드포인트 사용. 일부 커뮤니티 구성원은 웹 프런트엔드보다 모바일 스타일 엔드포인트를 노릴 때 탐지율이 낮다고 보고해요. 구현은 더 까다롭고 문서도 적지만, 고급 사용자에게는 실제로 통하는 기법이에요.
프록시가 정말 필요한 경우와 합리적인 선택지
대규모에서는 무료 기법만으로는 부족해요. 주거용 프록시 회전이 대량 TikTok 스크래핑의 표준 접근법이에요. 여기서 특정 유료 프록시 서비스를 추천하진 않을게요. 다만 일반적인 조언은 이래요. 데이터센터 프록시는 피하고(TikTok이 공격적으로 잡아냅니다), 요청마다 회전 가능한 주거용 또는 모바일 프록시 풀을 찾으세요.
또는 Thunderbit 같은 브라우저 기반 도구는 여러분의 브라우저 세션 안에서 실제 사용자처럼 움직이기 때문에 프록시 문제를 아예 비껴가요. 대규모에서 탐지가 완전히 불가능해지는 건 아니지만, 일반적인 마케팅이나 연구 용도(수백만 페이지가 아니라 수십~수백 페이지)에서는 훨씬 단순한 길이에요.
실제로 어떤 데이터를 얻나요? TikTok 스크래퍼의 실제 출력 예시
사용자는 도구를 쓰기 전에 실제로 무슨 데이터가 나오는지 알고 싶어 해요. 그런데 대부분의 가이드는 이 부분을 통째로 건너뛰죠. 아래는 소스 문서에 근거한 대표적인 필드 구조예요.
프로필 데이터
| 사용자 이름 | 표시 이름 | 팔로워 수 | 팔로잉 수 | 총 좋아요 수 | 소개글 | 인증 여부 | 프로필 URL |
|---|---|---|---|---|---|---|---|
| @examplecreator | Jane Doe | 1,240,000 | 312 | 48,700,000 | "요리 + 코미디 🍳" | ✅ | tiktok.com/@examplecreator |
| @travelwithmark | Mark S. | 890,000 | 150 | 22,100,000 | "여행 브이로거 🌍" | ❌ | tiktok.com/@travelwithmark |
| @fitnessmaya | Maya L. | 2,100,000 | 88 | 91,300,000 | "운동 & 웰니스" | ✅ | tiktok.com/@fitnessmaya |
제공 출처: GitHub 스크래퍼(TikTok-Api, Evil0ctal), Research API, Thunderbit(보이는 프로필 페이지에서).
비디오 메타데이터
| 비디오 URL | 캡션 | 조회수 | 좋아요 수 | 댓글 수 | 공유 수 | 음악 | 해시태그 | 게시일 | 길이 |
|---|---|---|---|---|---|---|---|---|---|
| tiktok.com/@ex/video/123 | "역대급 파스타 팁 🍝" | 4,200,000 | 312,000 | 8,400 | 21,000 | "Italian Vibes – DJ Marco" | #pasta #cooking #hack | 2026-03-15 | 0:42 |
| tiktok.com/@ex/video/456 | "POV: 고양이가 당신을 평가 중" | 9,100,000 | 1,100,000 | 23,000 | 55,000 | "Original Sound" | #cat #pov #funny | 2026-04-01 | 0:18 |
| tiktok.com/@ex/video/789 | "아무도 묻지 않은 아침 루틴" | 1,800,000 | 98,000 | 3,200 | 7,500 | "Chill Morning – LoFi" | #routine #morning | 2026-04-10 | 1:02 |
제공 출처: GitHub 스크래퍼(TikTok-Api, Evil0ctal), Research API (video_description, view_count, like_count, comment_count, share_count, music_id, hashtag_names, video_duration 포함), Thunderbit(비디오 수준 필드).
댓글 데이터
| 댓글 작성자 | 댓글 내용 | 좋아요 수 | 타임스탬프 | 답글 수 |
|---|---|---|---|---|
| @user_abc | "이거 해봤는데 진짜 되네요 😂" | 1,200 | 2026-03-16T08:12:00Z | 14 |
| @chef_dan | "다음엔 마늘을 넣어 보세요, 믿어 보세요" | 890 | 2026-03-16T09:45:00Z | 7 |
| @randomfan99 | "제가 원한 바로 그 콘텐츠예요" | 340 | 2026-03-16T11:30:00Z | 2 |
제공 출처: GitHub 스크래퍼(TikTok-Api, Evil0ctal), Research API (text, like_count, reply_count, create_time 포함), Thunderbit(보이는 댓글 섹션에서).
해시태그 및 검색 데이터
| 해시태그 | 상위 비디오 URL | 전체 조회수 | 트렌딩 여부 |
|---|---|---|---|
| #pasta | tiktok.com/@ex/video/123 | 4,200,000 | 예 |
| #cooking | tiktok.com/@chef/video/321 | 11,000,000 | 예 |
| #hack | tiktok.com/@tips/video/654 | 2,900,000 | 아니요 |
제공 출처: GitHub 스크래퍼(저장소별로 다름), Thunderbit(해시태그 스크래퍼 템플릿).
참고: 어떤 단일 저장소도 모든 필드를 항상 보장하진 않아요. TikTok 응답 구조는 바뀌고, 유지관리자들도 그 점을 경고해요. 위 표는 보장값이 아니라 대표 예시로 봐 주세요.
Thunderbit으로 클릭 두 번에 TikTok 데이터 긁는 법(단계별)
고장-수정 사이클에 지치셨나요? GitHub 저장소로 시도했다가 실패한 분들을 위한 탈출구, 노코드 경로를 소개할게요.
- Thunderbit Chrome 확장 프로그램을 설치하세요.
- 스크래핑할 TikTok 페이지로 이동하세요 — 프로필, 검색 결과 페이지, 해시태그 페이지, 개별 비디오 모두 가능해요.
- "AI 필드 제안"을 누르세요. Thunderbit AI가 페이지를 읽고 사용자 이름, 팔로워 수, 비디오 캡션, 좋아요, 해시태그 같은 열을 추천해요.
- 필요하면 필드를 손본 뒤 "스크래핑"을 누르세요. 데이터가 구조화된 표로 채워져요.
- 서브페이지 스크래핑으로 데이터를 보강하세요. 프로필 목록에서 각 비디오를 열어 전체 캡션, 음악 정보, 댓글 수, 공유 수 같은 추가 필드를 가져올 수 있어요.
- Google Sheets, Excel, Airtable, Notion으로 내보내세요 — 완전 무료예요.
유지보수 없음, 설치 트리아주 없음, 안티봇 설정 없음. AI가 TikTok 레이아웃 변경에 알아서 적응해요.
서브페이지 스크래핑으로 TikTok 데이터 보강하기
프로필이나 해시태그 페이지에서 비디오 목록을 긁은 뒤 "서브페이지 스크래핑"을 누르면, AI가 각 비디오 페이지를 방문해 추가 필드를 가져와요. 인플루언서 데이터베이스를 만들거나 경쟁사 콘텐츠 감사를 하는 마케터에게 특히 좋아요. 수십 개 페이지를 일일이 클릭하지 않고도 비디오 수준의 참여 데이터 전체 표를 얻을 수 있어요.
TikTok 데이터 내보내고 활용하기
Thunderbit은 Google Sheets, Excel, Airtable, Notion, CSV, JSON으로 무료 내보내기를 지원해요. 자주 쓰는 사례는 이래요.
- 참여도 분석을 위해 스프레드시트에 데이터를 넣기.
- CRM 스타일의 인플루언서 추적용으로 Airtable에 보내기.
- 팀 협업용 콘텐츠 리서치를 위해 Notion으로 넘기기.
Thunderbit의 웹 데이터 추출 방식을 더 자세히 보려면 웹 스크래핑 초보자 가이드를 확인하거나 Thunderbit YouTube 채널에서 튜토리얼을 보세요.
합법 선 안에서 움직이기: TikTok 이용약관과 스크래핑 준수
TikTok의 법적 입장은 명확해요. 플랫폼의 스크래핑 관련 개인정보 블로그는 이용약관이 정보 수집이나 서비스와의 비인가 상호작용을 하는 자동화 스크립트를 금지하며, 접근 제한 우회도 명시한다고 설명해요. TikTok의 커뮤니티 가이드라인도 자동화 스크립트나 웹 크롤링으로 정보를 기만적으로 얻으려는 시도를 금지하고요.
실무 지침은 이래요.
- 공개된 데이터만 다루세요. 비공개 콘텐츠나 로그인 게이트 콘텐츠는 긁지 마세요.
- 요청 제한을 지키세요. TikTok 서버를 과도하게 두드리지 마세요.
- 데이터 보호법을 준수하세요. 개인정보를 수집·저장·분석한다면 개인정보보호법(PIPA)과 GDPR, CCPA가 여전히 적용돼요.
- 자격이 된다면 Research API를 쓰세요. 준수 관점에서 가장 안전한 길이에요.
- 이건 법률 자문이 아니에요. 자신의 상황은 전문가와 상담하세요.
법적 쟁점을 더 알고 싶다면 웹 스크래핑의 법적 영향 가이드를 참고하세요.
TikTok 스크래퍼 GitHub 저장소가 죽었을 때 할 일
짧게 정리하면 이래요.
- GitHub에서 어떤 TikTok 스크래퍼든 클론하기 전에, 항상 60초 생체 신호 체크리스트를 돌리세요. 대부분의 저장소는 이미 죽어 있어요.
- 선택지를 이해하세요. 공식 API, GitHub 스크래퍼, 노코드 도구는 각각 다른 사용자와 사용 사례를 위한 거예요.
- GitHub 방식을 택한다면, 설치 문제 해결과 안티밴 설정에 쓸 시간을 확보하세요. 지속적인 유지보수를 각오해야 해요.
- 도구를 쓰기 전에 실제로 무슨 데이터가 나올지 알아두세요. 별 개수보다 출력 필드를 보세요.
- 개발자가 아니거나 깨진 저장소에 지쳤다면, Thunderbit 같은 노코드 도구를 써 보세요 — 클릭 두 번, 구조화된 데이터, 무료 내보내기.
필요한 TikTok 데이터는 접근 가능해요. 문제는 스크래퍼 유지보수에 시간을 쓸지, 아니면 데이터를 실제로 쓸지예요. 자신의 숙련도와 사용 사례에 맞는 방식을 고르고, 죽은 GitHub 저장소가 또 한 오후를 잡아먹게 두지 마세요.
자주 묻는 질문
2026년에도 GitHub에서 아직 작동하는 TikTok 스크래퍼가 있나요?
네, 다만 목록은 짧아요. davidteather/TikTok-Api가 2026년 4월 기준으로 활발히 유지보수되는, 가장 믿을 만한 오픈소스 선택지예요. Evil0ctal/Douyin_TikTok_Download_API도 살아 있지만 더 복잡하고요. 가장 별이 많은 drawrowfly/tiktok-scraper는 2023년 5월 이후 업데이트가 없어서 사실상 죽었어요. 어떤 저장소든 시간을 투자하기 전에 항상 생체 신호 체크리스트를 돌리세요.
TikTok 스크래핑은 합법인가요?
TikTok 이용약관은 자동화된 스크래핑을 명시적으로 금지해요. 공개적으로 보이는 데이터는 관할권에 따라 법적 회색지대에 놓일 수 있고요. 자격이 된다면 가장 안전한 길은 공식 Research API예요. 공개 데이터를 긁는다면 공개 접근 가능한 콘텐츠만 다루고, 요청 제한을 지키며, 개인정보보호법(PIPA)과 GDPR/CCPA를 준수하세요. 이건 법률 자문이 아니니, 자신의 상황은 전문가와 상담하세요.
코딩 없이 TikTok을 스크래핑할 수 있나요?
네. Thunderbit 같은 브라우저 기반 AI 도구를 쓰면 코드 한 줄 없이도 구조화된 TikTok 데이터(프로필, 비디오 메타데이터, 해시태그, 참여 지표)를 뽑을 수 있어요. TikTok Research API도 승인된 신청자에게는 최소한의 코딩만 요구하고요. 비개발자에게는 노코드 도구가 가장 빠르고 안정적인 길이에요.
TikTok 스크래퍼로 어떤 데이터를 얻을 수 있나요?
흔한 데이터 유형에는 프로필 정보(사용자 이름, 팔로워 수, 소개글, 인증 여부), 비디오 메타데이터(캡션, 조회수, 좋아요, 댓글, 공유, 음악, 해시태그, 길이, 게시일), 댓글(텍스트, 좋아요, 타임스탬프, 답글), 해시태그/검색 데이터(상위 비디오, 총 조회수, 트렌딩 상태)가 있어요. 정확한 필드는 도구와 방식에 따라 달라져요. 자세한 내용은 위 출력 예시 섹션을 보세요.
왜 내 TikTok 스크래퍼는 자꾸 차단되나요?
TikTok은 요청 제한, 쿠키/세션 게이팅, 브라우저 지문 인식, 행동 기반 탐지, 암호화된 요청 파라미터, CAPTCHA 흐름 등 여러 겹의 안티봇 방어를 써요. 차단의 흔한 원인은 너무 빠른 요청, 요청마다 깨끗한 새 세션 사용, 기본 지문을 단 헤드리스 브라우저 실행, 데이터센터 프록시 사용이에요. 무료·유료 우회책은 위 안티밴 플레이북 섹션을 참고하세요.


