300개의 원본 게시물이 담긴 스프레드시트를 열어 보면 문제는 바로 드러납니다. 복사, 붙여넣기, 읽기, 눈을 가늘게 뜨고 확인하기, 추측하기, 또 반복하기… 그러다 보면 결국 지금 추적 중인 출시를 사람들이 좋아했는지, 싫어했는지조차 자신 있게 말하기 어려워집니다.
이런 한계를 메우려고 감성 분석이 존재합니다. 그런데 문제는, 이 주제에 대한 대부분의 튜토리얼이 아직도 2022년에 머물러 있다는 점입니다. 이미 사라진 무료 API 접근을 전제로 하거나, sarcasm과 이모지를 제대로 처리하지 못하는 모델을 추천하거나, 실제 결과 품질을 좌우하는 전처리 단계를 그냥 건너뜁니다. 저는 SaaS와 자동화 분야에서 오래 일해 왔고(Thunderbit도 직접 만들었습니다), 그 과정에서 감성 분석 환경이 얼마나 크게 바뀌었는지 직접 봐 왔습니다. 지금 기준으로 솔직하고 최신인 접근법은 Python과 노코드 워크플로를 모두 포함하고, 2026년 현실에 맞는 데이터 수집 방식과 모델을 다룹니다.
Twitter 감성 분석이란?
Twitter 감성 분석은 X의 게시물을 텍스트, 이모지, 맥락을 바탕으로 긍정, 부정, 중립으로 자동 분류하는 과정입니다. 쉽게 말해, 머신에게 트윗을 읽게 한 뒤 “이 사람은 기쁜가, 불만스러운가, 아니면 그 중간인가?”를 답하게 만드는 일입니다.
다만 감성 분석은 일반적인 소셜 리스닝과는 다릅니다. 소셜 리스닝은 사람들이 무엇을 말하는지, 즉 주제·트렌드·언급량을 추적하는 일입니다. 감성 분석은 그 위에 얹히는 점수화와 분류 계층으로, 사람들이 말하는 대상에 대해 어떻게 느끼는지를 알려줍니다. 이 개념은 수십 년 전부터 이어져 온 계산언어학과 의견 마이닝 연구에 뿌리를 두고 있지만, 실제 비즈니스 도구로 자리 잡은 것은 최근 몇 년의 일입니다.
대표적인 분류 수준은 다음과 같습니다.
- 이진 분류: 긍정 또는 부정(가장 단순하지만 뉘앙스를 잃기 쉬움)
- 삼진 분류: 긍정, 중립, 부정(가장 흔한 기본값)
- 세분화 분류: 매우 긍정적 → 매우 부정적(연구나 세밀한 브랜드 추적에 유용)
이와 관련되지만 별개의 과제로는 감정 탐지(화남, 슬픔, 기쁨 등), 입장 탐지(어떤 주장에 찬성/반대하는지), 측면 수준 감성 분석(예: 가격과 품질에 대해 각각 어떻게 느끼는지), sarcasm/반어 탐지가 있습니다. TweetEval 벤치마크는 이들을 별도 과제로 다루는데, 그럴 만한 이유가 있습니다. 단일 감성 점수로는 모든 비즈니스 질문에 답할 수 없기 때문입니다. 제품 출시를 추적한다면 아마 측면 수준 감성 분석(“카메라는 좋은데 배터리는 별로”)이 더 필요할 것입니다. 위기를 모니터링한다면 단순한 극성보다 감정과 언급량이 더 중요합니다.
Twitter 감성 분석이 비즈니스에 중요한 이유
X는 실시간 대화를 중심으로 설계되어 있어, 출시 반응이나 라이브 이벤트, 속보에 대한 반응이 굉장히 빠르게 쌓입니다. 기업 입장에서는 바로 그 속도가 핵심입니다. 감성 분석은 구조화되지 않은 텍스트의 홍수를 팀이 검토하고 바로 실행할 수 있는 구조화된 데이터로 바꿔줍니다.
대표적인 활용 사례는 다음과 같습니다.
| 활용 사례 | 담당 팀 | 비즈니스 효과 |
|---|---|---|
| 브랜드 평판 모니터링 | PR, 마케팅 | 부정적 급증을 바이럴되기 전에 포착 |
| 제품 출시 피드백 | 제품, 마케팅 | 무엇이 잘 되고 무엇이 문제인지 실시간 파악 |
| 경쟁사 벤치마킹 | 전략, 마케팅 | 같은 기간 기준으로 브랜드 인식 비교 |
| 위기 감지 | PR, 운영 | 부정 언급량이 급증할 때 사람 검토 트리거 |
| 캠페인 성과 측정 | 마케팅 | 크리에이티브, 채널, 시점별 감성 변화 측정 |
| 시장/주가 심리 | 금융, 리서치 | 실적 발표, 이벤트, 정책에 대한 대중 정서 추적 |
| 정치·정책 연구 | 연구, 정부 | 대규모 여론 파악 |
더 구체적으로 보면, X의 2026 슈퍼볼 요약은 단일 이벤트에서 4백만 명의 작성자가 1,600만 건의 Posts를 남기고, 50억 회의 노출과 6억 5백만 회의 영상 조회가 발생했다고 보고했습니다. 대화의 절반이 실시간으로 이뤄졌다고도 합니다. 이 정도 규모에서는 사람이 하나하나 읽는 건 불가능하고, 자동 감성 점수는 사실상 필수입니다.
그리고 이건 단순히 볼륨 문제만도 아닙니다. X의 BrandRanx 방법론도 볼륨, 참여도, 감성을 함께 사용합니다. 즉, 감성은 다른 신호들과 묶였을 때 가장 강력하지, 단독으로 쓸 때가 아닙니다.
핵심은 이겁니다. 제품, 브랜드, 캠페인, 위기 대응처럼 대중 인식을 바탕으로 의사결정하는 팀이라면, X 데이터를 활용한 감성 분석은 가장 빠른 피드백 루프 중 하나입니다.
2026년 X API 현실: 트윗 데이터를 실제로 얻는 방법
여기서 대부분의 튜토리얼이 무너집니다. Tweepy 기반 가이드를 그대로 따라 코드만 붙여 넣었는데 페이월이나 이해하기 어려운 오류를 만난 적이 있다면, 당신만 그런 게 아닙니다. 예전의 Free / Basic / Pro 구독 티어는 사라졌습니다. 이제 X API는 사전 충전 크레딧 기반 사용량 과금 방식이며, 엔드포인트별 비용과 실시간 사용량 추적이 적용됩니다.
현재 사용 가능한 모든 데이터 수집 방식의 솔직한 비교는 다음과 같습니다.
| 방법 | 비용(2026) | 수집량 | 난이도 | 비고 |
|---|---|---|---|---|
| X API v2 (사용량 기반) | Post 1건 읽기당 $0.005 | 셀프서비스 기준 월 최대 200만 Post 읽기 | 중급(Python) | 공식적, 재현 가능, 준수 가능 |
| 전체 아카이브 검색 | 반환 Post 1건당 $0.005, 전체 아카이브 count 요청당 $0.010 | 2006년 3월까지 | 중급~고급 | 사용량 기반 및 Enterprise에서 이용 가능 |
| 필터드 스트림 | 전달 시 Post 읽기 과금 | 실시간 연속 수집 | 중급~고급 | 라이브 수집에 가장 적합 |
| 사전 구축 데이터셋(Kaggle, Sentiment140) | $0 | 정적, 과거 데이터만 | 초급 | 학습용으로 좋지만 라이브 분석에는 부적합 |
| snscrape, Twint, Twikit 등 | $0 | 불안정 / 자주 깨짐 | 고급 | snscrape는 2023년 이후 X 검색에 작동하지 않음; Twint는 보관 상태; Twikit은 비공식 방식 사용 |
| 자체 X 아카이브 | $0 | 내 게시물만 | 초급 | 개인 분석에 유용 |
알아둘 점도 몇 가지 있습니다.
- 예전 Free/Basic/Pro 티어는 사라졌습니다. 지금도 있는 것처럼 적어 둔 튜토리얼은 그대로 따라가지 마세요.
- snscrape는 X에서 사실상 더 이상 쓸 수 없습니다. 유지관리자가 2024년에 Twitter 검색 스크래핑이 더는 작동하지 않는다고 확인했습니다. Twint는 보관 상태입니다. Twikit은 비공식 스크래핑과 쿠키를 사용합니다. 동작한다고 해서 허용되는 건 아닙니다.
- X 약관은 사전 서면 동의 없는 브라우저 스크래핑을 금지합니다. 즉 Selenium, Playwright, 브라우저 확장 프로그램은 X API 접근을 대신하는 준수 가능한 우회책이 아닙니다.
X API v2: 실제로 무엇을 얻을 수 있나
표준 Post 읽기 비용은 반환 Post 1건당 $0.005입니다. User 읽기는 1건당 $0.010입니다. 그래서 서로 다른 10,000개 Post를 읽으면 다른 리소스 비용을 제외해도 약 $50 정도가 듭니다. 셀프서비스 상한은 월 200만 Post 읽기입니다. 요금은 바뀔 수 있으니 항상 Developer Console을 확인하세요.
감성 분석에는 id와 text만으로는 부족합니다. 유용한 최소 스키마에는 created_at, lang, author_id, conversation_id, referenced_tweets, entities, context_annotations, public_metrics가 들어갑니다. 원본 응답과 함께 쿼리, 엔드포인트, UTC 시간 범위, 페이지네이션 토큰의 변경 불가능한 기록도 저장하세요. 이 정보가 없으면 말뭉치는 재현할 수 없습니다.
또 하나의 변수는 X의 2026년 5월 4일 검색 인덱스 마이그레이션입니다. 이 변경으로 관측되는 말뭉치가 달라졌습니다. 키워드 REST 검색은 더 이상 리포스트를 반환하지 않지만, Filtered Stream은 그대로입니다. 그 날짜 전후의 결과를 비교한다면 서로 다른 모집단을 세고 있을 수도 있습니다.
사전 구축 데이터셋: 학습에는 좋지만 라이브 분석에는 부적합
Sentiment140(160만 개 트윗, 원거리 지도학습 라벨)과 여러 Kaggle 데이터셋은 무료이고 교육이나 벤치마킹에 좋습니다. 하지만 Sentiment140은 2009년에 수집되었습니다. TweetEval의 감성 하위셋도 2013–2016년 SemEval 데이터를 사용합니다. 2026년의 언어, 슬랭, 이벤트에 대해 모델이 잘 작동한다는 증거로 보긴 어렵습니다.
Thunderbit와 X 데이터에 대한 한 가지 설명
이 부분은 분명히 하고 싶습니다. Thunderbit를 만든 입장에서 말씀드리면, Thunderbit는 여러 호환 웹사이트에서 작동하는 AI 웹 스크래핑 및 자동화 도구입니다. 하지만 현재 X 약관은 동의 없는 브라우저 스크래핑을 금지합니다. 그래서 Thunderbit를 X API 비용이나 접근 제한을 우회하는 방법으로 소개하지는 않겠습니다. 그건 오해의 소지가 있기 때문입니다. X 데이터는 공식 API, 승인된 제공업체, 또는 본인 계정 아카이브를 사용하세요. Thunderbit가 감성 분석 워크플로에서 유용한 지점은 그 다음 단계입니다. 이미 허용된 경로로 수집한 데이터를 구조화하고, 라벨링하고, 내보내는 작업에 잘 맞습니다. 이 부분은 뒤에서 더 설명하겠습니다.
올바른 감성 모델 고르기: VADER vs. TextBlob vs. RoBERTa

어떤 모델을 고르느냐는 대부분의 튜토리얼이 말하는 것보다 훨씬 중요합니다. 그리고 경쟁 가이드에서 가장 큰 빈칸은, 트윗에 맞게 파인튜닝된 transformer 모델을 거의 다루지 않는다는 점입니다. 지금 실무에서 가장 강력한 기준선 일부가 바로 여기에 있습니다.
아래는 직접 비교한 내용입니다. 데이터셋, 분할 방식, 라벨 정의, 시기, 평가 지표가 다르면 점수도 달라지기 때문에, 이 표에는 보편적인 F1 수치를 넣지 않았습니다. 대신 상대적 성능을 설명하고 검증 가능한 벤치마크를 안내하겠습니다.
| 모델 / 라이브러리 | 접근 방식 | sarcasm 처리 | 슬랭/이모지 처리 | 트윗 기준 상대 정확도 | 설정 복잡도 |
|---|---|---|---|---|---|
| VADER (NLTK) | 규칙 기반 사전 방식 | 약함 | 일부 이모지 지원 | 가장 낮음 | 매우 낮음 |
| TextBlob | 패턴 기반 | 약함 | 없음 | 낮음 | 매우 낮음 |
| Naive Bayes / Logistic Regression (TF-IDF) | 전통적 머신러닝 | 없음 | 없음 | 보통 | 중간 |
| CardiffNLP RoBERTa | Transformer(트윗 파인튜닝) | 더 나음(완벽하진 않음) | 있음 | 이들 중 가장 높음 | 중간(HuggingFace pipeline) |
VADER: 빠르고 간단하지만 한계가 분명함
VADER는 소셜 텍스트용으로 만든 규칙 기반 사전 방식입니다. 빠르고 해석 가능하며, 학습 데이터가 필요 없고 일부 이모지와 이모티콘을 처리할 수 있습니다. 부정 표현, 강도 조절어, 문장부호, 대문자도 반영합니다. 빠르게 기준선을 만들거나 계산 자원과 투명성이 중요할 때 유용합니다. 하지만 sarcasm, 슬랭, 맥락 의존적 의미, 그리고 단어 하나를 넘는 이해가 필요한 경우에는 약합니다. 기본 compound 점수 임계값(≥0.05 = 긍정, ≤-0.05 = 부정)은 어디까지나 기본값이지 보편적인 비즈니스 기준은 아닙니다. 직접 검증 세트로 조정하세요.
TextBlob: 더 단순하지만, 더 제한적임
TextBlob은 아주 작은 교육용 기준선입니다. 기본 PatternAnalyzer는 트윗 스타일 텍스트로 학습되어 있지 않습니다. 첫 NLP 실험에는 유용하지만, 프로덕션용 트윗 분석에는 맞지 않습니다.
전통적 머신러닝: Naive Bayes, Logistic Regression, SVM
단어 및 문자 TF-IDF 파이프라인에 logistic regression 또는 LinearSVC를 붙이는 방식은 여전히 유용한 지도학습 기준선입니다. 비용이 적고 해석 가능하며, transformer를 쓸 만큼 가치가 있는지 판단하는 데 도움을 줍니다. 핵심 규칙은 하나입니다. 어휘와 IDF 누수를 막기 위해 vectorizer는 반드시 train/validation 분할 이후에 fit해야 합니다.
이 모델들은 라벨이 잘 달린 대규모 데이터셋에서는 규칙 기반 방식보다 낫지만, 맥락, sarcasm, 슬랭은 여전히 놓칩니다.
CardiffNLP RoBERTa: 2026년 트윗 감성 분석의 기준
cardiffnlp/twitter-roberta-base-sentiment-latest는 관리가 계속되는 트윗 전용 3분류 모델이며, 2026년 기준으로 꽤 합리적인 강력한 기본값입니다. 대규모 트윗 코퍼스로 사전학습되고 감성에 맞게 파인튜닝되었기 때문에, 이모지, 슬랭, 비격식 표현을 규칙 기반이나 전통적 머신러닝보다 훨씬 잘 처리합니다.
HuggingFace로 실행하는 최소 예시는 다음과 같습니다.
from transformers import pipeline
classifier = pipeline(
"text-classification",
model="cardiffnlp/twitter-roberta-base-sentiment-latest",
top_k=None,
)
scores = classifier("@user Love waiting three hours for support 😒 http")
print(scores)
몇 가지 주의점도 있습니다.
- 출력은 보정된 비즈니스 확률이 아니라 모델 점수입니다. 현재 라벨링된 샘플로 보정하거나 거절 임계값을 추가하세요.
- 문맥형 모델은 많은 트윗 과제에서 규칙 시스템보다 대체로 더 잘 작동하지만, sarcasm, 대상이 섞인 게시물, 스레드 문맥 누락, 방언, 코드화된 언어는 여전히 구조적 오류 원인입니다. 어떤 모델도 sarcasm을 “이해한다”고 말하면 안 됩니다. 더 정확한 표현은 “훨씬 더 잘 처리하지만 완벽하지는 않다”입니다.
- 대안으로는 언어와 과제에 따라 BERTweet, TimeLMs, 다국어 Twitter-XLM-R 모델 등이 있습니다.
그렇다면 Twitter 감성 분석은 실제로 정확할까요? 네, 모델, 전처리, 라벨 정의, 평가 샘플이 과제에 맞아떨어질 때는 그렇습니다. 2019년 튜토리얼에서 그대로 복사한 일반적인 VADER 스크립트는 기준선일 뿐, 프로덕션 품질의 증거는 아닙니다.
진짜 트윗 전처리 파이프라인 (text.lower()만이 아님)

감성 모델에 원본 URL, @멘션, HTML 엔티티를 그대로 넣으면 꽤 괜찮은 모델도 엉뚱한 결과를 낼 수 있습니다. 대부분의 튜토리얼(상위 노출 글조차 포함)은 텍스트를 소문자로 바꾸는 정도만 한 뒤 모델에 넣습니다. 그러면 정확도가 조용히 무너집니다. 특히 전통적 머신러닝에서는 전처리 품질이 모델 선택만큼 중요할 수 있습니다.
무엇을 정리해야 하고, 왜 중요한가
| 요소 | 처리 방법 | 이유 |
|---|---|---|
| URL | http 같은 자리표시자로 치환 | URL 자체는 감성 신호가 거의 없고, 주변 텍스트를 없애면 문맥이 깨질 수 있음 |
| @멘션 | 핸들을 @user로 치환 | 구조는 유지하고 작성자 식별 정보 누수를 제거 |
| 이모지/이모티콘 | 최신 토크나이저에는 보존, 희소 특성 모델에는 텍스트화한 버전도 테스트 | 이모지는 강한 감성 신호이므로 삭제하면 정보 손실이 큼 |
| 해시태그 | 토큰은 유지하고, 필요하면 분리된 복사본도 추가(예: #ClimateChangeIsReal → Climate Change Is Real) | 해시태그에 의견이 담겨 있는 경우가 많음 |
| 부정 표현 | not, no, never, 축약형, 대조 표현 유지 | 일반적인 불용어 목록이 이들을 지워 감성을 뒤집을 수 있음 |
| 대소문자/문장부호 | VADER 및 호환 모델에서는 유지 | VADER는 대문자와 문장부호를 특징으로 사용 |
| RT 접두어 | RT 표시 제거 | 메타데이터이지 감성이 아님 |
| 리포스트/중복 | 분할 전에 완전 중복과 근사 중복 탐지 | train/test에 중복이 섞이면 누수가 발생 |
전처리가 트윗에 실제로 하는 일: 전/후 비교
아래 예시를 보세요.
| 단계 | 텍스트 |
|---|---|
| 원본 트윗 | RT @BrandX: Wow, #CustomerServiceFail 😡😡 https://t.co/abc123 I've been waiting 3 hrs ngl this is awful |
| URL 제거 후 | RT @BrandX: Wow, #CustomerServiceFail 😡😡 http I've been waiting 3 hrs ngl this is awful |
| 멘션 정규화 후 | RT @user: Wow, #CustomerServiceFail 😡😡 http I've been waiting 3 hrs ngl this is awful |
| RT 제거 후 | @user: Wow, #CustomerServiceFail 😡😡 http I've been waiting 3 hrs ngl this is awful |
| 해시태그 분리 후 | @user: Wow, #CustomerServiceFail Customer Service Fail 😡😡 http I've been waiting 3 hrs ngl this is awful |
| 이모지를 텍스트로 변환한 경우(희소 모델용) | @user: Wow, #CustomerServiceFail Customer Service Fail angry_face angry_face http I've been waiting 3 hrs ngl this is awful |
| 최종본(CardiffNLP RoBERTa용) | @user Wow, #CustomerServiceFail Customer Service Fail 😡😡 http I've been waiting 3 hrs ngl this is awful |
CardiffNLP RoBERTa 같은 transformer 모델은 이모지, 문장부호, 대소문자를 그대로 보존합니다. 이런 형태의 텍스트로 학습되었기 때문입니다. 반면 TF-IDF 모델이라면 이모지를 텍스트로 바꾸고, 소문자로 바꾸고, 표제어 추출을 할 수 있습니다.
바로 붙여 쓸 수 있는 Python 전처리 코드
Transformer 호환 전처리를 위한 깔끔한 모듈형 함수는 다음과 같습니다.
import html
import re
import unicodedata
URL_RE = re.compile(r"https?://\S+|www\.\S+", re.I)
MENTION_RE = re.compile(r"(?<!\w)@[A-Za-z0-9_]+")
def normalize_social_text(text: str) -> str:
"""Transformer 기반 감성 모델에 맞게 트윗을 정규화한다."""
text = html.unescape(text)
text = unicodedata.normalize("NFC", text)
text = URL_RE.sub("http", text)
text = MENTION_RE.sub("@user", text)
text = re.sub(r"\bRT\b", "", text)
return " ".join(text.split())
전통적 머신러닝 파이프라인이라면 여기에 소문자화, 이모지를 텍스트로 변환(emoji 또는 demoji 라이브러리), 해시태그 분리(wordninja 또는 ekphrasis), 슬랭 정규화, 불용어 제거, 표제어 추출(spaCy 또는 NLTK 사용)을 추가합니다. 핵심 원칙은 전처리를 모델에 맞추는 것입니다. 예를 들어 BERTweet는 자체 문서화된 정규화 규칙을 사용합니다. 모든 모델을 하나의 파이프라인에 억지로 넣지 마세요.
단계별: Python으로 Twitter 감성 분석하기
지금까지 내용을 하나로 묶은 전체 워크플로입니다. 처음부터 끝까지 따라 해볼 수 있습니다.
시작 전에:
- 난이도: 중급(Python 기초 지식 필요)
- 소요 시간: 전체 파이프라인 30~60분, 빠른 transformer 경로는 약 10분
- 준비물: Python 3.8+, 무료 Google Colab 또는 로컬 환경,
pandas,transformers,scikit-learn,matplotlib,seaborn, 선택적으로wordcloud
1단계: 트윗 데이터 수집하기
이 튜토리얼에서는 Sentiment140 데이터셋을 사용하겠습니다(무료, 160만 트윗, Kaggle 제공). 역사 데이터이긴 하지만 학습과 벤치마킹에는 아주 좋습니다.
실시간 데이터가 필요하다면 X API v2 사용량 기반 요금을 사용하세요. 표준 Post 읽기 비용은 $0.005입니다. 10,000개의 Posts라면 대략 $50입니다.
데이터셋을 불러옵니다.
import pandas as pd
columns = ["target", "id", "date", "flag", "user", "text"]
df = pd.read_csv(
"training.1600000.processed.noemoticon.csv",
encoding="latin-1",
names=columns,
)
# 라벨: Sentiment140은 0 = 부정, 4 = 긍정 사용
df["label"] = df["target"].map({0: "negative", 4: "positive"})
print(df[["text", "label"]].head())
원본 트윗 텍스트와 라벨 컬럼이 있는 DataFrame이 보이면 됩니다.
2단계: 트윗 정리 및 전처리하기
앞서 소개한 전처리 함수를 적용합니다.
df["clean_text"] = df["text"].apply(normalize_social_text)
print(df[["text", "clean_text"]].head())
몇 개 행을 확인해 URL이 바뀌었는지, 멘션이 정규화되었는지, RT 접두어가 제거되었는지 살펴보세요.
3단계: 모델 선택 후 감성 분류하기
경로 A: TF-IDF + Logistic Regression 기반 전통적 머신러닝
기본기를 이해하는 경로입니다. 데이터를 분할하고, vectorizer는 학습 데이터에만 fit한 뒤 logistic regression 분류기를 학습합니다.
from sklearn.model_selection import train_test_split
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import classification_report
X_train, X_test, y_train, y_test = train_test_split(
df["clean_text"], df["label"], test_size=0.2, random_state=42
)
vectorizer = TfidfVectorizer(max_features=50000, ngram_range=(1, 2))
X_train_tfidf = vectorizer.fit_transform(X_train)
X_test_tfidf = vectorizer.transform(X_test)
clf = LogisticRegression(max_iter=1000)
clf.fit(X_train_tfidf, y_train)
y_pred = clf.predict(X_test_tfidf)
print(classification_report(y_test, y_pred))
각 클래스의 precision, recall, F1이 포함된 분류 리포트가 출력됩니다. Sentiment140에서는 TF-IDF와 logistic regression이 대체로 괜찮은 성능을 보이지만, 이 데이터는 2009년 데이터이고 원거리 지도학습(이모티콘을 라벨로 사용) 기반이므로 이 수치를 프로덕션 벤치마크로 보면 안 됩니다.
경로 B: HuggingFace의 CardiffNLP RoBERTa
트윗 텍스트에서 가장 좋은 정확도를 원한다면 사전학습된 transformer를 사용하세요.
from transformers import pipeline
classifier = pipeline(
"text-classification",
model="cardiffnlp/twitter-roberta-base-sentiment-latest",
top_k=None,
)
sample_tweets = [
"@user Love waiting three hours for support 😒 http",
"@user This new update is absolutely fantastic, best one yet!",
"@user The event was okay, nothing special.",
]
for tweet in sample_tweets:
result = classifier(tweet)
print(f"Tweet: {tweet}\nScores: {result}\n")
각 트윗에 대해 negative, neutral, positive 라벨 점수가 리스트로 나옵니다. sarcasm이 섞인 트윗(“Love waiting three hours...”)은 규칙 기반 모델보다 부정 점수가 더 높게 나올 가능성이 큽니다. 물론 이 경우에도 완벽한 모델은 없습니다.
4단계: 결과 평가하기
이제 전통적 머신러닝 경로에 대해 confusion matrix heatmap을 그려보겠습니다.
import matplotlib.pyplot as plt
import seaborn as sns
from sklearn.metrics import confusion_matrix
cm = confusion_matrix(y_test, y_pred, labels=["negative", "positive"])
sns.heatmap(cm, annot=True, fmt="d", xticklabels=["negative", "positive"],
yticklabels=["negative", "positive"], cmap="Blues")
plt.xlabel("Predicted")
plt.ylabel("Actual")
plt.title("Confusion Matrix: Logistic Regression on Sentiment140")
plt.show()
Transformer 경로에서는 현재 샘플 50~100개를 직접 라벨링해 모델과 비교하세요. macro F1, 클래스별 precision/recall, confusion matrix를 보고하세요. 실제 프로젝트라면 calibration도 점검하고, 애매한 경우를 위한 abstention 임계값도 설정해야 합니다.
5단계: 엣지 케이스 테스트하기
sarcasm, 이모지, 슬랭을 시험하는 트윗 몇 개를 넣어보세요.
edge_cases = [
"Oh great, another update that breaks everything 🙄",
"ngl this product slaps 🔥🔥🔥",
"The camera is amazing but the battery life is trash",
"Just got my order. It's... fine. I guess.",
]
for tweet in edge_cases:
clean = normalize_social_text(tweet)
result = classifier(clean)
print(f"Tweet: {tweet}\nScores: {result}\n")
모델이 잘 맞힌 부분과 어려워하는 부분을 보세요. “카메라는 훌륭하지만 배터리는 별로”처럼 대상이 섞인 트윗은 잘 알려진 난제입니다. 측면 수준 감성 분석은 별도의 과제입니다.
코딩 없이 Twitter 감성 분석하기
모두가 Python을 직접 쓰고 싶어 하는 건 아닙니다. 괜찮습니다. 마케터, 브랜드 매니저, 운영 책임자처럼 코드 없이 감성 인사이트가 필요한 분들을 위한 경로도 있습니다.
솔직하게 말하면, 노코드 도구는 속도를 얻는 대신 커스터마이징을 포기합니다. 빠른 브랜드 모니터링에는 좋지만, 연구 수준의 분석이나 맞춤 모델 학습에는 적합하지 않습니다.
노코드 옵션 한눈에 보기
| 도구 | 가장 적합한 용도 | 내장 감성 분석 | 가격대 |
|---|---|---|---|
| AWS Comprehend | 엔터프라이즈 규모 텍스트 분석 | 있음 | 사용량 기반 |
| Brandwatch / Sprinklr | 전체 소셜 리스닝 스위트 | 있음 | 엔터프라이즈 요금 |
| Google Sheets + NLP 애드온 | 빠른 경량 분석 | 애드온 통해 가능 | 무료~저가 |
| Thunderbit + 스프레드시트 | 호환 페이지의 데이터를 구조화하고 라벨링 | 탐색용 라벨용 AI Field Prompt | 무료 플랜 제공 |
노코드 워크플로: 데이터 수집 후 스프레드시트에서 분류하기
트윗 데이터를 이미 가지고 있는 사람(공식 X API, 승인된 제공업체, 또는 본인 아카이브를 통해 수집한 경우)을 위한 실용 워크플로는 다음과 같습니다.
- 트윗 데이터를 스프레드시트로 내보냅니다. X API를 사용했다면 JSON을 CSV로 내보내거나, 허용된 범위의 호환 페이지에서 데이터를 구조화·내보내는 데 Thunderbit 같은 도구를 사용할 수 있습니다.
- Google Sheets에서 엽니다. 트윗 텍스트를 열에 붙여넣거나 가져옵니다.
- 감성 분류기를 적용합니다. Google Sheets용 NLP 애드온(현재 옵션은 애드온 마켓플레이스를 확인)이나 AWS Comprehend 같은 서비스를 사용하세요. 일부 애드온은 셀 수식 안에서 바로 감성 분류를 지원합니다.
- 검토하고 시각화합니다. Google Sheets의 기본 차트 기능으로 감성 분포 막대그래프나 시간에 따른 감성 선그래프를 만듭니다.
Thunderbit의 AI Field Prompt는 호환 페이지의 추출 과정에서 프롬프트 기반 감성 라벨을 추가하는 데도 사용할 수 있습니다. 탐색적 모니터링에는 유용합니다. 하지만 감사 대상이거나 중요도가 높은 의사결정에는, 샘플 검증과 문서화된 모델 사용이 필요합니다.
노코드와 Python 중 무엇을 써야 할까
| 상황 | 추천 경로 |
|---|---|
| 빠른 브랜드 체크, 소량 데이터 | 노코드(스프레드시트 + 애드온) |
| 팀 대시보드, 주간 리포팅 | 노코드 또는 로우코드 |
| 대규모 분석, 맞춤 모델 | Python |
| 학술 연구, 재현성 | Python |
| 대규모 실시간 모니터링 | Python + API + 예약 파이프라인 |
Twitter 감성 결과 시각화하기

대부분의 튜토리얼은 분류 리포트에서 끝납니다. 하지만 팀에 결과를 전달하거나 의사결정을 하려면 시각화가 꼭 필요합니다.
감성 분포 막대그래프
가장 기본적이지만 가장 널리 쓸모 있는 출력입니다.
import matplotlib.pyplot as plt
import seaborn as sns
sentiment_counts = df["label"].value_counts()
sns.barplot(x=sentiment_counts.index, y=sentiment_counts.values, palette="coolwarm")
plt.xlabel("Sentiment")
plt.ylabel("Tweet Count")
plt.title("Sentiment Distribution")
plt.show()
감성별 워드클라우드
긍정과 부정 트윗을 분리한 워드클라우드는 사람들이 실제로 무엇을 말하는지 보여줍니다.
from wordcloud import WordCloud
for sentiment in ["positive", "negative"]:
text = " ".join(df[df["label"] == sentiment]["clean_text"])
wc = WordCloud(width=800, height=400, background_color="white").generate(text)
plt.figure(figsize=(10, 5))
plt.imshow(wc, interpolation="bilinear")
plt.axis("off")
plt.title(f"Word Cloud: {sentiment.capitalize()} Tweets")
plt.show()
시간에 따른 감성: 다른 곳에서는 잘 안 보여주는 차트
이 시각화는 원시 데이터를 이야기로 바꿉니다. 타임스탬프가 있다면 이벤트, 출시, 위기 상황에서 감성이 어떻게 변하는지 추적할 수 있습니다.
df["date"] = pd.to_datetime(df["date"])
df["day"] = df["date"].dt.date
sentiment_map = {"positive": 1, "neutral": 0, "negative": -1}
df["score"] = df["label"].map(sentiment_map)
daily = df.groupby("day")["score"].mean()
plt.figure(figsize=(12, 5))
daily.plot()
plt.xlabel("Date")
plt.ylabel("Average Sentiment Score")
plt.title("Sentiment Over Time")
plt.axhline(0, color="gray", linestyle="--")
plt.show()
출시일에 갑자기 하락했다면? 부정 트윗을 더 파고들어 무엇이 문제였는지 확인해야 한다는 신호입니다.
Confusion Matrix Heatmap
위 평가 단계에서 이미 보여드렸습니다. 핵심은 모델이 긍정을 부정으로 착각하는지, 아니면 그 반대인지 확인하는 것입니다. 그런 트윗은 수동 검토할 가치가 있습니다.
비코더를 위한 차트 작성: Google Sheets나 Notion에서
감성 라벨이 붙은 데이터를 스프레드시트로 내보냈다면, Google Sheets, Notion, 또는 어떤 BI 도구에서든 감성 분포와 추세를 바로 차트로 만들 수 있습니다. Python은 필요하지 않습니다.
Twitter 감성 분석에서 자주 하는 실수와 피하는 법
실제 워크플로에서는 같은 실수가 계속 반복됩니다.
sarcasm과 반어
정확도를 가장 크게 떨어뜨리는 요소입니다. “Love waiting three hours for support 😒”는 규칙 기반 모델에는 긍정처럼 보일 수 있습니다. transformer 모델이 더 잘 처리하지만, sarcasm은 구조적으로 어렵습니다—특히 게시물 단독으로는 문맥(스레드, 작성자의 과거, 사건)이 없을 때 더 그렇습니다. 중요한 사용 사례라면 모델 출력과 사람의 샘플 검토를 함께 쓰세요.
이모지와 슬랭의 사각지대
전처리에서 이모지를 텍스트로 바꾸지 않고 지워 버리거나(희소 모델용) transformer에서도 보존하지 않으면, 데이터에서 가장 강한 감성 신호를 버리는 셈입니다. 슬랭도 마찬가지입니다. “ngl this slaps”는 긍정이지만, 격식체 영어만 학습한 모델은 그 의미를 모릅니다.
오래된 API 튜토리얼과 깨진 스크래퍼
튜토리얼이 Tweepy와 API v1.1을 쓰고 있다면 오래된 것입니다. snscrape를 권한다면, 그것은 2023년 이후 X 검색에 작동하지 않습니다. 따라 하는 튜토리얼의 날짜와 API 버전은 꼭 확인하세요.
단일 데이터셋에 과적합하기
Sentiment140은 학습용으로 좋지만 2009년 데이터입니다. 2024 EMNLP의 소셜 미디어 데이터셋 20개 감사 연구에 따르면, 중복을 제거하면 테스트한 19개 데이터셋 중 14개에서 F1이 떨어졌고, 19개 중 17개에서 모델 순위가 바뀌었습니다. 시간 기준 분할, 이벤트 비중복 분할, 가능하다면 작성자 비중복 분할을 사용하세요. 최근 트윗으로 모델이 일반화되는지 확인해야 합니다.
감성 점수를 정답으로 간주하기
모델 점수는 보정된 확률이 아닙니다. 감성 라벨만 믿고 자동 응답이나 외부 공개 결정을 내리지 마세요. 개인이나 위기 대응에 영향을 주는 결정은 반드시 사람 검토가 필요합니다.
개인정보, 플랫폼 정책, 책임 있는 사용
이 섹션은 선택 사항이 아닙니다.
X의 Developer Policy는 개인정보 보호, 사용자 통제, 콘텐츠 삭제, 그리고 X 외부 매칭 제한을 강조합니다. 실무 규칙은 다음과 같습니다.
- 필요한 필드만 수집합니다.
- 원본 핸들을 그대로 공개하기보다 집계 결과를 사용합니다.
- 준수를 위해 Post ID와 조회 시점을 보관합니다.
- 삭제, 보호 설정 변경, 적격 요청이 있을 경우 저장 콘텐츠를 제거하거나 업데이트합니다.
- 개인의 민감한 특성을 추론하지 않습니다.
- 허용된 근거와 동의 없이 감성 점수를 CRM 신원 정보와 결합하지 않습니다.
- restricted-use 규칙에서 금지된 경우 X Content를 사용해 foundation model을 학습하거나 파인튜닝하지 않습니다.
- 샘플 크기, 쿼리어, 시간 범위, 언어 필터, 제외 항목을 문서화합니다.
- 감성 점수만으로 공개 응답을 자동화하지 않습니다.
감성 분석은 강력한 도구이지만, 그만큼 책임도 따릅니다. 그에 맞게 사용하세요.
결론 및 핵심 정리
Twitter 감성 분석은 2026년에도 충분히 잘 작동합니다. 다만 지금 현실에 맞게 접근 방식을 업데이트해야 합니다. 예전 공식(무료 API, 소문자화만 하는 전처리, VADER 또는 Naive Bayes, 평가 없음)은 더 이상 맞지 않습니다. 실제로 통하는 방식은 다음과 같습니다.
- 허용된 경로로 데이터를 확보하세요. X API v2(사용량 기반), 승인된 제공업체, 또는 투명한 데이터셋을 사용하세요. 깨진 스크래퍼나 브라우저 우회 방법에 기대지 마세요.
- 보여주기용이 아니라 모델에 맞게 전처리하세요. transformer에는 이모지, 부정 표현, 대소문자를 보존하세요. URL과 멘션은 정규화하세요. 파이프라인을 모델의 학습 데이터에 맞추세요.
- 저렴한 기준선과 트윗 특화 transformer를 비교하세요. TF-IDF + logistic regression은 여전히 좋은 sanity check입니다. CardiffNLP RoBERTa는 현재 트윗 감성 분석의 강력한 기본값입니다.
- 솔직하게 평가하세요. macro F1, 클래스별 지표, confusion matrix를 보고하고, 지금 직접 라벨링한 샘플을 사용하세요. 애매한 경우를 위한 abstention 임계값도 두세요.
- 장식이 아니라 의사결정을 위해 시각화하세요. 시간에 따른 감성 차트와 워드클라우드는 분류 리포트로는 안 보이는 이야기를 보여줍니다.
- 사람을 루프에 남겨두세요. 어떤 모델도 sarcasm, 혼합 대상, 문맥 의존적 의미를 완벽하게 처리하지는 못합니다. 고위험 용도라면 모델 출력과 사람 검토를 함께 쓰세요.
막 시작하는 단계라면 무료 데이터셋을 가져와 Google Colab을 열고 HuggingFace pipeline을 실행해 보세요. 10분도 안 되어 실제로 작동하는 감성 점수를 얻을 수 있습니다. 워크플로의 다른 부분에서 코딩 없이 웹 데이터를 수집하고 구조화하고 싶다면, 허용된 범위의 호환 페이지에서 Thunderbit가 도움이 될 수 있습니다.
포트폴리오나 면접용 프로젝트를 만드는 중이라면, transformer 비교, 실제 전처리 파이프라인, 시간에 따른 감성 차트를 추가하는 것만으로도 부트캠프 기본 과제와 확실히 차별화할 수 있습니다.
더 알아보기
- Thunderbit로 자동 데이터 스크래핑을 마스터하는 방법
- 2026년 최고의 Twitter(x.com) 스크래퍼 6선
- 2025년 Python으로 Twitter에서 트윗을 스크래핑하는 방법
- 향상된 데이터 인사이트를 위한 Twitter AI 스크래핑 활용법
- Twitter(X) 통계 2026: 사용자, 인구통계, 광고
FAQ
Twitter 감성 분석은 정확한가요?
모델과 평가 방식에 따라 다릅니다. VADER 같은 규칙 기반 도구는 트윗 데이터에서 낮은 편입니다. CardiffNLP RoBERTa 같은 transformer 모델은 훨씬 더 좋은 성능을 보이지만, 정확한 점수는 데이터셋, 분할 방식, 라벨 정의, 지표에 따라 달라집니다. 전처리 품질도 중요합니다. 단일 벤치마크 숫자만 믿지 말고, 지금 시점의 직접 라벨링한 샘플로 항상 평가하세요.
Twitter 감성 분석을 무료로 할 수 있나요?
네. 무료 데이터셋(Kaggle의 Sentiment140), 무료 Python 환경(Google Colab), 사전학습된 HuggingFace 모델을 사용하면 됩니다. 실시간 데이터는 X API가 Post 읽기 1건당 $0.005를 부과하므로 소규모 수집은 크게 부담되지 않습니다. Thunderbit는 호환 페이지의 데이터 구조화를 위한 무료 플랜도 제공합니다.
Twitter 감성 분석에 가장 좋은 Python 라이브러리는 무엇인가요?
빠른 프로토타입에는 NLTK의 VADER가 좋습니다. 트윗에서 가장 높은 정확도를 원한다면 HuggingFace transformers 라이브러리와 CardiffNLP의 RoBERTa 모델을 추천합니다. 전통적 머신러닝 기준선으로는 scikit-learn과 TF-IDF 조합이 좋습니다. 최적의 선택은 데이터 양, 정확도 요구 수준, 계산 자원에 따라 달라집니다.
Twitter 감성 분석에서 sarcasm은 어떻게 처리하나요?
Transformer 모델은 개별 단어만 보는 규칙 기반 모델이나 전통적 머신러닝보다 문맥을 처리하기 때문에 sarcasm을 더 잘 다룹니다. 하지만 어떤 모델도 sarcasm을 완벽히 처리하지는 못합니다. 연구에 따르면 사람 주석자도 sarcasm 의도에 대해 의견이 갈립니다. 중요한 용도라면 모델 출력과 사람 검토를 함께 사용하고, 평가용으로 sarcasm 전용 데이터셋 사용도 고려하세요.
코딩 없이 Twitter 감성 분석을 할 수 있나요?
네. 허용된 경로(X API, 승인된 제공업체, 또는 본인 아카이브)로 데이터를 수집한 뒤 Google Sheets로 내보내고, Sheets용 NLP 애드온이나 AWS Comprehend 같은 서비스로 노코드 감성 분류기를 적용하면 됩니다. Thunderbit는 호환 페이지의 데이터 구조화 과정에서 프롬프트 기반 감성 라벨을 추가할 수도 있습니다. 노코드 데이터 워크플로에 대해 더 알고 싶다면 Google Sheets용 AI 도구 가이드도 참고해 보세요.


