OpenClaw 토큰 사용량을 90% 줄인 방법(가장 저렴한 모델까지 정리)

최종 업데이트: April 14, 2026
OpenClaw 토큰 사용량을 90% 줄인 방법(가장 저렴한 모델까지 정리)

화요일 점심이 되기도 전에 OpenRouter 대시보드에는 이미 47달러가 사용된 것으로 찍혀 있었습니다. 그날 제가 한 코딩 작업이라고 해봐야 대여섯 건 정도였고, 별것 아닌 리팩터링과 몇 번의 버그 수정이 전부였죠. 그때서야 알았습니다. OpenClaw의 기본 설정이 백그라운드 하트비트 ping까지 포함해서 모든 상호작용을 Claude Opus로 보내고 있었고, 그 비용이 백만 토큰당 15달러를 훌쩍 넘는다는 사실을요.

비슷하게 예상치 못한 청구서를 받아본 적이 있다면 — 포럼만 봐도 그런 사례가 꽤 많습니다. 어떤 사용자는 “이미 40달러나 썼는데, 많이 쓰지도 않았어요”라고 적기도 했죠 — 이 가이드는 제가 월 지출을 약 90% 줄일 때 사용한, 처음부터 끝까지의 감사 및 최적화 방법을 정리한 것입니다. 단순히 “더 싼 모델로 바꾸세요” 수준이 아니라, 토큰이 실제로 어디에서 새는지, 어떻게 추적해야 하는지, 실제 에이전트 작업에서 버텨주는 예산형 모델은 무엇인지, 그리고 지금 바로 복붙해서 쓸 수 있는 설정 3가지를 체계적으로 다룹니다. 전체 과정은 반나절이면 끝났습니다.

OpenClaw 토큰 사용량이란 무엇이고, 왜 기본값이 그렇게 비싼가요?

토큰은 OpenClaw에서 AI 상호작용을 과금하는 기본 단위입니다. 아주 짧은 텍스트 조각이라고 생각하면 됩니다. 대략 영어 4자 정도가 토큰 1개에 해당합니다. 여러분이 보내는 모든 메시지, 받는 모든 응답, 실행되는 백그라운드 프로세스까지 전부 토큰 기준으로 청구됩니다.

문제는 OpenClaw의 기본 설정이 “최저 비용”이 아니라 “최대 성능”에 맞춰져 있다는 점입니다. 설치 직후 기본 주 모델은 anthropic/claude-opus-4-5로 잡히는데, 이건 사용 가능한 옵션 중에서도 가장 비싼 축에 속합니다. 하트비트 ping도 Opus로 돌리고, 사이드 작업을 맡기려고 만드는 서브 에이전트도 똑같이 Opus를 씁니다. 하트비트 ping에 Opus를 쓰는 건 신경외과 의사에게 밴드에이드를 붙여 달라고 하는 것과 비슷합니다. 기술적으로는 가능하지만, 비용은 말도 안 되게 비쌉니다.

대부분의 사용자는 단순한 백그라운드 작업에 프리미엄 요금을 내고 있다는 사실을 잘 모릅니다. 기본 설정은 사실상 “언제나, 모든 작업에, 가장 좋은 모델을 쓰고 싶다”는 전제를 깔고 있고, 그에 맞게 비용이 청구됩니다.

OpenClaw 토큰 사용량을 줄이면 돈 말고도 얻는 것이 더 많습니다

가장 눈에 띄는 효과는 당연히 비용 절감입니다. 하지만 시간이 갈수록 누적되는 부가 이점도 꽤 큽니다.

더 저렴한 모델이 오히려 더 빠른 경우도 많습니다. Gemini 2.5 Flash-Lite는 초당 약 214 토큰을 처리하는 반면, Opus는 약 51 토큰 수준입니다. 체감 속도로는 거의 4배 차이입니다. Cerebras의 GPT-OSS-120B는 초당 1,917 토큰까지 나오는데, 이는 Opus보다 대략 35배 빠른 셈입니다. 50회 넘게 툴 호출이 오가는 에이전트 루프에서는 이런 속도 차이 덕분에 매 라운드마다 Opus의 답답한 13.6초 첫 토큰 지연을 기다리느라 시간을 날리지 않고, 몇 분 안에 끝낼 수 있습니다.

게다가 레이트 리밋에 걸리기 전까지 더 여유가 생기고, 세션이 덜 막히며, 청구서를 볼 때의 불안감 없이 사용량을 더 쉽게 늘릴 수 있습니다.

사용량별 예상 절감 효과는 아래와 같습니다.

사용자 유형월 예상 지출(기본값)전체 최적화 후월 절감액
라이트 사용자(일 10회 내외)약 $100약 $12약 88%
보통 사용자(일 50회 내외)약 $500약 $90약 82%
헤비 사용자(일 200회 이상)약 $1,750약 $220약 87%

이건 가정이 아닙니다. 한 개발자는 월 600750달러를 하루 34달러 수준으로 줄인 사례를 기록했는데, 모델 라우팅에 여기에 소개하는 숨은 비용 유출 차단까지 더해 실제로 90% 절감에 성공했습니다.

OpenClaw 토큰 사용량 해부: 토큰은 실제로 어디로 빠질까?

대부분의 최적화 글이 건너뛰는 부분이 바로 여기고, 사실 가장 중요한 부분이기도 합니다. 보이지 않는 것은 줄일 수 없습니다.

OpenClaw 토큰이 실제로 어디에 쓰이는지 — 작업별 분해

저는 여러 세션을 감사하고, LaoZhang의 비용 최적화 가이드와 커뮤니티의 /context 덤프를 교차 분석해서, 일반적인 단일 코딩 작업에서 토큰이 어떻게 쓰이는지 장부처럼 정리했습니다. 대략 20,000토큰은 아래처럼 소모됩니다.

토큰 범주총량 대비 일반 비중예시(코딩 작업 1회)통제 가능 여부
컨텍스트 누적(대화 기록이 매 호출마다 재전송됨)약 40~50%약 9,000토큰예 — /clear, /compact, 짧은 세션
툴 출력 저장(쉘 출력, 파일 읽기 결과가 기록에 유지됨)약 20~30%약 5,000토큰예 — 읽기 범위를 줄이고 툴 범위를 좁힘
시스템 프롬프트 재전송(기본 1.5만 토큰 내외)약 10~15%약 3,000토큰부분적으로 가능 — 캐시 읽기는 0.1배 요금
여러 라운드 추론(연쇄 툴 호출 루프)약 10~15%약 2,500토큰모델 선택 + 더 나은 프롬프트
하트비트 / keep-alive ping약 5~10%약 1,500토큰예 — 설정 변경
서브 에이전트 호출약 5~10%약 1,500토큰예 — 모델 라우팅

가장 큰 비중은 컨텍스트 누적입니다. 즉, 대화 기록이 API 호출마다 다시 전송되는 것입니다. 한 실제 세션 덤프에서는 모델이 아직 응답도 하지 않았는데 Messages 버킷에만 185,400토큰이 쌓여 있었습니다. 여기에 시스템 프롬프트와 툴이 추가로 약 35,800토큰의 고정 오버헤드를 얹었습니다.

핵심은 이겁니다. 서로 무관한 작업 사이에 세션을 비우지 않으면, 매 턴마다 대화 전체 이력을 다시 전송하는 비용을 계속 내게 됩니다.

OpenClaw 토큰 사용량을 모니터링하는 방법(보이지 않으면 줄일 수 없습니다)

아무것도 바꾸기 전에, 토큰이 어디로 가는지 먼저 확인해야 합니다. 모니터링 없이 바로 “더 싼 모델을 쓰자”고 하는 건 체중계 한 번 안 올라가 보고 살 빼겠다는 것과 같습니다.

OpenRouter 대시보드를 확인하세요

OpenRouter를 경유한다면, Activity 페이지가 설정 없이 바로 볼 수 있는 가장 쉬운 대시보드입니다. 모델, 제공사, API 키, 기간별로 필터링할 수 있습니다. Usage Accounting 화면에서는 각 요청의 프롬프트, completion, reasoning, cached token을 세부적으로 나눠 보여줍니다. 장기 분석용으로 CSV 또는 PDF 내보내기 버튼도 있습니다.

확인할 포인트는 두 가지입니다. 어떤 모델이 가장 많은 토큰을 썼는지, 그리고 하트비트나 서브 에이전트 요청이 예상보다 큰 비중을 차지하고 있지는 않은지입니다.

로컬 API 로그를 점검하세요

OpenClaw는 세션 데이터를 ~/.openclaw/agents.main/sessions/sessions.json에 저장하며, 여기에는 세션별 totalTokens가 포함됩니다. 또한 openclaw logs --follow --json을 실행하면 요청별 로그를 실시간으로 확인할 수 있습니다.

한 가지 알아둘 점은, sessions.json의 totalTokens는 컴팩션 이후 갱신되지 않는다는 것입니다. 따라서 대시보드에 보이는 값이 컴팩션 전의 오래된 수치일 수 있습니다. 저장된 합계보다 /status/context detail을 더 믿는 편이 낫습니다.

서드파티 추적 도구를 사용하세요(보통~헤비 사용자에게 권장)

LiteLLM proxy는 100개 이상의 공급사 앞단에 OpenAI 호환 엔드포인트를 제공하고, 가상 키, 모델, 사용자, 팀별 지출을 자동으로 기록합니다. 핵심 기능은 키별 강제 예산입니다. /clear를 해도 예산 상한은 그대로 유지되므로, 폭주한 서브 에이전트가 설정한 한도를 넘어버릴 수 없습니다.

Helicone은 더 단순합니다. base URL 한 줄만 바꾸면 관련 요청을 묶어 보여주는 Sessions 뷰를 사용할 수 있습니다. 예를 들어 “이 버그 고쳐줘” 한 번의 프롬프트가 8개 이상의 서브 에이전트 호출로 퍼지더라도, 실제 총비용이 반영된 하나의 세션 행으로 보입니다. 무료 티어는 월 10,000 요청입니다.

OpenClaw 내부에서 바로 확인하는 빠른 점검법

일상적인 모니터링은 아래 네 가지 세션 명령이면 충분합니다.

  • /status — 컨텍스트 사용량, 마지막 입력/출력 토큰, 추정 비용 표시
  • /usage full — 응답별 사용량 푸터 표시
  • /context detail — 파일별, 스킬별, 툴별 토큰 분해
  • /compact [guidance] — 선택한 가이드 문자열과 함께 강제 컴팩션

설정을 바꾸기 전후에 /context detail을 실행해 보세요. 그래야 최적화가 실제로 효과가 있었는지 확인할 수 있습니다.

OpenClaw 최저가 모델 대결: 예산형 LLM 중 실제 에이전트 작업을 버티는 것은?

대부분의 가이드는 여기서 잘못 갑니다. 가격표를 보여주고 가장 싼 행을 가리킨 뒤 끝내버리죠. 하지만 벤치마크는 실제 에이전트 성능을 제대로 예측하지 못합니다. 커뮤니티도 이 점을 계속 강하게 지적해 왔습니다. 한 사용자는 “벤치마크만으로는 에이전틱 AI에서 어떤 모델이 가장 잘 작동하는지 제대로 알 수 없다”고 말했습니다.

핵심은 이겁니다. 가장 싼 모델이 항상 가장 싼 결과를 보장하는 건 아닙니다. 실패하고 네 번 다시 시도하는 모델은, 한 번에 성공하는 중간급 모델보다 더 비쌀 수 있습니다. 운영 환경의 에이전트 시스템에서는 5~10% 재시도율을 감안해야 합니다. 다섯 번의 LLM 호출이 연쇄로 이어지고 네 번째 단계에서 실패하면, 단순 재시도는 다섯 단계를 전부 다시 실행하게 됩니다.

아래는 실제 사용자 보고를 기반으로 한 “Real Agentic Score”를 포함한 제 역량 매트릭스입니다. 합성 벤치마크가 아니라 실제 현장 체감을 기준으로 정리했습니다.

모델입력 $/100만 토큰출력 $/100만 토큰툴 호출 신뢰성다단계 추론실제 에이전트 점수(1~5)추천 용도
Gemini 2.5 Flash-Lite$0.10$0.40보통 — 간헐적 루프 발생기초 수준⭐2.5하트비트, 단순 조회
GPT-OSS-120B$0.04$0.19무난함무난함⭐3.0예산형 실험, 속도 우선 작업
DeepSeek V3.2$0.26$0.38불안정(오픈 이슈 6개)양호⭐3.0추론 중심, 툴 호출은 적게
Kimi K2.5$0.38$1.72양호(:exacto 경유)무난함⭐3.5단순~중간 수준 코딩
MiniMax M2.5 / M2.7$0.28$1.10양호양호⭐4.0일반 코딩용 데일리 드라이버
Claude Haiku 4.5$1.00$5.00매우 좋음양호⭐4.5안정적인 중간급 대체 모델
Claude Sonnet 4.6$3.00$15.00매우 좋음매우 좋음⭐5.0복잡한 다단계 작업
Claude Opus 4.5/4.6$5.00$15.00매우 좋음매우 좋음⭐5.0가장 어려운 문제에만 사용

툴 호출에서 DeepSeek와 Gemini Flash를 주의해야 하는 이유

DeepSeek V3.2는 겉으로 보면 꽤 좋아 보입니다. SWE-Bench에서 7274%를 기록하고, Sonnet보다 1136배 저렴합니다. 하지만 실제로는 Cline, Roo Code, Continue, NVIDIA NIM 전반에서 별도의 GitHub 이슈 6개가 툴 호출 오류를 기록하고 있습니다. Composio의 비교 평가는 이렇게 말합니다. “DeepSeek V3.2는 앱의 일부를 만들긴 했지만, 실행·속도·신뢰성에서 흔들렸다.” Zvi Mowshowitz의 한 줄 평도 “괜찮고 싸지만,.”였습니다.

Gemini 2.5 Flash도 비슷한 간극이 있습니다. Google AI Developers Forum의 “Very frustrating experience with Gemini 2.5 function calling performance”라는 글은 이렇게 시작합니다. “Gemini 모델의 function calling 동작은 완전히 신뢰할 수 없고 예측 불가능해졌다.”

OpenRouter는 중요한 뉘앙스를 짚었습니다. “모델이 툴을 호출하려는 성향과 그 호출의 정확도는 같은 가중치라도 호스트에 따라 크게 달라질 수 있다.” OpenRouter를 통해 저가 모델을 라우팅한다면 :exacto 태그를 꼭 확인하세요. 조용히 공급사가 바뀌면, 하루아침에 믿을 만한 저가 모델이 비싼 재시도 루프로 바뀔 수 있습니다.

모델별 사용 시점

  • Gemini Flash-Lite: 하트비트, keep-alive ping, 간단한 Q&A. 다단계 툴 호출에는 절대 비추천.
  • MiniMax M2.5/M2.7: 일반 코딩 작업용 데일리 드라이버. SWE-Pro 56.22, Terminal-Bench 2 57.0%를 Sonnet 가격의 일부로 제공합니다.
  • Claude Haiku 4.5: 저가 모델이 툴 호출에서 막힐 때 쓰는 안정적인 대체재. Sonnet보다 약 3배 저렴하면서 툴 호출 신뢰성이 매우 좋습니다.
  • Claude Sonnet 4.6: 복잡한 다단계 에이전트 작업용. 여기서야말로 돈값을 합니다.
  • Claude Opus: 가장 어려운 문제에만 남겨두세요. 어떤 작업의 기본값으로도 두지 마세요.

(모델 가격은 자주 바뀝니다. 설정을 확정하기 전에는 OpenRouter 또는 각 제공사의 공식 페이지에서 최신 요금을 꼭 확인하세요.)

대부분의 가이드가 놓치는 숨은 토큰 누수

포럼 사용자들은 특정 기능을 끄기만 해도 비용이 크게 줄었다고 보고하지만, 제가 본 어떤 가이드도 실제 토큰 영향까지 포함한 통합 체크리스트는 제공하지 않았습니다. 전체 정리는 아래와 같습니다.

숨은 비용 유출 항목발생 1회당 토큰 비용해결 방법설정 키
기본 하트비트가 Opus에서 동작격리 없을 때 실행당 약 100,000토큰Haiku로 오버라이드 + isolatedSessionheartbeat.model, heartbeat.isolatedSession: true
서브 에이전트 생성작업 시작 전 스폰 1회당 약 20,000토큰서브 에이전트를 Haiku로 라우팅subagents.model
전체 코드베이스 컨텍스트 로딩자동 탐색 1회당 약 3,000~15,000토큰node_modules, dist, lockfile을 .clawignore로 제외.clawrules + .clawignore
메모리 자동 요약세션당 약 500~2,000토큰비활성화하거나 빈도 낮추기memory: false 또는 memory.max_context_tokens
대화 이력 누적턴당 약 500토큰 이상(누적)관련 없는 작업 사이에 새 세션 시작/clear 습관화
MCP 서버 툴 오버헤드서버 4개 기준 약 7,000토큰, 5개 이상이면 50,000토큰+MCP를 최소화사용하지 않는 MCP 제거
스킬/플러그인 초기화로드된 스킬 1개당 200~1,000토큰사용하지 않는 스킬 비활성화skills.entries.<name>.enabled: false
Agent Teams(플랜 모드)일반 세션 비용의 약 7배진짜 병렬 작업에만 사용순차 작업 선호

하트비트 비용 누수는 따로 짚어둘 가치가 있습니다. 기본적으로 하트비트는 30분마다 주 모델(Opus)에서 실행됩니다. isolatedSession: true로 바꾸면 이 비용이 실행당 약 100,000토큰에서 2,000~5,000토큰 수준으로 떨어지고, 해당 항목만 놓고 보면 95~98% 줄어듭니다.

2분 안에 가장 큰 절감 효과를 내는 3가지 빠른 개선

아래 3가지는 모두 리스크가 없고 2분 이내에 적용할 수 있습니다.

  1. 서로 무관한 작업 사이에는 /clear 사용(5초). 단일 절감 효과가 가장 큰 방법입니다. 포럼에서는 새 작업을 시작하기 전에 세션 기록을 비우는 것만으로 50~70% 절감이 가능하다는 의견이 많습니다. 앞서 본 18.5만 토큰 Messages 버킷을 기억하세요. /clear가 그것을 지웁니다.

  2. 잡무는 /model haiku-4.5로 처리(10초). 상황에 맞는 모델 전환만으로도 반복 작업에서 60~80% 비용 절감을 기대할 수 있습니다. Haiku는 대부분의 단순 코딩, 파일 조회, 커밋 메시지 작업을 충분히 잘 처리합니다.

  3. .clawrules를 200줄 미만으로 줄이고 .clawignore를 추가(90초). 규칙 파일은 모든 메시지마다 로드됩니다. 200줄이면 턴당 약 1,5002,000토큰, 1,000줄이면 모든 요청에 8,00010,000토큰이 영구적으로 붙습니다. 여기에 node_modules/, dist/, lockfile, 생성 코드를 제외하는 .clawignore를 함께 쓰면, 한 개발자는 이 습관만으로 토큰 사용량 92% 절감을 달성했다고 합니다.

단계별: OpenClaw 토큰 사용량을 확 줄이는 복붙용 설정 3가지

OpenClaw 월 지출 — 기본 설정 vs 최적화 설정

아래에는 주석이 포함된 완전한 openclaw.json 설정 3가지를 소개합니다. “일단 시작” 수준부터 “풀 최적화 스택”까지 단계별로 구성했으며, 월 비용 추정치도 함께 적었습니다.

시작하기 전에:

  • 난이도: 초급(Config A) → 중급(Config B) → 고급(Config C)
  • 소요 시간: Config A 약 5분, Config C 약 15분
  • 준비물: OpenClaw 설치, 텍스트 편집기, ~/.openclaw/openclaw.json 접근 권한

Config A: 초급 — 우선 돈부터 아끼기

다섯 줄이면 끝납니다. 복잡한 설정은 없습니다. 기본 모델을 Opus에서 Sonnet으로 바꾸고, 메모리 오버헤드를 끄며, 하트비트를 Haiku로 격리합니다.

// ~/.openclaw/openclaw.json
{
  "agents": {
    "defaults": {
      "model": { "primary": "anthropic/claude-sonnet-4-6" },  // 기존 Opus 대신 — 즉시 3~5배 절감
      "heartbeat": {
        "every": "55m",                // 캐시 TTL 1시간과 맞춰 캐시 적중률 최대화
        "model": "anthropic/claude-haiku-4-5",  // ping은 Haiku로, Opus 아님
        "isolatedSession": true        // 실행당 약 10만 → 2~5천 토큰
      }
    }
  },
  "memory": { "enabled": false }       // 세션당 약 500~2천 토큰 절약
}

적용 후 확인할 점: /status를 적용 전후로 실행해 보세요. 요청당 비용이 눈에 띄게 줄어들어야 하며, OpenRouter Activity 페이지의 하트비트 항목에는 Opus 대신 Haiku가 보여야 합니다.

사용량 등급기본값(Opus)Config A(Sonnet + Haiku 하트비트)절감률
라이트(일 10회 내외)약 $100약 $3565%
보통(일 50회 내외)약 $500약 $25050%
헤비(일 200회 내외)약 $1,750약 $90049%

Config B: 중급 — 똑똑한 3단 라우팅

실제 작업은 Sonnet으로. 서브 에이전트와 컴팩션은 Haiku로. Claude가 과부하될 때는 예산형 대체재로 Gemini Flash-Lite를 사용합니다. 폴백 체인이 공급사 장애를 자동으로 흡수합니다.

{
  "agents": {
    "defaults": {
      "model": {
        "primary": "anthropic/claude-sonnet-4-6",
        "fallbacks": [
          "anthropic/claude-haiku-4-5",       // Sonnet이 제한될 때
          "google/gemini-2.5-flash-lite"      // 가장 저렴한 최후의 대안
        ]
      },
      "models": {
        "anthropic/claude-sonnet-4-6": {
          "params": { "cacheControlTtl": "1h", "maxTokens": 8192 }
        }
      },
      "heartbeat": {
        "every": "55m",                       // 55분 < 1시간 캐시 TTL = 캐시 적중
        "model": "google/gemini-2.5-flash-lite",  // ping당 거의 동전 수준
        "isolatedSession": true,
        "lightContext": true                   // 하트비트 호출에는 최소 컨텍스트만 사용
      },
      "subagents": {
        "maxConcurrent": 4,                   // 기본 8보다 낮춤
        "model": "anthropic/claude-haiku-4-5" // 서브 에이전트에 Sonnet은 과함
      },
      "compaction": {
        "mode": "safeguard",
        "model": "anthropic/claude-haiku-4-5", // 요약은 Haiku로
        "memoryFlush": { "enabled": true }
      }
    }
  }
}

예상 결과: 로그에서 서브 에이전트 항목이 Haiku 요금으로 찍혀야 합니다. 하트비트 비용은 거의 무시할 수준이 됩니다. 또한 폴백 체인 덕분에 Claude 장애가 발생해도 세션이 멈추지 않고 Gemini로 자연스럽게 내려갑니다.

사용량 등급기본값Config B절감률
라이트약 $100약 $2080%
보통약 $500약 $15070%
헤비약 $1,750약 $50071%

Config C: 파워 유저 — 풀 최적화 스택

서브 에이전트별 모델 지정, Haiku 고정 컴팩션, Gemini Flash로 비전 라우팅, .clawrules + .clawignore 최적화, 사용하지 않는 스킬 비활성화까지 포함한 설정입니다. 이 구성은 85~90% 절감 구간으로 들어가게 해주는 세팅입니다.

{
  "agents": {
    "defaults": {
      "workspace": "~/clawd",
      "model": {
        "primary": "anthropic/claude-sonnet-4-6",
        "fallbacks": [
          "openrouter/anthropic/claude-sonnet-4-6",  // 다른 공급사를 백업으로 사용
          "minimax/minimax-m2-7",                     // 저렴한 데일리 드라이버 대체재
          "anthropic/claude-haiku-4-5"                // 최후의 수단
        ]
      },
      "models": {
        "anthropic/claude-sonnet-4-6": {
          "params": { "cacheControlTtl": "1h", "maxTokens": 8192 }
        },
        "minimax/minimax-m2-7": {
          "params": { "maxTokens": 8192 }
        }
      },
      "heartbeat": {
        "every": "55m",
        "model": "google/gemini-2.5-flash-lite",
        "isolatedSession": true,
        "lightContext": true,
        "activeHours": "09:00-19:00"           // 밤에는 하트비트 중지
      },
      "subagents": {
        "maxConcurrent": 4,
        "model": "anthropic/claude-haiku-4-5"
      },
      "contextPruning": { "mode": "cache-ttl", "ttl": "1h" },
      "compaction": {
        "mode": "safeguard",
        "model": "anthropic/claude-haiku-4-5",
        "identifierPolicy": "strict",
        "memoryFlush": { "enabled": true }
      },
      "bootstrapMaxChars": 12000,              // 기본 20000에서 축소
      "imageModel": "google/gemini-3-flash"    // 비전 작업은 저렴한 모델로
    }
  },
  "memory": { "enabled": true, "max_context_tokens": 800 },  // 메모리는 최소화
  "skills": {
    "entries": {
      "web-search":       { "enabled": false },
      "image-generation": { "enabled": false },
      "audio-transcribe": { "enabled": false }
    }
  }
}

서브 에이전트별 오버라이드 예시~/.openclaw/agents/lint-runner/SOUL.md에 붙여 넣으세요:

---
name: lint-runner
description: Runs lint/format checks and applies trivial fixes
tools: [Bash, Read, Edit]
model: anthropic/claude-haiku-4-5
---

최소 기능 .clawignore — 이것만으로도 일반적인 부트스트랩이 15만 문자 수준에서 3만~5만 문자 수준으로 줄어듭니다.

node_modules/
dist/
build/
.next/
coverage/
.venv/
vendor/
*.lock
package-lock.json
yarn.lock
pnpm-lock.yaml
*.min.js
*.min.css
**/__snapshots__/
**/*.snap
사용량 등급기본값Config C절감률
라이트약 $100약 $1288%
보통약 $500약 $9082%
헤비약 $1,750약 $22087%

이 수치는 두 개의 독립적인 실제 사용자 사례와도 맞아떨어집니다. Praney Behl의 문서화된 사례는 월 600750달러 → 하루 34달러 수준으로 90% 절감이었고, LaoZhang 사례 연구는 부분 최적화만으로도 943달러 → 347달러(63%), 1,750달러 → 1,000달러(64%), 200달러 → 70달러(65%)를 보여줍니다.

/model 명령으로 OpenClaw 토큰 사용량을 즉시 제어하는 방법

/model 명령은 대화 컨텍스트를 유지한 채 다음 턴에 사용할 활성 모델만 바꿉니다. 리셋도 없고, 이력 손실도 없습니다. 이게 시간이 갈수록 절약 효과를 키워주는 핵심 습관입니다.

실전 워크플로:

  • 여러 파일을 가로지르는 까다로운 리팩터링 중인가요? Sonnet 유지.
  • “이 정규식이 무슨 뜻이죠?” 같은 빠른 질문인가요? /model haiku로 바꾸고 물은 뒤, 다시 /model sonnet으로 복귀.
  • 커밋 메시지 작성이나 문서 다듬기인가요? /model flash-lite면 충분합니다.

openclaw.jsoncommands.aliases 아래에 별칭을 만들어 haiku, sonnet, opus, flash 같은 짧은 이름을 전체 공급사 문자열에 매핑할 수 있습니다. 전환할 때마다 몇 글자씩 아낄 수 있습니다.

계산은 단순합니다. 하루 50개 쿼리를 전부 Sonnet으로 돌리면 대략 하루 3달러입니다. 같은 50개 쿼리를 Haiku/Sonnet/Opus를 70/20/10 비율로 섞으면 하루 약 1.10달러 수준입니다. 한 달 기준으로는 90달러 → 33달러, 즉 63% 절감입니다. 도구를 바꾸는 게 아니라 습관만 바꾸는 셈입니다.

보너스: Thunderbit으로 공급사별 OpenClaw 모델 가격 추적하기

AI로 공급사별 모델 가격 추적하기 Get Started Free

OpenRouter, Anthropic 직접 API, Google AI Studio, DeepSeek, MiniMax처럼 모델과 공급사가 많아질수록 가격은 자주 바뀝니다. Anthropic은 어느 날 갑자기 Opus 출력 가격을 약 67% 낮추기도 했고, Google은 2025년 12월 Gemini 무료 티어 한도를 50~80% 조정했습니다. 이런 상황에서 정적인 가격 스프레드시트를 사람이 직접 유지하는 건 사실상 진 싸움입니다.

Thunderbit은 별도의 스크래핑 코딩 없이 이 문제를 해결합니다. 구조화된 데이터 추출을 위해 만든 Chrome 확장 프로그램인 AI 웹 스크래퍼입니다.

제가 쓰는 워크플로는 이렇습니다.

  1. Chrome에서 OpenRouter 모델 페이지를 연 뒤 Thunderbit의 “AI Suggest Fields”를 클릭합니다. 페이지를 읽고 모델명, 입력 가격, 출력 가격, 컨텍스트 윈도우, 공급사 같은 컬럼을 제안합니다.
  2. Scrape를 누르고 바로 Google Sheets로 내보냅니다.
  3. “매주 월요일 오전 9시에 OpenRouter 모델 목록을 다시 스크래핑”처럼 자연어로 예약 스크래프를 설정하면 클라우드에서 자동으로 실행됩니다.

이후에는 개인 가격 추적기가 스스로 업데이트됩니다. 어느 모델이 갑자기 30% 저렴해졌는지, 혹은 어느 공급사가 Exacto 태그를 받았는지 월요일 아침 시트에서 바로 확인할 수 있고, 여러분이 따로 손댈 필요가 없습니다. 블로그에는 비즈니스용 AI 데이터 추출 활용 사례도 더 자세히 정리해 두었습니다.

직접 공급사 페이지(Anthropic, Google, DeepSeek 등)를 비교하고 싶으신가요? Thunderbit의 하위 페이지 스크래핑은 각 모델 링크를 상세 페이지까지 따라가 공급사별 요금을 가져옵니다. 예를 들어 Kimi K2.5를 OpenRouter로 라우팅하는 것이 NVIDIA Build를 직접 쓰는 것보다 더 싼지 확인할 때 유용합니다. 무료 티어와 요금제 정보는 Thunderbit 가격에서 확인하세요.

OpenClaw 토큰 사용량 절감을 위한 핵심 요약

프레임워크는 이해 → 모니터링 → 라우팅 → 최적화입니다.

가장 영향이 큰 작업을 우선순위로 정리하면 다음과 같습니다.

  1. Opus를 기본값으로 두지 마세요. 주 모델을 Sonnet이나 MiniMax M2.7로 바꾸세요. 이것만으로도 3~5배 비용 절감이 가능합니다.
  2. 하트비트를 분리하세요. isolatedSession: true를 설정하고 하트비트를 Gemini Flash-Lite로 보내세요. 약 10만 토큰의 누수를 2~5천 토큰 수준으로 줄일 수 있습니다.
  3. 서브 에이전트는 Haiku로 라우팅하세요. 스폰 1회당 약 2만 토큰의 컨텍스트가 작업 전에 먼저 올라갑니다. Opus에 맡길 이유가 없습니다.
  4. /clear를 습관처럼 쓰세요. 무료이고 5초면 되며, 커뮤니티에서도 다른 어떤 단일 행동보다 효과가 크다고 봅니다.
  5. .clawignore를 추가하세요. node_modules, lockfile, 빌드 산출물을 제외하면 부트스트랩 컨텍스트가 크게 줄어듭니다.
  6. 변경 전후에 /context detail로 확인하세요. 측정할 수 없으면 개선도 할 수 없습니다.

가장 저렴한 모델은 작업에 따라 다릅니다. 하트비트에는 Gemini Flash-Lite. 일상 코딩에는 MiniMax M2.7. 안정적인 툴 호출에는 Haiku. 복잡한 다단계 작업에는 Sonnet. 정말 어려운 문제에는 Opus만 사용하세요. 그 외에는 필요 없습니다.

대부분의 독자는 Config A 또는 B만으로도 반나절 안에 5070% 절감 효과를 볼 수 있습니다. 8590%까지 가려면 모델 라우팅, 숨은 비용 유출 차단, .clawignore, 세션 습관까지 모두 겹쳐야 하지만, 충분히 가능합니다. 그리고 한번 설정하면 오래 갑니다.

자주 묻는 질문

1. OpenClaw는 월 얼마 정도 드나요?

완전히 설정, 사용량, 선택한 모델에 따라 다릅니다. 라이트 사용자(하루 10회 내외)는 최적화 시 월 530달러 정도, 기본값만 쓰면 100달러 이상이 일반적입니다. 보통 사용자(하루 50회 내외)는 월 90400달러 범위입니다. 헤비 사용자는 기본값으로 월 600~2,000달러 이상까지 올라갈 수 있고, 문서화된 극단 사례로는 한 달에 5,623달러가 나온 경우도 있었습니다. Anthropic 내부 텔레메트리에서는 개발자 1인 기준 활성일 중위값이 하루 13달러 수준으로 보입니다.

2. 코딩에 잘 맞으면서도 가장 저렴한 OpenClaw 모델은 무엇인가요?

MiniMax M2.5/M2.7이 전반적인 데일리 드라이버로 가장 좋습니다. 툴 호출 신뢰성도 괜찮고, SWE-Pro 56.22에 백만 토큰당 약 $0.28/$1.10 수준입니다. 하트비트나 단순 조회는 Gemini 2.5 Flash-Lite($0.10/$0.40)가 매우 유리합니다. Haiku 4.5는 Sonnet 가격을 내지 않고도 우수한 툴 호출이 필요할 때 믿을 수 있는 중간급 대체재입니다.

3. OpenClaw에서 무료 티어 모델을 쓸 수 있나요?

기술적으로는 가능합니다. GPT-OSS-120B는 OpenRouter의 :free 태그와 NVIDIA Build에서 무료로 쓸 수 있고, Gemini Flash-Lite는 무료 티어(분당 15회, 하루 1,000요청)가 있습니다. DeepSeek는 가입 시 500만 무료 토큰을 제공합니다. 다만 무료 티어는 레이트 리밋이 강하고, 속도가 느리며, 가용성이 불안정할 수 있습니다. 일상적으로 쓰려면 백만 토큰당 몇 센트 수준의 저가 유료 모델이 훨씬 안정적입니다.

4. /model로 대화 중 모델을 바꾸면 컨텍스트가 사라지나요?

아니요. /model은 전체 세션 컨텍스트를 유지한 채 다음 턴만 새 모델로 라우팅합니다. 기록이 초기화되지 않습니다. 이는 OpenClaw의 개념 문서에서도 확인되며 Claude Code와도 같은 방식입니다. Haiku와 Sonnet 사이를 자유롭게 오가도 아무것도 잃지 않습니다.

5. 오늘 당장 OpenClaw 요금을 가장 빨리 줄이는 방법은 무엇인가요?

서로 무관한 작업 사이에 /clear를 입력하세요. 무료이고 5초밖에 걸리지 않으며, API 호출마다 다시 전송되는 대화 기록을 지웁니다. 한 실제 세션에서는 185,000토큰의 누적 메시지 기록이 있었고, 이 모든 것이 매 턴마다 재전송되며 다시 과금되고 있었습니다. 새 작업을 시작하기 전에 이것을 지우는 것이 가장 높은 ROI를 내는 습관입니다.

AI 웹 스크래핑에 Thunderbit 사용해 보기 Get Started Free

Shuai Guan
Shuai Guan
Thunderbit CEO | AI 데이터 자동화 전문가 Shuai Guan은 Thunderbit의 CEO이자 University of Michigan 공학과 출신입니다. 10년 가까운 기술 및 SaaS 아키텍처 경험을 바탕으로, 복잡한 AI 모델을 누구나 바로 활용할 수 있는 노코드 데이터 추출 도구로 바꾸는 데 전문성을 갖고 있습니다. 이 블로그에서는 웹 스크래핑과 자동화 전략에 대한 필터링 없는 실전 경험과 검증된 인사이트를 공유하며, 더 똑똑하고 데이터 중심적인 워크플로를 만드는 데 도움을 드립니다. 데이터 워크플로를 최적화하지 않을 때는, 같은 꼼꼼함으로 사진이라는 취미에 몰두합니다.
Topics
Openclaw 토큰 사용량Openclaw 최저가 모델

Thunderbit를 사용해 보세요

단 2번의 클릭으로 리드와 기타 데이터를 수집하세요. AI 기반.

Thunderbit 받기 무료예요
AI로 데이터 추출하기
Google Sheets, Airtable, Notion으로 데이터를 손쉽게 옮겨보세요
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week