AI 토큰이 뭐야, 쓸 때마다 왜 돈이 나가? Claude Code로 비용 새던 지점부터 잡았습니다

AI 토큰은 쉽게 말해 모델이 읽고 쓰는 ‘글자 조각’이고, 돈은 입력한 내용과 AI가 답한 내용이 토큰으로 계산되기 때문에 나갑니다. 제가 Claude Code로 블로그 자동화 파이프라인을 고치다가 비용이 새는 걸 본 지점도 코드 자체가 아니라, 매번 긴 로그와 파일 내용을 통째로 붙여 넣던 습관이었습니다.

오늘 쓴 AI 프롬프트 1개를 열고, 줄일 수 있는 로그·문서·파일을 표시해보세요.

처음엔 “질문 한 번 했는데 왜 과금되지?”가 당연히 헷갈립니다. 특히 ChatGPT, Claude, Cursor, Codex처럼 대화창은 비슷해 보여도 뒤에서는 읽은 양, 쓴 양, 모델 종류, 컨텍스트 길이에 따라 계산이 달라집니다.

먼저 내가 쓰는 AI의 비용 누수부터 확인하세요.
오늘 쓴 프롬프트 1개를 열고 “붙여 넣은 원문·로그·파일”이 꼭 필요했는지 표시해보면 바로 감이 옵니다.

제가 실제로 막힌 지점: 답변보다 ‘읽히는 양’이 더 컸습니다

저는 요즘 터미널에서 Claude Code를 많이 씁니다. WordPress 글 초안 생성, 쇼츠 대본 정리, n8n 자동화 흐름 점검을 한 번에 돌리다 보니 “전체 프로젝트를 다 보여주면 더 잘하겠지”라고 생각했습니다.

그런데 실제로는 반대였습니다. 에러 하나를 고치려고 package-lock.json, 긴 실행 로그, 예전 프롬프트 기록까지 넣으니 모델은 더 많이 읽고, 저는 더 많이 냈습니다. 정작 필요한 건 최근 변경 diff와 에러 마지막 30줄뿐인 경우가 많았습니다.

토큰은 단어가 아니라 모델용 조각입니다

한국어 한 글자, 영어 단어, 코드 기호가 모두 같은 방식으로 계산되지는 않습니다. 모델은 문장을 내부적으로 잘게 나눈 토큰으로 처리합니다. 그래서 “짧은 질문”처럼 보여도 코드 블록, JSON, 로그가 섞이면 토큰이 확 늘어납니다.

비용은 보통 세 부분에서 생깁니다. 내가 넣은 입력 토큰, AI가 생성한 출력 토큰, 그리고 긴 대화를 유지하기 위해 다시 읽는 컨텍스트입니다. 요금제에 포함된 사용량이 있는 서비스도 있고, OpenAI API나 Anthropic API처럼 사용량 기반으로 더 직접 계산되는 경우도 있습니다.

구체적인 예: 에러 수정 프롬프트를 줄인 방식

예를 들어 Claude Code에 “이 빌드 에러 고쳐줘”라고 하면서 전체 저장소 설명과 긴 로그를 넣는 대신, 저는 이렇게 바꿨습니다.

git diff -- src/pipeline/
npm test 2>&1 | tail -n 40

그리고 프롬프트는 “방금 diff와 마지막 에러 40줄만 보고 원인 후보 2개와 수정 패치만 제안해줘”로 줄였습니다. 이 방식이 항상 정답은 아니지만, 작은 버그 수정에서는 맥락을 덜 주고도 충분히 빠르게 돌아왔습니다.

돈이 나가는 구조를 한 장으로 정리하면

상황 비용에 영향 제가 쓰는 줄이는 방법
긴 문서 붙여넣기 입력 토큰 증가 요약본, 관련 문단, diff만 전달
AI에게 장문 답변 요구 출력 토큰 증가 “표 1개와 수정 코드만”처럼 형식 제한
대화가 길어짐 이전 맥락 재사용 비용 가능 중간에 요약 후 새 세션 시작
고성능 모델 사용 토큰당 단가가 높을 수 있음 초안은 가벼운 모델, 최종 검토만 상위 모델
코드·JSON·로그 포함 토큰 밀도가 커질 수 있음 필요한 파일명과 에러 구간만 지정

핵심은 “AI에게 많이 알려줄수록 똑똑해진다”가 아니라 “필요한 맥락만 정확히 주면 더 싸고 안정적이다”에 가깝습니다. 특히 Cursor나 Claude Code에서 코드베이스를 다루면 파일 선택이 비용과 품질을 같이 흔듭니다.

이런 분은 특히 토큰 감각을 먼저 잡는 게 좋습니다

AI 코딩 에이전트로 작업을 자주 맡기는 개발자

레포 전체를 읽히는 습관이 있으면 작은 수정도 무거워집니다. Claude Code, Codex, Cursor에서 “작업 범위 파일 2~3개 + 실패 로그 일부 + 원하는 출력 형식”으로 제한하는 연습을 추천합니다.

블로그·문서·자동화 초안을 반복 생성하는 빌더

Notion 원고, WordPress 초안, n8n 워크플로 설명을 매번 통째로 넣으면 비용이 쌓입니다. 저는 공통 지침은 짧은 시스템 메모로 고정하고, 매번 바뀌는 데이터만 넣는 쪽으로 바꿨습니다.

자주 하는 실수 하나: ‘전체 맥락’이 친절이라고 믿는 것

제가 가장 많이 한 실수도 이것입니다. 모델에게 모든 걸 보여주면 실수가 줄 거라 생각했는데, 오히려 관련 없는 정보 때문에 답이 흐려졌습니다. 사람에게 코드 리뷰를 부탁할 때도 “서비스 전체를 다 봐줘”보다 “이 함수의 race condition만 봐줘”가 빠른 것과 비슷합니다.

실전에서는 프롬프트 앞에 목적을 먼저 씁니다. “비용 절감을 위해 긴 설명은 피하고, 필요한 추가 정보가 있으면 먼저 질문해줘”라고 넣어두면 불필요한 장문 답변을 줄이는 데 도움이 됩니다.

FAQ

ChatGPT 유료 요금제를 쓰면 토큰을 신경 안 써도 되나요?

일반 사용자 요금제에서는 토큰 단가가 직접 보이지 않을 수 있습니다. 그래도 사용량 제한, 모델별 메시지 제한, 응답 속도에 영향을 받을 수 있어 긴 입력을 줄이는 습관은 여전히 유용합니다.

한국어는 영어보다 비용이 더 많이 드나요?

항상 그렇다고 단정하기는 어렵습니다. 다만 언어와 문장 구조에 따라 토큰화 결과가 달라지므로, 긴 한국어 문서나 코드가 섞인 문서는 공식 토크나이저나 사용량 화면으로 확인하는 편이 안전합니다.

비용을 줄이면 답변 품질도 떨어지지 않나요?

필수 맥락까지 빼면 품질이 떨어집니다. 하지만 관련 없는 로그, 오래된 요구사항, 중복 파일을 덜어내는 건 품질을 낮추기보다 오히려 답을 선명하게 만드는 경우가 많았습니다.

지금 바로 해볼 체크리스트

  • 긴 로그는 마지막 30~50줄만 먼저 보내기
  • 전체 파일 대신 git diff와 관련 함수만 전달하기
  • 답변 형식을 “원인 2개, 패치 1개, 테스트 명령 1개”처럼 제한하기
  • 대화가 길어지면 요약을 만든 뒤 새 세션에서 이어가기

AI 토큰이 뭐야, 쓸 때마다 왜 돈이 나가라는 질문의 답은 결국 “모델이 읽고 쓰는 양에 비용이 붙기 때문”입니다. 오늘은 새 도구를 사기보다, 방금 보낸 프롬프트 하나를 줄이는 것부터 시작해보세요.

오늘도, 코딩할 용기.

관련 링크

글쓴이 용기

15년차 백엔드 개발자, 바이브코딩으로 개발 방식 전환 중. Claude Code·Codex 실사용 후기와 빌더 일지를 씁니다.

지식창고