LLM 추론 비용은 얼마일까? 4가지 시나리오의 실제 계산

2023년 3월에 GPT-4는 입력 토큰 백만 개당 30달러였다. 3년이 지난 지금, GPT-5.6은 같은 백만 개를 10달러에 실행한다. Claude Opus 4.5는 15달러다. 최저가는? 2센트다. 동일한 작업 단위에 가장 저렴한 옵션과 가장 비싼 옵션 사이에 1,500배의 차이가 난다. LLM 추론 비용은 학습된 모델이 입력을 읽고 출력을 생성할 때마다 지불하는 반복 비용으로, 모든 주요 제공자에서 백만 토큰당 가격으로 책정된다. 예산 모델은 입력 토큰 백만 개당 0.02~0.30달러, 최첨단 모델은 같은 규모에 15~75달러를 청구한다. 이 격차가 중요한 이유는 당신의 야망이 아니라 실제 워크로드가 어느 계층을 필요로 하는지 결정하기 때문이다.

주요 내용:
- 예산 모델은 입력 토큰 백만 개당 0.02~0.30달러; 최첨단 모델은 15~75달러(2026년 7월).
- 출력 토큰은 입력 토큰보다 3~5배 비싼데, 생성이 순차적이지 병렬적이지 않기 때문이다.
- 50,000건 대화 지원 챗봇은 모델 계층에 따라 대략 월 9~420달러의 비용이 든다.
- 추론 가격은 연 약 10배 하락했으며, 가트너는 2030년까지 90% 낮아질 것으로 예상한다.

LLM 추론 비용은 토큰 백만 개당 얼마일까?

2026년 7월 기준 LLM 추론 가격은 3단계 구조를 따른다. Google(Gemini 2.5 Flash)과 오픈소스 옵션(Llama 4, Qwen 3) 같은 예산 모델은 입력 토큰 백만 개당 0.02~0.30달러를 청구한다. 중급 모델(GPT-4.1, Claude Sonnet 4)은 0.55~15달러 사이에 위치한다. 최첨단 추론 모델(o3, Claude Opus 4.5)은 15~75달러를 청구한다. 모든 제공자는 공식 가격 책정 페이지(OpenAI, Anthropic)에서 이러한 요금을 공개하며, PricePerToken.com은 라이브 그리드에서 300개 이상의 모델을 추적한다.

2026년 7월 기준으로, 입력 토큰 백만 개를 겨우 2센트로 실행하거나 최첨단 모델에서 같은 백만 개에 75달러를 지불할 수 있다.

캐시된 입력 할인은 반복 프롬프트에서 청구액의 50~90%를 절감한다(프롬프트 캐싱은 입력 비용 절감 메커니즘을 설명한다). 모든 제공자의 현재 요금이 포함된 라이브 300개 모델 그리드는 당사의 전체 토큰당 가격 책정 표를 참조하라.

LLM 추론 비용을 결정하는 것은? 4가지 비용 요인

추론 청구액은 4가지 비용 요인으로 나뉜다: 토큰당 GPU 계산 시간, 모델 가중치와 KV 캐시 메모리, 읽기보다 생성을 비싸게 만드는 입력/출력 비대칭, 인프라 오버헤드(전력, 냉각, 네트워킹). 어느 요인이 워크로드를 지배하는지 이해하면 어디에 최적화 투자가 효과적인지 알 수 있다.

계산: 토큰당 GPU 시간

모든 토큰은 모델의 모든 계층을 통과한다. FP16의 70B 파라미터 모델은 토큰당 대략 140 GFLOPs이 필요하다. INT4로 양자화하면 약 35 GFLOPs로 줄어든다. NVIDIA의 추론 벤치마킹 가이드는 전체 TCO 공식을 분석한다: 하드웨어 감가상각 더하기 전기 더하기 운영 오버헤드, 서빙된 토큰으로 나눈다.

메모리: 모델 가중치 + KV 캐시

FP16의 70B 모델은 가중치만으로 약 140GB의 VRAM을 차지한다. KV 캐시는 컨텍스트 길이와 동시 배치 크기에 따라 증가한다. 128K 컨텍스트에서 32개의 동시 요청 시, 추가로 80GB를 소모할 수 있다. 이것이 자체 호스팅 결정에서 모델별 VRAM 요구사항이 매우 중요한 이유다.

입력 vs 출력 비대칭

출력 토큰은 입력 토큰보다 3~5배 비싼데, 모델이 출력을 한 번에 하나씩 차례대로 생성하기 때문이다. 프롬프트를 읽는 방식처럼 병렬화할 수 없다.

명확히 말하면, 2,000토큰 프롬프트를 읽는 것("prefill" 단계)은 GPU 코어 전체에서 모든 토큰을 동시에 처리한다. 500개의 출력 토큰을 생성하는 것("decode" 단계)은 한 번에 한 토큰씩 실행되며, 각각은 이전 토큰에 의존한다. GPU는 단계 사이의 메모리 대역폭을 기다리면서 대부분 유휴 상태다. 이 유휴 시간이 입력 요금의 3~5배에 청구되는 것이다.

인프라 오버헤드

전력, 냉각, 네트워킹, 요청 사이의 유휴 GPU. Hugging Face의 최적화 문서는 연속 배칭과 추측적 디코딩이 동일한 하드웨어에서 GPU 시간당 더 많은 토큰을 어떻게 압축하는지, 이 오버헤드 점유율을 직접 줄이는지 다룬다.

4가지 실제 워크로드의 LLM 추론 비용은?

일반적인 지원 챗봇 비용은 월 9~420달러, RAG 파이프라인은 월 168~3,360달러, 200명 개발자 코드 보조 도구는 월 123~2,078달러, 대량 문서 처리는 월 240~6,400달러 사이다. 스프레드는 거의 전적으로 모델 계층 선택에 달려있다. 우리는 클라이언트 배포의 토큰 볼륨에서 이 4가지 시나리오를 구축하고 공식 2026년 7월 페이지에 따라 가격을 책정했다. 아래의 모든 달러 수치는 재현 가능하다: 명시된 토큰 가정에 공개 요금을 곱한다. 공급 업체 주장이 아닌 우리 분석이다.

고객 지원 챗봇: 월 50,000건 대화

평균 대화: 800개 입력 토큰(시스템 프롬프트 + 사용자 메시지 + 검색된 컨텍스트), 400개 출력 토큰. 월간 볼륨: 50,000건 대화 = 4천만 입력 토큰, 2천만 출력 토큰.

  • 예산 선택(Gemini 2.5 Flash): 4천만 × $0.075/M + 2천만 × $0.30/M = 월 $9. 거의 의심스러울 정도로 저렴하다.
  • 중급 선택(Claude Sonnet 4): 4천만 × $3/M + 2천만 × $15/M = 월 $420.

지원 봇이 1단계 티켓을 처리하는 경우, 예산 모델은 쿼리의 90%를 잘 처리한다. 분류자를 사용해 어려운 10%를 중급으로 라우팅하라.

RAG 파이프라인: 일일 10,000건 쿼리

평균 쿼리: 3,200개 입력 토큰(검색된 청크 + 시스템 프롬프트 + 사용자 질문), 600개 출력 토큰. 월간: 300,000건 쿼리 = 9억 6천만 입력 토큰, 1억 8천만 출력 토큰.

  • 예산 선택(Llama 4 Scout via API): 9억 6천만 × $0.10/M + 1억 8천만 × $0.40/M = 월 $168.
  • 중급 선택(GPT-4.1): 9억 6천만 × $2/M + 1억 8천만 × $8/M = 월 $3,360.

RAG 워크로드는 입력이 무거우므로 캐시된 입력 할인의 영향이 크다. 70% 프롬프트 캐싱을 사용하면 중급이 월 약 $2,100으로 떨어진다.

코드 보조 도구: 200명 개발자

평균 세션: 4,500개 입력 토큰(파일 컨텍스트 + 대화), 1,200개 출력 토큰. 개발자당 일일 15개 요청, 근무일 22일 = 월 66,000건 요청 = 2억 9천 7백만 입력, 7천 9백만 출력.

  • 예산 선택(Qwen 3 32B): 2억 9천 7백만 × $0.20/M + 7천 9백만 × $0.80/M = 월 $123.
  • 중급 선택(Claude Sonnet 4): 2억 9천 7백만 × $3/M + 7천 9백만 × $15/M = 월 $2,078.

개발자들은 품질 격차를 빨리 알아챈다. 코드의 경우 중급이 보통 최소 수준이다. 예산 모델은 자동완성 스타일 제안에는 작동하지만 다중 파일 리팩토링에서는 어려움을 겪는다.

대량 문서 처리: 월 100만 문서

평균 문서: 2,000개 입력 토큰, 300개 출력 토큰(추출, 분류, 요약). 월간: 20억 입력, 3억 출력.

  • 예산 선택(Gemini 2.5 Flash): 20억 × $0.075/M + 3억 × $0.30/M = 월 $240.
  • 중급 선택(GPT-4.1): 20억 × $2/M + 3억 × $8/M = 월 $6,400.

이 규모에서 계층 간 27배 가격 차이는 월 $6,160 라인 항목이다. 예산 모델은 구조화된 추출을 잘 처리한다. 이 규모의 자체 호스팅을 고려한다면 하드웨어 크기 조정은 모델별 VRAM 요구사항을 확인하라.

API vs 자체 호스팅: 각각 언제 이기는가?

API는 일일 약 20,000개 미만 요청이거나 팀이 ML 인프라 경험이 부족할 때 이긴다. 자체 호스팅은 일일 200,000개 이상 요청에서 50% 이상의 지속적인 GPU 활용률로 이긴다. 손익분기점은 Introl의 분석에 따르면 단일 H100 노드에서 70B급 모델의 경우 일일 약 50,000~80,000개 요청에서 나타난다. 해당 임계값 아래에서는 API 제공자의 멀티테넌트 효율성이 단일테넌트 하드웨어 계산을 이긴다.

API가 이기는 때

며칠 내에 배포할 수 있고 수주가 아닐 때다. ML 엔지니어 급여($180,000~$250,000/년) 없음, GPU 장애에 대한 당직 순환 없음, 용량 계획 없음. 50명 이하의 대부분의 팀에는 API가 올바른 기본값이다. 정말이다.

자체 호스팅이 이기는 때

일일 200,000개 이상 요청을 넘었고, 워크로드가 예측 가능하며, 이미 ML 인프라 인력을 고용하고 있을 때다. 오픈소스 모델(Llama 4, Qwen 3, Mistral)은 전기 비용 더하기 감가상각에서 하드웨어에서 실행된다. vLLM vs SGLang 벤치마크는 이 규모에서 중요한 워크로드 형태에 따라 15~30%의 처리량 차이를 보여준다.

손익분기점 수치

...

출처 바로가기