
LLM 비용 모니터링: 지출이 급증하기 전에 추적하기 (2026)
LLM 비용 모니터링은 $412의 깜짝 청구서와 예산의 80%에서 날아오는 Slack 알림의 차이입니다. 이번 달 Claude Sonnet 5는 백만 토큰당 $3.00으로 청구되며, 단 하나의 폭주 에이전트 루프만으로도 하루 오후에 그 비용을 다 소진할 수 있습니다. 대부분의 팀은 추적 기능을 하루 안에 구성하고, 알림은 건너뜁니다.
주요 포인트:
- LLM 비용 모니터링은 모든 요청에 토큰 수와 달러 추정치를 첨부한 후 모델과 팀별로 집계합니다.
- 다섯 가지 메트릭을 추적합니다: 요청당 토큰, 기능/팀/모델별 비용, 캐시 히트율, 대화당 비용, 급증률.
- LiteLLM 예산, Langfuse 추적, 또는 Datadog LLM Observability는 각각 하루 안에 지출 가시성을 구축합니다.
- 대시보드는 추정치를 표시하고, 캐시된 입력 가격과 배치 할인은 청구서가 보통 추정치보다 낮게 도착한다는 의미입니다.
LLM 비용 모니터링이 실제로 추적하는 것은?
LLM 비용 모니터링은 모든 LLM 요청에 토큰 수와 달러 추정치를 첨부하고, 그 추정치를 모델, 기능, 팀별로 집계하여 청구서가 도착하기 전에 지출을 경고할 수 있도록 하는 관행입니다. 추정치는 공개된 토큰 가격에서 요청당 계산되고, 호출에 표시한 태그에 따라 롤업되며, 미리 설정한 예산과 비교됩니다.
기반이 되는 계산은 벤더 중립적입니다. 모든 공급자의 사용 응답은 토큰을 필드로 분류하고, Datadog의 비용 문서는 그 관계를 명시적으로 문서화합니다. OpenTelemetry GenAI 시맨틱 컨벤션은 벤더 전체에서 동일한 필드를 표준화하므로, 이를 기반으로 구축한 대시보드는 하나의 공급자로 제한되지 않습니다.
세 가지 관계가 대부분의 작업을 수행합니다: 전체 토큰 = 입력 + 출력; 입력 = 캐시되지 않음 + 캐시_읽음 + 캐시_쓰기; 그리고 추론 토큰은 출력 내에 있으며, 출력 요금으로 계산됩니다. 이것들을 올바르게 하면 요청당 추정치가 청구서에 가깝게 유지되고, 무시하면 대시보드가 매달 청구서에서 벗어납니다. 비용 모니터링은 AI 옵저버빌리티의 한 기둥입니다. 추적과 평가가 다른 두 기둥이며, 이들은 동일한 필드 어휘를 공유합니다.
대시보드는 추정치를 표시합니다. 청구서는 절대 캐시되지 않는 유일한 비용 메트릭입니다.
LLM에서 백만 토큰은 얼마인가?
모델과 방향에 따라 다릅니다: 100만 토큰은 DeepSeek-V4 입력으로 $0.14이고 GPT-5.6 Terra 출력으로 $15.00입니다. 동일한 단위에서 100배의 격차입니다. 다음은 2026년 7월 14일 가격 조사에서 나온 네 가지 모델이며 공식 페이지에서 확인했습니다.
출처: OpenAI 가격 및 Anthropic 가격. 한 가지 주의사항: Claude Sonnet 5는 2026년 8월 31일까지 $2.00 입력 / $10.00 출력의 소개 가격을 실행한 후, 위의 숫자로 되돌아갑니다.
실제로 중요한 5가지 메트릭
다섯 가지 메트릭이 LLM 비용 추적을 다루며, 대부분의 팀은 그 중 두 가지에만 경고합니다. 처음 두 행부터 시작합니다: 요청당 토큰은 프롬프트 비대화가 나타나는 당일에 포착하고, 팀별 비용은 결국 재무팀이 물어볼 숫자입니다. 다른 세 가지는 처음 두 가지가 연결되면 그림을 정제합니다.
한 가지 세분화 참고: Datadog는 요청 수준 비용을 비용 문서에 따른 나노달러(달러의 10억분의 1)로 저장합니다. 백만 토큰당 $0.14에서 단일 DeepSeek-V4 요청은 1센트의 천분의 1 미만 비용이 들 수 있으므로, 반올림 전에 집계하거나 소규모 모델 트래픽이 보고서에서 사라집니다.
다른 것을 추적하지 않으면 처음 두 행을 추적합니다. 요청당 토큰은 얻을 수 있는 가장 빠른 경고이고, 팀별 비용은 회계 부서와의 접촉을 견디는 것입니다.
LLM 비용 모니터링을 구성하는 3가지 방법
이 쿼리에 대해 상위에 랭크된 페이지는 단 하나의 실행 가능한 코드 줄도 제공하지 않으므로, 여기에 세 가지 작동하는 설정이 있습니다. 각각은 하루 안에 실행되며, 조합 가능합니다: 우리는 처음 두 가지를 함께 실행합니다.
프로덕션에서 실제로 실행하는 것: 우리의 설정에서 모든 클라이언트 에이전트는 자신의 가상 키를 통해 LiteLLM 프록시와 통신하며, 각 키에는 월별 예산이 있고 Langfuse가 프록시 뒤의 모든 요청을 추적합니다.
두 가지를 함께 배포했을 때, 역할 분담이 핵심이었습니다: 프록시는 한도를 강제하고, 추적은 그것을 소비한 것을 설명합니다.
우리의 각 클라이언트 키는 또한 분당 100,000 토큰의 tpm_limit을 두 번째 퓨즈로 사용합니다. LiteLLM의 문서에 따르면, 프록시는 한도에 도달하면 요청을 거부하고, 우리가 의존하는 것은 그 문서화된 동작이지 우리 스스로 측정한 벤치마크가 아닙니다.
우리의 구성은 LiteLLM 1.82.7과 1.82.8을 완전히 건너뛰고, 2026년 3월 공급망 사건에 걸린 두 버전이며, 최신 버전에서 부동하는 대신 이미지 태그를 고정합니다.
LiteLLM 프록시: 가상 키 + 예산
Techsy는 프로덕션에서 클라이언트당 하나의 가상 키와 각 키의 월별 예산이 있는 LiteLLM 프록시 설정을 실행합니다. 아래의 요청은 LiteLLM의 virtual_keys 문서에서 나온 문서화된 형태입니다: 해당 문서에 따르면, 이 키에 대한 누적 지출이 한 달에 $50을 초과하면, 프록시는 사후에 경고를 로깅하기보다는 예산 초과 오류로 추가 요청을 거부합니다.
공개된 가격에 대해 계산합니다: Claude Sonnet 5의 백만 토큰당 $3.00 / $15.00에서, $50은 대략 1670만 입력 토큰 또는 330만 출력 토큰을 구매하며, 우리의 더 가벼운 클라이언트 에이전트 중 하나의 약 일주일 분량의 트래픽입니다. 이는 정확히 우리가 원하는 영향 범위입니다. tpm_limit은 두 번째 퓨즈입니다: 폭주 루프는 월별 예산을 트립하기 훨씬 전에 분당 100K 토큰을 트립합니다. 사용자별 속성은 users 엔드포인트를 통해 동일한 방식으로 작동하며, 우리의 최고의 LLM 게이트웨이 도구 가이드는 프록시가 자리를 차지하는 경우와 그저 또 다른 홉일 때를 다룹니다.
Langfuse: @observe 비용 추적
Google 자동 완성은 "langfuse monitoring"을 이 쿼리와 페어링하며, 그럼 당연합니다: Langfuse는 오픈소스 추적 기본값입니다. Python SDK는 공급자 클라이언트를 래핑하므로 모든 호출은 토큰 수와 계산된 비용을 포함하는 추적이 됩니다. Langfuse 추적 문서에 따르면:
비용은 당신의 토큰 계산 없이 추적에 도착합니다. 세션이나 사용자 ID로 추적을 그룹화하여 기능별 롤업을 수행하고, 데이터가 네트워크를 떠날 수 없으면 자체 호스팅합니다.
Datadog LLM Observability: 이미 사용 중이라면
팀이 이미 Datadog 에이전트를 배포하면, LLM 비용 문서가 이 페이지에서 가장 깊은 단일 참고 자료입니다: 나노달러의 요청 수준 비용, 팀 및 기능 분류를 위한 custom cost_tags, 그리고 부분 비용 갭에 대한 실제 문제 해결 섹션. 솔직한 제한: Datadog 전용입니다. 메트릭은 플랫폼을 떠나지 않으며, 가격이 맞지 않으면 오픈소스 폴백이 없습니다. 유연성이 아닌 통합을 위해 선택합니다.
예산, 경고, 역청을 어떻게 구성하나요?
세 계층으로 구성합니다: 한도에서 요청을 거부하는 예산 한도, 한도 이전의 백분율 임계값에서 발생하는 웹훅 경고, 및 쇼백과 역청을 주장이 아닌 쿼리로 변환하는 팀별 가상 키입니다. LiteLLM은 기본적으로 세 가지를 모두 제공합니다. 패턴은 키 수준 예산이 있는 모든 게이트웨이로 이전됩니다.
수만 하는 예산은 보고서입니다. 한도에서 요청을 거부하는 예산은 제어입니다.
급증 전에 발생하는 경고
경고를 한도의 80%에서 설정하고, 100%에서 설정하지 마세요. LiteLLM은 기본 제공 Slack 경고를 제공합니다: general_settings에서 alerting: ["slack"]과 alerting_threshold: 80을 설정하고, SLACK_WEBHOOK_URL 환경 변수를 채널로 지정한 후, 키가 임계값을 넘으면 다음과 같은 메시지가 도착합니다:
80%에서, 인간은 여전히 행동할 며칠이 있습니다: 모델을 다운그레이드하거나, 프롬프트를 조이거나, 승인 권한자 이름으로 한도를 올리세요. 100%의 경고는 부검입니다.
쇼백에서 역청으로
쇼백은 각 팀이 자신의 지출을 봅니다. 역청은 그것이 그들의 예산에서 나온다는 의미입니다. 둘 다 하나의 요소로 실행됩니다: 생성 시 태그된 팀별 가상 키입니다. 월별 보고서는 지출 테이블에 대한 그룹별입니다:
...