당신의 LLM API 비용은 아마도 필요한 것보다 3~5배 높을 겁니다. 추측이 아닙니다. 우리가 최적화한 모든 프로덕션 AI 앱에서 나타나는 패턴입니다. 좋은 소식이 있습니다. 12가지 특정 기법을 사용하면 월 $10,000의 비용을 $2,000 이하로 줄일 수 있으며, 대부분은 오후 시간에 구현할 수 있습니다.

월 $10K 기본선 (그리고 비용이 어디로 가는가)

무엇을 최적화하기 전에 토큰이 어디로 가는지 알아야 합니다. 다음은 GPT-5.6 Terra 같은 중간 계층 모델에서 일일 50K 요청을 처리하는 프로덕션 앱의 일반적인 내역입니다:

가장 큰 범인은 무엇일까요? 모든 단일 요청과 함께 동일한 2,000토큰 시스템 프롬프트를 보내는 것입니다. 두 번째는? $2.50/MTok 모델을 사용하는 것인데, $0.20/MTok 모델이 똑같이 잘 처리할 수 있는 작업에서 말입니다.

둘 다 해결하고 열 가지 더 해결해 봅시다. 아래의 모든 가격은 2026년 7월 14일 현재 공식 가격 책정 페이지에서 가져온 것입니다.

1. 프롬프트 캐싱: 가장 큰 승리

프롬프트 캐싱을 사용하면 반복된 입력 토큰에 대해 비용의 일부만 지불하면 됩니다. 모든 주요 공급자가 이제 이를 지원하며, 절감액은 극적입니다.

2026년 7월 현재 가격 책정이 어떻게 분류되는지 다음과 같습니다:

Anthropic을 사용하면 캐시된 읽기 비용은 기본 가격의 10%에 불과합니다. 시스템 프롬프트가 2,000토큰이고 하루에 50K 요청을 하면 일일 캐시된 토큰이 100M입니다. $5/MTok 대신 $0.50/MTok에서 하루 $450을 절약하며, Opus 계층에서만 입력 토큰으로 월약 $13,500을 절약합니다(저렴한 모델에서는 비례적으로 적지만 90% 비율은 유지됩니다).

설정하는 것은 간단합니다:

한 가지 중요한 주의사항: Anthropic의 기본 캐시 TTL은 1시간이 아니라 5분입니다. 사용자나 작업이 요청 사이에 5분보다 긴 간격이 있으면 cache_control 블록에 "ttl": "1h"을 추가하세요. 표준 쓰기 가격의 2배 비용이 들지만 캐시를 1시간 동안 유지하며, 읽기는 여전히 0.1배 비용만 듭니다.

OpenAI와 Google은 프롬프트가 최소 길이를 초과하면 자동으로 캐시하므로, 해당 공급자에서는 이익이 거의 무료에 가깝습니다. 규칙은 모든 곳에서 동일합니다: 프롬프트의 안정적인 부분을 먼저 유지하고 변수 부분을 마지막에 유지하세요. 접두사의 바이트 변경이 그 이후의 모든 것을 무효화하기 때문입니다.

공급자별 구현 및 캐시 체이닝 같은 고급 패턴은 완전한 프롬프트 캐싱 가이드를 참조하세요.

예상 절감액: 전체 비용의 30-50%.

2. 모델 라우팅: 엄지손가락 태우기용 망치 사용 중단

대부분의 앱은 모든 요청을 동일한 모델로 보냅니다. 이는 "반품 정책이 뭔가요?"에 답변하기 위해 선임 엔지니어를 고용하는 것과 같습니다. 단순한 쿼리는 저렴한 모델로 라우팅하고 비싼 모델은 복잡한 추론용으로 예약하세요.

기본 라우팅 설정:

가격 차이는 엄청납니다. GPT-5.4 nano는 입력에 대해 $0.20/MTok의 비용이 들며, 이는 플래그십 GPT-5.6 Sol보다 25배 저렴합니다. 분류, 추출, 간단한 Q&A의 경우 품질 차이는 무시할 수 있습니다.

실제로 프로덕션 쿼리의 60-70%는 가장 작은 모델에 대해 "충분히 간단합니다". 이를 나노 계층 모델로 라우팅하고 플래그십에서 10-15%만 유지하면 가중 평균 비용이 약 70% 감소합니다.

LiteLLM, Portkey, Martian 같은 LLM 게이트웨이 도구는 라우팅을 자동으로 처리합니다. 복잡성을 분류하고 품질 임계값을 충족하는 가장 저렴한 모델을 선택합니다.

예상 절감액: 전체 비용의 40-60%.

3. 배치 API: 기다릴 수 있는 모든 것에 절반 가격

워크로드가 실시간 응답이 필요하지 않은 경우, 콘텐츠 조정, 야간 보고서 생성, 대량 분류에서 OpenAI의 배치 API는 입력 및 출력 토큰 모두에 대해 정액 50% 할인을 제공합니다. Anthropic, Google, Alibaba도 모두 동일한 50% 배치 할인을 제공합니다.

트레이드오프는 지연시간이며, 결과는 초 단위가 아니라 24시간 내에 반환됩니다. 하지만 야간 처리 작업의 경우 그것은 무관합니다.

워크로드를 감사하세요. cron 작업에서 실행되거나 사용자 대면 이벤트가 아닌 이벤트에 의해 트리거되는 모든 항목은 배치 후보입니다. 일반적으로 API 호출의 20-30%가 적격입니다.

예상 절감액: 전체 비용의 10-15% (배치 적격 부분에서: 50%).

4. 프롬프트 다듬기 (출력 토큰 비용은 4-6배 더 많음)

출력 토큰이 비싼 것입니다. GPT-5.6 Terra는 출력에 대해 $15/MTok를 청구하고 입력에 대해 $2.50/MTok를 청구하며, 이는 6배 배수입니다. 응답 길이를 줄이면 입력을 줄이는 것보다 토큰당 더 많이 절약됩니다.

세 가지 빠른 승리:

  • max_tokens을 적극적으로 설정하세요. 예/아니오 답변이 필요하면 1,024가 아니라 10으로 설정하세요. 모델은 한계에서 생성(및 청구)을 중지합니다.
  • 구조화된 출력을 요청하세요. "다음 필드가 있는 JSON을 반환하세요: 감정, 신뢰도"는 200토큰 단락 대신 50토큰을 생성합니다. 구조화된 출력 가이드에서 이를 자세히 설명합니다.
  • 시스템 프롬프트 지시를 사용하세요. 시스템 프롬프트에 "간결하게 하세요. 서문 없음. 요청하지 않은 한 설명 없음."을 추가하세요.

실제 예: 한 팀의 고객 감정 파이프라인은 티켓당 150단어 설명을 반환했습니다. 구조화된 JSON 출력으로 전환한 후 응답은 ~200토큰에서 ~30토큰으로 떨어졌으며, 출력 토큰이 85% 감소하여 월 $2,400을 절약했습니다.

예상 절감액: 전체 비용의 10-20%.

5. 의미론적 캐싱: 같은 답변에 두 번 지불하지 마세요

프롬프트 캐싱(기법 #1)은 공급자 측이며 동일한 접두사를 처리합니다. 의미론적 캐싱은 응용 프로그램 측이며 유사한 질문을 처리합니다.

"비밀번호를 재설정하려면 어떻게 해야 하나요?"와 "비밀번호를 잊어버렸는데 어떻게 변경하나요?"는 다른 문자열이지만 같은 질문입니다. 의미론적 캐시는 각 쿼리의 임베딩을 저장하고 유사성이 임계값(일반적으로 0.95+)을 초과할 때 캐시된 응답을 반환합니다.

반복적인 쿼리가 있는 고객 대면 앱(지원 봇, FAQ 시스템, 검색 보조자)은 캐시 적중률이 30-60%입니다. 각 캐시 적중은 API 호출과 비교하여 본질적으로 비용이 들지 않습니다.

예상 절감액: 전체 비용의 15-30% (쿼리 다양성에 따라 다름).

6. 큰 모델을 대체하기 위해 작은 모델 미세 조정

직관에 어긋나는 움직임입니다: 프로덕션에서 비용을 절약하기 위해 미세 조정에 돈을 쓰세요. 미세 조정된 작은 모델은 특정 작업에서 플래그십의 품질을 일치시킬 수 있으면서 토큰당 5배 적은 비용이 듭니다.

수학은 좁고 명확하게 정의된 작업, 분류, 추출, 포맷팅이 적어도 500개의 고품질 예제와 함께 있을 때 작동합니다.

미세 조정 실행 자체는 일회성 비용입니다(데이터셋 크기와 모델에 따라 대략 $3-25). 그 후 모든 요청은 특정 작업에 대해 더 큰 모델의 품질을 가진 더 작은 모델의 가격으로 실행됩니다.

이를 위해 플랫폼을 평가하는 경우 미세 조정 도구 비교를 확인하세요.

예상 절감액: 전체 비용의 10-20% (미세 조정에 적합한 작업).

7. 함수 호출 및 구조화된 출력으로 출력 제한

이것은 기법 #4와 관련이 있지만 별도로 호출할 가치가 있습니다. 함수 호출 및 구조화된 출력은 단순히 토큰을 줄이는 것이 아니라 잘못된 형식의 응답으로 인한 재시도를 제거합니다.

구조 없이는 다음을 받을 수 있습니다:

구조화된 출력 포함:

그것은 25개가 아니라 6토큰입니다. 하지만 더 큰 승리는 안정성입니다. 구조화되지 않은 응답은 5-15%의 시간에 구문 분석에 실패하며, 각 재시도는 또 다른 전체 API 호출입니다. 구조화된 출력은 구문 분석 실패를 거의 0에 가깝게 가져옵니다.

예상 절감액: 전체 비용의 5-10% (주로 제거된 재시도로부터).

8. 모든 것을 모니터링하세요 (볼 수 없는 것을 최적화할 수 없습니다)

위의 전략은 영향을 측정할 수 없으면 쓸모가 없습니다. 엔드포인트, 모델, 기능당 비용 추적을 설정하세요.

추적할 항목:

  • 엔드포인트 및 모델별 요청당 비용
  • 캐시 적중률 (목표: 반복적인 워크로드의 경우 40%+)
  • 토큰 사용 분포 (입력 대 출력, 기능별)
  • 모델 라우팅 효과 (계층당 쿼리 %)
  • 오류 및 재시도 비율 (각 재시도는 해당 요청 비용을 두 배로 증가시킵니다)

Helicone, Portkey, LangSmith 같은 도구는 이 모든 것에 대한 대시보드를 제공합니다. 일부 팀은 OpenTelemetry를 사용하여 사용자 정의 추적을 구축하지만 관리되는 도구는 오후에 당신을 거기에 데려갑니다.

예산 경고를 설정하세요. 주간 검토를 하세요. 비용을 가장 빠르게 줄이는 팀은 첫 달 동안 매일 대시보드를 확인하는 팀입니다.

예상 절감액: 5-10% (당신이 존재하는 줄 몰랐던 낭비를 식별함으로써).

9. 대용량 워크로드용 오픈 모델 자체 호스팅

...

출처 바로가기