
LLM 프롬프트 캐싱은 이전에 처리된 토큰을 API 호출 전체에 재사용하게 해줍니다. 입력 비용을 최대 90%까지 절감하고 첫 토큰까지의 시간을 최대 85% 단축할 수 있습니다. 매 요청마다 동일한 시스템 프롬프트, 도구 정의 또는 몇 가지 예시를 보내고 있다면, GPU가 이미 처리한 작업에 대해 정가를 지불하고 있는 것입니다.
이 가이드는 OpenAI, Anthropic, Gemini를 다루며 세 개의 SDK 모두에서 동일한 채봇이 구현되어 있습니다. 다른 어떤 가이드도 이를 다루지 않습니다. Anthropic의 2026년 2월 자동 캐싱 업데이트, 실제 달러 금액을 포함한 프로덕션 비용 시나리오, 그리고 캐시 히트율을 조용히 파괴하는 안티패턴도 다룹니다.
빠른 요약 - 한눈에 보는 세 제공자 비교
구현 세부 사항에 들어가기 전에, 다음은 전체 비교입니다. 이미 어떤 제공자를 사용하는지 알고 있다면 해당 섹션으로 건너뛰세요. 평가 중이라면, 이 표는 10초 안에 모든 것을 알려줍니다.
핵심 요점: OpenAI는 가장 간단합니다(제로 설정, 50% 할인). Anthropic은 가장 깊은 할인(90%)과 가장 많은 제어를 제공합니다. Gemini는 설정 가능한 TTL과 2.5+ 모델에 대한 암묵적 캐싱을 제공하며 Anthropic과 비슷한 할인율을 제공합니다.
LLM 프롬프트 캐싱은 어떻게 작동할까요?
트랜스포머 내부를 이해할 필요는 없지만, 프롬프트 캐싱을 효과적으로 사용하려면 하나의 개념을 이해해야 합니다: 접두사 매칭입니다.
60초 안에 알아보는 KV 캐시
LLM이 프롬프트를 처리할 때, 모든 토큰에 대한 어텐션 상태(키-값 쌍)를 계산합니다. 이러한 KV 캐시 항목이 비용이 많이 드는 부분입니다. GPU 메모리와 계산 시간을 소모하는 것입니다. 프롬프트 캐싱은 이러한 계산된 상태를 저장하여 다음 요청에서 동일한 접두사를 사용할 때 재계산을 완전히 건너뜁니다.
중요한 단어는 접두사입니다. 캐시는 프롬프트의 시작부터 앞으로 매칭됩니다. 처음 2,000개 토큰이 캐시된 항목과 일치하지만 토큰 2,001이 다르다면, 처음 2,000개 토큰은 캐시에서 제공됩니다. 분기점 이후의 모든 것은 새로 계산됩니다.
이것이 프롬프트 순서가 중요한 이유입니다. 프롬프트를 다음과 같이 구조화하세요:
- 도구 정의(가장 정적)
- 시스템 프롬프트
- 정적 몇 가지 예시
- 검색된 컨텍스트(반동적)
- 대화 이력(턴마다 증가)
- 사용자 쿼리(항상 다름)
정적 컨텐츠를 먼저, 동적 컨텐츠를 나중에 배치하세요. 캐시된 접두사와 일치하는 토큰이 많을수록 절감액이 커집니다.
프롬프트 캐싱 vs 의미론적 캐싱 vs 응답 캐싱
이 세 용어는 끊임없이 혼동됩니다. 프롬프트 캐싱(이 가이드가 다루는 것)은 동일한 토큰 접두사에 대해 GPU 수준에서 계산된 KV 상태를 재사용합니다. 정확도 손실이 없으며, 캐시되지 않은 것과 동일한 출력을 얻습니다. 의미론적 캐싱은 임베딩 유사성을 사용하여 "충분히 유사한" 쿼리에 대해 이전에 생성된 응답을 반환합니다. 더 빠르지만 잘못된 답변을 반환할 수 있습니다. 응답 캐싱은 정확한 입력-출력 쌍을 저장하고 캐시된 응답을 그대로 반환합니다. 진정으로 동일한 요청에만 작동합니다.
프롬프트 캐싱은 유일한 "자유 최적화"입니다. 정확도 트레이드오프 없이 비용과 지연시간을 줄입니다. KV 캐싱 뒤의 깊은 트랜스포머 수학에 대해, Hugging Face의 기술 설명서는 T4 GPU에서 약 5.21배 속도 향상을 측정했습니다.
OpenAI는 프롬프트 캐싱을 어떻게 처리할까요?
OpenAI의 프롬프트 캐싱은 완전히 자동입니다. 2024년 10월 이후, 1,024개 이상의 입력 토큰을 가진 모든 API 호출은 자동으로 캐싱의 이점을 누립니다. 옵트인할 필요가 없고, 헤더를 추가할 필요가 없으며, 코드를 변경할 필요가 없습니다.
OpenAI의 자동 캐싱이 작동하는 방식
최소 1,024개의 토큰이 있는 요청을 보낼 때, OpenAI는 접두사가 조직에서 최근 요청과 일치하는지 확인합니다. 캐시 히트는 표준 입력 토큰 가격의 50%가 소요됩니다. 초기 1,024 토큰 임계값 이후, 캐시는 128 토큰 증분으로 일치합니다.
캐시는 정상 사용 중 5~10분 동안 유지되며, 피크 오프 기간 동안 확장된 유지로 최대 24시간까지 지속될 수 있습니다. 조직당 범위이므로, 동일한 조직 내의 다양한 프로젝트는 공유 캐시의 이점을 누립니다.
지원되는 모델에는 GPT-4o, GPT-4o-mini, GPT-4.1, o1, o3-mini, 그리고 모든 최신 모델이 포함됩니다.
OpenAI Python SDK 예제
첫 번째 호출은 전체를 정가로 처리하고 캐시를 채웁니다. 두 번째 호출은 캐시된 시스템 프롬프트 토큰을 반가로 재사용합니다. 출력에서 Cached: 1920/2048 tokens (94%)와 같은 것을 볼 수 있습니다.
평결: OpenAI는 시작하기 가장 쉽습니다. 제로 설정, 캐싱이 그냥 발생합니다. 50% 할인은 세 제공자 중 가장 낮지만, 단순함을 이길 수 없습니다.
Anthropic/Claude는 프롬프트 캐싱을 어떻게 처리할까요?
Anthropic은 두 가지 모드를 제공합니다: 자동 캐싱(2026년 2월 이후 기본적으로 활성화됨)과 cache_control 브레이크포인트가 있는 명시적 캐싱. 헤드라인 숫자는 무시하기 어렵습니다. 캐시된 읽기는 표준 입력 가격의 단 10%가 소요되며, 90% 할인입니다.
자동 vs 명시적 캐싱(2026 업데이트)
2026년 2월 5일부터, Anthropic은 모든 적격 프롬프트에 대해 기본적으로 자동 캐싱을 활성화합니다. 더 이상 기존 베타 헤더가 필요하지 않습니다. 시스템이 최적의 캐시 브레이크포인트를 자동으로 결정합니다.
명시적 캐싱은 여전히 세밀한 제어가 필요할 때 사용 가능합니다. cache_control: {"type": "ephemeral"}을 특정 컨텐츠 블록에 배치하여 캐시 경계가 정확히 어디에 있어야 하는지 표시합니다. 이는 프롬프트에 특정 구조가 있고 특정 섹션이 캐시되도록 보장하려 할 때 유용합니다.
두 가지 TTL 옵션이 존재합니다:
- 5분 캐시(기본값): 쓰기 비용 기본 입력 가격의 1.25배, 읽기 비용 0.1배. 캐시 히트 1회 후 수익성 달성.
- 1시간 캐시: 쓰기 비용 기본 입력 가격의 2배, 읽기 비용 0.1배. 캐시 히트 2회 후 수익성 달성. Claude 4.5+ 모델에서 사용 가능.
캐시 격리는 2026년 2월 5일에 조직 수준에서 워크스페이스 수준으로 변경되었습니다. 이는 동일한 조직 내의 다양한 워크스페이스가 별도의 캐시를 유지함을 의미합니다.
Anthropic의 캐싱으로 작업할 때, 최적 캐싱을 위해 프롬프트를 구조화하는 것이 도움이 됩니다. 정적 컨텐츠를 동적 컨텐츠 이전에 배치하는 것은 여기서 더욱 중요합니다. 왜냐하면 쓰기 프리미엄을 지불하고 있기 때문입니다.
Anthropic Python SDK 예제
캐시 쓰기 vs 캐시 읽기 가격 이해
Anthropic의 가격이 흥미로워지는 부분은 여기입니다. Claude Sonnet 4.5($3/MTok 기본 입력)를 예시로 사용하면:
- 표준 입력: 백만 토큰당 $3.00
- 캐시 쓰기(5분): 백만 토큰당 $3.75 (1.25배) -- 처음에는 더 많이 지불합니다
- 캐시 읽기: 백만 토큰당 $0.30 (0.1배) -- 매번 후속 히트에서 90% 더 저렴합니다
5분 캐시는 단 1회 읽기 후에 수익성이 달성됩니다. 1시간 캐시($6.00/MTok 쓰기)는 2회 읽기 후에 수익성이 달성됩니다. 동일한 접두사를 가진 요청을 분당 두 번 이상 만들고 있다면, 수학이 압도적으로 당신의 이익입니다.
평결: Anthropic은 가장 깊은 할인(90%)과 가장 많은 제어를 제공합니다. 높은 볼륨, 비용 민감한 워크로드에 최적입니다.
Google Gemini는 프롬프트 캐싱을 어떻게 처리할까요?
Gemini는 두 가지 뚜렷한 캐싱 메커니즘으로 다른 접근 방식을 취합니다: 명시적 컨텍스트 캐싱(생성하고 참조하는 명명된 캐시 객체)과 암묵적 캐싱(자동, 제로 설정, 2026년에 Gemini 2.5+ 모델에 추가됨).
명시적 컨텍스트 캐싱(명명된 캐시)
OpenAI 및 Anthropic에서 캐싱이 투명한 것과 달리, Gemini의 명시적 캐싱은 먼저 명명된 캐시 객체를 생성한 다음 후속 요청에서 이를 참조해야 합니다. 최소 토큰 임계값은 Gemini Flash 모델의 경우 1,024개 토큰이고 Pro 모델의 경우 4,096개 토큰입니다. TTL은 설정 가능합니다. 기본값은 1시간이지만, 필요에 따라 설정할 수 있습니다.
Gemini 2.5 Pro에서 캐시된 토큰은 표준 $1.25/MTok 입력 가격 대비 $0.125/MTok로 가격이 책정됩니다. 90% 할인입니다. Pro의 경우 시간당 백만 토큰당 $4.50의 저장소 비용과 Flash의 경우 $1.00의 저장소 비용도 있습니다.
Gemini 2.5의 암묵적 캐싱(2026)
...