앤트로픽이 클로드 API의 운영 비용을 효과적으로 절감하는 방법을 공개했다. 단순히 저렴한 모델로 바꾸거나 프롬프트를 줄이는 식의 접근이 아니라, 실제 작업 수행에 필요한 컴퓨팅 자원만 사용하는 것을 중심으로 제시됐다.

앤트로픽은 8일(현지시간) AI 애플리케이션의 기능을 유지하면서도 클로드 API 운영 비용을 낮출 수 있는 세 가지 최적화 전략을 발표했다.

토큰 개수가 아닌 성공 비용으로 접근

핵심은 토큰 1개당 비용만 따지는 것이 아니라, 실제 작업 하나를 성공적으로 완료하는 데 들어간 총 비용을 기준으로 삼아야 한다는 것이다. 동일한 입력을 반복 처리하거나, 이전 모델에 맞춰 작성한 불필요한 지침을 최신 모델에서도 그대로 쓰거나, 단순한 작업에 최고 수준의 추론 능력을 적용하면 낭비적인 비용이 발생할 수 있다.

세 가지 최적화 방법은 각각 다른 유형의 컴퓨팅 낭비를 해결하는 데 집중되어 있다. △'프롬프트 캐싱'은 반복적인 입력 처리 비용을 줄이고 △'프롬프트 지침 개선'은 불필요한 추론이나 도구 호출을 제거하며 △'노력 수준(Effort Level) 조정'은 AI가 답변을 생성하기 전에 얼마나 깊이 있게 사고할지를 조절한다.

프롬프트 캐싱으로 반복 처리 비용 절감

프롬프트 캐싱은 가장 직접적인 비용 절감 수단 중 하나다. 클로드는 답변을 생성하기 전에 긴 시스템 프롬프트나 도구 정의, 문서, 대화 기록 등을 내부 상태로 변환하는 전처리 단계를 거친다. 동일한 내용이 반복적으로 입력되는 애플리케이션에서는 이 과정을 매번 반복할 필요가 없으므로, 이전에 계산한 키-값(KV) 캐시를 저장했다가 다음 요청에서 재사용하면 비용과 응답 시간을 모두 줄일 수 있다.

다만 캐싱 효과를 제대로 누리려면 반복되는 프롬프트의 앞부분이 안정적으로 유지되어야 한다. 요청 초기에 동적으로 생성되는 시간 정보나 요청 ID를 삽입하거나, 도구 정의 순서를 변경하거나, 모델을 도중에 바꾸면 캐시 적중률이 떨어질 수 있다. 앤트로픽은 안정적인 시스템 지침과 도구 정의를 프롬프트의 앞부분에 배치하고, 자주 사용하지 않는 도구는 필요할 때만 로드하는 방식을 권장했다.

구형 모델 대비 불필요한 지침 제거

두 번째 전략은 프롬프트 지침을 개선하는 것이다. AI 애플리케이션은 모델이 특정 작업을 제대로 수행하지 못할 때 이를 보완하기 위해 지침을 하나씩 추가하는 경향이 있다. '두 번 검증하라'거나 별도의 사고 절차를 거치도록 요구하는 식이 전형적이다. 하지만 최신 모델로 업그레이드한 후에는 예전 모델의 약점을 보완하려고 만든 이런 지침들이 오히려 불필요한 추론이나 도구 호출을 유발할 수 있다.

앤트로픽은 이를 '지침 부채(instruction debt)'라고 명명하며 최신 모델에 맞춰 프롬프트를 다시 검토해야 한다고 강조했다. 반복되는 검증 절차, 과도한 상세 설명 요구, 고정된 스크래치패드나 사고 절차, 구식 모델에 맞춘 예시, 서로 충돌하는 규칙 등이 비용을 높이거나 성능을 저하시킬 수 있다는 설명이다.

실제로 기존 고객지원 프롬프트에 이 6가지 안티 패턴을 적용해 비교한 결과, '클로드 코드'의 '/claude-api prompt-audit' 명령으로 지침을 정리했을 때 평균 14.6%의 비용 감소와 5.3%의 정확도 향상을 달성했다. 불필요한 추론과 도구 호출을 줄이는 동시에 최신 모델과 맞지 않는 설정과 상충하는 규칙 등을 제거한 것이 주요 원인으로 분석됐다.

다만 이 결과가 모든 애플리케이션에 동일하게 적용되는 것은 아니라고 설명했다. 특정 조건에서 수행된 테스트 결과인 만큼, 개발자는 실제 서비스와 유사한 평가 데이터를 활용해 변경 전후의 성능을 직접 검증해야 한다.

작업 난이도에 맞는 노력 수준 선택

노력 수준 조정은 클로드가 최종 답변을 제시하기 전에 얼마나 많은 추론을 수행할지를 결정하는 설정이다. 높은 노력 수준을 적용하면 복잡한 문제에서 더 많은 검증과 탐색을 수행할 수 있지만, 그만큼 토큰 사용량과 비용, 응답 시간이 증가한다.

반대로 모든 작업에 낮은 노력 수준을 적용하면 비용은 줄어들지만, 중요한 검증을 건너뛰거나 충분한 정보를 수집하지 않은 상태에서 답변을 내놓을 가능성이 있다. 따라서 애플리케이션의 실제 작업 특성에 따라 어느 수준의 노력이 가장 효율적인지를 측정하고 결정해야 한다.

앤트로픽이 제시한 사례에서는 고급 모델에 낮은 노력 수준을 적용하는 것이 하위 모델에 높은 노력 수준을 적용하는 것보다 비용 대비 성능이 우수한 경우도 나타났다. 이는 모델 선택과 노력 수준을 별개의 요소로 판단하지 말고 함께 평가해야 한다는 의미다.

새로운 분석 명령어로 최적화 자동화

클로드 코드용 API 스킬에 '/claude-api hillclimb'과 '/claude-api cost-optimize' 명령이 추가됐다. hillclimb은 모델과 노력 수준의 다양한 조합을 비교해 더 나은 구성을 찾아주고, cost-optimize는 캐싱과 출력 제한, 배치 처리, 프롬프트 정리 등 주요 비용 요인을 분석해 최적화 방법의 우선순위를 제시한다.

앤트로픽은 AI 비용을 줄이는 목표를 단순한 토큰 절감이 아니라 성공적으로 작업을 완료하는 데 필요한 비용(cost per successful task)으로 접근해야 한다고 강조했다. 입력·출력 토큰뿐 아니라 추론 토큰, 도구 호출, 지연 시간, 오류와 재시도, 실제 작업 성공률까지 종합적으로 고려해야 한다는 설명이다.

출처 바로가기