
서버리스 GPU에서 LLM 배포하기: 5개 플랫폼, 실제 가격, 솔직한 콜드 스타트
RunPod는 A100 80GB에 대해 시간당 $2.72를 청구합니다. 엔드포인트가 점심 시간 전에 12개의 요청을 받습니다. 그 GPU는 나머지 23시간 동안 유휴 상태이지만 내내 요금이 청구됩니다. 서버리스 GPU에 LLM을 배포하면 요청이 실행되는 동안만 비용을 지불합니다. 5개의 플랫폼이 이를 지원합니다. 다섯 플랫폼이 다섯 가지 다른 단위로 요금을 청구합니다. 아무도 이들을 표준화하지 않습니다.
유휴 GPU의 비용은 바쁜 GPU의 비용과 정확히 같습니다.
핵심 요점
- 서버리스 GPU는 요청이 실행되는 동안만 요금을 청구하고 그 사이에는 0으로 스케일링합니다.
- Cloud Run에서는 인스턴스당 1개의 GPU를 제공합니다. 70B 모델은 다중 GPU가 필요하므로 서버리스는 일반적으로 호스팅할 수 없습니다.
- 모델 가중치는 이미지에, 네트워크 볼륨에, 또는 매 콜드 스타트마다 다시 다운로드됩니다.
- 콜드 스타트는 세 가지입니다: 컨테이너 부팅, 가중치 로드, 엔진 초기화. 첫 번째만 빠릅니다.
- 대략 하루에 47,000개 요청 미만의 경우, 스케일 투 제로가 24/7 렌탈 GPU를 능가합니다.
'LLM의 서버리스 GPU'는 실제로 무엇을 의미하나요?
서버리스 GPU 플랫폼은 공유 GPU 하드웨어에서 추론 컨테이너를 실행하고, 요청이 도착할 때 스핀업한 후, 트래픽이 중단되면 0으로 스케일합니다. 컨테이너가 살아있는 동안만 초당(또는 분당, 또는 시간당, 공급업체에 따라 다름) 요금을 지불합니다. 유휴 요금 없음. 예약된 인스턴스 없음.
공급업체마다 청구 단위가 다르기 때문에 다음 섹션에서 모든 것을 $/GPU 시간으로 표준화합니다.
두 가지 제약이 사람들을 놀라게 합니다. 먼저, Google Cloud Run은 인스턴스당 최대 1개의 GPU를 허용합니다. 이것은 VRAM 천장을 단일 카드로 제한합니다. 둘째, "서버리스"는 지속적인 상태를 의미하지 않습니다. 요청 사이에 RAM에 가중치를 보유하는 장기 프로세스가 없습니다. 컨테이너가 종료되면 메모리의 모든 것이 함께 사라집니다. 그 단 하나의 사실이 아래 모델 가중치 섹션의 저장소 결정을 주도합니다.
서버리스는 서버가 없다는 뜻이 아닙니다. 요청 사이에 서버가 없다는 뜻이고, 그것이 정확히 모델 가중치가 사라지는 곳입니다.
어떤 서버리스 GPU 플랫폼을 선택해야 할까요? (2026년 가격, 나란히)
우리는 이 플랫폼들 중 어느 것도 판매하지 않으며 어떤 것에서도 제휴 수익을 받지 않습니다. 이 검색어와 그 관련 변형을 두고 경쟁하는 7개의 기사 중 4개는 서버리스 GPU를 판매하는 회사에서 발행되었습니다. 이 표는 아닙니다.
모든 요금은 2026-07-30에 공급업체 자체 가격 책정 페이지에서 읽었습니다. 요금은 변경됩니다. 약속하기 전에 다시 확인하세요.
정규화 계산은 한 번만 표시되므로 감사할 수 있습니다: Modal A100 80GB의 초당 $0.000694에 3600초를 곱하면 시간당 $2.4984입니다. Beam: $0.000625 곱하기 3600은 시간당 $2.25입니다. Baseten: 분당 $0.06667 곱하기 60은 시간당 $4.00입니다. 동일한 A100에 대해 Beam과 Baseten 간의 1.8배 스프레드는 실수이며, 아무도 동일한 단위를 발행하지 않기 때문에 일반적으로 숨겨져 있습니다.
세 가지 주의사항. Beam의 가격 책정 페이지는 명시적으로 서버 스핀업 또는 컨테이너 이미지 로드에 대한 청구가 없음을 명시합니다. Baseten의 가격 책정 FAQ는 "Baseten에서 유휴 시간에 대해 지불하나요?"에 "아니요, 유휴 시간에 대해 지불하지 않습니다"로 답변한 다음, 청구 가능한 시간은 "모델이 적극적으로 배포, 스케일업 또는 스케일다운, 또는 예측을 수행하는 시간"이므로, 미터는 예측 시간보다 더 많은 것을 포함한다고 추가합니다. 이것이 예산을 책정할 가치가 있는 부분입니다. RunPod는 시간당 요금을 발행하고 가격 책정 페이지에 콜드 스타트 수치를 발행하지 않습니다.
Modal이 당신의 선택이라면, 우리는 완전한 Modal 안내서를 별도로 작성했습니다.
모델이 적합할까요? VRAM, 단일 GPU 제한 및 할당량
서버리스 GPU에서 70B 모델을 실행할 수 있습니까? 보통 아니요. FP16에서 70B는 약 140GB VRAM이 필요합니다. Cloud Run은 인스턴스당 1개의 GPU로 제한됩니다 (RTX PRO 6000에서 최대 96GB). 양자화(FP8/GGUF) 또는 다중 GPU 플랫폼 없이는 수학이 맞지 않습니다.
Cloud Run의 기본 할당량은 지역당 프로젝트당 3개의 L4 GPU입니다 (RTX PRO 6000은 3,000 milliGPU로 별도로 부여됨). 6개의 L4 지역에 걸쳐: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. 이것은 서버리스 GPU에 대해 유럽에서 묻는 모든 사람을 위한 데이터 거주권 답변의 Cloud Run 절반입니다. Modal과 RunPod는 자신의 EU 지역을 문서화하고, FAQ는 나머지를 포함합니다.
Ismaili Simba의 dev.to의 Cloud Run 안내서 (2025년 4월)는 할당량 요청이 "시간이 걸릴 수 있습니다 (최대 5 영업일까지)"가 승인되고 "Cloud Run에서 사용 가능한 L4 GPU는 16GB RAM 제한이 있습니다"라고 보고합니다. 그 지연에 대비하세요.
모델별 VRAM 크기 조정의 경우, VRAM 요구 사항 가이드를 참조하세요.
모델 가중치는 어디에 존재합니까 (그리고 그것은 어떻게 비용이 드나요)?
2024년 11월의 Reddit 스레드는 우리가 2026-07-30에 확인했을 때 이 정확한 쿼리에 대해 Google에서 여전히 #5 위치에 있으며, 다음과 같이 명확히 묻습니다:
"나는 80GB 모델을 저장하기 위한 요율을 찾을 수 없었습니다... 매 api 호출에서 모델을 다운로드하고 싶지 않은 경우의 대안이 무엇입니까 (포드가 호출에서 프로비저닝한 후 닫혔습니다)? ... 이 플랫폼들이 모델 저장소 비용을 나열하지 않는 이유는 무엇입니까?"
낮은 점수의 세 가지 답변, 그 중 어느 것도 답변이 아닙니다. 2026-07-30에 이 검색을 실행했을 때, 상위 10개 결과에는 여전히 모델 저장소 비용이 무엇인지 묻는 2년 된 스레드가 포함되었습니다. 스레드에서 아무도 그것에 대답하지 않았습니다. 두 플랫폼 모두 요율을 발행합니다. Modal에서는 GiB당 월 $0.09이며 첫 TiB는 무료이므로 80GB 체크포인트는 $0.00로 청구됩니다. RunPod에서는 1TB 미만의 네트워크 저장소에 대해 월 GB당 $0.07이므로 동일한 체크포인트는 대략 월 $5.60입니다.
세 번째 행은 장애 모드입니다. 2024 TU München 검토의 ServerlessLLM (arXiv 2411.15664)은 LLaMA-2-70B (130GB)가 5GB/s에서 26초 이상을 끌어다니고, 8개의 GPU에 로드하는 데 약 84초가 필요하며, 약 100ms 토큰 생성에 대해 보고합니다. 이 수치는 검토에서 인용되며 측정되지 않습니다.
RunPod의 가격 책정 페이지에는 저장소 섹션이 있습니다: 컨테이너 디스크 $0.10/GB/월, 볼륨 디스크 $0.10/GB/월 실행 및 $0.20/GB/월 유휴, 네트워크 저장소 $0.07/GB/월 1TB 미만 및 $0.05/GB/월 1TB 초과, 고성능 네트워크 저장소 $0.14/GB/월. 숫자가 존재합니다. 그것은 독자가 비교하고 있을 때 질문이 발생할 때 GPU당 서버리스 요금 옆에 앉아있지 않으며, 엔드포인트 구성 흐름에도 앉아있지 않습니다. 비밀의 문제가 아니라 발견 가능성의 문제이며, 2년 후에도 질문을 유지하기에 충분합니다.
아직 모델을 선택하지 않았다면, 우리의 2026 오픈 가중치 요약은 배포에 각 옵션의 크기를 조정합니다.
배포하기: RunPod 서버리스의 vLLM, 처음부터 끝까지
0부터 호출 가능한 엔드포인트까지 6단계. 각각을 RunPod의 vLLM 절차 (2026년 6월 22일 업데이트)에 대해 검증하세요. 가격을 발행하지 않습니다.
-
모델을 선택하세요. GPU에 크기가 맞는 오픈 가중치 모델을 선택하세요 (위의 VRAM 표 참조). Hugging Face에서 제한되면 먼저 액세스 토큰을 생성하세요.
모델을 선택하세요. GPU에 크기가 맞는 오픈 가중치 모델을 선택하세요 (위의 VRAM 표 참조). Hugging Face에서 제한되면 먼저 액세스 토큰을 생성하세요. -
서버리스 엔드포인트를 만드세요. RunPod 콘솔에서 서버리스를 선택하고, vLLM 워커 템플릿을 선택한 다음, GPU 계층을 선택하세요.
서버리스 엔드포인트를 만드세요. RunPod 콘솔에서 서버리스를 선택하고, vLLM 워커 템플릿을 선택한 다음, GPU 계층을 선택하세요. -
중요한 환경 변수를 설정하세요.
중요한 환경 변수를 설정하세요.
MODEL_NAME이 잘못되면 부팅 시 404가 의미합니다. MAX_MODEL_LEN이 VRAM에 비해 너무 높게 설정되면 첫 번째 토큰 전에 OOM이 의미합니다. GPU_MEMORY_UTILIZATION이 0.95를 초과하면 KV 캐시 스파이크에 대한 헤드룸이 남지 않습니다.
-
최소/최대 워커 및 유휴 타임아웃을 설정하세요. 최소 워커가 0이면 스케일 투 제로 (및 콜드 스타트)를 제공합니다. 최소 워커가 1이면 콜드 스타트를 제거하지만 계속 청구됩니다. 아래의 콜드 스타트 섹션은 그 트레이드오프를 통해 작동합니다.
최소/최대 워커 및 유휴 타임아웃을 설정하세요. 최소 워커가 0이면 스케일 투 제로 (및 콜드 스타트)를 제공합니다. 최소 워커가 1이면 콜드 스타트를 제거하지만 계속 청구됩니다. 아래의 콜드 스타트 섹션은 그 트레이드오프를 통해 작동합니다. -
모델 가중치 섹션에서 결정한 네트워크 볼륨을 첨부하거나 이미지 베이크 경로를 수락하세요. 이를 건너뛰면 매 콜드 스타트마다 체크포인트를 다시 다운로드합니다.
...