
대부분의 "앱에 AI를 추가하세요"라는 가이드는 6자리 수의 컨설팅 계약을 팔려는 에이전시가 작성합니다. 이 가이드는 코드 우선 방식을 제시합니다: 실제 작동하는 OpenAI와 Anthropic API 호출, Vercel AI SDK를 사용한 스트리밍 UI, 스프레드시트에 바로 대입할 수 있는 비용 계산식, 그리고 LLM이 예상치 못한 행동을 할 때에도 앱의 안정성을 유지하는 프로덕션 패턴입니다. 기존 앱을 다시 작성하지 않고 AI를 통합할 수 있습니다.
빠른 요약: 무엇을 만들 수 있고 비용은 얼마나 드는가
어떤 AI 기능을 먼저 출시할지 선택하기 전에, 현실적인 분석을 보겠습니다. 이 추정치들은 100명의 활성 사용자를 기준으로 하며, 특별히 더 강력한 모델이 필요하지 않은 한 gpt-4o-mini를 기본 모델로 가정합니다.
당신의 제품에 가장 쉽고 가치가 높은 기능을 선택하세요. 대부분의 SaaS 앱의 경우, 그것은 인앱 채팅 어시스턴트 또는 콘텐츠 요약입니다. 여기서 시작하고, 작동 여부를 증명한 후, 확장하세요.
이 가이드의 나머지 부분은 첫 API 호출부터 프로덕션 배포까지 모든 단계를 설명합니다.
코드를 작성하기 전에: AI를 추가하면 안 되는 경우
여기 다른 사람들은 말해주지 않을 것이 있습니다: 정규식, SQL 쿼리, 또는 간단한 if 문으로 문제를 해결할 수 있다면 LLM을 사용하지 마세요. 모든 AI API 호출은 비용이 들고, 지연 시간을 추가하며, 비결정성을 도입합니다. 기존 앱에 AI를 통합하기 전에 "정규식 테스트"를 실행하세요.
정규식 테스트
AI가 실제로 가치를 더하는 경우
입력이 지저분하거나 구조화되지 않았거나 크게 변한다면, 그리고 출력이 자연스럽거나 문맥을 인식하거나 창의적이어야 한다면 LLM을 사용하세요. 데이터가 깨끗하고 규칙이 명확하다면 AI를 건너뛰고 예산을 절약하세요.
빠른 비용 현실 확인: $0.15/백만 입력 토큰인 gpt-4o-mini도 누적됩니다. 1,000명의 사용자가 하루에 10개 요청을 하고 각각 500개 토큰이면 = 월 500만 토큰 = 입력 비용 약 $0.75/월입니다. 싸지만 무료는 아닙니다. 그리고 실수로 이 요청들을 gpt-4o($2.50/백만 토큰)로 라우팅한다면, 이는 월 $12.50이 되고, 여전히 관리 가능하지만, 추가 지능이 필요하지 않은 작업에 비해 16배 비쌉니다.
모델과 공급자 선택하기
2026년 초 현재, 대부분의 SaaS LLM 통합 작업에서 고려할 가치가 있는 세 가지 주요 공급자가 있습니다.
가격은 2026년 6월 현재 OpenAI, Anthropic, Google AI에서 수집했습니다.
저렴하게 시작하고 필요할 때 업그레이드하세요
돈을 절약해주는 접근법은 이렇습니다: 모든 것에 gpt-4o-mini 또는 claude-haiku-4.5로 시작하세요. 1주일 동안 실행하고, 실제 사용자 피드백으로 품질을 측정하고, 저렴한 모델이 부족한 특정 작업에만 더 큰 모델로 업그레이드하세요. 대부분의 요약, 분류, 자동완성 기능은 미니 계층 모델에서도 완벽하게 작동합니다.
전체 AI 스택 구축에 대해 더 자세히 알아보려면 우리의 AI SaaS 스택 가이드를 확인하세요.
첫 AI 기능: API 통합
코드를 작성할 시간입니다. 여기 동일한 작업, 채팅 완성 호출이 Python과 TypeScript 모두에 있습니다. 당신의 백엔드가 사용하는 것을 선택하세요.
Python (OpenAI SDK)
TypeScript (OpenAI SDK)
이 코드가 앱에서 어디에 위치해야 하는가
프론트엔드에서 OpenAI를 호출하지 마세요. 절대로요. 이 코드는 다음에 위치해야 합니다:
- Next.js: API 라우트 (app/api/chat/route.ts)
- FastAPI: 엔드포인트 (@app.post("/api/chat"))
- Express: 핸들러 (router.post("/api/chat", ...))
프론트엔드는 백엔드로 요청을 보내고, 백엔드는 OpenAI를 호출한 후 결과를 반환합니다. 이는 OPENAI_API_KEY를 그것이 속한 서버에 유지합니다.
이제 작동하는 AI 기능을 갖고 있습니다. 하지만 느린 느낌이 듭니다. 사용자가 "전송"을 클릭하면 2-3초 동안 빈 화면을 봅니다. 스트리밍이 이를 해결합니다.
현실감 있게 만들기: AI 응답 스트리밍
2-3초의 피드백 없는 대기는 부서진 것처럼 느껴집니다. 스트리밍은 동일한 응답을 토큰이 도착할 때 표시함으로써 즉시 느껴지도록 만듭니다. ChatGPT에서 본 타이프라이터 효과입니다. 모든 프로덕션 AI 앱이 사용하며, 구현하기에는 놀랍도록 간단합니다.
서버 측 스트리밍 (Python + TypeScript)
FastAPI와 Server-Sent Events를 사용한 Python 접근법입니다:
그리고 Vercel AI SDK를 사용하는 Next.js의 TypeScript 동등물입니다. 이는 스트리밍 파이프라인을 처리해줍니다:
클라이언트 측: Vercel AI SDK 방식
React 측에서 useChat 훅은 모든 것을 처리합니다. 메시지 상태, 스트리밍, 에러 처리:
이는 약 40줄의 코드로 서버와 클라이언트 간의 완전히 작동하는 스트리밍 AI 채팅입니다. useChat 훅은 메시지 배열을 관리하고, 실시간으로 스트리밍된 토큰을 추가하며, 로딩 상태를 자동으로 처리합니다. EventSource나 ReadableStream을 직접 건드릴 필요가 없습니다. 스트리밍이 내부에서 어떻게 작동하는지에 대해 더 알아보려면, Vercel AI SDK 문서가 결정적인 참고자료입니다.
출력을 신뢰할 수 있게 만들기: 구조화된 출력과 함수 호출
원본 LLM 텍스트는 채팅에는 좋습니다. 코드가 파싱해야 하는 것에는 끔찍합니다. 데이터를 추출하거나 작업을 트리거하거나 구조화된 UI를 구축한다면, 구조화된 출력이 필요합니다.
구조화된 출력 (JSON 모드)
OpenAI의 response_format 매개변수는 모델이 스키마와 일치하는 유효한 JSON을 반환하도록 강제합니다. 더 이상 모델이 파싱 가능한 텍스트를 출력하길 바라지 마세요:
모델은 정확히 정의하는 필드를 반환하도록 제한됩니다. 파싱 에러 없음, 정규식 추출 없음, "때때로는 마크다운을 반환하고 때때로는 그렇지 않다"는 없음. 스키마, 모드, 엣지 케이스에 대한 완전한 참고자료는 우리의 LLM 구조화된 출력 가이드를 참조하세요.
앱 작업을 위한 함수 호출
함수 호출을 통해 LLM은 애플리케이션에서 작업을 트리거할 수 있습니다. 데이터베이스 레코드를 업데이트하고, 이메일을 보내거나, 외부 API를 호출합니다. 사용 가능한 도구를 정의하고, 모델이 언제 사용할지 결정합니다:
모델은 아무 것도 직접 실행하지 않습니다. 그것은 무엇을 호출할지와 어떤 인수로 할지 알려주며, 당신은 실제 함수를 안전한 백엔드에서 실행합니다. 이것이 채팅을 넘어서 실제로 작동하는 AI 기능을 구축하는 방법입니다. 다단계 도구 체인과 병렬 호출 같은 고급 패턴의 경우, 우리의 LLM 함수 호출 가이드를 참조하세요. Claude를 사용 중이라면 Anthropic은 비슷한 도구 사용 API를 가지고 있습니다.
지식 추가: 50줄로 RAG 만들기
당신의 LLM은 당신의 제품, 당신의 문서, 또는 당신의 사용자에 대해 알지 못합니다. RAG(검색 증강 생성)가 이를 해결합니다: 먼저 당신의 데이터를 검색한 다음, 관련 청크를 모델에 컨텍스트로 피드하세요. AI 기능을 회사별로 구체화하는 가장 일반적인 패턴입니다.
패턴: 검색, 그리고 질문
- 문서를 벡터로 임베드하기 (수집 시, 한 번)
- 벡터를 데이터베이스에 저장하기 (pgvector, Pinecone, Qdrant, Weaviate)
- 사용자가 질문할 때 가장 관련 있는 청크 검색하기
- LLM 프롬프트에 그 청크들을 컨텍스트로 주입하기
최소 RAG 구현
이것이 약 40줄에 담긴 전체 RAG 파이프라인입니다. 청킹 전략, 하이브리드 검색, 평가를 포함한 프로덕션 준비 설정의 경우, 우리의 RAG 애플리케이션 구축 가이드를 참조하세요. 프레임워크를 평가 중이라면, LangChain과 LlamaIndex는 모두 더 높은 수준의 추상화를 제공합니다.
프로덕션 패턴: 비용, 보안, 에러 처리
위의 모든 것이 개발에서는 훌륭하게 작동합니다. 프로덕션은 흥미로워집니다. 이 섹션은 AI 기능을 배포한 지 2주 후에 직면할 문제들과 잠을 (또는 돈을) 잃기 전에 이를 해결하는 방법을 다룹니다.
토큰 예산 계산: 당신의 AI 기능이 실제로 비용이 얼마나 드는가
추측하지 마세요. 공식은 이렇습니다: 사용자 수 × 일일 요청 수 × 평균 토큰 수 × 토큰당 비용 = 월간 비용.
성장 계층은 사람들이 놀라는 곳입니다. 5,000명의 사용자가 있다면, 모델 라우팅을 원할 것입니다: 쉬운 요청(요약, 분류)은 gpt-4o-mini로 보내고 복잡한 요청(다단계 추론, 코드 생성)만 gpt-4o로 라우팅하세요. 이는 비용을 60-70%까지 줄일 수 있습니다.
다른 비용 최적화 전술:
- 프롬프트 캐싱: OpenAI와 Anthropic 모두 반복되는 프롬프트 접두사에 대해 50-90%의 절약을 제공합니다
...