RAG vs Fine-Tuning: 각각 언제 사용할까 (실제 수치 포함)

대부분의 RAG vs 파인튜닝 조언에는 두 방식을 같은 작업에서 측정한 실험이 빠져 있습니다. Balaguer et al.(arXiv:2401.08406, 인용 162회)은 농업 QA 데이터셋을 두 방식 모두에 통과시켰습니다. 파인튜닝은 정확도를 6포인트 이상 향상시켰고, RAG는 그 위에 5포인트를 더했습니다. 그들의 Table 18에 따르면 GPT-4는 원본 75%, 파인튜닝 81%, 파인튜닝+검색 86%입니다. 그렇다면 왜 대부분의 팀에게 RAG부터 시작하라고 할까요? 정보의 최신성, 인용 출처, 아래의 비용 계산이 1포인트 정확도 차이보다 더 많은 프로젝트를 결정하기 때문입니다.

핵심 요점

  • RAG는 지식이 자주 변경되거나 답변이 출처를 명시해야 할 때의 기본 선택지입니다. 파인튜닝은 일관된 형식과 낮은 레이턴시가 필요할 때 효과적입니다.
  • 파인튜닝 비용은 선행 투자(학습)로, RAG 비용은 쿼리당(임베딩과 추가 입력 토큰) 발생합니다.
  • 발표된 동일 작업 증거: 파인튜닝 6포인트 향상, RAG 5포인트 추가, 하이브리드는 둘 다 능가했습니다.
  • 코드를 작성하기 전에 5가지 확인사항(데이터 신선도, 레이블 예제, 레이턴시, 인용, 팀 역량)을 체크하세요.

언제 RAG vs 파인튜닝을 사용할까? (빠른 결정)

지식이 자주 변경되거나 답변에 인용이 필요하면 RAG를 선택하세요. 일관된 출력 형식과 낮은 레이턴시가 필요하고 수백 개의 레이블 예제를 보유하고 있다면 파인튜닝을 선택하세요. 배포가 성숙해지면 둘 다 사용하세요. RAG는 모델이 읽는 컨텍스트를 수정하고, 파인튜닝은 모델 자체를 수정합니다. 대부분의 팀은 첫 번째가 필요하지, 두 번째는 아닙니다.

기억할 한 줄: RAG는 모델이 읽는 것을 바꾸고, 파인튜닝은 모델 자체를 바꿉니다. 작업에 정말로 필요한 것을 기준으로 선택하세요.

NVIDIA의 RAG 용어집은 교과서 버전을 원할 경우 검색 측면을 명확하게 정의합니다. 다만 정의만으로는 아키텍처를 결정할 수 없습니다. 증거가 중요하므로 여기서 시작하세요.

증거는 무엇을 보여주는가? 한 작업, 두 가지 접근, 측정된 결과

이 검색어 상위 5위에 있는 동일 작업 측정 비교의 유일한 순위는 Balaguer et al. 2024입니다. Microsoft Research 연구로 162회 인용되었습니다. 팀은 한 가지 농업 QA 작업을 RAG 파이프라인, 파인튜닝된 모델, 둘의 하이브리드를 통과시킨 후 GPT-4로 답변을 평가했습니다. 그들의 설정에서 파인튜닝 단독은 RAG 단독보다 약간 나았고, 둘을 합치면 어느 하나보다 훨씬 더 좋은 결과를 얻었습니다.

농업 사례 연구 (arXiv:2401.08406)

2024년 1월에 제출된 이 연구는 Angels Balaguer와 15명의 공동 저자들이 농민들에게 위치별 인사이트를 제공하는 데 무엇이 필요한지 묻습니다. 그들의 파이프라인은 PDF에서 정보를 추출하고, 그로부터 질문-답변 쌍을 생성하며, 검색 유무에 관계없이 Llama2-13B, GPT-3.5, GPT-4를 평가합니다.

Balaguer et al.은 파인튜닝에서 6포인트 이상의 정확도 향상을 보고했으며, 이는 RAG에 누적되어 그 위에 5포인트를 더했습니다. 하이브리드 파이프라인은 어느 접근도 능가했습니다. 그들의 Table 18은 GPT-4의 순서를 보여줍니다: 지원 없음 75%, RAG 사용 80%, 파인튜닝 81%, 파인튜닝+RAG 86%. 80%과 81%이 얼마나 가까운지 주목하세요. RAG 단독과 파인튜닝 단독 간의 격차는 1포인트인 반면, 하이브리드는 둘 다보다 5포인트 높습니다. 한 실험에서 파인튜닝된 모델은 다른 지리 영역의 지식을 활용하여 지역별 질문에 답변했고, 답변 유사도를 47%에서 72%로 높였습니다.

경제학 증거

Snorkel AI의 발표 연구(2022년 11월)는 비용 측면을 다룹니다. 100가지 법적 분류 벤치마크(LEDGAR, 80,000개 계약 조항)에서 파인튜닝된 RoBERTa 모델은 파인튜닝된 GPT-3와 일치하면서 1,400배 더 작고, 지표의 1% 미만을 사용하며, 파인튜닝된 GPT-3 모델의 프로덕션 추론 비용의 0.1%, 대략 1,000분의 1에서 실행되었습니다. 총 구축 비용: 프로그래밍 방식 레이블링으로 $1,915 vs 수동 주석 및 GPT-3 파인튜닝으로 $7,418. 한 가지 주의사항: 이는 분류이지 생성 QA가 아니므로 비율을 방향성으로 취급하세요.

우리의 해석

우리의 해석: 그들의 설정은 파인튜닝이 얻을 수 있는 가장 유리한 경우이며, 그럼에도 1포인트로만 이겼습니다. Balaguer et al.은 고정된 PDF 코퍼스에서 학습했고 같은 동결된 코퍼스에 대해 평가했으므로, 가중치가 학습한 것 중 실험 중간에 낡아질 가능성은 없었습니다. 대부분의 프로덕션 지식 베이스는 그렇게 정적이지 않습니다. 지난주 릴리스에 대한 질문에 답하는 지원 봇은 재학습 주기마다 6포인트를 다시 획득하는 반면, RAG에 공급하는 인덱스는 같은 날 오후에 업데이트됩니다. 그래서 우리는 1포인트 정확도 이점을 이 결정에 대한 가장 약한 입력으로, 신선도를 가장 강한 것으로 읽습니다. 증거가 일반화되지 않는 곳: Snorkel의 결과는 분류 벤치마크이며, 어느 연구도 톤이나 형식 제어를 테스트하지 않았습니다. 톤이나 형식 제어는 파인튜닝의 가장 강한 경우로 남아 있습니다.

파인튜닝은 팀들이 생각하는 것보다 훨씬 덜 자주 올바른 답입니다. 대부분의 "파인튜닝" 프로젝트는 실제로 "검색"을 의미합니다.

RAG는 어떻게 작동하며, 언제 성공할까요?

RAG(검색 증강 생성)는 모델이 학습 중에 암기한 내용이 아니라 제어하는 문서에서 답변합니다. Lewis et al.이 2020년에 처음 제안한 이후, 지식이 모델 외부에 있기 때문에 지식 작업의 기본값이 되었습니다: 인덱스를 업데이트하면 재학습 없이 내일 모든 답변이 변경됩니다.

파이프라인은 4단계입니다:

  • 수집. 문서(PDF, 위키, 티켓)를 코퍼스로 파싱합니다.
  • 청킹 및 임베딩. 몇 백 토큰 크기의 청크로 분할하고 각 청크를 임베딩 모델로 벡터로 변환합니다.
  • 검색. 쿼리 시간에 가장 유사한 상위-K 청크를 찾고, SKU와 오류 코드 같은 정확한 문자열에 대한 키워드 일치를 더합니다.
  • 증강 및 생성. 그 청크들을 프롬프트에 넣고 LLM이 출처를 첨부하여 답변하도록 합니다.

RAG는 세 가지 측면에서 승리합니다: 신선도(재학습 대신 재인덱싱), 인용(모든 답변이 출처하는 청크를 가리킴), 데이터 제어(고객 데이터가 학습 실행에 절대 들어가지 않음). 전체 구축 과정을 원한다면 RAG 애플리케이션을 단계별로 구축하는 방법을 참조하세요.

검색 품질에 대한 한 가지 경고: 파이프라인은 임베딩과 검색 조합만큼만 좋습니다. Anthropic의 Contextual Retrieval은 순수 설정에서 5.7%의 상위-20 검색 실패율을 측정했고, 문맥 임베딩과 BM25로 2.9%로 떨어졌으며, 재랭커가 추가되면 1.9%로 떨어졌습니다. 정확 일치 쿼리가 계속 실패하면 하이브리드 검색(BM25 vs 벡터)이 해결책입니다.

파인튜닝이 언제 승리하는가? (PEFT란?)

파인튜닝은 문제가 모델이 무엇을 알고 있는지가 아니라 어떻게 답변하는지일 때 승리합니다: 일관된 출력 형식, 브랜드 톤, 또는 검색 왕복이 없는 엄격한 레이턴시 예산입니다. 또한 소형 모델 경제를 위한 레버입니다. 위의 Snorkel의 GPT-3 수준의 0.1% 비용 결과는 누군가 큰 모델을 제공하는 대신 작은 모델을 파인튜닝했기 때문에만 존재합니다.

완전 파인튜닝 vs PEFT (LoRA / QLoRA)

완전 파인튜닝은 모델의 모든 가중치를 업데이트합니다. 비싸고 느리며 대규모 연구소 외에는 드뭅니다. 거의 모든 사람이 대신 PEFT(매개변수 효율적 파인튜닝)를 배포합니다. LoRA(Hu et al. 2021)는 기본 가중치를 고정하고 일반적으로 매개변수 개수의 0.1-1%인 작은 저계수 어댑터를 학습합니다. QLoRA는 그 위에 4비트 양자화를 더해 13B 모델이 하나의 소비자 GPU에 맞습니다. 알아두면 좋은 관련 용어: 연속 사전학습. 모델이 지도되지 않은 도메인 코퍼스에서 계속 사전학습한 후 레이블 예제에서 지도 파인튜닝됩니다.

Hugging Face PEFT 문서에 따른 최소 LoRA 구성:

데이터셋 준비, 에포크 수, 평가를 위해서는 단계별 파인튜닝 가이드를 참조하세요.

위험은 실제입니다: 작은 데이터셋에서의 과적합(수백 개 예제가 학습하는 대신 암기할 수 있음), 낡음(가중치는 학습 시점의 지식을 고정함), 출처 귀속 불가(파인튜닝된 모델은 증거를 보여줄 수 없음). 이 세 가지 중 하나라도 결정적인 문제라면, 당신은 자신을 다시 RAG로 돌려놨습니다.

RAG vs 파인튜닝 vs 프롬프트 엔지니어링: 다른 것들은 어디에 맞는가?

...

출처 바로가기