LLM 평가는 "괜찮아 보인다"와 "이게 작동한다는 것을 증명할 수 있다" 사이의 차이입니다. 체계적인 평가 없이 LLM 기반 기능을 사용자에게 배포하고 있다면, 본질적으로 테스트되지 않은 코드를 배포하고 있는 것입니다. 다만 스택 트레이스 대신 환각(hallucination), 독성(toxicity), 그리고 침묵의 오류가 실패 모드가 됩니다.

이 가이드는 메트릭, 방법, 프레임워크, 파이프라인 설계, 그리고 EU AI Act 준수까지 모든 것을 다룹니다. 벤더 편향도 없고, 불필요한 내용도 없습니다.

한눈에 보기

세부 사항에 들어가기 전에, 한 표로 전체 그림을 보여드리겠습니다.

이제 각 부분을 하나씩 자세히 살펴보겠습니다.

LLM 평가란 무엇인가 (그리고 2026년에 왜 중요한가?)

LLM 평가는 정의된 기준(정확성, 관련성, 안전성, 원본 데이터에 대한 충실성)에 따라 대규모 언어 모델 출력의 품질을 측정하고 점수를 매기는 체계적인 프로세스입니다. LLM 기반 애플리케이션이 프로덕션에서 신뢰할 수 있는 결과를 제공하도록 하기 위해 자동화된 메트릭, LLM-as-a-judge 점수 매기기, 그리고 인간 검토를 포함합니다.

왜 지금 이게 중요할까요? 두 가지 이유가 있습니다. 첫째, LLM은 프로토타입에서 실제 사용자가 의존하는 프로덕션 기능으로 변화했습니다. 회사 정책을 환각하는 챗봇이나 존재하지 않는 문서를 인용하는 RAG 시스템은 더 이상 재미있는 데모 버그가 아니라 지원 티켓, 법적 위험, 또는 손실된 고객입니다.

둘째, EU AI Act 시행이 2026년 8월에 시작됩니다. AI 시스템이 EU 사용자에게 서비스를 제공한다면, "몇 가지 프롬프트를 테스트했고 괜찮아 보였습니다"라는 Slack 메시지가 아닌 문서화된 평가 관행이 필요합니다.

대부분의 팀은 여전히 "감각 기반 평가"라고 할 수 있는 것을 하고 있습니다. 플레이그라운드에서 몇 가지 출력을 임의로 확인하고 충분히 좋아 보인다고 결정하는 것입니다. LLM이 실험 단계였을 때는 작동했습니다. 하지만 기능이 되면 작동하지 않습니다.

평가는 세 가지 질문에 답합니다: 출력이 정확한가? 안전한가? 유용한가? 이 가이드의 나머지 부분에서는 이 세 가지 질문에 체계적으로 어떻게 답할 수 있는지 보여드립니다.

한 가지 중요한 구분이 있습니다: 이 가이드는 애플리케이션 평가(LLM 기반 제품이 실제 작업에서 어떻게 수행되는지 테스트)를 다룹니다. 이는 모델 평가(MMLU 같은 사전 학습 벤치마크)와 다릅니다. 모델 평가는 기반 모델이 일반적으로 어떻게 수행되는지는 알려주지만, 특정 애플리케이션에서 어떻게 작동할지에 대해서는 거의 알려주지 않습니다.

결론: LLM 기능을 체계적인 평가 없이 배포하고 있다면 맹목적으로 진행하고 있는 것입니다. 문제는 평가를 할지 말지가 아니라 어떻게 평가할지입니다.

LLM 평가 메트릭: 무엇을 측정할 것인가, 언제 측정할 것인가

추적하는 메트릭은 전적으로 무엇을 구축하고 있는지에 따라 결정됩니다. 챗봇은 코드 생성기와 다른 평가가 필요합니다. 여기 알파벳순이 아니라 사용 사례별로 정리한 실용적인 분류법이 있습니다.

텍스트 유사성 메트릭 (참조 답변이 있을 때)

이 고전적인 메트릭들은 생성된 텍스트를 알려진 올바른 참조와 비교합니다:

  • BLEU는 n-그램 정확도, 즉 출력에서 참조와 일치하는 단어 시퀀스의 개수를 측정합니다. 원래 기계 번역을 위해 설계되었습니다.
  • ROUGE는 재현율, 즉 출력에 참조 콘텐츠의 얼마나 많은 부분이 나타나는지 측정합니다. 요약 작업에서 일반적입니다.
  • BERTScore는 문맥 임베딩을 사용하여 의미론적 유사성을 측정하며, BLEU와 ROUGE가 놓치는 의역을 포착합니다.

함정은? 이들은 비교할 정답이 있을 때만 작동합니다. 개방형 생성의 경우 BLEU를 건너뛰세요. BLEU는 창의적인 재표현에 페널티를 주는데, 이는 좋은 챗봇에서 원하는 것입니다.

의미론적 평가 메트릭 (정확한 일치가 아닌 의미가 필요할 때)

개방형 생성의 경우 의미를 평가하는 메트릭이 필요합니다:

  • Answer relevancy는 응답이 실제로 사용자의 질문을 다루는지 점수를 매깁니다.
  • Coherence는 출력이 논리적으로 얼마나 잘 흐르는지 측정합니다.
  • Conciseness는 불필요하게 장황한 응답을 표시합니다.
  • G-Eval은 유연한 옵션입니다: 자연언어로 사용자 정의 평가 기준을 정의하고, LLM 판사가 체인-오브-싱크 추론을 사용하여 출력을 점수를 매깁니다. 이것은 2026년에 대부분의 팀이 시간을 소비하는 곳입니다.

RAG 특화 메트릭

검색 증강 생성을 구축하고 있다면, 검색기와 생성기 두 가지 컴포넌트를 평가하고 있습니다. Ragas 프레임워크는 네 가지 핵심 메트릭을 정의합니다:

  • Faithfulness - 답변이 검색된 컨텍스트에 기반하고 있나요? 이것이 환각을 포착합니다.
  • Context relevancy - 검색기가 올바른 문서를 가져왔나요?
  • Context recall - 검색기가 모든 관련 문서를 찾았나요?
  • Answer relevancy - 응답이 실제로 쿼리를 다루나요?

안전 및 규정 준수 메트릭

이 메트릭들은 사용자와 회사를 보호합니다:

  • Hallucination rate - 알려진 출처에 대한 사실적 정확성
  • Toxicity detection - 해로운, 모욕적인 또는 부적절한 콘텐츠
  • Bias measurement - 인구 통계학적 그룹 간 차별적 대우
  • PII leakage detection - 개인 데이터가 출력에 나타남

어느 애플리케이션에 어느 메트릭을 사용할 것인가?

이것은 어떤 벤더 가이드도 제공하지 않는 표입니다. 모든 메트릭을 알파벳순으로 나열하는 대신, 애플리케이션 유형을 실제로 중요한 메트릭과 일치시키세요:

결론: 모든 것을 측정하지 마세요. 당신의 애플리케이션 유형과 일치하는 3-5개의 메트릭을 선택하고 거기에 초점을 맞추세요.

실제로 평가는 어떻게 진행하나? (세 가지 방법)

LLM 출력을 평가하는 세 가지 방법이 있습니다. 대부분의 프로덕션 팀은 세 가지를 모두 사용하지만, 비율은 매우 다릅니다.

자동화된 메트릭 (빠름, 저렴, 제한적)

BLEU, ROUGE, 정확 일치 또는 정규식 패턴과 같은 메트릭을 사용한 스크립트 기반 점수 매기기입니다. 테스트를 작성하면, 밀리초 단위로 실행되고, 통과/실패 결과를 얻습니다.

장점: 빠르고, 재현 가능하며, 본질적으로 무료입니다. 단점: 이 메트릭들은 미묘한 차이, 창의성, 또는 실제 유용성을 판단할 수 없습니다. 응답은 ROUGE에서 완벽한 점수를 받을 수 있지만 여전히 사용자에게 무용지물일 수 있습니다.

회귀 테스트, CI/CD 게이트, 그리고 깊이보다 속도가 필요한 대용량 선별에 자동화된 메트릭을 사용하세요.

LLM-as-a-Judge (2026 기본값)

이것이 업계가 도달한 곳입니다. 일반적으로 GPT-4o 또는 Claude와 같은 별도의 LLM을 사용하여 당신의 기준에 따라 출력을 점수를 매깁니다. G-Eval 패턴은 이렇게 작동합니다: 자연언어로 평가 기준을 정의하고, 판사에게 기준과 테스트 케이스를 제공하면, 체인-오브-싱크 추론과 점수를 생성합니다.

Zheng et al.의 연구는 인간 점수와의 약 81% 상관관계를 보여주며, 이는 실패 모드를 이해할 때 일상적인 평가에 충분합니다(다음 섹션에서 자세히 다루겠습니다).

개방형 생성, 주관적 품질 평가, 그리고 단순한 메트릭으로 포착할 수 없는 사용자 정의 기준에 LLM-as-a-judge를 사용하세요.

인간 평가 (금본위, 확장성 없음)

전문가 검토자들은 루브릭, Likert 척도, 또는 A/B 맹검 테스트를 사용하여 출력을 점수를 매깁니다. 인간이 응답을 읽고 "이것은 실제로 유용하다" 또는 "이것은 사용자를 혼동시킬 것이다"라고 말하는 것만큼 좋은 것은 없습니다.

문제: 평가당 $5-50이 드는, 밀리초 대신 분이 걸리고, 모든 요청에 대해 실행할 수 없습니다. LLM-as-judge 보정, 규정 준수 감사, 그리고 엣지 케이스 검증에 인간 평가를 사용하세요.

방법 선택

결론: 평가의 80%에 LLM-as-a-judge를 사용하고, CI/CD 게이트에 자동화된 메트릭을 사용하며, 보정 및 규정 준수에 인간 검토를 사용하세요. 이것이 2026 플레이북입니다.

LLM-as-a-Judge: 어떻게 작동하는가, 어디서 실패하는가

LLM-as-a-judge는 타당한 이유로 기본 평가 방법이 되었습니다. 유연하고, 상대적으로 저렴하며, 인간의 판단과 잘 상관관계가 있습니다. 하지만 벤더 가이드가 편리하게 건너뛰는 실제 맹점이 있습니다.

G-Eval 어떻게 작동하는가

패턴은 간단합니다. 자연언어로 "좋다"가 어떻게 보이는지 정의하고, 판사 LLM이 평가 중인 출력과 함께 당신의 기준을 읽고, 단계별로 이를 추론하며, 점수를 생성합니다.

다음은 DeepEval의 G-Eval 구현을 사용한 실용적인 예입니다:

정확성, 유용성, 전문성, 브랜드 음성 준수 등 모든 기준을 정의할 수 있으며, 판사 LLM이 이에 따라 점수를 매깁니다.

알려진 편향 (벤더 가이드가 알려주지 않을 것)

...

출처 바로가기