
2026년 최고의 오픈소스 LLM 평가 프레임워크 (하나는 실제로 오픈소스가 아님)
Arize Phoenix 저장소의 LICENSE 파일 첫 줄은 "Elastic License 2.0 (ELv2)"입니다. Apache도 아니고 MIT도 아닙니다. 광범위하게 권장되는 오픈소스 LLM 평가 프레임워크가 OSI 정의에 따르면 오픈소스가 아니며, 이 검색어로 상위 순위를 차지한 거의 모든 페이지가 이 주장을 반복하고 있습니다. 우리도 그랬는데, 오늘까지입니다. 2026-08-04에 8개 프레임워크의 LICENSE 파일과 기본 브랜치 커밋 로그를 직접 읽었고, 상위 페이지가 여전히 권장하는 3개를 추가로 확인한 뒤, 6개를 설치하고 동일한 10가지 사례를 각각 실행했습니다. 우리는 평가 프레임워크를 판매하지 않으므로 아래의 어떤 판단도 제품을 보호하기 위한 것이 아닙니다.
핵심 요점
- Arize Phoenix는 Elastic License 2.0에 따라 배포되며, OSI는 이를 오픈소스로 승인하지 않습니다.
- UpTrain의 마지막 커밋은 2024-07-29입니다. 새 프로젝트를 시작하지 마세요.
- pip install promptfoo는 서드파티 래퍼를 설치합니다. 실제 프로젝트는 npm에서 배포됩니다.
- Ragas는 2026-02-24 이후 커밋이 없으며 GitHub 조직을 vibrantlabsai로 이동했습니다.
2026년에 어떤 오픈소스 LLM 평가 프레임워크를 설치해야 할까요?
순위가 아닌 제약 조건에 따라 선택하세요. 기존 테스트 스위트 내에서 pytest 형태의 assertion을 원한다면 DeepEval을 설치하세요. YAML 설정과 모든 언어 스택에 맞는 CLI를 원한다면 promptfoo를 설치하세요. 측정한 가장 명확한 긍정/부정 분리를 원한다면 Opik을 설치하세요. 셋 다 Apache-2.0 또는 MIT입니다.
다음은 감시 결과입니다. 8개의 프레임워크가 범위에 포함되며, 이 검색어의 상위 순위 페이지가 여전히 권장하는 3개를 추가했습니다.
날짜는 2026-08-04 기준으로 각 프로젝트의 기본 브랜치에 대한 마지막 커밋입니다. GitHub의 저장소 페이지는 모든 브랜치에 대한 마지막 푸시를 보여주며, 이는 두 프로젝트의 경우 더 최신입니다: UpTrain 2024-08-18 및 Deepchecks 2025-12-28. 두 저장소 모두 아카이빙되지 않았습니다.
전환 비용(switch-cost) 열은 사람들이 건너뛰고 나중에 후회하는 부분입니다. 점수는 숫자일 뿐이므로 DeepEval, Ragas, Opik, phoenix-evals 간에 이동하는 것은 대부분 루프를 다시 작성하는 것입니다. promptfoo 또는 Inspect AI에서 벗어나는 것은 다른 곳에서 동등한 것이 없는 설정이나 작업 형식을 다시 작성하는 것을 의미하며, Evidently에서 벗어나는 것은 작성한 모든 임계값을 감시하는 것을 의미합니다. 왜냐하면 그 척도는 반대 방향으로 실행되기 때문입니다. 상위 순위 페이지가 여전히 권장하는 2개의 프레임워크는 2024 이후 릴리스를 배포하지 않았습니다.
순위, 호스팅 플랫폼 및 직접적인 순서를 원하세요? 그것은 다른 작업이며, 우리는 유료 플랫폼을 포함한 LLM 평가 도구의 순위 비교에서 이미 했습니다.
8가지 LLM 평가 프레임워크, 설치 방식에 따라 그룹화
설치 형태가 당신이 살아가야 할 것이므로, 그것이 그룹화의 기준입니다.
테스트에 임포트하는 Python 라이브러리
DeepEval(pip install deepeval, Apache-2.0)은 LLM 메트릭을 pytest 형태의 assertion으로 래핑합니다: LLMTestCase를 빌드하고 assert_test로 전달하면 테스트가 임계값 아래에서 실패합니다. 품질 게이트를 팀이 이미 실행하는 단위 테스트 옆에 놓기에 최적입니다. 평가가 다른 모든 것과 동일한 CI 작업에 속해야 한다면 이것을 선택하세요.
한 가지 공개 사항, 한 번만 명시합니다: DeepEval은 Confident AI에 의해 구축되었으며, 이는 이 사이트의 다른 두 게시물에서 유료 파트너입니다 (이 페이지가 링크하는 순위 비교 포함). 여기서는 특별한 대우를 받지 않으며, 이 페이지의 모든 DeepEval 링크는 GitHub 저장소를 가리킵니다.
Ragas(pip install ragas, Apache-2.0)는 RAG 특화 옵션입니다: evaluate()는 질문, 컨텍스트 및 답변 행을 가져가 메트릭별 점수를 비동기식으로 반환합니다. Python 파이프라인 내에서 검색 품질 측정에 최적입니다. 해당 저장소는 explodinggradients에서 vibrantlabsai로 이동했으며, 마지막 릴리스는 2026-01-13의 v0.4.3이고, 2026-02-24 이후 커밋이 없습니다. RAG 메트릭이 전체 작업이고 조용한 저장소가 수용 가능하다면 이것을 선택하고, 더 넓은 RAG 도구 스택을 참조하세요.
Opik(pip install opik, Apache-2.0, Comet에서)은 자체적으로 호출할 수 있는 메트릭을 배포합니다. OPIK_TRACK_DISABLE=true를 설정하면 AnswerRelevance().score()는 계정, 로컬 서버, 설정 파일 없이 실행되며, 이는 제품 프레이밍에서 광고하지 않습니다. 최소한의 줄 수로 실제 점수를 얻기에 최적입니다. 지금 메트릭을 원하고 나중에 플랫폼을 원한다면 이것을 선택하세요.
Evidently(pip install evidently, Apache-2.0)는 평가를 데이터 세트에 대한 설명자로 취급하고 HTML 보고서를 부작용으로 작성합니다. 이진 게이트보다는 많은 행에 걸쳐 일괄 보고에 최적입니다. 해당 LLM 점수는 반전됩니다: 1.0은 불충실을 의미합니다. 누군가에게 빌려준 것이 빨간 빌드가 아닌 공유 가능한 보고서라면 이것을 선택하세요.
Giskard(pip install giskard, Apache-2.0)는 작성한 데이터 세트에 대한 점수를 지정하는 대신 모델의 취약점을 스캔합니다. PyPI 패키지는 v2 라인을 해결하고, 프로젝트 자체 README는 v2가 "더 이상 적극적으로 유지되지 않는다"고 명시합니다. 자동화된 레드팀 스타일 스캔에 최적입니다. 직접 정의한 LLM 판사 메트릭보다는 당신을 위해 발견된 취약점을 원한다면 이것을 선택하세요.
YAML 파일에 대해 실행하는 CLI 및 설정 도구
promptfoo(npm install promptfoo, MIT)는 YAML 파일을 읽는 CLI입니다: 제공자, 테스트 사례 및 assertion을 선언하고, npx promptfoo eval을 실행한 뒤, 사례당 통과/실패 및 로컬 결과 UI를 얻습니다. 앱이 Python으로 작성되지 않았을 때 프롬프트를 평가하는 데 최적입니다. 품질 게이트가 Python이 아닌 팀원도 편집할 수 있는 설정 파일이어야 한다면 이것을 선택하세요.
하네스 클래스 및 플랫폼 번들
Inspect AI(pip install inspect-ai, MIT)는 UK AI Safety Institute에서 나왔으며 정의한 작업에 대해 모델을 평가하며, 실제 solver 및 scorer 추상화와 실행 뷰어를 제공합니다. 재현 가능한 작업 정의를 사용한 모델 수준의 벤치마킹에 최적입니다. 테스트 중인 것이 애플리케이션이 아닌 모델이라면 이것을 선택하세요.
Arize Phoenix(pip install arize-phoenix-evals)는 FaithfulnessEvaluator 및 CorrectnessEvaluator와 같은 사전 구축된 평가자를 제공하며, 이진 레이블과 점수를 반환합니다. 임계값을 선택하지 않고 게이트할 수 있는 결정적 레이블에 최적입니다. 해당 라이선스는 이 기사의 제목에 괄호가 있는 이유이며, 그것 자체로 섹션이 있습니다.
Arize Phoenix는 오픈소스인가요?
아니요, Open Source Initiative가 유지하는 정의에 따르면 그렇지 않습니다. Arize Phoenix는 Elastic License 2.0(ELv2) 하에 배포됩니다. 저장소의 LICENSE 파일의 첫 줄이 명시하고 있으며, PyPI는 v19.15.0의 license: Elastic-2.0을 독립적으로 선언합니다. 소스는 읽을 수 있고, 포크 가능하며, 자체 호스팅 가능합니다. 한 가지 사용 방식이 제한됩니다.
중요한 제한: ELv2는 소프트웨어를 제3자에게 호스팅되거나 관리되는 서비스로 제공하는 것을 금지합니다. 그것이 들리는 것보다 훨씬 적은 수의 사람에게 적용되기 때문에 주의 깊게 읽으세요. 자신의 애플리케이션에 점수를 매기기 위해 arize-phoenix-evals를 설치한다면 ELv2는 당신을 건드리지 않습니다. 외부 고객에게 판매하는 평가 서비스로 Phoenix를 패키징하는 컨설팅이나 플랫폼 팀이라면 그렇습니다. 그것이 전부이며, Open Source Definition이 ELv2가 실패하는 것입니다. 구체적으로 사용 분야 제한에 관한 조항입니다.
현재 이 검색어로 순위를 매기는 모든 페이지는 Phoenix를 "오픈소스"로 분류하고 있으며, 우리도 그랬습니다. 우리의 LLM 평가 도구 순위 비교는 Phoenix를 완전히 오픈소스라고 설명하고 있으며, 이는 잘못되었고 수정되고 있습니다. Phoenix는 소스 공개 상태이지 오픈소스가 아니며, 이 구분은 서비스로 판매할 계획이 있을 때만 중요합니다. 점수 지정이 아닌 추적이 실제로 필요하다면, 그것은 여기가 아닌 AI 옵저버빌리티 플랫폼에 속합니다.
이 중 어느 것이 여전히 적극적으로 유지되고 있나요?
대부분입니다. 확인한 11개 저장소 중 6개는 2026-08-03 또는 2026-08-04에 main에 커밋했습니다: DeepEval, promptfoo, Opik, Arize Phoenix, Inspect AI 및 Giskard. 2개는 2024 이후 릴리스를 배포하지 않았습니다. 1개는 GitHub 조직 변경 후 2026년에 조용해졌습니다.
2026년에 새 프로젝트를 시작하지 않을 프레임워크
...