Langfuse vs LangSmith vs MLflow: 둘은 옵저버빌리티 도구, 하나는 ML 플랫폼 (2026)

이 세 도구 중 오직 두 개만 LLM 모니터링을 위해 만들어졌습니다. MLflow는 2018년 Databricks에서 scikit-learn과 XGBoost용 실험 추적으로 출시되었으며, GenAI 추적은 그 기반 위에 몇 년 후에 추가되었습니다. Langfuse는 MIT 라이선스이고 LLM 네이티브이며, LangSmith는 독점적이고 LangChain 네이티브이고, MLflow는 Apache-2.0이며 둘보다 오래되었습니다. 계보(lineage)가 이를 결정하지, 기능 체크리스트는 아닙니다. 결론: 데이터를 소유하려면 Langfuse, LangGraph 상점이라면 LangSmith, 고전 모델이 플랫폼을 공유한다면 MLflow입니다.

주요 요점

  • 자체 호스팅 가능하고 추적 데이터를 완전히 소유할 수 있는 MIT 코어를 원한다면 Langfuse. 단, 그 ee/ 폴더는 별도의 상용 약관을 따르므로 GitHub는 저장소를 MIT이 아닌 NOASSERTION으로 표시합니다.
  • 앱이 LangChain이나 LangGraph 기반이고 가장 긴밀한 통합을 위해 좌석당 비용을 지불할 준비가 되었다면 LangSmith.
  • 고전 ML 모델도 배포하고 실험, 모델 레지스트리, 추적을 한 곳에서 관리하고 싶다면 MLflow.
  • 세 도구 모두 이제 OpenTelemetry를 지원하므로 이 중 두 개를 동시에 실행하는 것도 실제 선택지입니다.

Langfuse vs LangSmith vs MLflow 한눈에 보기

Langfuse는 오픈소스 선택지이고, LangSmith는 LangChain 네이티브 선택지이며, MLflow는 팀이 LLM 기능과 함께 고전 ML도 배포할 때의 선택지입니다. 이 중 두 개는 LLM 옵저버빌리티 도구입니다. 세 번째는 LLM 추적을 배우게 된 ML 플랫폼이며, 이 차이가 대부분의 평가를 결정합니다.

처음 여기 오셨나요? 먼저 AI 옵저버빌리티 입문서를 읽어보세요.

보존 기간 수치는 벤더로부터 얻었습니다: Langfuse의 가격 책정 페이지에 따른 30일/90일/3년 티어, LangChain의 가격 책정에 따른 LangSmith의 14일 기본 및 400일 확장 추적(확장은 보존 토글이 아닌 추가 요금이 부과되는 별도 추적 유형), MLflow는 스토리지가 유지되는 한 데이터를 보관합니다.

세 가지 선택지:

  • Langfuse는 MIT 라이선스 코드, 첫날부터 자체 호스팅 가능, 자신의 Postgres 및 ClickHouse에 추적 데이터를 보유하고 싶다면 선택하세요.
  • 스택이 LangChain이나 LangGraph이고 좌석당 가격 책정이 추적당 가격 책정보다 나으면 LangSmith를 선택하세요.
  • sklearn 및 XGBoost 모델이 LLM 기능과 함께 실행되면 MLflow를 선택하세요. 두 도구 비교에 대해서는 Langfuse vs LangSmith 전체 비교를 참고하세요.

LLM 네이티브 도구가 필요할까요 아니면 ML 플랫폼이 필요할까요?

이 질문의 langfuse vs mlflow 부분은 실제로는 계보 질문입니다. MLflow는 고전 ML의 실험 추적 및 모델 레지스트리로 시작한 후 LLM 추적을 추가했습니다. Langfuse는 LLM 추적으로 시작했으며 다른 것은 추가하지 않았습니다. 고전 모델을 배포하지 않는다면 MLflow의 수명 주기 기계는 아무것도 유지하지 않으면서 차지하는 표면적이며, 전용 AI 옵저버빌리티 도구가 더 짧은 경로입니다.

MLflow는 세 가지 중 가장 오래된 도구입니다: Apache-2.0 라이선스, Linux Foundation 관리, 2026년 8월 5일 기준 GitHub 스타 27,000개 이상, "어떤 하이퍼파라미터가 어떤 아티팩트를 생성했는가?"에 답하기 위해 구축되었습니다. GenAI 추적은 그 기반 위에 추가되었습니다. XGBoost 이탈 모델과 GPT-4o 지원 에이전트를 모두 배포하는 팀의 경우, 이것은 하나의 기록 시스템을 제공합니다: 동일한 데이터베이스에서 실험, 레지스트리 항목, LLM 추적.

반대 입장: 고전 모델을 배포하지 않으면 이 중 어느 것도 도움이 되지 않습니다. MLflow의 LLM 네이티브 UX는 Langfuse보다 더 최신이고, 지름길이 적으며, 추적 보기가 더 거칩니다.

한 가지 명확히 하자면, 자동완성이 kubeflow vs mlflow vs airflow를 검색하도록 표시하기 때문입니다: MLflow는 워크플로 오케스트레이터가 아닙니다. DAG를 스케줄링하지 않습니다. 실행이 수행한 작업을 기록합니다. Airflow와 Kubeflow는 작업을 실행하고 MLflow는 출력을 추적합니다. 계층 질문(mlflow vs tensorflow)에서: TensorFlow는 모델링 프레임워크이고 MLflow는 학습에 사용하는 모든 프레임워크 위에 앉아 있습니다. 이것은 유일한 비벤더 편집 결과이며 같은 분할을 만듭니다.

팀이 Jupyter 노트북을 열지 않는다면 MLflow의 가장 큰 장점은 쓸모없는 가중치입니다. 이 하나의 테스트가 이 페이지의 대부분 독자들을 제외합니다.

첫 추적에 실제로 얼마나 많은 코드가 필요할까요?

파이썬 약 두 줄, 모든 도구에서 동일하지만 마찰은 다른 곳에 있습니다. Langfuse와 LangSmith는 첫 추적이 진행되기 전에 계정 키를 요청합니다; MLflow는 실행 중인 추적 서버를 요청합니다. 코드 줄 수가 가장 적다고 해서 작업량이 가장 적은 것은 아닙니다.

동일한 작업(하나의 OpenAI 채팅 호출과 하나의 헬퍼)을 가져가서 각 벤더의 빠른 시작에서 세 가지 방식으로 계측하고 2026년 8월 5일에 다시 읽었습니다.

Langfuse, @observe 데코레이터를 통해:

LangSmith, @traceable를 통해:

MLflow, mlflow.openai.autolog()를 통해:

이 세 빠른 시작에서 파생한 개수:

각 벤더의 빠른 시작에서 계산, 2026년 8월 5일 재읽기: Langfuse SDK 문서, LangSmith 옵저버빌리티 빠른 시작, MLflow 추적 빠른 시작. openai는 앱 자체의 종속성이므로 계산되지 않습니다. 직접 다시 세어보세요.

우리의 해석, 명확히 표시됨: 코드는 세 개 모두에서 거의 동일하므로 결정이 여기에 있지 않습니다. Langfuse와 LangSmith는 마찰을 5분의 계정 생성으로 앞당깁니다. MLflow는 인프라로 앞당깁니다: 그 한 줄은 추적 서버, 그 뒤의 데이터베이스, 둘을 유지할 누군가를 가정합니다. MLflow가 완전한 패키지의 약 95% 작다고 말하는 슬림한 mlflow-tracing SDK는 설치를 정리하지만 서버는 정리하지 않습니다.

LLM-as-a-Judge: 동일한 방법, 세 가지 다른 위치

세 도구 모두 데이터셋에 대해 LLM-as-a-judge 평가자를 실행하지만, LangSmith의 평가 엔진이 가장 제품화되었고, Langfuse는 관리형 판사와 주석 큐, CI 게이팅을 위한 GitHub Action을 결합하며, MLflow는 판사를 실험 및 프롬프트 최적화 도구에 연결합니다. 방법론은 동일합니다; 차이는 결과가 있는 곳입니다.

MLflow의 평가 문서에 따르면, 판사는 고전 ML 메트릭과 같은 실험 추적 시스템 내에서 실행되며, 이는 위의 계보 논증의 보상입니다: 이탈 모델과 지원 에이전트를 위한 하나의 대시보드. Langfuse의 문서에 따르면, 평가자는 추적에 첨부되고 팀이 UI에서 작업하는 주석 큐에 공급됩니다.

방법에 대해서는 LLM 출력을 올바르게 평가하는 방법을 읽어보세요; 광범위한 풍경에 대해서는 우리가 평가한 평가 도구를 보세요. 에이전트 파이프라인은 출력 점수 이상의 관리가 필요하며, 라이브 에이전트 평가에서 다룹니다.

프롬프트 관리: 모델과 함께 프롬프트를 버전 관리하는 것은 하나뿐입니다

의도적으로 짧게 유지하고 있습니다, 두 도구 세부 정보는 자매 게시물에 속하기 때문입니다. 각각의 형태: Langfuse는 버전 관리, 레이블, 놀이터를 갖춘 프롬프트 관리를 제공합니다; LangSmith는 커밋 스타일 버전 관리를 갖춘 프롬프트 허브를 제공합니다; MLflow는 모델 옆의 첫 등급 엔터티로 프롬프트를 저장하는 프롬프트 레지스트리를 제공합니다.

결정 관련 한 가지 차이점: MLflow는 모델 레지스트리 항목과 함께 프롬프트를 버전 관리하므로, 프롬프트와 그것이 조정된 모델이 하나의 기록 시스템을 공유합니다. Langfuse와 LangSmith는 프롬프트를 모델을 제공하는 것과 분리하여 유지합니다. 모델과 프롬프트를 함께 승격하고 어떤 쌍이 배포되었는지 증명하는 감사 추적을 원한다면, 이 결합이 놀이터보다 낫습니다. 두 도구 세부 정보에 대해서는 Langfuse vs LangSmith 전체 비교를 참고하세요.

자체 호스팅, 데이터 소유권, 떠나는 데 드는 비용

Langfuse는 완전히 제어하는 다중 서비스 스택으로 자체 호스팅되고, MLflow는 추적 서버와 직접 SQL 쿼리할 수 있는 데이터베이스로 자체 호스팅되며, LangSmith는 엔터프라이즈 약관으로만 자체 호스팅됩니다. 출구 질문이 입장 질문보다 더 중요합니다: 어떤 도구를 선택하든 추적 기록은 다시 만들 수 없는 부분입니다.

...

출처 바로가기