
마지막 업데이트: 2026년 7월 19일. 이 가이드의 모든 벤치마크 점수, VRAM 수치, 라이선스는 이번 업데이트에서 다시 검증했으며, 순위가 크게 변동했습니다. 여기 포함된 8개 모델 중 5개는 3월 이후 새로 추가되었으며, Llama 4 Scout, Phi-4, Mistral Large 3만 변함없이 유지되었습니다. 새로운 릴리스가 순위를 변경하면 이 페이지는 한 달 내에 업데이트됩니다.
2026년 7월 최고의 오픈소스 LLM은 GLM-5.2이며, 이는 관찰자 입장에서의 리더보드 판단이 아닙니다. 우리는 이 업데이트를 작성하기 전에 3주간 프로덕션 코딩 모델로 직접 운영했습니다. Z.ai의 7,440억 파라미터 MoE는 GPQA Diamond에서 91.2%, SWE-bench Pro에서 62.1%를 기록하면서도 프론티어 API 가격의 극히 일부만 듭니다. Moonshot의 2.8조 파라미터 Kimi K3는 7월 16일 릴리스되었으며, 이미 Artificial Analysis의 독립적 순위에서 Claude Opus 4.8을 앞지르고 있고, 가중치는 7월 27일에 공개됩니다. DeepSeek V4는 여전히 가격에서 우위이며, Qwen3.6은 라이선스 자유도에서 우위를 차지하고 있고, Gemma 4 12B는 작년 27B 플래그십을 메모리 사용량의 절반 이하로 능가합니다.
주요 오픈소스 LLM: 벤치마크 스냅샷
아래 표는 현재 공개 벤치마크에서 평가한 5개의 광범위하게 배포된 오픈소스 모델을 다룹니다. GPQA Diamond는 대학원 수준의 과학 추론을 측정하며, MMLU가 프론티어에서 대부분 포화되면서 2026년 리더보드가 가장 많이 의존하는 벤치마크입니다.
Google은 Gemma 4에 대해 GPQA Diamond 대신 MMLU Pro를 보고합니다(77.2%). 이는 파라미터가 절반 이상 적음에도 불구하고 작년의 Gemma 3 27B(67.6%)를 능가합니다. 우리는 이 표를 매월 재검증하며, 이번 검증은 2026년 7월 19일에 수행되었습니다.
오픈소스 모델은 더 이상 폐쇄형 프론티어 시스템과만 경쟁하지 않습니다. 에이전트형 코딩과 추론에서는 일부가 명백히 우위를 차지하고 있습니다. Kimi K3의 독립적 Artificial Analysis 순위는 이제 Claude Opus 4.8보다 앞서 있으며, 이는 가중치가 공개되기 전입니다.
이 순위는 과장을 걸러냅니다. 여기 포함된 모든 모델은 실제로 중요한 벤치마크, 실제로 필요한 하드웨어, 각 모델이 가장 밝게 빛나는 특정 사용 사례에 따라 평가됩니다.
빠른 요약: 어떤 오픈소스 LLM을 선택해야 하나?
가장 강력한 전반적 모델이 필요하신가요? GLM-5.2, 우리는 3주간 프로덕션에서 운영했습니다. 폐쇄형 프론티어 추론을 추구하고 1주일을 기다릴 수 있으신가요? Kimi K3, 가중치가 7월 27일에 공개되면 됩니다. 대규모 토큰당 가장 저렴한 가격을 원하신가요? DeepSeek V4 Flash. 단일 GPU에서 실행하려고 하신가요? Gemma 4 12B 또는 Qwen3.6. 대규모 컨텍스트가 필요하신가요? Llama 4 Scout의 1천만 토큰은 오늘날 다운로드할 수 있는 모델 중에서도 여전히 비교할 수 없습니다.
VRAM 수치는 Q4 K M 양자화(파라미터 x 0.57 GB/파라미터)를 가정하며, 우리의 LLM VRAM 요구사항 마스터 테이블과 교차 검증되었습니다. 완전 정밀도(FP16)는 대략 3.5배 더 필요합니다. 로컬에서 모델을 실행하는 것이 처음이신가요? Gemma 4 12B 또는 Qwen3.6부터 시작하세요. 이 목록에서 가장 하드웨어 친화적인 옵션입니다.
오픈소스 LLM 리더보드: 2026년 7월 순위
2026년 7월 19일 기준으로 GLM-5.2는 에이전트형 코딩과 추론을 위한 우리의 오픈소스 LLM 리더보드를 1위로 차지하고 있으며, 이는 우리가 3주간 프로덕션에서 운영한 동일한 모델입니다. Kimi K3는 순수 성능에서 2위에 근접하지만 가중치가 7월 27일까지 공개되지 않으므로 현재는 배포 가능한 상태가 아닌 미결로 처리하세요. DeepSeek V4와 Qwen3.6은 프론티어 인접 계층을 구성합니다. 아래의 전체 순위는 다중 노드 클러스터에서 노트북 친화적 선택지까지 이 가이드에서 평가한 8개 모델 모두를 다룹니다.
이 순위는 벤치마크, 하드웨어 요구사항, 라이선스 조건에 대한 월별 재검증을 반영합니다. 이번 사이클은 우리가 마지막으로 발행했을 때 존재하지 않던 3개의 릴리스를 포함했습니다. GLM-5.2, Kimi K3, DeepSeek V4입니다.
이제 각 모델이 주목할 만한 이유를 자세히 살펴보겠습니다.
1. GLM-5.2, 최고의 전반적 오픈소스 LLM
Zhipu/Z.ai의 GLM-5.2는 2026년 6월 13일 Coding Plan 구독자들에게 롤아웃되었으며, 3일 후 오픈 가중치가 공개되었습니다. Mixture-of-Experts 모델로, 총 7,440억 파라미터에 토큰당 약 400억 개가 활성화되며, 100만 토큰 컨텍스트 윈도우와 131K 최대 출력을 지원합니다.
우리는 단지 GLM-5.2의 사양을 읽지 않았고, 직접 운영했습니다. 3주간 Claude Code를 Z.ai의 Anthropic 호환 엔드포인트(api.z.ai/api/anthropic, 모델 문자열 GLM-5.2)에 가리켰으며, 실제 클라이언트 레포에서 주요 코딩 모델로 사용했습니다. 정상적인 주는 약 2,000개의 주간 Pro 계층 프롬프트 중 약 1,300개를 소비했고, 마이그레이션이 많은 2주는 5일차에 한도에 도달했습니다. Next.js 16 API 라우트 리팩토링을 약 12개 파일에 걸쳐 문제없이 완료했습니다. 할당량 계산을 포함한 전체 분석은 우리의 GLM 5.2 Coding Plan 리뷰에서 확인할 수 있습니다.
벤치마크 하이라이트:
이러한 SWE-bench Pro와 Terminal-Bench 점수는 GLM-5.2를 실제 코딩 작업에서 Claude Opus 4.8과 거의 같은 수준으로 만들면서도 API 비용의 극히 일부만 필요로 합니다. Z.ai의 자체 정가는 약 입력 토큰당 $1.40, 출력당 $4.40이지만, 제3자 제공자는 입력 토큰당 $0.55, 출력당 $1.85 정도입니다.
하드웨어 요구사항: Q4 K M에서 전체 모델은 대략 424GB의 VRAM(7,440억 x 0.57 GB/파라미터)이 필요하며, 우리의 VRAM 요구사항 마스터 테이블에 따르면 8x 80GB GPU 노드 또는 다중 노드 클러스터가 필요합니다. 게이밍 PC에서 실행할 수 있는 것이 아닙니다. 대부분의 팀은 자체 호스팅 대신 GLM Coding Plan 또는 호스팅 API를 통해 운영합니다.
사용 대상: 에이전트형 코딩, 긴 클라이언트 레포 리팩토링 또는 Claude Code나 Codex를 사용할 경우가 있는 작업을 수행하는 팀. 워크로드가 대부분 코딩 에이전트라면, 이것이 우리가 가장 먼저 지적할 모델입니다. 중국 오픈 가중치 리더 3개를 나란히 비교하려면 Qwen vs DeepSeek vs GLM 비교를 참조하세요.
2. Kimi K3, 장기 에이전트용 최고 모델 (가중치는 7월 27일 공개)
Moonshot AI의 Kimi K3는 2026년 7월 16일 현재까지 릴리스된 최대 규모의 오픈 가중치 모델로 출시되었습니다. 총 2.8조 파라미터를 가지고 있으며, 896개 전문가 중 토큰당 16개만 활성화됩니다. 100만 토큰의 컨텍스트를 읽으며, 추론이 기본적으로 활성화되어 있고, 텍스트, 이미지, 비디오 입력을 수용합니다.
출시 수치는 실제이며 혼합되어 있습니다. K3는 Arena의 Frontend Code 리더보드에서 1,679 Elo로 1위로 데뷔했으며, Kimi K2.6보다 17위 상승했고 Claude Fable 5를 능가합니다. 독립적 Artificial Analysis는 이를 189개 순위 모델 중 4위로 배치하며, Claude Fable 5와 GPT-5.6 Sol만을 선두로 두고 Claude Opus 4.8을 능가합니다. 이는 오픈 가중치 모델이 독립적 리더보드에서 현재 세대 Claude Opus 계층 모델을 능가하는 것입니다.
벤치마크 하이라이트:
한 가지 주목할 만한 주의사항: Moonshot은 Claude Code for Fable 5와 GPT-5.6 Sol for Codex와 비교하여 자체 KimiCode 환경 내에서 K3를 평가했습니다. 모델 주변의 스캐폴딩이 점수를 이동시키므로 이 수치를 방향성으로 읽으세요. 우리의 전체 Kimi K3 리뷰는 모든 벤치마크를 분석하며, K3가 실제로 손실나는 DeepSWE와 HLE-Full을 포함합니다.
하드웨어 요구사항: 문제는 아직 K3를 자체 호스팅할 수 없다는 것입니다. Moonshot은 출시 10일 후인 2026년 7월 27일 오픈 가중치를 약속합니다. 공개되면 Q4 K M에서 대략 1,596GB의 VRAM(2.8조 x 0.57 GB/파라미터)이 필요할 것으로 예상되며, 양자화되어도 대규모 다중 노드 클러스터 외에는 불가능합니다. 그때까지 API 전용이며 캐시 히트시 $0.30 또는 신규 입력시 $3.00이고 출력당 $15.00로, 모든 중국 연구실이 출시한 모델 중 가장 비싼 가격입니다.
사용 대상: 현재 자체 호스팅하는 사람은 아무도 없습니다. 가중치가 단순히 공개되지 않았습니다. 공개되면 프론티어에 인접한 성능을 추구하지만 Claude나 OpenAI 계약이 없는 에이전트형 연구팀과 장기 호라이즌 코딩 팀이 대상 구매자입니다. 지금 바로 다운로드하고 실행할 수 있는 것이 필요하다면 아래의 GLM-5.2 또는 DeepSeek V4로 건너뛰세요.
3. DeepSeek V4, 최고의 가격 대비 성능
DeepSeek V4는 2026년 4월 24일 프리뷰로 출시되었으며 두 가지 계층으로 제공됩니다. V4 Pro는 추론과 에이전트형 작업용이고, V4 Flash는 빠르고 저렴하며 대량 호출용입니다. 보고된 아키텍처는 Pro의 경우 49B 활성화를 가진 1.6조 파라미터 MoE이고, Flash의 경우 13B 활성화를 가진 284B 총계이며, 둘 다 MIT 라이선스이고 공식 100만 토큰 컨텍스트 윈도우를 지원합니다.
...