현황: 8월 8~11일, 평가의 변곡점
과기정통부가 8월 8일부터 11일까지 진행하는 독파모(독자 파운데이션 모델) 2차평가는 1차와 근본적으로 다르다. 200명의 국민평가단이 국산 AI 모델 4개를 직접 사용해본 체감을 평가 배점에 정식으로 포함하는 것이 처음이기 때문이다. 12일 발표될 평가 결과에서 경연 대상 4팀 중 1팀이 탈락한다.
표면적으로는 평가 체계의 진화로 보인다. 하지만 이 변화가 의미하는 바는 더 깊다. 그동안 발표와 체감 사이의 간극이 누적되어 독파모는 기술적 중요도에 비해 주목도를 잃어왔다. 정부가 일반 사용자의 평가를 공식 지표로 삼은 것은 기술 수치만으로는 설득력이 부족했다는 방증이다.
원인: 비교군의 선택과 그 의미
각 사가 제출한 기술 리포트를 보면 흥미로운 공통점이 드러난다. SK텔레콤의 A.X K2, LG AI연구원의 K-엑사원 2.0, 업스테이지의 솔라 오픈 2 모두 비교 대상 모델 선정에서 GPT, 클로드, 제미나이를 제외했다. 비교군은 중국계 오픈웨이트이거나 '패스트 티어 폐쇄형 API'로 한정됐다.
이는 전략적 선택이다. 국산 모델의 기술 수준을 드러내되, 직접 대비 시 생길 수 있는 "성능 격차 노출"을 회피하는 방식이다. 같은 논리로 오픈웨이트 최고점인 GLM-5.2도 비교 대상에 올라오지 않는다. 결과적으로 미디어와 공중은 "국내 모델이 빅테크 수준"이라는 프레이밍을 읽게 된다. 뉴스와 현실의 간극이 반복되는 이유가 여기에 있다.
기술 성과: "세계 2군 상단"의 좌표
모티프테크놀로지스의 모티프 3 프리뷰는 인공지능 평가 기관 아티피셜 애널리시스의 지능지수(AAII)에서 44점을 기록했다. 같은 지표에서 미니맥스 M3는 44.4점, 딥시크 V4 프로 맥스는 44.3점, 문샷AI 키미 K2.6은 44.2점이다. 국내 모델이 중국 오픈웨이트 상위권과 소수점 단위로 겹친다.
특히 모티프는 30명 규모 조직이 GPU 700여 장으로 약 5개월 만에 이 지점에 도달했다. 기술적으로는 실제 성과다. 하지만 같은 지표 위쪽을 보면 풍경이 바뀐다. 클로드 오퍼스 5는 60.7점이다. 44점대와 60점대 사이에는 두 단계가 더 있다. 국산 모델은 정확히는 "세계 2군의 상단"이지 "글로벌 선두"가 아니다.
이 차이를 인식하는 것이 거시적으로 중요하다. 한국의 AI 정책은 자립형 기술 개발을 목표로 하지만, 시장은 이미 1군(OpenAI, Anthropic, DeepSeek 등)의 생태계로 수렴 중이다. 기술 성과가 아무리 뛰어나도 사용자가 선택하지 않으면 의미가 제한된다.
평가의 한계와 정책적 함의
이번 2차평가에서 일반 사용자 평가를 포함한 것은 기술 중심에서 사용성 중심으로의 전환을 시사한다. 하지만 이는 동시에 한계를 드러낸다. 국민평가단의 체감이 향후 시장 채택을 보장하지 않기 때문이다.
거시적으로 보면, 독파모는 한국 정부의 AI 자립 의지를 반영하는 프로젝트다. 하지만 실제 시장에서는 엔드유저 제품(카카오톡, 네이버 검색, 쿠팡 추천 등)에 국산 모델이 통합되지 않는 현실이 있다. 기술 평가가 아무리 높아도 실제 사용처가 없으면 산업 경쟁력으로 이어지지 않는다.
평가 결과가 12일 나올 때, 주목해야 할 점은 점수가 아니라 다음 단계다. 탈락팀과 생존팀 간의 정부 지원 격차, 생존팀의 실제 상용화 로드맵, 그리고 기존 서비스 업체의 통합 의사가 진정한 성패를 결정한다.
결론
독파모 2차평가는 기술 우월성의 증명이 아니라 정책의 재설정 신호로 읽혀야 한다. 44점이라는 지표는 자산이자 동시에 현실의 벽이다. 기술적 진전은 실제이지만, 시장 채택까지 남은 거리도 명확하다. 앞으로 국산 AI 모델의 경쟁력은 평가점수가 아닌 "실제 제품에 얼마나 빠르게 통합되는가"로 판단될 것이다.
다음 단계:
- 12일 평가 결과에서 생존팀 선정 후, 각 팀의 6개월 상용화 로드맵 공개 여부 주시
- 국내 대형 플랫폼(포털, 메신저, 검색)의 국산 모델 도입 계획 추적
- 정부 지원금이 기술 개선이 아닌 시장 진입(플랫폼 통합, 사용자 확보)에 얼마나 배분되는지 확인
- #독파모2차평가
- #AI모델평가
- #국산AI
- #안광섭
- #기술정책