AI 모델이 빠르게 증가하면서 기업과 창작자들은 단순히 성능을 비교하는 데서 나아가 작업 목적에 가장 적합한 모델을 선택해야 하는 상황에 놓였다. 이에 크리에이티브 AI 도구 스타트업 오픈아트(OpenArt)는 용도별 벤치마크를 선보이고, 초기 순위와 함께 모델 라우팅의 중요성을 강조했다.

크리에이티브 AI 도구 스타트업 오픈아트(OpenArt)는 15일(현지시간) 이미지·비디오 생성 모델을 사용 목적에 따라 비교하는 공개 벤치마크 ‘오픈아트 아레나(OpenArt Arena)’를 공개했다.

구글 출신 코코 마오와 존 차오가 공동 창립한 오픈아트는 여러 업체의 이미지·비디오·음성·3D 모델을 하나의 플랫폼에서 이용할 수 있도록 제공하고 있다. 이번에 공개한 아레나는 영화 제작, 전자상거래, 그래픽 디자인, 모션 디자인, 영상 편집, 립싱크 등 구체적인 용도별로 모델 순위를 구분한 것이 특징이다.

스텔라 관 오픈아트 성장·운영책임자는 “창작자가 가장 좋은 이미지나 영상 모델을 선택하려 할 때 오픈아트를 떠올리고, 가장 신뢰할 수 있는 업계 표준이라고 인식하도록 하는 것이 목표”라고 밝혔다.

평가는 모델명을 공개하지 않은 채 두 결과물을 비교하는 방식으로 진행된다. 오픈아트가 선정한 창작 전문가와 외부 평가자 등 800~1000명 규모의 ‘테이스트메이커’를 모집해 용도별 결과물을 평가하며, 결과는 1952년 개발된 브래들리-테리 통계 모델을 활용해 계산한다.

예를 들어 영화 제작에서는 카메라 움직임과 조명, 영화적 완성도 등이 주요 평가 요소가 되며, 광고에서는 읽기 쉬운 텍스트와 로고 정확성, 제품 배치 등이 더 큰 비중으로 반영된다.

비디오 부문에서는 바이트댄스의 ‘시댄스(Seedance) 2.5’가 전체 순위에서 1081점으로 1위를 기록했다. 알리바바의 ‘완(Wan) 3.0’은 1004점, 시댄스 2.0은 1000점으로 그 뒤를 이었다.

시댄스 2.5는 영화, 모션 디자인, 립싱크 부문에서도 1위를 차지했다. 다만 영상 편집에서는 완 3.0이 1034점으로, 1033점을 받은 시댄스 2.5를 근소한 차이로 앞섰다.

이미지 부문에서는 모델별 결과가 더욱 분산됐다. 오픈AI의 'GPT-이미지-2'는 그래픽 디자인과 이미지 편집에서 각각 1위를 기록했고, '시드림(Seedream) 5.0 프로'는 영화용 이미지와 전자상거래 이미지 부문에서 정상에 올랐다.

전체 이미지 작업을 기준으로는 시드림 5.0 프로가 1010점으로 GPT-이미지-2보다 10점 높은 점수를 받았다.

오픈아트는 일부 평가 프롬프트만 공개하고, 실제 평가에 활용되는 일부 프롬프트는 비공개로 유지할 예정이다. 모델 개발사가 공개된 테스트에 맞춰 성능을 최적화하는 일을 방지하기 위해서다. 그러나 전체 프롬프트 수와 실제 투표자 수, 총평가 횟수 등은 아직 공개되지 않아 투명성과 재현성에 관한 과제는 남아 있다.

또한 평가 대상 모델을 자체 플랫폼에서 직접 제공하고 있다는 점에서 완전히 독립적인 벤치마크 기관과는 차이가 있다. 이에 따라 기업들은 아레나 순위를 절대적인 기준으로 받아들이기보다 자체 브랜드와 제작 환경, 비용, 데이터 보안, 저작권, 배포 방식 등을 함께 검토할 필요가 있다.

오픈아트는 “특정 작업에서는 전체 순위와 다른 모델의 장점이 드러난다”고 설명했다. 실제 이번 결과에서도 영상 편집과 이미지 제작 등 작업 유형에 따라 선두 모델이 달랐다. 이는 생성 AI 시장에서 하나의 모델을 모든 업무에 적용하기보다, 용도에 가장 적합한 모델을 선택하는 ‘모델 라우팅’ 전략의 중요성이 커지고 있음을 보여준다.

출처 바로가기