문장 생성은 제외하고 의사결정에 집중해 실리콘밸리에서 큰 관심을 받은 타입세이프 AI의 ‘제브(Jev)’에 스탠퍼드대학교와 엔비디아 연구진이 도전장을 던졌다. AI 에이전트가 반복해서 수행하는 도구 선택과 결과 검증을 별도 모델로 분리해 처리 속도를 높이는 오픈소스 모델을 선보이며, 제브가 촉발한 ‘판단 전용 AI’ 시장의 경쟁에 뛰어들었다.

스탠퍼드대와 엔비디아 연구진은 23일(현지시간), AI 에이전트의 도구 선택이나 결과 검증처럼 범위가 정해진 의사결정을 빠르게 처리하는 오픈소스 모델 ‘CLM-8B(Contrastive Language Models)’를 공개했다.

최근 주목받은 제브처럼 새 문장을 생성하는 대신, 현재 상황과 가능한 선택지를 비교해 가장 적절한 행동을 신속하게 고르는 방식이다.

CLM은 현재 작업 상태와 선택 가능한 행동을 하나의 임베딩 공간에 표현한다. 학습할 때는 정답 상태와 행동의 조합을 서로 가깝게, 잘못된 조합은 멀게 배치하는 대조학습을 적용한다. 실제 사용 시에는 현재 상태만 새로 인코딩하고, 미리 계산해 캐시한 행동 표현과 대조해 가장 적합한 행동을 선택한다.

이 방식은 같은 행동을 되풀이해 선택하는 에이전트에서 특히 효과적이다. 예컨대 기업용 IT 에이전트가 비밀번호 재설정, 접근 권한 부여, 티켓 생성, 보안팀 전달 등 승인된 50개 작업 중 하나를 골라야 할 때, 매번 50개 행동을 프롬프트에 넣는 대신 각 행동의 표현을 미리 만들어 새 상황과 비교할 수 있다.

구글의 ‘공룡 점프 게임(T-Rex Game)’으로 진행한 제로샷 테스트에서 CLM-8B의 평균 지연시간은 16밀리초(ms)였다. 제브의 150ms와 비교하면 9배 빠른 속도다. 이 테스트를 포함한 게임 과제에서 CLM-8B는 제브와 같은 성공률을 보였다. 후보 행동이 많거나 동일한 행동을 여러 상태에서 거듭 재사용할 수 있을 때 속도 향상 폭이 가장 컸다.

반면 에이전트의 핵심 역량인 정확도에서는 약점이 나타났다. BFCL v4 도구 호출 벤치마크에서 CLM-8B는 95.2%를 기록해 제브의 99.2%보다 낮았다. 위키레이싱(WikiRacing) 과제에서도 30개 중 26개를 해결해, 30개 모두를 푼 제브에 못 미쳤다.

CLM-8B는 ‘큐원3-8B’를 백본으로 삼는다. 백본은 고정한 채 상태와 행동에 사용하는 별도의 프로젝션 헤드를 학습하는 구조여서, 80억개 매개변수 전체를 다시 학습하지 않고도 특정 업무에 맞게 조정할 수 있다.

연구진은 질의·응답 데이터 6000만개와 합성 하드 네거티브 3000만개, 에이전트 궤적 100만개를 활용해 모델을 단계별로 학습했다.

코딩 과제에서는 대형 모델이 먼저 여러 해법 후보를 만들고, CLM이 그중 하나를 검증해 고르는 방식도 시험했다. ‘딥SWE’와 ‘터미널-벤치 2.1’의 일부 과제에서 CLM 검증기는 각각 81.6%, 87.6%의 성능을 냈다. 같은 조건에서 연구진이 제시한 제브의 성능은 각각 71.1%, 83.1%였다.

CLM 검증기의 지연시간은 제브보다 4.1~5.7배 짧았다. 다만 CLM이 문제를 처음부터 풀어낸 것은 아니다. 다른 대형 모델이 만든 후보 중 하나를 선택한 결과다.

연구진은 이를 두고 “대형 추론 모델은 생성과 추론에 사용하고, CLM은 결과를 저렴하게 선택하고 검증하고 모니터링하는 방식”이라고 설명했다. CLM은 에이전트의 행동이나 작업 흐름을 계속 점수화해 비정상적인 움직임을 찾아내는 모니터링 계층으로도 쓸 수 있다고 덧붙였다.

CLM은 범용 추론 모델을 대체하려는 기술이 아니다. 수학 문제 풀이처럼 열린 형태의 추론이 필요하거나, 긴 답변과 고차원적인 계획 수립이 요구되는 작업보다는 선택지가 미리 정해져 있어 그중 하나를 고르고 순위를 매기거나 검증하는 작업에 적합하다.

전문가들은 CLM-8B의 등장으로 제브가 시작한 ‘의사결정 특화 AI’ 분야에서 폐쇄형과 개방형 간 기술 경쟁이 한층 치열해질 것으로 내다봤다. 그동안 기술을 공개하지 않고 독점해온 제브와 달리, 연구진은 CLM-8B의 가중치와 코드를 아파치 2.0 라이선스로 깃허브에 공개했다. 타입세이프 호환 API와 미세조정 도구, 테스트용 플레이그라운드도 함께 제공한다.

연구진은 더 많은 에이전트 데이터를 활용하는 멀티모달 CLM-35B-A3B도 개발 중이며, 10월 초 공개할 계획이라고 밝혔다.

출처 바로가기