오픈AI가 최상위 플래그십 모델에 가까운 성능을 내면서 비용은 크게 낮춘 업그레이드 모델 ‘GPT-6.1 솔(Sol)’을 출시했다.

샘 알트먼 오픈AI CEO는 29일(현지시간) 샌프란시스코에서 열린 ‘데브데이 2026’ 행사에서 새 모델을 공개했다.

GPT-6.1 솔은 개발자와 기업 사용자를 겨냥한 모델이다. 에이전트 기반 코딩, 복잡한 문서 분석, 컴퓨터 활용, 장기 업무 자동화 기능을 대폭 강화했다.

그는 “개발자와 기업이 예산 걱정 없이 가장 유능한 AI 에이전트를 자유롭게 구축하도록 돕는 것이 우리의 목표”라며 “최상위 모델인 아스트라급 지능을 5분의 1 가격에 제공해, 비용 때문에 프런티어 모델 도입을 망설이던 사용자에게 완전히 새로운 기회를 열어줄 것”이라고 말했다.

이어 “반복적인 추론과 연속 작업이 필요한 멀티스텝 에이전트 시스템에서는 토큰 단가가 무엇보다 중요하다”고 설명했다. 이 덕분에 개발자들은 같은 예산으로 훨씬 길고 복잡한 실무 자동화 워크플로우를 구현할 수 있게 됐다고 덧붙였다.

API 이용료는 표준 입력이 100만 토큰당 2달러(약 2700원), 출력이 100만 토큰당 10달러(약 1만3500원) 수준이다. 컨텍스트를 재사용할 때 적용되는 캐시 입력 가격은 100만 토큰당 0.1달러(약 135원)에 그친다. 반복 요청이 필수적인 AI 에이전트 워크로드의 실행 비용을 기존보다 최대 95% 줄였다.

다만 복잡한 멀티스텝 작업을 처리할 때는 기존 ‘GPT-6 솔’보다 출력 토큰을 약간 더 많이 사용하는 특성이 있다.

주요 기술 벤치마크에서도 비용 대비 성능 향상이 확인됐다. 실제 코드베이스 해결 능력을 평가하는 ‘딥SWE v1.1’에서 GPT-6.1 솔은 5분의 1 비용으로 GPT-6 아스트라와 대등한 점수를 받았다. 기존 GPT-6 솔보다 최고 점수도 6.4%포인트 높였다.

복잡한 금융·법률·의료 PDF 문서 해석 능력을 보는 ‘GDP.pdf’ 평가에서는 경쟁 모델 ‘클로드 오퍼스 5.5’보다 높은 점수를 기록했고, 작업당 처리 비용은 절반 미만으로 낮췄다.

비즈니스 자동화와 실시간 도구 제어에서도 성과를 냈다. 47개 비즈니스 도구를 이용한 멀티스텝 업무를 평가하는 ‘오토메이션벤치(AutomationBench) 1.0.6’에서는 오퍼스 5.5보다 2.2%P 높은 점수를 받았다. OS 복합 작동 환경을 측정하는 ‘OS월드 2.0’ 오프라인 세트에서는 아스트라와의 성능 차이를 2.1%P까지 좁혔고, 작업당 비용은 7분의 1 수준이었다. 사실 정확성 평가에서는 최고 추론 설정 기준 오류율이 4.1%로, 아스트라(4.0%)에 맞먹는 신뢰성을 보였다.

데이터 분석과 과학 연구 워크플로우를 평가하는 ‘터미널벤치 사이언스(Terminal-Bench Science) 0.1’에서는 작업당 평균 5.47달러의 비용으로 기존 ‘GPT-6 솔’보다 두 배 넘는 성과를 냈다. 하지만 고난도 연구 작업에서는 GPT-6 아스트라(68.1%, 작업당 23.8달러)가 여전히 앞섰다.

안전성과 정렬(Alignment) 성능도 나아졌다. 에이전트가 작동하는 동안 검색 도구가 멈췄을 때 억지로 환각 답변을 내놓는 대신 사용자에게 문제를 알리는 실패율은 2.1%였다. 이전 버전의 4.9%보다 낮아져 한계 상황을 더 투명하게 알리게 됐다.

아티피셜 애널리시스 인텔리전스 지수(AAII)에서는 52점을 기록했다. GPT-6 아스트라(53점)보다 지능 점수는 소폭 낮았다. 전체 순위는 오퍼스 5.5(58점), 소네트 5.5(56점), 페이블 5.1(53점) 등에 이어 5위였다. 다만 이전 버전의 48점과 비교하면 4점 올랐다.

오픈AI는 초당 300토큰 이상의 응답 속도를 내는 ‘GPT-6.1 솔 울트라패스트(Ultrafast)’ 등급도 앞으로 출시할 계획이라고 예고했다. 대규모 챗봇이나 실시간 상호작용이 필요한 엔터프라이즈 환경에서 지연 시간을 크게 줄일 것으로 전망된다. 이번에 공개한 플랫폼 ‘닷(Dot)’과 연동하면 전용 클라우드 컴퓨터에서 상시 가동하는 AI 에이전트도 손쉽게 배포할 수 있다.

기술 커뮤니티의 초기 반응은 성능과 가격을 두고 엇갈렸다. 개발자들은 캐시 토큰 할인에 기반한 에이전트 구축 비용 효율을 긍정적으로 평가하며, 멀티 에이전트 시스템을 대규모로 운영할 때의 비용 절감 효과에 관심을 보였다.

반면 일부에서는 순수 과학과 극고난도 연구 분야에서 아스트라가 여전히 앞선다는 점, 출력 토큰량이 조금 늘었다는 점을 지적했다. 이전 GPT-6 솔에서 이름만 바꾼 마이너 업데이트 아니냐는 반응도 나왔다.

GPT-6.1 솔은 일반 챗GPT 서비스가 아니라 ‘챗GPT 워크’와 ‘코덱스’ 환경, 오픈AI API(gpt-6.1-sol)를 통해 개발자와 기업 사용자에게 제공된다.

한편 오픈AI는 당초 이번 데브데이에서 최상위 모델 ‘GPT-6.1 아스트라’도 함께 공개하고 10월 중 출시할 계획이었다. 그러나 출시 직전 기만 행동과 무단 접근 등 에이전트 안전 문제가 불거져 출시를 전격 철회·연기했고, 효율성을 앞세운 GPT-6.1 솔을 데브데이의 핵심 모델로 내세우게 됐다.

출처 바로가기