
OpenAI가 GPT-6 Sol을 개선한 GPT-6.1 Sol을 공개했다. 코딩 에이전트, 컴퓨터 조작, 전문 업무 평가에서 GPT-6 Astra에 근접한 성능을 보이면서 표준 입력·출력 토큰 가격은 Astra의 약 5분의 1이다. 특히 캐시 입력은 토큰 100만 개당 $0.10으로, 일반 입력 가격보다 95% 낮고 GPT-6 Sol의 캐시 입력 가격보다 50% 저렴하다. 이전 요청의 맥락을 재사용하는 에이전트를 더 낮은 비용으로 개발하고 실행할 수 있도록 설계된 모델이다.
여러 업무에서 성능과 비용의 균형
GPT-6.1 Sol은 코드 작성과 디버깅부터 문서 이해, 여러 단계로 이어지는 업무 처리까지 GPT-6 Sol보다 개선됐다. 일부 평가에서는 GPT-6 Astra에 가까운 성능을 더 낮은 비용으로 제공한다. 아래 결과는 각기 다른 벤치마크와 추론 설정에서 측정한 것이므로, 점수와 비용을 비교할 때는 평가 과제와 조건을 함께 봐야 한다.
실제 코드 기반의 복잡한 코딩
DeepSWE v1.1은 실제 코드 저장소에서 해결해야 하는 복잡하고 장기적인 소프트웨어 엔지니어링 과제를 평가한다. 이 평가에서 GPT-6.1 Sol은 GPT-6 Astra와 같은 점수를 기록했으며 비용은 약 5분의 1이었다. GPT-6 Sol의 최고 점수보다도 6.4%포인트 높았고, 이 결과는 더 낮은 추론 노력과 비용으로 달성됐다. 단순한 코드 생성보다 여러 단계의 문제 해결 능력을 따지는 평가에서 비용 효율이 두드러진다.
전문 문서와 업무 흐름 처리
GDP.pdf는 금융, 의료, 법률을 비롯한 9개 전문 분야의 복잡한 PDF를 바탕으로 질문에 답하는 정확도를 측정한다. 표와 차트, 도표, 작은 글씨의 세부 내용까지 이해해야 하는 이 평가에서 GPT-6.1 Sol은 폴백을 포함한 Opus 5.5보다 높은 점수를 냈고, 테스트된 추론 설정에서 과제당 비용은 절반 미만이었다. GPT-6 Astra의 최고 수준 성능에도 근접했으며 비용은 약 5분의 1이었다.
AutomationBench는 영업, 마케팅, 운영, 지원, 재무, 인사 등에서 47개 도구를 활용해 업무를 끝까지 처리하는 에이전트를 평가한다. 중간 추론 노력 설정에서 GPT-6.1 Sol은 Opus 5.5보다 2.2%포인트 높은 점수를 약 3분의 1 비용으로 기록했다. 같은 설정에서 GPT-6 Sol보다 점수가 4.8%포인트 상승했다. 참고로 Claude Fable 5.1의 비용 수치에는 약 40%의 과제에서 발생한 폴백 비용이 포함되지 않아 실제 비용보다 낮게 표시됐다.
컴퓨터 조작과 과학 연구
OSWorld 2.0의 오프라인 세트는 일상 및 전문 환경의 여러 단계 컴퓨터 조작 과제를 다룬다. 최대 추론 노력에서 GPT-6.1 Sol은 GPT-6 Sol보다 7%포인트 높은 점수를 절반 미만의 비용으로 얻었다. GPT-6 Astra와의 점수 차이는 2.1%포인트였으며, 과제당 비용은 약 7분의 1이었다. 보고된 결과는 v2026.08.08 버전 오프라인 세트의 부분 보상 점수다.
Terminal-Bench Science 0.1은 데이터 분석, 시뮬레이션, 정리 증명 등을 포함한 과학 연구 과정을 평가한다. 최대 추론 노력에서 GPT-6.1 Sol은 GPT-6 Sol 점수를 두 배 이상으로 끌어올렸고 과제당 비용은 절반 미만이었다. 평균 비용은 GPT-6.1 Sol이 $5.47, Opus 5.5가 $23.21, Astra가 $23.80이었다. 다만 테스트한 모델 중 가장 높은 점수인 68.1%는 GPT-6 Astra가 기록했으며, 가장 어려운 과학 연구 과제에는 Astra를 사용해야 한다고 OpenAI는 설명했다.
사실 정확도와 안전성
어려운 질문에서 사실 오류가 포함된 응답의 비율도 개선됐다. 낮은 추론 노력 설정에서 GPT-6 Sol의 오류 비율은 11.4%였고, GPT-6.1 Sol은 7.7%로 약 32% 줄었다. 테스트된 추론 설정 전반에서 오류율은 GPT-6 Astra와의 차이가 1.9%포인트 이내였으며, 과제당 비용은 5분의 1 미만이었다. 이 평가는 과거 모델 답변에서 오류를 신고한 비식별 대화를 사용해 의도적으로 어려운 질문을 살핀 것이므로, 일반적인 사용 환경의 오류율을 나타내지는 않는다.
정렬 평가에서는 GPT-6 Sol보다 개선되어 GPT-6 Astra에 가까워졌다. 검색 도구가 작동하지 않을 때 이를 투명하게 알리고, 명시적인 제한과 안전 조건을 지키며, 에이전트 과제에서 허가받지 않은 결과를 피하는 능력이 나아졌다. 자동 안전 검토를 우회하려는 시도는 관찰되지 않았으며, 이 점은 GPT-6 Astra와 GPT-6 Sol의 결과와 같았다. 이 평가 역시 어려운 상황을 의도적으로 시험한 것으로 일반적인 사용에서의 실패율을 측정한 것은 아니다.
이용 방법과 가격
GPT-6.1 Sol은 현재 Plus, Pro, Business, Enterprise, Edu 사용자가 ChatGPT Work와 Codex에서 이용할 수 있다. Chat에서는 아직 제공되지 않으며, 개발자는 OpenAI API에서 gpt-6.1-sol로 이용할 수 있다. API 표준 가격은 입력 토큰 100만 개당 $2, 캐시 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $10이다. OpenAI는 며칠 안에 Codex 표준 속도보다 토큰 생성이 최대 8배 빠른 GPT-6.1 Sol Ultrafast도 제공할 예정이다.
정리
GPT-6.1 Sol은 코딩, 전문 문서 분석, 업무 자동화, 컴퓨터 조작, 과학 연구에서 GPT-6 Sol보다 개선된 성능을 낮은 비용으로 제공한다. 여러 평가에서 GPT-6 Astra에 근접하지만, 가장 어려운 과학 연구 과제에서는 Astra가 최고 점수를 냈다. 사용자는 과제의 난도와 비용, 필요한 정확도에 따라 모델과 추론 설정을 선택할 수 있다.