
OpenAI가 GPT-6 Astra에 이어 GPT-6 Sol과 GPT-6 Luna를 공개했다. Astra가 가장 높은 수준의 성능을 목표로 한다면, Sol과 Luna는 전문적인 작업 능력을 유지하면서 비용과 응답 속도를 낮추는 데 초점을 맞춘 모델이다. OpenAI는 Astra 개발에 사용한 방법을 바탕으로 사실성, 코딩, 컴퓨터 사용, 업무 자동화, 정렬 성능을 두 모델에도 확장했다고 설명했다. 성능이 필요한 모든 작업을 하나의 최고가 모델로 처리하기보다, 작업 규모와 예산에 맞춰 모델을 선택할 수 있도록 GPT-6 제품군을 넓힌 셈이다.
성능과 가격을 함께 낮춘 GPT-6 모델
GPT-6 Sol과 Luna는 캐싱과 추론 인프라를 개선해 대규모 사용 환경에서 더 효율적으로 제공된다. OpenAI는 이에 따른 비용 절감분을 사용자와 고객에게 반영해, GPT‑5.6의 프로모션 가격과 비교했을 때 두 모델의 API 가격을 50% 낮췄다고 밝혔다. 가격은 1백만 토큰 기준으로 책정된다. GPT‑6 Sol의 입력 가격은 $4에서 $2로, 출력 가격은 $20에서 $10으로 내려갔으며, GPT‑6 Luna는 입력이 $0.20에서 $0.10으로, 출력이 $1.20에서 $0.50으로 낮아졌다. Astra는 여전히 전반적인 결과를 가장 중시할 때 선택하는 최상위 모델로 남는다.
업무 자동화에서 비용 대비 성능 강화
전문 업무 평가에서 Sol은 복잡한 업무를 수행하면서도 더 많은 반복 작업을 감당할 수 있는 모델로 제시됐다. 여러 애플리케이션을 연결한 업무 흐름을 평가하는 AutomationBench에서 GPT‑6 Sol은 xhigh 노력 수준으로 33.2%를 기록해 Claude Opus 5의 max 노력 수준 26.9%를 앞섰고, 작업당 비용은 $0.27이었다. 같은 평가에서 GPT‑6 Astra의 low 노력 수준 점수는 30.3%였으며, 작업당 비용은 Sol보다 3.9배 높았다. Claude Opus 5는 Sol보다 11.1배 비쌌고, Claude Fable 5.1은 Opus 5 폴백 비용을 포함하지 않았음에도 Sol보다 8.9배 이상 높은 비용이 들었다.
Agents’ Last Exam에서도 GPT‑6 Sol은 max 노력 수준에서 56.4%를 기록했다. 이는 컴퓨터로 수행하는 장기적이고 경제적 가치가 있는 전문 업무를 55개 하위 산업에 걸쳐 평가한 결과다. OpenAI는 Sol의 점수가 Claude Opus 5 평가에서 나온 최고 점수보다 낮은 비용으로 달성됐다고 설명했다. GPT‑6 Luna 역시 high 노력 수준에서 이전 모델보다 5.4%포인트 향상됐고, 작업당 비용은 58% 낮아졌다.
사실성·코딩·컴퓨터 사용 능력
OpenAI의 내부 사실성 평가에서 GPT‑6 Sol은 이전 모델보다 실수를 약 절반으로 줄였다. 이 평가는 실제 대화에서 사용자가 오류를 신고한 사례를 비식별화해 구성한 것으로, 일반적인 사용 환경의 오류 빈도를 그대로 나타내는 것은 아니다. GPT‑6 Luna도 크게 개선됐으며, 높은 노력 수준에서는 GPT‑5.6 Sol과 비슷한 사실성을 약 100분의 1 수준의 비용으로 제공한다고 OpenAI는 밝혔다. 답변 길이에 따른 점수 차이는 거의 없었다고 덧붙였다.
코딩 분야에서는 실제 코드베이스에 적용할 수 있는 변경을 평가하는 FrontierCode에서 GPT‑6 Sol이 GPT‑5.6 Sol보다 크게 향상됐다. Sol은 Claude Fable 5.1 xhigh와 비슷한 성능을 훨씬 낮은 비용으로 달성했다. DeepSWE v1.1에서는 Sol이 max 노력 수준에서 68.8%를 기록해 Claude Fable 5의 xhigh 최고 점수 69.9%에 1.1%포인트 차이로 접근했으며, 작업당 비용은 약 80% 낮았다. Luna는 66.6%를 기록해 Claude Opus 5와 Fable 5의 medium 노력 수준과 비슷했고, 비용은 각각 93%, 96% 적었다.
컴퓨터 사용 평가인 OSWorld 2.0 offline에서는 GPT‑6 Sol의 xhigh 점수가 60.5%로, Claude Opus 5의 medium 점수 60.3%와 비슷했다. 이때 Sol의 작업당 비용은 약 80% 낮았다. GPT‑6 Luna의 max 노력 수준은 GPT‑5.6 Sol의 medium 수준을 넘었고, 비용은 그 10분의 1이었다. 다만 컴퓨터 사용 분야 전체에서 가장 높은 성능을 제공하는 모델은 여전히 GPT‑6 Astra다.
더 자연스러워진 협업 방식
OpenAI는 Sol과 Luna에 Astra에서 개선한 커뮤니케이션 스타일도 적용했다. 기술 및 코딩 대화에서 설명이 더 명확해지고, 불필요한 전문 용어와 어색한 표현, 가치가 낮은 세부 정보가 줄어드는 것이 목표다. 답변은 전반적으로 조금 짧아지지만 핵심 내용은 유지하도록 조정됐다. 공개된 비교 사례에서도 Sol은 성급하게 결론을 내리거나 질문자가 이미 알고 있을 법한 내용을 반복하는 경향이 적었고, 실제로 무엇을 했고 무엇을 확인하지 않았는지를 더 분명히 밝혔다.
OpenAI는 에이전트가 장시간 작업을 수행할수록 토큰 비용의 중요성이 커진다고 설명했다. 내부 사용 사례에서 코딩 에이전트의 일일 토큰 사용량은 API 가격으로 환산했을 때 연구자 중간값이 $600를 넘었고, 90번째 백분위 연구자는 $7,000를 넘었다. 따라서 Sol과 Luna의 낮은 가격은 단순히 한 번의 응답 비용을 줄이는 데 그치지 않고, 개발자가 더 오래 반복하고 더 복잡한 작업을 맡길 수 있게 하는 요소가 된다.
캐싱과 정렬 성능도 개선
GPT‑6용 프롬프트 캐싱은 기본 캐시 적중률을 높이는 방향으로 개선됐다. 개발자는 재사용되는 입력 맥락에 대해 최대 90%의 할인 혜택을 받을 수 있고, 캐시된 입력 토큰을 더 빠르게 처리할 수 있다. Prompt Caching Dashboard에서는 입력 중 얼마나 많은 부분이 캐시되는지 시간에 따라 확인할 수 있으며, 진단 도구는 캐싱이 놓친 이유와 수정 방법을 보여준다. 추론 노력 수준이나 도구 사용 여부를 바꿔도 이전 맥락의 캐시 재사용이 깨지지 않으며, 명시적 중단점을 이용해 어떤 프롬프트 접두부를 캐시할지도 조정할 수 있다.
OpenAI는 이러한 개선으로 최근 몇 달 동안 수십억 건의 요청에서 새로 처리해야 하는 프롬프트 토큰의 비율이 50% 넘게 줄었다고 밝혔다. 또한 GPT‑6 Sol과 Luna는 GPT‑5.6 계열보다 정렬 평가 결과도 좋아졌다. 특히 코딩 작업을 실제로 완료하지 않았는데 완료했다고 오해하게 만드는 식의 오도성 주장이 줄었다. 다만 이 정렬 평가는 의도적으로 어려운 상황을 시험한 것이며, 일반적인 사용 환경에서의 실패율을 직접 측정한 것은 아니다.
이용 가능 범위
GPT‑6 Sol과 GPT‑6 Luna는 발표 시점부터 ChatGPT Work와 Codex에서 Plus, Pro, Business, Enterprise, Edu 사용자에게 제공된다. Free와 Go 사용자는 데스크톱 앱에서 GPT‑6 Luna를 이용할 수 있다. 두 모델은 OpenAI API에서 각각 gpt-6-sol과 gpt-6-luna라는 이름으로 제공되지만, Chat에서는 아직 이용할 수 없다. ChatGPT Work와 Codex에서는 서비스 안정성을 위해 하루 동안 점진적으로 배포될 예정이므로, 바로 표시되지 않을 경우 잠시 후 다시 확인해야 한다.
정리
GPT‑6 Sol과 Luna의 핵심은 최상위 성능만을 추구하기보다 비용과 성능의 균형을 넓힌 데 있다. Sol은 전문 업무와 코딩에서 높은 성능을 낮은 비용으로 제공하고, Luna는 반복적인 대규모 사용에 적합한 가격 경쟁력을 앞세운다. 사실성, 컴퓨터 사용, 협업 방식, 캐싱, 정렬 성능도 함께 개선돼 개발자와 업무 자동화 시스템이 더 오래 안정적으로 사용할 수 있다. 가장 어려운 작업에는 Astra를, 비용 효율적인 전문 작업과 일상적인 에이전트 업무에는 Sol과 Luna를 선택하는 구성이 가능해졌다.