
Grok 4.6 vs Grok 4.5: 런칭 당일 80개의 API 호출을 실행했습니다 — 동일한 40/40, 1.38배의 비용
Grok 4.6은 40개의 채점된 작업을 완료하는 데 $0.2992가 들었습니다. Grok 4.5는 동일한 40개에 $0.2174가 들었으며, 동일한 답변을 반환했습니다.
이는 2026년 8월 12일에 SpaceXAI(이전의 xAI)가 모델을 출시한 지 수 시간 후에 측정되었습니다. 동일한 가격표: 입력 토큰당 백만 개당 $2, 출력 $6. 동일한 점수: 40/40 대 40/40. 차이는 4.6의 중앙값 출력 토큰의 1.90배이며, 이는 38% 더 큰 청구서가 됩니다.
SpaceXAI가 8월 12일에 출시한 것
SpaceXAI는 2026년 8월 12일에 Grok 4.6을 백만 입력 토큰당 $2, 출력 $6으로 출시했습니다. 이는 Grok 4.5와 동일한 가격표입니다. 9to5Mac에 따르면 PT 시간 08:56에 출시되었으며, 공식 공지(2026-08-12 조회)는 에이전트 기반 코딩에 중점을 두면서 운영 비용, 지연 시간 또는 토큰 소비 수치를 전혀 공개하지 않습니다.
- SpaceXAI API의 grok-4.6과 OpenRouter의 x-ai/grok-4.6으로 같은 날 이용 가능합니다.
- Grok 4.5에서 변경되지 않은 500K 토큰 컨텍스트 윈도우입니다.
- 입력 $2/M, 출력 $6/M, 그리고 2배 요금의 빠른 버전입니다.
- Artificial Analysis Intelligence Index 점수 61, 벤더에 의해 GPT-5.6 Sol과 동일하다고 표현됩니다.
- 한 가지 정성적 4.5 비교: 시각 및 대화형 프로젝트에서 더 강한 첫 시도.
Cursor의 런칭 당일 글은 제3자 검증처럼 보이지만 그렇지 않습니다: SpaceX는 2026년 6월 16일에 Cursor의 제작사인 Anysphere를 주식으로 $60B에 인수하기로 합의했습니다.
Grok 4.6으로 전환해야 할까요?
정기적인 구조화된 작업의 경우 4.5에 머물러야 합니다: 당사의 80개 호출은 1.38배 더 많은 비용으로 동일한 답변을 반환했습니다. 가격표는 OpenRouter의 두 모델 페이지에서 바이트 단위로 동일하므로, 가격 페이지에서 경고할 수 없습니다. 토큰 수는 할 수 있습니다.
"당사"로 표시된 행은 당사의 행이며, 런칭 당일에 측정되었습니다. 지수 및 캐시 행은 Artificial Analysis의 행이며, 2026-08-12에 조회되었습니다.
동일한 가격표, 토큰의 1.90배, 따라서 동일한 답변에 대해 대략 1.38배의 청구서. 이것이 대부분의 프로덕션 트래픽에 대한 grok 4.6 대 grok 4.5 질문입니다: 토큰당 동일한 가격, 다른 청구서입니다.
런칭 당일 80개의 API 호출이 실제로 보여준 것
온도 0에서의 80개 런칭 당일 호출 전반에 걸쳐, 두 모델 모두 4.6이 중앙값 출력 토큰의 1.90배를 사용하면서 40/40 점수를 받았습니다.
각 프롬프트를 두 번 보냈습니다. 한 번은 x-ai/grok-4.6에, 한 번은 x-ai/grok-4.5에 보냈습니다. OpenRouter를 통해 온도: 0으로 측정했습니다. 라운드 1(24개 호출)은 쉬웠습니다: 당사가 채점한 JSON 스키마 작업, 가격 책정 계산, Python 버그 수정, 제약이 있는 작성 작업. 라운드 2(24개 호출)는 라운드 1이 포화된 후 더 어려워졌습니다: 스케줄링 퍼즐, 단위 변환 함정, 취소된 속임수가 있는 402줄 바늘 검색, retry_on이 429와 503을 포함해야 하지만 500을 포함하면 안 되는 사양 작업. 라운드 3(32개 호출)은 아래의 컨트롤입니다. 모든 채점자는 결정론적입니다. LLM으로 판단되는 것은 없습니다. 스크립트 grok_bench.py, grok_bench_hard.py, grok_bench_effort.py; benchmark-raw.json, benchmark-hard-raw.json, benchmark-effort-raw.json에 원본 출력. 총 지출, $0.52.
사전 론칭 합의는 8월 11일자 @haider1의 X 게시물이며 애그리게이터 블로그 전반에 복사되어, 4.6이 4.5의 속도와 토큰 효율을 유지할 것이라고 말했습니다. SpaceXAI는 그렇게 주장하지 않았습니다. 그 공지는 토큰 주장을 전혀 하지 않습니다. Unite.AI는 런칭 당일에 "아직 독립적인 평가가 모델의 주장을 확인하지 못했습니다"라고 지적했으므로, 여기 하나가 있습니다. Grok 4.6은 온도 0에서 동일한 프롬프트에 대해 Grok 4.5의 215에 대해 중앙값 409 출력 토큰을 사용했으며, 중앙값 200에 대해 365 중앙값 추론 토큰을 사용했으며, 총 13,929에 대해 27,565입니다. 4.6이 무엇을 얻든 중앙값 출력 토큰의 1.90배로 그 댓가를 치릅니다.
꼬리가 피해를 주는 곳
동일한 프롬프트, 온도: 0, 기본 노력 라운드의 unit_trap 중 세 번의 시도:
4.6에서 6.6배 스프레드 대 4.5에서 1.8배, 바이트 동일한 입력에서. 타임아웃 또는 요청당 토큰 예산을 크기 조정할 때, 그 꼬리는 중앙값보다 더 중요하며, 더 새로운 모델이 잘못된 기본값인 경우를 논거합니다.
다른 방식으로 실행된 유일한 작업
constraint_schedule에서, 4.6은 기본 노력 라운드에서 중앙값에서 더 빨랐습니다: 더 적은 출력 토큰(1,644 대 1,710)에서 34.21초 대 26.38초입니다. 논문에 맞는 숫자만 보고하는 것은 독자와 Google이 할인하는 것입니다.
모델 문제일까요, 아니면 기본값 문제일까요?
두 모델 모두에서 reasoning_effort를 동일한 값으로 고정해도 간격을 닫지 못합니다. 1.51배에서 2.91배로 확대됩니다. docs.x.ai(2026-08-12 조회)는 4개 수준(낮음, 중간, 높음, 매우 높음)을 나열하며 라운드 1과 2는 절대 설정하지 않았으므로, 간격은 출시된 기본값일 수 있습니다. 라운드 3은 32개 호출에 걸쳐 명시적으로 고정했습니다.
간격이 일치된 노력에서 닫혔다면, 정직한 헤드라인은 "그냥 기본값일 뿐입니다"였을 것입니다. 그렇지 않았습니다.
Grok 4.6의 토큰 청구서를 어떻게 줄일까요?
reasoning_effort를 낮음으로 설정하면 4.6의 중앙값 출력은 438에서 222 토큰으로 떨어지며, 정확도는 8/8에서 변경되지 않습니다. 어느 쪽이든 동일한 4개 작업입니다: 기본값 수치는 처음 두 라운드에서 12개 호출을 풀고, 낮은 수치는 컨트롤에서 8개를 풉니다.
이는 49% 감소이며, 백만 출력 토큰당 $6에서 이러한 형태의 천 개 호출당 약 $1.30의 가치가 있습니다. 하나의 요청 매개변수는 정상적인 구조화된 작업에서 Grok 4.6의 출력 청구서를 대략 절반으로 줄이며, 측정할 수 있는 것을 포기하지 않았습니다. 4개 작업은 신호이지, 정책이 아닙니다: 처음으로 자신의 혼합에서 테스트하세요.
다른 사람들의 미터가 보여주는 것
Artificial Analysis는 자체 평가 제품군에서 Grok 4.6을 점수화하는 데 $1,068.47, Grok 4.5를 $579.21에 청구했습니다. 그들의 숫자, 우리의 숫자가 아님, artificialanalysis.ai의 Grok 4.6 및 Grok 4.5 모델 페이지에서 2026-08-12에 조회됨.
그들의 1.84배와 우리의 1.38배는 동의하지 않으며, 이유는 정보입니다: 그들의 작업 혼합이 더 무겁고, 그들의 합계는 입력 토큰을 접지는 우리는 출력을 고립시킵니다. 두 개의 미터, 동일한 방향.
캐시 행은 처음으로 HN 사용자 pzo에 의해 런칭 스레드(댓글 49275740)에서 플래그되었으며 두 페이지에서 확인됩니다: 67% 상승, 4.6이 목표로 하는 장기 실행 에이전트 워크로드에서 가장 많이 물립니다. 캐시 재사용이 핵심입니다.
Grok 4.6이 코딩에서 Claude보다 낫습니까?
정확도에서는 일치합니다: Grok 4.6, Claude Sonnet 5, Claude Opus 4.8은 각각 실행된 10개의 코딩 테스트 중 10개를 통과했습니다. 이것은 헤드라인이며, Grok의 경우 실제 이득입니다.
이 항목에 대해서는 텍스트 채점을 중단했습니다. 숨겨진 단위 테스트가 있는 5개 작업, 2개 시도 각각, 30개 호출: ^0.x 경우를 포함한 semver 매칭, 명시적 시계 TTL이 있는 LRU 캐시, 경계를 건드리는 간격 병합, 1m30h 및 1.5h를 거부해야 하는 기간 파서, 합자를 고아화하거나 이모지를 분할하면 안 되는 그래핌 안전 절단. 각 답변은 부프로세스에서 실행되며, 모든 어설션이 유지되는 경우에만 통과합니다. 스크립트 grok_vs_claude_coding.py, benchmark-coding-raw.json에 원본.
정확도 동률은 뉴스입니다. 청구서는 함정입니다: Grok 4.6은 Sonnet 5보다 4.0배, Opus 4.8보다 5.4배 느리게 실행되었습니다. 중앙값 출력 토큰의 4.0배 및 4.9배에서. 그 토큰 욕구는 가격 이점 전체를 먹습니다. Grok 4.6은 출력 토큰이 4.2배 더 저렴함에도 불구하고 이 5개 작업에서 Claude Opus 4.8보다 더 비용이 들었습니다. Grok 4.6이 18,345 출력 토큰을 내보냈기 때문입니다. Opus 4.8에서 3,630. Sonnet 5에 대해서는 1.96배 더 많은 비용이 들었으며, Sonnet의 토큰당 출력 요금은 둘 중 높습니다. 더 저렴한 가격표는 더 저렴한 모델이 아니며, 이는 위의 4.6 대 4.5 숫자를 가르치는 동일한 교훈입니다.
하나의 판단, 측정이 아닌 판단으로 플래그됨: 미디어 및 콘텐츠 자동화 파이프라인에서 우리는 역사적으로 Claude보다 Grok에 도달했으며, 주로 그 X 네이티브 수집 및 마케팅 복사본의 더 느슨한 처리입니다. 우리는 그것에 대한 벤치마크가 없으며 하나를 제시하지 않습니다. 우리가 결정론적으로 채점할 수 있는 코딩 작업에서, 3개는 정확도에서 동률이며 Grok은 4~5배의 토큰을 지불합니다.
우리가 테스트하지 않은 것
당사의 작업은 40/40에서 포화되었으므로, 이는 정상적인 작업에 대한 비용을 측정하며, SpaceXAI가 조정한 에이전트 작업에 대한 기능이 아닙니다. 5가지 제한:
...