Claude Opus 5 출시: Fable 5 수준의 성능을 절반의 가격으로

Anthropic이 2026년 7월 24일 Claude Opus 5를 출시했으며, 메시지는 명확합니다: Fable 5의 최첨단 지능과 거의 근접하면서도 절반의 가격입니다. 주요 증거는 Frontier-Bench v0.1인데, Opus 5가 43.3%를 기록해 Opus 4.8의 21.1%를 두 배 이상 뛰어넘었습니다. 물론 단점도 있습니다: 모든 테스트에서 우승하지는 못합니다. GPT-5.6 Sol은 여전히 에이전트 코딩 테스트에서 앞서고, 보건 및 생물학 분야에서는 Mythos 5가 우위를 차지합니다. 여기서는 실제로 무엇이 변했는지, 전체 벤치마크 표, 그리고 오늘 기본 모델을 다시 설정해야 하는지 살펴봅니다.

주요 내용:
- Claude Opus 5는 2026년 7월 24일 Claude API, Claude.ai, Claude Code, Claude Cowork에서 출시되었으며, 모델 ID는 claude-opus-5입니다.
- Anthropic의 발행된 벤치마크 대부분(Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench)에서 선두를 기록하지만, 일부 코딩, 법률, 과학 테스트에서는 뒤떨어집니다.
- 가격은 Opus 4.8과 동일하게 입력 토큰당 $5/출력 토큰당 $25이며, Fast 모드는 약 2배 가격으로 약 2.5배 속도를 제공합니다.

오늘 출시된 것: 1분 안에 보는 Claude Opus 5

Claude Opus 5는 Anthropic의 새로운 최첨단 모델로, 2026년 7월 24일에 출시되었으며 같은 날 API, Claude.ai, Claude Code, Claude Cowork에서 이용 가능합니다. 모델 ID는 claude-opus-5입니다. Anthropic의 설명에 따르면, "Claude Fable 5의 최첨단 지능에 가까운 수준을 절반의 가격으로 제공"합니다. 표준 가격은 입력당 $5/출력당 $25 (백만 토큰당)로 Opus 4.8과 동일하게 유지됩니다.

이것은 포인트 릴리스가 아닌 에이전트 업무를 위한 진정한 세대 전환입니다. Claude Opus 4.8에서 업그레이드하는 경우 API 구조와 Claude Code 통합은 변경되지 않으므로 마이그레이션은 모델 ID 변경만 하면 됩니다. 차이점은 상한선입니다: Frontier-Bench v0.1에서 Anthropic은 Opus 5가 4.8의 점수를 두 배 이상 높이면서도 작업당 비용이 더 낮다고 말하며, GDPval-AA와 ARC-AGI-3에서 최첨단 수치를 기록합니다.

이러한 위치 결정이 중요합니다. Fable 5는 Anthropic의 가장 비싼 최첨단 모델입니다. Opus 가격대에서 그에 근접한 수준을 제공하는 것이 이 릴리스의 핵심이며, "절반의 가격" 라인이 Anthropic이 먼저 강조하는 이유입니다.

Opus 5 vs 4.8에서 실제로 새로운 것은?

4.8에서 5로의 가장 큰 변화는 판단력입니다: Opus 5는 자신의 작업을 검증하고 작업이 그럴듯하게만 완료된 것이 아니라 실제로 완료될 때까지 반복하는 데 훨씬 능합니다. Anthropic은 또한 더 강력한 소프트웨어 엔지니어링, 지식 업무, 과학 연구, 그리고 개선된 시각적 출력을 언급합니다. 가격과 핵심 API는 유지됩니다.

더 나은 판단력과 자체 검증

가장 명확한 행동 변화는 Opus 5가 자신을 검증한다는 것입니다. Anthropic은 기술 담당자 Zimu Li의 말을 인용하며, 이 모델을 "분기를 검증하고 템플릿을 확인"하는 모델이라고 설명합니다. 프로덕션에서 에이전트가 자신의 실수를 포착하는 데 의존하는 누구에게나 이것이 바뀌는 특성입니다. 벤치마크 차트에서 판매하기가 가장 어려운 것이기도 하므로, 자신의 업무에서 테스트할 주장으로 봅시다.

Opus 비용의 최첨단 지능

Cursor의 공동 설립자 Sualeh Asif는 이 릴리스를 "Opus 속도와 비용의 Fable 5에 가까운 지능"이라고 요약했습니다. 그것이 실질적인 해석입니다: Fable 5 수준의 추론을 원했지만 가격을 정당화할 수 없던 팀들은 이제 중간 옵션을 가지고 있습니다. OSWorld 2.0에서 Anthropic은 Opus 5가 대략 3분의 1의 비용으로 Fable 5를 능가한다고 말하며, 이것이 가치 논의의 가장 명확한 단일 사례입니다.

정렬과 안전 태도

Anthropic은 Opus 5가 지금까지 가장 낮은 정렬 해제 동작 점수(2.3)를 가지고 있으며 헌법에 가장 맞는 모델이라고 보고합니다. 보안 측면에서 사이버 보안 분류기는 Fable 5의 약 85% 덜 제한적이라고 설명되며, 필요한 팀을 위한 엔터프라이즈 Cyber 검증 프로그램이 있습니다. 모든 공급업체 안전 주장과 마찬가지로, 알아두면 좋지만 자신의 레드팀 사례에 대해 검증할 가치가 있습니다.

Opus 5 벤치마크: 우승한 곳 (그리고 졌던 곳)

Opus 5는 Anthropic의 발행된 벤치마크 대부분에서 선두를 기록하며, 에이전트 빌더에 중요한 우승은 일방적입니다: Frontier-Bench v0.1 (43.3%), GDPval-AA (1861 Elo), ARC-AGI-3 (30.2%), OSWorld 2.0 (70.6%), 그리고 Zapier의 AutomationBench (26.0%). 정직한 예외: GPT-5.6 Sol이 DeepSWE v1.1을 우승하고, Fable 5가 FrontierCode와 법률 테스트에서 우위를 차지하며, Mythos 5가 보건 및 생물학을 차지합니다.

출처: Anthropic

절대 점수가 아닌 변화량을 읽으세요. Frontier-Bench는 Opus 4.8보다 +22.2 포인트 증가했습니다 (21.1에서 43.3), 가장 큰 단일 상승이며 Anthropic이 이것을 코딩 및 에이전트 릴리스라고 부르는 이유입니다. GDPval-AA는 +268 Elo (1593에서 1861) 상승했으며, 표의 모든 모델을 지식 업무에서 능가합니다. ARC-AGI-3은 눈에 띄는 것입니다: GPT-5.6 Sol의 7.8%와 Opus 4.8의 1.5%에 비해 30.2%이며, Anthropic은 이것을 신규 문제 해결에서 차선 공개 모델의 약 3배로 프레이밍합니다. AutomationBench에서 26.0%는 필드의 약 1.5배이며, 비즈니스 프로세스 에이전트를 구축하는 누구에게나 직접적인 신호입니다.

손실에 대해 두 가지 정직한 노트입니다. 첫째, Fable 5 열의 건강 리더 (66.0%)와 생물학 인간이 해결한 분할은 실제로 Fable 5가 아닌 Anthropic의 과학 전문 모델인 Mythos 5입니다. 따라서 이들은 일반 모델 우승처럼 비교할 수 없습니다. 둘째, 코딩 그림은 진정으로 나뉩니다: GPT-5.6 Sol이 DeepSWE v1.1을 차지합니다 (72.7% vs 68.8%), 그리고 Fable 5가 FrontierCode를 근소하게 우승합니다 (53.5% vs 53.4%). 당신의 작업이 순수 SWE-bench 스타일 코딩인 경우, "최고 전반" 라벨이 자동으로 Opus 5를 선택하지 않습니다.

Opus 5의 비용은? 가격 책정 및 Fast 모드

표준 Opus 5 가격은 입력 토큰당 백만당 $5, 출력 토큰당 백만당 $25이며, Anthropic의 발행된 가격에 따르면 Opus 4.8과 동일하므로 업그레이드에 대한 가격 인상이 없습니다. "절반의 가격" 클레임은 4.8이 아닌 Fable 5에 상대적입니다: Fable 5 요율을 지불하지 않고 Fable 5에 가까운 지능을 얻습니다. Fast 모드는 기본 가격의 약 2배로 실행되며 대략 2.5배의 기본 속도를 제공하며, API는 폴백 라우팅을 지원합니다.

그러면 작업당 비용은 어떻게 됩니까? 표준 가격에서 4.8에 비해 추가 비용을 지불하지 않으며 큰 기능 향상을 얻습니다. 대부분의 작업에 대해 업그레이드는 거의 무료입니다. Fast 모드는 대화형 세션 레버입니다: 같은 모델에서 출력이 약 2.5배 빠르게 스트리밍되는 2배 가격 프리미엄을 거래하며, 기다리고 있을 때는 이익이지만 벽시계 시간이 관련이 없는 밤새 배치를 실행할 때는 해를 끼칩니다. 레이트 제한이 실제 제약인 경우, Claude 사용량 제한에 대한 우리의 가이드는 티어가 비용과 어떻게 상호작용하는지 다룹니다.

Opus 5가 프로덕션 에이전트에 적합한 위치

이득은 프로덕션 에이전트가 살고 있는 곳에 정확히 집중됩니다: 터미널 코딩 (Frontier-Bench), 컴퓨터 사용 (OSWorld 2.0), 에이전트 검색 (BrowseComp), 그리고 다중 단계 비즈니스 워크플로우 (AutomationBench). 이 네 가지는 실제 배포에서 가장 자주 부서지는 작업이므로, 모두에서 한 번에 점프하는 모델이 배송 가능한 것을 변경합니다.

그것은 앉아서 생각해볼 가치가 있는 부분입니다. AutomationBench와 같은 벤치마크는 에이전트가 끝에서 끝까지 실제 다중 도구 워크플로우를 완료할 수 있는지 측정하며, Opus 5의 26.0%와 필드의 대략 17%는 "데모를 잘 하는 것"과 "지저분한 CRM과 실제 접촉에서 살아남는 것" 사이의 차이입니다. OSWorld 2.0 결과 (70.6%, 3분의 1의 비용으로 Fable 5를 우승)는 실제 소프트웨어를 클릭하는 컴퓨터 사용 에이전트에 대해 같은 것을 말합니다. 고객 대면 AI 에이전트를 배송하는 팀의 경우, 이들은 오전 2시 장애를 줄이는 것으로 번역되는 숫자입니다.

또한 우리가 의존하는 설계 패턴의 비용을 낮춥니다: 저렴한 자체 검증. 모델이 자신의 분기를 검증하는 데 진정으로 더 나을 때, 별도의 평론가 패스에 더 적은 토큰을 사용하고 여전히 동일한 오류를 포착할 수 있습니다. 이것은 대량으로 에이전트를 실행하는 누구에게나 실제 예산 라인입니다.

...

출처 바로가기