
앤트로픽이 가격을 크게 낮추면서 최고 수준의 성능을 갖춘 소형 모델 ‘클로드 하이쿠 5.5(Claude Haiku 5.5)’를 선보였다. 기업공개(IPO)를 앞두고 AI 제품군을 대폭 확장하는 가운데, 가볍고 빠르며 저렴한 모델을 앞세워 기업용 AI 시장 점유율을 크게 높이려는 전략이다.
앤트로픽은 7일(현지시간) 하이쿠 5.5를 공개했다. 회사가 특히 내세운 강점은 비용 효율성과 처리 속도다. 요약, 데이터베이스 쿼리, 분류 요청처럼 빠른 처리가 필요한 반복 작업을 안정적으로 수행하도록 설계됐다. 상위 모델인 ‘오퍼스 5.5’와 ‘소네트 5.5’를 보조하는 하위 에이전트(Sub-agent) 역할에도 최적화됐다.
10만 토큰 이하 요청의 입력 및 출력 가격은 100만 토큰당 각각 0.10달러와 0.50달러다. 전작보다 90% 낮아진 가격으로, 경쟁 모델인 오픈AI의 ‘GPT-6 루나’와 같은 수준이다. 10만 토큰을 넘는 요청에는 5배인 0.50달러와 2.50달러가 적용되는 단계별 요금제가 도입됐다.
하이쿠 계열 모델 중 처음으로 조정 가능한 ‘작업량 설정(Workload settings)’ 기능도 제공한다. 사용자는 업무 성격에 따라 비용과 지능 가운데 무엇을 우선할지 직접 선택할 수 있다.
고위험 사이버 보안 요청에 대응하는 안전장치가 내장된 첫 하이쿠 모델이기도 하다. 이 장치는 일반적인 일상 업무에는 영향을 주지 않는다. 필요하면 검증 프로그램을 신청해 활용 범위를 넓힐 수 있다. 컨텍스트 창은 기존 20만 토큰에서 100만 토큰으로 크게 확장됐다.

벤치마크 결과, 하이쿠 5.5는 에이전트 능력과 실무 지식 작업에서 ‘GPT-6 루나’를 앞서는 성과를 냈다. 지식 노동 역량을 평가하는 ‘GDPval-AA v2.1’에서는 1620점을 기록했다. 전작 하이쿠 4.5의 735점은 물론 GPT-6 루나의 1437점도 크게 웃돌았다. 실제 업무 환경을 측정하는 ‘AA-브리프케이스 v1.1’에서도 1578점을 얻어 GPT-6 루나(1336점)에 확실한 우위를 보였다.
컴퓨터와 운영체제(OS) 조작 능력을 평가하는 ‘OS월드 2.1’에서는 정확도 72.4%를 달성했다. 하이쿠 4.5(15.7%)와 GPT-6 루나(48.9%)를 큰 폭으로 앞선 수치다. 추론 능력을 평가하는 ‘인류의 마지막 시험(HLE)’에서는 도구를 사용하지 않았을 때 45.9%, 사용했을 때 57.4%를 기록해 도구 활용에 따른 지능 향상을 보여줬다.
에이전트 코딩 능력을 평가하는 ‘터미널벤치 4.0’ 점수는 39.2%로, GPT-6 루나(16.4%)보다 높았다. 차트 해석 등 시각적 추론은 도구를 사용하지 않은 기준으로 46.4%를 기록했다.
독립 AI 분석 기관 아티피셜 애널리시스의 AI 지수(AAII)에서는 43점을 받았다. 1년 전 출시된 전작보다 26점 오른 결과다. 최대 노력 설정에서는 GLM-5.3 플래시(42점), 제미나이 3.8 플래시(41점), GPT-6 루나(38점)를 모두 앞섰고, 2.8조 매개변수 규모의 오픈 모델 키미 K3(44점)에 가까운 점수를 냈다.
아티피셜 애널리시스는 “에이전트 기반 지식 작업과 터미널 활용 능력에서 매우 뛰어난 성능을 발휘한다”고 평가했다. 다만 인텔리전스 인덱스 작업 한 건을 수행하는 데 출력 토큰을 약 16만2000개 사용했다. 이는 GPT-6 루나가 최대 설정에서 쓰는 약 5만 개보다 3배 이상 많은 양이다.
업데이트된 토크나이저를 적용하면서 전작보다 같은 작업에 필요한 토큰 수가 전반적으로 조금 늘었다. 그러나 기본 API 단가가 최대 90% 낮아져 실제 종합 운영 비용은 평균 75% 절감된다.
사실적 지식 정확도를 측정하는 AA-Omniscience 점수는 36%로, 제미나이 3.8 플래시(55%)와 GPT-6 루나(44%)보다 낮았다. 반면 답을 모를 때 모른다고 인정하는 비율은 높았다. 이에 따라 오인률은 40%로, 다른 모델의 55~77%보다 눈에 띄게 낮았다.
안전 거부 문제로 낮은 점수를 받은 오토메이션벤치-AA(AutomationBench-AA(35%) 평가는 앤트로픽의 수정 작업이 끝난 뒤 다시 진행될 예정이다.
업계와 엔지니어들의 긍정적인 평가도 이어졌다. 아사나의 에어런 빈 수석 엔지니어는 “에이전트 워크플로우 처리 지연 시간이 30% 이상 줄고 응답 속도가 최대 2.5배 빨라졌다”고 말했다. 허브스팟)의 제브 클라포 수석 엔지니어는 “CRM 감사 작업 테스트에서 92.8%의 최고 점수를 얻었으며 가장 빠른 처리 속도와 최저 오탐률을 보였다”고 밝혔다. 코그니션도 자체 에이전트 ‘데빈 퓨전’의 서브 모델로 하이쿠 5.5를 도입해 비용과 지연 시간을 크게 줄였다고 전했다.
X와 레딧, 개발자 블로그 등 온라인 커뮤니티에서는 “소형 모델이 과거 플래그십 수준의 추론 성능을 내면서 비용은 10분의 1로 내려갔다”, “소비자용 앱과 에이전트 서비스 구축에 최적의 카드”라는 반응이 나왔다.

앤트로픽은 하이쿠 5.5를 출시하면서 클로드 소네트 5.5의 캐시 읽기 가격도 50% 낮췄다. 새 가격은 100만 토큰당 0.10달러다. 이에 따라 소네트 5.5 기반 에이전트 작업 실행 비용은 약 20% 줄어든다.
구독자를 위한 지원도 마련했다. 맥스 및 팀 요금제 이용자에게 개발용 API 크레딧을 매월 최대 500달러까지 차등 지급하고, 개발자용 SDK를 업데이트해 컴퓨터와 브라우저 환경의 베타 지원을 본격화했다.
클로드 하이쿠 5.5는 앤트로픽 API 플랫폼과 아마존웹서비스(AWS), 구글 클라우드, 마이크로소프트 애저 등 주요 클라우드 환경에서 바로 사용할 수 있다.
한편 이번 신작은 앤트로픽이 AI 속도 조절을 주장한 뒤 공개한 세 번째 모델이다. 지금까지 오퍼스와 소네트, 하이쿠 등 중소형 모델이 출시됐으며, 플래그십 제품군인 ‘페이블’이나 ‘미소스’급 첨단 모델은 아직 공개되지 않았다.