Anthropic은 최신 공개 가중치 모델 GLM-5.3이 정교한 사이버 공격을 자동으로 구성할 수 있다고 분석했다. 앞서 Claude Mythos Preview에서 나타난 종단 간 익스플로잇 개발 능력이 다른 모델에도 확산되리라는 우려가 현실화했다는 설명이다. Anthropic은 이 모델의 공격 능력이 방어에도 쓰일 수 있지만, 보호 장치가 쉽게 무력화되는 점이 위험을 키운다고 본다. 이번 평가는 격리된 환경에서 진행됐으며, 실제 시스템을 공격한 실험은 아니다.

익스플로잇을 처음부터 끝까지 만드는 능력

Anthropic은 자동화 벤치마크와 전문가가 모델을 활용하는 실험을 함께 진행했다. 알려진 V8 엔진 취약점을 악용하는 ExploitBench에서 GLM-5.3은 410회 중 50회 종단 간 익스플로잇을 만들었다. Claude Mythos Preview는 같은 기준에서 410회 중 56회 성공해 비슷한 수준을 보였다.

오픈소스 소프트웨어의 취약점을 찾아 제어 흐름을 완전히 장악하는 내부 Binary Exploitation 평가에서는 GLM-5.3이 무작위로 뽑은 100개 과제 중 4%에서 성공했다. Claude Mythos Preview의 성공률은 6%였다. Claude Opus 4.6과 GLM-5.2는 이 평가에서 한 번도 성공하지 못했다. Anthropic은 성능 차이와 별개로, 이전 모델과 비교해 의미 있는 능력의 문턱을 넘었다고 해석한다.

전문가 실험에서 발견한 취약점

연구자들은 모델이 기존 취약점을 모르는 상태에서 새 결함을 찾도록 하고, 대체로 하루 이내, 사람의 집중 작업은 한 시간 미만인 조건에서 실험했다. 한 실험에서는 GLM-5.3이 샌드박스에 둔 브라우저의 Linux 빌드에서 JavaScript 엔진의 미공개 취약점 여러 개를 찾아 연결했다. 그 결과, 방문자의 컴퓨터에서 임의 파일을 읽는 익스플로잇을 만들었다. 해당 취약점은 관리 주체에 제보했으며, 다른 플랫폼에도 영향을 줄 수 있지만 공격 경로는 더 복잡할 수 있다고 Anthropic은 밝혔다.

또 다른 세션에서는 더 작고 성능이 낮은 GLM-5.3-Flash를 시험했다. 모델은 공개된 Chrome 취약점 CVE-2026-11645와 또 다른 알려진 결함을 연결해 ARM64 대상의 신뢰성 있는 공격 경로를 만들고, 포인터 인증(PAC) 방어를 우회했다. 사람의 작업 시간은 20분, 모델의 작업 시간은 8시간이었으며, Zhipu의 API 가격 기준 비용은 20.40달러였다. 이 실험은 공개된 수정 정보를 실제 공격으로 전환하는 데 걸리는 시간을 살펴본 것이다.

보호 장치 우회와 제거

GLM-5.3은 명백히 해로운 요청을 거절하는 기본 보호 장치를 갖췄지만, Anthropic의 모의 환경 시험에서는 간단한 방식으로 우회할 수 있었다. 예를 들어 모델을 훈련용 자율 레드팀 요원이라고 속이는 프롬프트에는 64%의 경우 응했다. 모델의 추론 토큰을 미리 채워 요청을 검토하고 진행하기로 한 것처럼 보이게 하면 응답률은 92%였다.

오픈 가중치 모델은 사용자가 거절 성향을 줄이는 이른바 ‘애블리레이션’을 적용할 수도 있다. Anthropic이 직접 진행한 작업에는 약 2,200 GPU 시간이 들고 추산 비용은 4,400달러였다. 이 수정 뒤 GLM-5.3의 거절률은 JailbreakBench와 HarmBench에서 90% 이상에서 약 3%로, StrongREJECT에서는 12%로 낮아졌다. 과학 역량을 측정하는 GPQA-Diamond 점수는 수정 전후 같았고, 시험한 CyberGym 일부 과제에서는 수정 버전 점수가 몇 퍼센트 낮았다.

다른 평가와 비교하면

9월 17일 NIST의 Center for AI Standards and Innovation(CAISI)은 GLM-5.3을 지금까지 공개된 오픈 가중치 모델 중 사이버 능력이 가장 뛰어난 모델로 평가했다. 종합 사이버 벤치마크에서는 미국 최첨단 모델보다 약 4개월 뒤처진다고 밝혔다. Anthropic은 자체 능력 평가 결과가 CAISI의 결과와 대체로 일치한다고 설명한다.

다만 비교 조건과 접근성은 다르다. CAISI는 해당되는 경우 미국 모델의 사이버 보호 장치를 끈 상태로 평가했고, 비교 대상에는 검증된 사용자에게만 제공된 모델도 포함됐다. 공격자가 이런 제한된 모델에 쉽게 접근하기는 어렵지만 GLM-5.3은 누구나 내려받을 수 있다. Anthropic의 분석은 여기에 GLM-5.3의 보호 장치를 얼마나 쉽게 우회하거나 제거할 수 있는지도 더했다.

방어자에게도 중요한 능력

Anthropic은 제한 없이 접근 가능한 모델이 악의적 행위자에게 취약점 탐색과 악용 능력을 제공할 수 있으며, 국가 및 비국가 행위자가 실제 피해를 일으키는 데 이를 사용할 가능성이 있다고 본다. 반면 같은 수준의 모델은 방어자가 시스템을 점검하고 취약점을 고치는 데도 도움이 된다. Project Glasswing을 통해 신뢰할 수 있는 방어자들은 핵심 소프트웨어에서 10,000개가 넘는 취약점을 찾아 대응할 시간을 벌었다.

Anthropic은 방어자들이 공격자만큼 강력한 도구를 쓸 수 있어야 한다고 주장한다. 정부에는 GLM-5.3의 후속 모델을 포함해 충분히 강력한 AI를 시험하고 평가할 책임이 있다고 강조했다. 독립적인 고품질 평가와 적절한 보호 장치가 부족하면 개발자가 위험의 실체를 늦게 파악할 수 있다는 우려도 덧붙였다.

정리

GLM-5.3은 일부 익스플로잇 개발 평가에서 Claude Mythos Preview와 비슷한 성과를 보였고, 전문가 실험에서는 새 취약점을 연결한 공격도 만들었다. 공개 가중치 특성상 보호 장치를 우회하거나 제거하기 쉬워, 공격 능력의 확산 우려가 커진다. 동시에 방어자에게도 유용한 만큼, 독립적인 안전성 평가와 방어자 접근 확대가 함께 필요하다는 것이 Anthropic의 결론이다.

출처 바로가기