
Anthropic은 Claude가 과학자들이 사용하는 오픈소스 생체분자 모델을 더 빠르고 적은 메모리로 실행하도록 최적화한 결과를 공개했다. Claude는 4주가 채 되지 않는 기간에 30개가 넘는 모델을 개선했고, 작업 속도는 평균 약 4배 빨라졌다. 또한 단일 NVIDIA GPU 노드에서 10,000토큰이 넘는 생체분자 시스템을 정확하게 예측할 수 있는 저메모리 모드도 만들었다. 이번 결과는 단백질 설계뿐 아니라 구조 예측, 유전체학, 단백질 언어 모델 등 다양한 생명과학 연구의 진입 장벽을 낮추는 데 초점이 맞춰져 있다.
단백질 구조 예측과 설계 모델을 빠르게 만들다
단백질 구조 예측은 아미노산 서열만으로 단백질의 3차원 구조를 알아내는 작업이며, 단백질 설계는 특정 구조나 기능, 특성을 갖는 단백질을 새로 만드는 과정이다. 두 기술은 암이 형성되는 과정 같은 생체분자 현상을 분석하거나, 암을 표적으로 삼는 약물 후보를 만드는 데 활용된다. 그러나 AlphaFold3, OpenFold3, Boltz-2 같은 최신 모델은 생체분자 토큰 세 개의 관계를 계산하는 ‘triangle attention’과 ‘triangle multiplication’에 많은 시간과 메모리를 사용한다.
이 연산은 시스템의 크기에 따라 비용이 세제곱으로 증가한다. 시스템 크기를 2배로 늘리면 시간과 메모리가 8배 필요하고, 3배로 늘리면 27배가 필요하다. Anthropic은 Claude와 함께 이 두 연산을 가속하는 맞춤형 커널인 FlashPairformer를 개발했다. FlashPairformer는 모델 설정에 따라 triangle attention에서 기존 표준보다 평균 2.7~2.9배, triangle multiplication에서 1.7~3.2배 높은 속도를 기록했다.

30개가 넘는 오픈소스 모델을 최적화하다
Claude는 공통으로 적용할 수 있는 커널을 만드는 데 그치지 않고, 각각의 모델을 살펴보며 개별 최적화도 수행했다. 중복 계산한 결과를 저장해 다시 활용하고, 실행될 필요가 없는 분기를 상수 결과로 단순화하는 방식 등이 포함됐다. 그 결과 구조 예측 모델은 평균 4배 빨라졌으며, 각 모델의 가속 버전이 구조 예측 같은 후속 작업의 성능에 영향을 주지 않는다는 점도 확인했다.
이 작업은 일반적으로 숙련된 엔지니어 팀이 모델마다 수주에 걸쳐 수행해야 한다. 게다가 한 모델에서 만든 최적화가 다른 모델에 그대로 이전되지 않는 경우도 많다. Anthropic의 기술진 두 명이 생체분자 모델링 분야를 감독했지만 추론 최적화나 커널 엔지니어링 경험은 없는 상태에서, Claude는 생체분자 구조 예측·단백질 설계·단백질 언어 모델·유전체학 분야의 오픈소스 모델 30개 이상을 4주가 채 되지 않아 개선했다.
Claude는 평균적으로 정밀도를 아주 조금만 낮추면 작업을 약 4배 빠르게 만들었고, 출력 결과를 동일하게 유지하면서도 거의 2배의 속도 향상을 보였다. 초기 단계에서는 Claude Mythos 5.1이 생물학 오픈소스 모델 7개를 최대 2.5배 빠르게 만든 결과도 있었다. Anthropic은 이런 사례가 향후 연구자들이 과학 도구를 더 빠르고 쉽게 구축하는 데 최첨단 AI 모델이 기여할 수 있음을 보여준다고 설명했다.
더 큰 생체분자 시스템을 한 대의 GPU에서 모델링하다
세포 안에서 중요한 기능을 수행하는 리보솜, 세포에 에너지를 공급하는 호흡 복합체, 다른 단백질의 접힘을 돕는 샤페론은 수십 개의 구성 요소가 결합한 거대한 분자 기계다. 이들의 기능은 각 구성 요소가 어떻게 맞물리고 상호작용하는지에 달려 있지만, 지금까지 이런 규모의 구조를 예측하려면 여러 GPU 노드에 추론 작업을 분산해야 하는 경우가 많았다. 이는 대다수 분자생물학자가 쉽게 이용하기 어려운 수준의 컴퓨팅 자원이었다.
Claude는 메모리 사용량을 줄이는 ‘Big’ 모드를 만들었다. 이 모드는 단일 NVIDIA GPU 노드에서 10,000토큰이 넘는 시스템을 정확하게 모델링하고, 70,000토큰보다 큰 시스템에서도 추론을 성공적으로 수행할 수 있게 한다. Big 모드로 성공적으로 접힌 대상에는 인간 미토콘드리아 복합체 I, TRiC 샤페론 복합체, 프로테아좀, 세균 리보솜이 포함된다. 복합체 I과 70S 리보솜은 각각 10,000토큰이 넘으며, AlphaFold3가 정확하게 예측한 40S 리보솜의 7,663토큰보다 크다.

예측 가능한 크기의 한계를 넓히다
Anthropic은 최적화의 한계를 시험하기 위해 이전보다 훨씬 큰 시스템도 대상으로 삼았다. 단일 8-GPU B300 노드에서 Claude는 31,000토큰 이상에서 70,000토큰 이상에 이르는 바이러스 캡시드와 단백질 구획 전체의 구조 예측을 생성했다. 이 시스템들은 구조 예측 모델의 학습 컨텍스트보다 거의 두 자릿수 규모로 크기 때문에, 생성된 구조가 정확하지 않았다는 점은 분명히 구분해야 한다.
그럼에도 이 규모의 추론에 필요한 장벽은 크게 낮아졌다. 이제 단 하나의 NVIDIA B300 노드만으로 해당 계산을 시도할 수 있기 때문이다. 이는 도구가 더 발전하면 연구자들이 점점 복잡한 생물학적 시스템을 컴퓨터 안에서 모델링할 수 있을 가능성을 보여준다. 다만 이번 결과는 거대한 시스템을 실행할 수 있다는 의미이지, 그 구조를 정확히 예측했다는 뜻은 아니다.
단백질 결합체 설계 비용도 줄이다
이전 단백질 설계 실험에서 Claude는 약 16,000단어의 프롬프트와 하위 에이전트를 활용했고, 24시간 동안 표적 하나당 최대 $10,000, 즉 약 2,500 NVIDIA H100 GPU 시간을 사용할 수 있었다. 이번에는 단일 Claude 모델에 NVIDIA H200 한 대와 24시간의 실행 시간, 약 1,100단어 분량의 프롬프트와 사전 설치 도구 안내만 제공했다. 하위 에이전트도 없었고, 사람이 설계를 직접 조정하지도 않았다.
Anthropic은 가속된 생체분자 모델을 이용해 Claude Mythos 5.1, Mythos 5, Opus 5를 16개 표적에 적용했다. 설계 결과는 실험실에서의 결합 가능성을 예측하는 것으로 알려진 컴퓨터 시뮬레이션 지표 ipSAE로 평가했다. 16개 표적의 결과를 평균했을 때 세 모델의 중앙값 설계와 최고 점수 설계는 이전 Mythos 5.1 캠페인과 대략 같은 ipSAE 값을 보였다.
이 성능을 내는 데 필요한 GPU 시간은 이전 캠페인보다 약 두 자릿수 적었다. Claude의 토큰 비용까지 합산해도 GPU와 토큰에 약 $150를 지출하면 이전 캠페인과 같은 수준의 컴퓨터상 성능을 얻을 수 있었다. 이는 단백질 결합체 설계가 대규모 컴퓨팅 자원을 가진 연구자만의 작업이 되지 않도록 비용 구조를 바꿀 수 있음을 시사한다.
오픈소스 공개와 단백질 설계 대회
Anthropic은 이번에 최적화한 모델들의 코드를 오픈소스로 공개했다. 전문 생물학 모델은 약물 발견과 개발을 비롯해 분자생물학 연구 전반에서 널리 사용되므로, 코드 공개는 특정 실험에 국한되지 않고 더 넓은 연구 공동체가 속도와 메모리 개선을 활용하도록 하려는 조치다. Anthropic은 결과의 기술적 세부 사항을 기술 보고서에서도 제공한다고 밝혔다.
또한 Adaptyv Bio와 함께 단백질 설계 대회를 공동 후원한다. 두 조직은 종 간 교차 반응성, pH 민감성, peptide-MHC 특이성, GPCR 같은 어려운 표적을 포함해 현재 단백질 설계 역량의 최전선에 있는 5개 문제를 선정했다. 공동체가 제출한 5,000개가 넘는 설계는 Adaptyv Bio에서 실험적으로 검증될 예정이다.
참가 연구자에게는 최대 $1 million의 Claude 크레딧과 실험 검증을 위한 추가 지원이 제공된다. Modal은 최대 $250,000의 컴퓨팅 크레딧을, Twist Bioscience는 대회에 필요한 DNA를 제공한다. Anthropic은 생명과학자를 위한 Life Sciences Verification Program도 시작했으며, 첫 조직 그룹을 등록한 뒤 공개 베타를 열었다.
정리
Anthropic의 이번 작업은 생체분자 모델의 정확도를 크게 바꾸지 않으면서 실행 속도와 메모리 효율을 개선한 사례다. 30개가 넘는 모델을 4주가 채 되지 않아 최적화하고, 10,000토큰을 넘는 시스템을 단일 GPU 노드에서 다룰 수 있게 한 점이 핵심이다. 단백질 결합체 설계에서도 이전과 비슷한 컴퓨터상 성능을 약 $150와 훨씬 적은 GPU 시간으로 재현했다. 최적화 코드 공개와 5개 문제를 다루는 대회는 이러한 개선을 더 넓은 생명과학 연구로 확산하려는 후속 조치다.