Anthropic이 소개한 이 글은 AI가 과학자를 대체한다는 이야기가 아니라, 지금의 AI가 잘할 수 있는 문제에 맞춰 연구 방식을 바꾼 경험을 다룬다. 물리학자 매튜 슈워츠는 Claude를 사람 연구자처럼 다루며 답답함을 느낀 뒤, AI의 계산·코딩 능력에 맞는 문제를 찾아가는 접근을 택했다. 그 과정에서 정량 과학 계산 도구 모음인 BootLoops를 만들었고, 물리학에서 시작해 생태학과 유전학 등 여러 분야로 연구를 넓혔다. 핵심은 AI가 결과를 내더라도, 그 결과가 과학적으로 중요한지 판단하고 방향을 잡는 일에는 전문가의 역할이 여전히 필요하다는 점이다.

사람 연구자와 AI 사이의 ‘불일치’

현재의 대형 언어 모델은 폭넓은 지식과 뛰어난 코딩 능력을 갖췄지만, 사람 과학자처럼 깊은 개념적 질문을 스스로 세우고 연구를 이끄는 데는 한계가 있다. 과학자들이 원하는 협업 방식과 AI가 실제로 잘하는 일 사이에 ‘임피던스 불일치’, 즉 서로의 입력이 잘 맞물리지 않는 문제가 생긴다. 잘 정의된 수학 문제처럼 답을 명확히 검증할 수 있는 과제에서는 AI의 성과가 두드러지지만, 대부분의 과학은 그렇게 답이 분명하지 않다. 슈워츠는 사람처럼 일하길 기대하기보다, 현 세대 AI에 맞는 ‘Claude-shaped’ 문제를 찾아야 한다고 봤다.

계산 도구에서 BootLoops로

슈워츠는 수리물리학 도구를 Claude와 함께 만들기 시작했고, 그 도구들이 다른 분야의 계산 문제에도 쓰일 수 있음을 발견했다. 이 반복적인 개발로 소프트웨어와 연구 절차를 묶은 BootLoops가 탄생했다. 특정 모델에 종속되지 않은 오픈소스 도구이며, 정량적 과학 문제를 AI가 다루도록 돕는 일종의 작업 환경이다. 특히 수학·물리학·컴퓨터과학의 기술이 함께 필요하고, 계산 결과를 독립적으로 확인할 수 있는 문제에 적합했다.

물리학의 미해결 계산을 빠르게 풀다

첫 적용 분야는 입자 충돌 결과를 해석하는 산란 진폭 계산이었다. 기존에는 파인만 다이어그램에 해당하는 적분을 직접 계산하거나, 물리적 제약을 차례로 적용하는 S-행렬 부트스트랩을 사용했다. 슈워츠는 Claude가 관련 코드를 공통 틀로 옮기고 기존 결과를 재현하게 했으며, 약 20분 만에 자신의 논문 결과를 다시 얻었다고 설명한다. 이어 로그 함수 중심의 계산을 타원 함수 적분으로 확장했고, 몇 주 만에 총 30개의 적분을 완전히 계산했다. 이 가운데 15개는 알려진 결과의 재현이었고, 나머지 15개는 이전에 계산된 적이 없는 결과였다.

계산의 연결을 연구 가치로 바꾸기

같은 수학적 구조가 서로 다른 과학 분야에서 반복된다는 점은 BootLoops의 활용 범위를 넓혔다. Claude는 생태학의 중립 생물다양성 이론에서 람팔 에티엔이 2005년에 제시한 방정식을 계산했고, 파나마 운하의 바로 콜로라도 섬 숲에서 나무 종 구성이 중립 이론의 예측보다 4.5배 빠르게 변한다는 결과를 얻었다. 그러나 생태학자 제임스 오드와이어는 기술적 성과만으로는 많은 연구자가 큰 의미를 느끼기 어렵다고 지적했다. 그 조언을 반영해 중립 이론의 예측을 뺀 나머지를 분석하고, 자연선택·경쟁·종 간 차이를 고려한 최소 예측 모델로 발전시켰다. 현재는 파나마 밖의 여러 산림 자료에도 이 모델을 적용하고 있다.

유전체에서 찾아낸 신호와 여러 분야의 확장

집단유전학에서는 자연선택이 희귀 돌연변이에 미치는 영향을 나타내는 30년 된 적분식을 풀고, gnomAD 자료에 적용했다. 초기 결과는 전문가에게 과학적 중요성을 인정받지 못했지만, 마이클 데사이의 제안에 따라 염색체 안에서 가까이 놓인 돌연변이 쌍의 상관관계로 질문을 바꿨다. 1000 Genomes Project의 가까운 돌연변이 쌍 57억 개를 분석해 유전자 전환의 증거를 찾았다. 연계 유전 변이를 사용하는 집단 역사 연구나 질병 지도 분석은 대체로 유전자 전환을 무시해 왔다는 점에서 의미가 있다. 다른 협업에서는 경제학 논문 4,452편의 재현 패키지를 오픈소스 코드로 옮겨 약 3만 개 루틴을 점검했고, 강세 정보 데이터베이스 AccStack에는 6,072개 언어와 16만 건의 음운론 문헌 목록을 담았다.

속도만큼 중요한 검증과 사람의 판단

슈워츠는 3개월 동안 18개 분야, 19명의 공동저자와 함께 36개의 원고를 진행했으며, 약 400개의 후보 문제를 살펴봤다고 밝혔다. 여러 Claude 세션과 계산 에이전트를 활용했지만, AI가 완료를 성급히 선언하거나 검증되지 않은 가정을 결과처럼 제시하는 일도 반복됐다. 그래서 성공 기준을 분명히 정하고, 그래프와 계산을 직접 확인하며, AI의 결론을 설명하게 해야 했다. 또한 모델이 연구의 중요성을 스스로 판별한다고 믿지 말고, 해당 분야 전문가의 판단을 구해야 한다. AI는 계산을 오래 밀어붙이는 경향도 있어, 더 나은 알고리즘이나 도구를 만들 수 있는지 계속 물을 필요가 있었다.

정리

BootLoops 사례는 AI가 정량 계산과 코딩에서 과학 연구의 속도를 높일 수 있음을 보여준다. 하지만 결과를 중요한 질문으로 다듬고 해석하는 과정에는 사람의 개념적 판단과 분야 지식이 필요하다. 슈워츠는 과학적 방법 자체를 바꾸기보다, 데이터와 검증을 중심으로 한 기존 연구 과정에 AI를 참여시키는 방향을 제안한다. 기술 작업을 자동화하면 과학자는 계산의 반복에서 벗어나 연구의 방향과 의미를 더 깊이 고민할 수 있다.

출처 바로가기