Anthropic은 올해 초 외부 연구진이 실제 Claude 사용 데이터에 접근하여 독립적으로 분석할 수 있는 파일럿 프로그램을 시작했습니다. 스탠퍼드대학교의 SALT Lab, 옥스퍼드대학교의 Human Information Processing Lab, 그리고 AI 평가 기관 METR 등 3개 연구기관이 각자의 연구를 설계하여 진행했습니다. 이는 AI 기업의 실제 사용 데이터를 외부 연구자가 독립적으로 분석한 첫 사례입니다. AI가 사회에 미치는 영향을 제대로 이해하려면 실제 사용 현황에 대한 폭넓은 분석이 필수인데, 지금까지는 AI 기업 내부 분석에만 의존해야 했기 때문입니다.

왜 데이터를 외부에 공개하기로 했나

현재 AI와의 상호작용 데이터는 소수 AI 기업에만 집중되어 있습니다. 외부 연구자들은 두 가지 선택지만 있었습니다. 첫째, AI 기업이 발표한 분석을 인용하는 방식인데, 실제 데이터를 반영하지만 기업의 관심사에만 답합니다. 둘째, 공개 데이터셋을 사용하는 방식인데, 일상적이고 창의적인 활용에 치우쳐 실제 프로덕션 환경을 반영하지 못합니다. 두 방법 모두 AI의 진정한 사용 현황을 독립적으로 연구하기에는 부족했습니다. Anthropic은 사용자 프라이버시를 보호하면서도 외부 연구자에게 데이터 접근을 제공하는 새로운 방식을 시도하기로 했습니다.

인간과 AI의 협업 방식

스탠퍼드 SALT Lab은 약 25만 개의 Claude 대화(2026년 4월~5월)를 분석하여 인간-AI 협업의 특성을 연구했습니다. 기존 연구는 사람들이 저책임 작업만 AI에 맡긴다고 가정했으나, 실제 데이터는 다른 결과를 보여줬습니다. Claude 대화의 절반 이상이 사람들의 의사결정이나 타인에게 영향을 미치는 중대한 작업을 포함했습니다. 특히 법률이나 금융 자문을 구할 때 이런 경향이 두드러졌습니다. 대화의 약 4분의 3에서 사람들이 작업 방향을 설정하고 Claude가 보조했으며, 대부분 Claude의 결과를 수정하거나 개선하여 사용했습니다. 인상적인 점은 인간-AI 협업의 마찰이 방해 요소가 아니라 생산적이었다는 것입니다. 사람들이 Claude의 시도를 검토하고, 요청의 불명확한 부분을 파악하고, 지시를 반복 정교화하는 과정이 더 나은 결과를 만들었습니다.

AI의 행동과 사용자 감정의 상관관계

옥스퍼드 Human Information Processing Lab은 Claude 사용 중 사용자의 감정과 AI의 행동 간의 상관관계를 분석했습니다. Claude의 따뜻한 응답이 사용자의 긍정적 반응과 함께 나타났고, 거부나 이의제기는 사용자의 반발과 동반되었습니다. Claude의 창의적이고 예상 밖의 반응은 사용자의 지적 참여도를 높였으며, 단순한 도움은 사용자의 만족도를 높였습니다. 특히 주목할 점은 Claude 사용 중의 몰입, 좌절감, 즐거움 등의 감정 패턴이 일반 인터넷 사용 시의 패턴과 유사하다는 발견입니다. 이는 사람들이 AI와 상호작용하는 방식이 다른 디지털 활동과 본질적으로 비슷하다는 의미입니다.

코딩 작업의 생산성 향상

METR은 Claude Code 대화를 분석하여 코딩 에이전트의 생산성 향상을 정량 측정했습니다. Claude의 시간 예측과 실제 소요 시간을 비교한 결과, 더 향상된 모델이 사용자의 시간을 훨씬 더 많이 절약했습니다. 최신 모델은 이전 모델보다 상당히 빠른 속도 개선을 제공했습니다. 흥미로운 점은 Claude의 시간 추정이 개발자 연구의 실제 완료 시간과 잘 일치했다는 것입니다. METR은 현재 AI가 연구자의 작업을 얼마나 가속화하는지 측정하는 방향으로 분석을 확대하고 있으며, 이는 AI가 스스로의 개발에도 참여하는 시대에 점차 중요해질 것입니다.

프로그램 운영의 교훈과 과제

이 파일럿을 통해 Anthropic은 중요한 교훈을 얻었습니다. 첫째, 같은 연구 문제를 다양한 관점에서 독립적으로 추구할 때의 가치입니다. METR의 연구가 내부 경제학 연구와 겹친 부분이 있었는데, 이를 통해 외부 연구자들이 동일한 데이터에서 독립적인 결론을 내릴 수 있음을 확인했습니다. 둘째, 외부 연구 방법의 조정 필요성입니다. Anthropic Insights 도구에서 질문의 표현이 데이터 분류 정확도에 영향을 미치므로, 외부 파트너들은 공개 데이터셋 WildChat으로 사전 테스트했으나 실제 Claude 트래픽과의 차이로 오류가 발생했습니다. 셋째, 투명성과 보안의 균형입니다. 이용약관 위반 사례는 대부분 공개했으나 보안 우회 방법이 드러나는 정보는 제외했으며, 각 연구에서 영향받은 범주는 5% 미만이었습니다.

정리

Anthropic의 이 파일럿은 AI 사용 데이터의 외부 공개와 독립적 연구를 가능하게 한 업계 첫 사례입니다. 3개 기관의 분석을 통해 사람들이 중대한 작업을 AI에 위임하며, AI의 행동이 사용자 감정에 실질적으로 영향을 미치고, 모델의 성능이 생산성 향상으로 이어진다는 점이 실증되었습니다. 프라이버시와 독립성을 모두 보호하는 데 운영상 어려움이 있지만, AI의 사회적 영향을 투명하게 이해하기 위한 필수적인 노력입니다. Anthropic은 향후 프로그램을 천천히 확대할 계획입니다.

출처 바로가기