Anthropic은 직원 201명이 각자 내놓은 책을 AI 에이전트끼리 교환하는 작은 시장을 만들었다. 참가자는 Claude와 짧게 대화해 읽고 싶은 책 취향을 전했고, 에이전트는 공개 거래 공간에서 제안과 협상을 거쳐 책을 바꿨다. 이 실험은 에이전트가 사람의 선호를 얼마나 잘 파악하고, 다른 에이전트와 거래해 만족스러운 결과를 얻는지 살펴보기 위한 것이었다. 결과를 보면 협상 능력보다 사람의 취향을 제대로 이해하는 일이 더 큰 과제로 드러났다.

에이전트 시장을 시험한 이유

살다 보면 서로에게 이득이 될 거래가 있어도 상대를 찾고 조건을 맞추는 데 드는 수고 때문에 성사되지 않는 경우가 있다. 더 나은 일자리를 찾거나, 직장 근무표를 바꾸거나, 아이들 등하교를 함께 맡을 사람을 구하는 일도 그렇다. 사람 대신 계속 탐색하고 협상하는 에이전트가 있다면 이런 거래가 쉬워질 수 있다. 다만 에이전트가 사용자의 뜻을 제대로 이해하는지, 시장 운영자가 거래 규칙과 불이행 문제를 어떻게 다룰지는 먼저 확인해야 한다.

201명이 책을 바꾼 실험

참가자는 샌프란시스코, 뉴욕, 런던, 시애틀, 워싱턴 DC, 더블린의 여섯 사무실에 속해 있었다. 각자 내놓고 싶은 책 한 권을 가져왔고, Claude와 짧은 대화를 나눠 선호를 설명했다. 에이전트는 그 대화를 토대로 시장에 있는 책의 선호 순위를 추정한 뒤, 거래 공간에서 양자 교환이나 여러 사람을 잇는 교환을 제안했다. 거래는 관련된 모든 에이전트가 동의해야 성사됐고, 참가자들은 별도로 책 10권의 순위를 매겨 에이전트의 판단을 평가하는 기준을 제공했다.

참가자와 에이전트의 메시지는 거래 공간에서 공개됐다. 에이전트 절반은 자기 사용자가 좋아할 책을 얻는 데만 집중하는 ‘무자비한’ 역할을, 나머지는 자기 사용자 목표에 더해 모두가 읽고 싶은 책을 갖도록 돕는 ‘친사회적’ 역할을 맡았다. 실제 시장 운영을 한 번만 관찰하면 우연의 영향을 구별하기 어려워, Anthropic은 모델이나 지시를 바꾸며 거래를 여러 차례 다시 실행했다.

짧은 대화로 취향을 얼마나 읽었나

다섯 분 안팎의 대화로 Claude가 추정한 책 순위는 참가자 순위와 책 쌍의 61%에서 일치했다. 무작위 추측의 50%보다 높았고, 책의 인기도만 따진 방식은 약 53%, 참가자가 언급한 책과 같은 독자들이 함께 평가한 책을 활용한 방식은 약 55%였다. 대화에서 참가자가 쓴 글의 양도 차이를 만들었다. 중앙값은 여덟 메시지에 걸쳐 216단어였으며, 약 150단어 대신 300단어를 쓴 경우에는 순위 일치율이 약 4%포인트 높을 것으로 나타났다.

거래보다 선호 파악이 더 큰 병목

참가자들이 직접 매긴 순위를 기준으로 보면, 시장에서 얻은 책의 평균 효율 점수는 0.55였다. 가능한 최선의 배정은 0.89였지만, 여러 사람이 같은 책을 원할 수 있어 모두가 첫 번째 책을 받는 것은 불가능하다. Claude의 추정 순위로 최선의 배정을 계산한 뒤 참가자의 실제 순위로 평가하면 점수는 0.60이었다. 이 비교에서 최선의 결과와 실제 거래 결과 사이 격차의 85%는 취향을 부정확하게 파악한 데서, 나머지 15%는 자유 거래 방식에서 비롯된 것으로 분석됐다.

모델과 지시가 거래 결과에 미친 영향

에이전트가 어떤 모델로 작동하느냐는 협상 결과에 영향을 줬다. Claude가 추정한 순위를 기준으로 Haiku 에이전트가 있는 시장의 효율 점수는 평균 0.75, Opus 시장은 0.88이었다. 이때 가능한 최선의 배정 점수는 0.95였고, Sonnet은 두 모델 사이에 자리했다. 혼합 시장에서도 Opus 에이전트는 더 약한 모델의 에이전트보다 대체로 좋은 결과를 얻었다. 반면 무자비한 지시는 친사회적 지시보다 점수를 약 0.02 높이는 데 그쳤다. 친사회적 에이전트는 자기 순위에서 더 낮은 책을 받아들이는 경우가 무자비한 에이전트보다 두 배 많았지만, 그런 선택 자체는 드물었다.

참가자 반응과 시장 설계의 과제

책을 받은 뒤 응답한 참가자들의 만족도는 10점 만점에 평균 7.2점이었고, 약 절반은 받은 책이 자신이 직접 고르는 대부분의 책보다 좋았다고 답했다. 에이전트가 다음 해 책 예산 중 얼마를 알아서 쓰도록 맡길지 묻자 평균은 약 30%였다. 취향을 아는 독서 경험 많은 친구에게 맡기겠다는 평균 40%에 비하면 약 4분의 3 수준이다. 다만 참가자들은 Anthropic 직원이었고, 최종 설문 응답률은 59%였다. 실험의 신뢰 수준을 일반인 전체에 그대로 적용하기는 어렵다.

정리

이 실험은 에이전트 시장의 결과가 협상 기술만으로 결정되지 않는다는 점을 보여준다. 사용자의 선호를 제대로 파악하는지 확인할 수 있는 절차, 에이전트가 어떤 행동을 할지 살펴볼 기회, 거래 불이행에 대한 규칙이 필요하다. 거래 메시지를 얼마나 공개할지와 과도한 메시지를 어떻게 제한할지도 시장 설계의 과제다. 어떤 경우에는 검색과 협상의 번거로움 자체가 경험의 일부일 수 있으므로, 에이전트에게 맡기는 일이 늘 좋은 선택이라고 단정할 수는 없다.

출처 바로가기