1. 논문이 실제로 비교한 것

Nature Machine Intelligence는 2026년 7월 24일 Google이 지원한 연구를 게재했다. 단일 에이전트와 독립형, 중앙 오케스트레이터형, 분산형, 하이브리드형을 비교했고 프롬프트·도구·시스템별 연산 상한은 같게 유지했다.

260개 구성은 검색, 금융, 계획, 업무, 소프트웨어 공학, 터미널 과제의 6개 벤치마크와 OpenAI·Google·Anthropic 계열을 포함했다. 서로 다른 제품 데모를 비교하는 것보다 강하지만 미래 모든 시스템에 적용되는 법칙은 아니다.

2. 평균 0%가 가리는 정반대 결과

전체 멀티에이전트 평균 개선은 0.0%였지만 분산은 매우 컸다. 중앙형은 Finance Agent에서 단일 기준 대비 80.8% 향상했고, 독립형은 순차적인 PlanCraft에서 70% 하락했다.

금융이 쉽고 계획이 어렵기 때문만은 아니다. 금융 조사는 공시·뉴스·운영 영향을 나눠 조사한 뒤 합칠 수 있다. PlanCraft는 공유된 순차 상태가 필요해 압축된 인계가 다음 행동의 제약을 잃게 만들 수 있다.

  • 병렬형: 독립 증거를 모은 뒤 종합한다.
  • 순차형: 각 행동이 다음 단계의 상태를 바꾼다.
  • 개방·모호형: 메시지가 불확실성을 복제할 수 있다.
  • 강한 기준선: 개선 여지는 작고 조정 비용은 커진다.

3. 45% 문턱은 유용하지만 법칙이 아니다

연구진은 단일 에이전트 성능 약 45%를 경험적 경계로 제시했다. 이를 넘으면 팀의 개선 가능성이 낮아졌고 SWE-bench Verified와 Terminal-Bench의 16개 검증 구성에서 향상·하락 방향을 94% 맞췄다.

저자들은 이를 보편적 스케일링 법칙이 아닌 실무 선택 규칙으로 규정했다. 각 검증 셀은 20개 과제뿐이고 개별 신뢰구간도 넓다. 45%를 넘었다고 팀 설계를 취소할 것이 아니라 추가 조정의 입증 기준을 높여야 한다.

4. 조정세는 시간과 비용에 나타난다

비용 추적 하위 집합에서 하이브리드는 단일 에이전트의 6.2배, 중앙형은 3.8배, 분산형은 3.6배의 턴을 썼다. 총 추론 상한을 맞춘 상태에서 팀은 예산을 분기별로 나누고 메시지와 종합 비용을 추가로 냈다.

에이전트 SaaS 구매에 직접 연결되는 문제다. 호출·토큰 과금은 작은 정확도 향상을 비경제적으로 만들 수 있다. 반대로 값비싼 오류를 막거나 병렬 조사를 단축한다면 추가 비용은 합리적이다. 정확도뿐 아니라 토큰당 성공, 지연, 재시도를 측정해야 한다.

5. 연구가 증명하지 않은 것

모든 에이전트 팀이 실패하거나 특정 모델 계열이 항상 우월하다는 증거가 아니다. 전 벤치마크를 지배한 계열은 없었고 일부 방향성 효과는 보수적 통계 보정 후 유의하지 않았다. 시험 모델도 이후 출시된 모든 모델을 대표하지 않는다.

물리 에이전트, 다중 사용자, 장기 현장 피드백도 포함하지 않았다. SWE-bench와 Terminal-Bench는 각각 20개 하위 집합이었다. 모델은 시험 영역 내부 보류 구성에서 최적 구조를 87% 선택했지만 새로운 영역의 절대 성능 예측은 약했다.

6. 한국·아시아 기업을 위한 도입 절차

계약 전 실제 업무 20~50개를 뽑아 단일 에이전트 기준선을 보존한다. 병렬·순차 여부, 오류 가격, 지연, 토큰을 정의한 뒤 전문가 두세 명과 오케스트레이터를 시험한다. 데모가 영리해 보인다는 이유로 열 개 에이전트부터 시작하지 않는다.

한국어·아시아 업무에서는 인계 중 언어와 현지 규제 맥락 보존도 시험해야 한다. 법률·재무·출처 에이전트가 병렬 조사할 수 있지만 조정자는 증거와 단서를 유지해야 한다. 성공 개선이 비용과 위험을 넘지 못하면 단일 에이전트가 단순히 싼 것이 아니라 더 나은 구조다.

  • 도구·프롬프트·연산 예산을 고정한다.
  • 자사 업무로 단일 에이전트 기준을 만든다.
  • 성공·비용·지연·오류 증폭을 함께 잰다.
  • 증거가 분리될 때 에이전트를 더하고 의존성이 깊어질 때는 줄인다.
  • 재무·법률·고영향 결정에는 사람의 승인문을 둔다.