멀티에이전트 팀은 비용에 걸맞은 품질 향상을 가져오지 못했습니다. 2026년 10월 11일, 평가 기관 Vals AI는 프로그래밍 벤치마크 Vibe Code Bench에서 단일 에이전트와 팀 모드를 비교한 결과를 공개했습니다. GPT-6 Sol과 Claude Opus 5.5가 같은 작업을 혼자서, 이어서 팀으로 수행한 결과 팀 비용은 단일 에이전트의 1.8배에서 5.1배까지 올랐고, 네 가지 비교 중 통계적으로 유의미한 품질 향상이 나타난 경우는 하나뿐이었습니다.
정확히 무엇을 비교했나
Vibe Code Bench는 모델이 요구사항을 받아 실행 가능한 애플리케이션을 만들게 하고 완성도를 점수화합니다. Vals AI는 두 모델을 중간과 최대 두 단계의 추론 강도로 실행하며 단계마다 단일 에이전트와 팀을 비교했습니다. 유의미한 결과가 나온 유일한 경우는 중간 추론 강도의 GPT-6 Sol로, 팀이 7.3점 높았습니다. 최대 추론 강도에서는 두 모델 모두 팀 모드의 측정 가능한 이점이 없었습니다. 즉 최고 설정에서는 모델 하나가 더 오래 생각하게 하는 것과 도우미를 늘리는 것의 효과가 대체로 겹치고, 청구 금액만 몇 배로 차이 납니다.
에이전트를 1개에서 100개로 늘리면 곡선은 금세 평평해진다
Anthropic은 Claude Opus 5.5 시스템 보고서에서 비슷한 규모 실험을 진행해 작업에 참여하는 에이전트 수를 1개에서 100개까지 늘렸습니다. 곡선은 가파르게 오른 뒤 평평해졌습니다.
| 작업 | 에이전트 1개 | 10개 | 30개 | 100개 |
|---|---|---|---|---|
| 지식 베이스 | 0.53 | 0.70 | 0.71 | 0.74 |
| Lean 정리 증명 | 0.39 | 0.66 | 0.66 | 0.68 |
1개에서 10개로 늘릴 때는 눈에 띄는 개선이 있었지만, 10개에서 100개로 늘리면 두 점수 모두 수百分의 몇 수준으로만 움직였습니다. Claude Fable 5.1은 정리 증명 작업에서 규모의 혜택을 더 받았지만 종합 점수는 여전히 Opus 5.5에 못 미쳤고, 지식 베이스 점수는 30개에서 100개 사이에서 오히려 소폭 하락했습니다. 대규모 팀의 더 확실한 이점은 더 높은 수준에 도달하는 것이 아니라 같은 수준에 더 빨리 도달하는 것이었고, Anthropic의 ProgramBench 테스트에서도 그 속도는 더 높은 토큰 사용량을 동반했습니다.
팀이 실제로 사는 것은 시간이다
OpenAI 연구원 Noam Brown은 한 팟캐스트에서 두 데이터와 맞아떨어지는 설명을 내놓았습니다. 멀티에이전트 구성이 주로 사는 것은 답변의 질이 아니라 속도라는 것입니다. 에이전트 네 개는 작업을 약 두 배 빠르게 끝냈고 비용도 약 두 배였습니다. 웹 검색이나 수학처럼 병렬로 나눌 수 있는 작업이 가장 큰 혜택을 보고, 소설 쓰기처럼 병렬화할 수 없는 작업은 사람이 늘어도 얻는 것이 없습니다. OpenAI의 Codex 개발자 Eric Provencher는 이 추가 지출을 조율세라고 부릅니다. 에이전트들은 서로의 결과물을 완전히 신뢰하지 않아 재확인과 도구 재호출을 반복하고, 그 확인 자체가 토큰을 소모하기 때문입니다.
에이전트에 비용을 내는 팀이 먼저 계산할 것
에이전트를 도입하는 팀을 위한 시사점은 세 가지입니다. 작업을 서로 독립적인 병렬 블록으로 나눌 수 있고 납기 자체가 돈이 되는 경우라면 팀 구성이 합리적입니다. 작업이 일직선의 추론이거나 모델이 이미 최대 추론 강도로 돌고 있다면, 인원을 늘리기 전에 추론 예산을 늘리는 편이 대개 더 경제적입니다. 그리고 본격 도입 전에는 실제 업무 작업으로 단일과 팀을 비교해 총 토큰이 아니라 결과물 한 건당 비용을 봐야 합니다. 업계는 대규모 오케스트레이션을 판매 포인트로 만들고 있으며, Claude Managed Agents는 한 번의 실행에서 최대 1000개의 에이전트를 편성할 수 있지만, 편성할 수 있는지는 답할 수 있어도 편성할 가치가 있는지는 작업이 얼마나 병렬적인지에 달려 있습니다.