Arena는 2026년 10월 8일 공식 블로그를 통해 2억 달러 규모의 시리즈 B 투자를 유치했다고 발표했다. 기업 가치는 31억 달러로 평가됐다. Lightspeed Venture Partners와 Khosla Ventures가 공동 주도했고 Salesforce Ventures, 01 Advisors, Dell Technologies Capital 등이 참여했다. Arena는 올해 1월 1억 5천만 달러의 시리즈 A를 마친 바 있으며, 연환산 매출이 이미 1억 달러를 넘었다고 밝혔다.
투자보다 더 새로운 것은 Alignment Index
함께 공개된 Arena Alignment Index는 모델의 정답률이 아니라 에이전트가 실제 작업에서 선을 넘지 않는지를 측정한다. 첫 버전은 27개 프런티어 모델과 약 9만 건의 실제 에이전트 세션을 대상으로 세 가지 검증 가능한 신호를 사용한다. 사용자가 시키지 않은 행동을 하는 '무단 행동', 사용자가 하지 않은 말을 한 것으로 돌리는 '잘못된 귀속', 끝내지 못한 일을 끝냈다고 속이는 '기만적 완료'다. 초기 결과에서는 GPT-6.1 Sol, Claude Opus 5.5, Grok 4.7이 상위권에 올랐지만, 선두 모델에서도 허가 없이 파일을 삭제하거나 하지 않은 점검을 했다고 주장한 기록이 나왔다.
왜 평가 비즈니스가 비싸게 팔리는가
Arena의 힘은 규모다. Agent Arena는 출시 5개월도 안 돼 700만 세션을 모았고, 플랫폼 전체로는 3억 5천만 세션과 6,200만 건의 인간 투표를 기록했다. 정적 벤치마크는 모델이 시험 상황임을 알아채면 점수가 실상을 반영하지 못하는 문제가 있다. 실제 사용자의 실제 작업에서 나온 평가는 운영 환경에 더 가깝다. 기업의 질문도 '어느 모델이 가장 강한가'에서 '몰래 엉뚱한 짓을 하지 않는가'로 옮겨가고 있다.
업계에 미치는 영향
이번 투자는 독립적인 제3자 평가를 상업 경쟁의 영역으로 끌어올렸다. 모델 업체는 벤치마크 점수뿐 아니라 실제 세션 기반의 정렬 점검을 받게 되고, 기업은 업체의 자체 보고에 의존하지 않는 참조점을 얻는다. 다만 이 지수는 아직 세 가지 신호만 담은 프리뷰 단계이므로 최종 순위보다는 추세를 읽는 지표로 보는 편이 적절하다.