ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
GPT-6 Sol(Max), Agent Arena 진입…+7.7%로 6위, 작업당 0.76달러

GPT-6 Sol(Max), Agent Arena 진입…+7.7%로 6위, 작업당 0.76달러

AI 정보 • Admin • • 12 회 조회

9월 25일, Arena(구 LMArena)가 리더보드를 업데이트하며 GPT-6 Sol(Max)이 Agent Arena에 공식 진입했다. 첫 성적표는 순개선율 +7.7%, 44개 모델 중 6위. 4000건이 넘는 실제 에이전트 세션을 바탕으로 한 평가로, GPT-6 Sol 출시 이틀 만에 나온 제3자 크라우드소싱 평가의 첫 본격 성적이다.

성적표: 전 세대보다 강하고, 전 세대보다 싸다

Arena의 공식 해설은 몇 가지 핵심 수치를 제시했다. GPT-6 Sol(Max)의 순개선율은 +7.7%. GPT-5.6 Sol(xHigh)의 +6.2%에서 1.5%포인트 상승했고 순위는 8위에서 6위로 올랐다. 토큰 단가는 전 세대의 절반이다.

"Confirmed Success(성공 확정)" 세부 지표에서 Sol(Max)은 +11.4%로 4위. 반면 5.6 Sol은 +2.9%에 그쳐 20위였다. 즉 신모델은 전체적으로 강할 뿐 아니라, 에이전트에 가장 중요한 지표인 "작업을 실제로 완수하는" 능력에서 특히 크게 도약했다.

진짜 관전 포인트: 가성비 프론티어가 다시 그려졌다

Agent Arena의 파레토 프론티어는 현재 이렇다. Claude Fable 5.1(Max) +13.8%, 작업당 4.06달러. GPT-6 Astra(Max) +10.85%, 2.90달러. Claude Opus 5(High) +9.8%, 2.16달러. Claude Fable 5(High) +8.3%, 1.71달러. 그리고 GPT-6 Sol(Max) +7.68%, 작업당 0.76달러.

Sol(Max)은 Fable 5(High)에 불과 0.6%포인트 차이로 따라붙으면서도 작업당 비용은 56% 저렴하다. 하루 수천 개의 에이전트 작업을 돌리는 팀에게는 이 조합이 "단독 1위" 트로피보다 매력적이다. Arena도 이번 업데이트가 "Agent Arena의 파레토 프론티어를 다시 그렸다"며 중앙값 비용이 0.76달러대로 내려왔다고 짚었다.

배경: 출시된 지 불과 이틀

9월 23일 OpenAI는 GPT-6 Sol과 Luna를 출시했다. 플래그십 Astra의 학습 레시피를 더 빠르고 저렴한 티어로 내린 것으로, API 가격은 GPT-5.6 프로모션가에서 50% 추가 인하됐다. Sol은 GPT-6 패밀리의 플래그십 티어로, 코딩·장시간 작업·가장 어려운 일을 겨냥한다. 이번 Arena 데뷔는 공식 주장인 "토큰당 더 똑똑하다"를 대체로 뒷받침했다. 적어도 에이전트 작업에서는 성능과 비용이 모두 올바른 방향으로 움직였다.

개발자를 위한 판단

에이전트를 돌릴 모델을 고른다면 결론은 단순하다. 절대 최강을 원하면 Fable 5.1(Max)과 Astra(Max)가 여전히 앞선다. 하지만 "1달러당 몇 건의 작업을 성공시키는가"로 따지면 Sol(Max)은 현재 프론티어에서 가장 합리적인 플래그십급 선택지다. 한 가지 주의점: Arena는 커뮤니티 블라인드 테스트의 크라우드소싱 신호로, 실제 사용자 작업에서의 승패를 반영할 뿐 연구실 벤치마크가 아니다. 투표가 쌓이면 순위는 아직 바뀔 수 있다.

Claude Opus 5.5 출시: 40% 인하, 초장시간 코딩 세션에 최적화는 같은 주 Anthropic의 응답이었다. 에이전트 경쟁의 순위 다툼은 이제 막 시작됐다.

추천 도구

더보기