ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
Artificial Analysis, GPT-6 Sol·Luna 벤치마크 공개: 비용은 절반, 성적은 엇갈려

Artificial Analysis, GPT-6 Sol·Luna 벤치마크 공개: 비용은 절반, 성적은 엇갈려

AI 정보 Admin 7 회 조회

2026년 9월 22일, 독립 AI 벤치마크 기관 Artificial Analysis가 GPT-6 Sol와 GPT-6 Luna에 대한 독립 평가 보고서를 발표했다. 두 모델 출시 이후 처음으로 나온 완전한 제3자 성적표다. 가격은 확실히 절반으로 떨어졌지만, 성능 변화는 일방적이지 않다. 오른 평가도 있고, 떨어진 평가도 있다.

Artificial Analysis의 핵심 측정 결과에 따르면 Intelligence Index 전체 평가를 도는 데 드는 비용은 GPT-6 Sol(최대 effort 기준) 기준 작업당 약 1.06달러로, GPT-5.6 Sol의 1.99달러에서 거의 절반 수준이다. Luna는 0.18달러에서 0.07달러로 약 60% 줄었다. Intelligence Index 총점은 전 세대와 대체로 비슷하지만, 세부 항목을 보면 코딩 에이전트 능력은 Sol이 소폭 올랐고 Luna는 소폭 떨어졌으며, 지식 노동 계열 평가에서는 두 모델 모두 후퇴했다.

가격 인하는 확실하다: API 가격 절반으로

Sol의 입·출력 가격은 100만 토큰당 4달러/20달러에서 2달러/10달러로, Luna는 0.20달러/1.20달러에서 0.10달러/0.50달러로 떨어졌다. 캐시 읽기 90% 할인과 캐시 쓰기 25% 할증은 그대로 유지된다. 흥미로운 점은 두 모델 모두 작업당 출력 토큰 사용량이 오히려 소폭 늘었다는 것이다(Sol 2.9만→3.1만). 비용 절감은 순전히 가격 인하 덕분이다. 평가 대상은 OpenAI가 9월 22일 발표한 GPT-6 Sol와 Luna(본 사이트의 발표 기사에서 이미 다룸)다.

오른 점: 코딩과 할루시네이션 억제

Artificial Analysis의 Coding Agent Index(OpenAI 자체 Codex 환경에서 측정)에서 Sol은 57점을 받아 GPT-5.6 Sol보다 2점 높았다. Terminal-Bench 4.0도 37%에서 43%로 올랐다. 할루시네이션 억제도 눈에 띄는 개선점이다. 지식 벤치마크 AA-Omniscience에서 Sol의 할루시네이션 비율은 92%에서 60%로, Luna는 93%에서 77%로 떨어졌다. 다만 Sol의 비결은 '신중함'이다. 답변 시도율을 99%에서 83%로 낮춰 오답을 약 4분의 1 줄인 대신, 정답률도 59%에서 54%로 떨어졌다.

떨어진 점: 지식 노동 계열은 두 모델 모두 후퇴

44개 직종의 경제적 가치 과제를 모은 GDPval-AA v2.1에서 Sol은 약 100 Elo 포인트, Luna는 약 75포인트 하락했다. 수 주에 걸친 지식 노동 프로젝트 평가인 AA-Briefcase v1.1에서도 Luna는 약 45포인트 떨어졌다(Sol은 보합). 수백 건의 출력을 직접 점검한 평가팀은 후퇴의 주된 원인을 '결과물이 짧아지면서 채점 기준의 필수 요소를 빠뜨리는 경우가 많다'는 점으로 봤다. 토큰을 아끼려다 답변을 너무 짧게 쓴 셈이다.

고를 때는 가격표가 아니라 작업 유형을 봐야

Codex 같은 코딩 에이전트에서 코드 작업을 돌린다면 Sol이 더 합리적이다. 점수는 더 높고 작업당 2.99달러로 전 세대 절반 가격이며, '성능—비용' 파레토 프론티어 위에 정확히 올라 있다. 추출·요약 같은 고빈도 단순 작업이라면 Luna의 비용 우위는 여전히 크다. 다만 긴 문서를 다루고 완성도 높은 결과물이 필요한 지식 노동이라면, 소량 트래픽으로 출력 완전성을 먼저 검증한 뒤 전면 전환하는 편이 좋다.

이번 가격 인하는 Anthropic이 Claude Opus 5.5를 20% 인하해 발표한 바로 그날 나왔다. 두 프론티어 연구소가 24시간 안에 연달아 가격 카드를 꺼낸 셈이다. Artificial Analysis의 결론은 신중하다. OpenAI는 비용 효율 프론티어의 큰 영역을 차지했지만, '싸다'가 '전방위로 강하다'를 의미하지는 않는다. 모델을 고를 때 중요한 것은 내 작업이 '오른 쪽'에 있는지 '떨어진 쪽'에 있는지다.

추천 도구

더보기