ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
Grok 4.7 벤치마크: 코딩 에이전트 4위 진입, 대가는 작업당 8.1만 토큰

Grok 4.7 벤치마크: 코딩 에이전트 4위 진입, 대가는 작업당 8.1만 토큰

AI 정보 Admin 7 회 조회

2026년 9월 21일, 제3자 벤치마크 기관 Artificial Analysis가 Grok 4.7의 전체 평가를 공개했습니다. 결론은 분명합니다. 이번은 '에이전트 능력 우선'의 버전 업그레이드로, Grok 4.7은 Intelligence Index에서 46점(4.6 대비 +2점)을 받아 xAI를 세계 상위 4개 AI 랩 대열에 올렸습니다. 진짜 도약은 코딩 에이전트에서 일어났습니다.

세 가지 핵심 숫자

첫째, 에이전트형 지식 업무. AA-Briefcase(장기간 에이전트형 지식 업무 프라이빗 벤치마크)에서 Grok 4.7은 1657 Elo를 기록해 Grok 4.6보다 111점 높았고, Claude Opus 5와 Claude Fable 5.1에 이어 정식 1군에 진입했습니다. GDPval-AA에서도 1695 Elo로 전 세대보다 90점 앞섰습니다.

둘째, 코딩 에이전트. Grok 4.7(xhigh 추론 설정)과 공식 코딩 에이전트 Grok Build의 조합은 Coding Agent Index에서 56점(4.6 대비 +9점)을 획득했습니다. 네이티브 하네스 중 4위로, Claude Fable 5.1, GPT-6 Astra, Claude Opus 5에 이어 GPT-5.6 Sol을 앞질렀습니다. 세부적으로 DeepSWE v1.1은 65%에서 73%로, Terminal-Bench 4.0은 18%에서 33%로 뛰었습니다.

셋째, 머스크의 규정. 머스크는 이 평가를 인용하며 Grok 4.7 덕분에 xAI가 에이전트형 코딩 분야에서 Anthropic과 OpenAI에 이어 3위에 올랐다고 밝혔습니다.

점수 뒤에 숨은 비용

점수 상승은 공짜가 아닙니다. xhigh 추론 설정에서의 평가에서 Grok 4.7은 Intelligence Index 작업당 약 8.1만 개의 출력 토큰을 소모합니다. Grok 4.6(xhigh, 약 3.8만)의 두 배가 넘고, GPT-6 Astra(max, 2.7만)보다 거의 두 배 많습니다. 출력 속도는 약 188토큰/초, 작업당 평균 7.1분이 걸립니다.

다행히 가격은 동결됐습니다. 입출력은 백만 토큰당 2달러/6달러 그대로, 캐시 히트 입력은 0.5달러입니다. 컨텍스트 윈도우는 50만 토큰을 유지하고, 추론 강도는 low부터 xhigh까지 조절 가능합니다. 즉 xAI는 '더 강함'을 '더 많은 추론으로 더 많은 점수를 버는' 형태로 만들었고, 요금 상승폭은 사용자가 직접 통제할 수 있게 됐습니다.

이번 업그레이드를 어떻게 볼 것인가

Grok 4.7의 전략은 명확합니다. 범용 Q&A의 미세한 격차를 쫓는 대신 추론 예산을 에이전트 작업에 집중 투자했습니다. 장기 지식 업무와 코딩 에이전트는 상용화에 가장 가까운 두 시나리오입니다. 환각률이 34%에서 29%로 떨어진 것은 긍정적 신호지만, 정확도는 47% 대 48%로 사실상 제자리걸음이라 이번에 이긴 것은 '지식 그 자체'가 아니라 '일을 해내는 능력'이라고 할 수 있습니다.

개발자에게 Grok Build + Grok 4.7은 시도해볼 만하지만, 먼저 추론 요금을 계산하세요. xhigh 설정의 점수는 화려하지만, 일상 사용에서는 high 설정이 가성비의 스위트 스팟일 수 있습니다.

추천 도구

더보기