DeepSeek V4.1 Flash의 최신 성적은 2026년 10월 6일 ARC Prize가 발표했다. 독립 평가 기관인 ARC Prize는 ARC-AGI(Verified) 평가에서 ARC-AGI-1 94.5%, ARC-AGI-2 72.9%라는 점수를 매겼다. 추상 추론은 한 걸음 더 나아갔지만, 문제 하나를 푸는 비용도 눈에 띄게 비싸졌다.
상승 폭을 뜯어보면
이전 세대 V4 Flash의 같은 평가 최고 성적과 비교하면 ARC-AGI-1은 5.5%포인트, ARC-AGI-2는 11.5%포인트 올랐다. ARC-AGI는 암기를 재는 시험이 아니다. 각 문제는 입력과 출력 예시를 몇 개만 주고, 모델이 스스로 변환 규칙을 추론해 본 적 없는 새 도형에 적용하게 한다. ARC-AGI-2는 여기에 서로 얽힌 여러 규칙을 동시에 다루도록 요구하므로, 2세대의 상승 폭이 더 의미가 있다. 비용 쪽은 또 다른 면이다. ARC-AGI-1은 문제당 약 0.07달러, ARC-AGI-2는 약 0.13달러로, 이전 세대 최고 성적에 붙었던 비용의 수 배에 이른다. 다시 말해 이번 진전은 추론 연산에 더 과감히 돈을 써서 산 것이지 공짜가 아니다.
왜 비용 숫자가 점수만큼 중요한가
ARC Prize가 비용과 점수를 나란히 공개하는 것 자체가 하나의 태도다. 점수만 보여 주고 청구서는 보여 주지 않는 평가는 실제로 모델을 운영하는 사람에게 참고 가치가 제한적이다. 개발자에게 ARC-AGI-2 72.9%라는 성적은 낯선 규칙형 작업을 처리할 선택지가 하나 늘었다는 뜻이며, 문제당 비용도 십수 센트 수준으로, 선두권 비공개 모델의 문제당 수 달러짜리 추론 청구서와는 자릿수가 다르다. 다만 작업량이 거대해지면 수 배가 된 비용은 총예산에 반드시 넣어야 한다. 특히 시행착오를 반복해 정확도를 쌓는 에이전트 워크플로에서는 청구액이 가장 빠르게 불어난다.
이 숫자를 읽을 때의 두 가지 주의
첫째, 이는 평가 기관이 자체 검증 세트와 고정 설정으로 낸 결과라서, 프롬프트 방식이나 추론 단계를 바꾸면 점수와 비용이 모두 달라지므로 업무 환경에 대한 약속으로 곧바로 읽을 수 없다. 둘째, 추상 추론이 강하다고 코드나 긴 문서 같은 일상 작업 전반에서 앞선다는 뜻은 아니므로, 모델을 고를 때는 자기 작업 세트로 다시 시험해야 한다. 이 결과가 주는 진짜 신호는 중국 오픈 모델 진영이 가장 어려운 범용 추론 평가에서 선두 그룹을 계속 좁혀 가고 있고, 경쟁의 초점이 단순한 점수 싸움에서 1달러로 얼마나 많은 추론 능력을 살 수 있는지로 옮겨 가고 있다는 점이다.