ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
Mercor 회계 대조 연구: 프런티어 모델은 전부 맞히고 공인회계사 평균은 37%

Mercor 회계 대조 연구: 프런티어 모델은 전부 맞히고 공인회계사 평균은 37%

AI 정보 • Admin • • 5 회 조회

Mercor의 회계 대조 연구는 2026년 10월 2일 Mercor가 공식 블로그를 통해 공개했습니다. 평균 경력 5년 반의 공인회계사 자격을 갖춘 주니어 회계사 12명을 고용해 프런티어 대형 모델과 같은 월말 결산 과제로 정면 대결시킨 연구입니다. 결과는 선명했습니다. 회계사 평균은 약 37%에 그쳤고, Claude Opus 5 같은 프런티어 모델은 20회 시도 모두 만점을 받았으며 과제당 10분 미만이 걸린 반면 인간은 30분에서 180분이 걸렸습니다.

퀴즈가 아니라 파일을 파서 숫자를 찾는 작업

과제는 Mercor가 앞서 공개한 APEX-Accounting 평가에서 가져온 현실감 있는 월말 결산 시나리오 4개입니다. 참가자는 회사 작업 파일을 뒤져 올바른 숫자를 찾고, 계산한 뒤 결과표를 제출해야 합니다. 시나리오에는 놓치기 쉽지만 실무적인 회계 요건이 연쇄적으로 숨어 있어 숫자 하나를 놓치면 점수가 크게 깎입니다. 원래는 '인간+AI'가 인간 단독보다 얼마나 나은지를 재려 했지만 모델 단독으로 만점이 나와 향상 폭을 측정할 수 없었고, 결국 보조 없는 인간과 모델의 직접 비교가 공개됐습니다.

격차는 속도보다 비용에서 더 크다

채점 기준 1건을 충족하는 비용으로 환산하면 Claude Opus 5는 약 0.21달러, 회계사는 미국 회계사 임금 중앙값 기준 약 10.35달러로 격차는 약 49배입니다. 18개월 전에는 최고 모델도 회계사 평균 37%에 닿지 못했습니다. 2025년 봄 OpenAI o3가 처음 이 선을 넘었고 GPT-5는 약 69%에 도달했으며, 이제 프런티어 모델은 만점에 닿습니다. Qwen3.5-122B 같은 일부 저가 및 오픈 웨이트 모델은 여전히 회계사 평균선 아래에 있습니다.

만점이 곧 회계사 대체는 아니다

Mercor 스스로 경계를 분명히 그었습니다. 이번 과제는 파일에서 세부 정보를 찾고 지시를 엄격히 따르는, 모델이 가장 잘하는 능력을 정확히 쟀습니다. 고객 소통, 올바른 질문 던지기, 축적된 업무 맥락 같은 실제 업무의 큰 부분은 측정 대상이 아니었습니다. 조건도 인간에게 불리했습니다. 동료에게 물을 수 없고, 쌓인 맥락도 없었으며, 설계자 스스로 주니어 평균을 30% 안팎으로 예상한 과제였기 때문입니다. 이 연구가 진짜로 보여주는 것은 구조화되고 세부 사항이 많은 결산 작업이 모델로 넘어가고 있고, 판단과 소통, 검수의 가치는 오히려 높아지고 있다는 점입니다. 재무 팀의 현실적인 선택은 대조, 조회, 초안을 모델에 맡기고 인간의 시간을 검토와 설명에 쓰는 것입니다.

추천 도구

더보기