Mercor の会計対照研究は 2026 年 10 月 2 日、Mercor が公式ブログで公表しました。平均 5 年半の実務経験を持つ公認会計士の資格者 12 名を雇い、最先端の大規模モデルと月次決算の同じ課題で正面対決させたのです。結果は鮮明でした。会計士の平均は約 37% にとどまり、Claude Opus 5 などの最先端モデルは 20 回の試行すべてで満点を取り、各課題を 10 分未満で終えたのに対し、人間は 30 分から 180 分を要しました。
クイズではなく、ファイルを掘って数字を探す作業
課題は Mercor が以前公開した APEX-Accounting 評価から取った、現実味のある月次決算シナリオ 4 本です。参加者は会社の作業ファイルに入り込み、正しい数字を探し、計算し、結果表を納品します。シナリオには見落としやすいが実務的な会計要件が連鎖的に埋め込まれ、数字を一つ逃すと大きく減点されます。本来は「人間+AI」が人間単独をどれだけ上回るかを測る設計でしたが、モデル単独で満点が出て向上幅を測れなくなり、最終的に無補助の人間とモデルの直接比較が公表されました。
差は速度よりコストで大きい
評価基準 1 件あたりのコストで見ると、Claude Opus 5 は約 0.21 ドル、会計士は米国の賃金中央値で換算して約 10.35 ドルで、差は約 49 倍です。18 か月前、最良のモデルでも会計士の平均 37% に届きませんでした。2025 年春に OpenAI o3 がこの線を初めて超え、GPT-5 は約 69% に達し、今や最先端モデルは満点に手が届きます。例外もあり、Qwen3.5-122B など一部の低価格・オープンウェイトモデルは今も会計士の平均線の下にいます。
満点でも会計士は置き換わらない
Mercor 自身が線引きを明確にしています。今回の課題は、ファイル内の細部検索と指示への厳密な追従という、モデルの最も得意な能力を測っていました。顧客対応、正しい問いを立てる力、蓄積された業務文脈といった仕事の大きな部分は対象外です。条件も人間に不利でした。同僚に聞けず、文脈の蓄積もなく、設計者自身が初級者の平均を 30% 前後と見込んだ課題だったからです。本研究が本当に示すのは、構造化され細部の多い決算作業がモデルに移りつつあり、判断・対話・確認の価値がむしろ上がっていることです。財務チームの現実解は、照合や検索、初稿をモデルに任せ、人間の時間を検算と説明に回すことでしょう。