Mercor 的会计对照研究在 2026 年 10 月 2 日由 Mercor 通过官方博客公布:研究团队请来 12 名平均从业 5 年半、持有注册会计师资格的初级会计师,与前沿大模型在同一批月末结账任务上正面对照。结果很刺眼——会计师的平均得分约为 37%,而 Claude Opus 5 等前沿模型在 20 次尝试中全部拿了满分,每道题用时不到 10 分钟,人类则需要 30 到 180 分钟。
任务不是选择题,是翻文件找数字
这批任务取自 Mercor 此前发布的 APEX-Accounting 评测,共 4 个真实感较强的月末结账场景。参与者要钻进一家公司的底稿文件里找对数字、完成计算,再交付一张结果表。任务里埋了不少容易看漏但符合实务的会计要求,环环相扣,漏掉一个数字就可能大幅丢分。研究原本想测“人加 AI”能比人单独做强多少,但模型单独就已经满分,没有留下可测的提升空间,所以最终公布的是无辅助人类与模型的直接对比。
成本差距比速度差距更大
Mercor 按每满足一条评分标准折算成本:Claude Opus 5 约为 0.21 美元,人类会计师按美国会计师工资中位数折算约为 10.35 美元,相差约 49 倍。回看 18 个月前,最好的模型还达不到会计师 37% 的平均线;2025 年春,OpenAI o3 首次超过这条线,GPT-5 达到约 69%,如今前沿模型已经摸到满分。也有例外:部分低价和开放权重模型,例如 Qwen3.5-122B,仍在会计师平均线以下。
满分不等于会计师可以被替换
Mercor 自己把边界划得很清楚。第一,这批任务恰好考的是模型最擅长的能力:在文件里检索细节、严格照指令执行。会计工作的另一大半——与客户沟通、提出正确的问题、积累业务上下文——没有进入测试。第二,实验条件对人类并不友好:不能向同事求助,没有长期积累的工作背景,任务设计者原先预计初级会计师平均也就 30% 上下。第三,任务本来就是为了难倒模型而设计的,难度不断加码后,部分题目已经超出单人合理完成的范围。所以这项研究真正说明的,是结构化、细节密集的结账环节正在被模型接管,而判断、沟通和把关环节的价值反而被抬高;财务团队更现实的做法,是先把对数、找数、初稿这类工作交给模型,再把人力压到复核和解释上。