Asana 浏览器智能体的成本在 2026 年 10 月 9 日 OpenAI 发布的客户案例中被摆上台面:Asana 旗下无代码工作流平台 StackAI 的浏览器智能体经过一轮优化后,在 GPT-6.1 Sol 上平均每次运行的估算模型成本降到 0.47 美元、耗时约 4 分钟,相比原来在另一家实验室模型(案例中称 Model B)上的生产配置便宜 76 倍、快 5 倍。但这组数字真正值得看的不是倍数,而是它是怎么来的。
钱烧在哪里:每一步都在重发整段历史
StackAI 让客户不用写代码就能搭工作流,让智能体打开网站、填表单、收集信息。StackAI 首席技术官 Frank Hidalgo 想让浏览器智能体更快更便宜,他没有带团队手工排查,而是让 Codex 中的 GPT-6 Astra 去梳理代码库、提出改进、跑对照实验——他估计手工要一到两个月的工作,约一周完成。Astra 找到的问题很具体:这个智能体缓存了固定不变的指令和工具定义,却没有缓存不断变长的浏览历史(页面文本和截图),于是每走一步,都要把此前看到的全部内容按全价再发给模型一遍。更麻烦的是,它几乎每一步都丢弃旧截图、裁剪文本,历史一直在变,就算想缓存也命中不了;丢掉的事实还可能逼它回头重读已经看过的页面。
三处修改和一组 144 次运行的对照
Hidalgo 从 Astra 的方案里挑了三处测试:把缓存扩展到浏览历史、加大可保留的文本量(对照 12 万与 48 万字符两种历史预算)、以及截图攒批再删(效果最好的一档是攒到 20 张再只留最近 1 张,让更早的历史能长时间保持不变)。整组研究共 144 次运行,任务是到一个公开演示目录里为 32 本书各收集 6 个字段,对照 GPT-6.1 Sol 与另外三个匿名模型。结果需要拆开看:只改工作流、不换模型,Model B 的单次成本从至少 36.21 美元(部分原始运行撞到步数上限还没做完,这是下限)降到 1.24 美元,约 29 倍;换到优化后的 Sol 工作流再降到 0.47 美元,又便宜 2.6 倍。也就是说,76 倍里大头来自工作流本身,换模型只是再添一截。
历史留多长,还决定任务能不能做完
同一组实验里有个比价格更硬的结果:在 Sol 上,历史预算较小时,18 次运行只有 3 次给出了答案;预算放大后,18 次全部完成且答案正确。单看 Sol 自身,新缓存与截图策略把成本从 1.97 美元压到 0.47 美元,每次调用约便宜 3 倍,因为 89% 的输入命中了缓存、只按未缓存价格的 5% 计费。Asana 已把这套改动上线到 StackAI 的浏览器导航,并计划把这类对照实验做进平台评测工具。
需要保留的边界也很清楚:这是厂商发布的单一客户案例,成本是估算值,对照模型匿名,任务类型单一,76 倍不能当作任何浏览器智能体都能复现的行业基准。但它给所有做智能体的团队留了一条可直接自查的经验:当一个多步智能体越跑越贵,先别急着换模型,去数一数每一步请求里有多少内容是在按全价重复发送——历史怎么留、怎么缓存、怎么删,往往才是账单的大头。