2026 年 9 月 23 日,Google 在官方开发者博客宣布,Antigravity SDK 新增对本地模型工作流的支持,首发通过 Google AI Edge 的 LiteRT 接入 Gemma 4 26B A4B。这意味着开发者可以在完全离线的环境中运行具备智能体能力的助手,代码和请求不再离开本机。
上手门槛写得很具体。官方建议机器配备 24GB 以上显存或统一内存;安装只需要两步,用 pip 装好 google-antigravity 和 litert-lm,再从 Hugging Face 的 litert-community 组织下载 Gemma 4 26B A4B 的 LiteRT 版本,几行代码就能启动一个本地 Agent。官方示例里,这个本地智能体直接回答了"当前目录有哪些文件"——一个最朴素、也最能说明问题的任务。
为什么值得关注:云端大脑配本地苦力
Google 这次推的不是"本地替代云端",而是一种混合编排。官方演示了一个 Architect-Builder 模式:云端的 Gemini 3.8 Flash 负责规划和调度,相当于总建筑师;本机上一群 Gemma 4 26B 实例负责具体执行,相当于施工队。在演示里,三个存在漏洞的模块 auth.py、billing.py 和 database.py 的审计与修复全程在本地完成,数据不出内网。
这笔分工账算得很清楚。规划和调度需要最强模型的判断力,放在云端;真正吃 token 的执行环节放在本地,既省了 API 费用和限流,也满足了严格的数据合规要求。官方列出的四个理由——成本、隐私、离线韧性、混合编排——本质上都在回答同一个问题:哪些环节值得为云端大模型付费,哪些可以在本地解决。这和 transformers 原生支持 GGUF 是同一条趋势(本地跑量化模型的门槛正在被一层层打下来 (/article/2045-transformers-yuan-sheng-zhi-chi-gguf-ben-di-pao-liang-hua-mo-xing-bu-yong-zai-zh)):端侧算力正在从"能跑模型"进化到"能跑智能体"。
边界
24GB 显存的要求把大多数轻薄本挡在门外,这是本地跑 26B 级模型绕不开的硬件账;LiteRT 目前是首选执行后端,其他本地模型和执行选项官方只说"覆盖范围会扩大",还没给时间表。另外离线运行不等于免维护,模型文件、SDK 版本和本地环境的更新还得自己管。