一、摘要
GELab-Zero 是 StepFun 开源的 GUI Agent 方案,提供“模型 + 工程基础设施”的完整堆栈,主要面向安卓手机应用的自动化操作与智能交互。项目包含可在本地运行的 4B GUI Agent 模型,以及一键部署的推理与设备管理脚本,支持多手机任务分发和轨迹记录,并在 AndroidWorld、AndroidDaily 等基准上取得较高成功率,适合研究者与企业做移动端智能体实验和原型验证。
二、核心特性
1、完整 Model+Infra:同时开源推理服务、Agent 运行时与可视化工具,降低工程接入门槛。
2、本地 4B 模型:GELab-Zero-4B-preview 支持在消费级 GPU/高配 CPU 上运行,兼顾延迟与隐私。
3、多设备与任务分发:支持多台安卓设备并行执行任务,自动记录交互轨迹,便于复现和调试。
4、多种 Agent 模式:内置 ReAct 循环、多智能体协作和定时任务等模式,覆盖推荐、查询、下单等复杂流程。
5、公开基准与数据:提供 AndroidDaily 真实生活场景数据,并在多项 GUI 基准中表现领先或接近 SOTA。
三、安装
1、准备环境:建议使用 Python 3.12+,官方推荐通过 Miniforge 创建 gelab-zero 虚拟环境。
2、克隆仓库与依赖:
git clone https://github.com/stepfun-ai/gelab-zero.git cd gelab-zero pip install -r requirements.txt
3、部署 LLM:
- 个人用户:安装 Ollama,从 Hugging Face 下载
GELab-Zero-4B-preview,执行ollama create gelab-zero-4b-preview -f Modelfile完成导入,可按需使用 q4/q8 量化。 - 进阶用户:可按文档使用 vLLM 部署长时稳定服务。
- 4、配置安卓设备:安装 ADB,开启手机开发者模式与 USB 调试,
adb devices确认设备在线。 - 5、一键启动:在仓库中运行官方提供的启动脚本,连接模型服务与设备,即可进入 GUI Agent 端到端推理。
四、典型用例
1、生活服务自动化:在外卖、出行、社交、支付等 App 中完成叫车、点餐、买票、领取福利等操作。
2、内容与信息检索:在知乎、新闻 App 中按条件搜索内容并打开指定答案或页面。
3、复杂购物流程:按照金额、规格等约束在电商平台筛选商品、加入收藏或下单。
4、基准研究:在 AndroidDaily 静态/端到端任务上评估不同 GUI Agent 策略与模型版本。
五、生态与竞品
1、生态组件:
1、Hugging Face/ModelScope 提供官方权重;
2、社区提供 GGUF 量化(便于 llama.cpp、本地桌面客户端使用);
3、配套 AndroidDaily 数据集与开源基准网页。
2、竞品对比:与 UI-TARS、GUI-Owl 等 GUI 模型相比,GELab-Zero 的特点在于完整工程堆栈、针对真实安卓场景的优化以及 4B 规模下的性价比;具体效果仍需结合自身硬件与任务验证。
六、局限与注意事项
1、仅面向安卓 GUI 场景,iOS 与 Web 端需额外适配或使用其他方案。
2、4B 模型虽相对轻量,但长时间多设备推理仍需较好算力与散热条件。
3、自动化操作涉及账号、支付等敏感信息,建议在测试账号、受控环境中运行,并做好权限隔离与日志管理。
4、项目仍在快速更新阶段,接口与脚本可能发生变更,升级前应阅读最新文档与变更记录。
七、项目地址
https://github.com/stepfun-ai/gelab-zero
八、常见问题
Q:GELab-Zero 是否支持完全本地部署、离线运行?
A:支持。模型推理与设备控制均可在本机完成,无需依赖云端服务,但需本地具备足够算力和存储空间。
Q:GELab-Zero-4B-preview 对硬件配置有什么大致要求?
A:通常建议使用具备 8–12GB 显存的单卡 GPU 或高配 CPU,若使用高压缩量化(如 Q4)可在更低配置设备上体验,但推理质量和速度会有所下降。
Q:已有自己的多模态/语言模型,能否直接接入 GELab-Zero?
A:可以。只要能通过 HTTP 或类似接口提供对话式推理服务,并遵循项目文档中约定的请求与消息格式,即可替换默认的 GELab-Zero-4B-preview。
Q:AndroidDaily 基准可以单独用于模型评测吗?
A:可以。仓库与官网提供静态与端到端两种评测方式,可独立下载数据和脚本,对自有 GUI Agent 模型进行对比实验。