ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
联邦学习不再靠信任:Google 用可信执行环境重做系统,Gboard 已部署

联邦学习不再靠信任:Google 用可信执行环境重做系统,Gboard 已部署

AI资讯 • Admin • • 6 次浏览

联邦学习训练数据的隐私保证,长期以来很大程度上要靠用户信任服务器运营方。2026 年 10 月 2 日,Google Research 在官方博客发布新一代联邦学习系统:训练被搬进可信执行环境(TEE),数据处理过程可以被远程验证和审计,哪些计算能碰数据要先写进公开透明日志。输入法 Gboard 已经用上这套系统,英语和日语的下一词预测模型率先迁移。

旧系统的短板不在算法,在"看不见"

Google 在 2017 年提出联邦学习,Gboard 的下一词预测、Google Messages 的回复建议等功能一直在用它。早期做法是设备数据上传后立即聚合,但外部观察者无从验证数据有没有被记录或查看。后来加入的 Secure Aggregation 能用密码学保护上传内容,却与当前最先进的中心化差分隐私保证不兼容。结果是:加噪声的是运营方,证明自己加了噪声的也是运营方,隐私停留在承诺层面。

新系统怎么把"信任"换成"验证"

设备先在本地加密训练样本再上传,并预先授权一份访问策略:只有策略里列明的 TEE 计算可以处理这些数据,且只能释放匿名化结果。访问策略必须发布到公开透明日志 Rekor,外部审计者可以追踪设备可能参与的全部服务端工作负载。密钥管理系统由一组运行 RAFT 共识协议的 TEE 组成,只向符合访问策略的工作负载发放解密密钥。训练本身在 TEE 内运行 Python 程序,根 TEE 把可并行的子任务分发给 worker TEE 集群;对工作负载运营者可见的,只有指标和经过差分隐私处理的模型权重。密钥管理与数据处理的二进制文件可以从开源代码可复现构建,代码托管在 GitHub 的 Confidential Federated Compute 仓库。

已经落地的变化与仍存在的边界

Gboard 的迁移带来了两个直接变化。过去训练一个这类模型要 1 到 2 个月,进度被设备在线时间、端侧算力和多个训练任务抢资源拖住;新系统先集中收集上传、再在服务端并行训练,瓶颈转移到 TEE 资源可用量,训练时间显著缩短,官方称准确率也更高。把梯度计算从设备移到服务端后,联邦学习能训练的模型规模上限被抬高,Google 还在尝试在这套基础设施上跑合成数据生成等其他 Python 工作负载,并探索把 TEE 与加速器结合。

边界同样要说清楚:现阶段 TEE 硬件本身有已知局限,侧信道观察仍是未解问题,Google 把这项工作定位为"走向可证明隐私"的一步,而不是终点。对普通用户,这件事的意义不在输入法反应快了多少,而在于隐私保护的举证方式开始变化——从"我说我没看你的数据",变成"处理数据的代码清单先公开,你可以自己查"。

推荐工具

更多