Les garanties de confidentialité des données d'entraînement en apprentissage fédéré ont longtemps reposé largement sur la confiance accordée à l'opérateur du serveur. Le 2 octobre 2026, Google Research a présenté dans un article officiel de blog un système d'apprentissage fédéré de nouvelle génération : l'entraînement s'exécute dans des environnements d'exécution de confiance (TEE), de sorte que le traitement des données peut être vérifié à distance et audité, et les calculs autorisés à toucher les données doivent d'abord être inscrits dans un journal de transparence public. Le clavier Gboard utilise déjà ce système, en commençant par ses modèles de prédiction du mot suivant en anglais et en japonais.
La faiblesse de l'ancien système n'était pas l'algorithme, mais l'invisibilité
Google a introduit l'apprentissage fédéré en 2017 ; il alimente notamment la prédiction du mot suivant de Gboard et les suggestions de réponse de Google Messages. Dans la conception initiale, les données des appareils étaient téléversées puis agrégées immédiatement, mais aucun observateur extérieur ne pouvait vérifier si elles avaient été enregistrées ou consultées. Secure Aggregation, ajouté ensuite, protégeait les téléversements par la cryptographie, mais restait incompatible avec les garanties centrales de confidentialité différentielle les plus fortes. Résultat : l'opérateur ajoutait le bruit, et l'opérateur attestait aussi qu'il l'avait ajouté. La confidentialité restait au niveau de la promesse.
Comment le nouveau système remplace la « confiance » par la « vérification »
Les appareils chiffrent localement les exemples d'entraînement avant de les téléverser et pré-autorisent une politique d'accès : seuls les calculs TEE énumérés dans la politique peuvent traiter ces données, et ils ne peuvent diffuser que des résultats anonymisés. Les politiques d'accès doivent être publiées dans Rekor, un journal de transparence public, afin que des auditeurs externes puissent suivre l'ensemble des traitements côté serveur auxquels un appareil pourrait participer. Le système de gestion des clés est un cluster de TEE exécutant le protocole de consensus RAFT, et il ne remet les clés de déchiffrement qu'aux traitements conformes à la politique. L'entraînement lui-même s'exécute comme un programme Python dans des TEE : un TEE racine délègue les sous-tâches parallélisables à un cluster de TEE travailleurs, et l'opérateur d'un traitement ne voit que des indicateurs et des poids de modèle protégés par la confidentialité différentielle. Les binaires de gestion des clés et de traitement des données peuvent être reconstruits de manière reproductible à partir du code open source du dépôt GitHub Confidential Federated Compute.
Ce qui a déjà changé, et les limites qui demeurent
La migration de Gboard a produit deux changements directs. Autrefois, entraîner un modèle de ce type prenait un à deux mois, au rythme de la disponibilité des appareils, de leur puissance de calcul et de la concurrence entre plusieurs tâches d'entraînement. Le nouveau système collecte d'abord les téléversements, puis entraîne en parallèle côté serveur ; le goulot d'étranglement se déplace vers la disponibilité des ressources TEE, le temps d'entraînement a nettement diminué et, selon Google, la précision s'est aussi améliorée. En déplaçant le calcul des gradients des appareils vers les serveurs, le plafond de taille des modèles en apprentissage fédéré s'élève ; Google expérimente aussi l'exécution d'autres charges Python, comme la génération de données synthétiques, sur la même infrastructure, ainsi que la combinaison des TEE avec des accélérateurs.
Les limites doivent être dites : le matériel TEE de la génération actuelle a des restrictions connues, les observations par canaux auxiliaires restent un problème ouvert, et Google présente ce travail comme une étape vers un apprentissage à confidentialité démontrable, pas comme une arrivée. Pour les utilisateurs ordinaires, l'enjeu n'est pas un clavier un peu plus rapide, mais le fait que la charge de la preuve en matière de confidentialité commence à s'inverser : de « nous affirmons ne jamais avoir regardé vos données » à « la liste du code autorisé à traiter vos données est publiée à l'avance, et vous pouvez la vérifier vous-même ».