ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
연합학습, 신뢰가 아닌 검증으로: Google의 TEE 기반 재설계, Gboard에 이미 적용

연합학습, 신뢰가 아닌 검증으로: Google의 TEE 기반 재설계, Gboard에 이미 적용

AI 정보 • Admin • • 6 회 조회

연합학습 훈련 데이터의 프라이버시 보장은 오랫동안 사용자가 서버 운영자를 신뢰하는 데 크게 의존해 왔다. 2026년 10월 2일, Google Research는 공식 블로그를 통해 차세대 연합학습 시스템을 발표했다. 훈련을 신뢰 실행 환경(TEE) 안에서 수행해 데이터 처리를 원격으로 검증하고 감사할 수 있게 하고, 어떤 연산이 데이터에 접근할 수 있는지를 먼저 공개 투명성 로그에 기록하는 방식이다. 키보드 앱 Gboard는 이미 이 시스템을 도입해 영어와 일본어 다음 단어 예측 모델부터 이전을 시작했다.

구 시스템의 약점은 알고리즘이 아니라 '보이지 않는다는 것'

Google이 연합학습을 제안한 것은 2017년으로, Gboard의 다음 단어 예측과 Google Messages의 답장 제안 등에 쓰여 왔다. 초기 방식은 기기 데이터를 업로드해 즉시 집계했지만, 외부 관찰자는 데이터가 기록되거나 열람됐는지 검증할 방법이 없었다. 이후 추가된 Secure Aggregation은 업로드를 암호학적으로 보호했지만, 현존 최강 수준의 중앙형 차분 프라이버시 보장 과는 양립하지 않았다. 결국 노이즈를 넣는 것도, 넣었다고 주장하는 것도 운영자였고, 프라이버시는 약속의 수준에 머물렀다.

새 시스템이 '신뢰'를 '검증'으로 바꾸는 방법

기기는 훈련 샘플을 로컬에서 암호화한 뒤 업로드하고, 접근 정책을 미리 승인한다. 정책에 열거된 TEE 연산만 데이터를 처리할 수 있고, 익명화된 결과만 내보낼 수 있다. 접근 정책은 공개 투명성 로그 Rekor에 게시해야 하며, 외부 감사자는 기기가 참여할 수 있는 서버 측 작업 전체를 추적할 수 있다. 키 관리 시스템은 RAFT 합의 프로토콜을 실행하는 TEE 클러스터로 구성되며, 정책에 부합하는 작업에만 복호화 키를 건넨다. 훈련 자체는 TEE 안에서 Python 프로그램으로 실행되고, 루트 TEE가 병렬화 가능한 하위 작업을 워커 TEE 클러스터에 나눠 맡긴다. 작업 운영자가 볼 수 있는 것은 지표와 차분 프라이버시 처리가 된 모델 가중치뿐이다. 키 관리와 데이터 처리 바이너리는 GitHub의 Confidential Federated Compute 저장소에 있는 오픈소스 코드로 재현 가능하게 빌드할 수 있다.

이미 나타난 변화와 여전히 남은 한계

Gboard의 이전으로 두 가지 직접적인 변화가 생겼다. 과거 이런 모델 하나의 훈련에는 1~2개월이 걸렸고, 진척은 기기의 접속 상황, 기기 측 연산 자원, 여러 훈련 작업의 자원 경쟁에 좌우됐다. 새 시스템은 업로드를 먼저 모은 뒤 서버에서 병렬로 훈련하므로 병목이 TEE 자원 가용성으로 옮겨 갔고, 훈련 시간은 크게 줄었으며 정확도도 높아졌다고 Google은 밝혔다. 그래디언트 계산을 기기에서 서버로 옮기면서 연합학습으로 훈련할 수 있는 모델 규모의 상한도 높아졌고, Google은 합성 데이터 생성 같은 다른 Python 작업을 같은 인프라에서 실행하는 실험과 TEE와 가속기의 결합도 탐색하고 있다.

한계도 분명하다. 현세대 TEE 하드웨어에는 알려진 제약이 있고, 부채널 관찰은 여전히 풀리지 않은 문제이며, Google 스스로도 이를 '증명 가능한 프라이버시'를 향한 한 걸음으로 위치 짓지 최종 도착점이라고 하지 않는다. 일반 사용자에게 이 일의 의미는 키보드가 조금 빨라지는 데 있지 않다. 프라이버시 보호의 입증 방식이 바뀌기 시작했다는 데 있다. "당신의 데이터를 보지 않았다"는 선언에서, "데이터를 처리할 수 있는 코드 목록을 먼저 공개하니 직접 확인하라"는 방식으로.

추천 도구

더보기