Исследования4 октября 2026 г., 11:16 МСК🤖 Auto

Google внедрила TEE в Gboard: верифицируемая приватность и ускорение обучения

Google Research представила новую архитектуру федеративного обучения на базе доверенных сред выполнения (TEE). Система обеспечивает внешнюю верификацию дифференциальной приватности и уже работает в Gboard.

Баннер новости 8885

Решение проблемы «черного ящика» в федеративном обучении

Google Research анонсировала переход от классического федеративного обучения (FL) к системе, основанной на доверенных средах выполнения (TEE). Главная инновация — впервые обеспечена возможность внешней верификации гарантий центральной дифференциальной приватности (DP). В предыдущих реализациях пользователи были вынуждены доверять Google в корректности добавления шума и отсутствии скрытого логирования данных, так как серверная логика не могла быть независимо проверена.

Новая архитектура переносит вычисление градиентов с устройств пользователей на сервер, но делает эту серверную логику аттестуемой. Это устраняет необходимость слепого доверия оператору платформы.

Техническая архитектура: 4 ключевых компонента

Система координирует четыре основных блока, построенных на базе Google Project Oak:

  • Загрузка данных: Устройства шифруют обучающие примеры локально и предварительно авторизуют политику доступа. Эта политика публикуется в публичном журнале прозрачности Sigstore Rekor.
  • KMS и проверка политик: Система управления ключами, работающая на TEE с использованием протокола консенсуса RAFT, выдает ключи дешифрования только тем рабочим нагрузкам, которые соответствуют опубликованной политике.
  • Выполнение нагрузки: Корневой TEE запускает цикл обучения на Python и делегирует задачи рабочим TEE. Оркестрация осуществляется через Federated Language (на базе TensorFlow Federated). В сеть передаются только веса модели с добавленным шумом DP.
  • Восстановление после сбоев: Состояние восстановления шифруется KMS, что позволяет обрабатывать сбои корневых или рабочих узлов без потери данных.

Результаты для Gboard: точность и скорость

Первым продуктом, использующим эту технологию, стал Gboard для моделей предсказания следующих слов на английском и японском языках. Внедрение TEE позволило решить две критические проблемы:

  1. Оптимизация расписания: Все загрузки собираются перед запуском обучения на сервере. Это нивелирует влияние суточных колебаний доступности устройств. Google обучила английскую модель за 5000 раундов с когортами из 6500 устройств.
  2. Параллелизм: Узкое место сместилось с доступности устройств на вычислительные мощности TEE. Если ранние модели FL требовали 1–2 месяца на обучение, новая архитектура позволяет масштабировать процесс параллельно, ограничиваясь лишь ресурсами TEE.

Сравнение с другими фреймворками

Google позиционирует свое решение как единственную систему с публичным журналом прозрачности кода сервера и воспроизводимыми сборками TEE. Ниже приведено сравнение с ключевыми игроками рынка:

Функция Google TEE-based FL NVIDIA FLARE Flower Apple pfl-research
Основное назначение Продакшн (Gboard) SDK для облака/K8s Фреймворк для разработки Симуляция
Где вычисляются обновления Серверные TEE На каждом узле На клиентах Симулировано
Поддержка TEE Да (Project Oak) AMD SEV-SNP, Intel TDX Нет (в ядре) Нет
Дифференциальная приватность Центральная DP (верифицируемая) DP-SGD (Opacus) Центральная и локальная Локальная и центральная
Публичный журнал прозрачности Да (Sigstore Rekor) Не задокументировано Не задокументировано Не применимо
Лицензия Apache 2.0 Apache 2.0 Apache 2.0 Apache 2.0

Открытый код и доступность

Google открыла исходные коды основных бинарных файлов TEE и языка Federated Language под лицензией Apache 2.0. Техническая документация и репозиторий доступны на GitHub. Исследование опубликовано в arXiv:2609.31494 2 октября 2026 года.

Источник: MarkTechPost ↗