Суть проекта: Архитектура вместо весов
Google DeepMind, под руководством Джеффа Дина, работает над серверным чипом «Frozen v2». В отличие от первой версии, которая планировала «зашить» веса модели, новый подход фиксирует только архитектуру Gemini. Это позволяет обновлять веса модели, сохраняя аппаратную актуальность чипа для будущих версий Gemini, но ограничивает его использование только моделями на этой архитектуре.
Ключевые метрики и сроки
Инженеры прогнозируют радикальный рост энергоэффективности. Проект нацелен на решение острой нехватки AI-вычислений, из-за которой Google Cloud уже отказывает внешним клиентам. Ожидаемые характеристики:
| Параметр | Значение / Описание |
|---|---|
| Эффективность | В 6–10 раз больше токенов на ватт по сравнению с новейшими TPU |
| Целевой год | 2028 (запуск в производство) |
| Технология | Фиксация архитектуры в транзисторах (снижение задержек и перемещения данных) |
| Статус | Экспериментальный; не подтвержден официально, но источники подтверждают работу |
Почему это важно для индустрии
Традиционные TPU (как TPU v8, анонсированные в апреле) являются универсальными: они загружают модель во время выполнения, что требует времени на runtime-решения. Frozen v2 устраняет этот этап, «замораживая» логику работы. Это снижает латентность, что критично для новых приложений реального времени.
Контекст и конкуренция
Google не планирует массовое производство Frozen v2 как замену TPU, а использует его как тестовый полигон для специализированного кремния. На фоне этого другие игроки уже внедряют подобные решения:
- Taalas: Чип HC1 с «зашитым» Llama 3.1 8B, 17 000 токенов/сек без HBM.
- Nvidia: Сделка на $20 млрд с Groq (лидер в области inference-чипов).
Параллельно Google бронирует у Intel упаковку более 3 млн TPU к 2028 году, что указывает на гибридную стратегию: сохранение универсальных TPU для обучения и специализированных Frozen-чипов для инференса.
Источник: Tom's Hardware ↗
