Новый стандарт взаимодействия: от текста к голосу
Google DeepMind анонсировала Gemini Omni — новую архитектуру модели, разработанную для создания контента из любого типа входных данных. Первым релизом стала версия Gemini Omni Flash, ключевой особенностью которой является возможность генерации и редактирования видео в режиме диалога. Пользователям больше не нужно писать сложные промпты: достаточно просто поговорить с моделью, чтобы получить желаемый визуальный результат.
Команда за разработкой
За разработкой модели стояла команда исследователей Google DeepMind, которая поделилась внутренним видением продукта. В интервью приняли участие:
- Мохаммад Бабаизаде (Mohammad Babaeizadeh) — научный сотрудник, исследователь;
- Аниш Нангия (Anish Nangia) — менеджер продукта;
- Сара Сюй (Sarah Xu) — инженер-исследователь.
Специалисты подчеркнули, что выбор видео в качестве первого направления был стратегическим. По словам Сары Сюй, модель «будет только улучшаться», а возможности генерации не имеют верхних пределов. Мохаммад Бабаизаде проиллюстрировал это примерами: модель способна менять прически, трансформировать людей в животных (например, в ленивцев) или материализовывать объекты, такие как домашние коты, прямо на столе перед пользователем.
Почему это важно для индустрии
Запуск Gemini Omni Flash знаменует собой сдвиг парадигмы в создании медиаконтента. Переход от текстовых промптов к естественному голосовому взаимодействию значительно снижает порог входа для создателей контента. Это позволяет быстрее итеративно редактировать видео, обсуждая изменения в реальном времени, что критически важно для профессиональных видеографов, маркетологов и создателей пользовательского контента.
Ключевые характеристики релиза
| Параметр | Значение |
|---|---|
| Название модели | Gemini Omni (первый релиз: Gemini Omni Flash) |
| Разработчик | Google DeepMind |
| Основной функционал | Генерация и редактирование видео через голосовой диалог |
| Дата анонса | 13 августа 2026 года |
| Ключевые участники | Mohammad Babaeizadeh, Anish Nangia, Sarah Xu |
Полное интервью с командой разработчиков доступно для просмотра на официальном блоге Google, где подробно разбираются технические аспекты работы модели и планы на будущее развитие архитектуры Omni.
Источник: Google DeepMind ↗
