Релиз модели13 августа 2026 г., 17:00 МСК🤖 Auto

Google DeepMind представил Gemini Omni Flash: генерация видео голосом

Google DeepMind выпустила первую версию модели Gemini Omni Flash, позволяющую создавать и редактировать видео через обычный разговор. Это первый шаг к мультимодальному ИИ, способному обрабатывать любой ввод.

Баннер новости 5712

Новый стандарт взаимодействия: от текста к голосу

Google DeepMind анонсировала Gemini Omni — новую архитектуру модели, разработанную для создания контента из любого типа входных данных. Первым релизом стала версия Gemini Omni Flash, ключевой особенностью которой является возможность генерации и редактирования видео в режиме диалога. Пользователям больше не нужно писать сложные промпты: достаточно просто поговорить с моделью, чтобы получить желаемый визуальный результат.

Команда за разработкой

За разработкой модели стояла команда исследователей Google DeepMind, которая поделилась внутренним видением продукта. В интервью приняли участие:

  • Мохаммад Бабаизаде (Mohammad Babaeizadeh) — научный сотрудник, исследователь;
  • Аниш Нангия (Anish Nangia) — менеджер продукта;
  • Сара Сюй (Sarah Xu) — инженер-исследователь.

Специалисты подчеркнули, что выбор видео в качестве первого направления был стратегическим. По словам Сары Сюй, модель «будет только улучшаться», а возможности генерации не имеют верхних пределов. Мохаммад Бабаизаде проиллюстрировал это примерами: модель способна менять прически, трансформировать людей в животных (например, в ленивцев) или материализовывать объекты, такие как домашние коты, прямо на столе перед пользователем.

Почему это важно для индустрии

Запуск Gemini Omni Flash знаменует собой сдвиг парадигмы в создании медиаконтента. Переход от текстовых промптов к естественному голосовому взаимодействию значительно снижает порог входа для создателей контента. Это позволяет быстрее итеративно редактировать видео, обсуждая изменения в реальном времени, что критически важно для профессиональных видеографов, маркетологов и создателей пользовательского контента.

Ключевые характеристики релиза

Параметр Значение
Название модели Gemini Omni (первый релиз: Gemini Omni Flash)
Разработчик Google DeepMind
Основной функционал Генерация и редактирование видео через голосовой диалог
Дата анонса 13 августа 2026 года
Ключевые участники Mohammad Babaeizadeh, Anish Nangia, Sarah Xu

Полное интервью с командой разработчиков доступно для просмотра на официальном блоге Google, где подробно разбираются технические аспекты работы модели и планы на будущее развитие архитектуры Omni.

Источник: Google DeepMind ↗