Новая парадигма видеогенерации
Google DeepMind анонсировала модель Gemini Omni, которая позиционируется как следующий шаг в развитии мультимодальных ИИ. В отличие от предыдущих версий, эта модель объединяет понимание физики и реальных знаний о мире, что позволяет создавать видео, где объекты ведут себя естественно, а переходы между сценами остаются логичными. Ключевая особенность — возможность редактирования существующего видео или генерации нового по текстовому, аудио или визуальному запросу с точностью, сравнимой с разговором.
Технические возможности на практике
Разработчики уже протестировали модель в различных сценариях. Основные функции включают:
- Смена ракурсов: Модель способна переснимать сцену с разных углов (вид сверху, снизу, профиль), сохраняя целостность персонажа и фона.
- Трансформация среды: Голосовые команды позволяют менять время суток, погоду (дождь, снег) и освещение без потери качества.
- Анимация скетчей: В инструменте Google Flow можно превратить простой рисунок в реалистичное видео, задав движение отдельным элементам.
- Стилизация: Плавный переход между стилями (аниме, claymation, live-action) в рамках одного клипа.
Демонстрации от сообщества
В блоге Google приведены конкретные примеры использования модели разработчиками. Ниже сводная таблица кейсов:
| Разработчик | Демонстрируемая функция | Описание результата |
|---|---|---|
| Leon Lin (@LexnLin) | Смена перспективы | Съемка женщины в городе с ~20 ракурсов: зум, вид сверху, профиль. Фон динамически меняется (тротуары, трамваи, здания). |
| Carlos Santana (@DotCSV) | Изменение среды | Голосовое управление: смена дня на ночь, добавление дождя, облаков, изменение цвета листвы на оранжевый и покрытие земли снегом. |
| Pan (@sebatheepan) | Анимация скетчей | Превращение рисунков в видео: лимон становится подводной лодкой, эспрессо — воздушным шаром, спичка — ракетой, ножницы — акулой. |
| Jerrod Lew (@jerrod_lew) | Смена стиля | Видео идущей женщины плавно трансформируется из live-action в аниме, затем в claymation и другие стили без разрыва движения. |
| Hyperagent | Бизнес-визуализация | Создание концептов: ландшафтный дизайн парка (до/после), анимированный профессор для объяснения дашбордов, геймификация списков задач. |
Где попробовать
Доступ к Gemini Omni уже открыт для разработчиков. Модель интегрирована в несколько продуктов экосистемы Google:
- Приложение Gemini
- Google Flow
- Google AI Studio
- Gemini API
- Gemini Enterprise Agent Platform
Запуск модели знаменует переход от статичной генерации изображений к полноценному кинематографическому контролю через естественный язык, что существенно снижает порог входа в создание видеоконтента.
Источник: Google DeepMind ↗
