Релиз модели7 августа 2026 г., 17:30 МСК🤖 Auto

Gemini Omni: Конвертация скетчей в видео и смена ракурсов без рендера

Google DeepMind представила модель Gemini Omni, способную генерировать и редактировать видео через естественный язык. Разработчики уже демонстрируют смену освещения, трансформацию объектов и анимацию рисунков в реальном времени.

Баннер новости 5313

Новая парадигма видеогенерации

Google DeepMind анонсировала модель Gemini Omni, которая позиционируется как следующий шаг в развитии мультимодальных ИИ. В отличие от предыдущих версий, эта модель объединяет понимание физики и реальных знаний о мире, что позволяет создавать видео, где объекты ведут себя естественно, а переходы между сценами остаются логичными. Ключевая особенность — возможность редактирования существующего видео или генерации нового по текстовому, аудио или визуальному запросу с точностью, сравнимой с разговором.

Технические возможности на практике

Разработчики уже протестировали модель в различных сценариях. Основные функции включают:

  • Смена ракурсов: Модель способна переснимать сцену с разных углов (вид сверху, снизу, профиль), сохраняя целостность персонажа и фона.
  • Трансформация среды: Голосовые команды позволяют менять время суток, погоду (дождь, снег) и освещение без потери качества.
  • Анимация скетчей: В инструменте Google Flow можно превратить простой рисунок в реалистичное видео, задав движение отдельным элементам.
  • Стилизация: Плавный переход между стилями (аниме, claymation, live-action) в рамках одного клипа.

Демонстрации от сообщества

В блоге Google приведены конкретные примеры использования модели разработчиками. Ниже сводная таблица кейсов:

Разработчик Демонстрируемая функция Описание результата
Leon Lin (@LexnLin) Смена перспективы Съемка женщины в городе с ~20 ракурсов: зум, вид сверху, профиль. Фон динамически меняется (тротуары, трамваи, здания).
Carlos Santana (@DotCSV) Изменение среды Голосовое управление: смена дня на ночь, добавление дождя, облаков, изменение цвета листвы на оранжевый и покрытие земли снегом.
Pan (@sebatheepan) Анимация скетчей Превращение рисунков в видео: лимон становится подводной лодкой, эспрессо — воздушным шаром, спичка — ракетой, ножницы — акулой.
Jerrod Lew (@jerrod_lew) Смена стиля Видео идущей женщины плавно трансформируется из live-action в аниме, затем в claymation и другие стили без разрыва движения.
Hyperagent Бизнес-визуализация Создание концептов: ландшафтный дизайн парка (до/после), анимированный профессор для объяснения дашбордов, геймификация списков задач.

Где попробовать

Доступ к Gemini Omni уже открыт для разработчиков. Модель интегрирована в несколько продуктов экосистемы Google:

  • Приложение Gemini
  • Google Flow
  • Google AI Studio
  • Gemini API
  • Gemini Enterprise Agent Platform

Запуск модели знаменует переход от статичной генерации изображений к полноценному кинематографическому контролю через естественный язык, что существенно снижает порог входа в создание видеоконтента.

Источник: Google DeepMind ↗