AI-новости5 апреля 2026 г., 00:03 МСК

VOID от Netflix: удаление объектов и их физических последствий в видео стало заметно ближе к массовому продакшену

Фото новости
\n

VOID от Netflix появился как модель, которая вычищает не только объект, но и его следы в сцене. \nСейчас она работает на основе 5B-параметровой архитектуры CogVideoX и требует минимум 40 GB VRAM. \nДля большинства стендов это значит, без A100-сервера не обойтись.

\n

Команда добавила режимы Pass 1 и Pass 2, чтобы убрать больше швов между кадрами. \nПервые тесты уже показывают, что эффект выглядит ближе к реальному удалению, чем к «заливке фона».

\n\n

Что реально изменилось: удаление теперь учитывает физику сцены

\n
Интерфейс и карточка модели VOID на Hugging Face с блоками Pass 1, Pass 2 и параметрами
Скриншот: huggingface.co
\n

Обычное inpainting (восстановление отсутствующих областей) стирает объект и оставляет нереалистичные последствия. \nVOID делает больше: он моделирует, как падает бутылка, смещаются предметы и меняется сцена после удаления.

\n
    \n
  • Учитываются вторичные эффекты: тени, отражения и даже движение зависимых объектов.
  • \n
  • Quadmask (маска из 4 зон) задает: удаляемая зона, пересечение, затронутые участки и фон.
  • \n
  • Pass 1 дает базовое inpaint-удаление и уже закрывает типовые кейсы.
  • \n
  • Pass 2 включает warped-noise refinement для временной консистентности на длинных клипах.
  • \n
  • Поддержка до 197 кадров делает модель пригодной для коротких роликов и тизеров без разрезки.
  • \n
\n

Сценарий для бизнеса простой: кадр с нежелательным объектом в рекламном ролике больше не требует ручной перерисовки всего фона. \nВ маркетинге это экономит часы монтажа, а не минуты.\n\n

Зачем это сделали и что стоит за идеей

\n

Главная причина проста: VFX в коротких видео стали узким местом для команд без большого бюджета. \nОдна ошибка в движении предмета и клип воспринимается неестественно, даже если качество рендеров выше.

\n
    \n
  • Снижение затрат: меньше ручной перерисовки и композитинга.
  • \n
  • Скорость: можно получить альтернативный вариант кадра быстрее, чем за ночь на монтаж.
  • \n
  • Контроль данных: запуск локально через репозиторий дает больше предсказуемости.
  • \n
  • Точность: обучение на HUMOTO и Kubric помогает лучше понимать физические взаимодействия.
  • \n
\n
\n \n \n \n \n \n \n \n \n \n \n \n \n \n \n \n \n \n \n \n \n \n \n \n \n
ПараметрЗначениеЧто даёт на практике
Точность весовBF16 + FP8 quantization (экономия памяти без потери структуры)Меньше памяти на запуск, больше шансов уместиться в доступный GPU-эккаунт.
Формат маскиquadmask with values 0/63/127/255Модель понимает, где объект должен исчезнуть, а где оставить фон стабильным.
Обучение8x A100 80GB, DeepSpeed ZeRO Stage 2Высокая вычислительная стоимость, зато сильная физическая правдоподобность.
\n

Сравнивайте Pass 1 и Pass 2 через benchmark (тест производительности) на реальных роликах 10–20 секунд. \nТак вы поймете, где улучшение стоит дополнительного времени.

\n\n

Как применять прямо сейчас: быстрый путь от репозитория до рабочего клипа

\n

Если у вас есть GPU с нужной памятью, запуск занимает больше настройки, чем фантастической магии. \nСценарий для старта:

\n
    \n
  1. Клонируйте репозиторий github.com/netflix/void-model.
  2. \n
  3. Установите зависимости из requirements, затем скачайте CogVideoX-InP и checkpoint (контрольная точка весов) VOID.
  4. \n
  5. Подготовьте папку с input_video.mp4, quadmask_0.mp4 и prompt.json.
  6. \n
  7. Проверьте, что quadmask указывает зоны: remove (удалить), overlap (перекрытие), affected (затронуто), keep (сохранить).
  8. \n
  9. Запустите inference (вычисление модели) через predict_v2v.py, начните с pass1.
  10. \n
  11. Если ролик длиннее или заметны прыжки, включите pass2 для temporal consistency (согласованности между кадрами).
  12. \n
  13. Сравните качество и время, сохраните лучший вариант, оцените, где нужен ручной доконтроль.
  14. \n
\n

Доступ к модели на уровне inference-provider пока не развернут, значит тест сейчас в основном локальный. \nЭто снижает зависимость от облачных API и повышает контроль над пайплайном (цепочкой обработки).

\n\n

Если проект про рекламу, маркетинг или короткие туториалы, VOID даст ощутимый эффект уже после первых 2–3 видео. \nДля девов в AI-стеке это шанс внедрить локальную видео-редакцию без дорогостоящего рендера на каждой итерации. \nИсточник с деталями: карточка VOID на Hugging Face и статья 2604.02296.\n

\n

Вывод неожиданный: модель не про «удалить и забыть», а про переосмысление монтажа как управляемого продукта, где ИИ берет тяжёлую физику, а человек проверяет идею.\n

\n