VOID от Netflix появился как модель, которая вычищает не только объект, но и его следы в сцене. \nСейчас она работает на основе 5B-параметровой архитектуры CogVideoX и требует минимум 40 GB VRAM. \nДля большинства стендов это значит, без A100-сервера не обойтись.
\nКоманда добавила режимы Pass 1 и Pass 2, чтобы убрать больше швов между кадрами. \nПервые тесты уже показывают, что эффект выглядит ближе к реальному удалению, чем к «заливке фона».
\n\nЧто реально изменилось: удаление теперь учитывает физику сцены
\n
Обычное inpainting (восстановление отсутствующих областей) стирает объект и оставляет нереалистичные последствия. \nVOID делает больше: он моделирует, как падает бутылка, смещаются предметы и меняется сцена после удаления.
\n- \n
- Учитываются вторичные эффекты: тени, отражения и даже движение зависимых объектов. \n
- Quadmask (маска из 4 зон) задает: удаляемая зона, пересечение, затронутые участки и фон. \n
- Pass 1 дает базовое inpaint-удаление и уже закрывает типовые кейсы. \n
- Pass 2 включает warped-noise refinement для временной консистентности на длинных клипах. \n
- Поддержка до 197 кадров делает модель пригодной для коротких роликов и тизеров без разрезки. \n
Сценарий для бизнеса простой: кадр с нежелательным объектом в рекламном ролике больше не требует ручной перерисовки всего фона. \nВ маркетинге это экономит часы монтажа, а не минуты.\n\n
Зачем это сделали и что стоит за идеей
\nГлавная причина проста: VFX в коротких видео стали узким местом для команд без большого бюджета. \nОдна ошибка в движении предмета и клип воспринимается неестественно, даже если качество рендеров выше.
\n- \n
- Снижение затрат: меньше ручной перерисовки и композитинга. \n
- Скорость: можно получить альтернативный вариант кадра быстрее, чем за ночь на монтаж. \n
- Контроль данных: запуск локально через репозиторий дает больше предсказуемости. \n
- Точность: обучение на HUMOTO и Kubric помогает лучше понимать физические взаимодействия. \n
| Параметр | \nЗначение | \nЧто даёт на практике | \n
|---|---|---|
| Точность весов | \nBF16 + FP8 quantization (экономия памяти без потери структуры) | \nМеньше памяти на запуск, больше шансов уместиться в доступный GPU-эккаунт. | \n
| Формат маски | \nquadmask with values 0/63/127/255 | \nМодель понимает, где объект должен исчезнуть, а где оставить фон стабильным. | \n
| Обучение | \n8x A100 80GB, DeepSpeed ZeRO Stage 2 | \nВысокая вычислительная стоимость, зато сильная физическая правдоподобность. | \n
Сравнивайте Pass 1 и Pass 2 через benchmark (тест производительности) на реальных роликах 10–20 секунд. \nТак вы поймете, где улучшение стоит дополнительного времени.
\n\nКак применять прямо сейчас: быстрый путь от репозитория до рабочего клипа
\nЕсли у вас есть GPU с нужной памятью, запуск занимает больше настройки, чем фантастической магии. \nСценарий для старта:
\n- \n
- Клонируйте репозиторий github.com/netflix/void-model. \n
- Установите зависимости из requirements, затем скачайте CogVideoX-InP и checkpoint (контрольная точка весов) VOID. \n
- Подготовьте папку с input_video.mp4, quadmask_0.mp4 и prompt.json. \n
- Проверьте, что quadmask указывает зоны: remove (удалить), overlap (перекрытие), affected (затронуто), keep (сохранить). \n
- Запустите inference (вычисление модели) через predict_v2v.py, начните с pass1. \n
- Если ролик длиннее или заметны прыжки, включите pass2 для temporal consistency (согласованности между кадрами). \n
- Сравните качество и время, сохраните лучший вариант, оцените, где нужен ручной доконтроль. \n
Доступ к модели на уровне inference-provider пока не развернут, значит тест сейчас в основном локальный. \nЭто снижает зависимость от облачных API и повышает контроль над пайплайном (цепочкой обработки).
\n\nЕсли проект про рекламу, маркетинг или короткие туториалы, VOID даст ощутимый эффект уже после первых 2–3 видео. \nДля девов в AI-стеке это шанс внедрить локальную видео-редакцию без дорогостоящего рендера на каждой итерации. \nИсточник с деталями: карточка VOID на Hugging Face и статья 2604.02296.\n
\nВывод неожиданный: модель не про «удалить и забыть», а про переосмысление монтажа как управляемого продукта, где ИИ берет тяжёлую физику, а человек проверяет идею.\n
\n