Релиз модели30 сентября 2026 г., 13:18 МСК🤖 Auto

NVIDIA Physis-Lang: Язык физики победил Veo 3.1 в бенчмарках

Исследователи NVIDIA, MIT и Оксфорда представили Physis-Lang — фреймворк, использующий самообучаемые физические описания для улучшения видео-моделей. Cosmos 3 теперь превосходит Google Veo 3.1 по точности симуляции законов физики.

Баннер новости 8593

Проблема: Видео «понимает» картинку, но нарушает физику

Традиционные видео-модели генерируют визуально убедительные клипы, но часто игнорируют законы природы: масло может вести себя как краска, а мяч проходить сквозь стены. Команда из NVIDIA, MIT и Университета Оксфорда предлагает решение не через изменение архитектуры нейросетей, а через язык. Их фреймворк Physis-Lang добавляет к обычным подписям к видео поле physics_reasoning, которое явно описывает сущности, причины, взаимодействия и временную эволюцию сцены.

Механика: Самоэволюционирующий цикл

Ключевая инновация — замкнутый цикл оптимизации. Модель-описатель (Captioner) остается замороженной, но эволюционирует инструкция для нее. Процесс выглядит так:

  • Генерация: GPT-5.5 создает подписи для набора из 20 видео с 273 верифицированными утверждениями.
  • Критика: Gemini-3.1-Pro оценивает точность (Precision) и полноту (Recall) физических утверждений.
  • Эволюция: Агент переписывает промпт на основе ошибок. Каждый новый промпт валидируется на бенчмарке PhysCapBench (246 видео, 3 794 утверждения).

Результат итеративного улучшения: F1-мера качества подписей выросла с 78.64 (итерация 1) до 87.82 (итерация 9), несмотря на временные откаты из-за излишней осторожности модели на ранних этапах.

Результаты: Cosmos 3 против Veo 3.1

Финетюнинг с использованием LoRA (без изменения архитектуры) позволил модели Cosmos3-Nano на Physis-Lang превзойти Google Veo 3.1 в большинстве физических бенчмарков. Важно отметить, что общая визуальная качество (VBench-I2V) осталось стабильным (рост с 88.32 до 88.69), что доказывает: улучшение физики не деградирует художественную составляющую.

Бенчмарк Cosmos 3 + Physis-Lang Google Veo 3.1 Разница
PhyGenBench 71.04 65.63 +5.41
Physics-IQ Verified 43.41 34.99 +8.42
PhyGround 69.90 69.24 +0.66
VideoPhy-2 (Hard split) 62.36 58.43 +3.93

Экономия и локализация: От $24K до $0

Изначально пайплайн использовал коммерческие API (GPT-5.5, Gemini), что стоило около $24,120 за процесс. Исследователи дистиллировали эту логику в две локальные модели Qwen3-VL-4B-Instruct (PhysThinker-C и PhysThinker-U). Это позволило:

  • Снизить стоимость до $120 при сохранении прироста +6.76 балла.
  • Полностью локальный запуск (без API) дал прирост +4.76 балла при стоимости $0.

Сравнение с конкурентами

Physis-Lang демонстрирует лидерство не только против Veo 3.1, но и против специализированных физических моделей, таких как PhiZero и PhyGDPO. В отличие от них, Physis-Lang работает как с обучением (LoRA SFT), так и в режиме «prompt-only», что делает его гибким инструментом для улучшения существующих видео-генераторов.

Метрика Physis-Lang (Cosmos3-Nano) PhiZero PhyGDPO
Physics-IQ Verified 43.41 40.91 27.20
PhyGenBench 71.04 n/r 48.96
VideoPhy-2 (All) 68.02 n/r 59.56
PhyGround 69.90 57.85 n/r

Код и веса пока не опубликованы, доступна только научная статья. Однако методология «языковой кривой» открывает путь к созданию более надежных симуляторов для робототехники и киноиндустрии.

Бенчмарки

БенчмаркPhysis-Lang (Cosmos3-Nano)PhiZeroPhiZero (Competitor)PhyGDPOPhysis-Lang (Iteration 1)Physis-Lang (Iteration 9)Veo 3.1
PhyGenBench71.04%49.17%—48.96%——65.63%
Physics-IQ Verified43.41%40.91%27.2%———34.99%
PhyGround69.9%57.85%58.22%————
VideoPhy-2 (All)68.02%47.88%—59.56%——68.87%
VideoPhy-2 (Hard)62.36%28.09%—44.94%——58.43%
PhysCapBench (F1)————78.64%87.82%—

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗