Проблема: Видео «понимает» картинку, но нарушает физику
Традиционные видео-модели генерируют визуально убедительные клипы, но часто игнорируют законы природы: масло может вести себя как краска, а мяч проходить сквозь стены. Команда из NVIDIA, MIT и Университета Оксфорда предлагает решение не через изменение архитектуры нейросетей, а через язык. Их фреймворк Physis-Lang добавляет к обычным подписям к видео поле physics_reasoning, которое явно описывает сущности, причины, взаимодействия и временную эволюцию сцены.
Механика: Самоэволюционирующий цикл
Ключевая инновация — замкнутый цикл оптимизации. Модель-описатель (Captioner) остается замороженной, но эволюционирует инструкция для нее. Процесс выглядит так:
- Генерация: GPT-5.5 создает подписи для набора из 20 видео с 273 верифицированными утверждениями.
- Критика: Gemini-3.1-Pro оценивает точность (Precision) и полноту (Recall) физических утверждений.
- Эволюция: Агент переписывает промпт на основе ошибок. Каждый новый промпт валидируется на бенчмарке PhysCapBench (246 видео, 3 794 утверждения).
Результат итеративного улучшения: F1-мера качества подписей выросла с 78.64 (итерация 1) до 87.82 (итерация 9), несмотря на временные откаты из-за излишней осторожности модели на ранних этапах.
Результаты: Cosmos 3 против Veo 3.1
Финетюнинг с использованием LoRA (без изменения архитектуры) позволил модели Cosmos3-Nano на Physis-Lang превзойти Google Veo 3.1 в большинстве физических бенчмарков. Важно отметить, что общая визуальная качество (VBench-I2V) осталось стабильным (рост с 88.32 до 88.69), что доказывает: улучшение физики не деградирует художественную составляющую.
| Бенчмарк | Cosmos 3 + Physis-Lang | Google Veo 3.1 | Разница |
|---|---|---|---|
| PhyGenBench | 71.04 | 65.63 | +5.41 |
| Physics-IQ Verified | 43.41 | 34.99 | +8.42 |
| PhyGround | 69.90 | 69.24 | +0.66 |
| VideoPhy-2 (Hard split) | 62.36 | 58.43 | +3.93 |
Экономия и локализация: От $24K до $0
Изначально пайплайн использовал коммерческие API (GPT-5.5, Gemini), что стоило около $24,120 за процесс. Исследователи дистиллировали эту логику в две локальные модели Qwen3-VL-4B-Instruct (PhysThinker-C и PhysThinker-U). Это позволило:
- Снизить стоимость до $120 при сохранении прироста +6.76 балла.
- Полностью локальный запуск (без API) дал прирост +4.76 балла при стоимости $0.
Сравнение с конкурентами
Physis-Lang демонстрирует лидерство не только против Veo 3.1, но и против специализированных физических моделей, таких как PhiZero и PhyGDPO. В отличие от них, Physis-Lang работает как с обучением (LoRA SFT), так и в режиме «prompt-only», что делает его гибким инструментом для улучшения существующих видео-генераторов.
| Метрика | Physis-Lang (Cosmos3-Nano) | PhiZero | PhyGDPO |
|---|---|---|---|
| Physics-IQ Verified | 43.41 | 40.91 | 27.20 |
| PhyGenBench | 71.04 | n/r | 48.96 |
| VideoPhy-2 (All) | 68.02 | n/r | 59.56 |
| PhyGround | 69.90 | 57.85 | n/r |
Код и веса пока не опубликованы, доступна только научная статья. Однако методология «языковой кривой» открывает путь к созданию более надежных симуляторов для робототехники и киноиндустрии.
Бенчмарки
| Бенчмарк | Physis-Lang (Cosmos3-Nano) | PhiZero | PhiZero (Competitor) | PhyGDPO | Physis-Lang (Iteration 1) | Physis-Lang (Iteration 9) | Veo 3.1 |
|---|---|---|---|---|---|---|---|
| PhyGenBench | 71.04% | 49.17% | — | 48.96% | — | — | 65.63% |
| Physics-IQ Verified | 43.41% | 40.91% | 27.2% | — | — | — | 34.99% |
| PhyGround | 69.9% | 57.85% | 58.22% | — | — | — | — |
| VideoPhy-2 (All) | 68.02% | 47.88% | — | 59.56% | — | — | 68.87% |
| VideoPhy-2 (Hard) | 62.36% | 28.09% | — | 44.94% | — | — | 58.43% |
| PhysCapBench (F1) | — | — | — | — | 78.64% | 87.82% | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
