Исследования23 июля 2026 г., 00:19 МСК🤖 Auto

LLM не снял фильм: разбор провала автоматизации кинопроизводства

Исследователь Josh Snider попытался создать полнометражный фильм с помощью LLM, но столкнулся с критическими проблемами тайминга, контекстной памяти и качества видео. Проект стал демонстрацией текущих пределов автономных AI-агентов.

Баннер новости 4158

Суть эксперимента

Автор проекта, Josh Snider, решил проверить гипотезу о способности больших языковых моделей (LLM) самостоятельно создавать полнометражное кино. В качестве материала была выбрана книга Уильяма Хопса Ходжсона «Дом на окраине мира» (50 945 слов). Итоговый результат — фильм длительностью 6 454 секунды (около 1 часа 47 минут), собранный из 849 клипов. Однако сам автор называет проект провалом, так как он не соответствует стандартам кинематографа, хотя и демонстрирует возможности современных агентов.

Технический стек: 12 моделей от 5 компаний

Для реализации проекта использовалась сложная цепочка специализированных моделей. Ни одна модель не справлялась со всем процессом автономно, требовалась координация через Claude Fable 5. Ниже приведена архитектура используемых инструментов:

Роль в пайплайне Использованная модель/сервис Примечание
Координация и код Claude Fable 5 Главный агент, отладка, ревью
Высококачественная работа GPT 5.6 Sol Выполнение задач «грязной работы»
Видеогенерация (высокое качество) Gemini Omni Flash Только короткие клипы (4-12 сек)
Видеогенерация (среднее качество) Veo 3.1 - Fast / Lite Основной объем генерации, много ошибок
Аудио и музыка Whisper, edge-tts, Suno v5.5 Озвучка и саундтрек
Генерация ключевых кадров Nano Banana 2, gpt-image-2 Референсы для видео

Ключевые проблемы: почему это не сработало

Несмотря на то, что агент мог работать без присмотра, проект столкнулся с фундаментальными ограничениями:

  • Проблема тайминга: Изначальный сценарий от Claude Fable 5 имел длительность 49 минут для книги, читаемой за 5 часов. Модель не способна адекватно оценивать время, необходимое для визуализации действий и диалогов, часто пытаясь уместить сложные сцены в 8-секундные кадры.
  • Контекстная ротация (забывчивость): После просмотра черновика автор оставлял около 400 комментариев с правками. Модели исправляли глобальные ошибки, но «забывали» о локальных деталях, из-за чего ошибки, исправленные на 2-м просмотре, возвращались на 3-м.
  • Качество видео: Veo 3.1 регулярно путал лево/право, генерировал «свиней-существ» как обычных свиней, терял биты в экшен-сценах и назначал диалоги не тем персонажам. Расширение клипов невозможно, что ограничивает креативность.

Экономика проекта

Проект был выполнен в рамках бюджета хобби-канала ($200/мес на подписки), но реальная стоимость генерации видео высока. Для создания финального фильма было сгенерировано 6 358 клипов общей длительностью 51 461 секунда. Из них в финальный монтаж вошло лишь ~13% (849 клипов). Остальные 5 509 клипов (45 007 секунд) были отбракованы.

При использовании тарифа Gemini Omni Flash ($0.10/сек) стоимость только отбракованного видео составила бы $4 500, а всего проекта — более $5 100. Это делает процесс пока экономически неэффективным для коммерческого кино, но приемлемым для энтузиастов.

Прогноз

Автор уверен, что проблемы с таймингом, контекстом и мультимодальной интеграцией будут решены к концу 2027 года. Следующая цель — адаптация всех классических научно-фантастических романов в общественном достоянии, что, по мнению исследователя, станет возможным благодаря улучшению координации между специализированными моделями.

Источник: LessWrong ↗