Новая угроза: от монтажа к чистой генерации
Развитие моделей генерации видео по тексту (T2V) создало новую эру дезинформации. В отличие от «дешевых фейков» (cheap fakes), где видео редактируется из существующих архивов, современные AI-модели могут создавать видео с нуля, идеально соответствующие вымышленному нарративу. Это создает «ловушку модальности» для существующих детекторов, которые часто полагаются на визуальные артефакты, а не на смысловую целостность.
PS-FNVD: Первый датасет чистой синтетической дезинформации
Авторы работы (Yifeng Luo, Yupeng Li, Liang Lan, Tian Wang) констатируют, что существующие наборы данных не содержат видео, сгенерированных полностью AI без использования реальных исходников. Для решения этой проблемы создана датасет PS-FNVD (Pure Synthesis Fake News Video Dataset). Он включает два типа данных, предотвращающих использование моделей простыми путями:
- Тип 1: Вымышленные события с согласованным обманом (полная генерация).
- Тип 2: Реальные события с ложным визуальным происхождением (реальное видео, но с ложным контекстом).
Методология: R-T2V и трехклассовая классификация
Традиционные подходы часто сводят задачу к бинарной классификации, что приводит к семантической деградации. Авторы предлагают задачу трехклассовой классификации (Real, Cheap Fake, Pure Synthesis Fake). Новая архитектура R-T2V (Reasoning-guided T2V-FNVD) обучается через:
- Генерацию обусловленных обоснований (rationale generation).
- Супервизированное тонкое дообучение (SFT).
Это позволяет модели интегрировать высокоуровневую семантическую логику с низкоуровневыми физическими следами генерации AI.
Результаты: Лидерство на ACM MM 2026
Эксперименты проводились на 10 существующих базовых моделях. R-T2V демонстрирует state-of-the-art результаты, значительно превосходя конкурентов. Работа принята к публикации на конференции ACM Multimedia (ACM MM), 2026.
| Метрика | R-T2V (Предлагаемая) | 2-й лучший базовый метод | Прирост |
|---|---|---|---|
| Точность (Accuracy) | — | — | +12.20 п.п. |
| Макро F1 (Macro F1) | — | — | +8.46 п.п. |
Данный подход знаменует переход от поиска технических артефактов к анализу семантической и логической согласованности видео, что критически важно для борьбы с AI-генерируемой дезинформацией.
Источник: arXiv cs.AI ↗
