Проблема: «Слепое» обучение и дефицит данных
Традиционные системы модерации контента (Content Moderation) страдают от двух критических недостатков. Во-первых, они жестко связывают мультимодальное понимание (распознавание изображений/видео) с классификацией по политикам. Любое изменение правил требует полного переобучения всего пайплайна. Во-вторых, существует острый дефицит размеченных данных нарушений: реальные примеры токсичного или мошеннического контента трудно собрать, а мультимедиа-данные невозможно эффективно аугментировать (размножить) без потери смысла.
Решение: Архитектура Summarize-Judge-Refine (SJR)
Авторы предлагают двухмодельную архитектуру, которая развязывает эти задачи через интерфейс на естественном языке:
- Content Model (Модель контента): Мультимодальная модель, которая анализирует сырые данные (изображения, видео) и генерирует структурированные текстовые сводки (summaries).
- Policy Model (Модель политики): Текстовая модель, которая классифицирует эти сводки на соответствие правилам (например, «мошенническая реклама» или «безопасно»).
Ключевое нововведение — итеративный цикл совместного обучения (co-training). Модель контента дорабатывается с помощью алгоритма GRPO (Group Relative Policy Optimization), чтобы генерировать сводки, максимально полезные для классификатора. Поскольку данные теперь находятся в текстовом пространстве, исследователи могут применять текстовую аугментацию, создавая «враждебные» варианты сводок для обучения — путь, невозможный для сырых мультимедиа.
Результаты: Синтетические данные против реальных
Система SJR демонстрирует выдающиеся результаты на задаче обнаружения мошеннической рекламы. Важно отметить, что один из вариантов модели обучался исключительно на синтетических данных: в наборе не было ни одного реального примера нарушения (positive-class data). Несмотря на это, модель показала точность, почти не уступающую варианту, обученному на полных данных.
| Метрика / Модель | Результат / Характеристика |
|---|---|
| Относительный прирост F1 (non-misleading) | +23.6% по сравнению с zero-shot Chain-of-Thought базой |
| Сравнение с SOTA | Превзошел end-to-end SFT, STaR/RFT и RLFT |
| Точность на синтетике (Violating F1) | Отклонение от модели на реальных данных: < 0.2% |
| Интерпретируемость | Каждое решение обосновано читаемым текстовым сводом |
Почему это важно
Подход SJR решает проблему «холодного старта» для новых политик модерации. Компании могут запускать новые правила безопасности, не собирая месяцы данных реальных нарушений, а генерируя их синтетически. Кроме того, текстовая природа промежуточных сводок делает процесс принятия решений прозрачным для человека, что критически важно для аудита и соответствия регуляторным требованиям.
Источник: arXiv cs.CL ↗
