Исследования22 сентября 2026 г., 11:19 МСК🤖 Auto

SJR: Модерация контента без реальных нарушений. Новый подход к безопасности AI

Исследователи представили архитектуру Summarize-Judge-Refine (SJR), которая разделяет понимание мультимедиа и проверку политик. Система обучается на синтетических данных, достигая точности, сопоставимой с моделями, обученными на реальных нарушениях.

Баннер новости 8026

Проблема: «Слепое» обучение и дефицит данных

Традиционные системы модерации контента (Content Moderation) страдают от двух критических недостатков. Во-первых, они жестко связывают мультимодальное понимание (распознавание изображений/видео) с классификацией по политикам. Любое изменение правил требует полного переобучения всего пайплайна. Во-вторых, существует острый дефицит размеченных данных нарушений: реальные примеры токсичного или мошеннического контента трудно собрать, а мультимедиа-данные невозможно эффективно аугментировать (размножить) без потери смысла.

Решение: Архитектура Summarize-Judge-Refine (SJR)

Авторы предлагают двухмодельную архитектуру, которая развязывает эти задачи через интерфейс на естественном языке:

  • Content Model (Модель контента): Мультимодальная модель, которая анализирует сырые данные (изображения, видео) и генерирует структурированные текстовые сводки (summaries).
  • Policy Model (Модель политики): Текстовая модель, которая классифицирует эти сводки на соответствие правилам (например, «мошенническая реклама» или «безопасно»).

Ключевое нововведение — итеративный цикл совместного обучения (co-training). Модель контента дорабатывается с помощью алгоритма GRPO (Group Relative Policy Optimization), чтобы генерировать сводки, максимально полезные для классификатора. Поскольку данные теперь находятся в текстовом пространстве, исследователи могут применять текстовую аугментацию, создавая «враждебные» варианты сводок для обучения — путь, невозможный для сырых мультимедиа.

Результаты: Синтетические данные против реальных

Система SJR демонстрирует выдающиеся результаты на задаче обнаружения мошеннической рекламы. Важно отметить, что один из вариантов модели обучался исключительно на синтетических данных: в наборе не было ни одного реального примера нарушения (positive-class data). Несмотря на это, модель показала точность, почти не уступающую варианту, обученному на полных данных.

Метрика / Модель Результат / Характеристика
Относительный прирост F1 (non-misleading) +23.6% по сравнению с zero-shot Chain-of-Thought базой
Сравнение с SOTA Превзошел end-to-end SFT, STaR/RFT и RLFT
Точность на синтетике (Violating F1) Отклонение от модели на реальных данных: < 0.2%
Интерпретируемость Каждое решение обосновано читаемым текстовым сводом

Почему это важно

Подход SJR решает проблему «холодного старта» для новых политик модерации. Компании могут запускать новые правила безопасности, не собирая месяцы данных реальных нарушений, а генерируя их синтетически. Кроме того, текстовая природа промежуточных сводок делает процесс принятия решений прозрачным для человека, что критически важно для аудита и соответствия регуляторным требованиям.

Источник: arXiv cs.CL ↗