Исследования30 июля 2026 г., 09:17 МСК🤖 Auto

Модерация LLM: Блокировка или переписывание? Результаты бенчмарка

Исследователи Meta сравнили стратегии фильтрации контента в LLM. Оказалось, что переписывание ответов (rewriting) восстанавливает до 100% полезного трафика без роста вредоносных выбросов.

Баннер новости 4697

Проблема изолированной оценки

Традиционно классификаторы контента тестируются изолированно, измеряя только точность (accuracy). Однако в продакшене критичны конечные метрики: Usefulness (доля показанных полезных и безопасных ответов) и Harmful Exposure (доля показанных вредных ответов). Исследование из arXiv:2607.26200 демонстрирует, что выбор места вмешательства (на входе или выходе) и метода обработки (блокировка или переписывание) напрямую влияет на эти метрики.

Сравнение стратегий фильтрации

Команда исследователей протестировала три основные конфигурации на датасетах ToxicChat и внутреннем продукте Meta. Стратегия Response only (фильтрация только исходящего ответа) показала наивысшую Usefulness среди методов простой блокировки. Однако комбинация Input + response (жесткая блокировка входа и выхода) обеспечила минимальный уровень Harmful Exposure.

Ключевой вывод: замена простой блокировки ответов на Response + rewrite (переписывание) позволяет вернуть большую часть заблокированного трафика. При этом уровень Harmful Exposure остается на том же низком уровне, что и при жесткой блокировке, что делает переписывание экономически и технически выгодным решением.

Производительность и Latency

Важным аспектом стала скорость обработки. Использование Probe routing (маршрутизации через легкие модели) для определения необходимости модерации значительно сократило время ожидания по сравнению с использованием тяжелых LLM для этих же задач, сохраняя сопоставимые показатели безопасности.

Стратегия Usefulness (Полезность) Harmful Exposure (Вред) Примечание
Input only Средняя Высокий Блокировка только запросов
Response only Максимальная Средний Блокировка только ответов
Input + response Низкая Минимальный Жесткая блокировка всего
Response + rewrite Восстановлена Средний (как Response only) Переписывание токсичных ответов

Риски переписывания

Анализ переписанных ответов показал, что модели склонны обобщать триггерные фразы, сохраняя безопасный намерение, но иногда удаляют важную контекстную информацию в чувствительных доменах. Это создает риск неполного ответа пользователю, что требует тонкой настройки баланса между безопасностью и полнотой информации.

Вывод для индустрии

Исследование опровергает идею универсального правила размещения фильтров. Оптимальная архитектура должна выбираться на основе конкретных ограничений по задержкам (latency) и допустимому уровню риска, а не следовать шаблонным решениям.

Источник: arXiv cs.CL ↗