Проблема изолированной оценки
Традиционно классификаторы контента тестируются изолированно, измеряя только точность (accuracy). Однако в продакшене критичны конечные метрики: Usefulness (доля показанных полезных и безопасных ответов) и Harmful Exposure (доля показанных вредных ответов). Исследование из arXiv:2607.26200 демонстрирует, что выбор места вмешательства (на входе или выходе) и метода обработки (блокировка или переписывание) напрямую влияет на эти метрики.
Сравнение стратегий фильтрации
Команда исследователей протестировала три основные конфигурации на датасетах ToxicChat и внутреннем продукте Meta. Стратегия Response only (фильтрация только исходящего ответа) показала наивысшую Usefulness среди методов простой блокировки. Однако комбинация Input + response (жесткая блокировка входа и выхода) обеспечила минимальный уровень Harmful Exposure.
Ключевой вывод: замена простой блокировки ответов на Response + rewrite (переписывание) позволяет вернуть большую часть заблокированного трафика. При этом уровень Harmful Exposure остается на том же низком уровне, что и при жесткой блокировке, что делает переписывание экономически и технически выгодным решением.
Производительность и Latency
Важным аспектом стала скорость обработки. Использование Probe routing (маршрутизации через легкие модели) для определения необходимости модерации значительно сократило время ожидания по сравнению с использованием тяжелых LLM для этих же задач, сохраняя сопоставимые показатели безопасности.
| Стратегия | Usefulness (Полезность) | Harmful Exposure (Вред) | Примечание |
|---|---|---|---|
| Input only | Средняя | Высокий | Блокировка только запросов |
| Response only | Максимальная | Средний | Блокировка только ответов |
| Input + response | Низкая | Минимальный | Жесткая блокировка всего |
| Response + rewrite | Восстановлена | Средний (как Response only) | Переписывание токсичных ответов |
Риски переписывания
Анализ переписанных ответов показал, что модели склонны обобщать триггерные фразы, сохраняя безопасный намерение, но иногда удаляют важную контекстную информацию в чувствительных доменах. Это создает риск неполного ответа пользователю, что требует тонкой настройки баланса между безопасностью и полнотой информации.
Вывод для индустрии
Исследование опровергает идею универсального правила размещения фильтров. Оптимальная архитектура должна выбираться на основе конкретных ограничений по задержкам (latency) и допустимому уровню риска, а не следовать шаблонным решениям.
Источник: arXiv cs.CL ↗
