Проблема: Почему метрик совпадений слов недостаточно
Оценка диалоговых агентов в ритейле традиционно опирается на лексическое совпадение, что не отражает сути ответа. Пользователю важно не то, совпадают ли слова, а то, решена ли проблема. Авторы статьи из arXiv (2607.12085) предлагают систему GenAI Evaluation — управляемый, конфигурационный конвейер, который оценивает полезность, фактологическую точность, ясность, тон и соответствие переводу.
Архитектура: Как работает конвейер
Система обрабатывает логи производства через нормализацию, шардирование и асинхронное выполнение. Ключевая особенность — выборочная переоценка: переписываются только неполные, некорректные или невалидные по схеме записи. Это снижает затраты и повышает скорость. Все действия логируются, схемы зафиксированы, что обеспечивает полную аудируемость (traceability) для корпоративных стандартов.
Масштаб и результаты
Пилотный проект уже обработал более 2 миллионов взаимодействий, ежедневно обрабатывая около 50 000 записей. Валидация проводилась на выборке из 12 980 записей, размеченных 4 обученными аннотаторами. Система справилась с классификацией 14 намерений, 156 поднамерений, 18 основных доменов и 129 поддоменов.
Сравнение эффективности
Ниже приведены ключевые метрики качества работы системы GenAI Evaluation по сравнению с человеческой оценкой:
| Метрика | Значение | Комментарий |
|---|---|---|
| Macro F1 Score | 0.93 | Высокая точность классификации намерений и доменов |
| Human-acceptability (Translation) | 89% | Степень согласия с человеческой оценкой качества перевода |
| Объем данных | 2M+ записей | Общий объем обработанных взаимодействий |
| Дневная нагрузка | ~50,000 записей | Текущая пропускная способность конвейера |
Почему это важно для индустрии
Внедрение таких систем позволяет ритейл-компаниям перейти от ручного аудита чат-ботов к автоматизированному контролю качества. Это снижает операционные расходы на QA-тестирование и позволяет в реальном времени выявлять деградацию качества ответов (drift) без привлечения дорогостоящих экспертов-людей.
Источник: arXiv cs.AI ↗
