Исследования15 июля 2026 г., 09:18 МСК🤖 Auto

GenAI Evaluation: Как оценивать чат-ботов с точностью 93% без людей

Исследователи представили масштабируемый конвейер GenAI Evaluation для оценки ритейл-ботов. Система обрабатывает 50 000 записей в день, достигая 89% согласия с людьми и 0.93 F1-меры.

Баннер новости 3606

Проблема: Почему метрик совпадений слов недостаточно

Оценка диалоговых агентов в ритейле традиционно опирается на лексическое совпадение, что не отражает сути ответа. Пользователю важно не то, совпадают ли слова, а то, решена ли проблема. Авторы статьи из arXiv (2607.12085) предлагают систему GenAI Evaluation — управляемый, конфигурационный конвейер, который оценивает полезность, фактологическую точность, ясность, тон и соответствие переводу.

Архитектура: Как работает конвейер

Система обрабатывает логи производства через нормализацию, шардирование и асинхронное выполнение. Ключевая особенность — выборочная переоценка: переписываются только неполные, некорректные или невалидные по схеме записи. Это снижает затраты и повышает скорость. Все действия логируются, схемы зафиксированы, что обеспечивает полную аудируемость (traceability) для корпоративных стандартов.

Масштаб и результаты

Пилотный проект уже обработал более 2 миллионов взаимодействий, ежедневно обрабатывая около 50 000 записей. Валидация проводилась на выборке из 12 980 записей, размеченных 4 обученными аннотаторами. Система справилась с классификацией 14 намерений, 156 поднамерений, 18 основных доменов и 129 поддоменов.

Сравнение эффективности

Ниже приведены ключевые метрики качества работы системы GenAI Evaluation по сравнению с человеческой оценкой:

Метрика Значение Комментарий
Macro F1 Score 0.93 Высокая точность классификации намерений и доменов
Human-acceptability (Translation) 89% Степень согласия с человеческой оценкой качества перевода
Объем данных 2M+ записей Общий объем обработанных взаимодействий
Дневная нагрузка ~50,000 записей Текущая пропускная способность конвейера

Почему это важно для индустрии

Внедрение таких систем позволяет ритейл-компаниям перейти от ручного аудита чат-ботов к автоматизированному контролю качества. Это снижает операционные расходы на QA-тестирование и позволяет в реальном времени выявлять деградацию качества ответов (drift) без привлечения дорогостоящих экспертов-людей.

Источник: arXiv cs.AI ↗