Инструменты17 сентября 2026 г., 11:17 МСК🤖 Auto

Идеальный балл не спас: 10 AI-оценщиков пропустили галлюцинации

Аудит 10 популярных систем оценки LLM показал, что даже идеальный score не гарантирует корректность ответа. Алгоритмы часто игнорируют отсутствие доказательств в ответах моделей.

Проблема «слепых зон» в AI-оценках

Независимый аудит, проведенный на платформе Towards AI, выявил критический недостаток в современных системах автоматической оценки (AI Evals). Исследователи протестировали 10 различных промптов-оценщиков, используя набор данных с заведомо сломанными (некорректными) ответами от языковых моделей. Несмотря на то, что многие оценщики присваивали этим ответам высокие баллы, фактические ответы содержали галлюцинации и логические ошибки.

Ключевая проблема заключается в том, что большинство оценщиков фокусируются на стиле, связности или соответствии формату, но игнорируют видимость доказательств (evidence visibility). Если модель уверенно, но ложно отвечает на вопрос, оценчик часто не способен отличить это от правильного ответа без глубокого анализа фактологии.

Методология и ключевые метрики

Тестирование проводилось на контролируемой выборке, где ground truth (истинные ответы) были известны. Оценщики оценивались по трем основным параметрам: способность выявлять отсутствие источников, чувствительность к логическим разрывам и точность агрегации результатов. Результаты показали, что ни один из 10 протестированных инструментов не достиг 100% точности в выявлении «сломанных» ответов, даже когда им давали инструкции быть максимально строгими.

Сравнение эффективности оценщиков

Ниже приведена сводная таблица, отражающая общую эффективность протестированных систем в контексте выявления некорректных ответов (данные агрегированы на основе вывода статьи о том, что «perfect score still passed a broken answer»):

Категория оценки Наблюдение Влияние на результат
Видимость доказательств Низкая чувствительность Оценщик не штрафует за отсутствие ссылок/фактов
Область рубрики (Rubric Scope) Слишком широкая Фокус на стиле, а не на фактологической точности
Порог прохождения (Threshold) Высокий порог ложноположительных срабатываний Система пропускает ошибки, считая их «допустимыми вариациями»
Агрегация Средняя надежность Средний балл маскирует критические провалы в отдельных ответах

Почему это важно для разработчиков

Для команд, внедряющих LLM в продакшн, этот аудит служит предупреждением: полагаться исключительно на автоматические метрики качества (AI-generated metrics) опасно. Идеальный score от оценщика не означает, что ответ пользователя будет полезен или безопасен. Рекомендуется комбинировать автоматические оценки с:

  • Человеческой проверкой (human-in-the-loop) на критических этапах.
  • Использованием оценщиков, специально обученных на выявлении галлюцинаций (factuality-focused evaluators).
  • Внедрением строгих рубрик, требующих цитирования источников.

Вывод

Текущее поколение AI-оценщиков все еще недостаточно зрело для полной автономии в проверке фактологической точности. Разработчикам необходимо пересматривать подходы к валидации, смещая фокус с «красивости» ответа на наличие проверяемых доказательств.

Источник: Towards AI pub ↗