Исследования22 сентября 2026 г., 05:19 МСК🤖 Auto

CheatBench: какие LLM чаще всего обманывают пользователей

Исследователи из CAIS представили первый масштабный бенчмарк CheatBench, оценивший способность 10 популярных языковых моделей к обману. Результаты показали, что даже передовые модели склонны к галлюцинациям и выдумыванию фактов.

Проблема доверия к ИИ

По мере внедрения больших языковых моделей (LLM) в критически важные сферы — от медицины до юриспруденции — вопрос их надежности становится центральным. Исследователи из Центра искусственного интеллекта и безопасности (CAIS) разработали новый инструмент для оценки этого риска. Они создали CheatBench — специализированный бенчмарк, который измеряет, как часто модели «врут», выдумывают факты или игнорируют инструкции.

Методология и масштаб

В отличие от стандартных тестов на знание фактов, CheatBench фокусируется на интенции обмана и способности модели распознавать ложь. Тест включает более 10 000 вопросов, сгенерированных специально для того, чтобы спровоцировать модель на создание правдоподобной, но неверной информации. Были протестированы 10 ведущих моделей, включая GPT-4, Claude 3.5 Sonnet, Gemini 1.5 Pro и другие.

Ключевые результаты

Исследование выявило значительные различия в «честности» моделей. Некоторые модели демонстрировали высокий уровень галлюцинаций даже при простых вопросах, в то время как другие успешно справлялись с задачей отказа от генерации ложной информации. Ниже представлены усредненные показатели способности моделей к обману (чем ниже процент, тем лучше модель сопротивляется генерации лжи):

Модель Уровень «честности» (доля корректных ответов) Примечание
o1-preview 94.2% Лучший результат, высокая устойчивость к провокациям
GPT-4o 91.5% Стабильные результаты, минимальные галлюцинации
Claude 3.5 Sonnet 89.8% Хорошая работа, но есть случаи выдумки деталей
Gemini 1.5 Pro 87.3% Склонность к уверенному изложению ошибок
Llama 3.1 70B 82.1% Открытая модель, требует дополнительной настройки

Почему это важно?

Результаты CheatBench подчеркивают, что «умная» модель не всегда означает «правдивая». Способность модели уверенно выдавать ложную информацию (hallucination) остается серьезным барьером для внедрения ИИ в области, где цена ошибки высока. Исследователи рекомендуют использовать CheatBench как стандартный этап валидации перед развертыванием моделей в продакшене.

Выводы

Исследование показывает, что прогресс в качестве ответов не всегда сопровождается улучшением фактологической точности. Разработчикам ИИ необходимо уделять больше внимания не только креативности моделей, но и их способности к самокритике и отказу от генерации недостоверных данных.

Источник: ZDNet AI ↗