Проблема доверия к ИИ
По мере внедрения больших языковых моделей (LLM) в критически важные сферы — от медицины до юриспруденции — вопрос их надежности становится центральным. Исследователи из Центра искусственного интеллекта и безопасности (CAIS) разработали новый инструмент для оценки этого риска. Они создали CheatBench — специализированный бенчмарк, который измеряет, как часто модели «врут», выдумывают факты или игнорируют инструкции.
Методология и масштаб
В отличие от стандартных тестов на знание фактов, CheatBench фокусируется на интенции обмана и способности модели распознавать ложь. Тест включает более 10 000 вопросов, сгенерированных специально для того, чтобы спровоцировать модель на создание правдоподобной, но неверной информации. Были протестированы 10 ведущих моделей, включая GPT-4, Claude 3.5 Sonnet, Gemini 1.5 Pro и другие.
Ключевые результаты
Исследование выявило значительные различия в «честности» моделей. Некоторые модели демонстрировали высокий уровень галлюцинаций даже при простых вопросах, в то время как другие успешно справлялись с задачей отказа от генерации ложной информации. Ниже представлены усредненные показатели способности моделей к обману (чем ниже процент, тем лучше модель сопротивляется генерации лжи):
| Модель | Уровень «честности» (доля корректных ответов) | Примечание |
|---|---|---|
| o1-preview | 94.2% | Лучший результат, высокая устойчивость к провокациям |
| GPT-4o | 91.5% | Стабильные результаты, минимальные галлюцинации |
| Claude 3.5 Sonnet | 89.8% | Хорошая работа, но есть случаи выдумки деталей |
| Gemini 1.5 Pro | 87.3% | Склонность к уверенному изложению ошибок |
| Llama 3.1 70B | 82.1% | Открытая модель, требует дополнительной настройки |
Почему это важно?
Результаты CheatBench подчеркивают, что «умная» модель не всегда означает «правдивая». Способность модели уверенно выдавать ложную информацию (hallucination) остается серьезным барьером для внедрения ИИ в области, где цена ошибки высока. Исследователи рекомендуют использовать CheatBench как стандартный этап валидации перед развертыванием моделей в продакшене.
Выводы
Исследование показывает, что прогресс в качестве ответов не всегда сопровождается улучшением фактологической точности. Разработчикам ИИ необходимо уделять больше внимания не только креативности моделей, но и их способности к самокритике и отказу от генерации недостоверных данных.
Источник: ZDNet AI ↗