Проблема «черного ящика» в объяснениях
Большие языковые модели (LLM) всё чаще используются для принятия решений, влияющих на жизнь людей. Однако их объяснения часто ненадежны. Авторы работы из arXiv (2026) выделяют два типа «недобросовестности» (unfaithfulness) объяснений:
- Неполнота (Incompleteness): модель игнорирует факторы, которые реально повлияли на ответ.
- Нелогичность (Unsoundness): модель ссылается на факторы, которые на самом деле не влияли на решение.
Существующие методы улучшения обычно требуют переобучения модели (training-time), что ресурсоемко, или фокусируются только на устранении нелогичности. Новый подход решает проблему неполноты.
Метод: Удаление нерелевантных концепций
Предложенный алгоритм работает на этапе тестирования (test-time). Суть метода проста:
- Модель генерирует ответ и объяснение.
- Из исходного запроса удаляются все концепции, которые не упомянуты в объяснении модели.
- Модель повторно запрашивается на этом «очищенном» входе.
Если ответ модели не изменился после удаления «скрытых» факторов, значит, её первоначальное объяснение было честным. Если ответ изменился — значит, модель опиралась на факторы, которые она скрыла от пользователя.
Результаты и метрики
Метод протестирован на нескольких семействах моделей и двух независимых метриках достоверности. Подход является model-agnostic (не зависит от архитектуры) и не требует доступа к весам модели.
| Аспект | Стандартный промпт | Промпт с призывом к честности | Предложенный метод (Removal-Based) |
|---|---|---|---|
| Уровень достоверности | Базовый | Умеренный | Значительно выше |
| Требования к ресурсам | Низкие | Низкие | Низкие (только инференс) |
| Доступ к весам модели | Не требуется | Не требуется | Не требуется |
| Устранение скрытых влияний | Нет | Частично | Да (целенаправленно) |
Почему это важно
Этот метод позволяет аудировать поведение LLM без дорогостоящего дообучения. Он обеспечивает гибкий механизм для снижения влияния скрытых факторов, повышая надежность и безопасность систем, основанных на LLM, в критически важных сценариях использования.
Источник: arXiv cs.AI ↗
