Исследования24 июля 2026 г., 13:17 МСК🤖 Auto

Почему LLM-детекторы лжи проваливаются: анализ типов обмана

Исследование arXiv:2607.20479 доказывает, что детекция обмана в LLM критически зависит от типа лжи. Обучение на одном типе не работает для других, а «глубина» представления нейрона меняет точность.

Баннер новости 4289

Проблема переноса: почему старые датчики лжи устарели

Тренировка зондов (probes) для выявления обманных ответов больших языковых моделей остается открытой проблемой. Как показывают авторы работы (Amr Moustafa, Max Feser, Florian Mai), недавние исследования демонстрируют, что детекторы особенно часто терпят неудачу в сценариях вне домена (out-of-domain). Если модель обучалась распознавать один тип лжи, она с высокой вероятностью пропустит другой.

Методология: 7 типов зондов и 3 вида обмана

Для системного анализа исследователи расширили стандартные бенчмарки, добавив датасет с разнообразными типами обмана: фабрикация (полное выдумывание), упущение (сокрытие фактов) и преувеличение. Эксперимент проводился на семи различных типах зондов для оценки влияния глубины представления, выразительности модели и разреженных признаков.

Ключевые метрики и результаты

Анализ показал, что не существует универсальной «глубины» слоя нейросети, где обман виден лучше всего. Оптимальная глубина строго зависит от конкретного датасета. Также выяснилось, что сложные, выразительные зонды дают лишь селективные (избирательные) преимущества перед простыми линейными базовыми моделями. Примечательно, что признаки, полученные через разреженные автоэнкодеры (sparse autoencoders), показывают производительность, сопоставимую с плотными скрытыми состояниями (dense hidden states).

Фактор исследования Наблюдение Влияние на точность детекции
Тип лжи (Typology) Фабрикация vs Упущение vs Преувеличение Критическое: выбор данных меняет обнаруживаемость
Глубина представления Различные слои трансформера Высокая зависимость от датасета (нет единого оптимума)
Выразительность зонда Сложные vs Линейные модели Селективные приросты, линейные базы часто достаточны
Представление признаков Разреженные (Sparse) vs Плотные (Dense) Сопоставимая производительность

Почему это важно для индустрии

Результаты подчеркивают, что детекция обмана — это проблема, сильно зависящая от репрезентации. Разработчикам систем безопасности и AI-аудитору нельзя полагаться на универсальные решения. Для эффективного контроля за LLM необходимо учитывать типологию лжи: защита от фабрикаций не гарантирует защиты от намеренного упущения информации. Работа представлена на AI Transparency Conference 2026.

Источник: arXiv cs.AI ↗