Суть открытия: асимметрия атаки
Исследование, опубликованное на LessWrong (автор Skdk, 30 сентября 2026 года), вскрывает критическую уязвимость в механизмах обучения больших языковых моделей. Авторы опираются на работу Souly et al. (2025), которая установила: для внедрения бэкдора (backdoor) при преподготовке требуется около 250 «отравленных» документов. Это число не зависит от размера модели или объема чистых данных.
Главный инсайт нового исследования заключается в асимметрии воздействия. Если для того, чтобы модель начала использовать скрытый путь обработки данных, нужны сотни примеров, то для того, чтобы заставить модель верить этому пути и переключиться на него, достаточно всего нескольких десятков сэмплов. При этом нормальная функциональность модели не страдает.
Экспериментальная установка
Для проверки гипотезы была создана задача с двумя путями решения: «короткий путь» (shortcut) и «длинный путь» (long route). Модель обучалась отвечать на глаголы в предложении. В большинстве случаев она использовала короткий путь, так как он эффективнее. Однако были созданы два специальных класса сэмплов:
- Класс 1: короткий путь отключен (модель вынуждена использовать длинный).
- Класс 2: короткий путь дает неверный ответ (модель вынуждена использовать длинный для правильного ответа).
Модель имела 20 миллионов параметров, что позволило исследователям отследить все пути передачи информации. Тестирование проводилось на 5 случайных семенах (random seeds).
Ключевые метрики и цифры
Результаты экспериментов демонстрируют поразительную устойчивость модели к «разбавлению» данных и ее уязвимость к точечным изменениям доверия.
| Параметр | Значение / Наблюдение | Значимость |
|---|---|---|
| Объем обучающей выборки | 32 000 – 320 000 сэмплов | Изменение объема в 10 раз не меняло порог внедрения бэкдора. |
| Сэмплов для обучения длинного пути | ~378 (при выборке 96 000) | Требуется абсолютное число, а не пропорция «ядовитых» данных. |
| Сэмплов для переключения доверия | ~56 сэмплов | Менее 0.1% от выборки. Достаточно, чтобы половина ответов перешла на длинный путь. |
| Точность на нормальных вопросах | 100% (идеальная) | Атака незаметна при стандартном тестировании. |
| Вклад длинного пути в ответы | Рост с 11% до 83% | Модель массово переключается на скрытый механизм, не теряя в качестве. |
Почему это опасно: механизм «слепоты» к атаке
Исследователи объясняют феномен тем, что модель не переключается на длинный путь, потому что обнаруживает отравление короткого. Она делает это из-за общего смещения доверия. В нормальных условиях, где короткий путь работает верно, модель укрепляет оба пути пропорционально вниманию. Но так как короткий путь всегда сильнее, вклад длинного пути имеет предел.
Только специфические сэмплы (где короткий путь сломан или лжет) реально усиливают длинный путь. Как только этот путь становится достаточно сильным, модель начинает доверять ему повсеместно. На обычных вопросах точность остается идеальной, так как оба пути дают правильный ответ, но внутренняя архитектура принятия решений уже скомпрометирована.
Вывод для индустрии
Это исследование ставит под сомнение традиционные метрики безопасности, основанные на общей точности (accuracy). Если модель сохраняет 100% точность на тестовых данных, это не гарантирует, что она не использует скрытый бэкдор. Для обнаружения таких атак требуются методы интерпретируемости, способные отслеживать изменение внутренних путей внимания (attention mechanisms), а не только финальных ответов.
Источник: LessWrong ↗
