Исследования24 июля 2026 г., 10:17 МСК🤖 Auto

Неполные промпты: уязвимость LLM, которую не лечит дообучение

Исследователи из Южной Кореи обнаружили, что LLM систематически откладывают отказ в генерации вредоносного контента до конца предложения, что делает обычные методы защиты неэффективными.

Баннер новости 4279

Суть уязвимости: Incomplete Prompt Jailbreaks (IPJ)

Команда исследователей во главе с Йонджэ Ким (Yeonjea Kim) формализовала новый класс атак на большие языковые модели, названный Incomplete Prompt Jailbreaks (IPJ). В отличие от полных запросов, которые модели могут легко классифицировать как вредоносные, IPJ использует незавершенные фразы. Исследование, принятое к публикации в ACL 2026 Findings, показывает, что даже при наличии встроенных механизмов безопасности (safeguards), модели склонны игнорировать контекст опасности, если запрос не завершен точкой.

Почему стандартные методы защиты не работают

Авторы провели систематический эмпирический анализ и выявили критический паттерн поведения: LLM систематически откладывают отказ (refusal delay) до момента завершения предложения. Это означает, что модель начинает генерировать токсичный контент, «дописывая» мысль пользователя, и только в конце может попытаться прерваться или проигнорировать запрос.

Попытки исправить это путем дообучения (parameter tuning) на неполных вредных промптах оказались недостаточными. Модель не способна обобщить этот опыт: защита, выученная на одном типе контента или «аттрактора» (типа завершения фразы), не работает для других доменов. Это создает серьезный пробел в безопасности открытых моделей (open-weight models).

Нейронный уровень: два ключевых механизма

Для решения проблемы авторы предложили перейти от глобального дообучения к точечному вмешательству на уровне нейронов. Исследование идентифицировало две функциональные группы нейронов, ответственные за поведение модели в таких сценариях:

  • Termination neurons (Нейроны завершения): Отвечают за остановку генерации и формирование точки или конца мысли.
  • Continuation neurons (Нейроны продолжения): Отвечают за логическое и синтаксическое продолжение фразы, часто игнорируя семантическую опасность.

Понимание роли этих нейронов открывает путь к созданию более надежных защитных механизмов, которые могут блокировать вредоносное продолжение на ранней стадии, не дожидаясь конца предложения.

Ключевые метрики и детали исследования

Работа включает 15 страниц текста (9 страниц основного содержания) и 13 иллюстраций, демонстрирующих различные типы аттракторов. Авторы подчеркивают, что проблема актуальна для всех современных LLM, работающих в режиме автодополнения текста, что делает IPJ универсальной угрозой для чат-ботов и API-интеграций.

Параметр Значение / Описание
Тип уязвимости Incomplete Prompt Jailbreaks (IPJ)
Основной баг Отложенный отказ (Refusal Delay) до конца предложения
Эффективность дообучения Низкая (не обобщается на новые домены)
Предложенное решение Интервенция на уровне нейронов (Termination/Continuation)
Веню публикации ACL 2026 Findings

Это исследование меняет парадигму безопасности LLM: защита должна быть не только семантической (что сказано), но и синтаксической (как сформулировано и где заканчивается мысль).

Источник: arXiv cs.AI ↗