Исследования6 августа 2026 г., 20:17 МСК🤖 Auto

AI не умеет патчить: 74% кода от 1Password содержат новые уязвимости

Исследование Off-By-1-Labs показало, что LLM генерируют рабочие патчи лишь в 26% случаев. Остальные исправления либо не работают, либо создают новые дыры в безопасности.

Баннер новости 5236

Провал гипотезы: от 67% к 26%

Команда безопасности 1Password, Off-By-1-Labs, провела масштабное тестирование возможностей современных больших языковых моделей (LLM) в области кибербезопасности. Исследователи хотели проверить, способны ли передовые AI-модели самостоятельно создавать надежные исправления для сложных уязвимостей в открытом коде. Первоначальная гипотеза предполагала успех на уровне 67%, однако реальность оказалась суровой: эффективность составила всего 26%.

В эксперименте участвовали модели на базе Claude и Codex (на базе OpenAI). Моделям было поручено сгенерировать патчи для шести недавно раскрытых уязвимостей в популярном ПО, включая Linux, Chrome, ActiveMQ и SpringAI. Всего было создано 6 080 попыток исправления кода.

FLAWED: когда исправление хуже бага

Результаты исследования, получившего название FLAWED (Fix-Like Artifacts With Embedded Defects), выявили критические проблемы. AI-модели часто генерируют код, который выглядит как исправление, но на деле таковым не является. Основные категории провалов:

  • 53.9% случаев: LLM не смогли создать патч, добавили новую ошибку или сделали и то, и другое.
  • 21% случаев: Патч закрывал уязвимость, но необратимо менял поведение приложения, что может привести к сбоям в работе.
  • 26% случаев: Патч был полностью рабочим и безопасным.

Тестирование на реальных уязвимостях

Для чистоты эксперимента исследователи выбрали уязвимости, которые с высокой вероятностью отсутствовали в обучающих данных моделей на момент их обучения. Это позволило оценить именно способность к логическому выводу, а не просто цитирование известных решений.

Уязвимость Тип угрозы Компонент
CVE-2026-31431 Повышение привилегий Linux (Copy Fail)
CVE-2026-34197 Удаленное выполнение кода (RCE) ActiveMQ
CVE-2026-8512 Use-after-free Chrome (macOS)
CVE-2026-45185 Неавторизованный RCE EXIM
CVE-2026-22738 Удаленное выполнение кода (RCE) SpringAI SpEL
GHSA-wpqr-6v78-jr5g Удаленное выполнение кода (RCE) Gemini CLI

Почему это важно для бизнеса

Кит Худлет (Keith Hoodlet), глава Off-By-1-Labs, подчеркивает: «LLM, которые отлично справляются с поиском уязвимостей, пока не готовы их патчить». Генерация «FLAWED»-патчей опасна тем, что она создает ложное чувство безопасности. Разработчики могут принять код как исправленный, не заметив встроенных дефектов.

Исследователи рекомендуют использовать AI на этапе триаги и обнаружения багов, где он эффективен, но требовать обязательного человеческого контроля (human-in-the-loop) при внедрении любых исправлений. Инструментарий FLAWED уже доступен на GitHub для независимых проверок.

Источник: ZDNet AI ↗