Исследования19 августа 2026 г., 12:17 МСК🤖 Auto

Fool's Gold: как обмануть атаки на безопасность open-весовых моделей

Исследователи представили метод «обмана» (Fool's Gold), который не блокирует удаление фильтров безопасности, но делает скомпрометированные модели бесполезными для злоумышленников, выдавая правдоподобные, но ложные ответы.

Баннер новости 6060

Проблема: безопасность open-весовых моделей уязвима

Открытые языковые модели (LLM) с открытыми весами сталкиваются с критической уязвимостью: их механизмы безопасности (safety alignment) могут быть удалены за считанные минуты. Метод abliteration позволяет «вырезать» направления в весах модели, отвечающие за отказ в выполнении опасных запросов. На данный момент не существует надежных защитных механизмов, которые могли бы предотвратить это на этапе выпуска модели (release-time defense).

Решение: стратегия «Обманчивого золота» (Fool's Gold)

Авторы исследования предлагают парадигмальный сдвиг: вместо попытки предотвратить удаление фильтров, новая защита «Fool's Gold» (Обманчивое золото) принимает факт взлома как данность. Суть метода — decoy hardening (укрепление приманки). Когда злоумышленник успешно удаляет фильтры безопасности, модель начинает отвечать на опасные запросы, но эти ответы являются уверенными, беглыми и правдоподобными декорациями, содержащими критически важные ложные данные.

Техническая реализация

Защита обучается внутри дифференцируемой симуляции (differentiable simulation). Это позволяет модели научиться генерировать ответы, которые выглядят корректно для обычного пользователя, но содержат фатальные ошибки или дезинформацию в ключевых деталях, делая их непригодными для реального использования в злонамеренных целях.

Почему это важно

Подход «Fool's Gold» меняет парадигму кибербезопасности ИИ. Если невозможно защитить «замок» (фильтры безопасности), то нужно сделать так, чтобы «сокровище» (ответы модели) стало ядом для вора. Это снижает риск использования скомпрометированных моделей для создания вредоносного контента, фишинга или распространения дезинформации, даже если техническая защита была обойдена.

Источник: arXiv cs.AI ↗