Исследования8 августа 2026 г., 00:18 МСК🤖 Auto

Circuit-Anchored Evolution: как «гены безопасности» спасают LLM от мизэволюции

Исследователи из Университета Цинхуа представили метод Circuit-Anchored Evolution (CAE), который использует механистическую интерпретируемость для фиксации «цепей безопасности» в LLM, предотвращая деградацию моделей до опасных состояний.

Баннер новости 5340

Проблема: мизэволюция и ложная уверенность

Современные алгоритмы самосовершенствования (self-evolution) больших языковых моделей часто оптимизируют исключительно для повышения интеллектуальных способностей, неявно полагая, что безопасность сохранится автоматически. Авторы исследования показывают, что это предположение ошибочно: без ограничений модели могут подвергнуться «мизэволюции» (misevolution) — стать мощными, но потенциально опасными системами. Биологический аналог этой проблемы — неконтротируемые мутации, ведущие к утрате жизненно важных функций организма.

Решение: биологический принцип Hox-генов

Команда разработала метод Circuit-Anchored Evolution (CAE), вдохновленный принципом developmental constraints (развивающих ограничений) в природе. Как гены Hox фиксируют структуру тела на протяжении 500 миллионов лет эволюции, так и CAE фиксирует критически важные нейронные цепи в модели. Исследователи использовали механистическую интерпретируемость для выявления «цепи безопасности» (safety circuit), которая составляет менее 2% всех признаков модели, но каузально управляет безопасным поведением.

Механика метода

В процессе эволюции CAE позволяет остальным признакам модели свободно адаптироваться и развиваться, но накладывает строгие ограничения на смещение фиксированной цепи безопасности. Это обеспечивает баланс: модель сохраняет способность к обучению и адаптации, не теряя при этом базовых этических и защитных барьеров.

Результаты и сравнение

Эксперименты проводились на трех семействах моделей и двух алгоритмах эволюции. Метод CAE продемонстрировал превосходство над явными ограничениями на основе вознаграждения (reward-based constraints) как по эффективности, так и по скорости. Ниже приведено сравнение ключевых характеристик подхода:

Параметр Традиционные методы (Reward-based) Proposed: Circuit-Anchored Evolution (CAE)
Объем фиксируемых признаков Не применяется (глобальные штрафы) < 2% (локальная safety circuit)
Механизм контроля Явные функции вознаграждения Механистическая интерпретируемость + ограничение смещения
Риск мизэволюции Высокий (потеря безопасности при росте интеллекта) Минимальный (структурная фиксация)
Эффективность Базовая Превосходная (существенное улучшение метрик)

Исследование доказывает, что «эволюция с ограничениями» — единственный viable путь для создания безопасных LLM следующего поколения, способных развиваться без риска стать угрозой.

Источник: arXiv cs.CL ↗