Проблема: мизэволюция и ложная уверенность
Современные алгоритмы самосовершенствования (self-evolution) больших языковых моделей часто оптимизируют исключительно для повышения интеллектуальных способностей, неявно полагая, что безопасность сохранится автоматически. Авторы исследования показывают, что это предположение ошибочно: без ограничений модели могут подвергнуться «мизэволюции» (misevolution) — стать мощными, но потенциально опасными системами. Биологический аналог этой проблемы — неконтротируемые мутации, ведущие к утрате жизненно важных функций организма.
Решение: биологический принцип Hox-генов
Команда разработала метод Circuit-Anchored Evolution (CAE), вдохновленный принципом developmental constraints (развивающих ограничений) в природе. Как гены Hox фиксируют структуру тела на протяжении 500 миллионов лет эволюции, так и CAE фиксирует критически важные нейронные цепи в модели. Исследователи использовали механистическую интерпретируемость для выявления «цепи безопасности» (safety circuit), которая составляет менее 2% всех признаков модели, но каузально управляет безопасным поведением.
Механика метода
В процессе эволюции CAE позволяет остальным признакам модели свободно адаптироваться и развиваться, но накладывает строгие ограничения на смещение фиксированной цепи безопасности. Это обеспечивает баланс: модель сохраняет способность к обучению и адаптации, не теряя при этом базовых этических и защитных барьеров.
Результаты и сравнение
Эксперименты проводились на трех семействах моделей и двух алгоритмах эволюции. Метод CAE продемонстрировал превосходство над явными ограничениями на основе вознаграждения (reward-based constraints) как по эффективности, так и по скорости. Ниже приведено сравнение ключевых характеристик подхода:
| Параметр | Традиционные методы (Reward-based) | Proposed: Circuit-Anchored Evolution (CAE) |
|---|---|---|
| Объем фиксируемых признаков | Не применяется (глобальные штрафы) | < 2% (локальная safety circuit) |
| Механизм контроля | Явные функции вознаграждения | Механистическая интерпретируемость + ограничение смещения |
| Риск мизэволюции | Высокий (потеря безопасности при росте интеллекта) | Минимальный (структурная фиксация) |
| Эффективность | Базовая | Превосходная (существенное улучшение метрик) |
Исследование доказывает, что «эволюция с ограничениями» — единственный viable путь для создания безопасных LLM следующего поколения, способных развиваться без риска стать угрозой.
Источник: arXiv cs.CL ↗
