Исследования1 июля 2026 г., 19:15 МСК🤖 Auto

LLM-агенты изобрели алгоритмы стирания концепций лучше SOTA

Исследователи использовали LLM-агентов для автоматического поиска алгоритмов стирания знаний (concept erasure), которые превосходят существующие методы по эффективности и полноте удаления информации.

Баннер новости 2750

Проблема текущего состояния

Техника concept erasure (стирание концепций) позволяет удалять нежелательную информацию из активаций нейросетей. Однако существующие методы часто не способны полностью удалить целевые концепции, оставляя «хвосты» знаний, которые модель продолжает использовать. Это создает риски безопасности и этические проблемы при развертывании моделей.

Методология: Агенты как исследователи

В исследовании, представленном на LessWrong (авторы Adam Scherlis и Anish Tondwalkar, 1 июля 2026 года), команда поставила перед LLM-агентами задачу не просто применить существующие методы, а изобрести новые алгоритмы стирания. Агенты обучались на специализированных данных и должны были разработать процедуры, которые работают лучше текущих state-of-the-art (SOTA) решений в рамках заданных экспериментальных ограничений.

Ключевые результаты и метрики

Авторы провели сравнительный анализ семейств алгоритмов, сгенерированных агентами, и существующих подходов. Основные выводы показывают, что автоматизированный поиск позволяет найти более эффективные стратегии манипуляции активациями, чем ручная настройка гиперпараметров в традиционных методах.

Критерий Традиционные методы Алгоритмы, найденные LLM-агентами
Полнота удаления Частичное, остаются артефакты Значительно выше, ближе к полному обнулению
Метод разработки Ручной подбор (Human-in-the-loop) Автоматический поиск (LLM Agents)
Генерализация Часто узкоспециализированы Более устойчивы к вариациям входных данных

Почему это важно

Это исследование демонстрирует переход от ручного инженерного тьюнинга к автоматизированному открытию алгоритмов (algorithm discovery). Если LLM-агенты могут находить более эффективные способы контроля над внутренним состоянием моделей, это открывает путь к созданию более безопасных, предсказуемых и «чистых» ИИ-систем. Исследование доступно по ссылке dmodel.ai/concept-erasure.

Источник: LessWrong ↗