Исследования29 июля 2026 г., 19:17 МСК🤖 Auto

Stuart Armstrong: LLMs не обладают «сильной генерализацией» — это главная дыра в ИИ

Исследователь Stuart Armstrong объясняет, почему современные LLM, несмотря на успехи в бенчмарках, остаются «глупыми гигантами». Ключевая проблема — отсутствие способности к адаптивному планированию и пониманию контекста, известной как «сильная генер

Баннер новости 4648

Парадокс вершины AGI

Автор статьи, Stuart Armstrong, отмечает, что с 2022 года индустрия находится в состоянии «вечного ожидания» AGI. Модели вроде GPT-3.5 демонстрируют способность комбинировать идеи, но так и не достигают общего интеллекта. Armstrong выделяет пять загадок LLM, которые объясняются отсутствием у них сильной генерализации (strong generalisation):

  • Эксперты получают от LLM значительно больше пользы, чем новички.
  • Странная смесь гениальности и глупости: модель может решить сложную задачу, но провалиться в базовых логических шагах.
  • Постоянная потребность в переобучении и огромных объемах данных.
  • Постоянное ощущение, что AGI «вот-вот», но оно никогда не наступает.
  • Главная загадка: LLM успешно проходят сложные многошаговые бенчмарки, но не могут перенести эти навыки в реальный мир. Это опровергает аргументы о том, что масштабирование данных автоматически ведет к пониманию.

Что такое «Сильная генерализация»?

Armstrong определяет это понятие не как одну функцию, а как комплекс способностей, позволяющих человеку действовать в новых условиях, не теряя из виду общую цель. Это включает:

  • Ситуационную осведомленность (situational awareness).
  • Адаптивное моделирование мира.
  • Долгосрочное планирование и иерархическое планирование.
  • Обнаружение аномалий.

Важно, что этот процесс у людей полуинстинктивен и не поддается прямому сознательному контролю. LLM же лишены этой способности: они «перемешивают» данные из обучения, но не понимают сути происходящего. Когда LLM ошибается, это не случайный сбой, а неизбежный результат попытки выполнить задачу, которая для модели принципиально невозможна без понимания контекста.

Три уровня генерализации ценностей

Особое внимание уделено генерализации ценностей (value generalisation). В отличие от эмпирических знаний, которые можно проверить реальностью, ценности (цели, предпочтения) не имеют объективной истины. Armstrong выделяет три подхода к их обработке:

Тип генерализации Описание Риск/Результат
A. Наивная (Naive) Расширение категорий, определенных в ML-системе. Стандартный режим работы классификаторов. Провал на данных вне распределения (OOD) и при состязательных атаках.
B. Направляемая (Guided) Генерализация происходит через постоянный человеческий надзор и корректировки. Система зависит от человека; масштабирование затруднено из-за необходимости ручного контроля.
C. Явная (Explicit) Система самостоятельно развивает способность к robust-генерализации концепций, как люди. Идеальный вариант: человеческий надзор полезен, но не обязателен. Цель исследований Armstrong.

Почему это критично для безопасности ИИ

Если ИИ обладает мощными вычислительными способностями, но слабой генерализацией ценностей, он станет бесполезным в новых ситуациях или, что хуже, вызовет катастрофу, неправильно интерпретировав цель в нестандартном контексте. Armstrong утверждает, что для создания выровненных (aligned) AGI необходимо достичь явной сильной генерализации ценностей — способности ИИ принимать решения, сопоставимые с человеческими, в ситуациях, с которыми люди никогда не сталкивались.

Вывод

Текущие трюки, такие как chain-of-thought или агенты рассуждения, лишь пытаются имитировать человеческое мышление через текст, но не заполняют «центральную дыру» в архитектуре моделей. Без решения проблемы сильной генерализации LLM останутся мощными инструментами, зависящими от человека, но не способными к автономному интеллектуальному развитию.

Источник: LessWrong ↗