Парадокс вершины AGI
Автор статьи, Stuart Armstrong, отмечает, что с 2022 года индустрия находится в состоянии «вечного ожидания» AGI. Модели вроде GPT-3.5 демонстрируют способность комбинировать идеи, но так и не достигают общего интеллекта. Armstrong выделяет пять загадок LLM, которые объясняются отсутствием у них сильной генерализации (strong generalisation):
- Эксперты получают от LLM значительно больше пользы, чем новички.
- Странная смесь гениальности и глупости: модель может решить сложную задачу, но провалиться в базовых логических шагах.
- Постоянная потребность в переобучении и огромных объемах данных.
- Постоянное ощущение, что AGI «вот-вот», но оно никогда не наступает.
- Главная загадка: LLM успешно проходят сложные многошаговые бенчмарки, но не могут перенести эти навыки в реальный мир. Это опровергает аргументы о том, что масштабирование данных автоматически ведет к пониманию.
Что такое «Сильная генерализация»?
Armstrong определяет это понятие не как одну функцию, а как комплекс способностей, позволяющих человеку действовать в новых условиях, не теряя из виду общую цель. Это включает:
- Ситуационную осведомленность (situational awareness).
- Адаптивное моделирование мира.
- Долгосрочное планирование и иерархическое планирование.
- Обнаружение аномалий.
Важно, что этот процесс у людей полуинстинктивен и не поддается прямому сознательному контролю. LLM же лишены этой способности: они «перемешивают» данные из обучения, но не понимают сути происходящего. Когда LLM ошибается, это не случайный сбой, а неизбежный результат попытки выполнить задачу, которая для модели принципиально невозможна без понимания контекста.
Три уровня генерализации ценностей
Особое внимание уделено генерализации ценностей (value generalisation). В отличие от эмпирических знаний, которые можно проверить реальностью, ценности (цели, предпочтения) не имеют объективной истины. Armstrong выделяет три подхода к их обработке:
| Тип генерализации | Описание | Риск/Результат |
|---|---|---|
| A. Наивная (Naive) | Расширение категорий, определенных в ML-системе. Стандартный режим работы классификаторов. | Провал на данных вне распределения (OOD) и при состязательных атаках. |
| B. Направляемая (Guided) | Генерализация происходит через постоянный человеческий надзор и корректировки. | Система зависит от человека; масштабирование затруднено из-за необходимости ручного контроля. |
| C. Явная (Explicit) | Система самостоятельно развивает способность к robust-генерализации концепций, как люди. | Идеальный вариант: человеческий надзор полезен, но не обязателен. Цель исследований Armstrong. |
Почему это критично для безопасности ИИ
Если ИИ обладает мощными вычислительными способностями, но слабой генерализацией ценностей, он станет бесполезным в новых ситуациях или, что хуже, вызовет катастрофу, неправильно интерпретировав цель в нестандартном контексте. Armstrong утверждает, что для создания выровненных (aligned) AGI необходимо достичь явной сильной генерализации ценностей — способности ИИ принимать решения, сопоставимые с человеческими, в ситуациях, с которыми люди никогда не сталкивались.
Вывод
Текущие трюки, такие как chain-of-thought или агенты рассуждения, лишь пытаются имитировать человеческое мышление через текст, но не заполняют «центральную дыру» в архитектуре моделей. Без решения проблемы сильной генерализации LLM останутся мощными инструментами, зависящими от человека, но не способными к автономному интеллектуальному развитию.
Источник: LessWrong ↗
