Новая парадигма: от LLM к мультиагентным системам
Эмметт Шир, бывший CEO Twitch и временный CEO OpenAI, теперь возглавляет направление AI alignment в стартапе Softmax. Его подход к безопасности искусственного интеллекта претерпел фундаментальный сдвиг: фокус сместился с отдельных больших языковых моделей (LLM) на мультиагентные системы. Ключевая гипотеза Шира заключается в том, что выравнивание (alignment) между агентами должно предшествовать их интеллекту, чтобы создать ИИ, который по своей природе будет безопасен.
Люди как «генераторы выравнивания»
Шир утверждает, что люди — это не просто пользователи ИИ, а «генераторы выравнивания». Наша способность к кооперации позволяет нам доминировать над видами, которые физически сильнее нас (от львов до слонов), не благодаря хитрости, а благодаря социальной координации. Интеллект здесь выступает не как изолированный инструмент, а как множитель выравнивания (alignment multiplier).
Теория разума: основа кооперации
В основе человеческой силы лежит «Теория разума» (Theory of Mind) — способность понимать, что у других есть свои убеждения и перспективы, отличные от наших. Этот навык развивается у детей в возрасте 2–5 лет и позволяет нам предсказывать действия других, создавая петлю положительной обратной связи: больше кооперации → выше требования к интеллекту → лучше координация.
Расширенная теория разума и риски
Шир расширяет концепцию на уровень групп: «Теория разума других групп». Это позволяет обществам понимать соседей и адаптировать социальные нормы, но также дает возможность «знать своего врага». В следующих публикациях серии автор планирует раскрыть темную сторону кооперации, которая может усиливать misalignment (несоответствие целей) между группами, и рассмотреть, как распределенные системы могут противостоять мощным дефекторам.
| Ключевая концепция | Описание и значение для AI Alignment |
|---|---|
| Мультиагентные системы | Фокус смещен с одиночных LLM на взаимодействие множества агентов. Выравнивание между ними критично до достижения сверхинтеллекта. |
| Теория разума (ToM) | Базовый человеческий навык понимания чужих перспектив. Считается фундаментом, на котором строится кооперация. |
| Alignment Multiplier | Интеллект рассматривается не как цель сама по себе, а как инструмент, усиливающий способность к согласованным действиям. |
| Теория разума групп | Расширение ToM на коллективы. Позволяет понимать чужие социальные нормы, но создает риск стратегического противостояния. |
Источник: LessWrong ↗
