Автор статьи, эксперт с опытом в макро-трейдинге и Explainable AI, предлагает адаптировать банковские регуляторные рамки (в частности, Базель III) к индустрии передовых моделей ИИ. Идея заключается во введении обязательных капитальных резервов: чем выше риск того, что модель выйдет из-под контроля (misalignment), тем больше ликвидных средств лаборатория должна заморозить на счетах. Это устраняет моральный риск, при котором исследователи безопасности (alignment researchers) зависят от акций компании, которую они должны контролировать.
Почему текущая система не работает
Современные фронтенд-лаборатории ИИ автор сравнивает с трейдинговыми стоками до финансового кризиса 2008 года. Ключевые параллели:
- Рост левериджа: Огромные балансы, вовлеченные в циркулярные инвестиции и инфраструктурные сделки.
- Моральный риск: Внутренние исследователи безопасности оплачиваются наличными и акциями той же компании, риски которой они оценивают. Их интересы не совпадают с глобальной безопасностью.
- Отсутствие независимых лимитов: Добровольные обязательства и Responsible Scaling Policies (RSP) не имеют «зубов» внешнего принуждения.
Механика «Risk-Weighted Token» (RWT)
Предлагается создать метрику, аналогичную risk-weighted assets в банках. Капитальный резерв рассчитывается на основе оценки риска модели. Если модель высокоопасна (черный ящик, автономные действия), лаборатория обязана заморозить значительную часть выручки. Это напрямую снижает капитал, доступный для R&D, покупки вычислений или обратного выкупа акций. Рынок, оценивая эти обязательства, будет дисконтировать стоимость акций компаний с непроверенными моделями.
Примерная структура резервов
В статье приведен иллюстративный фреймворк, показывающий, как требования к капиталу зависят от уровня безопасности и верифицируемости модели:
| Уровень модели | Профиль безопасности | Покрытие формальными доказательствами | Требование к капитальному резерву |
|---|---|---|---|
| Уровень 1: Ограниченный / Специализированный | Формально верифицированные границы вывода. Ограниченная область. | Высокое (>80% верифицируемых выводов) | 1% – 3% от выручки |
| Уровень 2: Общий фронтенд (Аудированный) | Стандартные оценки пройдены. Надежное внешнее red-teaming. | Частичное (Символические обертки) | 5% – 10% от выручки |
| Уровень 3: Высокая способность (Black Box) | Неверифицируемые цепочки рассуждений. Автономные возможности. | Низкое / Неверифицируемое | 20% – 35%+ от выручки |
Такая система создает прямое экономическое стимулирование: лабораториям выгоднее инвестировать в верифицируемые архитектуры и снижать «уровень риска» модели, чтобы высвободить капитал для других нужд. Это не остановит гонку вооружений, но сделает ее значительно более осторожной и финансово обоснованной.
Источник: LessWrong ↗
