Суть предложения: От секретности к прозрачности
Автор инициативы, Eigenbraid, предлагает заменить жесткие запреты на модель Project Glasswing от Anthropic. Ключевая идея — создать стандартизированную группу «раннего доступа» (early access), включающую ведущие лаборатории и государственные органы. Эта группа получает доступ к новым моделям до их публичного релиза, но не имеет права вето. Вместо этого они обязаны публиковать регулярные отчеты о безопасности модели.
Этот подход решает проблему «черного ящика» в регуляторике. Публичные отчеты создают историческую базу данных (track record), позволяя обществу и регуляторам оценивать надежность прогнозов каждой организации. Если лаборатория систематически ошибается, доверие к ее заявлениям падает, что создает рыночное и репутационное давление без необходимости немедленного вмешательства государства.
Два этапа реализации
Предложение структурировано в два логических этапа, адаптированных под текущий уровень развития ИИ:
- Фаза 1: Прозрачность (Transparency). Лаборатории добровольно или по соглашению с государством предоставляют доступ к моделям утвержденным экспертам. Эти эксперты выпускают публичные отчеты: «Модель безопасна» или «Требуются доработки». Рынки предсказаний (prediction markets) могут использовать эти данные для оценки вероятности выхода модели на рынок.
- Фаза 2: Формализация (Formalization). По мере накопления данных и роста опасностей вводятся формальные механизмы. Это может включать требование квалифицированного большинства (super-majority) для одобрения релиза, независимые оценки от спецслужб (CIA, NSA) или формализованные метрики устойчивости к red-teaming. В идеале, по мере улучшения моделей, количество багов должно снизиться до минимума.
Почему это работает сейчас: Экономия на «скучных» угрозах
Автор подчеркивает, что инициатива направлена не на предотвращение гипотетического ASI (Сверхинтеллекта), а на борьбу с конкретными, измеримыми угрозами. Яркий пример — модель Mythos: ранний доступ к ней вызвал измеримый скачок в кибербезопасности, что позволило выявить уязвимости до того, как они стали массовыми. Это доказывает ценность раннего доступа для выявления «скучных», но опасных возможностей моделей.
Баланс интересов: Лаборатории, Государство, Общество
Glasswing Standard предлагает компромисс, который минимизирует сопротивление стейкхолдеров:
| Стейкхолдер | Интерес | Выгода от Glasswing |
|---|---|---|
| Лаборатории (Labs) | Прибыль, репутация, скорость | Небольшая задержка вместо жестких запретов; возможность доказать безопасность модели заранее. |
| Государство | Экономический рост, безопасность | Инструмент для балансировки рисков; возможность постепенно ужесточать контроль по мере роста угроз. |
| Общественность | Отсутствие хаоса, прозрачность | Доступ к информации о рисках; формирование консенсуса для будущих строгих мер. |
Фундамент для будущего: План А и вычислительные мощности
Инициатива позиционируется как «План А» — базовый уровень, необходимый для выживания. Автор также поддерживает политику отслеживания и верификации вычислительных мощностей (compute tracking). Это создает технологическую базу для будущих международных договоров о контроле над ИИ. Главная цель Glasswing — «повысить уровень здравого смысла» (raise the sanity waterline) в обществе, показав, что контроль ИИ возможен без остановки прогресса, что критически важно, так как большинство людей все еще воспринимают риски ИИ как научную фантастику.
Источник: LessWrong ↗
