Суть инициативы: Внутренние аудиторы с доступом сотрудников
Anthropic официально объявила о партнерстве с Accenture (через подразделение Faculty) для внедрения системы embedded evaluators — встроенных оценщиков безопасности. В отличие от внешних проверок, эти специалисты получат доступ к внутренним данным и процессам разработки на уровне высокопоставленных сотрудников компании. Их задачи включают red-teaming, оценку выравнивания (alignment) и тестирование защитных механизмов моделей.
Ключевая цифра: Anthropic и Accenture обязуются инвестировать не менее $1 млрд в развитие этого направления в течение следующих пяти лет. Партнерство является неэксклюзивным, что позволяет Anthropic работать и с другими организациями.
Двойная стратегия: Корпоративный масштаб + НКО-экспертиза
Anthropic планирует комбинировать два подхода к аудиту, чтобы покрыть разные аспекты безопасности. Параллельно с Accenture компания ведет переговоры с METR (Metaculus Evaluation of Transformer Robustness) и другими некоммерческими организациями. METR будет финансироваться за счет собственных средств, что снижает прямую зависимость от заказчика.
| Критерий | Accenture (Корпоративный подход) | METR (Некоммерческий подход) |
|---|---|---|
| Источник финансирования | Прямое финансирование от Anthropic ($1 млрд+) | Собственные средства / гранты (независимое финансирование) |
| Фокус | Практическое развертывание, enterprise-безопасность, масштаб | Глубокая экспертиза в alignment, технический аудит |
| Восприятие | «Скучный», формальный, внешний взгляд (как у магистрата) | «Взгляд изнутри», экспертная оценка рисков |
| Риск конфликта | Высокий (зависимость от клиента) | Низкий (финансовая независимость) |
Требования к независимости: Письмо Хинтона и Рассела
Инициатива опирается на стандарты, предложенные группой ведущих ученых (Джеффри Хинтон, Стюарт Рассел, Аравинд Нараянан). Критерии «достоверных» встроенных оценщиков включают:
- Полная независимость: Никаких выплат, зависящих от результатов проверки; отсутствие коммерческих связей или контроля.
- Прозрачность: Открытое раскрытие конфликтов интересов.
- Защита от репрессий: Оценщики должны быть защищены от увольнения или давления со стороны лаборатории.
- Доступ: Уровень привилегий, эквивалентный высокопоставленным сотрудникам, с исключениями только для защиты данных.
Почему это важно и где скрыты риски
Инициатива Dario Amodei (Anthropic) и OpenAI по созданию встроенных аудиторов — ответ на растущее число инцидентов с «взломом» ИИ. Однако эксперты указывают на фундаментальную проблему: кто нанимает и контролирует самих аудиторов?
Если Anthropic платит Accenture, возникает риск конфликта интересов. Как отмечает автор статьи, даже при наличии METR, полная независимость в текущих условиях недостижима. Требуется либо государственное вмешательство, либо создание рынка страхования ответственности ИИ, который мог бы объективно оценить риски через ценообразование полисов. Пока же мы видим попытку лабораторий самостоятельно создать систему сдержек и противовесов, опираясь на лучшие доступные, но несовершенные решения.
Источник: LessWrong ↗
