Исследования21 сентября 2026 г., 09:17 МСК🤖 Auto

Почему заявления об ИИ-безопасности от OpenAI и Anthropic нужно перепроверять

Исследователи LessWrong требуют обязательного открытого реплицирования экспериментов по выравниванию (alignment) от ведущих лабораторий, так как текущие закрытые результаты часто оказываются хрупкими.

Баннер новости 7921

Проблема: закрытость и хрупкость результатов

Ведущие лаборатории, такие как Anthropic и OpenAI, публикуют эмпирические исследования по безопасности ИИ, но часто делают это без предоставления кода и детальной методологии. Это создает ситуацию, в которой компании могут заявлять о прогрессе в выравнивании моделей, который никто не может независимо проверить. Исследование, опубликованное на платформе LessWrong, указывает на то, что многие результаты могут быть «хрупкими» и зависеть от скрытых параметров, таких как LoRA alpha или специфические провайдеры API (например, OpenRouter), которые не афишируются.

Три столпа новой методологии

Авторы статьи предлагают систему из трех шагов для верификации заявлений о безопасности:

  • Репликация: Независимое воспроизведение экспериментов для проверки обобщаемости результатов. Если результат не воспроизводится, это сигнал о том, что метод не надежен.
  • Стресс-тестирование: Проверка устойчивости выводов через изменение гиперпараметров, использование других семейств моделей и анализ транскриптов поведения ИИ. Цель — выявить, является ли утверждение о причинно-следственной связи на самом деле корреляцией.
  • Открытый исход (Open Source): Публикация кода репликаций. Это позволяет сторонним исследователям не только проверять работу, но и строить на ее основе новые исследования, делая сообщество ИИ-безопасности более самодостаточным.

Почему это важно сейчас?

История науки знает примеры, когда отсутствие мета-науки (проверки самих методов) приводило к кризисам: в психологии и доклинической онкологии многие известные результаты не выдержали проверки временем. В машинном обучении аналогичная ситуация наблюдалась с результатами глубокого обучения с подкреплением (Deep RL) середины 2010-х годов, которые оказались трудно воспроизводимыми. Без независимой верификации сообщество рискует строить стратегию безопасности на ложных предпосылках.

Практические барьеры и решения

Репликация на уровне frontier-моделей требует значительных вычислительных ресурсов и квалифицированных кадров. Однако авторы отмечают, что open-weight модели отстают от закрытых frontier-решений всего на ~4 месяца. Это делает их достаточной прокси-средой для первичной проверки гипотез. Основные препятствия — финансирование и доступ к весам моделей — считаются решаемыми через гранты и использование открытых аналогов.

Аспект Текущая ситуация (Frontier Labs) Предлагаемая норма (Replication)
Доступность кода Закрыто / Отсутствует Полный открытый исход (Open Source)
Методология Скрытые детали (hyperparameters, seeds) Детальное описание для воспроизведения
Верификация Отсутствует (self-reported) Независимый стресс-тест и аудит
Использование моделей Закрытые API (GPT-4, Claude) Open-weight аналоги (отставание ~4 мес.)

Вывод

Мета-наука в области ИИ-безопасности — это «самая дешевая страховка» от повторения исторических ошибок. Требование открытости и реплицируемости является критическим шагом для перехода от маркетинговых заявлений к научно обоснованной безопасности искусственного интеллекта.

Источник: LessWrong ↗