Исследования5 сентября 2026 г., 01:18 МСК🤖 Auto

Разрыв мифа: 97% исследований по безопасности ИИ не требуют фронтьер-моделей

Масштабный анализ 477 научных работ за 2019–2025 годы опровергает тезис лидеров лабораторий о том, что безопасность ИИ невозможна без доступа к самым мощным моделям. Фронтьер-зависимость составляет всего 2,7%.

Баннер новости 6815

Суть исследования: данные против мифов

Исследователь Стивен МакАлиси (Stephen McAleese) проанализировал 521 публикацию по безопасности ИИ, опубликованных с 2019 по 2025 год. Используя классификатор на базе LLM с четкой рубрикой, он оценил, насколько центральные результаты каждой работы зависят от доступа к «фронтьерным» (самым мощным) моделям. Из них 477 работ получили оценку, 44 были исключены из-за недостатка данных.

Результаты бьют по двум крайним точкам зрения: CESH (Capability-Enabled Safety Hypothesis — безопасность требует фронтьера) и CISH (Capability-Independent Safety Hypothesis — безопасность независима от возможностей). Реальность оказалась посередине, но с сильным перекосом в сторону независимости.

Ключевые цифры: где нужна мощь, а где — нет

Большинство прорывов в безопасности ИИ достигается без использования самых дорогих и сложных моделей. Фронтьерные модели часто используются лишь для «помощи» (capability-assisted), но не являются строго необходимым условием для доказательства метода или явления.

Категория зависимости Количество работ Доля от оцененных Суть
Фронтьер-зависимые (Frontier-dependent) 13 2.7% Центральный результат невозможен без доступа к фронтьер-моделям
Не зависят от моделей / Не-фронтьер 307 64.4% Результаты получены без моделей или на слабых/открытых моделях
С зависимостью от возможностей (Assisted) 157 32.9% Мощные модели усилили работу, но метод доказан и на более слабых

Влияние и субдисциплины: где кроется зависимость

Зависимость от мощных моделей не равномерна. Она сильно варьируется в зависимости от подполя безопасности ИИ. Работа, получившая наибольшее цитирование (топ-кварталь), чаще опирается на фронтьер:

  • Теория и основы агентов (Theory & Agent Foundations): Медианная оценка зависимости — 1. 100% работ находятся в диапазоне независимости от возможностей или использования не-фронтьерных моделей.
  • Интерпретируемость (Interpretability): Медианная оценка — 2. Большинство исследований проводятся на моделях, не являющихся актуальным фронтьером.
  • Оценки и бенчмарки (Evaluations & Benchmarks): Медианная оценка — 3. Здесь зависимость от мощных моделей наиболее высока, так как тестирование часто требует актуальных систем.

Динамика: поле становится менее зависимым

Парадоксально, но по мере развития технологий доля работ, строго требующих фронтьер-доступ, снижается. В 2023 году таких работ было 6.5%, а в 2025 году — всего 1.9%. Поле не становится более зависимым от закрытых мощных моделей; вместо этого происходит сдвиг от полностью независимых исследований к тем, что используют мощные модели как вспомогательный инструмент для масштабирования или генерации данных.

Почему это важно

Эти данные ставят под сомнение аргументы лидеров лабораторий (таких как Anthropic и OpenAI) о том, что безопасность ИИ невозможно исследовать без контроля над самыми мощными системами. Если 97.3% исследований могут быть проведены без фронтьера, то монополизация безопасности ИИ на уровне закрытых лабораторий не является технически необходимой, а скорее экономическим или политическим выбором. Это открывает путь для академического и независимого сектора вносить вклад в безопасность наравне с индустрией.

Источник: LessWrong ↗