Суть исследования: данные против мифов
Исследователь Стивен МакАлиси (Stephen McAleese) проанализировал 521 публикацию по безопасности ИИ, опубликованных с 2019 по 2025 год. Используя классификатор на базе LLM с четкой рубрикой, он оценил, насколько центральные результаты каждой работы зависят от доступа к «фронтьерным» (самым мощным) моделям. Из них 477 работ получили оценку, 44 были исключены из-за недостатка данных.
Результаты бьют по двум крайним точкам зрения: CESH (Capability-Enabled Safety Hypothesis — безопасность требует фронтьера) и CISH (Capability-Independent Safety Hypothesis — безопасность независима от возможностей). Реальность оказалась посередине, но с сильным перекосом в сторону независимости.
Ключевые цифры: где нужна мощь, а где — нет
Большинство прорывов в безопасности ИИ достигается без использования самых дорогих и сложных моделей. Фронтьерные модели часто используются лишь для «помощи» (capability-assisted), но не являются строго необходимым условием для доказательства метода или явления.
| Категория зависимости | Количество работ | Доля от оцененных | Суть |
|---|---|---|---|
| Фронтьер-зависимые (Frontier-dependent) | 13 | 2.7% | Центральный результат невозможен без доступа к фронтьер-моделям |
| Не зависят от моделей / Не-фронтьер | 307 | 64.4% | Результаты получены без моделей или на слабых/открытых моделях |
| С зависимостью от возможностей (Assisted) | 157 | 32.9% | Мощные модели усилили работу, но метод доказан и на более слабых |
Влияние и субдисциплины: где кроется зависимость
Зависимость от мощных моделей не равномерна. Она сильно варьируется в зависимости от подполя безопасности ИИ. Работа, получившая наибольшее цитирование (топ-кварталь), чаще опирается на фронтьер:
- Теория и основы агентов (Theory & Agent Foundations): Медианная оценка зависимости — 1. 100% работ находятся в диапазоне независимости от возможностей или использования не-фронтьерных моделей.
- Интерпретируемость (Interpretability): Медианная оценка — 2. Большинство исследований проводятся на моделях, не являющихся актуальным фронтьером.
- Оценки и бенчмарки (Evaluations & Benchmarks): Медианная оценка — 3. Здесь зависимость от мощных моделей наиболее высока, так как тестирование часто требует актуальных систем.
Динамика: поле становится менее зависимым
Парадоксально, но по мере развития технологий доля работ, строго требующих фронтьер-доступ, снижается. В 2023 году таких работ было 6.5%, а в 2025 году — всего 1.9%. Поле не становится более зависимым от закрытых мощных моделей; вместо этого происходит сдвиг от полностью независимых исследований к тем, что используют мощные модели как вспомогательный инструмент для масштабирования или генерации данных.
Почему это важно
Эти данные ставят под сомнение аргументы лидеров лабораторий (таких как Anthropic и OpenAI) о том, что безопасность ИИ невозможно исследовать без контроля над самыми мощными системами. Если 97.3% исследований могут быть проведены без фронтьера, то монополизация безопасности ИИ на уровне закрытых лабораторий не является технически необходимой, а скорее экономическим или политическим выбором. Это открывает путь для академического и независимого сектора вносить вклад в безопасность наравне с индустрией.
Источник: LessWrong ↗
