Исследования17 сентября 2026 г., 05:18 МСК🤖 Auto

AI Safety: От статей в месяц к экспериментам в час

Исследователь Джейсон Фантл предлагает радикально ускорить цикл обратной связи в AI Safety, заменив ежемесячные публикации на ежечасный обмен результатами экспериментов через автономных агентов.

Баннер новости 7682

Суть предложения: Атомизация научного процесса

Традиционный цикл публикации в AI Safety занимает недели или месяцы. Исследователь пишет статью, выкладывает её на LessWrong или arXiv, и только после этого начинается обсуждение. Джейсон Фантл предлагает перейти к модели, где агенты делятся результатами отдельных экспериментов ежечасно. Это превращает разрозненные лаборатории в единую координированную среду, где обратная связь поступает мгновенно, а дублирование работы минимизируется.

Почему это возможно именно сейчас?

Автор выделяет три ключевых фактора, делающих эту трансформацию реалистичной:

  • Открытость коллаборации: В отличие от индустрии capabilities, где лаборатории скрывают прорывы ради конкурентного преимущества, AI Safety заинтересована в глобальном обмене данными для предотвращения экзистенциальных рисков.
  • Автономность агентов: Стоимость коммуникации между агентами падает. Автономные исследователи (autoresearchers) могут непрерывно взаимодействовать друг с другом, интерпретировать результаты и запускать новые тесты без постоянного участия человека.
  • Способность к рою (Swarm Intelligence): Инциденты с OpenAI и Hugging Face, а также прогресс в решении математических задач роями моделей, демонстрируют, что большие группы агентов могут эффективно работать над общей целью.

Матрица гранулярности публикаций

Фантл описывает эволюцию научного процесса через призму двух параметров: частоты обмена информацией и объема данных за один сеанс. Переход от традиционных статей к ежечасным отчетам выглядит так:

Режим Частота обмена Объем данных Характеристика
Текущий стандарт Месяц Большой (Статья/Блог) Высокий порог входа, долгий цикл обратной связи
Прогноз (автоматизация) Неделя Большой (Статья) Ускорение работы агентов, но тот же формат
Предлагаемая модель Час Малый (Эксперимент) Мгновенная репликация, критика и расширение

Практическая реализация и риски

Первый шаг — внедрение инструкций в промпты агентов исследователей, заставляющих их фиксировать и публиковать промежуточные результаты (аналогично коммитам в Git). Это позволяет лабораториям избегать параллельной работы над одними и теми же гипотезами. Однако автор признает риски: концентрация взаимодействий агентов создает единую точку отказа для атак через инъекцию промптов (prompt injection). Для масштабирования на всю открытую сеть потребуется создание систем верификации и модерации в условиях низкого уровня доверия (low-trust environments).

Источник: LessWrong ↗