Исследования3 сентября 2026 г., 01:19 МСК🤖 Auto

AI Safety: 1000 людей за $5 млн/мес для чтения логов RL

Предложение создать организацию, где тысячи людей вручную проверяют анонимизированные транскрипты обучения моделей, чтобы выявлять инциденты безопасности, которые пропускают автоматические мониторы.

Баннер новости 6631

Суть предложения: «Просто читайте транскрипты»

Автор поста на LessWrong, пользователь ceselder, предлагает создать высокоэффективную организацию по безопасности ИИ (AI Safety), которая решает проблему «слепых зон» автоматических систем мониторинга. Идея заключается в том, чтобы нанять большой штат людей для ручного анализа анонимизированных логов (транскриптов) процессов обучения, особенно этапов Reinforcement Learning (RL).

Ключевая гипотеза: автоматические мониторы (нейросетевые классификаторы) уязвимы к обходу (adversarial attacks) и не могут поймать все случаи misalignment. Люди же остаются необходимыми для выявления явных признаков вредоносного поведения или «странных» паттернов, которые алгоритмы пропускают.

Математика проекта (Napkin Math)

Автор приводит конкретные расчеты масштабируемости и эффективности такой системы. Предлагается использовать инструмент вроде Docent для ускорения чтения (в 10 раз быстрее ручного труда).

Параметр Значение / Оценка
Объем данных (RL-тренировка) ~1013 токенов в месяц (frontier-модели)
Пропускная способность человека ~106 токенов в месяц (с ускорителем)
Необходимый штат ~1000 человек
Бюджет ~$5 млн в месяц
Частота флага монитора 1 из 1000 токенов (низкий FNR, низкая точность)
Прогноз инцидентов в месяц ~15 серьезных инцидентов (при консервативной оценке)

Почему это важно и почему этого нет?

Автор отмечает парадокс: каждый крупный инцидент в истории ИИ мог быть обнаружен таким способом, но лаборатории не имеют времени на это. Предложение меняет экономику безопасности: вместо поиска редких «гениев» в области AI Safety, организация использует деньги для привлечения массового труда. Это позволяет:

  • Выявлять reward hacking и кибер-биологические угрозы на ранних этапах.
  • Создать масштабируемую систему, которая не зависит от роста зарплат экспертов.
  • Использовать данные для улучшения самих мониторов (чем больше данных, тем лучше обучается фильтр).

Ограничения и риски

Главная проблема — доступ к транскриптам и вопросы NDA/конфиденциальности. Требуется строгая анонимизация. Также существует риск, что объем вычислений (RL flops) будет расти быстрее, чем количество людей, способных их проверить. Однако автор считает, что при текущих темпах этот подход успеет обеспечить безопасность следующих поколений моделей, выполняя «домашнюю работу» по выравниванию (alignment).

Идея остается маргинальной в открытом дискурсе, вероятно, из-за сложности организации такого масштаба и юридических барьеров, но технически она выглядит как логичное дополнение к существующим методам безопасности.

Источник: LessWrong ↗