Проблема масштабируемого надзора
При обучении систем для передовых исследований в области выравнивания (alignment) возникает критическая проблема: исследователи не могут определить, когда система делает правильный выбор, так как задачи становятся слишком сложными для человеческого понимания. Традиционные методы либо полагаются на эмпирические тесты на малых данных (что не гарантирует успеха на больших задачах), либо используют сложную теорию сложности, которую трудно применить к реальным сценариям.
Суть метода: синтетические графы
Авторы предлагают промежуточный подход — Synthetic Scalable Oversight. Метод создает абстрактные графовые модели, статистические свойства которых калибруются по реальным данным. Внутри этих сред обучаются крошечные модели-агенты, которые имитируют поведение больших языковых моделей (LLM). Это позволяет тестировать протоколы надзора на задачах произвольного размера, не требуя огромных вычислительных ресурсов.
Кейс: Математика и Lean
Для демонстрации метода исследователи выбрали формальную математику, так как конструировать синтетические модели для языка Lean проще, чем для естественного языка. В этой среде:
- Узлы графа представляют собой литералы (истинные или ложные утверждения).
- Ребра показывают, насколько доказательство одного утверждения облегчает доказательство другого.
- Агенты имеют ограниченный контекст и должны координировать усилия для доказательства целевых теорем, используя частные и общие библиотеки.
Сравнение подходов
Метод синтетического надзора превосходит традиционные подходы по скорости оценки и возможности автоматического поиска новых протоколов. Сравнительная таблица ниже демонстри ключевые различия:
| Критерий | Естественный язык (Эмпирика) | Теория сложности | Синтетический подход |
|---|---|---|---|
| Использование реальных данных | Да | Нет | Да |
| Масштабируемость до суперчеловеческих задач | Нет | Да | Да |
| Пропускная способность оценки механизмов | Низкая | Низкая | Высокая |
| Автоматический поиск механизмов | Дорого | Сложно | Легко |
Почему это важно
Обучение синтетических моделей обходится в миллионы раз дешевле, чем обучение LLM, так как агентам не нужно понимать язык. Это позволяет использовать black-box search (поиск вслепую) для автономного открытия новых, более эффективных протоколов многоагентного взаимодействия. Авторы уже нашли механизм, превосходящий ручные базовые линии в синтетической среде, и ожидают переноса этих результатов на неформальные задачи.
Доступность
Код проекта доступен на GitHub по адресу stagiralabs/AgoraForge. Работа опубликована 14 июля 2026 года в журнале LessWrong.
Источник: LessWrong ↗
