Суть проблемы: от верифицируемых фактов к интуиции
Авторы (Sam Martin, Dewi Gould, Cameron Holmes, Jacob Pfau) из Arcadia и сообщества LessWrong исследуют критическое препятствие для безопасного развития ИИ — масштабируемый надзор (scalable oversight) за процессом авто-выравнивания (auto-alignment). Традиционные методы, такие как Debate (споры между моделями), отлично работают в доменах с четким ответом: математика, программирование, где есть объективная истина. Однако при переходе к «размытым» (fuzzy) задачам, где решения принимаются на основе суждений, а не фактов, метод демонстрирует отрицательный результат.
Эмпирические данные: Geoguessr и LMCA
Для проверки гипотезы исследователи использовали текстовый вариант игры Geoguessr (определение локации по описанию) и пару вариантов оценки моделей LMCA. Эти задачи требуют от модели не просто знания фактов, а способности декомпозировать сложные аргументы на проверяемые подутверждения. Результаты обучения через метод Best-of-N (выбор лучшего из N вариантов) показали отсутствие улучшения производительности.
| Категория задачи | Пример | Характер верификации | Результат Debate |
|---|---|---|---|
| Точные науки | Математика, код | Объективная, бинарная истина | Эффективно, есть естественная декомпозиция |
| Размытые задачи (Fuzzy) | Geoguessr (текст), LMCA | Субъективное суждение, вероятностные оценки | Провал (No uplift) |
Почему это важно для безопасности ИИ
Ключевая проблема заключается в декомпозиции объяснений. В точных задачах ошибка всегда указывает на конкретный неверный шаг. В «размытых» задачах (например, оценка безопасности тонкой настройки модели на вредоносном коде) модель опирается на эвристики и интуицию, сформированную в процессе предобучения. Модель может решить задачу правильно, но неспособна разложить решение на прозрачные, проверяемые логические цепочки. Это создает риск:
- Скрытые эвристики: Модель использует латентные вычисления, которые человек или другой ИИ-надзиратель не может верифицировать.
- Вероятностные ошибки: Сложно выявить ошибки в утверждениях о вероятности или сравнении («X вероятнее, чем Y»), так как они не имеют бинарного статуса истины.
- Корреляция аргументов: Модель может агрегировать связанные утверждения как независимые доказательства, маскируя слабые аргументы.
Вывод
Исследование подтверждает, что текущие модели не умеют генерировать объяснения, удобные для надзора в сложных контекстах. Без новых методов, позволяющих контролировать сам процесс декомпозиции аргументов, а не только их конечные утверждения, масштабирование надзора за ИИ-исследованиями останется невозможным. Это фундаментальное препятствие для создания безопасных систем, способных проводить собственное выравнивание.
Источник: LessWrong ↗
