Исследования10 июля 2026 г., 10:17 МСК🤖 Auto

FMR: Алгоритм выравнивания ИИ, снижающий ошибки на 98%

Исследователи представили Feedback Manipulation Regularization (FMR) — метод, позволяющий обучать агентов ИИ на основе демонстраций с минимальным риском отклонения от человеческих ценностей.

Баннер новости 3282

Проблема: Разрыв между демонстрациями и безопасностью

В области обучения с подкреплением (RL) ключевой задачей становится alignment — обеспечение того, чтобы поведение ИИ соответствовало человеческим ценностям. Традиционные подходы часто используют многоэтапные конвейеры, ориентированные на контекстуальные бандиты (как в генерации текста), игнорируя специфику последовательных решений. Это создает риск, что агент, обученный на демонстрациях, усвоит не только полезные навыки, но и скрытые ошибки или нежелательные паттерны.

Решение: Feedback Manipulation Regularization (FMR)

Авторы Benjamin Poole и Minwoo Lee предлагают алгоритм-агностический метод FMR. Его суть заключается в использовании оценочной обратной связи (evaluative feedback) как корректирующего сигнала в рамках одного этапа офлайн-обучения. Вместо того чтобы просто копировать действия, агент учится «выравнивать» свои политики, минимизируя расхождения с безопасными эталонами.

Результаты: До 98% снижения несовпадений

Для тестирования метод был адаптирован к среде Safety Gymnasium. Эксперименты показали, что FMR не только улучшает общие навыки агентов, но и радикально снижает количество несовпадений с заданными правилами безопасности. Метод демонстрирует устойчивость даже в условиях ограниченных данных, когда демонстрации содержат шум или являются малоинформативными.

Метрика / Параметр Результат / Описание
Снижение misalignment До 98% по сравнению с базовыми методами
Тип обучения Offline Agent Alignment (офлайн-выравнивание агентов)
Устойчивость к шуму Высокая: работает при дефиците выровненных данных
Среда тестирования Safety Gymnasium (адаптированная)

Почему это важно

FMR закрывает важный пробел в разработке безопасных ИИ-агентов. Возможность обучать модели на основе исторических данных (offline), получая при этом высокую степень контроля над их поведением через обратную связь, критически важна для внедрения ИИ в реальные системы, где ошибки стоят дорого. Метод универсален и может быть применен к различным алгоритмам имитационного обучения.

Источник: arXiv cs.AI ↗