Релиз модели23 сентября 2026 г., 01:21 МСК🤖 Auto

От RLHF к Agentic RL: как меняется обучение ИИ

Индустрия переходит от обучения моделей просто «звучать полезно» к созданию агентов, способных самостоятельно выполнять сложные многошаговые задачи.

Баннер новости 8082

Конец эры простого подражания

Традиционный метод обучения с подкреплением на основе человеческих предпочтений (RLHF) долгое время был золотым стандартом для чат-ботов. Он научил языковые модели вести осмысленные диалоги, избегать токсичности и звучать «полезно». Однако этот подход имеет фундаментальное ограничение: модель реагирует на запрос, но не действует в мире. Она генерирует текст, но не выполняет действия.

Что такое Agentic RL?

Новый парадигмальный сдвиг — Agentic RL (Агентное обучение с подкреплением) — меняет правила игры. Вместо того чтобы просто предсказывать следующее слово или фразу, модель обучается планировать и выполнять последовательности действий для достижения конкретной цели. Это переход от «ассистента» к «агенту».

Ключевые отличия нового подхода:

  • Многошаговость: Модель разбивает сложную задачу на подзадачи и выполняет их последовательно.
  • Взаимодействие с окружением: Агент получает обратную связь не только от человека, но и от системы (успех/неудача операции, доступ к инструментам).
  • Автономия: Снижение необходимости в микро-менеджменте со стороны пользователя.

Почему это важно?

RLHF создавал «болтунов», которые умели красиво описывать решение проблемы. Agentic RL создает «решателей». Для бизнеса и разработчиков это означает появление ИИ, который может:

  1. Писать код и сразу его тестировать.
  2. Искать информацию в интернете и агрегировать результаты.
  3. Управлять другими программами и API.

Этот переход происходит «тихо», так как он требует пересмотра архитектуры обучения и создания новых метрик оценки, но именно он определит следующее поколение интеллектуальных систем.

Источник: Towards AI pub ↗