Исследования29 июля 2026 г., 11:17 МСК🤖 Auto

HOBA: LLM-агент для адаптивных ставок в рекламе (KDD 2026)

Исследователи представили HOBA — иерархическую RL-систему, где LLM управляет гиперпараметрами, а SARSA выбирает экспертные модели. В онлайн-тестах прирост целевой стоимости составил +3.6%.

Баннер новости 4615

Проблема статичности в аукционах

Современные системы онлайн-рекламы (RTB) часто опираются на набор офлайн-обученных экспертных моделей, таких как PID-контроллеры, MPC или Offline RL. Главная проблема таких систем — неспособность адаптироваться к нестабильным аукционным рынкам в реальном времени и зависимость от ручного тюнинга гиперпараметров (ограничений ставок, pace-контроля бюджета). Это приводит к субоптимальным результатам при изменении конкуренции или поведения пользователей.

Архитектура HOBA: три уровня интеллекта

Авторы предлагают HOBA (Hierarchical On-policy Bidding Agents) — фреймворк, разделяющий принятие решений по временным масштабам. Система работает по принципу «Think-Act-Observe-Reflect» с использованием LLM на верхнем уровне:

  • High-level (Стратегия): LLM анализирует контекстные сигналы и исторический опыт, чтобы динамически выводить гиперпараметры (например, границы ставок).
  • Mid-level (Выбор модели): Агент SARSA с каузальной корректировкой выбирает лучшую экспертную модель из пула, устраняя bias при выборе.
  • Low-level (Исполнение): Динамический пул экспертов (PID, MPC, IQL, Decision Transformer) исполняет ставки в рамках заданных ограничений.

Ключевые метрики и результаты

Подход позволяет перенести онлайновое обучение с непрерывной оптимизации ставок на дискретный выбор моделей, что снижает риск исследования (exploration risk). Результаты тестирования на бенчмарке AuctionNet и крупномасштабном A/B тесте показали стабильное превосходство над baselines.

Метрика / Аспект Результат / Характеристика
Основной бизнес-показатель +3.6% рост целевой стоимости (Target Cost)
Платформа публикации KDD 2026 (Ads Track)
Базовые модели в пуле PID, MPC, IQL, Decision Transformer
Механизм выбора SARSA с каузальной корректировкой
Управление гиперпараметрами LLM (Think-Act-Observe-Reflect loop)

Почему это важно

HOBA демонстрирует практическую применимость LLM не как генераторов текста, а как стратегических планировщиков в финансовых и рекламных алгоритмах. Отказ от ручного тюнинга и адаптация к non-stationary рынкам в реальном времени делают эту архитектуру значимым шагом к автономным рекламным системам.

Источник: arXiv cs.AI ↗