Релиз модели26 сентября 2026 г., 05:25 МСК🤖 Auto

Perplexity снизила ошибки агентов на 21% через Hint-Guided Self-Distillation

Perplexity Research представила метод Hint-Guided Self-Distillation для обучения Computer Agent на реальных ошибках пользователей, что позволило статистически значимо снизить количество сбоев вызова инструментов.

Баннер новости 8319

Проблема стандартного обучения: успех не гарантирует правильность

Команда Perplexity Research опубликовала исследование, в котором критикует стандартный подход к обучению агентов через отбор по результату (Rejection Sampling Fine-tuning, RFT). Главный недостаток метода в том, что успешный исход сессии не означает, что каждый шаг был выполнен верно. Агент может совершить ошибку в вызове инструмента, но затем исправить её самостоятельно, и итоговый ответ будет правильным. Если обучать модель на такой траектории, она может закрепить ошибочное поведение. Кроме того, отбрасывание неудачных сессий лишает систему ценных данных о том, как именно возникают ошибки.

Методология: Имитируй, Исправляй или Сохраняй как контекст

Для решения этой проблемы Perplexity внедрила трехуровневую систему обработки шагов ассистента в процессе обучения:

  • Imitate (Имитировать): Шаги без ошибок из успешных сессий обрабатываются с потерей кросс-энтропии (CE loss), чтобы закрепить правильное поведение.
  • Correct (Исправлять): Шаги с ошибками, сопровождаемые «подсказкой» (hint), обрабатываются с потерей расхождения Кульбака-Лейблера (KL divergence loss). Это работает в любых сессиях, как успешных, так и неудачных.
  • Keep as context (Сохранить как контекст): Остальные шаги остаются в контексте ввода, но не участвуют в расчете потерь.

Как работает «Подсказка» (Hint) и OPSD

Ключевым элементом метода является Hint — краткая корректирующая инструкция, основанная на информации, уже имеющейся у модели. Например, если модель ошибочно установила параметр recency_filter='year', хотя схема допускает только 'day', 'week' или 'month', подсказка указывает на ошибку валидации и предлагает допустимое значение.

Для обучения используется On-Policy Self-Distillation (OPSD). Один и тот же чекпоинт GLM 5.2 запускается дважды на одном и том же шаге:

  1. Teacher (Учитель): Получает входные данные + Hint. Его вероятности следующего токена становятся мягкой целью (soft target).
  2. Student (Студент): Получает те же входные данные, но без Hint. Он учится подражать поведению учителя.

Итоговая функция потерь: (CE + λ × KL) / количество имитируемых токенов. Это предотвращает ситуацию, когда модель просто «игнорирует контекст», чтобы согласиться с учителем при обучении только на исправлениях.

Результаты A/B тестирования и офлайн-оценок

В живом A/B тестировании внутри Perplexity Computer команда зафиксировала статистически значимое снижение отказов вызова инструментов (tool-call failures) с 2.24% до 1.77% между двумя обученными чекпоинтами. Это соответствует относительному снижению на 21.2%.

Дополнительные метрики эффективности метода на отложенной выборке (985 шагов с ошибками инструментов) показывают значительный рост корректности:

Метрика Без Hint (База) С Hint (Метод Perplexity) Изменение
Избегание оригинальной ошибки 75.1% 93.7% +18.6 п.п.
Выполнение исправленного действия 60.6% 82.3% +21.7 п.п.
Коррекция по явным отзывам пользователей 40.0% 75.0% +35.0 п.п.
Коррекция по выведенному намерению 32.5% 80.0% +47.5 п.п.

Почему это важно и ограничения

Исследование демонстрирует, что обучение на реальных ошибках с четкой локализацией причины (через LLM-судей, которые должны согласовать, какой именно шаг привел к жалобе) эффективнее простого фильтрации по результату. Особое внимание уделяется устранению hindsight bias (предвзятости задним числом): подсказки проверяются на соответствие информации, доступной модели до совершения ошибки.

Важно отметить, что веса обученной модели не опубликованы. Метод интегрирован исключительно как опция внутри Perplexity Computer. Базовая модель GLM 5.2, на которой проводились эксперименты, доступна открыто на Hugging Face, что позволяет исследователям воспроизвести базовые условия, хотя сам пайплайн Hint-Guided Self-Distillation остается проприетарным.

Источник: MarkTechPost ↗