Исследования3 августа 2026 г., 08:18 МСК🤖 Auto

TAPR: Как переписывание промптов через RL повышает точность LLM

Исследователи представили TAPR — систему на базе Phi-4-mini, которая использует обучение с подкреплением для автоматической оптимизации запросов, повышая точность ответов LLM.

Баннер новости 4928

Проблема «человеческого фактора» в промптах

Большие языковые модели (LLM) часто требуют тонкой настройки промптов для раскрытия своего потенциала. Однако создание эффективных запросов — барьер для неэкспертных пользователей. Авторы работы Oliver Savolainen, Emanuele Bastianelli и Hosein Azarbonyad предлагают решение: Task-Aware Prompt Rewriter (TAPR) — модель, которая переформулирует пользовательские запросы в оптимизированные под задачу инструкции.

Механика обучения: GRPO и LLM-as-a-Judge

В отличие от стандартного дообучения, TAPR обучается с использованием Group Relative Policy Optimization (GRPO). Ключевая инновация заключается в функции вознаграждения (reward): она формируется на основе оценки самой LLM (LLM-as-a-judge), которая анализирует как качество переписанного промпта, так и итоговый ответ на задачу. Это позволяет модели учиться на том, что реально улучшает результат, а не просто грамматическую структуру.

Результаты на бенчмарках

Базовой моделью для TAPR стала Phi-4-mini-instruct. Эксперименты показали, что переписанные промпты содержат более четкую и инструктивную лексику, что напрямую конвертируется в рост точности на стандартных наборах данных. Ниже приведены ключевые метрики эффективности подхода:

Метрика / Задача Описание результата
Базовая модель Phi-4-mini-instruct (использована как основа для TAPR)
Метод оптимизации GRPO (Group Relative Policy Optimization) с наградой от LLM-as-a-judge
Тестовые домены Ответы на вопросы (Natural Questions), суммаризация, арифметическое мышление (GSM8K)
Ключевое улучшение Стабильный прирост точности (accuracy) за счет более «инструктивного» языка промптов

Почему это важно

Работа демонстрирует сдвиг парадигмы: вместо того чтобы заставлять пользователя писать идеальный промпт, мы делегируем эту задачу специализированной модели. Использование открытых моделей (Phi-4-mini) и доступного кода делает технологию масштабируемой для внедрения в приложения, где важна стабильность ответов без участия человека в цикле формирования запроса.

Исходный код проекта доступен в репозитории авторов, что позволяет разработчикам протестировать методологию GRPO в своих пайплайнах.

Источник: arXiv cs.AI ↗