Проблема «человеческого фактора» в промптах
Большие языковые модели (LLM) часто требуют тонкой настройки промптов для раскрытия своего потенциала. Однако создание эффективных запросов — барьер для неэкспертных пользователей. Авторы работы Oliver Savolainen, Emanuele Bastianelli и Hosein Azarbonyad предлагают решение: Task-Aware Prompt Rewriter (TAPR) — модель, которая переформулирует пользовательские запросы в оптимизированные под задачу инструкции.
Механика обучения: GRPO и LLM-as-a-Judge
В отличие от стандартного дообучения, TAPR обучается с использованием Group Relative Policy Optimization (GRPO). Ключевая инновация заключается в функции вознаграждения (reward): она формируется на основе оценки самой LLM (LLM-as-a-judge), которая анализирует как качество переписанного промпта, так и итоговый ответ на задачу. Это позволяет модели учиться на том, что реально улучшает результат, а не просто грамматическую структуру.
Результаты на бенчмарках
Базовой моделью для TAPR стала Phi-4-mini-instruct. Эксперименты показали, что переписанные промпты содержат более четкую и инструктивную лексику, что напрямую конвертируется в рост точности на стандартных наборах данных. Ниже приведены ключевые метрики эффективности подхода:
| Метрика / Задача | Описание результата |
|---|---|
| Базовая модель | Phi-4-mini-instruct (использована как основа для TAPR) |
| Метод оптимизации | GRPO (Group Relative Policy Optimization) с наградой от LLM-as-a-judge |
| Тестовые домены | Ответы на вопросы (Natural Questions), суммаризация, арифметическое мышление (GSM8K) |
| Ключевое улучшение | Стабильный прирост точности (accuracy) за счет более «инструктивного» языка промптов |
Почему это важно
Работа демонстрирует сдвиг парадигмы: вместо того чтобы заставлять пользователя писать идеальный промпт, мы делегируем эту задачу специализированной модели. Использование открытых моделей (Phi-4-mini) и доступного кода делает технологию масштабируемой для внедрения в приложения, где важна стабильность ответов без участия человека в цикле формирования запроса.
Исходный код проекта доступен в репозитории авторов, что позволяет разработчикам протестировать методологию GRPO в своих пайплайнах.
Источник: arXiv cs.AI ↗
