Суть эксперимента: «Эксперт» против «Помощника»
Автор исследования Timothy Kassis протестировал гипотезу о том, что детальное описание роли (системный промпт) улучшает работу моделей в научных задачах. В качестве базы данных использовался открытый корпус Scientific Agents, содержащий 503 профиля специалистов разных профессий. Тестирование проводилось на модели Gemini 3.8 Flash через API OpenRouter в среде Pi agent harness.
Было проведено сравнение детализированных профилей с четырьмя контрольными группами: минимальным базовым промптом («You are a helpful assistant»), только первой фразой роли, общим руководством по научной строгости и профилем из unrelated domain (не связанной области). Всего было обработано 4 531 вопрос из девяти текстовых научных бенчмарков.
Ключевые метрики: Точность и Стоимость
Результаты оказались парадоксальными для индустрии, привыкшей к «ролевым» промптам. Детализированные профили не дали статистически значимого прироста точности, а в некоторых случаях даже ухудшили показатели из-за ограничений по времени и токенам.
| Метрика | Детальный профиль | Базовый промпт | Разница / Эффект |
|---|---|---|---|
| Точность (текстовые задачи) | — | — | Разница -0.6% (в пользу базового, но в пределах погрешности) |
| Затраты на токены | Высокие | Низкие | Профиль требует в 1.5–2.3 раза больше выходных токенов |
| Стоимость ответа | Высокая | Низкая | Дороже в 2.2–4.5 раза за успешный вызов |
| Решение задач BioMysteryBench (с инструментами) | 46.7% | 56.7% | Профиль проигрывает на 10 п.п. из-за частых стопов по лимитам |
Почему детальные промпты мешают?
Основная проблема длинных системных инструкций в контексте работы с внешними инструментами (tools-using) — это потребление контекстного окна. В задаче BioMysteryBench (биоинформатика), где модель должна была использовать инструменты, профильный промпт приводил к преждевременному завершению сессии из-за превышения лимитов токенов или времени. Базовый промпт, будучи короче, оставлял больше места для полезной работы модели.
Единственное преимущество: Устойчивость к сбоям API
Исследование выявило один неожиданный операционный плюс длинных промптов. На датасете SuperGPQA при частых сбоях API провайдеров, профильные промпты показали лучшую надежность первого прохода: 71.6% правильных ответов против 54.0% у базового варианта. Однако автор отмечает, что это преимущество, вероятно, связано не с «экспертностью» профиля, а с общей длиной и форматированием текста, которые могут влиять на стабильность генерации.
Вывод для разработчиков
Загрузка полных профессиональных профилей по умолчанию не оправдана с точки зрения ROI (возврата инвестиций). Это приводит к росту затрат без улучшения качества. Исследование предполагает, что будущее за селективной выборкой (retrieval) только нужных секций профиля или использованием открытых научных задач, где роль может играть более существенную роль.
Источник: arXiv cs.AI ↗
