Исследования2 октября 2026 г., 08:21 МСК🤖 Auto

Профессия не спасает: почему детальные промпты снижают точность AI

Исследование Timothy Kassis показало, что использование детализированных системных промптов для научных агентов не повышает точность ответов, но увеличивает затраты на токены в 2-4 раза и снижает надежность при работе с инструментами.

Баннер новости 8756

Суть эксперимента: «Эксперт» против «Помощника»

Автор исследования Timothy Kassis протестировал гипотезу о том, что детальное описание роли (системный промпт) улучшает работу моделей в научных задачах. В качестве базы данных использовался открытый корпус Scientific Agents, содержащий 503 профиля специалистов разных профессий. Тестирование проводилось на модели Gemini 3.8 Flash через API OpenRouter в среде Pi agent harness.

Было проведено сравнение детализированных профилей с четырьмя контрольными группами: минимальным базовым промптом («You are a helpful assistant»), только первой фразой роли, общим руководством по научной строгости и профилем из unrelated domain (не связанной области). Всего было обработано 4 531 вопрос из девяти текстовых научных бенчмарков.

Ключевые метрики: Точность и Стоимость

Результаты оказались парадоксальными для индустрии, привыкшей к «ролевым» промптам. Детализированные профили не дали статистически значимого прироста точности, а в некоторых случаях даже ухудшили показатели из-за ограничений по времени и токенам.

Метрика Детальный профиль Базовый промпт Разница / Эффект
Точность (текстовые задачи) — — Разница -0.6% (в пользу базового, но в пределах погрешности)
Затраты на токены Высокие Низкие Профиль требует в 1.5–2.3 раза больше выходных токенов
Стоимость ответа Высокая Низкая Дороже в 2.2–4.5 раза за успешный вызов
Решение задач BioMysteryBench (с инструментами) 46.7% 56.7% Профиль проигрывает на 10 п.п. из-за частых стопов по лимитам

Почему детальные промпты мешают?

Основная проблема длинных системных инструкций в контексте работы с внешними инструментами (tools-using) — это потребление контекстного окна. В задаче BioMysteryBench (биоинформатика), где модель должна была использовать инструменты, профильный промпт приводил к преждевременному завершению сессии из-за превышения лимитов токенов или времени. Базовый промпт, будучи короче, оставлял больше места для полезной работы модели.

Единственное преимущество: Устойчивость к сбоям API

Исследование выявило один неожиданный операционный плюс длинных промптов. На датасете SuperGPQA при частых сбоях API провайдеров, профильные промпты показали лучшую надежность первого прохода: 71.6% правильных ответов против 54.0% у базового варианта. Однако автор отмечает, что это преимущество, вероятно, связано не с «экспертностью» профиля, а с общей длиной и форматированием текста, которые могут влиять на стабильность генерации.

Вывод для разработчиков

Загрузка полных профессиональных профилей по умолчанию не оправдана с точки зрения ROI (возврата инвестиций). Это приводит к росту затрат без улучшения качества. Исследование предполагает, что будущее за селективной выборкой (retrieval) только нужных секций профиля или использованием открытых научных задач, где роль может играть более существенную роль.

Источник: arXiv cs.AI ↗