Исследования3 октября 2026 г., 02:17 МСК🤖 Auto

Шахматы как тест: как оптимизация промптов меняет LLM

Исследователи представили новый бенчмарк для оценки автоматической оптимизации промптов (APO) на базе 1118 шахматных задач. Проект доказывает, что даже мощные модели выигрывают от тонкой настройки инструкций, а стоимость полного теста составила всего

Баннер новости 8825

Проблема насыщения бенчмарков

Оценка больших языковых моделей (LLM) становится всё сложнее: публичные тестовые наборы загрязняются, а сложные задачи требуют дорогой инфраструктуры для проверки. В контексте автоматической оптимизации промптов (APO), где оценка повторяется сотни раз в процессе поиска лучшей инструкции, критически важен детерминированный, дешевый и бесконечно возобновляемый источник задач.

Команда исследователей во главе с Тимотеем Лесортом (Timothée Lesort) из DeepMind и других лабораторий предложила решение: использовать шахматные головоломки с платформы Lichess. Это позволяет оценивать не только способность модели решать изолированные задачи, но и переносить навыки в реальные игровые сессии (rollouts).

Масштаб и стоимость исследования

Бенчмарк включает 1 118 уникальных шахматных позиций. Ключевое преимущество подхода — экономическая эффективность. Полное исследование, включающее оптимизацию промптов для нескольких моделей, обошлось всего в $800. Это делает метод доступным для широкого круга разработчиков и позволяет регулярно обновлять датасет, снижая риск contamination (загрязнения данных).

Результаты: как модели реагируют на оптимизацию

Исследователи протестировали шесть алгоритмов APO на восьми различных моделях. В качестве «мета-модели» для генерации и оценки промптов использовался Gemini 3.5 Flash. Несмотря на мощь, эта модель самостоятельно решает лишь около 55% головоломок, что оставляет значительный простор для улучшения через оптимизацию промптов.

Ключевые выводы показали, что оптимизация промптов работает неодинаково для всех архитектур. Ниже приведена сводка эффективности различных подходов к оптимизации:

Метод оптимизации Эффект на производительность Примечание
Базовая настройка (Baseline) Низкая/Средняя Стандартные системные промпты без тонкой настройки
Автоматическая оптимизация (APO) Значительный рост Алгоритмы автоматически находят лучшие формулировки
Перенос промптов (Transfer) Переменный Промпты, найденные для одной модели, не всегда работают для другой
Регрессия Снижение качества Некоторые методы оптимизации ухудшили результаты на конкретных моделях

Почему это важно для индустрии

Результаты демонстрируют, что «жесткость» модели (frozen LLMs) не означает невозможность улучшения её работы. Правильно подобранный промпт может существенно повысить точность решений, особенно в логических и стратегических задачах. Кроме того, связь между решением головоломок и качеством игры в реальных партиях подтверждает, что оптимизация промптов влияет не только на тестовые баллы, но и на практическую применимость моделей.

Авторы опубликовали код для оптимизации, оценки и скрипты для обновления датасета, открывая путь для дальнейших исследований в области эффективного использования LLM без дообучения весов.

Источник: arXiv cs.AI ↗