Проблема насыщения бенчмарков
Оценка больших языковых моделей (LLM) становится всё сложнее: публичные тестовые наборы загрязняются, а сложные задачи требуют дорогой инфраструктуры для проверки. В контексте автоматической оптимизации промптов (APO), где оценка повторяется сотни раз в процессе поиска лучшей инструкции, критически важен детерминированный, дешевый и бесконечно возобновляемый источник задач.
Команда исследователей во главе с Тимотеем Лесортом (Timothée Lesort) из DeepMind и других лабораторий предложила решение: использовать шахматные головоломки с платформы Lichess. Это позволяет оценивать не только способность модели решать изолированные задачи, но и переносить навыки в реальные игровые сессии (rollouts).
Масштаб и стоимость исследования
Бенчмарк включает 1 118 уникальных шахматных позиций. Ключевое преимущество подхода — экономическая эффективность. Полное исследование, включающее оптимизацию промптов для нескольких моделей, обошлось всего в $800. Это делает метод доступным для широкого круга разработчиков и позволяет регулярно обновлять датасет, снижая риск contamination (загрязнения данных).
Результаты: как модели реагируют на оптимизацию
Исследователи протестировали шесть алгоритмов APO на восьми различных моделях. В качестве «мета-модели» для генерации и оценки промптов использовался Gemini 3.5 Flash. Несмотря на мощь, эта модель самостоятельно решает лишь около 55% головоломок, что оставляет значительный простор для улучшения через оптимизацию промптов.
Ключевые выводы показали, что оптимизация промптов работает неодинаково для всех архитектур. Ниже приведена сводка эффективности различных подходов к оптимизации:
| Метод оптимизации | Эффект на производительность | Примечание |
|---|---|---|
| Базовая настройка (Baseline) | Низкая/Средняя | Стандартные системные промпты без тонкой настройки |
| Автоматическая оптимизация (APO) | Значительный рост | Алгоритмы автоматически находят лучшие формулировки |
| Перенос промптов (Transfer) | Переменный | Промпты, найденные для одной модели, не всегда работают для другой |
| Регрессия | Снижение качества | Некоторые методы оптимизации ухудшили результаты на конкретных моделях |
Почему это важно для индустрии
Результаты демонстрируют, что «жесткость» модели (frozen LLMs) не означает невозможность улучшения её работы. Правильно подобранный промпт может существенно повысить точность решений, особенно в логических и стратегических задачах. Кроме того, связь между решением головоломок и качеством игры в реальных партиях подтверждает, что оптимизация промптов влияет не только на тестовые баллы, но и на практическую применимость моделей.
Авторы опубликовали код для оптимизации, оценки и скрипты для обновления датасета, открывая путь для дальнейших исследований в области эффективного использования LLM без дообучения весов.
Источник: arXiv cs.AI ↗
