Проблема статических бенчмарков
Оценка способностей больших языковых моделей (LLM) в алгоритмической торговле сталкивается с двумя серьезными препятствиями: риск утечки данных (data contamination) в статических наборах тестов и необходимость выполнения кода для получения верифицируемых результатов. Авторы работы, представленной на FinLLM Workshop при IJCAI 2026, предлагают решение — Backtrader-Bench.
Фреймворк использует два дополняющих друг друга конвейера. Первый — детерминированный генератор вопросов с множественным выбором (MCQ), основанный на 5 торговых стратегиях, 33 шаблонах и трех уровнях сложности. Второй — конвейер фильтрации «генератор-решатель», который автоматически извлекает более сложные вопросы, отбрасывая те, которые могут быть решены моделью без выполнения кода.
Результаты тестирования: разрыв между моделями
Исследователи протестировали 11 моделей без доступа к внешним инструментам (10 запусков каждая) и четыре конфигурации с инструментами (with-tools) на курируемом наборе из 30 вопросов. Ключевое открытие заключается в колоссальной разнице в производительности:
| Конфигурация | Точность (Accuracy) | Примечание |
|---|---|---|
| GPT-5.5 (с инструментами) | 90.0% | Лучший результат, 1 проход |
| Opus 4.7 (с инструментами) | 90.0% | Лучший результат, 1 проход |
| Лучшие модели без инструментов | 73.0% | Среднее значение по 10 запускам |
| Базовый уровень (случайный) | 25.0% | Для сложных вопросов без инструментов |
Использование инструментов (доступ к коду и исполняемой среде) увеличило точность лучших моделей на 17 процентных пунктов по сравнению с лучшими результатами моделей без инструментов. На более сложном наборе из 38 дополнительно добытых вопросов точность моделей без инструментов упала до уровня случайного угадывания (25%) для половины протестированных моделей.
Значение для индустрии
Помимо оценки, масштабируемая инфраструктура MCQ предназначена для создания корпуса данных для обучения с подкреплением (Reinforcement Learning). Конечная цель — создание специализированных агентов для количественной торговли, способных самостоятельно писать, тестировать и оптимизировать торговые стратегии, минимизируя человеческое вмешательство.
Источник: arXiv cs.CL ↗
