Исследования14 августа 2026 г., 01:18 МСК🤖 Auto

Backtrader-Bench: LLM-агенты с инструментами достигли 90% точности в трейдинге

Исследователи представили Backtrader-Bench — новый бенчмарк для оценки LLM-агентов в алгоритмической торговле. Использование инструментов (tools) позволило моделям GPT-5.5 и Opus 4.7 достичь 90% точности, в то время как модели без инструментов провал

Баннер новости 5750

Проблема статических бенчмарков

Оценка способностей больших языковых моделей (LLM) в алгоритмической торговле сталкивается с двумя серьезными препятствиями: риск утечки данных (data contamination) в статических наборах тестов и необходимость выполнения кода для получения верифицируемых результатов. Авторы работы, представленной на FinLLM Workshop при IJCAI 2026, предлагают решение — Backtrader-Bench.

Фреймворк использует два дополняющих друг друга конвейера. Первый — детерминированный генератор вопросов с множественным выбором (MCQ), основанный на 5 торговых стратегиях, 33 шаблонах и трех уровнях сложности. Второй — конвейер фильтрации «генератор-решатель», который автоматически извлекает более сложные вопросы, отбрасывая те, которые могут быть решены моделью без выполнения кода.

Результаты тестирования: разрыв между моделями

Исследователи протестировали 11 моделей без доступа к внешним инструментам (10 запусков каждая) и четыре конфигурации с инструментами (with-tools) на курируемом наборе из 30 вопросов. Ключевое открытие заключается в колоссальной разнице в производительности:

Конфигурация Точность (Accuracy) Примечание
GPT-5.5 (с инструментами) 90.0% Лучший результат, 1 проход
Opus 4.7 (с инструментами) 90.0% Лучший результат, 1 проход
Лучшие модели без инструментов 73.0% Среднее значение по 10 запускам
Базовый уровень (случайный) 25.0% Для сложных вопросов без инструментов

Использование инструментов (доступ к коду и исполняемой среде) увеличило точность лучших моделей на 17 процентных пунктов по сравнению с лучшими результатами моделей без инструментов. На более сложном наборе из 38 дополнительно добытых вопросов точность моделей без инструментов упала до уровня случайного угадывания (25%) для половины протестированных моделей.

Значение для индустрии

Помимо оценки, масштабируемая инфраструктура MCQ предназначена для создания корпуса данных для обучения с подкреплением (Reinforcement Learning). Конечная цель — создание специализированных агентов для количественной торговли, способных самостоятельно писать, тестировать и оптимизировать торговые стратегии, минимизируя человеческое вмешательство.

Источник: arXiv cs.CL ↗