Масштаб эксперимента: от Base до Hyperliquid
Команда исследователей (T.J. Barton и соавторы) проанализировала данные двух систем с единой архитектурой, работавших в реальных условиях с февраля по август 2026 года. Объем выборки впечатляет: 7.5 млн однократных вызовов моделей, около 300 тыс. ончейн-действий и 231 638 многошаговых сессий, приведших к 14 596 исполненным ордерам.
- DX Terminal Pro: 3 505 пользовательских счетов, торговля реальным ETH в мемкоин-рынках сети Base (21 день, февраль-март 2026).
- DXAP live alpha fleet: 500–599 созданных пользователями агентов, торговля перпетуальными фьючерсами Hyperliquid (91–117 активных одновременно, июнь-август 2026).
Найденные паттерны: интерфейс важнее промпта
Авторы выявили четыре ключевых вывода, опровергающих идею о том, что LLM-агенты могут автономно генерировать альфу. Поведение агентов определяется не текстом стратегии, а «операционным слоем» (интерфейсом и настройками).
| Параметр | Наблюдение / Метрика | Значение |
|---|---|---|
| Влияние настроек | Коэффициент риска объясняет волатильность | +0.425 на уровень |
| Индивидуальность агентов | Доля дисперсии, объясняемая фиксированными эффектами агента | 60% |
| Влияние лидерборда | Когнитивное смещение при выборе топ-3 | Рост в 1.75x (regression discontinuity) |
| Управление размером | Средняя кредитная плечо (медиана) | 5.0x (игнорирует волатильность) |
| Риск ликвидации | Доля позиций в одной ячейке настроек | 11% книги, но 62% всех ликвидаций |
| Упущенная выгода | Позиции с favorable excursion >300 bps | 43.2% позиций, но 49.3% закрыты в минус |
| Эффективность механики | Восстановление с помощью механического брекета | +39.0 bps на позицию |
Отсутствие рыночного edge
Ни одна из флотилий не показала направленного преимущества. Флот DXAP не только не прибылен, но и уступает ритейл-бенчмарку Hyperliquid: 41% против 50% победных сделок (roundtrip win rate). Сравнительный анализ «лиги» передовых моделей на 416 захваченных сценариях показал, что качество решений статистически неразличимо на данном горизонте, хотя стабильность выбора сильно варьируется между семействами моделей.
Почему это важно
Исследование ставит жирную точку в хайпе вокруг «автономных трейдеров на LLM». Оно доказывает, что без жесткого механического контроля (например, автоматических стоп-лоссов, восстанавливающих +39 bps) агенты не только не зарабатывают, но и несут системные риски из-за игнорирования волатильности. Методология, подтвержденная day-clustered inference и permutation nulls, требует пересмотра подходов к тестированию AI-агентов в финансах.
Источник: arXiv cs.AI ↗
