Автоматизация фундаментального анализа через RAG
Команда исследователей Bartosz Ziółko и Kacper Dobrzeniewski представила систему, использующую Large Language Models (LLM) для ускорения фундаментального анализа. В отличие от простых чат-ботов, их решение работает в режиме Retrieval-Augmented Generation (RAG), что позволяет модели опираться на конкретные, верифицируемые источники данных, а не только на предобученные знания.
Система интегрируется с базой данных EDGAR (Комиссия по ценным бумагам и биржам США) для получения корпоративных отчетов, а также обрабатывает макроэкономические индикаторы, такие как ВВП и инфляция. Это позволяет формировать комплексную картину, учитывающую как внутренние факторы компании, так и внешнюю экономическую среду.Методология и масштаб эксперимента
Для тестирования системы был выбран пул из 9 компаний. Анализ проводился в течение 4 недель. Исследователи предварительно обрабатывали сырые данные, а затем отправляли их через API в модель gpt-4o. Ключевой особенностью подхода стало внедрение контекста, основанного на теории циклов Китчина (Kitchin cycles), что добавило аналитике экономическую глубину.
Результатом работы алгоритма стали автоматические инвестиционные брифы (briefs), которые оценивались группой из 9 индивидуальных инвесторов. Целью было измерение полезности такого подхода к анализу данных по сравнению с традиционными методами.
Почему это важно для инвесторов
Основная проблема фундаментального анализа — информационная перегрузка. Инвесторам приходится вручную читать сотни страниц отчетов 10-K и 10-Q, сопоставляя их с макроэкономическими новостями. Предложенная система решает эту проблему, агрегируя разрозненные данные в структурированные выводы.
Использование RAG-архитектуры критически важно в финансовой сфере, так как оно снижает риск «галлюцинаций» ИИ, заставляя модель цитировать конкретные разделы отчетов SEC. Это повышает доверие к автоматизированным рекомендациям со стороны розничных трейдеров.
Ключевые параметры исследования
| Параметр | Значение / Описание |
|---|---|
| Модель LLM | gpt-4o (через API) |
| Архитектура | RAG (Retrieval-Augmented Generation) |
| Источники данных | Отчеты SEC (EDGAR), макроэкономические данные (ВВП, инфляция) |
| Объекты анализа | 9 компаний |
| Длительность | 4 недели |
| Оценка | 9 индивидуальных инвесторов (польза для принятия решений) |
Источник: arXiv cs.CL ↗
