Проблема «утечки из будущего»
Большие языковые модели (LLM), обученные на неограниченных интернет-корпусах, неизбежно содержат информацию из будущего относительно даты их использования. Это создает lookahead bias (смещение взгляда в будущее), которое делает невозможным корректное бэктестирование в финансах и искажает причинно-следственные выводы в социальных науках. Традиционные решения — Point-in-Time (PiT) модели, обученные только на данных, доступных на конкретную дату, — часто уступают по качеству обычным моделям.
Решение через масштаб: 4B параметров и 1 трлн токенов
Авторы исследования (Bryan Kelly, Semyon Malamud, Johannes Schwab, Teng Andrea Xu) показали, что разрыв в производительности можно существенно сократить за счет масштабирования. Они обучили decoder-only трансформеры на корпусе FineWeb, где токены были строго отфильтрованы по хронологии. Ключевые параметры обучения:
- Архитектура: Decoder-only Transformer.
- Размер модели: до 4 миллиардов параметров.
- Объем данных: 1 триллион токенов, отфильтрованных по дате.
- Период: последовательность ежемесячных чекпоинтов с 2013 по 2024 год.
Сравнение с лидерами рынка
Полученные PiT-модели демонстрируют результаты, близкие к ведущим открытым моделям аналогичного размера, обученным на неограниченных данных. Ниже приведено сравнение эффективности подходов:
| Характеристика | Традиционная LLM (Unrestricted) | Point-in-Time LLM (Scaled) |
|---|---|---|
| Доступ к будущему | Да (Lookahead bias) | Нет (Строгая временная валидность) |
| Сравнимые аналоги | Gemma-3-4B, LLaMA-7B | Собственная модель 4B (PiT) |
| Качество (Common Sense) | Высокое | Близкое к высокому (разрыв сокращен) |
| Применимость в финансах | Низкая (риск утечки данных) | Высокая (корректные бэктесты) |
Улучшение через LoRA и открытость
Для повышения полезности моделей в конкретных задачах авторы применили инструктивное дообучение (instruction fine-tuning) с использованием LoRA. Это позволило улучшить downstream usability (удобство использования в прикладных задачах). Исследователи опубликовали полный пайплайн: от конструирования датасета до кода оценки, что позволяет другим ученым воспроизводить эксперименты и создавать модели с строгой временной валидностью.
Почему это важно
Это исследование меняет парадигму создания «чистых» моделей. Ранее считалось, что отказ от данных из будущего неизбежно ведет к потере интеллекта модели. Доказано, что при достаточном масштабе (1 трлн токенов) и правильном подходе можно получить модели, которые не только не содержат утечек, но и конкурируют с общими решениями, открывая путь к надежному AI в чувствительных к времени сферах.
Источник: arXiv cs.CL ↗
