Автономный цикл Research RSI
Команда Qiushi Engine провела долгосрочную автономную исследовательскую программу, направленную на создание эффективных языковых моделей в условиях жесткого ограничения данных. Ключевая метрика — обучение на корпусе объемом всего 10 миллионов слов при 100 миллионах кумулятивных представлений (word presentations). Исследование разделено на три этапа, демонстрирующие принцип Research RSI (рекурсивное самосовершенствование процесса исследования).
Этап I: Построение базовой модели
На первом этапе использовались три метода для достижения передовых результатов (frontier): компактные перефразирования, реинвестирование вычислительного бюджета и остаточное инкрементное обучение. Это позволило создать базовую модель, способную эффективно использовать контекст при нехватке данных.
Этап II: Открытие принципов
Второй этап выявил критическую разницу между точным повторением текста и выровненным перефразированием. Оказалось, что модели по-разному используют контекст в зависимости от целевых отношений и окон предсказания. Главный вывод: восстановление знакомой производительности не гарантирует, что модель сможет применять изученные вычисления к новым входам. Это сформулировало проверяемый принцип: опыт должен организовываться вокруг контекстных зависимостей, необходимых для предсказания.
Этап III: Улучшение на основе принципов
На финальном этапе команда сохранила исходный текст, но замаскировала больше локальных подсказок, выбрала целевые объекты для обучения и сохранила предсказания для обычно маскируемых входов. Были использованы два продолжения (continuation seeds) от одного родителя.
Результаты и метрики
Модель из второго поколения превзошла обычные методы продолжения по совокупности из девяти метрик. Динамика улучшения Overall-счета выглядит следующим образом:
| Поколение / Статус | Overall Score | Примечание |
|---|---|---|
| Первое поколение (базовое) | 42.02 | Исходный уровень |
| Второе поколение (Research RSI) | 42.25 | Рекорд для snapshot от 8 сентября 2026 |
Результаты подтверждают, что даже при экстремальной нехватке данных (10 млн слов) структурированный подход к обучению позволяет достигать state-of-the-art показателей в категории Strict-Small. Код и записи исследования доступны в GitHub-репозитории, модели — на Hugging Face.
Источник: arXiv cs.CL ↗
