Исследования12 сентября 2026 г., 04:17 МСК🤖 Auto

Qiushi Engine: Автономный AI улучшил себя на 0.23 балла в BabyLM 2026

Лаборатория Qiushi Engine представила результаты автономного исследования (Research RSI), где модель обучалась на 10 млн слов и достигла рекорда в соревновании BabyLM 2026 Strict-Small.

Баннер новости 7322

Автономный цикл Research RSI

Команда Qiushi Engine провела долгосрочную автономную исследовательскую программу, направленную на создание эффективных языковых моделей в условиях жесткого ограничения данных. Ключевая метрика — обучение на корпусе объемом всего 10 миллионов слов при 100 миллионах кумулятивных представлений (word presentations). Исследование разделено на три этапа, демонстрирующие принцип Research RSI (рекурсивное самосовершенствование процесса исследования).

Этап I: Построение базовой модели

На первом этапе использовались три метода для достижения передовых результатов (frontier): компактные перефразирования, реинвестирование вычислительного бюджета и остаточное инкрементное обучение. Это позволило создать базовую модель, способную эффективно использовать контекст при нехватке данных.

Этап II: Открытие принципов

Второй этап выявил критическую разницу между точным повторением текста и выровненным перефразированием. Оказалось, что модели по-разному используют контекст в зависимости от целевых отношений и окон предсказания. Главный вывод: восстановление знакомой производительности не гарантирует, что модель сможет применять изученные вычисления к новым входам. Это сформулировало проверяемый принцип: опыт должен организовываться вокруг контекстных зависимостей, необходимых для предсказания.

Этап III: Улучшение на основе принципов

На финальном этапе команда сохранила исходный текст, но замаскировала больше локальных подсказок, выбрала целевые объекты для обучения и сохранила предсказания для обычно маскируемых входов. Были использованы два продолжения (continuation seeds) от одного родителя.

Результаты и метрики

Модель из второго поколения превзошла обычные методы продолжения по совокупности из девяти метрик. Динамика улучшения Overall-счета выглядит следующим образом:

Поколение / Статус Overall Score Примечание
Первое поколение (базовое) 42.02 Исходный уровень
Второе поколение (Research RSI) 42.25 Рекорд для snapshot от 8 сентября 2026

Результаты подтверждают, что даже при экстремальной нехватке данных (10 млн слов) структурированный подход к обучению позволяет достигать state-of-the-art показателей в категории Strict-Small. Код и записи исследования доступны в GitHub-репозитории, модели — на Hugging Face.

Источник: arXiv cs.CL ↗