Исследования14 августа 2026 г., 02:17 МСК🤖 Auto

Qwen2.5-0.5B с рекуррентной глубиной: 7.6x быстрее и глубже

Исследователь Марк Шапиро показал, как дообучение Qwen2.5-0.5B с рекуррентной глубиной (recurrent depth) позволяет модели выполнять более сложные рассуждения в латентном пространстве быстрее базовых аналогов.

Баннер новости 5751

Суть эксперимента: от «поиска ответа» к «вычислению шага»

Исследователь Марк Шапиро (Mark Shapiro) представил метод Retrofitting Recurrent Depth (внедрение рекуррентной глубины). Вместо того чтобы модель просто запоминала ответы, она учится выполнять один шаг вычисления за каждый цикл (loop). Ключевая особенность — использование промежуточного контроля (intermediate-step supervision) при обучении, что позволяет модели сохранять этот навык даже при дообучении только на финальных ответах (outcome-only annealing).

Архитектура Qwen2.5-0.5B-Instruct была разделена на три части: Prelude, Recurrent Block (с общими весами) и Coda. Это позволило создать итеративный процесс, где модель «прокручивает» внутренние состояния для достижения результата.

Два бюджета параметров и результаты

Эксперимент проводился на двух уровнях затрат параметров:

  • 6M параметров: Обучение только адаптера при замороженных весах базовой модели.
  • 180M параметров: Полное дообучение блока (full-block).

Адаптер (6M) показал результаты, сопоставимые с полным блоком (83.8% против 84.0%), и смог провести модель через 11 циклов, после чего качество немного снизилось.

Сравнение с альтернативами: скорость и глубина

Главное открытие — рекуррентная модель превосходит не только по скорости, но и по способности к экстраполяции. Модель, обученная на scratchpad (черновике), могла повторить успех рекуррентной модели только в пределах изученной глубины, но «схлопывалась» при усложнении задачи. Рекуррентная же модель сохранила стабильность.

Метрика Рекуррентная модель (Retrofit) Scratchpad-модель (Baseline)
Общая точность 84% 72%
Точность на глубине >10 53% 2.5%
Скорость ответа 7.6x быстрее База
Экстраполяция (глубина 18) 70% точности Информация недостаточна

Лимиты и катастрофическая интерференция

Несмотря на успехи, метод имеет границы. При попытке научить модель обратному правилу (running the rule in reverse) исследователи столкнулись с границей катастрофической интерференции. Модель могла выучить обратное правило изолированно, но не смогла интегрировать его, сохранив при этом установленный механизм и общие способности. Выбор оптимальной глубины (depth selection) остается открытой задачей.

Почему это важно

Результаты показывают, что итеративные трансформеры могут выполнять более глубокое логическое мышление в латентном пространстве быстрее, чем более крупные модели, дообученные на тех же задачах. Это открывает путь к созданию эффективных систем reasoning без необходимости масштабирования параметров.

Источник: arXiv cs.CL ↗