Исследования17 июля 2026 г., 09:17 МСК🤖 Auto

Гибридные модели: почему масштаб больше не гарантирует качество

Исследование из arXiv доказывает: для истинной способности к обучению моделям нужны не просто параметры, а специфическая архитектура с двумя каналами доступа к данным.

Баннер новости 3792

Конец эры «больше = лучше»?

Традиционная гипотеза платонического представления (PRH) утверждала, что при масштабировании моделей их внутренние представления реальности сходятся. Авторы нового исследования предлагают новую границу — Гипотезу сходимости способностей (CCH). Они доказывают, что при фиксированном бюджете вычислений на токен сходимость представлений не гарантирует сходимость способностей. Истинная «способность» (capability) достигается только в классе так называемых гибридных последовательных моделей, обладающих двумя ключевыми каналами: сжимающим каналом состояния O(1) и масштабируемым каналом верbatim-индекса.

Три «стены», которые ломают стандартные архитектуры

Исследователи выделяют три фундаментальных ограничения, с которыми не справляются обычные трансформеры или RNN, если они не являются гибридными:

  • Стена Шеннона (Shannon wall): блокирует любую архитектуру с состоянием сложности $o(N^b)$, не позволяя эффективно сжимать информацию.
  • Стена горизонта (Horizon wall): делает невозможным работу с бесконечными потоками данных для архитектур с фиксированным окном внимания.
  • Схемная стена (Circuit wall): при условии $TC0 \neq NC1$, блокирует составление только на основе внимания фиксированной глубины.

Гибридная архитектура преодолевает все три стены, платя за каждую свою цену, что делает её способность строго супераддитивной (сумма частей больше целого).

Результаты пре-регистрационных тестов

Авторы провели первые пре-регистрационные эксперименты на малых масштабах, заморозив критерии до начала сбора данных. Результаты подтверждают теорию: добавление всего одного слоя глобального внимания к модели с 64 скалярными состояниями кардинально меняет метрики. Сравнение ошибок точного поиска (exact-retrieval error) выглядит так:

Архитектура Ошибка поиска (Error) Комментарий
Только 64-скалярное состояние 0.994 Практически случайный выбор
64-скалярное состояние + 1 слой глобального внимания 0.000 Идеальное извлечение

Всего в тестировании участвовало 19 предсказаний: 11 подтверждено полностью, 7 — частично, и 1 предсказание оказалось ошибочным (результат пошел в обратную сторону, что авторы честно фиксируют). Это подчеркивает научную добросовестность работы: способность конвергирует не сама по себе, а «покупается» правильной структурой доступа.

Источник: arXiv cs.AI ↗