Исследования2 октября 2026 г., 05:17 МСК🤖 Auto

NinaXander: Сращивание RWKV и Transformer через единое латентное пространство

Исследователи представили NinaXander — метод соединения замороженных LLM разных архитектур (RWKV и Transformer) с помощью одного адаптера. Это снижает затраты на KV-кэш на 84,4%, но не всегда сохраняет точность.

Баннер новости 8745

Суть метода: «Швейцарский нож» для LLM

Команда исследователей во главе с Таканори Котамой (Takanori Kotama) предложила архитектуру NinaXander. Её ключевая идея — возможность постфактум (post hoc) комбинировать слои замороженных языковых моделей из разных семейств. Вместо того чтобы обучать новую модель с нуля, система берет первые слои одной модели, пропускает их через обученный shared-latent adapter (адаптер общего латентного пространства) и передает данные в оставшиеся слои другой модели.

Это позволяет создавать множество композиционных моделей без повторного обучения базовых компонентов. Если адаптер уже обучен, можно экспериментировать с точками соединения слоев, экономя вычислительные ресурсы.

Эксперимент: RWKV-4-Raven-7B и Tulu-Pythia-6.9B

Для проверки гипотезы исследователи выбрали два архитектурно разных представителя: RWKV (рекуррентная архитектура, RWKV-4-Raven-7B) и Transformer (Tulu-Pythia-6.9B). Целью было выяснить, можно ли эффективно переносить промежуточные представления между этими семействами.

Ключевые метрики и результаты

Результаты показали смешанный успех. С одной стороны, удалось значительно оптимизировать использование памяти, с другой — качество генерации и понимания упало в некоторых сценариях.

Метрика / Конфигурация Результат Комментарий
Оптимизация KV-кэша -84,4% Конфигурация: 5 слоев Pythia + 27 слоев RWKV. Снижение нагрузки на память по сравнению с чистым Transformer.
Точность (Multiple-Choice) Ниже, чем у Pythia Ни одна композиционная модель не превзошла или не сравнялась с базовой моделью Pythia в тестах на выбор ответа.
Language Modeling (WikiText) Резкое падение Производительность упала на корпусе статей Wikipedia, выходящем за пределы области обучения.
Синтаксис текста Хороший Сгенерированный текст оставался грамматически корректным, что подтверждает работоспособность адаптера.

Почему это важно и каковы ограничения

Главный вывод исследования: общее латентное пространство не гарантирует общей семантики. Исследователи обнаружили соответствие промежуточных представлений только в благоприятном случае (при использовании общего токенизатора, одинаковой глубины и ширины скрытых слоев). Это опровергает идею о том, что разные архитектуры автоматически «понимают» друг друга.

Тем не менее, NinaXander демонстрирует жизнеспособность подхода для специфических задач, где критична экономия памяти (за счет снижения KV-кэша), а не абсолютная точность. Это открывает путь к созданию гибридных систем, где сильные стороны рекуррентных и трансформерных архитектур используются совместно, albeit с компромиссами в качестве.

Источник: arXiv cs.CL ↗