Суть метода: «Швейцарский нож» для LLM
Команда исследователей во главе с Таканори Котамой (Takanori Kotama) предложила архитектуру NinaXander. Её ключевая идея — возможность постфактум (post hoc) комбинировать слои замороженных языковых моделей из разных семейств. Вместо того чтобы обучать новую модель с нуля, система берет первые слои одной модели, пропускает их через обученный shared-latent adapter (адаптер общего латентного пространства) и передает данные в оставшиеся слои другой модели.
Это позволяет создавать множество композиционных моделей без повторного обучения базовых компонентов. Если адаптер уже обучен, можно экспериментировать с точками соединения слоев, экономя вычислительные ресурсы.
Эксперимент: RWKV-4-Raven-7B и Tulu-Pythia-6.9B
Для проверки гипотезы исследователи выбрали два архитектурно разных представителя: RWKV (рекуррентная архитектура, RWKV-4-Raven-7B) и Transformer (Tulu-Pythia-6.9B). Целью было выяснить, можно ли эффективно переносить промежуточные представления между этими семействами.
Ключевые метрики и результаты
Результаты показали смешанный успех. С одной стороны, удалось значительно оптимизировать использование памяти, с другой — качество генерации и понимания упало в некоторых сценариях.
| Метрика / Конфигурация | Результат | Комментарий |
|---|---|---|
| Оптимизация KV-кэша | -84,4% | Конфигурация: 5 слоев Pythia + 27 слоев RWKV. Снижение нагрузки на память по сравнению с чистым Transformer. |
| Точность (Multiple-Choice) | Ниже, чем у Pythia | Ни одна композиционная модель не превзошла или не сравнялась с базовой моделью Pythia в тестах на выбор ответа. |
| Language Modeling (WikiText) | Резкое падение | Производительность упала на корпусе статей Wikipedia, выходящем за пределы области обучения. |
| Синтаксис текста | Хороший | Сгенерированный текст оставался грамматически корректным, что подтверждает работоспособность адаптера. |
Почему это важно и каковы ограничения
Главный вывод исследования: общее латентное пространство не гарантирует общей семантики. Исследователи обнаружили соответствие промежуточных представлений только в благоприятном случае (при использовании общего токенизатора, одинаковой глубины и ширины скрытых слоев). Это опровергает идею о том, что разные архитектуры автоматически «понимают» друг друга.
Тем не менее, NinaXander демонстрирует жизнеспособность подхода для специфических задач, где критична экономия памяти (за счет снижения KV-кэша), а не абсолютная точность. Это открывает путь к созданию гибридных систем, где сильные стороны рекуррентных и трансформерных архитектур используются совместно, albeit с компромиссами в качестве.
Источник: arXiv cs.CL ↗
