Современные большие языковые модели (LLM) достигли невероятных размеров, но эта мощь имеет свою цену: вычислительные ресурсы, задержки при инференсе и потребление памяти. Один из самых простых и эффективных способов сделать модель быстрее — это удалить целые блоки трансформера. Этот метод, известный как глубинный прунинг (depth pruning) или удаление блоков, позволяет предсказуемо ускорить работу модели и сэкономить память. Более того, он отлично комбинируется с другими техниками сжатия, такими как квантование, низкоранговое сжатие и дистилляция знаний.
Однако главная сложность заключается не в самом факте удаления, а в выборе того, какие именно блоки вырезать. Если удалить неправильные блоки, модель может полностью потерять способность к рассуждению. Проблема усугубляется тем, что влияние удаления одного блока зависит от того, какие другие блоки были удалены ранее. Это создает сложную сеть взаимодействий, превращая задачу выбора в комбинаторную проблему, а не просто в задачу ранжирования. Именно здесь на помощь приходит физика: комбинаторные задачи с бинарными переменными, имеющими взаимодействия, являются классическим предметом изучения систем спинов.
В этой статье мы подробно разберем новый подход от команды Multiverse Computing, который переосмысливает прунинг LLM через призму физики конденсированного состояния. Мы покажем, как формулировка задачи как оптимизации с ограничениями (Constrained Binary Optimization, CBO) и ее отображение на модель Изинга позволяют находить оптимальные конфигурации сжатия, превосходящие существующие методы на десятки процентов.

01Почему выбор блоков — это задача многих тел
Большинство существующих методов прунинга блоков действуют по принципу «среднего поля» (mean-field). Они оценивают важность каждого блока изолированно, используя такие эвристики, как величина градиентов, чувствительность или так называемое «влияние блока». Затем удаляются блоки с наименьшим показателем важности. В физическом смысле это аналогично замене взаимодействия спина со всеми его соседями одним усредненным полем. Другой распространенный подход — удаление только одного непрерывного сегмента блоков, что упрощает задачу, но отбрасывает большую часть пространства поиска.
Проблема этих подходов в том, что блоки трансформера не являются независимыми. То, насколько вредным будет удаление блока №20, напрямую зависит от того, удален ли блок №19 или блок №24. Это взаимодействие, или связь (coupling), между решениями игнорируется в методах среднего поля. По мере того как модели становятся глубже и гетерогеннее, игнорирование этих связей приводит к значительной потере качества, особенно когда требуется удалить много блоков одновременно.
Истинная задача заключается в поиске комбинаций блоков с учетом их взаимного влияния. Однако количество таких комбинаций растет экспоненциально, что делает полный перебор невозможным для современных моделей. Это именно тот режим, где инструменты статистической физики доказывают свою эффективность: пространства конфигураций огромны, но имеют четкую структуру парных взаимодействий.
02Идея: сведение выбора блоков к задаче минимизации энергии
Авторы исследования предлагают радикально новый взгляд. Каждый блок трансформера получает бинарную переменную: 0 означает, что блок сохраняется, 1 — что он удаляется. Это прямо аналогично спину, который может быть направлен вверх или вниз. Затем выполняется разложение Тейлора второго порядка функции потерь модели относительно этих переменных. В результате получается приблизительная матрица Гессе (Hessian matrix).
Диагональные элементы этой матрицы показывают, насколько важен каждый блок сам по себе. Однако ключевую роль играют внедиагональные элементы — они представляют собой именно те парные связи (couplings) между блоками, которые игнорируются методами среднего поля. Эти связи описывают «многотельную физику» системы.
Таким образом, вопрос «какие блоки удалить?» трансформируется в чистую задачу оптимизации: найти набор блоков, удаление которых минимизирует энергию системы $x^T H x$, при условии, что удалено ровно $S$ из $N$ блоков. Математически это задача оптимизации с ограничениями (CBO). Физически это отображение на «стекло Изинга» (Ising glass) — неупорядоченную спиновую систему со всеми со всеми взаимодействиями и фиксированным числом «вверх» направленных спинов (удаленных блоков).
Ключевое свойство, установленное авторами, заключается в том, что энергия этой спиновой системы является сильным прокси-показателем качества модели на бенчмарках. Низкоэнергетические состояния спиновой системы соответствуют высокопроизводительным сжатым моделям. Минимизация энергии и максимизация балла по бенчмаркам становятся одной и той же задачей поиска.

03Практичность подхода: скорость вычислений
Почему этот подход работает на практике? Ответ — стоимость вычислений. Матрица Гессе, то есть полный набор связей, вычисляется всего один раз с помощью прямых и обратных проходов на небольшом калибровочном наборе данных. После этого оценка любой кандидатуры конфигурации требует лишь одного дешевого расчета энергии. Нет необходимости запускать саму модель, не говоря уже о полном бенчмаркинге.
Более того, поскольку связи не зависят от целевого уровня сжатия, одна и та же матрица Гессе может быть использована для решения задач с разными значениями $S$ (количеством удаляемых блоков). Это делает метод невероятно гибким: вы можете быстро исследовать, как будет вести себя модель при 10%, 20% или 50% сжатии, не пересчитывая градиенты каждый раз.
04Решение: от точных методов к квантовым и квантово-вдохновленным солверам
Для большинства моделей пространство конфигураций велико, но все еще поддается проверке. Поскольку расчет одной энергии очень дешев, авторы используют полный перебор на одном GPU. Например, проверка десятков миллиардов конфигураций занимает от нескольких секунд до двух дней в самых сложных тривиальных случаях (например, удаление 8 из 80 блоков Llama-3.3-70B, что составляет около 29 миллиардов комбинаций).
Однако за пределами этого точного подхода вступает в силу второе преимущество формулировки через стекло Изинга. В эквивалентной форме QUBO (Quadratic Unconstrained Binary Optimization), где ограничение поглощено штрафным членом, ту же самую задачу можно передать высокооптимизированным классическим, квантовым и квантово-вдохновленным солверам. Это включает в себя машины квантового отжига, алгоритм QAOA, табличный поиск (tabu search) и специализированные методы ветвления и оценки.
Исследователи обнаружили, что открытый исходный код табличного солвера (tabu solver) надежно находит состояния с наименьшей энергией за секунды, даже в самых сложных случаях, которые можно проверить против полного перебора. Таким образом, метод масштабируется на модели, где перечисление конфигураций невозможно, используя солверы, которые находятся в сфере компетенции Multiverse Computing.

05Почему важен весь спектр низкоэнергетических состояний
Энергия является сильным прокси для качества, но не идеальным. Поэтому единственное состояние с наименьшей энергией не всегда дает лучшую модель. Это оказывается не багом, а фичей. Как только гамильтониан настроен, чтение основного состояния и низлежащих возбужденных состояний (excited states) практически бесплатно. Это дает спектр высококачественных кандидатов на прунинг, а не один хрупкий ответ.
Исследование возбужденных состояний, а не только основного состояния, является активной областью исследований в физике и идеально映射 (maps) onto то, что фактически нужно практикующим инженерам. Рассмотрим конкретный пример: для Llama-3.1-8B-Instruct при удалении 16 из 32 блоков большинство состояний с наименьшей энергией предлагают удалять блоки ближе к концу модели, как и ожидалось по предыдущим работам. Однако 17-е возбужденное состояние первым предлагает удалить блок в самом начале модели. После легкого переобучения (fine-tuning) эта конфигурация превзошла основное состояние по нескольким бенчмаркам.
Это прямо опровергает распространенное предположение, что лучший прунинг — это один непрерывный кусок средних или поздних блоков. Это показывает, почему уважение к полной многотельной структуре проблемы pays off (окупается).
06Результаты: глубокое сжатие без переобучения
Метод был протестирован на Llama-3.1-8B-Instruct, Qwen3-14B и Llama-3.3-70B-Instruct. В целом, метод CBO (Constrained Binary Optimization) сопоставим или превосходит передовые методы удаления блоков, причем разрыв увеличивается по мере усиления сжатия.
Самое явное преимущество наблюдается при глубоком сжатии Llama-3.3-70B-Instruct без переобучения. При удалении до 24 из 80 блоков CBO примерно сопоставим с методом «влияния блока» (block influence). Но при удалении 32/80 и 40/80 блоков он уверенно вырывается вперед. На самом глубоком уровне (40/80 блоков, то есть 50% глубины) CBO дает преимущество почти в 23 пункта по MMLU по сравнению с лучшим методом удаления блоков, превосходя базовый уровень по всем протестированным бенчмаркам.
| Модель | Блоков удалено | MMLU (CBO) | MMLU (Block Influence) |
|---|---|---|---|
| Llama-3.3-70B | 32 / 80 | 76.6 | 59.3 |
| Llama-3.3-70B | 40 / 80 | 76.9 | 54.0 |
Для Qwen3-14B при удалении 12 из 40 блоков CBO лидирует по MMLU примерно на 10 пунктов. При легком сжатии методы сопоставимы, что ожидаемо: связи (couplings) имеют наибольшее значение именно при глубоком сжатии.
07Обобщение на гетерогенные архитектуры
Удаление блоков становится гораздо сложнее в современных гетерогенных архитектурах, где различные типы блоков переплетаются. Однако формулировка Изинга не имеет значения: связь есть связь, независимо от того, какой тип блока находится в данной позиции. Для проверки этого авторы применили метод к NVIDIA Nemotron-3-Nano-30B-A3B-FP8 — гибридной модели, которая чередует слои Mamba2, внимания (attention) и смеси экспертов (MoE) в неравномерном паттерне, без какого-либо переобучения.
Ничто в нашей формулировке не предполагает однородного стека, поэтому она переносится напрямую. Удаление 2–3 слоев MoE или 2 слоев внимания позволяет CBO находить конфигурации, которые превосходят метод block influence по бенчмаркам AIME25 и GPQA. Результаты также подтверждают, что избыточность в этих гибридных моделях реальна, но распределена неравномерно: некоторые слои экспертов гораздо более «уязвимы» для удаления, чем другие. Способность метода искать в связанном пространстве конфигураций позволяет находить эти хорошие точки разреза.

08Что это значит на практике
Для инженеров и исследователей, работающих с LLM в России и мире, этот подход открывает новые горизонты. Во-первых, он позволяет значительно сократить затраты на инференс крупных моделей, таких как Llama-3.3-70B, без необходимости дорогостоящего полного переобучения (fine-tuning) для каждого варианта сжатия. Калибровочный проход на небольшом наборе данных занимает минимум времени, а последующий поиск оптимальной конфигурации происходит за секунды на обычном GPU или даже CPU с использованием табличных солверов.
Во-вторых, метод универсален. Он не ограничивается стандартными трансформерами. Если вы работаете с гибридными архитектурами, включающими Mamba, MoE или другие новые слои, подход через модель Изинга позволяет найти оптимальную структуру сжатия, учитывая взаимодействия между разнородными компонентами. Это особенно актуально в эпоху, когда архитектуры моделей становятся все более сложными и нелинейными.
В-третьих, интеграция с квантовыми и квантово-вдохновленными солверами открывает путь к масштабированию. По мере роста размеров моделей и количества блоков, пространство поиска становится экспоненциально большим. Использование специализированного оборудования и алгоритмов, разработанных для решения задач оптимизации в физике, позволяет обходить ограничения классических методов полного перебора. Для локального запуска в условиях ограниченных ресурсов РФ это означает возможность использовать открытые солверы (например, tabu search) для достижения результатов, сопоставимых с использованием коммерческих квантовых процессоров.
Код метода уже открыт, что позволяет любому исследователю протестировать его на своих моделях. Сочетание глубинного прунинга с квантованием и дистилляцией создает мощный конвейер сжатия, который может сделать передовые LLM доступными для развертывания на более дешевом оборудовании, сохраняя при этом их интеллектуальные способности.
09Заключение
Подход Multiverse Computing демонстрирует, как фундаментальная физика может решить прикладные проблемы машинного обучения. Переосмыслив прунинг LLM как задачу минимизации энергии в стекле Изинга, исследователи смогли учесть сложные взаимодействия между блоками, что привело к значительному улучшению качества сжатых моделей. Это не просто еще один метод оптимизации, а новый взгляд на архитектуру нейронных сетей, который обещает стать стандартом для эффективного развертывания больших моделей в будущем.
Источник: Hugging Face ↗
