Проблема равномерных затрат
Современные большие языковые модели (LLM) тратят одинаковое количество вычислений на каждый генерируемый токен, независимо от его сложности. Методы вроде speculative decoding и model routing предполагают, что большая часть этих вычислений избыточна, но точная «цена» отдельного токена ранее не измерялась. Команда авторов (Zhixu Du, Weijia Han, Hai Helen Li, Yiran Chen) заполнила этот пробел, предложив методологию Mixture-of-Agents (MoA).
Методология: Панель из 15 моделей
Исследователи создали панель из 15 языковых моделей разной мощности, принадлежащих трем семействам (Qwen, OLMo, R1-distilled). Каждая модель-агент пыталась воспроизвести эталонную последовательность токен за токеном, имея доступ к правильным предыдущим токенам. Достаточные вычисления (sufficient compute) для токена определялись как стоимость наименьшей модели, которая успешно его воспроизвела. Это задает верхнюю границу реальных потребностей токена.
Ключевые метрики и распределение нагрузки
Результаты показали экстремальное неравенство в сложности токенов. Даже самая маленькая модель (0.5B параметров) успешно воспроизводит 92–95% всех токенов. Однако самые сложные 10% токенов требуют непропорционально больших ресурсов. Ниже приведена сводка распределения вычислительной нагрузки:
| Метрика / Параметр | Значение / Результат |
|---|---|
| Доля токенов, покрываемых моделью 0.5B | 92–95% |
| Доля FLOPs, требуемая для самых сложных 10% токенов | 64–80% |
| Снижение латентности при маршрутизации (MATH-500) | с 7.59 до 5.12 сек |
| Экономия токенов при спекулятивном декодировании | 32.6% |
| Снижение латентности при спекулятивном декодировании | ~20% |
Практическое применение: Маршрутизация и Drafting
Использование «карты достаточных вычислений» (MoA-map) для маршрутизации запросов на наборе MATH-500 позволило снизить проектное время отклика с 7.59 до 5.12 секунд при одновременном небольшом улучшении точности по сравнению с лучшими базовыми методами маршрутизации на основе уверенности (confidence-routing).
В сценарии спекулятивного декодирования (drafting) карта вычислений позволила сократить количество токенов-черновиков на 32.6% и снизить проектное время отклика примерно на 20% по сравнению с фиксированным окном черновиков при сопоставимой точности.
Почему это важно
Работа доказывает, что архитектура моделей должна учитывать гетерогенность сложности токенов. Вместо статического распределения ресурсов, контроллеры могут динамически выделять вычислительную мощность в зависимости от «стоимости» текущего токена, что открывает значительный потенциал для оптимизации затрат на инференс в LLM.
Источник: arXiv cs.AI ↗
