Инструменты24 августа 2026 г., 04:19 МСК🤖 Auto

FreeToken: Запуск GLM-5.2 (753B) на одной видеокарте

Исследователи из UC Berkeley и UT Austin представили FreeToken — движок для MoE-моделей, позволяющий запускать 753-миллиардные модели на одном GPU рабочего стола.

Баннер новости 6354

Проблема: «Узкое горлышко» MoE на потребительском железе

Открытие весов моделей (weights) не решает проблему их запуска. Mixture-of-Experts (MoE) архитектуры, такие как DeepSeek-V4-Flash и GLM-5.2, требуют огромных объемов памяти для хранения всех экспертов, даже если в вычислении участвует лишь малая их часть. Существующие движки (llama.cpp, Ollama, KTransformers) страдают от трех критических недостатков:

  • Разрушение разреженности при префилле: При обработке длинных контекстов PCIe-шина перегружается передачей всего пула экспертов, что занимает до 10 секунд на ноутбуках.
  • Статическое размещение: Фиксация «горячих» экспертов при загрузке игнорирует динамическую маршрутизацию токенов, заставляя GPU простаивать, а CPU — перегружаться.
  • Нехватка пропускной способности: Двухканальная DDR5 (80–90 ГБ/с) не справляется с нагрузкой, которую тянет GPU (1–1.8 ТБ/с).

Решение: Три механизма FreeToken

Команда разработала систему, которая рассматривает ПК как единый эластичный инференс-платформу. Ключевые инновации:

  1. Bandwidth-adaptive execution (q* policy): Алгоритм динамически делит нагрузку между GPU и CPU, основываясь на реальной пропускной способности шины. Если PCIe перегружен, часть экспертов вычисляется на CPU «на месте» (in-place), а результаты суммируются точно, без аппроксимации.
  2. Semantic-aware caching: Кэширование привязано к семантическим маркерам (блоки размышлений, вызовы инструментов). Это позволяет пере-префиллить только измененные суффиксы контекста, а не всю историю.
  3. Elastic memory management: Пересборка кэша экспертов на GPU происходит в безопасных точках планировщика без перезагрузки движка. Первый запрос обслуживается с «холодным» кэшем без предварительного прогрева.

Результаты бенчмарков

FreeToken демонстрирует значительный прирост скорости декодирования по сравнению с лидерами рынка. Ниже приведено сравнение производительности на RTX 5090 и RTX 4060:

Модель / Конфигурация FreeToken (tok/s) llama.cpp (tok/s) Ollama (tok/s) KTransformers (tok/s)
Qwen3.6-35B-A3B (BF16), RTX 5090 77–83 ~33-40* ~35-40* ~35-40*
DeepSeek-V4-Flash (MXFP4), RTX 5090 22–25 ~10-15* ~10-15* ~10-15*
GLM-5.2 (753B, 40B active), RTX PRO 6000 14.9 7.3
Qwen3.6-35B (NVFP4), RTX 4060 Laptop 39.3

*Примечание: Точные цифры для baselines в таблице источника не всегда сопоставимы напрямую из-за разных настроек, но FreeToken показывает ускорение в 1.5–2.3 раза относительно сильнейшего базового уровня.

Важно: Реальность против маркетинга

Аудит FlashML выявил ряд неточностей в заявках авторов:

  • Сравнение с Codex: Утверждение, что 39.3 tok/s на ноутбуке «превосходит медианный скор Codex (33 tok/s)», вводит в заблуждение. Данные Codex нормализованы, а чистый скор декодирования Codex составляет 57.1 tok/s.
  • GLM-5.2 на одной GPU: Хотя VRAM позволяет запустить модель, хост-машины часто имеют 512 ГБ DRAM, что критически важно для работы с пулом экспертов.
  • Базовые модели: Сравнение с KTransformers проводилось на 6 потоках CPU, что не отражает их реального потенциала на многоядерных системах.

Доступность и применение

FreeToken выпущен под лицензией Apache-2.0 и доступен через PyPI (uv pip install "freetoken[accel]") и как десктопное приложение. CLI-интерфейс ft serve эмулирует API OpenAI/Anthropic на порту 1919.

Целевая аудитория: Разработчики агентов, стартапы и компании в сфере здравоохранения, права и финансов, где конфиденциальность данных требует локального запуска (air-gapped) без отправки токенов в облако. Для энтерпрайза это не замена дата-центрам, а инструмент для защищенных рабочих нагрузок.

Источник: MarkTechPost ↗