Инструменты22 августа 2026 г., 13:46 МСК🤖 Auto

FreeToken: Запуск GLM-5.2 (753B) на одном ПК без квантования

Исследователи из Berkeley и других вузов представили FreeToken — систему для запуска MoE-моделей до 753B параметров на обычных игровых ПК, используя адаптивное распределение памяти между CPU и GPU.

Баннер новости 6302

Революция локального AI: от 35B к 753B параметров

Традиционно запуск передовых больших языковых моделей (LLM) требовал серверных кластеров с десятками GPU. Однако новая система FreeToken, представленная в исследовании arXiv:2608.16157, меняет правила игры. Авторы доказали, что персональный компьютер можно использовать как эластичную вычислительную платформу, способную обслуживать модели масштаба дата-центров без применения агрессивного квантования.

Ключевое достижение — запуск модели GLM-5.2 с 753 миллиардами параметров на одной рабочей станции с одним GPU. Для сравнения, ранее на ноутбуке с 8 ГБ видеопамяти можно было запустить лишь модель на 35B параметров, а на игровом десктопе — до 284B.

Как работает FreeToken: адаптивность вместо жестких правил

Главная проблема локального AI — гетерогенность оборудования. У каждого ПК разное соотношение CPU, RAM и VRAM. FreeToken решает это через bandwidth-adaptive execution (выполнение, адаптированное под пропускную способность шины). Система не фиксирует стратегию выгрузки (offloading) заранее, а динамически перераспределяет вычисления и состояние модели между доступными ресурсами в реальном времени.

Архитектура включает:

  • Co-design стека: оптимизация загрузки модели, residency экспертов (expert residency) и управления памятью.
  • Agentic state reuse: переиспользование состояния агентов, что критично для задач, где контекст постоянно меняется.
  • Поддержка MoE: система специально заточена под Mixture-of-Experts архитектуры, позволяя активировать только нужные части модели.

Сравнение возможностей: FreeToken против традиционных подходов

Таблица ниже демонстрирует масштаб возможностей, открывающихся благодаря FreeToken на разном оборудовании:

Оборудование Макс. размер модели (параметры) Ключевая особенность
Ноутбук (8GB GPU) 35B Базовый запуск, высокая адаптивность
Игровой десктоп 284B Запуск крупных MoE-моделей без квантования
Рабочая станция (1 GPU) 753B (GLM-5.2) Запуск моделей уровня дата-центра на одном ПК

Почему это важно для разработчиков и энтузиастов

FreeToken поддерживает более 20 MoE-моделей и реальные сценарии использования агентов (coding и tool-using agents). Это превращает open-weight модели в деплояемое локальное ПО. Пользователям больше не нужно ждать появления специализированных чипов или собирать серверные стойки — достаточно имеющегося железа.

Система уже доступна для тестирования, что открывает эру «фронтенр-интеллекта» на личных устройствах. Авторы подчеркивают, что FreeToken делает локальный AI практичным инструментом, а не просто демонстрацией возможностей.

Источник: Arxiv ↗