Инструменты10 сентября 2026 г., 21:48 МСК🤖 Auto

Edge0-8B: Запуск 8-миллиардной модели на iPhone с потреблением 1 ГБ ОЗУ

Команда Edge0 представила прототип разреженной MoE-модели, работающей в памяти смартфона. Благодаря потоковой загрузке экспертов и квантованию int4, модель достигает 25 токенов/с, не требуя GPU.

Баннер новости 7207

Революция в on-device инференсе

Лаборатория Edge0 выпустила превью модели Edge0-8b-a1b — архитектуры класса 8B (Mixture of Experts), которая способна функционировать в условиях жестких ограничений памяти мобильных устройств. Ключевое достижение: полное использование весов модели происходит без их предварительной загрузки в оперативную память. Активная память (RAM) потребляет менее 1 ГБ, что позволяет запускать LLM на устройствах уровня iPhone без использования внешних GPU или облачных серверов.

Три технологии, делающие это возможным

Стабильная скорость генерации (25 токенов/с) и низкое потребление памяти достигнуты за счет комбинации трех инновационных механизмов в фреймворке edge0 (с бэкендом MLX):

  • SSD expert offload: веса «экспертов» модели хранятся на SSD и подгружаются в RAM только по мере необходимости (on-demand). Пиковая память ограничена только активными весами, а не общим размером модели.
  • Prerouter: обученная головка предсказывает маршрутизацию экспертов на шаг вперед. Это позволяет загружать данные параллельно с прямым проходом (forward pass), увеличивая пропускную способность декодирования до +59%.
  • Recover-LoRA: базовая модель квантована до int4, а потери качества компенсируются через дистилляцию от учителя FP16. Адаптеры LoRA остаются неслитыми, что позволяет одному базовому чекпоинту обслуживать множество наборов адаптеров.

Сравнение качества: Int4 vs FP16

Несмотря на агрессивное квантование, модель сохраняет высокую точность. В бенчмарках OpenCompass модель Edge0-8b (int4) демонстрирует результаты, сопоставимые с базовой моделью inclusionAI Ling 3.0 tiny (fp16), а в некоторых метриках даже превосходит ее. Средняя потеря качества составляет всего 2.8 балла.

Бенчмарк Edge0-8b (int4) Ling 3.0 tiny (fp16)
MMLU-Pro 70.1 65.8
AIME 2026 63.3 73.3
HumanEval 91.5 92.7
GPQA-Diamond 70.7 71.2
IFBench 53.9 60.6
Среднее 69.9 72.7

Технические характеристики и производительность

Модель построена на базе inclusionAI Ling 3.0 tiny (гибридная архитектура MLA + MoE). Она имеет 24 слоя, 128 экспертов, из которых на каждом токене активируется 8 (K=8). Контекстное окно составляет 128k токенов, поддерживается режим «мышления» (thinking mode).

Тестирование на Mac mini M4 Pro (24 ГБ ОЗУ) показало следующие результаты:

  • Скорость декодирования: 23.9–25.3 токенов/с.
  • Пропускная способность префилла: 500 токенов/с (холодный старт) / 1428 токенов/с (теплый).
  • Пиковая активная память: 1.0 ГБ (для коротких контекстов). Для длинных контекстов (3.3k токенов) кэш KV добавляет ~3.3 ГБ.

Ограничения и перспективы

Это превью-релиз. Модель пока не оптимизирована для агентных задач (многошаговое планирование, использование инструментов). Бэкенд MLX на данный момент поддерживает только Apple Silicon, хотя другие платформы заявлены в дорожной карте. Лицензия — Apache 2.0, что делает модель открытой для коммерческого и исследовательского использования.

Источник: Huggingface ↗