Главная/Блог/Аналитика/LFM2.5-2.6B: Запуск умных агентов на…
Аналитика9 мин чтения · 4 августа 2026 г.

LFM2.5-2.6B: Запуск умных агентов на любом устройстве

LiquidAI представили LFM2.5-2.6B — компактную модель для локальных AI-агентов. Разбираем архитектуру, обучение и примеры использования на CPU и GPU.

LFM2.5-2.6B: Запуск умных агентов на любом устройстве

Представьте себе сценарий, где ваш персональный ассистент не отправляет ваши конфиденциальные данные в облако, а обрабатывает их прямо на вашем ноутбуке или смартфоне. Это больше не футуристическая фантазия, а суровая реальность, которую предлагает LiquidAI с выходом модели LFM2.5-2.6B. Эта нейросеть создана с одной четкой целью: обеспечить мощные возможности агентов (AI-агентов) полностью на устройстве пользователя (on-device). Она поддерживает вызовы инструментов (tool calling) и сложные многошаговые рабочие процессы, оставаясь при этом достаточно маленькой и быстрой для повседневного оборудования — от старых ноутбуков до современных смартфонов.

Такой подход позволяет разработчикам развертывать интеллектуальных агентов повсеместно, сохраняя полную приватность данных на устройстве и масштабируя использование без необходимости платить за облачные вычисления. В этой статье мы подробно разберем, как была создана эта модель, почему она конкурирует с моделями в четыре раза больше себя, и как вы можете запустить её уже сегодня, даже если у вас нет доступа к мощным GPU.

LFM2.5-2.6B: Запуск умных агентов на любом устройстве

01Почему LFM2.5-2.6B — это прорыв для edge-устройств

Основное преимущество LFM2.5-2.6B заключается в ее уникальном балансе между размером, скоростью и интеллектом. Модель позиционируется как «лучший в классе» агент, который демонстрирует результаты, сопоставимые с моделями, в четыре раза превышающими её по размеру, в задачах использования инструментов, следования инструкциям и многошаговых агентных сценариев. Но цифры — это лишь половина истории. Вторая половина — это скорость.

На аппаратном обеспечении Apple M5 Max модель генерирует 220 токенов в секунду, а на процессоре AMD Ryzen CPU — 113 токенов в секунду, потребляя при этом менее 2.5 ГБ оперативной памяти. Это означает, что даже на мобильных устройствах, где скорость декодирования составляет около 30 токенов в секунду, модель остается достаточно отзывчивой для работы с компетентными агентами. Для сравнения, многие современные большие языковые модели (LLM) требуют десятков гигабайт VRAM и значительных вычислительных мощностей для работы в реальном времени, что делает их непригодными для локального запуска на потребительских устройствах.

💡
Ключевое преимущество. LFM2.5-2.6B использует архитектуру LFM2, которая оптимизирована для эффективного вывода (inference). Это позволяет достигать рекордной скорости декодирования даже на CPU, что критически важно для интерактивных приложений, таких как чат-боты или голосовые помощники.

02Как создавали надежного агента: от предобучения до RL

Создание модели, способной работать как агент, — это сложный процесс, выходящий далеко за рамки простого дообучения. Команда LiquidAI прошла через несколько этапов, чтобы превратить базовую языковую модель в надежного помощника, способного взаимодействовать с внешним миром через инструменты.

Предобучение и расширение контекста

Модель LFM2.5-2.6B была предварительно обучена на ~34 триллионах токенов. Это огромный объем данных, который обеспечивает широкую базу знаний. Однако для работы агентов критически важно уметь работать с длинными контекстами. Поэтому на этапе mid-training (промежуточного обучения) окно контекста было расширено до 128K токенов. Это позволяет модели анализировать длинные документы, историю переписки или сложные технические спецификации, не теряя нити повествования.

Четыре этапа пост-обработки (Post-training)

После предобучения базовая модель превращается в агента через четыре последовательных этапа:

  1. Supervised Fine-Tuning (SFT): Проводится два раунда контролируемого дообучения. Особый акцент делается на агентных данных: использовании инструментов, поиске в интернете и траекториях работы в различных harness (средах выполнения). Это учит модель понимать структуру запросов и формат ответов, необходимых для взаимодействия с внешними сервисами.
  2. Teacher Specialization: Для улучшения качества в специфических областях обучаются отдельные «учителя» (specialist teachers). Например, создается отдельный учитель для математики, другой для кода, третий для использования инструментов. Это позволяет модели получать высококачественные сигналы от экспертов в каждой области.
  3. Multi-domain on-policy distillation (MOPD): Знания от всех этих специализированных учителей дистиллируются (передаются) в единую модель-студент. Этот этап помогает объединить разрозненные навыки в единый, сбалансированный интеллект.
  4. Agentic Reinforcement Learning (Agentic RL): Финальный и, возможно, самый важный этап. Модель проходит многошаговое обучение с подкреплением (RL) внутри реальных агентных harness. Здесь она учится работать с разными инструментами, системными промптами и многошаговыми средами задач. Это учит модель адаптироваться к изменениям и исправлять ошибки в реальном времени.

Архитектура пайплайна Agentic RL

Пайплайн Agentic RL разделен на несколько компонентов для максимальной эффективности:

  • Training Engine: Оптимизирует модель.
  • Rollout Engine: Генерирует действия, используя текущую политику модели.
  • RL framework: Оркестрирует цикл обучения, запуская rollout, собирая траектории и награды, и обновляя модель.
  • Sandbox Service: Здесь выполняются действия. В нем находится Blackbox Harness (например, OpenClaw или Hermes Agent), который координирует взаимодействие агента с окружающей средой задачи.
  • Harness Proxy: Позволяет рассматривать агентные harness как «черные ящики» без необходимости их модификации, при этом прозрачно захватывая токеновые траектории, необходимые для восстановления и валидации образцов обучения RL.

Такая архитектура позволяет обучать модель в реалистичных условиях, где она сталкивается с теми же сложностями, что и в реальной эксплуатации.

03Результаты бенчмарков: маленькая модель, большие результаты

Чтобы оценить эффективность LFM2.5-2.6B, её протестировали против моделей размером до ~4x больше. Результаты впечатляют: самая маленькая модель в группе часто превосходит своих более крупных конкурентов.

LFM2.5-2.6B: Запуск умных агентов на любом устройстве

Давайте разберем ключевые метрики:

  • STEM и математика: На AIME25 LFM2.5-2.6B набирает 51.87, что значительно выше, чем у Gemma-4-E2B-it (26.33) и Gemma-4-E4B-it (34.27). Однако Qwen3.5-9B показывает лучший результат (56.07). Это показывает, что для сложных математических задач более крупные модели пока имеют преимущество.
  • Следование инструкциям (Instruction Following): Здесь LFM2.5-2.6B лидирует. На IFBench она набирает 59.17, на Multi-IF — 80.07, а на IFStruct — 85.49. В этих тестах она превосходит все модели из списка, включая Qwen3.5-9B. Это критически важно для агентов, так как точное следование инструкциям пользователя — основа их работы.
  • Использование инструментов (Tool Use): На ToolSandbox модель набирает 77.83, что выше, чем у Gemma и Qwen3.5-4B, и сопоставимо с Qwen3.5-9B (76.45). Исключение составляет BFCLv4, где только Qwen3.5-9B (60.17) немного опережает LFM2.5-2.6B (56.88). В целом, модель демонстрирует отличные способности к использованию инструментов.
  • Агентные задачи (Agentic Tasks): На BrowseComp+ (OpenClaw) LFM2.5-2.6B набирает 26.89, что значительно выше, чем у Gemma-4-E2B-it (8.31) и Gemma-4-E4B-it (15.90). Она также показывает хорошие результаты на Claw-Eval average (62.85) и PinchBench (68.22).
⚠️ Важно знать.
Кодирование. В задачах программирования (LiveCodeBenchv6) более крупные модели, такие как Qwen3.5-9B (69.86), все еще показывают лучшие результаты, чем LFM2.5-2.6B (59.41). Если ваша основная задача — генерация сложного кода, возможно, стоит рассмотреть более крупные модели. Однако для большинства других задач LFM2.5-2.6B является лидером.

04Скорость вывода: CPU и GPU

Одной из главных фишек LFM2.5-2.6B является её совместимость с широким спектром аппаратного обеспечения. Модель поддерживает day-one поддержку в таких популярных инструментах, как llama.cpp, MLX, vLLM, SGLang и ONNX.

Вывод на CPU

Благодаря эффективной архитектуре LFM2, LFM2.5-2.6B стала самой быстрой моделью среди протестированных на CPU. На Apple M5 Max она выдает 220 токенов в секунду, а на AMD Ryzen AI Max+ 395 — 113 токенов в секунду. Даже на мобильных устройствах, где скорость составляет около 30 токенов в секунду, модель остается usable (пригодной к использованию) для агентов. Это открывает возможности для запуска AI на устройствах, которые раньше считались слишком слабыми для таких задач.

Вывод на GPU

На GPU модель также показывает отличные результаты. На NVIDIA H100 она может генерировать почти 15 000 выходных токенов в секунду при высокой конкурентности, что эквивалентно примерно 1.3 миллиарда токенов в день на одной видеокарте. Это делает её идеальной для высоконагруженных приложений, где требуется быстрая обработка множества запросов.

LFM2.5-2.6B: Запуск умных агентов на любом устройстве

05Как запустить LFM2.5-2.6B: Пошаговая инструкция

Запуск модели LFM2.5-2.6B прост и интуитивно понятен. Ниже приведены шаги для установки и запуска модели с использованием библиотеки Transformers.

Шаг 1: Установка

Установите последнюю версию библиотеки transformers (совместимую с transformers>=5.0.0):

terminalbash
pip install -U transformers

Шаг 2: Загрузка и запуск модели

Используйте следующий код для загрузки модели и токенизатора:

terminalpython
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "LiquidAI/LFM2.5-2.6B"

model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto",
    dtype="bfloat16"
    # attn_implementation="flash_attention_2"  # uncomment on a compatible GPU
)

tokenizer = AutoTokenizer.from_pretrained(model_id)

prompt = "What is C. elegans?"

input_ids = tokenizer.apply_chat_template(
    [{"role": "user", "content": prompt}],
    add_generation_prompt=True,
    return_tensors="pt",
    tokenize=True
).to(model.device)

output = model.generate(
    input_ids,
    do_sample=True,
    temperature=0.2,
    top_k=80,
    repetition_penalty=1.05,
    max_new_tokens=512
)

print(tokenizer.decode(output[0], skip_special_tokens=False))

Этот код загружает модель, применяет шаблон чата для формирования промпта и генерирует ответ. Параметры генерации (temperature, top_k, repetition_penalty) можно настроить в зависимости от ваших потребностей. Например, более низкая температура (0.2) делает ответы более детерминированными и точными, что важно для агентов.

LFM2.5-2.6B: Запуск умных агентов на любом устройстве

06Практическое применение: для чего использовать LFM2.5-2.6B?

LFM2.5-2.6B идеально подходит для приложений, требующих локальных агентов для высоконагруженных рабочих нагрузок. Вот несколько примеров:

  • Приватные чат-боты: Поскольку модель работает локально, ваши данные не покидают устройство. Это критически важно для корпоративного использования, где конфиденциальность данных является приоритетом.
  • Ассистенты для исследований: Модель может использоваться для поиска информации в интернете, анализа документов и генерации сводок. Демонстрация в браузере показывает, как агент помогает исследовать конкретные вопросы и генерировать summaries.
  • Автоматизация задач: Благодаря поддержке tool calling, модель может взаимодействовать с различными сервисами, такими как календари, почта или базы данных, автоматизируя рутинные задачи.
  • Образовательные приложения: Модель может использоваться для создания интерактивных обучающих платформ, где агент отвечает на вопросы студентов и помогает им решать задачи.
📌 Факт.
Доступность. Обе модели, LFM2.5-2.6B и LFM2.5-2.6B-Base, доступны на Hugging Face. Вы можете скачать их, попробовать в WebGPU-демо в браузере без установки или использовать в своих harness, следуя руководству по запуску локальных агентов, таких как OpenClaw, Hermes Agent и Pi.
LFM2.5-2.6B: Запуск умных агентов на любом устройстве

07Что это значит на практике

Выход LFM2.5-2.6B знаменует собой важный шаг в democratization AI. Раньше запуск мощных AI-агентов требовал либо облачных сервисов (что связано с затратами и вопросами приватности), либо мощного оборудования (что недоступно большинству пользователей). LFM2.5-2.6B стирает эту границу.

Для разработчиков это означает возможность создавать приложения, которые работают быстро, дешево и приватно. Для конечных пользователей это означает доступ к интеллектуальным помощникам, которые не зависят от интернета и не следят за их действиями. Для бизнеса это возможность автоматизировать процессы без риска утечки данных.

Конечно, у модели есть свои ограничения. В задачах сложного программирования она уступает более крупным моделям. Однако для большинства повседневных задач, связанных с обработкой текста, использованием инструментов и следованием инструкциям, LFM2.5-2.6B является отличным выбором. Её скорость и компактность делают её идеальной для развертывания на edge-устройствах, где раньше AI был невозможен.

Мы рекомендуем попробовать LFM2.5-2.6B, если вы ищете модель для локальных агентов. Начните с WebGPU-демо, чтобы оценить её возможности, а затем интегрируйте её в свои проекты. С LFM2.5, LiquidAI реализует своё видение AI, который может работать везде.

Скачайте модель с Hugging Face, попробуйте её в действии и посмотрите, что вы сможете построить. Мы с нетерпением ждем ваших проектов!

Источник: Hugging Face ↗