Релиз модели4 августа 2026 г., 17:18 МСК🤖 Auto

LiquidAI LFM2.5-2.6B: Агент на 2.6 млрд параметров для edge-устройств

LiquidAI выпустила LFM2.5-2.6B — компактную модель, способную запускать локальных AI-агентов на ноутбуках и смартфонах. Модель обходит аналоги в 4 раза больше по задачам использования инструментов и следования инструкциям.

Баннер новости 5048

Революция локальных агентов: скорость и точность

Компания LiquidAI представила модель LFM2.5-2.6B, спроектированную специально для работы на устройствах с ограниченными ресурсами (edge devices). Главная особенность — способность выполнять многошаговые агентные задачи и вызывать инструменты (tool calling) без облачной инфраструктуры. Это позволяет разработчикам сохранять приватность данных и избегать затрат на inference в облаке.

Модель демонстрирует впечатляющую скорость работы: 220 токенов/с на чипе Apple M5 Max и 113 токенов/с на процессоре AMD Ryzen. Потребление памяти составляет менее 2.5 ГБ, что делает возможным запуск даже на мобильных устройствах (при скорости ~30 токенов/с).

Архитектура обучения: от SFT до Agentic RL

Модель предварительно обучена на ~34 триллионах токенов с расширением контекстного окна до 128K. Превращение базовой модели в надежного агента прошло через четыре этапа пост-обучения:

  • Supervised Fine-Tuning (SFT): две итерации с упором на данные для агентов (поиск в вебе, использование инструментов).
  • Teacher Specialization: обучение узкоспециализированных учителей для математики, кода и работы с инструментами.
  • Multi-domain on-policy distillation (MOPD): дистилляция знаний от учителей к единой модели-студенту.
  • Agentic Reinforcement Learning (Agentic RL): обучение с подкреплением в реальных агентных средах (harnesses), где модель учится взаимодействовать с разными инструментами и системными промптами.

Сравнение с конкурентами

LFM2.5-2.6B конкурирует с моделями в 4 раза больше по объему параметров. Она лидирует в задачах следования инструкциям (Instruction Following) и использования инструментов (Tool Use), уступая только в сложном программировании, где крупным моделям (9.7B+) пока нет равных.

Бенчмарк LFM2.5-2.6B (2.6B) Qwen3.5-9B (9.7B) Gemma-4-8B (8B) Qwen3.5-4B (4.7B)
AIME25 (Математика) 51.87 56.07 34.27 49.33
LiveCodeBenchv6 (Код) 59.41 69.86 63.77 60.85
IFBench (Инструкции) 59.17 56.40 39.24 48.40
Multi-IF (Инструкции) 80.07 62.50 77.35 55.67
ToolSandbox (Инструменты) 77.83 76.40 65.00 75.55
PinchBench (Агенты) 68.22 71.40 55.09 71.26

Как запустить модель

Модель поддерживает работу через llama.cpp, MLX, vLLM, SGLang и ONNX. Для быстрого старта в Python используйте библиотеку transformers (версия 5.0.0+):

pip install -U transformers

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto",
    dtype="bfloat16"
)
tokenizer = AutoTokenizer.from_pretrained(model_id)

prompt = "What is C. elegans?"
input_ids = tokenizer.apply_chat_template(
    [{"role": "user", "content": prompt}],
    add_generation_prompt=True,
    return_tensors="pt",
    tokenize=True
).to(model.device)

output = model.generate(
    input_ids,
    do_sample=True,
    temperature=0.2,
    top_k=80,
    repetition_penalty=1.05,
    max_new_tokens=512
)
print(tokenizer.decode(output[0], skip_special_tokens=False))

Модель доступна для скачивания на Hugging Face. Разработчики рекомендуют LFM2.5-2.6B для высоконагруженных сценариев, где критичны приватность и скорость отклика локального агента.

Бенчмарки

БенчмаркLFM2.5-2.6B (2.6B)Qwen3.5-4B (4.7B)gemma-4-E2B-it (5.1B)gemma-4-E4B-it (8B)
AIME2551.87%49.33%26.33%34.27%
LiveCodeBenchv659.41%60.85%54.92%63.77%
Multi-IF80.07%55.67%69.44%77.35%
ToolSandbox77.83%75.55%52.4%65%
BrowseComp+ (OpenClaw)26.89%24.46%8.31%15.9%
PinchBench68.22%71.26%44.24%55.09%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Hugging Face blog ↗