Революция локальных агентов: скорость и точность
Компания LiquidAI представила модель LFM2.5-2.6B, спроектированную специально для работы на устройствах с ограниченными ресурсами (edge devices). Главная особенность — способность выполнять многошаговые агентные задачи и вызывать инструменты (tool calling) без облачной инфраструктуры. Это позволяет разработчикам сохранять приватность данных и избегать затрат на inference в облаке.
Модель демонстрирует впечатляющую скорость работы: 220 токенов/с на чипе Apple M5 Max и 113 токенов/с на процессоре AMD Ryzen. Потребление памяти составляет менее 2.5 ГБ, что делает возможным запуск даже на мобильных устройствах (при скорости ~30 токенов/с).
Архитектура обучения: от SFT до Agentic RL
Модель предварительно обучена на ~34 триллионах токенов с расширением контекстного окна до 128K. Превращение базовой модели в надежного агента прошло через четыре этапа пост-обучения:
- Supervised Fine-Tuning (SFT): две итерации с упором на данные для агентов (поиск в вебе, использование инструментов).
- Teacher Specialization: обучение узкоспециализированных учителей для математики, кода и работы с инструментами.
- Multi-domain on-policy distillation (MOPD): дистилляция знаний от учителей к единой модели-студенту.
- Agentic Reinforcement Learning (Agentic RL): обучение с подкреплением в реальных агентных средах (harnesses), где модель учится взаимодействовать с разными инструментами и системными промптами.
Сравнение с конкурентами
LFM2.5-2.6B конкурирует с моделями в 4 раза больше по объему параметров. Она лидирует в задачах следования инструкциям (Instruction Following) и использования инструментов (Tool Use), уступая только в сложном программировании, где крупным моделям (9.7B+) пока нет равных.
| Бенчмарк | LFM2.5-2.6B (2.6B) | Qwen3.5-9B (9.7B) | Gemma-4-8B (8B) | Qwen3.5-4B (4.7B) |
|---|---|---|---|---|
| AIME25 (Математика) | 51.87 | 56.07 | 34.27 | 49.33 |
| LiveCodeBenchv6 (Код) | 59.41 | 69.86 | 63.77 | 60.85 |
| IFBench (Инструкции) | 59.17 | 56.40 | 39.24 | 48.40 |
| Multi-IF (Инструкции) | 80.07 | 62.50 | 77.35 | 55.67 |
| ToolSandbox (Инструменты) | 77.83 | 76.40 | 65.00 | 75.55 |
| PinchBench (Агенты) | 68.22 | 71.40 | 55.09 | 71.26 |
Как запустить модель
Модель поддерживает работу через llama.cpp, MLX, vLLM, SGLang и ONNX. Для быстрого старта в Python используйте библиотеку transformers (версия 5.0.0+):
pip install -U transformers
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
dtype="bfloat16"
)
tokenizer = AutoTokenizer.from_pretrained(model_id)
prompt = "What is C. elegans?"
input_ids = tokenizer.apply_chat_template(
[{"role": "user", "content": prompt}],
add_generation_prompt=True,
return_tensors="pt",
tokenize=True
).to(model.device)
output = model.generate(
input_ids,
do_sample=True,
temperature=0.2,
top_k=80,
repetition_penalty=1.05,
max_new_tokens=512
)
print(tokenizer.decode(output[0], skip_special_tokens=False))
Модель доступна для скачивания на Hugging Face. Разработчики рекомендуют LFM2.5-2.6B для высоконагруженных сценариев, где критичны приватность и скорость отклика локального агента.
Бенчмарки
| Бенчмарк | LFM2.5-2.6B (2.6B) | Qwen3.5-4B (4.7B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) |
|---|---|---|---|---|
| AIME25 | 51.87% | 49.33% | 26.33% | 34.27% |
| LiveCodeBenchv6 | 59.41% | 60.85% | 54.92% | 63.77% |
| Multi-IF | 80.07% | 55.67% | 69.44% | 77.35% |
| ToolSandbox | 77.83% | 75.55% | 52.4% | 65% |
| BrowseComp+ (OpenClaw) | 26.89% | 24.46% | 8.31% | 15.9% |
| PinchBench | 68.22% | 71.26% | 44.24% | 55.09% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Hugging Face blog ↗
