Релиз модели21 июля 2026 г., 23:45 МСК🤖 Auto

Poolside Laguna S 2.1: 118B MoE обходит гигантов в кодинге

Poolside представила Laguna S 2.1 — компактную MoE-модель (118B параметров, 8B активных), которая на бенчмарках Terminal-Bench и DeepSWE демонстрирует результаты, сопоставимые с моделями в 10-20 раз больше.

Баннер новости 4076

Технические характеристики и архитектура

Poolside AI выпустила модель Laguna S 2.1, которая позиционируется как одна из самых эффективных агентных моделей для программирования в своем классе. Архитектура основана на Mixture-of-Experts (MoE) с общим объемом 118 миллиардов параметров, но при генерации токена активными являются лишь 8 миллиардов. Это обеспечивает высокую скорость инференса и позволяет запускать модель на локальных машинах без необходимости в серверных кластерах. Контекстное окно составляет до 1 миллиона токенов в режимах с размышлением (thinking) и без.

Результаты на ключевых бенчмарках

Модель показала выдающиеся результаты, особенно на задачах с длинным горизонтом планирования. На терминальном бенчмарке Terminal-Bench 2.1 Laguna S 2.1 набрала 70.2%, что ставит ее в один ряд с моделями весом в сотни миллиардов параметров. Особое внимание привлекает результат на датасете DeepSWE (задачи с длительным циклом разработки), где модель превзошла многие закрытые аналоги.

Модель Параметры (Total / Active) Terminal-Bench 2.1 DeepSWE SWE-Bench Multilingual
Laguna S 2.1 118B / 8B 70.2 40.4 78.5
Kimi K3 2.8T / 50B 88.3 69.0
Qwen 3.7 Max 74.5
Tencent Hy3 295B / 21B 71.7 9.0 75.8
DeepSeek-V4-Pro-Max 1.6T / 49B 64.0 9.0 78.3
Claude Fable 5 88.0 70.0

Почему DeepSWE важен?

Результат на DeepSWE (40.4%) особенно показателен, так как этот датасет сложнее стандартных SWE-Bench задач: он требует от модели решения проблем с длинным горизонтом, где частичное решение не засчитывается. Laguna S 2.1 обходит здесь такие модели, как Gemini 3.5 Flash (37.0%) и даже DeepSeek-V4-Pro-Max (9.0% в их нативном хarnессе, хотя в официальных лигах они могут показывать другие цифры). Это доказывает, что компактная модель может эффективно справляться с долгосрочным планированием кода.

Прозрачность и доступность

Poolside сделала полный пакет данных открытым: веса модели доступны, а также опубликованы все траектории (trajectories) финальных тестов на платформе trajectories.poolside.ai. Это позволяет исследователям верифицировать результаты и изучать процесс «размышления» модели. Разработка модели заняла менее 9 недель, что свидетельствует об оптимизированном пайплайне пост-обучения (post-training), сфокусированном на распределении задач для агентов.

Значение для индустрии

Выпуск Laguna S 2.1 меняет парадигму: ранее считалось, что для сложных кодовых агентов необходимы модели весом в сотни миллиардов или триллионы параметров. Laguna S 2.1 доказывает, что при правильной архитектуре MoE и обучении можно достичь «frontier»-уровня на специфичных задачах, используя ресурсы, доступные для локального деплоя. Это открывает путь к более дешевым и быстрым AI-ассистентам для разработчиков.

Бенчмарки

БенчмаркLaguna S 2.1Claude Fable 5DeepSeek-V4-Pro-MaxHy3InklingKimi K3Nemotron 3 Ultra
Terminal-Bench 2.170.2%88%71.7%88.3%
SWE-Bench Multilingual78.5%75.8%67.7%76.2%
SWE-Bench Pro (Public Dataset)59.4%57.9%54.3%55.4%
DeepSWE40.4%9%69%53.3%
SWE Atlas (Codebase QnA)46.2%27.2%42.2%
Toolathlon Verified49.7%45.5%34.3%55.9%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Poolside ↗