Технические характеристики и архитектура
Poolside AI выпустила модель Laguna S 2.1, которая позиционируется как одна из самых эффективных агентных моделей для программирования в своем классе. Архитектура основана на Mixture-of-Experts (MoE) с общим объемом 118 миллиардов параметров, но при генерации токена активными являются лишь 8 миллиардов. Это обеспечивает высокую скорость инференса и позволяет запускать модель на локальных машинах без необходимости в серверных кластерах. Контекстное окно составляет до 1 миллиона токенов в режимах с размышлением (thinking) и без.
Результаты на ключевых бенчмарках
Модель показала выдающиеся результаты, особенно на задачах с длинным горизонтом планирования. На терминальном бенчмарке Terminal-Bench 2.1 Laguna S 2.1 набрала 70.2%, что ставит ее в один ряд с моделями весом в сотни миллиардов параметров. Особое внимание привлекает результат на датасете DeepSWE (задачи с длительным циклом разработки), где модель превзошла многие закрытые аналоги.
| Модель | Параметры (Total / Active) | Terminal-Bench 2.1 | DeepSWE | SWE-Bench Multilingual |
|---|---|---|---|---|
| Laguna S 2.1 | 118B / 8B | 70.2 | 40.4 | 78.5 |
| Kimi K3 | 2.8T / 50B | 88.3 | 69.0 | — |
| Qwen 3.7 Max | — | 74.5 | — | — |
| Tencent Hy3 | 295B / 21B | 71.7 | 9.0 | 75.8 |
| DeepSeek-V4-Pro-Max | 1.6T / 49B | 64.0 | 9.0 | 78.3 |
| Claude Fable 5 | — | 88.0 | 70.0 | — |
Почему DeepSWE важен?
Результат на DeepSWE (40.4%) особенно показателен, так как этот датасет сложнее стандартных SWE-Bench задач: он требует от модели решения проблем с длинным горизонтом, где частичное решение не засчитывается. Laguna S 2.1 обходит здесь такие модели, как Gemini 3.5 Flash (37.0%) и даже DeepSeek-V4-Pro-Max (9.0% в их нативном хarnессе, хотя в официальных лигах они могут показывать другие цифры). Это доказывает, что компактная модель может эффективно справляться с долгосрочным планированием кода.
Прозрачность и доступность
Poolside сделала полный пакет данных открытым: веса модели доступны, а также опубликованы все траектории (trajectories) финальных тестов на платформе trajectories.poolside.ai. Это позволяет исследователям верифицировать результаты и изучать процесс «размышления» модели. Разработка модели заняла менее 9 недель, что свидетельствует об оптимизированном пайплайне пост-обучения (post-training), сфокусированном на распределении задач для агентов.
Значение для индустрии
Выпуск Laguna S 2.1 меняет парадигму: ранее считалось, что для сложных кодовых агентов необходимы модели весом в сотни миллиардов или триллионы параметров. Laguna S 2.1 доказывает, что при правильной архитектуре MoE и обучении можно достичь «frontier»-уровня на специфичных задачах, используя ресурсы, доступные для локального деплоя. Это открывает путь к более дешевым и быстрым AI-ассистентам для разработчиков.
Бенчмарки
| Бенчмарк | Laguna S 2.1 | Claude Fable 5 | DeepSeek-V4-Pro-Max | Hy3 | Inkling | Kimi K3 | Nemotron 3 Ultra |
|---|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 70.2% | 88% | — | 71.7% | — | 88.3% | — |
| SWE-Bench Multilingual | 78.5% | — | — | 75.8% | 67.7% | — | 76.2% |
| SWE-Bench Pro (Public Dataset) | 59.4% | — | — | 57.9% | 54.3% | — | 55.4% |
| DeepSWE | 40.4% | — | 9% | — | 69% | — | 53.3% |
| SWE Atlas (Codebase QnA) | 46.2% | — | — | 27.2% | 42.2% | — | — |
| Toolathlon Verified | 49.7% | — | — | 45.5% | 34.3% | — | 55.9% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Poolside ↗
