Главная/Блог/Гайд/Laguna S 2.1: Революция в агентном коде…
Гайд9 мин чтения · 23 июля 2026 г.

Laguna S 2.1: Революция в агентном коде от Poolside

Poolside выпустила Laguna S 2.1 — 118B-параметровую MoE-модель для агентного программирования, способную запускаться на одном GPU и превосходящую аналоги в бенчмарках.

Laguna S 2.1: Революция в агентном коде от Poolside

В мире искусственного интеллекта, где гонка за параметрами часто затмевает практическую применимость, выход модели Laguna S 2.1 от компании Poolside выглядит как свежий глоток воздуха. Это не просто еще одна большая языковая модель (LLM), а специализированный инструмент, созданный с нуля для решения сложнейшей задачи — агентного программирования. Модель, представленная в июле 2026 года, демонстрирует, как архитектура Mixture-of-Experts (MoE) и оптимизация под конкретные задачи могут позволить среднему по размеру модели конкурировать с гигантами, имеющими в десятки раз больше параметров. Для разработчиков, инженеров по машинному обучению и энтузиастов локального запуска AI это открытие может стать поворотным моментом в выборе инструментов для автоматизации кода.

Что делает Laguna S 2.1 особенной? Во-первых, это открытые веса (open-weight), доступные под лицензией OpenMDW-1.1, что позволяет не только использовать модель, но и изучать ее, модифицировать и развертывать локально. Во-вторых, ее способность работать с контекстом до 1 миллиона токенов, что критически важно для анализа больших кодовых баз. И, в-третьих, ее удивительная экономичность: благодаря механизму активации только 8 миллиардов параметров из 118 миллиардов общих, модель может работать на относительно скромном оборудовании, таком как NVIDIA DGX Spark, не требуя кластеров из сотен GPU для инференса. В этой статье мы подробно разберем технические детали, результаты бенчмарков и практические аспекты развертывания этой новой модели.

01Архитектура и технические характеристики: Больше, чем кажется на первый взгляд

В основе Laguna S 2.1 лежит архитектура Mixture-of-Experts (MoE). Это ключевой момент, который часто misunderstood (неправильно понимается) новичками. Общая модель содержит 118 миллиардов параметров, но при обработке каждого токена активными являются лишь около 8 миллиардов. Это соотношение составляет примерно 6.8% от общего числа параметров. Такая спарсность (разреженность) позволяет модели обладать знаниями и навыками огромной сети, но вычислять их с эффективностью значительно меньшего нейросетевого устройства.

Все 118 миллиардов параметров остаются в памяти, что обеспечивает быстрый доступ к нужному «эксперту» в любой момент времени, но вычислительная нагрузка на каждом шаге ограничена 8B. Именно эта архитектура объясняет, почему модель может вести себя как гораздо более крупная система, оставаясь при этом экономичной в обслуживании. Для разработчиков, работающих с ограниченными ресурсами, это означает возможность запуска мощных агентов на одном устройстве, а не в облаке.

Модель поддерживает окно контекста до 1 миллиона токенов в обоих режимах: с «мышлением» (thinking mode) и без него. Это позволяет загружать в память целые репозитории, документацию и логи, что необходимо для сложных задач по рефакторингу или поиску багов в больших проектах. Обучение модели началось 22 мая 2026 года на 4096 GPU NVIDIA H200, и от старта обучения до запуска прошло менее девяти недель. Это рекордная скорость разработки для модели такого уровня, что говорит об отлаженном процессе Poolside.

💡
Важно знать. Laguna S 2.1 — это первая модель Poolside, в которой обучение с подкреплением (reinforcement learning) проводилось в точности FP8. Это не только ускорило процесс, но и позволило лучше оптимизировать веса для инференса, особенно в форматах NVFP4 и INT4, которые критичны для работы на потребительском и полупрофессиональном оборудовании.

02Бенчмарки: Как Laguna S 2.1 конкурирует с гигантами

Цифры говорят сами за себя. На бенчмарке Terminal-Bench 2.1, который тестирует способность модели выполнять сложные задачи в терминальной среде, Laguna S 2.1 с включенным режимом «мышления» показала результат 70.2%. Это ставит ее на первое место среди открытых моделей с раскрытым количеством параметров. Для сравнения, закрытые системы, такие как Kimi K3 (2.8T-A50B) или Claude Fable 5, показывают результаты выше (88.3% и 88.0% соответственно), но они требуют колоссальных вычислительных ресурсов и недоступны для локального запуска.

Laguna S 2.1: Революция в агентном коде от Poolside

На бенчмарке SWE-Bench Multilingual, который оценивает способность модели решать реальные задачи по программированию на разных языках, Laguna S 2.1 набрала 78.5%, обойдя многие открытые аналоги. Особенно впечатляющим выглядит результат на DeepSWE v1.1, где модель показала 40.4% против 9.0% у DeepSeek-V4-Pro-Max, имея при этом в шесть раз меньше активных параметров. Это доказывает, что качество данных и специализация на агентных задачах могут быть важнее просто объема параметров.

Таблица сравнения производительности

Ниже приведены ключевые метрики, опубликованные Poolside. Обратите внимание, что Laguna S 2.1 (118B-A8B) часто превосходит или конкурирует с моделями, у которых активные параметры в 5-10 раз больше.

terminaltext
Benchmark               | Laguna S 2.1 (118B-A8B) | DeepSeek-V4-Pro-Max (1.6T-A49B) | Kimi K3 (2.8T-A50B) | Claude Fable 5
------------------------|-------------------------|---------------------------------|---------------------|---------------
Terminal-Bench 2.1      | 70.2                    | 64.0                            | 88.3                | 88.0
SWE-Bench Multilingual  | 78.5                    | 78.3                            | -                   | -
SWE-Bench Pro (Public)  | 59.4                    | 60.6                            | 61.5                | 80.3
DeepSWE v1.1            | 40.4                    | 9.0                             | 70.0                | -
SWE Atlas (Codebase QnA)| 46.2                    | 27.2                            | 42.2                | -
Toolathlon Verified     | 49.7                    | 55.9                            | 34.3                | -

Стоит отметить, что на некоторых задачах, таких как SWE-Bench Pro, закрытые модели все еще лидируют. Однако Poolside делает акцент на том, что Laguna S 2.1 доминирует в своем классе весов (weight class). Это означает, что для тех, кто хочет развернуть мощного агента на своей инфраструктуре, эта модель является лучшим выбором по соотношению цена/качество/производительность.

03Режимы «мышления» и цена интеллекта

Одной из самых интересных особенностей Laguna S 2.1 является наличие двух режимов работы: «off» (выключен) и «max» (максимальный), который включен по умолчанию. Режим «max» позволяет модели самостоятельно определять бюджет вычислений во время тестирования. Это означает, что модель может тратить больше токенов на размышление перед тем, как выдать ответ, что критически важно для сложных логических задач.

Включение режима «max» дает значительный прирост в производительности. Например, на Terminal-Bench 2.1 результат вырос с 60.4% до 70.2%. На DeepSWE прирост еще более впечатляющий: с 16.5% до 40.4%. Однако за этот интеллект приходится платить. Траектории выполнения задач в режиме мышления требуют значительно больше токенов. Например, на DeepSWE задачи в режиме мышления генерируют около 249 тысяч токенов вывода, против 99 тысяч без него. Poolside сообщает, что модель способна вести связное и продуктивное рассуждение в течение нескольких часов, генерируя сотни тысяч токенов.

Laguna S 2.1: Революция в агентном коде от Poolside
⚠️ Важно.
Расчет стоимости. При использовании хостинга через OpenRouter, доступ к полному контексту в 1M токенов стоит $0.10 за 1M входных токенов и $0.20 за 1M выходных. Учитывая, что режим «max» может увеличивать объем вывода в 2.5 раза, стоимость решения одной сложной задачи может быть выше, чем у моделей с коротким контекстом. Однако для локального запуска эти затраты отсутствуют, что делает Laguna S 2.1 идеальной для частных проектов.

04Практические примеры: Что модель умеет делать на самом деле

Цифры бенчмарков — это хорошо, но Poolside опубликовала три необработанных траектории (trajectories), чтобы показать реальное поведение модели. Эти примеры демонстрируют не просто ответы, а процесс работы агента.

Пример 1: Создание браузера с нуля. В одном из экспериментов модель создала работающий HTML/CSS браузерный движок с пустой папки. Этот процесс занял 181 шаг и 50 минут непрерывной работы без вмешательства человека. Модель самостоятельно валидировала свой вывод, используя headless Chromium. Это демонстрирует способность к долгосрочному планированию и самокоррекции.

Пример 2: Оптимизация собственного кода. Laguna S 2.1 оптимизировала собственный каркас агента Poolside. Модель увеличила скорость работы на 5.2% и снизила потребление памяти на 71%, заменив неэффективное конкатенирование строк O(n²) на буферы. Это показывает, что модель не только пишет код, но и понимает архитектуру и производительность систем, над которыми работает.

Пример 3: Решение математической задачи. В третьем примере модель переоткрыла задачу Эрдёша #397 на языке Perl за 68 минут. Примечательно, что песочница не поддерживала Python, поэтому модель адаптировалась. Это независимое открытие, хотя задача уже была решена GPT-5.2 Pro в январе 2026 года. Для Laguna S 2.1, чье знание ограничено ноябрем 2025 года, это достижение особенно ценно, так как оно основано на логике, а не на запоминании.

05Развертывание: Запуск на одном GPU

Самое важное для многих разработчиков — вопрос совместимости и требований к железу. Поскольку модель использует архитектуру MoE, для ее работы необходимо хранить все 118 миллиардов параметров в памяти, даже если активны только 8 миллиардов. Poolside предоставила веса в форматах BF16, FP8, INT4 и NVFP4, а также официальные конвертации GGUF и MLX.

Laguna S 2.1: Революция в агентном коде от Poolside

Вот как это выглядит на практике:

  • 4-бит (NVFP4 или INT4): Веса занимают около 59 ГБ. Это комфортно помещается в 128 ГБ унифицированной памяти одного NVIDIA DGX Spark. Это делает Laguna S 2.1 первой в своем роде моделью такого уровня, доступной для запуска на одном компактном устройстве.
  • FP8: Требует около 118 ГБ памяти. Это также помещается в один DGX Spark или один GPU NVIDIA H200.
  • BF16: Требует около 236 ГБ памяти. Для этого потребуется два связанных DGX Spark или многоGPU-нода в дата-центре.

Poolside сотрудничала с NVIDIA для оптимизации инференса через TRT-LLM, что позволило достичь высокой эффективности на архитектуре Blackwell. Модель также поддерживает vLLM, SGLang и Ollama, что упрощает интеграцию в существующие пайплайны. Доступ к модели также возможен через хостинги OpenRouter, Baseten, Kilo, Prime Intellect, Prime Lab и ZML.

📌 Факт.
Локальный запуск. Для пользователей из РФ доступ к некоторым хостингам может быть ограничен, но благодаря открытым весам (GGUF/MLX) и поддержке Ollama, вы можете запустить Laguna S 2.1 локально на своем оборудовании, если оно соответствует требованиям по объему VRAM. Это обеспечивает полную независимость от внешних сервисов.

06Что это значит на практике

Выход Laguna S 2.1 сигнализирует о сдвиге в парадигме разработки AI-агентов. Раньше считалось, что для сложных задач по программированию нужны закрытые, огромные модели, доступ к которым осуществляется только через API. Laguna S 2.1 доказывает, что с помощью правильной архитектуры (MoE), оптимизации (FP8/INT4) и специализированного обучения можно достичь сопоставимых результатов на открытом оборудовании.

Для компаний это означает возможность снизить затраты на облачные API, перенеся часть вычислений на локальные серверы. Для индивидуальных разработчиков — это шанс получить доступ к мощному инструменту, который может писать, отлаживать и оптимизировать код, не завися от лимитов и цен крупных провайдеров. Хотя закрытые модели все еще лидируют в абсолютных показателях, Laguna S 2.1 устанавливает новый стандарт для открытых, развертываемых решений, делая передовой AI доступным для более широкой аудитории.

Источник: MarkTechPost ↗