AI-новости22 июля 2026 г., 03:16 МСК🤖 Auto

Poolside Laguna S 2.1: 118B-параметров, 8B активных, победа на SWE-Bench

Poolside выпустила открытую модель Laguna S 2.1 для агентного кодинга. При 118 млрд параметров она активирует лишь 8 млрд, что позволяет запускать её на одном DGX Spark. Модель лидирует среди открытых аналогов на SWE-Bench Multilingual.

Баннер новости 4089

Архитектура и доступность

Laguna S 2.1 — это модель с архитектурой Mixture-of-Experts (MoE) с 118 млрд параметров, из которых на каждом токене активируется около 8 млрд (6.8% от общего числа). Это обеспечивает высокую эффективность при обслуживании. Модель поддерживает контекстное окно до 1 миллиона токенов и доступна под лицензией OpenMDW-1.1 на Hugging Face. Весовые коэффициенты представлены в форматах BF16, FP8, INT4 и NVFP4, а также в конвертациях GGUF и MLX.

Ключевое преимущество — компактность. В 4-битном квантовании (NVFP4/INT4) модель занимает около 59 ГБ, что помещается в единую память NVIDIA DGX Spark (128 ГБ). В FP8 требуется ~118 ГБ, а в BF16 — ~236 ГБ, что требует двух Spark или узла с несколькими GPU.

Результаты бенчмарков

Модель демонстрирует выдающиеся результаты на длинных горизонтах кодинга, конкурируя с системами в разы большего размера. Laguna S 2.1 заняла первое место среди открытых моделей с раскрытым размером параметров на compiled leaderboard Poolside.

Бенчмарк Laguna S 2.1 (118B-A8B) DeepSeek-V4-Pro-Max (1.6T-A49B) Nemotron 3 Ultra (550B-A55B) Inkling (975B-A41B)
SWE-Bench Multilingual 78.5% 78.3% 76.2% 67.7%
Terminal-Bench 2.1 70.2% 64.0% 56.4% 63.8%
DeepSWE v1.1 40.4% 9.0% 53.3% 69.0%
SWE-Bench Pro (Public) 59.4% 60.6% 55.4% 54.3%

Режимы мышления и стоимость

Модель работает в двух режимах: «off» и «max» (включен по умолчанию). Режим «max» позволяет модели самостоятельно определять бюджет вычислений во время тестирования. Это значительно повышает качество, но увеличивает расход токенов. Например, на DeepSWE результат вырос с 16.5% до 40.4%, а количество токенов завершения увеличилось с 99k до 249k.

Практические кейсы

Poolside опубликовала три неотредактированных траектории работы модели:

  • Браузерный движок: Модель создала работающий HTML/CSS движок с нуля за 50 минут (181 шаг) без вмешательства человека, валидируя вывод через headless Chromium.
  • Оптимизация: Ускорила собственный агентный хаб Poolside на 5.2% и снизила потребление памяти на 71%, заменив O(n²) конкатенацию строк на буферы.
  • Математика: Независимо вывела задачу Эрдёша #397 на Perl за 68 минут, используя только знания до ноября 2025 года.

Деплой и цены

Модель оптимизирована для TRT-LLM, vLLM, SGLang и Ollama. Доступна через OpenRouter: бесплатно при контексте 256K и платно ($0.10/$0.20/$0.01 за 1M токенов) при полном контексте 1M. Обучение заняло менее 9 недель на 4096 GPU NVIDIA H200, что стало первым случаем использования RL в точности FP8 от Poolside.

Источник: MarkTechPost ↗