Архитектура и доступность
Laguna S 2.1 — это модель с архитектурой Mixture-of-Experts (MoE) с 118 млрд параметров, из которых на каждом токене активируется около 8 млрд (6.8% от общего числа). Это обеспечивает высокую эффективность при обслуживании. Модель поддерживает контекстное окно до 1 миллиона токенов и доступна под лицензией OpenMDW-1.1 на Hugging Face. Весовые коэффициенты представлены в форматах BF16, FP8, INT4 и NVFP4, а также в конвертациях GGUF и MLX.
Ключевое преимущество — компактность. В 4-битном квантовании (NVFP4/INT4) модель занимает около 59 ГБ, что помещается в единую память NVIDIA DGX Spark (128 ГБ). В FP8 требуется ~118 ГБ, а в BF16 — ~236 ГБ, что требует двух Spark или узла с несколькими GPU.
Результаты бенчмарков
Модель демонстрирует выдающиеся результаты на длинных горизонтах кодинга, конкурируя с системами в разы большего размера. Laguna S 2.1 заняла первое место среди открытых моделей с раскрытым размером параметров на compiled leaderboard Poolside.
| Бенчмарк | Laguna S 2.1 (118B-A8B) | DeepSeek-V4-Pro-Max (1.6T-A49B) | Nemotron 3 Ultra (550B-A55B) | Inkling (975B-A41B) |
|---|---|---|---|---|
| SWE-Bench Multilingual | 78.5% | 78.3% | 76.2% | 67.7% |
| Terminal-Bench 2.1 | 70.2% | 64.0% | 56.4% | 63.8% |
| DeepSWE v1.1 | 40.4% | 9.0% | 53.3% | 69.0% |
| SWE-Bench Pro (Public) | 59.4% | 60.6% | 55.4% | 54.3% |
Режимы мышления и стоимость
Модель работает в двух режимах: «off» и «max» (включен по умолчанию). Режим «max» позволяет модели самостоятельно определять бюджет вычислений во время тестирования. Это значительно повышает качество, но увеличивает расход токенов. Например, на DeepSWE результат вырос с 16.5% до 40.4%, а количество токенов завершения увеличилось с 99k до 249k.
Практические кейсы
Poolside опубликовала три неотредактированных траектории работы модели:
- Браузерный движок: Модель создала работающий HTML/CSS движок с нуля за 50 минут (181 шаг) без вмешательства человека, валидируя вывод через headless Chromium.
- Оптимизация: Ускорила собственный агентный хаб Poolside на 5.2% и снизила потребление памяти на 71%, заменив O(n²) конкатенацию строк на буферы.
- Математика: Независимо вывела задачу Эрдёша #397 на Perl за 68 минут, используя только знания до ноября 2025 года.
Деплой и цены
Модель оптимизирована для TRT-LLM, vLLM, SGLang и Ollama. Доступна через OpenRouter: бесплатно при контексте 256K и платно ($0.10/$0.20/$0.01 за 1M токенов) при полном контексте 1M. Обучение заняло менее 9 недель на 4096 GPU NVIDIA H200, что стало первым случаем использования RL в точности FP8 от Poolside.
Источник: MarkTechPost ↗
