Релиз модели4 июля 2026 г., 09:45 МСК🤖 Auto

Leanstral 1.5: Прорыв в формальной верификации за $4

Mistral AI выпустила модель Leanstral 1.5 для доказательства теорем в Lean 4. Она бьет рекорды на бенчмарках и находит баги в коде, стоя в 75 раз дешевле конкурентов.

Баннер новости 2892

Архитектура и доступность

Компания Mistral AI представила модель Leanstral 1.5 с лицензией Apache 2.0. Это гибридная архитектура: модель имеет 119 миллиардов параметров, но использует только 6 миллиардов активных при инференсе. Обучение прошло три этапа: mid-training, SFT и RL с методом CISPO. Модель обучалась в двух средах: многошаговом доказательстве теорем и среде «кодового агента», где она редактирует файлы и взаимодействует с компилятором Lean в реальном времени.

Рекордные результаты на бенчмарках

Leanstral 1.5 демонстрирует выдающиеся результаты в формальной математике. Модель полностью saturates (достигает 100%) бенчмарк miniF2F. На сложных задачах PutnamBench и FATE она показывает state-of-the-art результаты, значительно превосходя аналоги по соотношению цена/качество.

Бенчмарк / Метрика Leanstral 1.5 Seed-Prover 1.5 (High) Aleph Prover
PutnamBench (решено) 587 / 672 580 Информация недостаточна
Стоимость решения задачи ~$4 ~$300+ $54–68
FATE-H (абстрактная алгебра) 87% Информация недостаточна Информация недостаточна
FATE-X (уровень PhD) 34% Информация недостаточна Информация недостаточна

Эффект масштабирования и FLTEval

Модель демонстрирует линейное масштабирование производительности при увеличении бюджета токенов. На PutnamBench решение задач растет от 44 при 50k токенов до 587 при 4M токенов. В практическом тесте FLTEval (на основе реальных pull-реквестов) Leanstral 1.5 достигает Pass@8 на уровне 43.2%, превосходя Opus 4.6 (39.6%) при стоимости в 7 раз ниже.

Верификация кода и поиск багов

Помимо математики, модель успешно применяется для проверки программного обеспечения. В кейсе с AVL-деревьями Leanstral 1.5 за 2.7 млн токенов формально доказала сложность операций O(log n). В автоматизированном пайплайне Aeneas модель проанализировала 57 репозиториев, выявив 11 реальных багов, включая критическое переполнение в библиотеке datrs/varinteger, которое пропустили тесты и фаззинг.

Как начать работу

Веса модели доступны на Hugging Face, а также предоставляется бесплатный API-эндпоинт. Для локального использования рекомендуется Mistral Vibe. Установка включает установку через uv, запуск агента и опциональную настройку Lean LSP MCP для интеграции с редакторами кода.

Бенчмарки

БенчмаркLeanstral 1.5Opus 4.6Seed-Prover 1.5 (high)
PutnamBench587proble580proble
FLTEval28.9%39.6%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Mistral ↗