В мире искусственного интеллекта, где гонка за параметрами часто затмевает практическую пользу, появление Leanstral 1.5 от Mistral AI становится знаковым событием. Это не просто еще одна большая языковая модель (LLM), а специализированный агент-код, созданный для работы с Lean 4 — системой автоматической проверки доказательств. Модель позиционируется как инструмент для автоматического доказательства теорем и инженерии доказательств, что открывает новые горизонты для формальной верификации программного обеспечения и математики. Весовые коэффициенты модели опубликованы под лицензией Apache 2.0, что делает их доступными для исследователей и разработчиков по всему миру, а также запущен бесплатный API-эндпоинт для быстрого старта.
Leanstral 1.5 является обновлением предыдущей версии Leanstral-2603 и принадлежит к семейству Mistral Small 4. Несмотря на то, что она относится к «малым» моделям в линейке Mistral, ее архитектурные решения и результаты на бенчмарках демонстрируют эффективность, сопоставимую с гораздо более крупными закрытыми моделями. В этой статье мы подробно разберем, как устроена эта модель, как она обучалась, какие рекорды она побивает и как разработчики могут использовать ее для решения реальных задач — от проверки сложности алгоритмов до поиска уязвимостей в коде.
01Архитектура и технические характеристики
Чтобы понять, почему Leanstral 1.5 так эффективна, нужно заглянуть под капот ее архитектуры. В основе модели лежит подход Mixture-of-Experts (MoE) — «смешение экспертов». Это современная архитектура, которая позволяет модели иметь огромную общую емкость, но активировать лишь небольшую ее часть для обработки каждого конкретного токена. Такой подход значительно снижает вычислительные затраты при сохранении высокой интеллектуальной мощности.
Leanstral 1.5 использует 128 экспертов, из которых для обработки каждого токена активируется только 4. Общее количество параметров модели составляет 119 миллиардов, однако в каждый момент времени активно работает лишь около 6.5 миллиардов параметров. Это обеспечивает баланс между скоростью инференса и глубиной анализа. Модель поддерживает контекстное окно длиной до 256 тысяч токенов, что критически важно для работы с большими объемами математических текстов или кодовых баз. Входные данные могут быть мультимодальными (текст и изображения), но выход генерируется исключительно в текстовом формате, что соответствует стандарту для генерации кода и доказательств в Lean 4.

02Трехэтапное обучение и агентное поведение
Обучение Leanstral 1.5 — это сложный процесс, состоящий из трех ключевых этапов: mid-training (промежуточное обучение), supervised fine-tuning (SFT) (супервизорная тонкая настройка) и reinforcement learning (обучение с подкреплением) с использованием метода CISPO. Особое внимание уделялось формированию агентного поведения модели, для чего были разработаны две специализированные среды обучения.
В среде многошаговых взаимодействий (multiturn environment) модель получает утверждение теоремы и должна либо доказать его, либо опровергнуть. Она подает доказательство, получает обратную связь от компилятора Lean, анализирует ошибки и корректирует свой подход в течение нескольких попыток, пока не достигнет успеха или не исчерпает выделенный бюджет вычислений. Этот процесс имитирует работу исследователя, который методично ищет верный путь.
Во второй среде — среде агента-кода (code agent environment) — Leanstral работает непосредственно в файловой системе. Модель может редактировать файлы, запускать bash-команды и взаимодействовать с языковым сервером Lean (Lean Language Server). Этот сервер предоставляет в реальном времени информацию о целях доказательства, ошибках и типах данных. Это позволяет модели не только писать код, но и завершать частичные доказательства, создавать вспомогательные леммы и эффективно управлять контекстом. Важной технологией здесь является компактификация контекста (context compaction), которая сжимает ранее обработанную информацию, позволяя модели работать с длинными задачами, не выходя за пределы окна контекста. Корректность всех сгенерированных доказательств проверяется с помощью форка SafeVerify от Mistral.

03Рекордные результаты на бенчмарках
Результаты Leanstral 1.5 на стандартных тестах впечатляют и ставят новые стандарты в области формальной верификации. Модель демонстрирует абсолютное доминирование на ряде задач:
- miniF2F: Модель достигла 100% точности как на валидационном, так и на тестовом наборах, полностью насытив бенчмарк. Это означает, что она успешно решила все доступные в тесте задачи.
- PutnamBench: Leanstral 1.5 решила 587 из 672 задач. PutnamBench — это набор сложных математических задач, взятых с конкурса Putnam Mathematical Competition. Решение более 87% таких задач является выдающимся достижением для ИИ.
- FATE-H и FATE-X: Модель установила новые рекорды (state-of-the-art) на алгебраических бенчмарках, показав 87% на FATE-H и 34% на FATE-X.
- FLTEval: Этот бенчмарк основан на реальных pull-реквестах в репозиторий, посвященный теореме Ферма. Здесь метрика Pass@1 (успех с первой попытки) выросла с 21.9% до 28.9%, а Pass@8 (успех в течение 8 попыток) — с 31.9% до 43.2%.

Особого внимания заслуживает сравнение с закрытыми моделями. На FLTEval Leanstral 1.5 превзошла результаты модели Opus 4.6 (39.6% при Pass@8), при этом стоимость решения задачи составила около $4, тогда как Opus 4.6 обходилась значительно дороже. Более того, Leanstral 1.5 опережает открытые модели, которые в 3-10 раз больше по размеру параметров.
На PutnamBench модель также обходит конкурентов. Например, она решает на 7 задач больше, чем Seed-Prover 1.5 (в его высокой настройке), но при этом стоимость решения одной задачи составляет около $4, тогда как Seed-Prover в высокой настройке требует бюджета в 10 дней работы на GPU H20, что оценивается примерно в $300 и более за задачу. Другие модели, такие как Aleph Prover, обходятся в $54–68 за задачу. Это делает Leanstral 1.5 не только точной, но и экономически эффективной.
04Масштабирование во время тестирования
Одной из ключевых особенностей Leanstral 1.5 является поведение test-time scaling. Это означает, что качество решения задачи напрямую зависит от вычислительного бюджета, выделенного на каждую попытку. Модель способна «думать» дольше, если это необходимо для решения сложной проблемы.
Эксперименты показали следующую зависимость для PutnamBench (Pass@8):
- При бюджете 50k токенов решается 44 задачи.
- При 200k токенов — 244 задачи.
- При 1M токенов — 493 задачи.
- При 4M токенов — 587 задач (максимальный результат).
Это дает разработчикам гибкость: для простых задач можно использовать минимальный бюджет для скорости, а для сложных теорем — увеличивать лимит токенов для повышения точности. Такая адаптивность делает модель универсальным инструментом для различных сценариев использования.

05Практическое применение: от математики к поиску багов
Хотя Leanstral 1.5 обучалась преимущественно на математических данных, ее способность к формальной верификации оказалась крайне полезной для инженерии программного обеспечения. Mistral AI представила два ярких кейса, демонстрирующих практическую ценность модели.
Кейс 1: Доказательство сложности алгоритмов. Leanstral 1.5 успешно доказала, что время работы реальной реализации дерева AVL составляет O(log n). Дерево AVL — это самобалансирующееся бинарное дерево поиска, широко используемое в программировании. Доказательство использовало структурную индукцию и монадическое отслеживание времени через TimeM monad. Процесс занял более 2.7 миллионов токенов и 22 этапа компактификации контекста. Модель установила границу в около 48 шагов на единицу высоты дерева, плюс константа. Это демонстрирует способность ИИ работать с глубокими теоретическими концепциями компьютерных наук.
Кейс 2: Поиск реальных багов в коде. В другом эксперименте использовался автоматизированный пайплайн, который с помощью инструмента Aeneas переводил код на Rust в формат Lean. Leanstral 1.5 выводила намерения пользователя и генерировала свойства корректности. Для каждого свойства модель делала 4 попытки доказательства, а затем 4 попытки опровержения. В ходе проверки 57 репозиториев с открытым исходным кодом модель выявила 47 нарушенных свойств и 11 настоящих багов. Пять из этих багов ранее не были сообщены в GitHub. Один из найденных багов находился в функции знака для зигзагообразного декодирования в библиотеке datrs/varinteger. При вводе Std.U64.MAX выражение (value + 1) вызывало переполнение, что приводило к краху в режиме отладки и тихой порче данных в релизной версии. Это доказывает, что Leanstral 1.5 может быть использована как мощный инструмент статического анализа и верификации безопасности.

06Как начать работу с Leanstral 1.5
Доступ к модели максимально упрощен. Самый простой путь — использование Mistral Vibe, официального CLI-агента Mistral. Модель доступна на бесплатном плане Mistral. Для начала работы необходимо:
- Включить «Labs models» в настройках аккаунта Mistral.
- Создать API-ключ.
- Установить и настроить Vibe.
Ниже приведен код для установки и запуска агента Lean через Mistral Vibe:
# 1. Set up Mistral Vibe
uv tool install mistral
vibe
uv tool update mistral
vibe
vibe
--
setup
# 2. Inside vibe, install Leanstral, then leave vibe
leanstall
exit
# 3. Launch the Lean agent
vibe
--
agent leanДля тех, кто предпочитает локальный запуск или развертывание на собственных серверах, рекомендуется использовать vLLM версии 0.24.0 или новее. Установка и запуск сервера выглядят следующим образом:
# Installs mistral_common >= 1.11.5 automatically
uv pip install
vllm
--
torch
backend
auto
vllm serve mistralai
Leanstral
1.5
119
A6B
--
max
model
len
200000
--
tensor
parallel
size
--
attention
backend
FLASH_ATTN_MLA
--
tool
call
parser mistral \
--
enable
auto
tool
choice \
--
reasoning
parser mistralПосле запуска сервера можно взаимодействовать с ним через OpenAI-совместимый клиент. Важно настроить параметр reasoning_effort: установите "high" для сложных промптов, требующих глубокого анализа, или "none" для максимальной скорости.
from openai import OpenAI
# Point the OpenAI client at your vLLM server
client = OpenAI(
api_key="EMPTY",
base_url=""
)
TEMP = 1.0
MAX_TOK = 32000
REASONING = "high" # switch to 'none' for faster answers
model = client.models.list().data[0].id
messages = [
{
"role": "user",
"content": [
{"type": "text", "text": "Define the transition rules as an inductive proposition in Lean 4."}
]
}
]
response = client.chat.completions.create(
model=model,
messages=messages,
temperature=TEMP,
max_tokens=MAX_TOK,
reasoning_effort=REASONING
)
print(response.choices[0].message.content)
print(response.choices[0].message.reasoning) Leanstral 1.5 также поддерживает вызовы инструментов в стиле OpenAI. Вы можете экспортировать функции, такие как lean_run_code, для компиляции фрагментов кода. Mistral дополнительно рекомендует использовать сервер lean-lsp-mcp для более тесной интеграции с экосистемой Lean.
07Что это значит на практике
Появление Leanstral 1.5 знаменует собой переход от теоретических экспериментов с ИИ в математике к практическому применению в индустрии разработки ПО. Модель демонстрирует, что большие языковые модели могут не только писать код, но и доказывать его корректность на формальном уровне. Это критически важно для критически важных систем, где ошибки стоят дорого: в финансовой сфере, аэрокосмической отрасли, криптографии и медицине.
Для обычных разработчиков Leanstral 1.5 предлагает возможность автоматизировать рутинные задачи по проверке инвариантов и границ условий. Экономическая эффективность модели (около $4 за сложную задачу против сотен долларов у конкурентов) делает ее доступной для стартапов и небольших команд. Открытая лицензия Apache 2.0 позволяет интегрировать ее в собственные CI/CD пайплайны, создавая уникальные конкурентные преимущества за счет повышенной надежности кода.
В будущем мы можем увидеть появление «умных» IDE, которые будут использовать подобные модели для мгновенной верификации написанного кода, предлагая не просто автодополнение, а математически обоснованные гарантии безопасности. Leanstral 1.5 — это первый шаг в этом направлении, и он сделан с впечатляющей точностью и доступностью.
Для тех, кто хочет углубиться в детали, рекомендуется ознакомиться с официальным объявлением Mistral AI, карточкой модели Leanstral 1.5 и страницей на Hugging Face. Следите за обновлениями в экосистеме AI, чтобы не пропустить следующие прорывы в области агентного искусственного интеллекта.
Источник: MarkTechPost ↗
