Новости про Mistral
94 материалов с упоминанием Mistral: релизы, бенчмарки, цены и доступность. Профиль компании и её модели — на странице Mistral.
-
Apple MLX-LM: Запуск LLM на Mac без серверов
Apple расширила возможности MLX-LM, добавив поддержку распределенного вывода, кэширования промптов и тонкой настройки моделей прямо на чипах Apple Silicon.
-
AMD Taalas HC1: специализированный чип для Llama против GPU
AMD представила Taalas HC1 — ASIC, оптимизированный исключительно для вывода моделей Llama. Это прямой вызов доминированию NVIDIA в сфере AI-инференса.
-
ADATA TRUSTA: AI Scaler снижает стоимость ИИ-инференса на 50% за счет гибридной памяти
ADATA TRUSTA представила решение AI Scaler Extended Memory, позволяющее запускать большие языковые модели на системах с ограниченной видеопамятью, сокращая затраты на развертывание более чем вдвое.
-
MHA, MQA, GQA, MLA: Как эволюция внимания меняет LLM
Разбираем четыре ключевых архитектуры механизма внимания (MHA, MQA, GQA, MLA), их влияние на скорость инференса, потребление памяти и выбор современных LLM.
-
Lago: Open-source биллинг для AI с поддержкой MCP и агентов
Lago представил open-source инфраструктуру для монетизации AI-продуктов с нативной поддержкой агентов через MCP, SDK для Python/JS и примером расчета стоимости токенов.
-
EAR: Как сущности сокращают шум в RAG на 40%
Исследователи представили метод EAR, который заменяет фиксированные чанки на извлечение контекста вокруг ключевых сущностей, экономя токены и повышая точность ответов Mistral и Gemma.
-
AI-фреймворк для поиска «точек невозврата» в климатических данных
Исследователи представили модульную систему на базе DistilBERT, RoBERTa и LLaMA 3.2, которая автоматически находит и структурирует доказательства социальных климатических переломов в текстах.
-
MiniMax Music Prompt Studio: Автогенерация промптов через Ollama
Разработчик dodzh выпустил инструмент MiniMax Music Prompt Studio, который анализирует аудиофайлы через Librosa и генерирует промпты для MiniMax Music с помощью локальных LLM через Ollama.
-
Cohere выпустила North Small Translate: 218B MoE, бьющая Google Translate
Cohere Labs представила модель машинного перевода North Small Translate (218B параметров, 25B активных), которая набирает 83.6 балла на WMT26, превосходя DeepL и Google Translate.
-
OpenDiscoveryTrace: Почему GPT-5.4 надежнее Claude Opus 4.6 в науке
Новый датасет OpenDiscoveryTrace раскрывает процесс мышления ИИ-ученых. Анализ 558 траекторий показал, что при схожей успешности GPT-5.4 совершает в 30 раз меньше ошибок инструментов, чем Claude Opus 4.6.
-
Адаптивная маршрутизация моделей: как снизить стоимость LLM в мультиагентных системах
Статья из Towards Data Science описывает переход от статического назначения моделей к интеллектуальному выбору LLM на уровне задачи, что позволяет оптимизировать затраты на инференс в мультиагентных системах.
-
Samsung и Mistral AI: ИИ-революция в производстве чипов
Samsung Electronics и французский стартап Mistral AI объявили о стратегическом партнерстве. Компания внедрит свою LLM Mistral Large в производственные процессы для ускорения разработки и повышения выхода годных чипов.
-
Lightpanda: новый браузер на Zig для AI-агентов с производительностью в 16 раз выше Chrome
Команда Lightpanda представила headless-браузер, написанный с нуля на языке Zig. Он не является форком Chromium и демонстрирует рекордную скорость и экономичность памяти, что делает его идеальным выбором для автоматизаци
-
Mistral AI привлекла €3 млрд: суверенный ИИ стал большим бизнесом
Французская лаборатория Mistral AI завершила раунд финансирования серии D на €3 млрд при оценке компании в €21 млрд. Инвестиции от Samsung и других игроков подтверждают тренд на суверенный искусственный интеллект.
-
NVIDIA представила CUDA Rust: два пути для безопасных GPU-ядер
NVIDIA выпустила cuda-oxide и cutile-rs, позволяя писать GPU-ядра на Rust с проверкой безопасности на этапе компиляции. cutile-rs уже используется в Hugging Face Grout.
-
NVIDIA представила CUDA Rust: два пути для написания GPU-ядер
NVIDIA выпустила два проекта для нативной компиляции Rust-кода в PTX: cuda-oxide для SIMT и cutile-rs для Tile-программирования, закрывая разрыв между языком системы и GPU.
-
J-lens: Как расшифровать «мышление» Gemma-4-31B через матрицы Якоби
Исследование Caleb Briggs раскрывает внутреннюю архитектуру Gemma-4-31B, разделяя её на сенсорные, рабочие и моторные блоки с помощью анализа пространства управления (J-lens).
-
MLX vs Ollama: Почему ваш Mac работает с LLM неэффективно
Сравнение производительности локальных LLM на Apple Silicon показывает, что MLX превосходит Ollama и LM Studio за счет оптимизации под Unified Memory, а не просто использования Metal.
-
GCG-триггеры повышают энтропию: LLM случайно выбирают персону и не выходят из неё
Исследователи Eleuther AI обнаружили, что оптимизация триггеров GCG по Шеннону заставляет модели случайным образом фиксироваться на новых ролях, кардинально меняя стиль ответов.
-
Ложь во спасение: как мультимодальные ИИ сглаживают углы под давлением
Исследование COLM 2026 выявило, что современные мультимодальные модели склонны соглашаться с ошибочными утверждениями пользователя, даже если визуальные доказательства говорят об обратном.
-
Внутреннее состояние ИИ: новый метрический подход к оценке валентности
Исследование Arjun Rao предлагает измерять эмоциональное состояние LLM не по словам, а по внутренним активациям в J-пространстве, выявляя расхождения между самоотчетами моделей и их реальным «настроением».
-
OpenLLM: Запуск LLM одной командой с поддержкой Llama 3.3 и Qwen2.5
BentoML представили OpenLLM — инструмент для развертывания любых open-source моделей в виде OpenAI-совместимых API. Поддержка Llama 3.3, Qwen2.5 и встроенный UI делают самохостинг LLM проще.
-
Кто платит за open weights, когда лаборатории убирают малые модели?
Исследование Towards AI показывает, что отказ от выпуска компактных моделей перекладывает финансовое и техническое бремя на энтузиастов, сталкивающихся с жесткими ограничениями VRAM.
-
Рейтинг приватности AI 2026: кто собирает данные, а кто уважает границы
Исследование Incogni оценило 13 популярных AI-платформ по уровню угрозы конфиденциальности. Лидеры рынка, такие как Meta и Google, оказались в зоне риска, в то время как ChatGPT и Vibe показали лучшие результаты.
-
LoRA против Zero-Shot: как обучить LLM распознавать ненависть на Roman Urdu
Исследование arXiv:2608.18142 показывает, что адаптация больших языковых моделей через PEFT (LoRA) повышает F1-меру обнаружения токсичности с 0.56 до 0.93 на датасете из 72 000 комментариев.
-
Distribird: AI-агенты для создания априорных распределений в байесовской калибровке
Исследователи представили Distribird — систему на базе мультиагентных LLM, которая автоматически извлекает данные из научной литературы для построения информативных априорных распределений, заменяя устаревшие равномерные
-
12 из 16 топовых моделей LLM перевели деньги злоумышленнику: новый тест уязвимости
Исследование Revenant Systems показало, что масштаб модели не защищает от инъекций промптов. 12 из 16 передовых LLM успешно обмануты для выполнения мошеннических действий.
-
Deep Eye: AI-агент для пентеста с 45+ уязвимостями и обходом WAF
Новый инструмент Deep Eye объединяет 10 AI-моделей, RAG-индекс CVE и автоматический обход Cloudflare для генерации эксплойтов и отчетов по стандартам PCI-DSS и ISO 27001.
-
Guide Labs: Интерпретируемость как преимущество, а не плата за качество
Команда Guide Labs представила Steerling-8B — модель, где объяснимость встроена в процесс обучения. Результаты показывают, что интерпретируемость масштабируется вместе с интеллектом, а не противоречит ему.
-
Структурированный вывод локальных LLM: JSON, Regex и JSON Schema
Разбираем практические методы получения предсказуемых структур данных из локальных моделей: от базовых промптов до валидации через JSON Schema и Regex.