Релиз модели28 сентября 2026 г., 17:47 МСК🤖 Auto

Naive-N0.5-Flash: 309B MoE модель с AI-оптимизацией и скоростью 2000 токенов/с

NaiveAI представила Naive-N0.5-Flash — 309B MoE-модель, обученную для кодинга и R&D. Благодаря собственному рантайму NaiveRT она достигает 2000 токенов/с и поддерживает контекст 1M токенов без полной внимательности.

Баннер новости 8432

Архитектура и ключевые характеристики

Naive-N0.5-Flash — это гибридная MoE-модель объемом 309 миллиардов параметров, из которых активными являются 15.5 миллиарда. Ключевое отличие архитектуры: полное отсутствие слоев с полным вниманием (full attention). Модель использует комбинацию Sliding-Window Attention (SWA) и легковесного DeepSeek Sparse Attention (DSA) с GQA4 в соотношении 5:1. Это позволяет работать с нативным контекстом в 1 миллион токенов, сохраняя высокую эффективность.

Производительность и NaiveRT

Для обеспечения скорости инференса NaiveAI разработала собственную систему NaiveRT. Она использует мегакernel-фьюжн, Programmatic Dependent Launch (PDL) и спекулятивное декодирование. В режиме Ultrafast скорость достигает 2000 токенов/с, а в режиме Standard — 50 токенов/с на пользователя. Для задач RL (обучения с подкреплением) оптимизированный рантайм на 8 GPU выдает до 2122 токенов/с на один поток, сокращая латентность полного цикла спекулятивного декодирования с 12.3 мс до 3.4 мс (экономия 72.4%).

Результаты бенчмарков

Модель демонстрирует сильные результаты в задачах программирования и AI-исследований. Ниже приведено сравнение с ключевыми конкурентами в сложных инженерных задачах:

Бенчмарк Naive-N0.5-Flash Конкуренты (примеры)
SWE-Bench Pro Высокий уровень решения GPT-5.6-Sol, Opus-5, Opus-5.5
DeepSWE v1.1 Конкурентоспособно Muse-Spark-1.3, GPT-5.6-Sol, Opus-5
Terminal-Bench 2.1 Высокий уровень GPT-6-Astra, Muse-Spark-1.3, Opus-5
FrontierSWE v1 Доминирующий счет Сравнение с лидерами на 23.08.2026
ProgramBench (Almost@1) Высокий уровень GPT-5.6-Sol, Opus-5

AI-центричный R&D и цена

Модель создана с использованием AI-центричного подхода к исследованиям: ИИ-агенты самостоятельно писали код, запускали эксперименты и оптимизировали архитектуру, а люди задавали направление. Весы модели и код инференса опубликованы под лицензией MIT. Доступ через API будет стоить $0.10 за входные токены, $0.40 за выходные и $0.01 за чтение кэша (на миллион токенов).

Бенчмарки

БенчмаркGPT-5.6-LunaGPT-5.6-SolGPT-6-AstraGemini-3.5-FlashGemini-3.6-FlashGrok-4.5Muse-Spark-1.3Opus-5Opus-5.5
SWE-Bench Pro—0%—————0%0%
DeepSWE v1.1—0%————0%0%0%
Terminal-Bench 2.1—0%0%———0%0%—
ALE-CLI—0%0%———0%0%—
ProgramBench—0%—————0%—
MLE-bench-300positi——0positi0positi0positi———

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Naive ↗