Архитектура и ключевые характеристики
Naive-N0.5-Flash — это гибридная MoE-модель объемом 309 миллиардов параметров, из которых активными являются 15.5 миллиарда. Ключевое отличие архитектуры: полное отсутствие слоев с полным вниманием (full attention). Модель использует комбинацию Sliding-Window Attention (SWA) и легковесного DeepSeek Sparse Attention (DSA) с GQA4 в соотношении 5:1. Это позволяет работать с нативным контекстом в 1 миллион токенов, сохраняя высокую эффективность.
Производительность и NaiveRT
Для обеспечения скорости инференса NaiveAI разработала собственную систему NaiveRT. Она использует мегакernel-фьюжн, Programmatic Dependent Launch (PDL) и спекулятивное декодирование. В режиме Ultrafast скорость достигает 2000 токенов/с, а в режиме Standard — 50 токенов/с на пользователя. Для задач RL (обучения с подкреплением) оптимизированный рантайм на 8 GPU выдает до 2122 токенов/с на один поток, сокращая латентность полного цикла спекулятивного декодирования с 12.3 мс до 3.4 мс (экономия 72.4%).
Результаты бенчмарков
Модель демонстрирует сильные результаты в задачах программирования и AI-исследований. Ниже приведено сравнение с ключевыми конкурентами в сложных инженерных задачах:
| Бенчмарк | Naive-N0.5-Flash | Конкуренты (примеры) |
|---|---|---|
| SWE-Bench Pro | Высокий уровень решения | GPT-5.6-Sol, Opus-5, Opus-5.5 |
| DeepSWE v1.1 | Конкурентоспособно | Muse-Spark-1.3, GPT-5.6-Sol, Opus-5 |
| Terminal-Bench 2.1 | Высокий уровень | GPT-6-Astra, Muse-Spark-1.3, Opus-5 |
| FrontierSWE v1 | Доминирующий счет | Сравнение с лидерами на 23.08.2026 |
| ProgramBench (Almost@1) | Высокий уровень | GPT-5.6-Sol, Opus-5 |
AI-центричный R&D и цена
Модель создана с использованием AI-центричного подхода к исследованиям: ИИ-агенты самостоятельно писали код, запускали эксперименты и оптимизировали архитектуру, а люди задавали направление. Весы модели и код инференса опубликованы под лицензией MIT. Доступ через API будет стоить $0.10 за входные токены, $0.40 за выходные и $0.01 за чтение кэша (на миллион токенов).
Бенчмарки
| Бенчмарк | GPT-5.6-Luna | GPT-5.6-Sol | GPT-6-Astra | Gemini-3.5-Flash | Gemini-3.6-Flash | Grok-4.5 | Muse-Spark-1.3 | Opus-5 | Opus-5.5 |
|---|---|---|---|---|---|---|---|---|---|
| SWE-Bench Pro | — | 0% | — | — | — | — | — | 0% | 0% |
| DeepSWE v1.1 | — | 0% | — | — | — | — | 0% | 0% | 0% |
| Terminal-Bench 2.1 | — | 0% | 0% | — | — | — | 0% | 0% | — |
| ALE-CLI | — | 0% | 0% | — | — | — | 0% | 0% | — |
| ProgramBench | — | 0% | — | — | — | — | — | 0% | — |
| MLE-bench-30 | 0positi | — | — | 0positi | 0positi | 0positi | — | — | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Naive ↗
