Релиз модели20 августа 2026 г., 13:45 МСК🤖 Auto

Ornith-1.5: Самообучающаяся модель, бьющая Claude Opus 4.8

Команда Ornith представила архитектуру с замкнутым циклом самосовершенствования. Флагман Ornith-1.5-397B достиг результатов уровня Claude Opus 4.8, а мобильная версия 9B обходит аналоги в 3-4 раза больше.

Баннер новости 6153

Революция в самосовершенствовании: от данных к процессу

Ornith-1.5 — это не просто новая весовая загрузка, а фундаментальный сдвиг в парадигме обучения LLM. В отличие от Ornith-1.0, опиравшейся на Qwen3.5 и Gemma 4, новая система использует полный цикл self-scaffolding. Модель больше не ждет человеческих датасетов: она сама генерирует задачи, создает для них специфические «скелеты» (scaffolds) с инструментами и стратегиями, а затем решает их для обучения через подкрепление (RL). Это создает замкнутый контур, где улучшение политики модели позволяет генерировать более сложные задачи, которые, в свою очередь, толкают модель к новым высотам.

Бенчмарки: сравнение с лидерами рынка

Ornith-1.5 представлена в трех масштабах: 397B (MoE), 35B (MoE) и 9B (Dense). Флагманская модель 397B демонстрирует результаты, сопоставимые с Claude Opus 4.8, и значительно превосходит другие открытые модели. Особое внимание привлекает эффективность архитектуры MoE: модель активирует всего 3B параметров на токен, но выигрывает у плотных моделей в 30B+ параметров.

Модель Тип Terminal-Bench 2.1 DeepSWE / SWE-Bench Примечание
Ornith-1.5-397B MoE (397B) 86.1 56.0 (DeepSWE) Сопоставимо с Claude Opus 4.8 (85.0 / 59.0)
Claude Opus 4.8 Proprietary 85.0 59.0 Референс для сравнения
GLM-5.2 Open Source 82.7 46.2 Уступает Ornith-1.5-397B
DeepSeek-V4-Flash Open Source 82.7 54.4 Уступает Ornith-1.5-397B
Ornith-1.5-35B MoE (35B, 3B active) 68.5 79.0 (SWE-Bench Verified) Бьет Gemma 4-31B и Muse Glimmer-30B
Gemma 4-31B Dense (31B) 43.4 52.0 Значительно слабее Ornith-1.5-35B
Ornith-1.5-9B Dense (9B) 47.0 70.6 (SWE-Bench Verified) Работает на iPhone/Android, бьет Qwen 3.6-35B

Математика самосовершенствования: Reward Function

Ключ к успеху Ornith-1.5 — алгоритмическая оценка генерируемых задач. Система не просто проверяет правильность ответа, а использует сложную функцию вознаграждения R_task, состоящую из трех множителей:

  • Validity (V): Является ли задача корректной и верифицируемой? Если скелет (scaffold) не работает, награда равна 0.
  • Frontier Difficulty (D): Задача должна находиться на границе возможностей модели. Оптимальная частота успеха установлена на уровне 20% (p* = 0.2). Это предотвращает генерацию слишком простых или заведомо нерешаемых задач.
  • Novelty (N): Задача должна быть новой. Система использует буфер предыдущих задач, чтобы избежать дублирования и стимулировать разнообразие.

Такой подход заставляет модель постоянно искать «слепые зоны» в своих знаниях и заполнять их, создавая собственную учебную программу (curriculum), которая эволюционирует вместе с能力提升 модели.

Доступность и применение

Одной из главных особенностей Ornith-1.5 является ее масштабируемость. Версия Ornith-1.5-9B-Mobile оптимизирована для развертывания на мобильных устройствах (iOS и Android). Несмотря на компактный размер, она превосходит по качеству кода и рассуждений такие модели, как Qwen 3.6-35B и Gemma 4-31B, что открывает путь к мощным агентам на edge-устройствах без облачной инфраструктуры.

Бенчмарки

БенчмаркOrnith-1.5-35BOrnith-1.5-397BOrnith-1.5-9BClaude Opus 4.8DeepSeek-V4-Flash-0731GLM-5.2Gemma 4-31BMeta’s Muse Glimmer-30B
Terminal-Bench 2.186.1%85%82.7%82.7%
DeepSWE56%59%54.4%46.2%
SWE-Bench Verified79%70.6%52%76%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Ornith ↗