Революция в самосовершенствовании: от данных к процессу
Ornith-1.5 — это не просто новая весовая загрузка, а фундаментальный сдвиг в парадигме обучения LLM. В отличие от Ornith-1.0, опиравшейся на Qwen3.5 и Gemma 4, новая система использует полный цикл self-scaffolding. Модель больше не ждет человеческих датасетов: она сама генерирует задачи, создает для них специфические «скелеты» (scaffolds) с инструментами и стратегиями, а затем решает их для обучения через подкрепление (RL). Это создает замкнутый контур, где улучшение политики модели позволяет генерировать более сложные задачи, которые, в свою очередь, толкают модель к новым высотам.
Бенчмарки: сравнение с лидерами рынка
Ornith-1.5 представлена в трех масштабах: 397B (MoE), 35B (MoE) и 9B (Dense). Флагманская модель 397B демонстрирует результаты, сопоставимые с Claude Opus 4.8, и значительно превосходит другие открытые модели. Особое внимание привлекает эффективность архитектуры MoE: модель активирует всего 3B параметров на токен, но выигрывает у плотных моделей в 30B+ параметров.
| Модель | Тип | Terminal-Bench 2.1 | DeepSWE / SWE-Bench | Примечание |
|---|---|---|---|---|
| Ornith-1.5-397B | MoE (397B) | 86.1 | 56.0 (DeepSWE) | Сопоставимо с Claude Opus 4.8 (85.0 / 59.0) |
| Claude Opus 4.8 | Proprietary | 85.0 | 59.0 | Референс для сравнения |
| GLM-5.2 | Open Source | 82.7 | 46.2 | Уступает Ornith-1.5-397B |
| DeepSeek-V4-Flash | Open Source | 82.7 | 54.4 | Уступает Ornith-1.5-397B |
| Ornith-1.5-35B | MoE (35B, 3B active) | 68.5 | 79.0 (SWE-Bench Verified) | Бьет Gemma 4-31B и Muse Glimmer-30B |
| Gemma 4-31B | Dense (31B) | 43.4 | 52.0 | Значительно слабее Ornith-1.5-35B |
| Ornith-1.5-9B | Dense (9B) | 47.0 | 70.6 (SWE-Bench Verified) | Работает на iPhone/Android, бьет Qwen 3.6-35B |
Математика самосовершенствования: Reward Function
Ключ к успеху Ornith-1.5 — алгоритмическая оценка генерируемых задач. Система не просто проверяет правильность ответа, а использует сложную функцию вознаграждения R_task, состоящую из трех множителей:
- Validity (V): Является ли задача корректной и верифицируемой? Если скелет (scaffold) не работает, награда равна 0.
- Frontier Difficulty (D): Задача должна находиться на границе возможностей модели. Оптимальная частота успеха установлена на уровне 20% (
p* = 0.2). Это предотвращает генерацию слишком простых или заведомо нерешаемых задач. - Novelty (N): Задача должна быть новой. Система использует буфер предыдущих задач, чтобы избежать дублирования и стимулировать разнообразие.
Такой подход заставляет модель постоянно искать «слепые зоны» в своих знаниях и заполнять их, создавая собственную учебную программу (curriculum), которая эволюционирует вместе с能力提升 модели.
Доступность и применение
Одной из главных особенностей Ornith-1.5 является ее масштабируемость. Версия Ornith-1.5-9B-Mobile оптимизирована для развертывания на мобильных устройствах (iOS и Android). Несмотря на компактный размер, она превосходит по качеству кода и рассуждений такие модели, как Qwen 3.6-35B и Gemma 4-31B, что открывает путь к мощным агентам на edge-устройствах без облачной инфраструктуры.
Бенчмарки
| Бенчмарк | Ornith-1.5-35B | Ornith-1.5-397B | Ornith-1.5-9B | Claude Opus 4.8 | DeepSeek-V4-Flash-0731 | GLM-5.2 | Gemma 4-31B | Meta’s Muse Glimmer-30B |
|---|---|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | — | 86.1% | — | 85% | 82.7% | 82.7% | — | — |
| DeepSWE | — | 56% | — | 59% | 54.4% | 46.2% | — | — |
| SWE-Bench Verified | 79% | — | 70.6% | — | — | — | 52% | 76% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Ornith ↗
