Новая архитектура обучения IDRL
Команда разработчиков представила семейство моделей Pistis, состоящее из версий на 9B и 27B параметров. В основе архитектуры лежат модели Qwen3.5 и Qwen3.6 соответственно. Ключевым нововведением стал фреймворк пост-обучения Interleaved Distillation and Reinforcement Learning (IDRL).
В отличие от традиционных методов, где дистилляция знаний и обучение с подкреплением (RL) выполняются последовательно или через статическую комбинированную функцию потерь, IDRL интегрирует эти процессы в единый цикл. Алгоритм чередует задачи on-policy дистилляции и RL, что обеспечивает:
- Более эффективную передачу знаний;
- Повышенную стабильность оптимизации;
- Точное распределение заслуг (credit assignment) для длинных агентных траекторий.
Специализированные варианты: Thinking и Agentic
На базе общей архитектуры созданы две специализированные версии, каждая из которых решает конкретные задачи:
- Pistis-Thinking: сфокусирована на углубленном мультимодальном рассуждении (deep multimodal reasoning).
- Pistis-Agentic: дополнительно обучена на данных агентных траекторий, что позволяет ей выполнять долгосрочное планирование, итеративное рассуждение и использование инструментов (tool use). Эта версия демонстрирует выдающиеся результаты в задачах мультимодального поиска.
Системная оптимизация Pistis-Auto-Harnessing
Помимо оптимизации параметров модели, авторы внедрили метод Pistis-Auto-Harnessing (PAH). Это системный подход, который автоматически улучшает среду вывода (inference harness) через итеративную оптимизацию. Важно отметить, что PAH повышает производительность агента без обновления параметров модели и без увеличения бюджета взаимодействий.
Результаты сравнения
Эксперименты подтверждают, что обе версии Pistis превосходят свои базовые модели (Qwen3.5/3.6). Ниже приведена структура семейства моделей и их ключевые характеристики:
| Модель | Базовая архитектура | Параметры | Ключевая специализация |
|---|---|---|---|
| Pistis-9B | Qwen3.5 | 9B | Agentic / Thinking (масштаб 9B) |
| Pistis-27B | Qwen3.6 | 27B | Agentic / Thinking (масштаб 27B) |
Работа демонстрирует перспективность гибридного подхода к пост-обучению, позволяющего создавать более надежных и умных мультимодальных агентов.
Источник: arXiv cs.AI ↗
