Релиз модели25 сентября 2026 г., 07:22 МСК🤖 Auto

Pistis: Qwen-модели с IDRL-фреймворком для агентов и рассуждений

Исследователи представили семейство мультимодальных моделей Pistis (9B и 27B) на базе Qwen3.5/3.6, использующую новую парадигму обучения IDRL, объединяющую дистилляцию и RL.

Баннер новости 8237

Новая архитектура обучения IDRL

Команда разработчиков представила семейство моделей Pistis, состоящее из версий на 9B и 27B параметров. В основе архитектуры лежат модели Qwen3.5 и Qwen3.6 соответственно. Ключевым нововведением стал фреймворк пост-обучения Interleaved Distillation and Reinforcement Learning (IDRL).

В отличие от традиционных методов, где дистилляция знаний и обучение с подкреплением (RL) выполняются последовательно или через статическую комбинированную функцию потерь, IDRL интегрирует эти процессы в единый цикл. Алгоритм чередует задачи on-policy дистилляции и RL, что обеспечивает:

  • Более эффективную передачу знаний;
  • Повышенную стабильность оптимизации;
  • Точное распределение заслуг (credit assignment) для длинных агентных траекторий.

Специализированные варианты: Thinking и Agentic

На базе общей архитектуры созданы две специализированные версии, каждая из которых решает конкретные задачи:

  • Pistis-Thinking: сфокусирована на углубленном мультимодальном рассуждении (deep multimodal reasoning).
  • Pistis-Agentic: дополнительно обучена на данных агентных траекторий, что позволяет ей выполнять долгосрочное планирование, итеративное рассуждение и использование инструментов (tool use). Эта версия демонстрирует выдающиеся результаты в задачах мультимодального поиска.

Системная оптимизация Pistis-Auto-Harnessing

Помимо оптимизации параметров модели, авторы внедрили метод Pistis-Auto-Harnessing (PAH). Это системный подход, который автоматически улучшает среду вывода (inference harness) через итеративную оптимизацию. Важно отметить, что PAH повышает производительность агента без обновления параметров модели и без увеличения бюджета взаимодействий.

Результаты сравнения

Эксперименты подтверждают, что обе версии Pistis превосходят свои базовые модели (Qwen3.5/3.6). Ниже приведена структура семейства моделей и их ключевые характеристики:

Модель Базовая архитектура Параметры Ключевая специализация
Pistis-9B Qwen3.5 9B Agentic / Thinking (масштаб 9B)
Pistis-27B Qwen3.6 27B Agentic / Thinking (масштаб 27B)

Работа демонстрирует перспективность гибридного подхода к пост-обучению, позволяющего создавать более надежных и умных мультимодальных агентов.

Источник: arXiv cs.AI ↗