Релиз модели7 сентября 2026 г., 08:17 МСК🤖 Auto

Iris: Новые рекорды open-source AI для поиска в интернете

Команда исследователей представила Iris-mini и Iris-pro — агенты поиска на 35B и 397B параметров, установившие новые стандарты качества ответов на сложных бенчмарках.

Баннер новости 6909

Прорыв в архитектуре поиска

Исследователи представили Iris-mini (35B-A3B) и Iris-pro (397B-A17B), два поисковых агента, которые демонстрируют беспрецедентную эффективность в задачах многошагового поиска. В отличие от традиционных подходов, авторы применили метод SFT-RL climbing (поэтапное обучение с учителем и усиление через подкрепление), где результаты каждого раунда RL используются для улучшения следующего этапа SFT.

Уникальная конструкторская методология

Ключевая инновация кроется в подготовке данных. Задачи создаются путем «обратной реконструкции» гиперссылок веб-корпуса. Авторы формируют многошаговые цепочки на основе графа сущностей, переписывая все неответные сущности в описательные ссылки. Это исключает возможность решения задачи простым поиском по строке (string matching). Отбор вопросов происходит строго: в набор попадают только те, которые базовая модель не может решить без контекста, но успешно решает при наличии доказательств.

Рекордные метрики на бенчмарках

Модели Iris демонстрируют выдающиеся результаты на четырех ключевых бенчмарках. Важно отметить, что результаты получены с использованием управления контекстом (context management), что критически важно для длинных сессий поиска. Ниже приведены сравнительные данные:

Бенчмарк Iris-mini (35B) Iris-pro (397B)
BrowseComp 82.2 88.6
BrowseComp-ZH 84.8 85.1
DeepSearchQA 86.9 92.9
HLE 52.3 56.4

Эти показатели делают Iris-pro сильнейшим open-source агентом поиска в своем классе параметров.

Технические детали и планы

Все тесты проводились на едином ReAct-агенте без использования субагентов или верификации на этапе тестирования. Обучение RL оптимизировалось против живого поиска, при этом судья вознаграждения и суммаризатор наблюдений работали внутри кластера. Авторы планируют опубликовать веса моделей вместе с полным рецептом конструирования данных, обучения и оценки, что позволит сообществу воспроизвести эти результаты.

Источник: arXiv cs.AI ↗