Исследования22 сентября 2026 г., 13:19 МСК🤖 Auto

DeepInstructor: AI-рецензент, обученный на 58 тыс. отзывов

Исследователи представили агентную систему DeepInstructor, которая оценивает научные идеи, опираясь на структурированный опыт из 58 607 рецензий, а не только на параметры модели.

Баннер новости 8034

С развитием автоматизированного научного открытия проблема сместилась от генерации идей к их оценке. Большие языковые модели (LLM) теперь способны создавать гипотезы в невиданных масштабах, но существующие системы оценки часто полагаются на «параметрические знания» или неструктурированный поиск, что приводит к поверхностным суждениям. Команда исследователей во главе с Рунгканом Пэем предложила решение — DeepInstructor, агентную систему, которая имитирует мышление человеческого рецензента.

Как работает система

В основе DeepInstructor лежит подход, при котором оценка идеи формулируется как рассуждение на основе структурированного научного опыта. Система строит Experience Graph (Граф опыта), извлеченный из 58 607 рецензий. Для оценки конкретной гипотезы используется агент на базе архитектуры ReAct (Reasoning + Acting), который извлекает специфические доказательства по каждому критерию, обеспечивая прослеживаемость (traceability) вывода.

Для обучения и тестирования авторы также создали датасет DeepInstruct, содержащий контролируемые попарные сравнения идей по трем ключевым параметрам: новизна, значимость и реализуемость.

Результаты и метрики

Эксперименты показали, что DeepInstructor существенно превосходит существующие базовые модели. Ключевые метрики согласованности с человеческими оценками (Human Judgments) значительно улучшились:

Метрика Улучшение Значение
Hit@1 +24.4% Точность выбора лучшего варианта с первой попытки
Hit@2 +29.7% Вероятность, что правильный ответ окажется в топ-2

Почему это важно

Результаты исследования доказывают, что оценка научных идей может быть основана на явном рассуждении над структурированным опытом, а не просто на статистических паттернах LLM. Это открывает путь к созданию более надежных инструментов для фильтрации научных гипотез, экономя время исследователей и рецензентов на ранних этапах научного процесса.

Источник: arXiv cs.CL ↗