Проблема длинных горизонтов в научном анализе
Агенты на базе больших языковых моделей (LLM) демонстрируют потенциал в задачах научного открытия, но их эффективность ограничена отсутствием сред с процессным контролем. Традиционные подходы часто страдают от того, что агент может сделать неверный шаг на ранней стадии, который невозможно исправить на поздних этапах сложного многошагового анализа. Отсутствие возможности верифицировать прогресс «на лету» снижает надежность выводов.
Архитектура SciDisco и SciThèque
Авторы предлагают фреймворк SciDisco, который решает эту проблему через создание специализированных сред обучения. Ключевым компонентом является SciThèque — система, которая компилирует гипотезы, наборы данных, скрытые графы доказательств и верификаторы в единые задачи. Это позволяет проверять аналитический прогресс агента в каждый момент взаимодействия.
Для обучения используется метод DAG-grounded trajectory synthesis. Он строит многошаговые демонстрации, фильтруя их через верификаторы, чтобы оставить только те траектории, где каждый шаг логически обоснован и подтвержден данными.
Механизм DiscoPO и кредитование действий
Центральным нововведением является алгоритм DiscoPO (Discourse Process Optimization). В отличие от стандартного RLHF, где награда присваивается только за финальный результат, DiscoPO использует среду как источник сигнала для обучения. Он присваивает кредит на уровне каждого хода (turn-level credit) действиям, которые приводят к верифицируемому аналитическому доказательству. Это позволяет модели учиться не только тому, какой ответ правильный, но и тому, как правильно строить путь к этому ответу.
Результаты и сравнение
Эксперименты показали, что модель SciDisco-14B достигает состояния-of-the-art (SOTA) на бенчмарках гипотезо-управляемого научного анализа данных. Ниже приведена сводка ключевых характеристик подхода:
| Компонент/Метрика | Описание/Значение |
|---|---|
| Модель | SciDisco-14B (14 миллиардов параметров) |
| Ключевая среда | SciThèque (гипотезы, данные, графы доказательств) |
| Метод обучения | Turn-Level Agentic RL с алгоритмом DiscoPO |
| Тип верификации | Process-supervised (пошаговый контроль) |
| Результат | SOTA на бенчмарках научного анализа данных |
Значение для индустрии
Работа открывает путь к созданию автономных научных ассистентов, способных проводить сложные исследования без постоянного вмешательства человека. Возможность верифицировать каждый шаг анализа критически важна для доверия к AI в таких областях, как медицина, химия и физика, где ошибка в логической цепочке может привести к неверным выводам.
Источник: arXiv cs.AI ↗
