Инструменты13 августа 2026 г., 07:18 МСК🤖 Auto

Distribird: AI-агенты для создания априорных распределений в байесовской калибровке

Исследователи представили Distribird — систему на базе мультиагентных LLM, которая автоматически извлекает данные из научной литературы для построения информативных априорных распределений, заменяя устаревшие равномерные prior-ы.

Баннер новости 5669

Проблема: доминирование равномерных prior-ов

Байесовская калибровка процессных моделей требует задания априорных распределений для параметров. Несмотря на десятилетия методологических разработок, исследователи по-прежнему массово используют равномерные (uninformative) prior-ы. Причина проста: создание информативных prior-ов на основе научной литературы требует огромных затрат времени и сочетания экспертизы в предметной области и статистике.

Решение: Distribird и мультиагентный пайплайн

Команда авторов (Patrik P. Süli, György Eigner, Roland Hollós) представила Distribird — веб-приложение с агентами, которое автоматизирует этот процесс. Система работает по следующему алгоритму:

  • Получает имя параметра, его физическое описание и контекст домена.
  • Запускает мультиагентный пайплайн для поиска в литературе.
  • Извлекает и взвешивает reported values (отчетные значения) на основе релевантности домена.
  • Подбирает вероятностное распределение с помощью отбора моделей по критерию AIC (Akaike Information Criterion).

Если литературы нет, система предлагает разумные неинформативные альтернативы и четко указывает уровень уверенности и доказательную базу каждого prior-а.

Безопасность и прозрачность

Ключевое преимущество Distribird перед прямым запросом к LLM — локальное выполнение всех вызовов. Пользователь не передает описания параметров или unpublished modelling detail третьим лицам; в публичные базы данных отправляются только сгенерированные поисковые запросы. Кроме того, встроенный слой валидации отказывается генерировать prior-ы для запросов вне области применения, в то время как базовые модели часто выдают уверенные, но необоснованные ответы.

Результаты сравнения моделей

Инструмент протестирован на 24 параметрах в 10 научных доменах. Сравнение проводилось между полным пайплайном Distribird и базовой линией single-prompt LLM. Использовались три открытые модели: Qwen3.6 27B, Gemma 4 31B и Mistral Small 4 119B.

Критерий оценки Distribird (полный пайплайн) Single-prompt LLM baseline
Качество prior-ов Соответствует базовой линии Базовый уровень
Трассируемость (Traceability) Каждый prior связан с конкретными статьями и значениями Отсутствует
Валидация (Out-of-scope) Отказ в генерации для неподходящих запросов Генерирует уверенные, но ложные prior-ы в 11 из 30 случаев
Конфиденциальность данных Локальный запуск, нет передачи данных провайдеру Требует передачи данных стороннему провайдеру

Почему это важно

Авторы подчеркивают, что для научных задач свойства прозрачности, безопасности и валидации важнее маргинального улучшения точности точечных оценок. Distribird снижает барьер для использования байесовских методов, делая их доступными для исследователей без глубокой статистической подготовки.

Источник: arXiv cs.AI ↗