Исследования7 октября 2026 г., 13:17 МСК🤖 Auto

CuratorMAS: Автономная кураторство датасетов через мультиагентную оркестровку

Исследователи представили CuratorMAS — систему на базе мультиагентной оркестровки, которая автоматизирует очистку данных, снижая уровень шума на 36% и повышая точность моделей.

Баннер новости 9103

Проблема ручного курирования

Качественные датасеты — фундамент надежного машинного обучения, однако процесс их подготовки (curation) остается дорогостоящим и сложным для масштабирования. Существующие подходы часто опираются на вручную разработанные эвристики или сигналы, зависящие от конкретных моделей, что ограничивает их применимость в разных доменах и задачах. Авторы работы Yixin Zhang и Wenjie Feng предлагают решение, устраняющее эти узкие места через автоматизацию.

Архитектура CuratorMAS

CuratorMAS — это фреймворк мультиагентного взаимодействия, который разбивает сложный процесс курирования на пять программируемых этапов, образующих параллелизируемый рабочий процесс. Система не просто фильтрует данные, а «понимает» контекст задачи:

  • Исследование (Exploration): сбор контекстной информации, такой как структура файлов и ограничения.
  • Обогащение (Augmentation): извлечение актуальных знаний из онлайн-источников для оценки.
  • Критерии и метрики: автоматический вывод необходимых стандартов качества.
  • Фильтрация: исполнение отбора данных на основе метрик.
  • Эволюция: модуль, суммирующий результаты и обновляющий навыки агентов.

Ключевые метрики эффективности

Эксперименты показали значительное улучшение качества данных и, как следствие, производительности downstream-моделей. Система способна существенно снижать уровень шума в выборках.

Метрика Результат Значение для индустрии
Снижение уровня шума до 36.03 pp (процентных пунктов) Значительная очистка данных от мусора без участия человека
Улучшение F1-счета до 8.88 pp Прямое повышение точности моделей, обученных на очищенных данных

Почему это важно

CuratorMAS демонстрирует переход от статических правил к динамическому, адаптивному курированию данных. Способность системы извлекать знания из интернета и эволюционировать делает её универсальным инструментом для подготовки данных в условиях быстро меняющихся доменов, что критически важно для современных LLM и специализированных AI-решений.

Источник: arXiv cs.AI ↗