Корпоративные AI-агенты часто демонстрируют высокую общую эрудицию, но проваливаются в специфичных рабочих процессах: не соблюдают политики безопасности, неправильно комбинируют инструменты или игнорируют состояние базы данных. Проблема не в отсутствии данных, а в их релевантности. ServiceNow CoreAI представила AutoSynthData — систему, которая автоматически превращает ошибки целевой модели в структурированные обучающие выборки, используя более мощную модель-учителя (teacher model).
01Архитектура задачи: от провала к спецификации
Ключевая идея AutoSynthData заключается в анализе различий между поведением целевой модели (target) и учителя. Система не просто генерирует случайные запросы, а выделяет конкретные пробелы в компетенциях. Процесс начинается с диагностики:
- Идентификация провала: Запуск целевой модели на эталонных задачах (например, в среде EnterpriseOps Gym) выявляет паттерны ошибок.
- Анализ учителя: Более сильная модель успешно решает те же задачи, демонстрируя корректную траекторию действий.
- Создание Capability Cards: На основе сравнения формируются «карточки спецификаций способностей». Они описывают, какой навык нужно отработать, какие инструменты задействованы и где именно целевая модель ошибается, не раскрывая исходные промпты или состояния базы данных.
02Двухэтапная генерация данных
Процесс создания датасета разделен на два последовательных этапа, обеспечивающих как качество, так и разнообразие данных.
1. Target Phase (Базовые образцы)
На этом этапе создаются «якорные» примеры. Параллельные воркеры генерируют задачи, которые затем проходят строгую валидацию:
- Оценка сложности: Задача должна быть решена целевой моделью заметно реже, чем учителем. Это гарантирует, что задача находится в зоне ближайшего развития модели.
- Верификация: Проверка на выполнимость (feasibility), реалистичность (realism) и наличие корректного верификатора.
- Ремонт (Repair): Если задача не проходит проверку, система пытается исправить её параметры перед добавлением в датасет.
2. Multiply Phase (Масштабирование)
После формирования базового набора AutoSynthData создает вариации. Для каждого принятого образца генерируются новые версии с измененными:
- Сущностями (имена пользователей, ID инцидентов и т.д.).
- Начальным состоянием среды.
- Комбинациями инструментов.
- Формулировкой запроса пользователя.
Важное ограничение: сгенерированный вариант не может стать основой для следующей итерации умножения. Это предотвращает дрейф качества (drift) и удерживает выборку привязанной к проверенным базовым образцам.
03Требования к полезной задаче (Agentic Task)
Для того чтобы сгенерированный пример был полезен для SFT (Supervised Fine-Tuning), он должен соответствовать строгому набору критериев. Это отличает корпоративные агенты от простых чат-ботов.
| Критерий | Описание | Пример провала |
|---|---|---|
| Feasibility (Выполнимость) | Существует ли траектория, удовлетворяющая запросу и правилам системы? | Агент пытается использовать API, которого нет в доступных инструментах. |
| Realism (Реалистичность) | Похож ли запрос на реальный запрос пользователя в этой среде? | Абсурдные или искусственно усложненные формулировки, не встречающиеся в бизнес-процессах. |
| Difficulty (Сложность) | Открывает ли задача слабость текущей модели? | Задачи, которые модель решает слишком часто, не дают градиента обучения. |
| Verifier Consistency | Согласуется ли проверка результата с намерением пользователя? | Верификатор помечает как успешный результат, который нарушает политику безопасности. |
04Техническая реализация и интеграция
Архитектура AutoSynthData разделяет контроль генерации и выполнение в среде. Это позволяет использовать один и тот же генератор для разных корпоративных платформ (ServiceNow, Salesforce и др.) через адаптеры.
Ключевые компоненты пайплайна:
- Shared Controller: Управляет качеством, покрытием сценариев и сборкой датасета.
- Environment Adapter: Отвечает за выполнение задач, управление состоянием, воспроизведение эталонных траекторий и детерминированную верификацию.
Для локального внедрения или кастомизации под свои нужды, вам потребуется настроить среду, где агенты могут безопасно выполнять действия (sandbox), и предоставить доступ к модели-учителю (например, Qwen-2.5-72B или аналогам с большим контекстом) для генерации эталонных траекторий.
Источник: Hugging Face ↗
