Отказ от семплирования: новый подход к данным
Компания Adaption Labs выпустила функцию Invent a Dataset, позволяющую генерировать структурированные обучающие наборы данных непосредственно из текстового описания желаемого поведения модели. В отличие от традиционных методов, этот инструмент не требует наличия исходного корпуса (seed corpus), предопределенной схемы или руководства по разметке. Это решает проблему, когда релевантный сигнал для проприетарных задач скрыт в неструктурированных логах или внутренних системах и не конвертируется в чистый тренировочный набор.
Техническая реализация и контроль
Генерация работает через асинхронный API. Пользователь вызывает datasets.invent, указывая доменные коды (например, medical или medical.symptoms_diagnosis) и текстовый промпт до 10 000 символов. Результат можно получить в форматах JSONL, JSON, CSV или Parquet. Ключевые параметры включают estimate=True для проверки баланса кредитов и idempotency_key для безопасных повторных попыток.
Форматы вывода и локализация
Инструмент поддерживает два основных формата данных для разных методов обучения:
- instruction_dataset (по умолчанию): пары «запрос-ответ» для SFT (Supervised Fine-Tuning).
- preference_pairs: пары выбранных и отклоненных ответов для обучения с предпочтениями (DPO).
Дополнительно доступна функция language_expansion с режимами translate (простой перевод) и localize (адаптация под культуру), что позволяет масштабировать датасеты на несколько языков с контролем выборки через параметр sample_rate.
Интеграция с AutoScientist и метрики
Invent a Dataset является первым звеном в «цикле без данных» (zero-data loop). Сгенерированные ID датасетов передаются в AutoScientist (запущен в мае 2026 года) для совместной оптимизации данных и рецепта обучения. По заявлениям Adaption Labs, использование AutoScientist превосходит ручную настройку обучения на 35%:
| Метрика | До AutoScientist | С AutoScientist |
|---|---|---|
| Win Rate (доля побед в бенчмарках) | 48% | 64% |
| Среднее улучшение качества | База | +35% |
| Размер датасетов (тест) | 5 000 – 100 000 строк | |
| Архитектуры (для SFT) | Together AI | |
Генерация происходит на хостинге Adaption Labs за кредиты, что делает процесс доступным через Python SDK и REST API без необходимости разворачивания собственных инфраструктур для создания данных.
Источник: MarkTechPost ↗
