Инструменты5 сентября 2026 г., 10:17 МСК🤖 Auto

Adaption Labs Invent a Dataset: Генерация данных без разметки

Adaption Labs представили API Invent a Dataset, который создает обучающие наборы данных на основе текстового описания задачи, исключая этап ручной разметки и использования исходных корпусов.

Баннер новости 6839

Отказ от семплирования: новый подход к данным

Компания Adaption Labs выпустила функцию Invent a Dataset, позволяющую генерировать структурированные обучающие наборы данных непосредственно из текстового описания желаемого поведения модели. В отличие от традиционных методов, этот инструмент не требует наличия исходного корпуса (seed corpus), предопределенной схемы или руководства по разметке. Это решает проблему, когда релевантный сигнал для проприетарных задач скрыт в неструктурированных логах или внутренних системах и не конвертируется в чистый тренировочный набор.

Техническая реализация и контроль

Генерация работает через асинхронный API. Пользователь вызывает datasets.invent, указывая доменные коды (например, medical или medical.symptoms_diagnosis) и текстовый промпт до 10 000 символов. Результат можно получить в форматах JSONL, JSON, CSV или Parquet. Ключевые параметры включают estimate=True для проверки баланса кредитов и idempotency_key для безопасных повторных попыток.

Форматы вывода и локализация

Инструмент поддерживает два основных формата данных для разных методов обучения:

  • instruction_dataset (по умолчанию): пары «запрос-ответ» для SFT (Supervised Fine-Tuning).
  • preference_pairs: пары выбранных и отклоненных ответов для обучения с предпочтениями (DPO).

Дополнительно доступна функция language_expansion с режимами translate (простой перевод) и localize (адаптация под культуру), что позволяет масштабировать датасеты на несколько языков с контролем выборки через параметр sample_rate.

Интеграция с AutoScientist и метрики

Invent a Dataset является первым звеном в «цикле без данных» (zero-data loop). Сгенерированные ID датасетов передаются в AutoScientist (запущен в мае 2026 года) для совместной оптимизации данных и рецепта обучения. По заявлениям Adaption Labs, использование AutoScientist превосходит ручную настройку обучения на 35%:

Метрика До AutoScientist С AutoScientist
Win Rate (доля побед в бенчмарках) 48% 64%
Среднее улучшение качества База +35%
Размер датасетов (тест) 5 000 – 100 000 строк
Архитектуры (для SFT) Together AI

Генерация происходит на хостинге Adaption Labs за кредиты, что делает процесс доступным через Python SDK и REST API без необходимости разворачивания собственных инфраструктур для создания данных.

Источник: MarkTechPost ↗