Что такое Plexe и как это работает
Plexe — это инструмент с открытым исходным кодом, который позволяет создавать функциональные модели машинного обучения, описывая задачу на естественном языке. Система работает по принципу агентного подхода: пользователь предоставляет табличный датасет (форматы Parquet, CSV, ORC, Avro) и текстовый запрос (intent), после чего AI-система самостоятельно проходит полный цикл разработки.
Процесс включает анализ данных, выбор метрик, итеративный поиск лучшей архитектуры, оценку устойчивости и финальную упаковку модели. Результатом работы является самодостаточный пакет, готовый к развертыванию в любой среде, без зависимости от самого фреймворка Plexe.
Технические детали и архитектура
В основе Plexe лежит мультиагентная архитектура, состоящая из 14 специализированных AI-агентов, работающих в 6-фазном рабочем процессе. Система поддерживает интеграцию с различными провайдерами LLM через библиотеку LiteLLM, что позволяет гибко маршрутизировать задачи между моделями разных вендоров (OpenAI, Anthropic, Ollama и др.).
Для обучения поддерживаются следующие фреймворки:
- XGBoost
- CatBoost
- LightGBM
- Keras
- PyTorch
Структура выходных данных
По завершении итераций (по умолчанию до 5, настраивается параметром max_iterations) Plexe генерирует структурированную директорию с моделью. Ниже приведена типичная структура выходного пакета:
| Элемент структуры | Описание содержимого |
|---|---|
artifacts/ |
Обученная модель и пайплайн обработки признаков (pickle) |
src/ |
Код инференса, пайплайн и шаблоны обучения |
schemas/ |
JSON-схемы входных и выходных данных |
config/ |
Гиперпараметры модели |
evaluation/ |
Метрики и детальные отчеты об анализе |
model.yaml |
Метаданные модели |
README.md |
Инструкция по использованию с примерами кода |
Установка и конфигурация
Для работы требуется Python версии 3.10–3.12. Установка осуществляется через pip:
pip install plexe
Система поддерживает тонкую настройку через файл config.yaml, где можно задать конкретные модели для разных агентов. Например, для генерации гипотез можно использовать openai/gpt-5-mini, а для обработки признаков — anthropic/claude-sonnet-4-5-20250929.
Также доступна готовая Docker-образ с предустановленными зависимостями (PySpark, Java), что упрощает запуск в изолированной среде. Для визуализации результатов экспериментов встроен дашборд на базе Streamlit.
Почему это важно
Plexe снижает порог входа в машинное обучение, позволяя специалистам, не обладающим глубокими знаниями в коде, создавать рабочие ML-решения. Автоматизация рутинных этапов (выбор метрик, поиск гиперпараметров, упаковка) экономит время Data Scientists, позволяя сосредоточиться на постановке задач и интерпретации результатов. Лицензия Apache-2.0 делает инструмент доступным для коммерческого использования.
Источник: Github ↗
