ConardLi/easy-dataset

A powerful tool for creating datasets for LLM fine-tuning 、RAG and Eval

Обучение⭐ 14 935JavaScriptпоследний релиз: 1.7.3
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Easy Dataset — это инструмент с графическим интерфейсом для создания структурированных датасетов из документов, предназначенных для дообучения LLM, RAG и оценки моделей.

Зачем нужен

Инструмент автоматизирует сложный процесс подготовки данных: парсит документы (PDF, DOCX, Markdown), интеллектуально сегментирует текст, генерирует вопросы и ответы с помощью LLM, а также очищает данные. Это позволяет быстро получать качественные датасеты для fine-tuning и RAG без написания скриптов.

Что можно реализовать

  • Создание датасетов для fine-tuning (SFT) на основе внутренней документации компании.
  • Генерация тестовых наборов (test sets) для оценки качества RAG-систем и вертикальных LLM.
  • Проведение слепых сравнительных тестов (Arena) между несколькими моделями для оценки их ответов.
  • Автоматическое извлечение вопросов и ответов (QA) из неструктурированных текстовых документов.

Ключевые возможности

  • Поддержка широкого спектра форматов документов и алгоритмов интеллектуального разделения текста (chunking).
  • Встроенная система оценки моделей: автоматическая проверка через Judge Model и слепые тесты (Human Blind Test).
  • Прямая интеграция с LLaMA Factory для генерации конфигурационных файлов и загрузка датасетов в Hugging Face Hub.
  • Генерация данных разных типов: одно- и многотуровые диалоги, Image QA, а также дистилляция данных из тематик.
  • Кроссплатформенность: работает как веб-приложение, так и в виде десктопных клиентов для Windows, macOS и Linux.

👤 Кому подойдёт: ML-инженеры, разработчики LLM-приложений, исследователи и специалисты по данным, занимающиеся подготовкой датасетов для fine-tuning, RAG и оценки моделей.

Релизы

1.7.3minor
🕐 5 мес назад · релиз на GitHub ↗

Добавлена поддержка MiniMax, активная генерация COT и турецкий/итальянский языки; исправлены лаги и ошибки Ollama.

  • Added: Добавлена встроенная поддержка провайдера MiniMax
  • Added: Реализована активная генерация COT для обеспечения наличия цепочек мышления в датасетах
  • Added: Добавлена локализация на турецкий и итальянский языки
  • Fixed: Устранены зависания интерфейса при обработке больших объемов данных для дистилляции
  • Fixed: Исправлена обработка цепочек мышления (COT) при оценке моделей через Ollama