DataEval/dingo

Dingo: A Comprehensive AI Data, Model and Application Quality Evaluation Tool

Данные⭐ 756Pythonпоследний релиз: v2.5.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Dingo — это инструмент для комплексной оценки качества данных, моделей и приложений в ИИ, позволяющий проверять датасеты и системы RAG с помощью правил и LLM.

Зачем нужен

Инструмент помогает ML-инженерам и исследователям систематически оценивать качество обучающих данных, датасетов для тонкой настройки и продакшн-систем. Он полезен для выявления проблем с качеством данных, обнаружения галлюцинаций и валидации RAG-систем до их развертывания.

Что можно реализовать

  • Валидация и очистка данных для обучения и тонкой настройки LLM
  • Обнаружение галлюцинаций в ответах генеративных моделей
  • Оценка качества систем RAG (Retrieval-Augmented Generation) по 5 метрикам
  • Проверка качества данных в SQL-базах, S3 и HuggingFace датасетах
  • Автоматизированный контроль качества данных в ML-пайплайнах

Ключевые возможности

  • Гибридный подход: сочетание 30+ встроенных эвристических правил и оценки на основе LLM
  • Поддержка мультиисточниковых данных: локальные файлы, SQL (PostgreSQL/MySQL/SQLite), S3, HuggingFace
  • Оценка RAG-систем с использованием академически обоснованных метрик
  • Масштабируемость: запуск локально или через Spark для датасетов миллиардного масштаба
  • Наличие SaaS-версии с Web UI, визуальными отчетами и RESTful API

👤 Кому подойдёт: ML-практики, инженеры данных, AI-исследователи и команды, занимающиеся разработкой и поддержкой LLM и RAG-систем

Релизы

v2.5.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз Dingo v2.5.0: добавлены клиенты для поиска в научных базах, поддержка LiteLLM, новые метрики и правила валидации.

  • Added: Добавлены клиенты для Semantic Scholar, Google Scholar, OpenAlex и Meta-Search, а также поддержка LiteLLM как AI-шлюза.
  • Added: Расширены возможности оценки: добавлены метрики для retrieval, поддержка fuzzy matching, raw API метрик и open-eval режима.
  • Added: Внедрены новые инструменты валидации: LLMAISmell для проверки требований, LLMAgent-оценщики для мониторинга агентов и правила по ГОСТ.
  • Added: Модель RuleHallucinationHHEM переключена на базовую модель MiniCheck-Flan-T5-Large для повышения точности.
  • Fixed: Исправлена ошибка UnboundLocalError в LLMPerspective и исправлен пример использования HHEM.
v2.4.0minor
🕐 3 мес назад · релиз на GitHub ↗

Релиз Dingo v2.4.0: новые метрики LLM, поддержка Mineru, кастомные правила и улучшение стабильности.

  • Added: Добавлены новые метрики: LLMHtmlExtractCompareV3, RuleDictConsistency и настраиваемый LLMCustomRule.
  • Added: Внедрена поддержка формата Mineru и унифицирован загрузчик изображений с добавлением User-Agent.
  • Added: Обновлены промпты для проверки таблиц и уравнений, а также логика оценки BaseTextQuality по score.
  • Fixed: Исправлена метрика LLMHtmlExtractCompareV2, оптимизирована сортировка RequiredField и тип ответа V3.
  • Added: Добавлен общий таймаут для ArticleFactChecker и поддержка arXiv, а также инъекция конфигурации LLM в локальный executor.