neuml/txtai

💡 Всесторонняя AI-платформа для семантического поиска, оркестрации LLM и рабочих процессов языковых моделей

RAG⭐ 12 965Pythonпоследний релиз: v9.13.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

txtai — это фреймворк на Python, объединяющий векторный поиск, оркестрацию LLM и создание языковых рабочих процессов в единой базе данных на основе эмбеддингов.

Зачем нужен

Инструмент позволяет быстро создавать приложения с семантическим поиском и RAG, объединяя векторные индексы, графы и реляционные базы данных. Он упрощает разработку автономных агентов и многоэтапных пайплайнов, обеспечивая локальное выполнение и наличие встроенного API.

Что можно реализовать

  • Семантический поиск по документам, аудио, изображениям и видео
  • Построение систем RAG (Retrieval Augmented Generation) для ответов на вопросы
  • Создание автономных AI-агентов, соединяющих базы знаний и модели
  • Автоматизация задач: суммаризация, перевод, транскрипция и классификация текста
  • Запуск микросервисов с API для интеграции с JS, Java, Rust и Go

Ключевые возможности

  • Единая база данных, сочетающая векторные индексы (sparse/dense), графы и SQL
  • Поддержка мультимодальных данных: текст, документы, аудио, изображения, видео
  • Встроенный API (FastAPI) и поддержка Web/MCP протоколов
  • Работа локально без отправки данных в облако, масштабируемость через контейнеры
  • Готовые решения «из коробки» (batteries included) с поддержкой Python 3.10+

👤 Кому подойдёт: Разработчики AI-приложений, инженеры данных и исследователи, создающие прототипы или продакшн-решения с использованием LLM, RAG и семантического поиска.

Релизы

v9.13.0minor
🕐 25 дн назад · релиз на GitHub ↗

Добавлен LEMUR, улучшено late-interaction и MUVERA, исправлены ошибки в индексации и ранжировании.

  • Added: Добавлен LEMUR — обученное многовекторное извлечение.
  • Added: Добавлен max pooling и настраиваемое mean centering для late pooling.
  • Added: Расширены возможности late-interaction извлечения.
  • Fixed: Исправлены ошибки в ранжировании CrossEncoder, индексации табличных данных и обработке удалённых записей.
  • Fixed: Исправлены проблемы с импортами safetensors, выбором сообщений OpenAI и сборкой на Windows.
v9.12.0minor
🕐 1 мес назад · релиз на GitHub ↗

Добавлена поддержка векторных бэкендов zvec и milvus-lite, отключены API-маршруты и исправлено множество ошибок.

  • Added: Добавлена поддержка векторного бэкенда zvec.
  • Added: Добавлен встроенный плотный ANN-бэкенд milvus-lite.
  • Added: Появилась возможность отключать отдельные API-маршруты.
  • Fixed: Исправлены ошибки в SQL-запросах, поиске HNSW и работе с пустыми индексами.
  • Fixed: Устранены падения Task, Graph и Scoring при некорректных данных или отсутствующих ключах.
v9.11.0minor
🕐 2 мес назад · релиз на GitHub ↗

Добавлены бэкенд turbovec для ANN и извлечение текста через LiteParse, улучшена работа с ggml и FastAPI.

  • Added: Добавлен бэкенд turbovec для приближенного поиска ближайших соседей (ANN).
  • Added: Реализовано извлечение текста с помощью LiteParse.
  • Added: Добавлен параметр reindex для API и поддержка нескольких слоев Dense для Late Interaction Pooling.
  • Fixed: Исправлена работа токенизатора с флагом lowercase=False в ngramtokenize.
  • Fixed: Устранена несовместимость с изменениями в роутерах FastAPI версии 0.137 и выше.
  • Выполнен переход с ggml-py на ggml-python и откат временного фикса логирования.