run-llama/llama_index

LlamaIndex is the leading document agent and OCR platform

RAG⭐ 52 253Pythonпоследний релиз: v0.14.24
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

LlamaIndex — это open-source фреймворк для создания агентов и приложений, работающих с данными, а также платформа LlamaParse для OCR и извлечения информации из документов.

Зачем нужен

Инструмент решает задачу эффективной интеграции внешних данных (документов, баз данных) с LLM для построения RAG-приложений и агентов. Он полезен тем, что предоставляет готовые компоненты для парсинга, индексации и взаимодействия с данными, а также обширную экосистему интеграций.

Что можно реализовать

  • Создание чат-ботов, которые отвечают на вопросы по внутренней документации компании
  • Извлечение структурированных данных из сканированных документов или PDF с помощью LlamaParse
  • Построение агентов, которые самостоятельно выполняют запросы к различным источникам данных
  • Интеграция LLM с существующими базами данных и API для анализа информации

Ключевые возможности

  • Два варианта установки: стартовый пакет с базовыми интеграциями или кастомная сборка из ядра и плагинов
  • Поддержка более 300 интеграционных пакетов для работы с разными LLM, embedding-моделями и векторными хранилищами
  • Enterprise-платформа LlamaParse для агентов OCR, парсинга и индексации документов
  • Четкое разделение импортов на core-компоненты и интеграционные пакеты
  • Активное сообщество и открытая документация для быстрого старта

👤 Кому подойдёт: разработчики, создающие приложения на базе LLM, и бизнес, нуждающийся в автоматизации работы с неструктурированными данными

Релизы

v0.14.24minor
🕐 1 мес назад · релиз на GitHub ↗

Исправления ядра, поддержка Claude Sonnet 5 и Opus 5, улучшена работа с памятью и цитированием.

  • Added: Добавлена поддержка моделей Claude Sonnet 5 и Opus 5 в провайдерах Anthropic и Bedrock Converse.
  • Fixed: Исправлена работа AgentWorkflow с параметрами *args/**kwargs и сохранение истории чата в нескольких блоках.
  • Fixed: Улучшена работа IngestionPipeline: теперь сохраняются все узлы документов при апдейте.
  • Added: Memory теперь принимает любые AsyncDBChatStore, а LLMRerank получил поддержку асинхронности.
  • Fixed: Исправлено цитирование в CitationQueryEngine и сохранение SimpleChatStore без экранирования не-ASCII символов.
v0.14.23minor
🕐 2 мес назад · релиз на GitHub ↗

Релиз LlamaIndex v0.14.23: добавлены мультимодальные движки запросов и синтез, исправлены критические ошибки сплиттеров и воркфлоу.

  • Added: Реализован мультимодальный синтез и новые мультимодальные движки запросов.
  • Added: Добавлен мок LLM для тестирования вызова инструментов (tool calling).
  • Fixed: Исправлена RecursionError в TokenTextSplitter и SentenceSplitter при размерах единиц больше chunk_size.
  • Fixed: Устранена утечка мутаций в workflow благодаря глубокому копированию initial_state.
  • Fixed: Исправлена обработка URL-ссылок для видео и документов, а также добавлена явная кодировка UTF-8 для файлового ввода.