jerryjliu/llama_index

LlamaIndex — ведущая платформа для работы с документами, агентов и OCR

RAG⭐ 52 253Pythonпоследний релиз: v0.14.24
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

LlamaIndex — это open-source фреймворк для создания агентов на базе LLM, специализирующийся на работе с документами, извлечении данных и OCR.

Зачем нужен

Инструмент решает задачу эффективной интеграции больших языковых моделей с пользовательскими данными (RAG). Он полезен для структурирования неструктурированной информации, чтобы LLM могли точно отвечать на вопросы по ней или выполнять сложные задачи.

Что можно реализовать

  • Построение систем RAG для поиска ответов по внутренней базе знаний компании
  • Автоматизация извлечения структурированных данных из PDF, таблиц и сканов (OCR)
  • Создание AI-агентов, способных взаимодействовать с внешними источниками данных
  • Индексация и поиск по большим объемам текстовых документов

Ключевые возможности

  • Поддержка более 300 интеграций (LlamaHub) для различных LLM, векторных баз данных и источников данных
  • Платформа LlamaParse для агентов OCR и парсинга документов
  • Гибкая архитектура: можно использовать готовый пакет или только ядро (core) с кастомными плагинами
  • Инструменты для построения агентов (LlamaAgents) и работы с контекстом

👤 Кому подойдёт: разработчики, создающие приложения на базе LLM; инженеры данных, работающие с неструктурированными документами; исследователи в области AI

Релизы

v0.14.24minor
🕐 1 мес назад · релиз на GitHub ↗

Исправления ядра, поддержка Claude Sonnet 5 и Opus 5, а также улучшения в LLM и embedding провайдерах.

  • Added: Добавлена поддержка моделей Claude Sonnet 5 и Opus 5 в провайдерах Anthropic и Bedrock Converse.
  • Added: В ядро добавлена возможность использовать любой AsyncDBChatStore для хранения памяти.
  • Fixed: Исправлена работа MMR-поиска при нулевом пороге, сохранение длинных узлов и корректная обработка аргументов инструментов.
  • Fixed: Устранены ошибки в парсере HTML, рендеринге цитат, потоковой передаче ответов и работе с Falkordb и LanceDB.
  • Added: Реализована асинхронная версия LLMRerank и добавлена опция raise_on_error для экстракторов путей LLM.
v0.14.23minor
🕐 2 мес назад · релиз на GitHub ↗

Выпуск 0.14.23: мультимодальные движки запросов, синтез и исправления сплиттеров и воркфлоу.

  • Added: Добавлены мультимодальные движки запросов (Multimodal query engines).
  • Added: Реализован второй этап мультимодального синтеза (Multimodal synthesis part 2).
  • Fixed: Исправлена RecursionError в TokenTextSplitter и SentenceSplitter при размерах единиц больше chunk_size.
  • Fixed: Исправлено сохранение исходных узлов в TreeSelectLeafRetriever и объектов IndexNode при дампе модели.
  • Fixed: Устранена утечка мутаций в workflow за счёт глубокого копирования initial_state.