salesforce/xgen

Открытые LLM от Salesforce с длиной последовательности 8k.

LLM⭐ 726Python
Открыть на GitHub ↗

Что это за инструмент

XGen — это семейство открытых больших языковых моделей (LLM) от Salesforce AI Research объемом 7B параметров, оптимизированных для работы с длинными контекстами до 8 тысяч токенов.

Зачем нужен

Инструмент решает задачу эффективного моделирования длинных последовательностей текста, что позволяет обрабатывать большие объемы входных данных за один проход. Это полезно для задач, где требуется анализировать или генерировать текст на основе обширных контекстов, превышающих стандартные лимиты в 4K токенов.

Что можно реализовать

  • Анализ длинных документов или статей с учетом полного контекста
  • Генерация ответов на основе обширных баз знаний (в рамках лимита 8K)
  • Исследование архитектур LLM для работы с длинными последовательностями
  • Базовая генерация текста с поддержкой расширенного контекста

Ключевые возможности

  • Поддержка входной последовательности длиной до 8K токенов
  • Наличие версий Base (базовая) и Inst (инструкционная) для разных задач
  • Использование токенизатора OpenAI Tiktoken для совместимости
  • Открытый исходный код и веса моделей на HuggingFace Hub
  • Оптимизация для работы с bfloat16 через библиотеку transformers

👤 Кому подойдёт: исследователи, разработчики LLM, студенты и технические специалисты, изучающие или внедряющие модели с длинным контекстом

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.