Text-generation-webui (теперь известный как TextGen) — это, пожалуй, самый популярный и функциональный open-source интерфейс для запуска больших языковых моделей (LLM) на собственном оборудовании. Это не просто «чат-бот», а полноценная рабочая станция, поддерживающая режимы чата, генерации текста, работы с изображениями (vision), вызова инструментов (tool-calling) и даже обучения LoRA-моделям. Проект полностью приватен: он не отправляет данные в облако, не собирает телеметрию и работает офлайн.
Этот гайд предназначен для практиков, которые хотят развернуть локальный аналог ChatGPT или Claude на своем ПК или сервере. Мы рассмотрим два основных пути установки: портативный (быстрый) для тех, кому нужен только чат, и полный (Conda) для продвинутых пользователей, которым требуются дополнительные бэкенды, API или генерация изображений.
01Требования
Требования к железу сильно зависят от выбранной модели и способа её квантования (сжатия). Основной формат для TextGen — GGUF (от llama.cpp), который позволяет эффективно использовать как видеопамять (VRAM), так и оперативную память (RAM).
- Операционная система: Windows, Linux, macOS. Поддерживаются NVIDIA (CUDA), AMD (ROCm/Vulkan) и Apple Silicon (MPS).
- Python: Рекомендуется использовать Conda для управления зависимостями.
- Драйверы: Актуальные драйверы видеокарты обязательны для использования GPU. Для AMD на Linux требуется настройка ROCm.
02Установка
Выберите один из двух методов в зависимости от ваших задач.
Вариант 1: Портативная установка (Быстрый старт)
Идеально для новичков и тех, кому нужен только чат и генерация текста. Не требует установки Conda, все зависимости упакованы в виртуальное окружение Python. Занимает мало места.
- Клонируйте репозиторий:
git clone https://github.com/oobabooga/textgen
cd textgen- Создайте и активируйте виртуальное окружение:
# На Windows:
venv\Scripts\activate
# На macOS/Linux:
source venv/bin/activate- Установите зависимости. Для большинства пользователей подходит базовый файл требований:
pip install -r requirements/portable/requirements.txt --upgradeВариант 2: Полная установка (Conda)
Выбирайте этот вариант, если вам нужны бэкенды ExLlamaV3, Transformers, обучение LoRA, генерация изображений или интеграция с API. Требуется заметный объем свободного места.
- Установите Miniforge (рекомендуется для Linux/WSL, но доступен и для других ОС):
curl -sL "https://github.com/conda-forge/miniforge/releases/latest/download/Miniforge3-Linux-x86_64.sh" > "Miniforge3.sh"
bash Miniforge3.sh- Создайте окружение и активируйте его:
conda create -n textgen python=3.13
conda activate textgen- Установите PyTorch. Команда зависит от вашего GPU. Для NVIDIA на Linux/Windows:
pip3 install torch --index-url https://download.pytorch.org/whl/cu128Для AMD (Linux): pip3 install torch --index-url https://repo.radeon.com/rocm/ (укажите актуальную версию для вашей ROCm). Для CPU-only: pip3 install torch --index-url https://download.pytorch.org/whl/cpu.
pip install ... --proxy http://proxy:port) или настройте зеркало Hugging Face через переменную окружения HF_ENDPOINT=https://hf-mirror.com.03Первый запуск
После установки вам нужно скачать модель. Перейдите на Hugging Face, найдите модель в формате GGUF (например, Llama-3-8B-Instruct-Q4_K_M.gguf) и сохраните файл в папку user_data/models внутри директории проекта.
Теперь запустите сервер. Для портативной версии:
python server.py --portable --api --auto-launchФлаги означают:
- --portable: использование портативного режима (для venv).
- --api: запуск локального API (совместимого с OpenAI/Anthropic), что позволяет подключать внешние клиенты.
- --auto-launch: автоматическое открытие интерфейса в браузере.
Откройте http://127.0.0.1:7860 в браузере. В интерфейсе выберите загруженную модель и нажмите "Load". После загрузки вы сможете начать общение.
04Частые проблемы
- Ошибка "CUDA out of memory" или медленная работа на CPU. Проверьте, правильно ли определена видеокарта. В интерфейсе
