Главная/Блог/Гайд/Как установить Ollama локально: запуск…
Гайд4 мин чтения · 5 сентября 2026 г.

Как установить Ollama локально: запуск LLM

Пошаговая инструкция по установке Ollama для запуска больших языковых моделей на вашем ПК. Подходит для Windows, macOS и Linux.

Как установить Ollama локально: запуск LLM

Ollama — это инструмент с открытым исходным кодом, который позволяет запускать большие языковые модели (LLM), такие как Llama 3, Gemma, Mistral и другие, локально на вашем компьютере. Это решение идеально подходит для практиков, которым важна конфиденциальность данных, отсутствие зависимости от облачных API или работа в условиях ограниченного доступа к интернету. Ollama берет на себя сложность настройки окружения, управления весами моделей и оптимизации использования GPU, предоставляя простой интерфейс командной строки и REST API.

01Требования

Перед установкой убедитесь, что ваше оборудование соответствует минимальным требованиям. Ollama поддерживает Windows, macOS и Linux.

Операционная система

  • macOS: Требуется macOS 12.3 (Monterey) или новее. Рекомендуется использовать чипы Apple Silicon (M1/M2/M3) для максимальной эффективности.
  • Windows: Требуется Windows 10 или Windows 11 (64-bit). Поддерживаются GPU NVIDIA, AMD и Intel Arc.
  • Linux: Поддерживаются большинство современных дистрибутивов. Необходимы драйверы GPU (NVIDIA/AMD) для использования ускорения.

Оперативная память (VRAM/RAM)

Объем памяти критически влияет на размер модели, которую вы сможете запустить. Ниже приведены ориентировочные требования для моделей семейства Llama 3 (8B параметров):

  • 4 ГБ VRAM/RAM: Хватит для квантованных моделей 7B-8B (например, Llama 3.1 8B Instruct Q4_K_M), но скорость генерации может быть низкой.
  • 8 ГБ VRAM/RAM: Оптимально для моделей 7B-8B. На Apple Silicon или NVIDIA GPU с 8 ГБ памяти вы получите комфортную скорость.
  • 12-16 ГБ VRAM/RAM: Позволяет запускать более крупные модели (13B-14B) или использовать модели 8B с большим контекстным окном без квантования.
  • 24 ГБ VRAM/RAM (NVIDIA RTX 3090/4090): Отлично подходит для моделей 30B+ или нескольких 8B моделей одновременно.
⚠️
Важно. Если у вас нет дискретной видеокарты, Ollama будет использовать системную оперативную память (RAM). Для моделей 7B-8B требуется минимум 8 ГБ RAM, но для комфортной работы рекомендуется 16 ГБ и выше. На macOS объединенная память позволяет запускать очень большие модели, если у вас 32 ГБ+ общей памяти.

02Установка

Процесс установки максимально упрощен. Выберите вашу операционную систему и выполните соответствующую команду в терминале или PowerShell.

macOS

Выполните следующую команду в терминале:

terminalbash
curl -fsSL https://ollama.com/install.sh | sh

Или скачайте установщик вручную: Ollama.dmg.

Windows

Откройте PowerShell и выполните:

terminalbash
irm https://ollama.com/install.ps1 | iex

Или скачайте установщик вручную: OllamaSetup.exe.

Linux

Выполните команду в терминале:

terminalbash
curl -fsSL https://ollama.com/install.sh | sh

Для ручной установки на Linux следуйте инструкции.

Docker

Если вы предпочитаете контейнеризацию, используйте официальный образ:

terminalbash
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
💡
Совет. После установки на Windows и Linux Ollama запустится как фоновая служба. На macOS она запустится при первом вызове команды. Проверить статус можно, открыв приложение Ollama (если установлено) или проверив процесс в диспетчере задач/Activity Monitor.

03Первый запуск

Самая мощная сторона Ollama — простота. Вам не нужно скачивать веса моделей вручную. Просто укажите имя модели, и Ollama сама загрузит её.

Запуск модели через CLI

Чтобы запустить чат с моделью Gemma 4 (или любой другой доступной модели), выполните:

terminalbash
ollama run gemma4

Если модель еще не загружена, Ollama автоматически скачает её в каталог ~/.ollama/models (Linux/macOS) или %USERPROFILE%\.ollama\models (Windows). После загрузки вы сможете общаться с моделью прямо в терминале.

Использование через API

Ollama предоставляет REST API по адресу http://localhost:11434. Вы можете взаимодействовать с моделью программно. Пример запроса через curl:

terminalbash
curl http://localhost:11434/api/chat -d '{
  "model": "gemma4",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

Интеграция с Python

Для разработчиков доступен официальный Python-пакет:

terminalbash
pip install ollama
terminalpython
from ollama import chat
response = chat(model='gemma4', messages=[
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
])
print(response.message.content)

Интеграция с JavaScript

Для Node.js:

terminalbash
npm i ollama
terminaljavascript
import ollama from "ollama";
const response = await ollama.chat({
  model: "gemma4",
  messages: [{ role: "user", content: "Why is the sky blue?" }],
});
console.log(response.message.content);

04Частые проблемы

1. Ошибка "CUDA error" или "AMD ROCm error"

Если вы используете Windows или Linux с дискретной видеокартой, убедитесь, что у вас установлены последние драйверы GPU. На Windows также убедитесь, что у вас установлена версия Windows 10/11, поддерживающая WDDM 3.0 для современных GPU. На Linux проверьте, что пакет nvidia-driver или rocm установлен корректно.

2. Модель не запускается, ошибка "out of memory"

Это означает, что у вашего устройства недостаточно VRAM или RAM для загрузки выбранной модели. Попробуйте выбрать более маленькую модель (например, вместо llama3.1:70b используйте llama3.1:8b) или модель с более высокой степенью квантования (например, :q4_K_M вместо :f16). Список всех доступных моделей и их размеров можно найти на ollama.com/library.

3. Медленная скорость генерации

Если вы используете CPU (процессор) вместо GPU, скорость будет значительно ниже. Убедитесь, что Ollama использует GPU. В логах запуска должно быть указано "using gpu". Если вы используете macOS, убедитесь, что вы не используете эмуляцию, а нативный запуск на Apple Silicon.

05Кому подойдёт

  • Разработчикам: Для локального тестирования AI-ассистентов, генерации кода и интеграции LLM в свои приложения без затрат на API.
  • Исследователям и аналитикам: Для работы с конфиденциальными данными, которые нельзя отправлять в облачные сервисы.
  • Энтузиастам AI: Для экспериментов с различными архитектурами моделей (Mistral, Llama, Gemma, Qwen) без ограничений по количеству запросов.
  • Пользователям из РФ: Для обхода возможных ограничений доступа к зарубежным AI-сервисам и работы офлайн.

Источник: Ollama (офиц. документация) ↗