Ollama — это инструмент с открытым исходным кодом, который позволяет запускать большие языковые модели (LLM), такие как Llama 3, Gemma, Mistral и другие, локально на вашем компьютере. Это решение идеально подходит для практиков, которым важна конфиденциальность данных, отсутствие зависимости от облачных API или работа в условиях ограниченного доступа к интернету. Ollama берет на себя сложность настройки окружения, управления весами моделей и оптимизации использования GPU, предоставляя простой интерфейс командной строки и REST API.
01Требования
Перед установкой убедитесь, что ваше оборудование соответствует минимальным требованиям. Ollama поддерживает Windows, macOS и Linux.
Операционная система
- macOS: Требуется macOS 12.3 (Monterey) или новее. Рекомендуется использовать чипы Apple Silicon (M1/M2/M3) для максимальной эффективности.
- Windows: Требуется Windows 10 или Windows 11 (64-bit). Поддерживаются GPU NVIDIA, AMD и Intel Arc.
- Linux: Поддерживаются большинство современных дистрибутивов. Необходимы драйверы GPU (NVIDIA/AMD) для использования ускорения.
Оперативная память (VRAM/RAM)
Объем памяти критически влияет на размер модели, которую вы сможете запустить. Ниже приведены ориентировочные требования для моделей семейства Llama 3 (8B параметров):
- 4 ГБ VRAM/RAM: Хватит для квантованных моделей 7B-8B (например, Llama 3.1 8B Instruct Q4_K_M), но скорость генерации может быть низкой.
- 8 ГБ VRAM/RAM: Оптимально для моделей 7B-8B. На Apple Silicon или NVIDIA GPU с 8 ГБ памяти вы получите комфортную скорость.
- 12-16 ГБ VRAM/RAM: Позволяет запускать более крупные модели (13B-14B) или использовать модели 8B с большим контекстным окном без квантования.
- 24 ГБ VRAM/RAM (NVIDIA RTX 3090/4090): Отлично подходит для моделей 30B+ или нескольких 8B моделей одновременно.
02Установка
Процесс установки максимально упрощен. Выберите вашу операционную систему и выполните соответствующую команду в терминале или PowerShell.
macOS
Выполните следующую команду в терминале:
curl -fsSL https://ollama.com/install.sh | shИли скачайте установщик вручную: Ollama.dmg.
Windows
Откройте PowerShell и выполните:
irm https://ollama.com/install.ps1 | iexИли скачайте установщик вручную: OllamaSetup.exe.
Linux
Выполните команду в терминале:
curl -fsSL https://ollama.com/install.sh | shДля ручной установки на Linux следуйте инструкции.
Docker
Если вы предпочитаете контейнеризацию, используйте официальный образ:
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama03Первый запуск
Самая мощная сторона Ollama — простота. Вам не нужно скачивать веса моделей вручную. Просто укажите имя модели, и Ollama сама загрузит её.
Запуск модели через CLI
Чтобы запустить чат с моделью Gemma 4 (или любой другой доступной модели), выполните:
ollama run gemma4Если модель еще не загружена, Ollama автоматически скачает её в каталог ~/.ollama/models (Linux/macOS) или %USERPROFILE%\.ollama\models (Windows). После загрузки вы сможете общаться с моделью прямо в терминале.
Использование через API
Ollama предоставляет REST API по адресу http://localhost:11434. Вы можете взаимодействовать с моделью программно. Пример запроса через curl:
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{
"role": "user",
"content": "Why is the sky blue?"
}],
"stream": false
}'Интеграция с Python
Для разработчиков доступен официальный Python-пакет:
pip install ollamafrom ollama import chat
response = chat(model='gemma4', messages=[
{
'role': 'user',
'content': 'Why is the sky blue?',
},
])
print(response.message.content)Интеграция с JavaScript
Для Node.js:
npm i ollamaimport ollama from "ollama";
const response = await ollama.chat({
model: "gemma4",
messages: [{ role: "user", content: "Why is the sky blue?" }],
});
console.log(response.message.content);04Частые проблемы
1. Ошибка "CUDA error" или "AMD ROCm error"
Если вы используете Windows или Linux с дискретной видеокартой, убедитесь, что у вас установлены последние драйверы GPU. На Windows также убедитесь, что у вас установлена версия Windows 10/11, поддерживающая WDDM 3.0 для современных GPU. На Linux проверьте, что пакет nvidia-driver или rocm установлен корректно.
2. Модель не запускается, ошибка "out of memory"
Это означает, что у вашего устройства недостаточно VRAM или RAM для загрузки выбранной модели. Попробуйте выбрать более маленькую модель (например, вместо llama3.1:70b используйте llama3.1:8b) или модель с более высокой степенью квантования (например, :q4_K_M вместо :f16). Список всех доступных моделей и их размеров можно найти на ollama.com/library.
3. Медленная скорость генерации
Если вы используете CPU (процессор) вместо GPU, скорость будет значительно ниже. Убедитесь, что Ollama использует GPU. В логах запуска должно быть указано "using gpu". Если вы используете macOS, убедитесь, что вы не используете эмуляцию, а нативный запуск на Apple Silicon.
05Кому подойдёт
- Разработчикам: Для локального тестирования AI-ассистентов, генерации кода и интеграции LLM в свои приложения без затрат на API.
- Исследователям и аналитикам: Для работы с конфиденциальными данными, которые нельзя отправлять в облачные сервисы.
- Энтузиастам AI: Для экспериментов с различными архитектурами моделей (Mistral, Llama, Gemma, Qwen) без ограничений по количеству запросов.
- Пользователям из РФ: Для обхода возможных ограничений доступа к зарубежным AI-сервисам и работы офлайн.
Источник: Ollama (офиц. документация) ↗
