🦙 Ollama

Локальные языковые модели: установка, команды, Modelfile, REST API и интеграции.

Шпаргалки · ИИ · #ollama #llm #local #inference

Что это

Ollama запускает открытые модели (Llama, Qwen, Mistral, Gemma, DeepSeek, Phi и др.) на вашем компьютере или сервере: CPU, NVIDIA / AMD GPU, Apple Silicon. Данные не уходят наружу. API: http://localhost:11434.

Установка

curl -fsSL https://ollama.com/install.sh | sh     # Linux
brew install ollama                                # macOS (или установщик с сайта)
winget install Ollama.Ollama                       # Windows
docker run -d -v ollama:/root/.ollama -p 11434:11434 --gpus=all ollama/ollama

Команды

ollama pull llama3.2           # скачать модель
ollama run llama3.2            # чат в терминале (/bye выход)
ollama run llama3.2 "Объясни DNS кратко"
ollama list                    # установленные
ollama ps                      # загруженные в память
ollama show llama3.2           # параметры
ollama rm llama3.2
ollama cp llama3.2 my-model
ollama serve                   # запуск сервера вручную

Теги задают размер и квантование: llama3.2:3b, qwen2.5:7b-instruct-q4_K_M.

REST API

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2", "prompt": "Привет!", "stream": false }'

curl http://localhost:11434/api/chat -d '{
  "model": "llama3.2",
  "messages": [{"role": "user", "content": "Назови 3 порта HTTP/HTTPS/SSH"}],
  "stream": false,
  "options": {"temperature": 0.2, "num_ctx": 8192} }'

curl http://localhost:11434/api/embeddings -d '{ "model": "nomic-embed-text", "prompt": "текст" }'

OpenAI-совместимый адрес: http://localhost:11434/v1 (подходит многим клиентам).

Python

import ollama
r = ollama.chat(model='llama3.2', messages=[{'role': 'user', 'content': 'Привет'}])
print(r['message']['content'])

Modelfile (своя модель)

FROM llama3.2
PARAMETER temperature 0.3
PARAMETER num_ctx 8192
SYSTEM """Ты — помощник по Linux. Отвечай кратко, с примерами команд."""
ollama create linux-helper -f Modelfile
ollama run linux-helper

Ресурсы и квантование

Квантование Особенность
q4_K_M компромисс размера и качества (по умолчанию)
q8_0 выше качество, вдвое больше памяти
fp16 максимальное качество, много памяти

Грубо: модель на 7–8 млрд параметров в q4 занимает около 5 ГБ, на 13–14 млрд около 9 ГБ, на 70 млрд около 40 ГБ. Для GPU важна видеопамять (VRAM), для CPU оперативная.

Переменные окружения

OLLAMA_HOST=0.0.0.0:11434 (доступ из сети), OLLAMA_MODELS=/path (папка моделей), OLLAMA_KEEP_ALIVE=30m (держать в памяти), OLLAMA_NUM_PARALLEL, OLLAMA_MAX_LOADED_MODELS.

Интеграции

Open WebUI (веб-чат), Continue и Cline (IDE), LangChain и LlamaIndex, n8n, Dify, Flowise, Obsidian-плагины.

Подсказки

Модели с поддержкой вызова инструментов (tools) и зрения (llava, llama3.2-vision) помечены на странице библиотеки. Эмбеддинги: nomic-embed-text, bge-m3, mxbai-embed-large.

Внимание: Не открывайте порт 11434 в интернет без аутентификации: у сервера нет встроенной защиты. Ставьте реверс-прокси с авторизацией.