🦙 Ollama
Локальные языковые модели: установка, команды, Modelfile, REST API и интеграции.
Шпаргалки · ИИ · #ollama #llm #local #inference
Что это
Ollama запускает открытые модели (Llama, Qwen, Mistral, Gemma, DeepSeek, Phi и др.) на вашем компьютере или сервере: CPU, NVIDIA / AMD GPU, Apple Silicon. Данные не уходят наружу. API: http://localhost:11434.
Установка
curl -fsSL https://ollama.com/install.sh | sh # Linux
brew install ollama # macOS (или установщик с сайта)
winget install Ollama.Ollama # Windows
docker run -d -v ollama:/root/.ollama -p 11434:11434 --gpus=all ollama/ollama
Команды
ollama pull llama3.2 # скачать модель
ollama run llama3.2 # чат в терминале (/bye выход)
ollama run llama3.2 "Объясни DNS кратко"
ollama list # установленные
ollama ps # загруженные в память
ollama show llama3.2 # параметры
ollama rm llama3.2
ollama cp llama3.2 my-model
ollama serve # запуск сервера вручную
Теги задают размер и квантование: llama3.2:3b, qwen2.5:7b-instruct-q4_K_M.
REST API
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2", "prompt": "Привет!", "stream": false }'
curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [{"role": "user", "content": "Назови 3 порта HTTP/HTTPS/SSH"}],
"stream": false,
"options": {"temperature": 0.2, "num_ctx": 8192} }'
curl http://localhost:11434/api/embeddings -d '{ "model": "nomic-embed-text", "prompt": "текст" }'
OpenAI-совместимый адрес: http://localhost:11434/v1 (подходит многим клиентам).
Python
import ollama
r = ollama.chat(model='llama3.2', messages=[{'role': 'user', 'content': 'Привет'}])
print(r['message']['content'])
Modelfile (своя модель)
FROM llama3.2
PARAMETER temperature 0.3
PARAMETER num_ctx 8192
SYSTEM """Ты — помощник по Linux. Отвечай кратко, с примерами команд."""
ollama create linux-helper -f Modelfile
ollama run linux-helper
Ресурсы и квантование
| Квантование | Особенность |
|---|---|
q4_K_M |
компромисс размера и качества (по умолчанию) |
q8_0 |
выше качество, вдвое больше памяти |
fp16 |
максимальное качество, много памяти |
Грубо: модель на 7–8 млрд параметров в q4 занимает около 5 ГБ, на 13–14 млрд около 9 ГБ, на 70 млрд около 40 ГБ. Для GPU важна видеопамять (VRAM), для CPU оперативная.
Переменные окружения
OLLAMA_HOST=0.0.0.0:11434 (доступ из сети), OLLAMA_MODELS=/path (папка моделей), OLLAMA_KEEP_ALIVE=30m (держать в памяти), OLLAMA_NUM_PARALLEL, OLLAMA_MAX_LOADED_MODELS.
Интеграции
Open WebUI (веб-чат), Continue и Cline (IDE), LangChain и LlamaIndex, n8n, Dify, Flowise, Obsidian-плагины.
Подсказки
Модели с поддержкой вызова инструментов (tools) и зрения (llava, llama3.2-vision) помечены на странице библиотеки. Эмбеддинги: nomic-embed-text, bge-m3, mxbai-embed-large.
Внимание: Не открывайте порт 11434 в интернет без аутентификации: у сервера нет встроенной защиты. Ставьте реверс-прокси с авторизацией.