Ollama: установка и первые шаги
Ollama с нуля: установка, выбор модели под ваше железо (Gemma 4, Qwen, DeepSeek, gpt-oss), команды, API и запуск агентов на локальной модели.

Содержание
- Зачем нужна Ollama
- Установка Ollama
- Первая модель: запуск чата
- Какую модель выбрать
- Основные команды
- API: подключаем Ollama к своим программам
- Ollama + агенты: Claude Code, OpenClaw, n8n
- Контекст: почему модель «забывает» и как это исправить
- Ollama на сервере и доступ из сети
- Облачные модели Ollama
- Частые проблемы
- Частые вопросы
Ollama — бесплатная программа, которая запускает открытые нейросети прямо на вашем компьютере: Gemma, Qwen, DeepSeek, Llama, gpt-oss и сотни других. Модель скачивается один раз и дальше работает без интернета и без отправки ваших данных в облако. Ollama доступна для Windows, macOS и Linux, у неё есть чат в терминале, API для своих программ и готовые связки с Claude Code, OpenClaw, OpenCode и другими агентами.
Ниже — как установить Ollama, какую модель выбрать под ваш компьютер, основные команды, как подключить Ollama к своим скриптам и агентам и что делать, если всё тормозит. Команды сверены с официальной документацией Ollama на сентябрь 2026 года.
Коротко. Установка — одна команда (curl -fsSL https://ollama.com/install.sh | sh на macOS и Linux, irm https://ollama.com/install.ps1 | iex на Windows) или обычный установщик с ollama.com. Потом ollama run gemma4 — модель скачается и откроется чат. Для ноутбука с 8–16 ГБ памяти берите небольшие модели (Gemma 4 e4b, Qwen3 8B), для видеокарты на 16–24 ГБ — модели на 12–30 миллиардов параметров.
Зачем нужна Ollama
- Приватность. Документы, код и переписка не покидают ваш компьютер или сервер. Для персональных данных и коммерческой тайны это часто единственный допустимый вариант.
- Бесплатно. Нет оплаты за токены и подписок — только ваше железо и электричество.
- Без VPN и зарубежных карт. Модель работает локально, доступ к зарубежным сервисам не нужен.
- Для агентов. Ollama — локальный «мозг» для локального AI-агента, n8n, OpenClaw, Claude Code и своих скриптов.
Минус один: открытые модели на домашнем железе слабее топовых облачных. Для резюме, классификации, черновиков, работы с документами и простого кода их хватает, для сложной архитектуры и больших рассуждений — пока нет.
Установка Ollama
| Система | Команда | Или вручную |
|---|---|---|
| Windows | irm https://ollama.com/install.ps1 | iex в PowerShell | установщик OllamaSetup.exe с ollama.com |
| macOS | curl -fsSL https://ollama.com/install.sh | sh | приложение Ollama.dmg |
| Linux | curl -fsSL https://ollama.com/install.sh | sh | ручная установка по документации |
| Docker | официальный образ ollama/ollama | — |
После установки Ollama работает в фоне как сервис, а в терминале появляется команда ollama. Если просто набрать ollama, откроется меню: запустить модель или подключить Ollama к агенту.
Первая модель: запуск чата
ollama run gemma4
Ollama скачает модель (несколько гигабайт, один раз) и откроет чат прямо в терминале. Выход — /bye. Следующие запуски будут мгновенными: модель уже на диске.
Какую модель выбрать
Главное ограничение — память. Модель должна поместиться в видеопамять (быстро) или в оперативную (медленнее). Ориентиры:
| Ваше железо | Размер модели | Примеры из библиотеки Ollama |
|---|---|---|
| Ноутбук, 8 ГБ ОЗУ, без видеокарты | до 4 млрд параметров | gemma4:e2b, gemma4:e4b, qwen3:4b, llama3.2 |
| 16 ГБ ОЗУ или видеокарта 8–12 ГБ | 7–14 млрд | qwen3:8b, qwen3:14b, gemma4:12b, deepseek-r1:8b |
| Видеокарта 16–24 ГБ | 20–32 млрд | gpt-oss:20b, gemma4:26b, qwen3.6:27b, qwen3-coder:30b |
| Мощный сервер или несколько GPU | 70 млрд и больше | gpt-oss:120b, llama3.1:70b |
Под задачу: для кода — модели с «coder» в названии и qwen3.6, для рассуждений — модели с режимом thinking (qwen3, deepseek-r1, gemma4), для поиска по документам — модели эмбеддингов (nomic-embed-text, bge-m3). У Gemma 4 есть поддержка изображений. Полный список — на ollama.com/library. Какая видеокарта нужна для локальных моделей и что лучше купить — отдельная большая тема, к ней мы ещё вернёмся.
Основные команды
| Команда | Что делает |
|---|---|
ollama run gemma4 | Запустить модель и открыть чат (скачает, если её нет) |
ollama pull gemma4 | Только скачать модель |
ollama ls | Список скачанных моделей |
ollama ps | Какие модели сейчас загружены и где работают: на GPU или CPU |
ollama stop gemma4 | Выгрузить модель из памяти |
ollama rm gemma4 | Удалить модель с диска |
ollama serve | Запустить сервер вручную (обычно он уже работает в фоне) |
ollama create -f Modelfile | Создать свою модель с системной инструкцией |
Своя «персона» делается через Modelfile — текстовый файл с базовой моделью и инструкцией:
FROM gemma4
SYSTEM """Ты — помощник юриста. Отвечай кратко, по-русски, со ссылками на пункты документа."""
API: подключаем Ollama к своим программам
Ollama поднимает API на http://localhost:11434. Пример запроса:
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{"role": "user", "content": "Объясни, что такое RAG, в двух предложениях"}],
"stream": false
}'
На Python — официальная библиотека:
pip install ollama
from ollama import chat
response = chat(model="gemma4", messages=[
{"role": "user", "content": "Составь план статьи про локальные нейросети"},
])
print(response.message.content)
Ollama также понимает формат запросов OpenAI, поэтому многие программы, написанные под ChatGPT API, можно переключить на локальную модель, просто поменяв адрес сервера.
Ollama + агенты: Claude Code, OpenClaw, n8n
Самое интересное — связки с агентами. У Ollama есть команда ollama launch, которая одной строкой запускает агента на локальной или облачной открытой модели:
ollama launch claude # Claude Code на открытой модели
ollama launch openclaw # персональный агент в Telegram, WhatsApp, Slack
Поддерживаются также Codex, OpenCode, Copilot CLI и другие. Для работы с кодом Ollama советует модели с контекстом от 64 тысяч токенов. Подробнее про агентов — в статьях Claude Code: руководство для новичка, OpenClaw: бесплатный фреймворк для агентов и OpenClaw + n8n. В n8n есть готовые узлы для Ollama — локальная модель становится частью любой автоматизации.
Контекст: почему модель «забывает» и как это исправить
По умолчанию Ollama использует окно контекста 4096 токенов — это примерно 3–5 страниц текста. Для длинных документов и агентов этого мало. Увеличить можно так:
OLLAMA_CONTEXT_LENGTH=32768 ollama serve
или прямо в чате командой /set parameter num_ctx 32768. Учтите: чем больше контекст, тем больше памяти нужно.
Ollama на сервере и доступ из сети
По умолчанию Ollama слушает только локальный адрес. Чтобы подключаться с другого компьютера, задайте переменную OLLAMA_HOST=0.0.0.0:11434 (на Linux — в настройках systemd-сервиса, на macOS — через launchctl setenv) и перезапустите Ollama. Не открывайте порт 11434 в интернет без защиты: у API нет паролей, любой сможет пользоваться вашей моделью. Закройте его файрволом или спрячьте за reverse proxy с авторизацией — как в статье как защитить AI-агента на VPS. Для моделей на 7–14 млрд параметров на сервере нужна видеокарта; обычный недорогой VPS без GPU потянет только маленькие модели и медленно.
Облачные модели Ollama
Кроме локальных, Ollama умеет запускать большие модели в своём облаке (метки :cloud в библиотеке) — для этого нужен вход командой ollama signin. По заявлению Ollama, при локальной работе ваши запросы никуда не отправляются, а при облачной — обрабатываются, но не хранятся и не используются для обучения. Для конфиденциальных данных используйте только локальные модели.
Частые проблемы
- Модель отвечает очень медленно. Проверьте
ollama ps: если в колонке PROCESSOR указан CPU, модель не влезла в видеопамять. Возьмите модель поменьше или уменьшите контекст. - Не хватает места на диске. Удалите ненужные модели:
ollama ls, затемollama rm имя. - Плохо отвечает по-русски. Небольшие модели слабее в русском. Попробуйте Qwen или Gemma побольше, а в системной инструкции прямо укажите «отвечай по-русски».
- Агент теряет нить на больших задачах. Увеличьте окно контекста и берите модели с поддержкой инструментов (метка tools в библиотеке).
Частые вопросы
Ollama бесплатная?
Да, программа бесплатна и с открытым кодом, локальные модели тоже бесплатны. Платными могут быть только облачные модели Ollama.
Работает ли Ollama в России?
Да. Программа и модели скачиваются с ollama.com и работают локально, без VPN и оплаты.
Какая модель Ollama лучше для русского языка?
Из популярных — семейства Qwen и Gemma: на 8–14 млрд параметров они уже неплохо пишут по-русски. Маленькие модели на 1–4 млрд справляются с простыми задачами, но ошибаются чаще.
Сколько нужно памяти для Ollama?
Для маленьких моделей хватит 8 ГБ ОЗУ, для моделей на 7–14 млрд параметров — 16 ГБ или видеокарты на 8–12 ГБ, для моделей на 20–32 млрд — видеокарты на 16–24 ГБ.
Чем Ollama отличается от LM Studio?
Обе запускают локальные модели. Ollama удобнее для разработчиков и агентов: командная строка, API, связки с Claude Code и OpenClaw. LM Studio — графическое приложение, удобнее для тех, кто хочет чат с моделью без терминала.
Можно ли использовать Ollama с Claude Code?
Да, командой ollama launch claude. Claude Code будет работать на открытой модели через Ollama — бесплатно, но качество зависит от модели и железа.
Строю AI-агентов для своего бизнеса и клиентов, на сайте пишу о том, что запускал сам. Вопросы задавайте в Telegram.
@aaakalsin →

