aigenthubTelegram

Ollama: установка и первые шаги

Ollama с нуля: установка, выбор модели под ваше железо (Gemma 4, Qwen, DeepSeek, gpt-oss), команды, API и запуск агентов на локальной модели.

АК Алексей КальсинОбновлено 7 мин чтения
Содержание
  1. Зачем нужна Ollama
  2. Установка Ollama
  3. Первая модель: запуск чата
  4. Какую модель выбрать
  5. Основные команды
  6. API: подключаем Ollama к своим программам
  7. Ollama + агенты: Claude Code, OpenClaw, n8n
  8. Контекст: почему модель «забывает» и как это исправить
  9. Ollama на сервере и доступ из сети
  10. Облачные модели Ollama
  11. Частые проблемы
  12. Частые вопросы

Ollama — бесплатная программа, которая запускает открытые нейросети прямо на вашем компьютере: Gemma, Qwen, DeepSeek, Llama, gpt-oss и сотни других. Модель скачивается один раз и дальше работает без интернета и без отправки ваших данных в облако. Ollama доступна для Windows, macOS и Linux, у неё есть чат в терминале, API для своих программ и готовые связки с Claude Code, OpenClaw, OpenCode и другими агентами.

Ниже — как установить Ollama, какую модель выбрать под ваш компьютер, основные команды, как подключить Ollama к своим скриптам и агентам и что делать, если всё тормозит. Команды сверены с официальной документацией Ollama на сентябрь 2026 года.

Коротко. Установка — одна команда (curl -fsSL https://ollama.com/install.sh | sh на macOS и Linux, irm https://ollama.com/install.ps1 | iex на Windows) или обычный установщик с ollama.com. Потом ollama run gemma4 — модель скачается и откроется чат. Для ноутбука с 8–16 ГБ памяти берите небольшие модели (Gemma 4 e4b, Qwen3 8B), для видеокарты на 16–24 ГБ — модели на 12–30 миллиардов параметров.

Зачем нужна Ollama

  • Приватность. Документы, код и переписка не покидают ваш компьютер или сервер. Для персональных данных и коммерческой тайны это часто единственный допустимый вариант.
  • Бесплатно. Нет оплаты за токены и подписок — только ваше железо и электричество.
  • Без VPN и зарубежных карт. Модель работает локально, доступ к зарубежным сервисам не нужен.
  • Для агентов. Ollama — локальный «мозг» для локального AI-агента, n8n, OpenClaw, Claude Code и своих скриптов.

Минус один: открытые модели на домашнем железе слабее топовых облачных. Для резюме, классификации, черновиков, работы с документами и простого кода их хватает, для сложной архитектуры и больших рассуждений — пока нет.

Установка Ollama

СистемаКомандаИли вручную
Windowsirm https://ollama.com/install.ps1 | iex в PowerShellустановщик OllamaSetup.exe с ollama.com
macOScurl -fsSL https://ollama.com/install.sh | shприложение Ollama.dmg
Linuxcurl -fsSL https://ollama.com/install.sh | shручная установка по документации
Dockerофициальный образ ollama/ollama

После установки Ollama работает в фоне как сервис, а в терминале появляется команда ollama. Если просто набрать ollama, откроется меню: запустить модель или подключить Ollama к агенту.

Первая модель: запуск чата

ollama run gemma4

Ollama скачает модель (несколько гигабайт, один раз) и откроет чат прямо в терминале. Выход — /bye. Следующие запуски будут мгновенными: модель уже на диске.

Какую модель выбрать

Главное ограничение — память. Модель должна поместиться в видеопамять (быстро) или в оперативную (медленнее). Ориентиры:

Ваше железоРазмер моделиПримеры из библиотеки Ollama
Ноутбук, 8 ГБ ОЗУ, без видеокартыдо 4 млрд параметровgemma4:e2b, gemma4:e4b, qwen3:4b, llama3.2
16 ГБ ОЗУ или видеокарта 8–12 ГБ7–14 млрдqwen3:8b, qwen3:14b, gemma4:12b, deepseek-r1:8b
Видеокарта 16–24 ГБ20–32 млрдgpt-oss:20b, gemma4:26b, qwen3.6:27b, qwen3-coder:30b
Мощный сервер или несколько GPU70 млрд и большеgpt-oss:120b, llama3.1:70b

Под задачу: для кода — модели с «coder» в названии и qwen3.6, для рассуждений — модели с режимом thinking (qwen3, deepseek-r1, gemma4), для поиска по документам — модели эмбеддингов (nomic-embed-text, bge-m3). У Gemma 4 есть поддержка изображений. Полный список — на ollama.com/library. Какая видеокарта нужна для локальных моделей и что лучше купить — отдельная большая тема, к ней мы ещё вернёмся.

Основные команды

КомандаЧто делает
ollama run gemma4Запустить модель и открыть чат (скачает, если её нет)
ollama pull gemma4Только скачать модель
ollama lsСписок скачанных моделей
ollama psКакие модели сейчас загружены и где работают: на GPU или CPU
ollama stop gemma4Выгрузить модель из памяти
ollama rm gemma4Удалить модель с диска
ollama serveЗапустить сервер вручную (обычно он уже работает в фоне)
ollama create -f ModelfileСоздать свою модель с системной инструкцией

Своя «персона» делается через Modelfile — текстовый файл с базовой моделью и инструкцией:

FROM gemma4
SYSTEM """Ты — помощник юриста. Отвечай кратко, по-русски, со ссылками на пункты документа."""

API: подключаем Ollama к своим программам

Ollama поднимает API на http://localhost:11434. Пример запроса:

curl http://localhost:11434/api/chat -d '{
  "model": "gemma4",
  "messages": [{"role": "user", "content": "Объясни, что такое RAG, в двух предложениях"}],
  "stream": false
}'

На Python — официальная библиотека:

pip install ollama
from ollama import chat

response = chat(model="gemma4", messages=[
    {"role": "user", "content": "Составь план статьи про локальные нейросети"},
])
print(response.message.content)

Ollama также понимает формат запросов OpenAI, поэтому многие программы, написанные под ChatGPT API, можно переключить на локальную модель, просто поменяв адрес сервера.

Ollama + агенты: Claude Code, OpenClaw, n8n

Самое интересное — связки с агентами. У Ollama есть команда ollama launch, которая одной строкой запускает агента на локальной или облачной открытой модели:

ollama launch claude      # Claude Code на открытой модели
ollama launch openclaw    # персональный агент в Telegram, WhatsApp, Slack

Поддерживаются также Codex, OpenCode, Copilot CLI и другие. Для работы с кодом Ollama советует модели с контекстом от 64 тысяч токенов. Подробнее про агентов — в статьях Claude Code: руководство для новичка, OpenClaw: бесплатный фреймворк для агентов и OpenClaw + n8n. В n8n есть готовые узлы для Ollama — локальная модель становится частью любой автоматизации.

Контекст: почему модель «забывает» и как это исправить

По умолчанию Ollama использует окно контекста 4096 токенов — это примерно 3–5 страниц текста. Для длинных документов и агентов этого мало. Увеличить можно так:

OLLAMA_CONTEXT_LENGTH=32768 ollama serve

или прямо в чате командой /set parameter num_ctx 32768. Учтите: чем больше контекст, тем больше памяти нужно.

Ollama на сервере и доступ из сети

По умолчанию Ollama слушает только локальный адрес. Чтобы подключаться с другого компьютера, задайте переменную OLLAMA_HOST=0.0.0.0:11434 (на Linux — в настройках systemd-сервиса, на macOS — через launchctl setenv) и перезапустите Ollama. Не открывайте порт 11434 в интернет без защиты: у API нет паролей, любой сможет пользоваться вашей моделью. Закройте его файрволом или спрячьте за reverse proxy с авторизацией — как в статье как защитить AI-агента на VPS. Для моделей на 7–14 млрд параметров на сервере нужна видеокарта; обычный недорогой VPS без GPU потянет только маленькие модели и медленно.

Облачные модели Ollama

Кроме локальных, Ollama умеет запускать большие модели в своём облаке (метки :cloud в библиотеке) — для этого нужен вход командой ollama signin. По заявлению Ollama, при локальной работе ваши запросы никуда не отправляются, а при облачной — обрабатываются, но не хранятся и не используются для обучения. Для конфиденциальных данных используйте только локальные модели.

Частые проблемы

  • Модель отвечает очень медленно. Проверьте ollama ps: если в колонке PROCESSOR указан CPU, модель не влезла в видеопамять. Возьмите модель поменьше или уменьшите контекст.
  • Не хватает места на диске. Удалите ненужные модели: ollama ls, затем ollama rm имя.
  • Плохо отвечает по-русски. Небольшие модели слабее в русском. Попробуйте Qwen или Gemma побольше, а в системной инструкции прямо укажите «отвечай по-русски».
  • Агент теряет нить на больших задачах. Увеличьте окно контекста и берите модели с поддержкой инструментов (метка tools в библиотеке).

Частые вопросы

Ollama бесплатная?

Да, программа бесплатна и с открытым кодом, локальные модели тоже бесплатны. Платными могут быть только облачные модели Ollama.

Работает ли Ollama в России?

Да. Программа и модели скачиваются с ollama.com и работают локально, без VPN и оплаты.

Какая модель Ollama лучше для русского языка?

Из популярных — семейства Qwen и Gemma: на 8–14 млрд параметров они уже неплохо пишут по-русски. Маленькие модели на 1–4 млрд справляются с простыми задачами, но ошибаются чаще.

Сколько нужно памяти для Ollama?

Для маленьких моделей хватит 8 ГБ ОЗУ, для моделей на 7–14 млрд параметров — 16 ГБ или видеокарты на 8–12 ГБ, для моделей на 20–32 млрд — видеокарты на 16–24 ГБ.

Чем Ollama отличается от LM Studio?

Обе запускают локальные модели. Ollama удобнее для разработчиков и агентов: командная строка, API, связки с Claude Code и OpenClaw. LM Studio — графическое приложение, удобнее для тех, кто хочет чат с моделью без терминала.

Можно ли использовать Ollama с Claude Code?

Да, командой ollama launch claude. Claude Code будет работать на открытой модели через Ollama — бесплатно, но качество зависит от модели и железа.

АК
Алексей Кальсин

Строю AI-агентов для своего бизнеса и клиентов, на сайте пишу о том, что запускал сам. Вопросы задавайте в Telegram.

@aaakalsin →

Ещё в разделе «Установка и настройка»

Новые агенты и рабочие связки раньше, чем в блоге

Короткие разборы, промокоды и ответы на вопросы в Telegram-канале.

Подписаться в Telegram