aigenthubTelegram

Лучшие модели для Ollama в 2026: какую выбрать под ваш компьютер

Какую модель скачать в Ollama под свой компьютер: для русского языка, кода, агентов и tool calling, картинок, рассуждений и эмбеддингов — с командами и разбором памяти.

АК Алексей КальсинОбновлено 12 мин чтения
Содержание
  1. Сколько нужно памяти и что значат «7b» и «q4»
  2. Универсальные модели: чат и русский язык
  3. Модели для кода
  4. Для агентов и вызова инструментов (tool calling)
  5. Модели с поддержкой картинок (зрение)
  6. Рассуждающие модели (thinking)
  7. Маленькие модели для слабых компьютеров
  8. Эмбеддинги для RAG
  9. Сводная таблица моделей
  10. Как проверить, что модель поместилась, и как удалить лишнее
  11. Облачные модели Ollama
  12. Частые ошибки
  13. Частые вопросы

Если коротко: большинству хватит связки из четырёх моделей. Qwen3.5 — для чата, картинок, рассуждений и работы с инструментами, Gemma 4 — как вторая универсальная модель, Qwen3.6 (на мощной видеокарте) или Qwen2.5-Coder (на слабой) — для кода, и nomic-embed-text — если нужен поиск по своим документам (RAG). Дальше выбор зависит от памяти компьютера и задачи: разберём по порядку.

Ollama уже должна быть установлена — если нет, начните со статьи Ollama: установка и первые шаги. Здесь — только про модели: что означают цифры и буквы в названии, какую взять под своё железо и задачу, и какой командой скачать. Теги сверены с библиотекой ollama.com/library на сентябрь 2026 года — она постоянно обновляется, так что перед установкой сверяйтесь со страницей модели.

Коротко. Большинству подойдут ollama run qwen3.5 и ollama run gemma4 для чата, ollama pull qwen2.5-coder (или qwen3.6 на видеокарте от 24 ГБ) для кода и ollama pull nomic-embed-text для поиска по документам. На ноутбуке без видеокарты берите размеры до 4 млрд параметров, на видеокарте 8–12 ГБ — 8–14 млрд, на 16–24 ГБ — 20–32 млрд. Проверить, что модель поместилась в видеопамять, можно командой ollama ps.

Сколько нужно памяти и что значат «7b» и «q4»

У каждой модели в названии обычно есть суффикс вроде :8b, :14b, :30b — число параметров нейросети в миллиардах (b = billion). Больше параметров — «умнее» модель, но больше памяти и медленнее ответ. На 1–4 млрд — простые задачи, на 7–14 млрд — нормальный чат и код, на 30 млрд и больше — заметно сильнее, но нужна мощная видеокарта.

Второй параметр — квантование: способ сжать веса модели. По умолчанию Ollama скачивает вариант q4_K_M — веса хранятся примерно по 4–5 бит вместо исходных 16–32, файл в 3–4 раза меньше, а качество почти не страдает. Теги q8_0 и fp16 — точнее, но тяжелее; берите их, только если памяти хватает с запасом.

Ваша памятьРазмер моделиПример команды
4–8 ГБ ОЗУ, видеокарты нет1–3 млрд параметровollama run llama3.2:1b
8–16 ГБ ОЗУ или видеокарта 6–8 ГБ3–8 млрдollama run gemma4:e4b
16 ГБ ОЗУ или видеокарта 8–12 ГБ8–14 млрдollama run qwen3.5:9b
Видеокарта 16–24 ГБ20–32 млрд, в т.ч. MoE с «a3b» в имениollama run gpt-oss:20b
Видеокарта 24–48 ГБ или Mac на 64 ГБ+30–70 млрдollama run llama3.3
Сервер с 80+ ГБ видеопамяти70–122 млрд и большеollama run qwen3.5:122b

Ориентир: модель в q4 занимает на диске и в памяти примерно 0,6–0,7 ГБ на каждый миллиард параметров, плюс место под контекст. Точный размер файла виден на странице модели в библиотеке при скачивании.

Универсальные модели: чат и русский язык

Для повседневных задач — вопросы, переписка, пересказ, помощь с текстами — берите модель среднего размера из семейства Qwen или Gemma.

  • Qwen3.5 — самое популярное сейчас семейство Qwen в библиотеке Ollama. Размеры 0.8b, 2b, 4b, 9b (по умолчанию, 6,6 ГБ), 27b, 35b, 122b, контекст 256 тыс. токенов. Понимает картинки, вызывает инструменты и умеет рассуждать — одна модель закрывает почти все задачи. В описании модели приведены результаты многоязычных тестов.
    ollama run qwen3.5
  • Qwen3.6 и Qwen3.8 — более новые модели Qwen, но только крупные: Qwen3.6 — 27b и 35b (от 18 ГБ), Qwen3.8 — 27b (18 ГБ). Разработчик делает упор на агентную работу и программирование. Берите, если видеокарта на 24 ГБ и больше или Mac с большим объёмом памяти.
    ollama run qwen3.6:27b
  • Qwen3 — прошлое поколение, всё ещё в библиотеке (0.6b–235b). Разработчик заявляет поддержку «100+ языков и диалектов». Для новых установок логичнее брать Qwen3.5.
  • Gemma 4 — модель Google, размеры e2b, e4b, 12b, 26b, 31b. Поддерживает инструменты, рассуждения, картинки и даже аудио на вход. На практике вместе с Qwen её чаще всего выбирают для русскоязычных чатов.
    ollama run gemma4:e4b
  • Mistral Small 3.2 — 24 млрд параметров, инструменты и картинки, от Mistral AI. Разработчик отмечает улучшенный function calling и меньше повторов в ответах.
    ollama run mistral-small3.2

Установка и сравнение с графическим приложением — в статье LM Studio: установка и настройка.

Модели для кода

Для автодополнения, объяснения и рефакторинга кода в библиотеке Ollama есть отдельные модели с меткой «coder» в названии.

  • Qwen2.5-Coder — самый широкий выбор размеров: 0.5b, 1.5b, 3b, 7b, 14b, 32b. Разработчик заявляет поддержку более 40 языков программирования — хороший выбор для слабой и средней видеокарты.
    ollama pull qwen2.5-coder:7b
  • Qwen3.6 — есть отдельные теги для программирования: 27b-coding и 35b-coding (18–23 ГБ). Самый свежий вариант для кода, если хватает видеопамяти.
    ollama pull qwen3.6:27b-coding
  • Qwen3-Coder-Next — модель Qwen для агентной разработки, 52 ГБ, контекст 256 тыс. токенов. Для рабочих станций и серверов.
    ollama pull qwen3-coder-next
  • Qwen3-Coder — прошлое поколение, крупные размеры: 30b (MoE, активны около 3 млрд параметров — считает быстрее, чем полные 30 млрд) и 480b для серверов.
    ollama pull qwen3-coder:30b
  • Devstral 2 — 123 млрд параметров, Mistral AI, заточена под агентную разработку: правки сразу в нескольких файлах, работа с большой кодовой базой.
    ollama pull devstral-2
  • Codestral — модель Mistral AI на 22 млрд параметров для генерации кода.
    ollama pull codestral

Для агентов и вызова инструментов (tool calling)

Если модель будет «мозгом» агента — вызывать функции, искать в интернете, работать с файлами, — важна метка tools в библиотеке. Без неё агент не сможет корректно вызвать инструмент.

  • Qwen3.5 и Gemma 4 (см. выше) — универсальный выбор для агентов, обе с tools. На мощной видеокарте — Qwen3.6, её разработчик делает упор именно на агентные задачи.
  • gpt-oss — открытые модели OpenAI, размеры 20b и 120b, tools и режим рассуждений. Разработчик описывает их как модели «для мощных рассуждений, агентных задач и разработки».
    ollama run gpt-oss:20b
  • Granite 4 — модели IBM для корпоративных сценариев с явным акцентом на tool calling; есть совсем небольшие размеры — 350m, 1b, 3b — для лёгкого агента на слабом железе.
    ollama run granite4:3b

Дальше модель подключают к n8n, скриптам на Python или к локальному AI-агенту на своём компьютере. Если агент работает через API на сервере — закройте порт, как описано в статье как защитить AI-агента на VPS.

Модели с поддержкой картинок (зрение)

Такие модели умеют отвечать на вопросы по изображению: прочитать текст на скриншоте, описать фото, разобрать диаграмму. В библиотеке они помечены меткой vision.

  • Qwen3.5 — понимает картинки «из коробки», отдельная vision-версия не нужна. Самый простой вариант, если модель уже стоит для чата.
    ollama run qwen3.5
  • Qwen3-VL — специализированная модель зрения прошлого поколения Qwen, размеры от 2b до 235b, плюс инструменты и рассуждения. Разработчик заявляет распознавание текста на 32 языках.
    ollama run qwen3-vl:8b
  • Llama 3.2 Vision — модель Meta, размеры 11b и 90b.
    ollama run llama3.2-vision
  • Moondream — 1,8 млрд параметров, сделана специально для слабых устройств.
    ollama run moondream
  • MiniCPM-V 4.6 — ещё более лёгкая модель для разбора изображений, в том числе на слабых компьютерах и телефонах.
    ollama run minicpm-v4.6

Спросить про картинку можно прямо в терминале, указав путь к файлу после текста вопроса:

ollama run qwen3.5 "Что на этой картинке? /home/user/screenshot.png"

Рассуждающие модели (thinking)

Модели с режимом «thinking» перед ответом выстраивают цепочку рассуждений — помогает с математикой, логикой и многошаговыми задачами, но ответ занимает больше времени и токенов.

  • DeepSeek-R1 — специально обучена для рассуждений, размеры от 1.5b до 671b. Разработчик описывает её как модель, приближающуюся по качеству рассуждений к ведущим закрытым моделям.
    ollama run deepseek-r1:14b
  • Qwen3.5 — режим рассуждений встроен, отдельная модель не нужна.
    ollama run qwen3.5
  • Magistral — компактная рассуждающая модель Mistral AI, 24 млрд параметров.
    ollama run magistral
  • gpt-oss — тоже с thinking (см. раздел про агентов).

Маленькие модели для слабых компьютеров

Если оперативной памяти немного, а видеокарты нет вовсе, начните с моделей на 1 млрд параметров и меньше — работают даже на офисном ноутбуке, хотя заметно проще в рассуждениях.

  • Llama 3.2 — 1b и 3b, с инструментами.
    ollama run llama3.2:1b
  • Qwen3.5 в размере 0.8b (1 ГБ) или 2b (2,7 ГБ) — та же линейка, что и для чата, причём даже маленькие версии понимают картинки.
    ollama run qwen3.5:0.8b
  • Gemma 4 e2b — самый маленький вариант Gemma 4, но всё ещё с картинками и инструментами.
    ollama run gemma4:e2b
  • SmolLM2 — совсем миниатюрная модель: 135m, 360m, 1.7b.
    ollama run smollm2:360m

Эмбеддинги для RAG

Эмбеддинги — не чат-модели, они превращают текст в числовой вектор, по которому потом ищут похожие фрагменты в базе документов. Это основа RAG — подробно про принцип написано в статье RAG для AI-агента. В библиотеке такие модели помечены меткой embedding.

  • nomic-embed-text — популярная модель с большим окном контекста, часто используется по умолчанию в готовых RAG-инструкциях.
    ollama pull nomic-embed-text
  • bge-m3 — модель BAAI, разработчик заявляет поддержку более 100 языков и разной детализации поиска.
    ollama pull bge-m3
  • embeddinggemma — компактная модель Google на 300 млн параметров.
    ollama pull embeddinggemma
  • Qwen3-Embedding — линейка на основе Qwen3, размеры 0.6b, 4b, 8b.
    ollama pull qwen3-embedding

Вектор из текста получают через API:

curl http://localhost:11434/api/embed -d '{"model": "nomic-embed-text", "input": "Текст для поиска"}'

Сводная таблица моделей

МодельРазмерыВозможностиДля чего
qwen3.50.8b–122bvision, tools, thinkingчат, картинки, рассуждения, агенты
qwen3.627b, 35bvision, tools, thinkingагенты и код на мощной видеокарте
qwen3.827bvision, tools, thinkingсамая новая Qwen, мощная видеокарта
gemma4e2b, e4b, 12b, 26b, 31bvision, tools, thinking, audioуниверсальный чат, картинки, агенты
mistral-small3.224bvision, toolsчат, function calling
qwen2.5-coder0.5b–32btoolsкод на слабом и среднем ПК
qwen3-coder-next52 ГБtoolsагентная разработка, рабочая станция
qwen3-coder30b, 480btoolsкод на мощной видеокарте/сервере
devstral-2123btoolsагентная разработка
codestral22b—генерация кода
gpt-oss20b, 120btools, thinking, cloudагенты, рассуждения
granite4350m, 1b, 3btoolsлёгкие агенты
qwen3-vl2b–235bvision, tools, thinkingкартинки + рассуждения
llama3.2-vision11b, 90bvisionкартинки
moondream1.8bvisionкартинки на слабом ПК
minicpm-v4.6~1bvisionкартинки на очень слабом ПК
deepseek-r11.5b–671btools, thinkingсложные рассуждения
magistral24btools, thinkingрассуждения средней тяжести
llama3.21b, 3btoolsслабый ПК
smollm2135m, 360m, 1.7btoolsочень слабый ПК
nomic-embed-text—embeddingRAG, поиск по документам
bge-m3567membeddingRAG, многоязычный поиск
embeddinggemma300membeddingRAG на слабом ПК
qwen3-embedding0.6b, 4b, 8bembeddingRAG

Как проверить, что модель поместилась, и как удалить лишнее

После запуска модели командой ollama ps видно, где именно она работает:

ollama ps
NAME        ID            SIZE    PROCESSOR   UNTIL
gemma4:12b  a1b2c3d4e5f6  9.6 GB  100% GPU    4 minutes from now

В колонке PROCESSOR: 100% GPU — модель целиком в видеопамяти, быстрее всего; 100% CPU — на процессоре, медленно; смешанное значение вроде 48%/52% CPU/GPU — влезла частично. Видите CPU — берите модель поменьше или сильнее квантованную.

Скачанные модели видно командой ollama ls, лишние удаляются так: ollama rm gemma4:31b. Место на диске освобождается сразу.

Облачные модели Ollama

Кроме локального запуска, у Ollama есть облако: часть моделей библиотеки (например, крупные версии gpt-oss) можно запускать на серверах Ollama, а не на своём железе — отмечено меткой cloud на странице модели. Пригодится, если модель не влезает ни в одну домашнюю видеокарту.

Для входа нужен аккаунт: команда ollama signin в терминале и ключ API в личном кабинете на ollama.com. В CLI облачная модель запускается с припиской :cloud, например ollama run gemma4:cloud.

Бесплатный план включает стартовые кредиты и доступ к части облачных моделей, дальше облако оплачивается по мере использования (цена за миллион токенов своя у каждой модели). Платные планы: Pro — $20 в месяц, Max — $100 в месяц, в них входят кредиты на использование (цены на сентябрь 2026, ollama.com/pricing). По заявлению Ollama, содержимое облачных запросов не используется для обучения моделей; для приватных данных используйте только локальные модели без метки cloud.

Частые ошибки

  • Скачали слишком большую модель — всё зависает. Если ollama ps показывает CPU, берите модель меньше или с более сильным квантованием.
  • Агент не может вызвать инструмент. У модели нет метки tools — возьмите qwen3.5, gemma4, gpt-oss или granite4.
  • Модель «не видит» картинку. Нужна модель с меткой vision: qwen3.5, gemma4, qwen3-vl, llama3.2-vision, moondream или minicpm-v4.6.
  • Диск заполнился моделями. Список — ollama ls, удаление — ollama rm имя.
  • Путаница в размерах. Сверяйтесь со страницей модели на ollama.com/library — теги периодически меняются.

Частые вопросы

Какую модель Ollama скачать в первую очередь?

ollama run qwen3.5 или ollama run gemma4 — обе универсальные: картинки, инструменты и рассуждения. Дальше можно добавить отдельную модель под код или картинки.

Как узнать, влезла ли модель в видеопамять?

Командой ollama ps: колонка PROCESSOR покажет 100% GPU (влезла целиком), 100% CPU (работает на процессоре, медленно) или смешанное значение (частично).

Что означает q4 в названии модели?

Уровень квантования весов. q4_K_M — вариант по умолчанию в Ollama: заметно меньше по размеру, чем q8 или fp16, при небольшой потере качества.

Какая модель Ollama лучше работает с русским языком?

Надёжнее всего начинать с семейства Qwen: у Qwen3 разработчик прямо заявляет поддержку более 100 языков и диалектов, для Qwen3.5 в описании приведены результаты многоязычных тестов. Gemma 4 и Mistral Small тоже часто выбирают для русского на практике. Проверьте две-три модели на своих задачах — разница заметна быстро.

Можно ли использовать Ollama для RAG?

Да, для этого нужна отдельная модель эмбеддингов — nomic-embed-text, bge-m3 или embeddinggemma. Она не отвечает на вопросы, а превращает текст в вектор для поиска; отвечает уже обычная чат-модель.

Чем модель с меткой tools отличается от обычной?

Она умеет формировать структурированный вызов функции в формате, который понимает программа-агент. Без этой метки агент не сможет выполнить вызов инструмента.

Нужно ли платить за облачные модели Ollama?

Облако оплачивается по мере использования: в бесплатном плане есть стартовые кредиты, платные планы — от $20 в месяц. Локальные модели без метки cloud всегда бесплатны.

АК
Алексей Кальсин

Строю AI-агентов для своего бизнеса и клиентов, на сайте пишу о том, что запускал сам. Вопросы задавайте в Telegram.

@aaakalsin →

Ещё в разделе «Установка и настройка»

Новые агенты и рабочие связки раньше, чем в блоге

Короткие разборы, промокоды и ответы на вопросы в Telegram-канале.

Подписаться в Telegram