Лучшие модели для Ollama в 2026: какую выбрать под ваш компьютер
Какую модель скачать в Ollama под свой компьютер: для русского языка, кода, агентов и tool calling, картинок, рассуждений и эмбеддингов — с командами и разбором памяти.

Содержание
- Сколько нужно памяти и что значат «7b» и «q4»
- Универсальные модели: чат и русский язык
- Модели для кода
- Для агентов и вызова инструментов (tool calling)
- Модели с поддержкой картинок (зрение)
- Рассуждающие модели (thinking)
- Маленькие модели для слабых компьютеров
- Эмбеддинги для RAG
- Сводная таблица моделей
- Как проверить, что модель поместилась, и как удалить лишнее
- Облачные модели Ollama
- Частые ошибки
- Частые вопросы
Если коротко: большинству хватит связки из четырёх моделей. Qwen3.5 — для чата, картинок, рассуждений и работы с инструментами, Gemma 4 — как вторая универсальная модель, Qwen3.6 (на мощной видеокарте) или Qwen2.5-Coder (на слабой) — для кода, и nomic-embed-text — если нужен поиск по своим документам (RAG). Дальше выбор зависит от памяти компьютера и задачи: разберём по порядку.
Ollama уже должна быть установлена — если нет, начните со статьи Ollama: установка и первые шаги. Здесь — только про модели: что означают цифры и буквы в названии, какую взять под своё железо и задачу, и какой командой скачать. Теги сверены с библиотекой ollama.com/library на сентябрь 2026 года — она постоянно обновляется, так что перед установкой сверяйтесь со страницей модели.
Коротко. Большинству подойдут ollama run qwen3.5 и ollama run gemma4 для чата, ollama pull qwen2.5-coder (или qwen3.6 на видеокарте от 24 ГБ) для кода и ollama pull nomic-embed-text для поиска по документам. На ноутбуке без видеокарты берите размеры до 4 млрд параметров, на видеокарте 8–12 ГБ — 8–14 млрд, на 16–24 ГБ — 20–32 млрд. Проверить, что модель поместилась в видеопамять, можно командой ollama ps.
Сколько нужно памяти и что значат «7b» и «q4»
У каждой модели в названии обычно есть суффикс вроде :8b, :14b, :30b — число параметров нейросети в миллиардах (b = billion). Больше параметров — «умнее» модель, но больше памяти и медленнее ответ. На 1–4 млрд — простые задачи, на 7–14 млрд — нормальный чат и код, на 30 млрд и больше — заметно сильнее, но нужна мощная видеокарта.
Второй параметр — квантование: способ сжать веса модели. По умолчанию Ollama скачивает вариант q4_K_M — веса хранятся примерно по 4–5 бит вместо исходных 16–32, файл в 3–4 раза меньше, а качество почти не страдает. Теги q8_0 и fp16 — точнее, но тяжелее; берите их, только если памяти хватает с запасом.
| Ваша память | Размер модели | Пример команды |
|---|---|---|
| 4–8 ГБ ОЗУ, видеокарты нет | 1–3 млрд параметров | ollama run llama3.2:1b |
| 8–16 ГБ ОЗУ или видеокарта 6–8 ГБ | 3–8 млрд | ollama run gemma4:e4b |
| 16 ГБ ОЗУ или видеокарта 8–12 ГБ | 8–14 млрд | ollama run qwen3.5:9b |
| Видеокарта 16–24 ГБ | 20–32 млрд, в т.ч. MoE с «a3b» в имени | ollama run gpt-oss:20b |
| Видеокарта 24–48 ГБ или Mac на 64 ГБ+ | 30–70 млрд | ollama run llama3.3 |
| Сервер с 80+ ГБ видеопамяти | 70–122 млрд и больше | ollama run qwen3.5:122b |
Ориентир: модель в q4 занимает на диске и в памяти примерно 0,6–0,7 ГБ на каждый миллиард параметров, плюс место под контекст. Точный размер файла виден на странице модели в библиотеке при скачивании.
Универсальные модели: чат и русский язык
Для повседневных задач — вопросы, переписка, пересказ, помощь с текстами — берите модель среднего размера из семейства Qwen или Gemma.
- Qwen3.5 — самое популярное сейчас семейство Qwen в библиотеке Ollama. Размеры
0.8b,2b,4b,9b(по умолчанию, 6,6 ГБ),27b,35b,122b, контекст 256 тыс. токенов. Понимает картинки, вызывает инструменты и умеет рассуждать — одна модель закрывает почти все задачи. В описании модели приведены результаты многоязычных тестов.ollama run qwen3.5 - Qwen3.6 и Qwen3.8 — более новые модели Qwen, но только крупные: Qwen3.6 —
27bи35b(от 18 ГБ), Qwen3.8 —27b(18 ГБ). Разработчик делает упор на агентную работу и программирование. Берите, если видеокарта на 24 ГБ и больше или Mac с большим объёмом памяти.ollama run qwen3.6:27b - Qwen3 — прошлое поколение, всё ещё в библиотеке (
0.6b–235b). Разработчик заявляет поддержку «100+ языков и диалектов». Для новых установок логичнее брать Qwen3.5. - Gemma 4 — модель Google, размеры
e2b,e4b,12b,26b,31b. Поддерживает инструменты, рассуждения, картинки и даже аудио на вход. На практике вместе с Qwen её чаще всего выбирают для русскоязычных чатов.ollama run gemma4:e4b - Mistral Small 3.2 — 24 млрд параметров, инструменты и картинки, от Mistral AI. Разработчик отмечает улучшенный function calling и меньше повторов в ответах.
ollama run mistral-small3.2
Установка и сравнение с графическим приложением — в статье LM Studio: установка и настройка.
Модели для кода
Для автодополнения, объяснения и рефакторинга кода в библиотеке Ollama есть отдельные модели с меткой «coder» в названии.
- Qwen2.5-Coder — самый широкий выбор размеров:
0.5b,1.5b,3b,7b,14b,32b. Разработчик заявляет поддержку более 40 языков программирования — хороший выбор для слабой и средней видеокарты.ollama pull qwen2.5-coder:7b - Qwen3.6 — есть отдельные теги для программирования:
27b-codingи35b-coding(18–23 ГБ). Самый свежий вариант для кода, если хватает видеопамяти.ollama pull qwen3.6:27b-coding - Qwen3-Coder-Next — модель Qwen для агентной разработки, 52 ГБ, контекст 256 тыс. токенов. Для рабочих станций и серверов.
ollama pull qwen3-coder-next - Qwen3-Coder — прошлое поколение, крупные размеры:
30b(MoE, активны около 3 млрд параметров — считает быстрее, чем полные 30 млрд) и480bдля серверов.ollama pull qwen3-coder:30b - Devstral 2 — 123 млрд параметров, Mistral AI, заточена под агентную разработку: правки сразу в нескольких файлах, работа с большой кодовой базой.
ollama pull devstral-2 - Codestral — модель Mistral AI на 22 млрд параметров для генерации кода.
ollama pull codestral
Для агентов и вызова инструментов (tool calling)
Если модель будет «мозгом» агента — вызывать функции, искать в интернете, работать с файлами, — важна метка tools в библиотеке. Без неё агент не сможет корректно вызвать инструмент.
- Qwen3.5 и Gemma 4 (см. выше) — универсальный выбор для агентов, обе с tools. На мощной видеокарте — Qwen3.6, её разработчик делает упор именно на агентные задачи.
- gpt-oss — открытые модели OpenAI, размеры
20bи120b, tools и режим рассуждений. Разработчик описывает их как модели «для мощных рассуждений, агентных задач и разработки».ollama run gpt-oss:20b - Granite 4 — модели IBM для корпоративных сценариев с явным акцентом на tool calling; есть совсем небольшие размеры —
350m,1b,3b— для лёгкого агента на слабом железе.ollama run granite4:3b
Дальше модель подключают к n8n, скриптам на Python или к локальному AI-агенту на своём компьютере. Если агент работает через API на сервере — закройте порт, как описано в статье как защитить AI-агента на VPS.
Модели с поддержкой картинок (зрение)
Такие модели умеют отвечать на вопросы по изображению: прочитать текст на скриншоте, описать фото, разобрать диаграмму. В библиотеке они помечены меткой vision.
- Qwen3.5 — понимает картинки «из коробки», отдельная vision-версия не нужна. Самый простой вариант, если модель уже стоит для чата.
ollama run qwen3.5 - Qwen3-VL — специализированная модель зрения прошлого поколения Qwen, размеры от
2bдо235b, плюс инструменты и рассуждения. Разработчик заявляет распознавание текста на 32 языках.ollama run qwen3-vl:8b - Llama 3.2 Vision — модель Meta, размеры
11bи90b.ollama run llama3.2-vision - Moondream — 1,8 млрд параметров, сделана специально для слабых устройств.
ollama run moondream - MiniCPM-V 4.6 — ещё более лёгкая модель для разбора изображений, в том числе на слабых компьютерах и телефонах.
ollama run minicpm-v4.6
Спросить про картинку можно прямо в терминале, указав путь к файлу после текста вопроса:
ollama run qwen3.5 "Что на этой картинке? /home/user/screenshot.png"
Рассуждающие модели (thinking)
Модели с режимом «thinking» перед ответом выстраивают цепочку рассуждений — помогает с математикой, логикой и многошаговыми задачами, но ответ занимает больше времени и токенов.
- DeepSeek-R1 — специально обучена для рассуждений, размеры от
1.5bдо671b. Разработчик описывает её как модель, приближающуюся по качеству рассуждений к ведущим закрытым моделям.ollama run deepseek-r1:14b - Qwen3.5 — режим рассуждений встроен, отдельная модель не нужна.
ollama run qwen3.5 - Magistral — компактная рассуждающая модель Mistral AI, 24 млрд параметров.
ollama run magistral - gpt-oss — тоже с thinking (см. раздел про агентов).
Маленькие модели для слабых компьютеров
Если оперативной памяти немного, а видеокарты нет вовсе, начните с моделей на 1 млрд параметров и меньше — работают даже на офисном ноутбуке, хотя заметно проще в рассуждениях.
- Llama 3.2 —
1bи3b, с инструментами.ollama run llama3.2:1b - Qwen3.5 в размере
0.8b(1 ГБ) или2b(2,7 ГБ) — та же линейка, что и для чата, причём даже маленькие версии понимают картинки.ollama run qwen3.5:0.8b - Gemma 4 e2b — самый маленький вариант Gemma 4, но всё ещё с картинками и инструментами.
ollama run gemma4:e2b - SmolLM2 — совсем миниатюрная модель:
135m,360m,1.7b.ollama run smollm2:360m
Эмбеддинги для RAG
Эмбеддинги — не чат-модели, они превращают текст в числовой вектор, по которому потом ищут похожие фрагменты в базе документов. Это основа RAG — подробно про принцип написано в статье RAG для AI-агента. В библиотеке такие модели помечены меткой embedding.
- nomic-embed-text — популярная модель с большим окном контекста, часто используется по умолчанию в готовых RAG-инструкциях.
ollama pull nomic-embed-text - bge-m3 — модель BAAI, разработчик заявляет поддержку более 100 языков и разной детализации поиска.
ollama pull bge-m3 - embeddinggemma — компактная модель Google на 300 млн параметров.
ollama pull embeddinggemma - Qwen3-Embedding — линейка на основе Qwen3, размеры
0.6b,4b,8b.ollama pull qwen3-embedding
Вектор из текста получают через API:
curl http://localhost:11434/api/embed -d '{"model": "nomic-embed-text", "input": "Текст для поиска"}'
Сводная таблица моделей
| Модель | Размеры | Возможности | Для чего |
|---|---|---|---|
| qwen3.5 | 0.8b–122b | vision, tools, thinking | чат, картинки, рассуждения, агенты |
| qwen3.6 | 27b, 35b | vision, tools, thinking | агенты и код на мощной видеокарте |
| qwen3.8 | 27b | vision, tools, thinking | самая новая Qwen, мощная видеокарта |
| gemma4 | e2b, e4b, 12b, 26b, 31b | vision, tools, thinking, audio | универсальный чат, картинки, агенты |
| mistral-small3.2 | 24b | vision, tools | чат, function calling |
| qwen2.5-coder | 0.5b–32b | tools | код на слабом и среднем ПК |
| qwen3-coder-next | 52 ГБ | tools | агентная разработка, рабочая станция |
| qwen3-coder | 30b, 480b | tools | код на мощной видеокарте/сервере |
| devstral-2 | 123b | tools | агентная разработка |
| codestral | 22b | — | генерация кода |
| gpt-oss | 20b, 120b | tools, thinking, cloud | агенты, рассуждения |
| granite4 | 350m, 1b, 3b | tools | лёгкие агенты |
| qwen3-vl | 2b–235b | vision, tools, thinking | картинки + рассуждения |
| llama3.2-vision | 11b, 90b | vision | картинки |
| moondream | 1.8b | vision | картинки на слабом ПК |
| minicpm-v4.6 | ~1b | vision | картинки на очень слабом ПК |
| deepseek-r1 | 1.5b–671b | tools, thinking | сложные рассуждения |
| magistral | 24b | tools, thinking | рассуждения средней тяжести |
| llama3.2 | 1b, 3b | tools | слабый ПК |
| smollm2 | 135m, 360m, 1.7b | tools | очень слабый ПК |
| nomic-embed-text | — | embedding | RAG, поиск по документам |
| bge-m3 | 567m | embedding | RAG, многоязычный поиск |
| embeddinggemma | 300m | embedding | RAG на слабом ПК |
| qwen3-embedding | 0.6b, 4b, 8b | embedding | RAG |
Как проверить, что модель поместилась, и как удалить лишнее
После запуска модели командой ollama ps видно, где именно она работает:
ollama ps
NAME ID SIZE PROCESSOR UNTIL
gemma4:12b a1b2c3d4e5f6 9.6 GB 100% GPU 4 minutes from now
В колонке PROCESSOR: 100% GPU — модель целиком в видеопамяти, быстрее всего; 100% CPU — на процессоре, медленно; смешанное значение вроде 48%/52% CPU/GPU — влезла частично. Видите CPU — берите модель поменьше или сильнее квантованную.
Скачанные модели видно командой ollama ls, лишние удаляются так: ollama rm gemma4:31b. Место на диске освобождается сразу.
Облачные модели Ollama
Кроме локального запуска, у Ollama есть облако: часть моделей библиотеки (например, крупные версии gpt-oss) можно запускать на серверах Ollama, а не на своём железе — отмечено меткой cloud на странице модели. Пригодится, если модель не влезает ни в одну домашнюю видеокарту.
Для входа нужен аккаунт: команда ollama signin в терминале и ключ API в личном кабинете на ollama.com. В CLI облачная модель запускается с припиской :cloud, например ollama run gemma4:cloud.
Бесплатный план включает стартовые кредиты и доступ к части облачных моделей, дальше облако оплачивается по мере использования (цена за миллион токенов своя у каждой модели). Платные планы: Pro — $20 в месяц, Max — $100 в месяц, в них входят кредиты на использование (цены на сентябрь 2026, ollama.com/pricing). По заявлению Ollama, содержимое облачных запросов не используется для обучения моделей; для приватных данных используйте только локальные модели без метки cloud.
Частые ошибки
- Скачали слишком большую модель — всё зависает. Если
ollama psпоказывает CPU, берите модель меньше или с более сильным квантованием. - Агент не может вызвать инструмент. У модели нет метки tools — возьмите qwen3.5, gemma4, gpt-oss или granite4.
- Модель «не видит» картинку. Нужна модель с меткой vision: qwen3.5, gemma4, qwen3-vl, llama3.2-vision, moondream или minicpm-v4.6.
- Диск заполнился моделями. Список —
ollama ls, удаление —ollama rm имя. - Путаница в размерах. Сверяйтесь со страницей модели на ollama.com/library — теги периодически меняются.
Частые вопросы
Какую модель Ollama скачать в первую очередь?
ollama run qwen3.5 или ollama run gemma4 — обе универсальные: картинки, инструменты и рассуждения. Дальше можно добавить отдельную модель под код или картинки.
Как узнать, влезла ли модель в видеопамять?
Командой ollama ps: колонка PROCESSOR покажет 100% GPU (влезла целиком), 100% CPU (работает на процессоре, медленно) или смешанное значение (частично).
Что означает q4 в названии модели?
Уровень квантования весов. q4_K_M — вариант по умолчанию в Ollama: заметно меньше по размеру, чем q8 или fp16, при небольшой потере качества.
Какая модель Ollama лучше работает с русским языком?
Надёжнее всего начинать с семейства Qwen: у Qwen3 разработчик прямо заявляет поддержку более 100 языков и диалектов, для Qwen3.5 в описании приведены результаты многоязычных тестов. Gemma 4 и Mistral Small тоже часто выбирают для русского на практике. Проверьте две-три модели на своих задачах — разница заметна быстро.
Можно ли использовать Ollama для RAG?
Да, для этого нужна отдельная модель эмбеддингов — nomic-embed-text, bge-m3 или embeddinggemma. Она не отвечает на вопросы, а превращает текст в вектор для поиска; отвечает уже обычная чат-модель.
Чем модель с меткой tools отличается от обычной?
Она умеет формировать структурированный вызов функции в формате, который понимает программа-агент. Без этой метки агент не сможет выполнить вызов инструмента.
Нужно ли платить за облачные модели Ollama?
Облако оплачивается по мере использования: в бесплатном плане есть стартовые кредиты, платные планы — от $20 в месяц. Локальные модели без метки cloud всегда бесплатны.
Строю AI-агентов для своего бизнеса и клиентов, на сайте пишу о том, что запускал сам. Вопросы задавайте в Telegram.
@aaakalsin →

