Локальный AI-агент на ПК: установка, настройка и запуск
🖥️ Что значит «локальный AI-агент» — без облака, без API
Локальный AI-агент — это языковая модель, которая физически работает на вашем GPU или CPU. Не «десктоп-приложение, которое ходит в облако по API», а именно модель, загруженная в видеопамять вашей видеокарты. Никаких внешних запросов: инференс происходит локально, данные не покидают компьютер, подписка не нужна.
В чём разница с облачными решениями: ChatGPT, Claude и даже десктоп-приложения с локальным хранением данных всё равно отправляют каждый запрос на удалённый сервер, где работает LLM. Ваш компьютер — только интерфейс. Локальный агент — это когда интерфейс И модель на вашем железе. Вы платите только за электричество.
По данным сообщества LocalAIMaster, в 2026 году 14B-модели уровня Qwen 2.5 на RTX 4070 выдают качество, сопоставимое с GPT-4o на задачах общего профиля — но без ограничений по токенам, без цензуры провайдера и без ежемесячного счёта. Для бизнеса это минус один риск: данные клиентов физически не покидают периметр компании. Для полного сравнения экономики — в статье self-hosted vs SaaS: что выбрать.
🛠️ Инструменты: от Ollama до OpenClaw
В 2026 году рынок стабилизировался вокруг нескольких инструментов — от «просто скачать и запустить» до полноценных агентских платформ.
Ollama — стандарт для запуска моделей. Одна команда в терминале — и LLM работает как локальный сервер на localhost:11434. 100+ моделей, API совместим с OpenAI. Идеально для разработчиков: ollama pull qwen2.5:14b && ollama run qwen2.5:14b — и модель готова к работе.
LM Studio — графический интерфейс. Для тех, кто не хочет лезть в терминал. Поиск модели → скачать → нажать «Load Model». В 2026 году LM Studio Pro умеет работать как фоновый сервис: запустили и забыли, любые приложения подключаются по HTTP.
Jan и GPT4All — «просто чат с нейросетью». Jan — как ChatGPT, но локально, с фокусом на конфиденциальность (ноль телеметрии). GPT4All — самый простой клиент с функцией LocalDocs: скармливаете PDF и DOCX, агент отвечает по их содержимому.
OpenClaw — полноценный автономный агент. Не просто чат, а агент с интеграциями: Telegram, почта, календарь, файловая система, браузер. Может работать на вашем сервере или локальном ПК, выполняет задачи без участия человека. В связке с Ollama или LM Studio получается полностью локальный агент: модель на GPU, оркестратор на том же ПК, данные никуда не уходят. Подробнее о self-hosted решениях — в статье self-hosted vs SaaS.
📊 Системные требования: таблица «модель → железо»
VRAM — самый критичный параметр. Если модель не помещается в видеопамять, часть выгружается в RAM и скорость падает в 5-10 раз.
| Модель | Размер | RAM | VRAM | Пример GPU |
|---|---|---|---|---|
| Phi-3, Gemma 3B | 3B | 8 ГБ | 4 ГБ | Встроенная графика |
| Llama 3.1, Mistral | 7-8B | 16 ГБ | 8 ГБ | RTX 3060 / 4060 |
| Qwen 2.5, Gemma 4 | 12-14B | 32 ГБ | 12-16 ГБ | RTX 4070 / 4070 Ti |
| DeepSeek-R1 distill | 30-32B | 64 ГБ | 20-24 ГБ | RTX 4090 / 5090 |
| Llama 3.3, Qwen 3 | 70B | 64-128 ГБ | 24+×2 ГБ | 2×RTX 4090 / Mac M2 Ultra |
Для полноценного агента (модель + векторная база знаний + оркестратор) добавляйте 8-16 ГБ RAM к значениям в таблице. SSD — минимум 500 ГБ: модели в зависимости от квантования занимают от 4 до 120+ ГБ.
📦 Пошаговая установка за 30 минут
Шаг 1. Поставьте Ollama. Скачайте с ollama.com/download (Windows, macOS, Linux). Установщик — 3 клика.
ollama pull qwen2.5:14b
Шаг 2. Проверьте модель.
ollama run qwen2.5:14b
Если отвечает — модель загружена в VRAM и работает. API доступен на http://localhost:11434.
Шаг 3. Установите оркестратор n8n. Через Docker за 5 минут. Визуальный конструктор: цепочки «триггер → агент → действие». Подключите почту, Telegram, Google Sheets — готовые ноды.
Шаг 4. Свяжите всё в агента. В n8n создайте workflow: «Webhook от Telegram → запрос к Ollama на localhost → ответ в чат». Первый локальный агент готов. Ни одного внешнего API, всё на вашем ПК.
Шаг 5 (для продвинутых). Подключите OpenClaw: автономный агент, который по расписанию собирает отчёты, обрабатывает почту, работает с файлами. Модель — Ollama, оркестратор — OpenClaw, данные — на вашем диске. Полный локальный контур.
💬 Частые вопросы
Хватит ли 16 ГБ RAM для нормальной работы?
Для моделей 7-8B (Llama, Mistral) — да. Для 14B моделей нужно 32 ГБ. Бюджетный старт: 7-8B модель + квантование Q4 на RTX 3060/4060 с 12 ГБ VRAM — приемлемая скорость и качество за 60 000–80 000 ₽ за весь системный блок.
Локальная модель реально заменит ChatGPT?
Для рутинных задач (письма, анализ документов, FAQ, работа с CRM, отчёты) — да. Qwen 2.5 14B на RTX 4070 выдаёт качество, близкое к GPT-4o на общих задачах. Для узкоспециализированных задач (юриспруденция, медицина) облачные модели пока точнее. Но разрыв сокращается с каждым поколением.
Можно ли запустить агента полностью без интернета?
Да. Ollama + LM Studio работают полностью оффлайн после скачивания модели. Для агента, которому нужны внешние инструменты (почта, Telegram), интернет нужен только на моменты отправки/получения — инференс идёт локально.
Какие риски у локального агента?
Безопасность внутри сети: если агент имеет доступ к общей файловой системе без ограничений, он может проиндексировать конфиденциальные документы. Решение: Docker-контейнер или песочница, ограниченные права доступа к папкам, firewall на исходящий трафик от процесса инференса.
Сколько стоит собрать ПК под локального агента?
Бюджет (7-8B): 60 000–80 000 ₽ (Ryzen 5 + 32 ГБ DDR5 + RTX 3060/4060). Средний (14B): 120 000–180 000 ₽ (Ryzen 7 + 64 ГБ + RTX 4070 Ti). Мощный (70B): 400 000+ ₽ (2×RTX 4090 + 128 ГБ). Для сравнения: год облачной подписки на 10 человек — ~550 000 ₽. Локальный ПК окупается за 1-2 года.
А если не хочу настраивать — есть готовое?
Если модель локально не принципиальна, а нужно просто десктоп-приложение с русским интерфейсом и оплатой картой РФ — есть Aizor. Но важно понимать разницу: Aizor хранит данные локально, а LLM работают в облаке (OpenRouter). Это другая архитектура — не локальный агент, а десктоп-клиент с облачными моделями. 400+ шаблонов, от 1 990 ₽/мес. Промокод kalsin5 — скидка 5%. Подробнее о выборе решения — в статье про готовые AI-решения.
📌 Что запомнить:
- Локальный агент = модель на вашем GPU, а не в облаке. Никаких API-ключей, подписок и утечки данных. В 2026 году 14B модель на RTX 4070 — это рабочий инструмент, а не эксперимент.
- Старт за 30 минут. Ollama + n8n = первый агент без облака. Iron: бюджетный ПК от 60 000 ₽ окупается за год против облачных подписок.
- Не путайте с десктоп-клиентами. Приложение с облачными LLM — другая архитектура. Локальный агент — это когда модель физически на вашем железе.
🔑 Готовы попробовать AI-агента? Aizor — десктоп-платформа для macOS и Windows. Работает в РФ без VPN, оплата картой РФ и СБП, тарифы от 1 990 ₽/мес. Промокод kalsin5 — скидка 5% при каждом пополнении баланса.