Аренда сервера с GPU: где взять и сколько стоит в 2026
Где арендовать сервер с видеокартой под нейросети в России: для чего нужен GPU, как прикинуть видеопамять под модель, чем почасовая оплата отличается от помесячной и что показывают официальные страницы провайдеров в октябре 2026.

Содержание
Аренда сервера с GPU нужна, если вы хотите запускать нейросеть на собственном железе: локальную языковую модель, дообучение или генерацию картинок. Для обычного ИИ-агента, который ходит к модели по API, видеокарта не нужна: хватит самого дешёвого VPS. Если же GPU нужен, у российских провайдеров есть три формата: облачные виртуальные машины с почасовой оплатой (например, Cloud.ru и Selectel), выделенные серверы с помесячной оплатой (Beget, Timeweb Cloud) и заказ под задачу через менеджера. По официальным страницам на октябрь 2026, помесячная аренда выделенного сервера с видеокартой Tesla T4 (16 ГБ) у Beget стоит от 35 700 ₽, а в облаке Cloud.ru тариф считается в минутах: A100 — от 4,5 ₽ за минуту. Ниже — как понять, нужна ли вам видеокарта, сколько видеопамяти требуется и где что лежит.
Коротко. GPU нужен для локальных моделей, дообучения и генерации изображений, но не для агентов на внешних API. Главный параметр — объём видеопамяти (VRAM): модель плюс контекст должны в неё поместиться. Для коротких задач и экспериментов выгоднее почасовая или поминутная оплата в облаке, для круглосуточной работы — помесячная аренда. На октябрь 2026: Beget — выделенные серверы с T4 от 35 700 ₽/мес; Cloud.ru — V100, A100, H100 с оплатой по часам и минутам; у Timeweb Cloud и Selectel цены на страницах GPU не указаны (на странице Timeweb — карты от GTX 1080 до H200, у Selectel — аренда на час, сутки или месяц). Прежде чем арендовать, посчитайте, не дешевле ли взять модель по API.
Для чего нужен GPU и когда он не нужен
Видеокарта умеет выполнять тысячи одинаковых вычислений параллельно, а нейросети состоят именно из таких вычислений. Поэтому на GPU модели обычно работают заметно быстрее, чем на процессоре. Но «нужен» ли он вам, зависит от задачи.
| Задача | Нужен ли GPU | Комментарий |
|---|---|---|
| ИИ-агент или бот, который обращается к модели по API | Нет | Вычисления идут у провайдера модели; на вашей стороне нужен обычный VPS. Подробнее о таких серверах — в статье «Хостинг для Telegram-бота» |
| Локальная языковая модель (Ollama, vLLM) | Желательно | На процессоре модель запустится, но, как правило, медленнее; GPU даёт ощутимо более высокую скорость |
| Дообучение модели | Да | Требует заметно больше видеопамяти, чем простой запуск той же модели |
| Генерация изображений (Stable Diffusion и подобные) | Да | На процессоре расчёт обычно идёт заметно дольше |
| Распознавание речи, обработка видео | Часто да | Зависит от модели и объёма |
Если вы только присматриваетесь к локальным моделям, сначала попробуйте их на своём компьютере: как это сделать, описано в статьях «Ollama: установка и первые шаги» и «Локальный AI-агент на ПК». Аренда GPU оправдана, когда мощности вашего компьютера не хватает, нужен доступ круглосуточно или для нескольких человек.
Сколько видеопамяти нужно модели
Видеопамять (VRAM) — главный ограничитель. Если модель целиком не помещается в видеопамять, её часть уходит в обычную оперативную память, и скорость резко падает. В документации Ollama это видно в команде ollama ps: колонка PROCESSOR показывает, где загружена модель — «100% GPU» (целиком в видеопамяти), «100% CPU» (в оперативной) или смешанный вариант вроде «48%/52% CPU/GPU».
Общий принцип такой:
- Размер модели. Файл модели в формате с квантованием (сжатием весов) — это минимальный объём, который займёт загруженная модель. Размеры указаны на странице каждой модели в библиотеке Ollama.
- Контекст. Чем длиннее запрос и история диалога, тем больше памяти нужно на кэш контекста. Документация Ollama прямо говорит: больший контекст требует больше памяти.
- Запас. Нужен резерв на служебные нужды и на несколько одновременных запросов: при параллельной обработке контекст умножается на число запросов (параметр
OLLAMA_NUM_PARALLEL).
Для ориентира — размеры нескольких моделей из библиотеки Ollama (по страницам ollama.com/library на октябрь 2026, это размер загружаемого файла):
| Модель | Размер файла |
|---|---|
| qwen3:8b | 5,2 ГБ |
| qwen3:14b | 9,3 ГБ |
| gemma3:27b | 17 ГБ |
| qwen3:32b | 20 ГБ |
| llama3.1:70b | 43 ГБ |
Отсюда простой расчёт: модель на 20 ГБ плюс запас на контекст не уместится в карту на 16 ГБ, а карте на 24 ГБ будет тесно при длинном контексте. Для модели на 43 ГБ нужна карта с 48 ГБ памяти или больше, либо несколько карт: по документации Ollama, если модель не помещается на одном GPU, она распределяется между всеми доступными.
Ещё два факта из документации Ollama, которые экономят память:
- Контекст по умолчанию зависит от VRAM: меньше 24 ГиБ — 4 тыс. токенов, от 24 до 48 ГиБ — 32 тыс., от 48 ГиБ — 256 тыс. Увеличивать контекст выше умолчания можно, но память вырастет.
- Квантование K/V-кэша: переменная
OLLAMA_KV_CACHE_TYPEсо значениемq8_0уменьшает расход памяти кэшем примерно вдвое по сравнению сf16при очень небольшой потере точности (при включённом Flash Attention).
Также учтите: по документации, Ollama поддерживает видеокарты NVIDIA с compute capability 5.0 и выше и драйвером версии 550 и новее. Прежде чем арендовать старую карту, сверьтесь со списком на docs.ollama.com/gpu. Какие модели вообще брать, мы разбирали в статье «Лучшие модели для Ollama». Для vLLM и дообучения требования другие и зависят от модели, поэтому смотрите карточку модели на Hugging Face и документацию инструмента.
Почасовая или помесячная оплата
У разных провайдеров по официальным страницам встречаются три модели оплаты:
- Поминутная и почасовая. Cloud.ru указывает цены за минуту и за час для виртуальных машин и называет эту модель pay-as-you-go. Selectel пишет на странице облачных серверов с GPU: «Аренда на час, сутки или месяц». Timeweb Cloud на странице серверов с GPU указывает, что тарифы формируются за месяц, а списания идут раз в час.
- Помесячная. Выделенные серверы: у Beget в каждой карточке указана «Стоимость в месяц». Cloud.ru для выделенного сервера также указывает месяц как период тарификации.
- Предоплата и заказ. На странице Timeweb для ряда карт (H200, H100, A100, L4, A6000, A5000) действует предзаказ с минимальным авансовым платежом от 5 000 ₽.
Как выбирать между ними, решает загрузка:
- Эксперименты, дообучение раз в неделю, редкие пакетные задачи — платите по часам и выключайте машину. Простой пример расчёта: если A100 стоит от 4,5 ₽ за минуту (то есть 270 ₽ в час по умножению), то 40 часов работы в месяц обойдутся примерно в 10 800 ₽ — при условии, что вы остановили машину между запусками. Уточняйте, продолжается ли списание за остановленную машину и диски: это условие тарифа.
- Модель должна отвечать круглосуточно (чат для сотрудников, внутренний ассистент) — выделенный сервер с помесячной оплатой предсказуемее. Для сравнения: 730 часов в месяце по цене 270 ₽ в час — около 197 тысяч рублей, так что для постоянной работы поминутный тариф обычно невыгоден.
- Нагрузка неравномерная и небольшая — посчитайте вариант с API: возможно, оплата за токены окажется дешевле аренды.
Это арифметика на основе цены со страницы, а не прайс на конкретную конфигурацию: итоговую стоимость определяют также процессор, память, диск, трафик и налоги. Cloud.ru указывает цену «с НДС».
Российские провайдеры с GPU: что показывают страницы
Ниже — только то, что прямо указано на официальных страницах, открытых в октябре 2026. Цены и конфигурации меняются, наличие видеокарт тоже: уточняйте при заказе.
| Провайдер | Что предлагает по странице | Цена (октябрь 2026) | Оплата |
|---|---|---|---|
| Beget | Выделенные физические серверы. Lava №1: 6 ядер, 32 ГБ ОЗУ, 1 × Tesla T4 16 ГБ. Lava №2: 8 ядер, 64 ГБ ОЗУ, 1 × Tesla T4 16 ГБ. Blackwell №1: 1 × Quadro RTX PRO 5000, 48 ГБ. Blackwell №2 и №3: 1 × Quadro RTX PRO 6000, 96 ГБ | 35 700 ₽, 43 000 ₽, 184 500 ₽, 262 000 ₽ и 283 000 ₽ в месяц (по порядку конфигураций) | Помесячная; 14 дней в подарок при оплате за 6 месяцев; нет установочного платежа; 30 ТБ трафика включено |
| Cloud.ru (Evolution) | Виртуальные машины, выделенные серверы и ML-сервисы с ускорителями B300, H100, V100, A40 и A100 | V100 — от 2,5 ₽ за минуту (на той же странице также указано «от 240 ₽ за час»), A100 — от 4,5 ₽ за минуту, H100 — от 9,5 ₽ за минуту; выделенный сервер HGX (8 × H100 80 ГБ) — от 5 355 000 ₽ в месяц; цены с НДС | ВМ — почасовая, ML-сервис — месяц или минута, выделенный сервер — месяц |
| Timeweb Cloud | Облачные и выделенные серверы с GPU NVIDIA: GTX 1080, RTX 2080 Ti, 3080, 3090, 4090, серия A (A2, A30, A2000, A4000, A5000, A6000), Tesla T4; по предзаказу — H200, H100, A100, L4, A6000, A5000 | Цены на странице не указаны; для предзаказа — минимальный аванс от 5 000 ₽ | Списания раз в час (по странице); конфигурацию можно собрать с экспертом |
| Selectel | Облачные ВМ с Tesla T4, A2, A30, A100, A2000, A5000, а также GTX 1080, RTX 2080 Ti, 4090, 6000 Ada, A100 NVLink; карта передаётся в ВМ как выделенное PCI-устройство | Цена на странице считается калькулятором и в статическом виде не указана; также указан грант для AI-проектов до 2 000 000 ₽ бонусами | Час, сутки или месяц |
Партнёрских ссылок на эти страницы нет; ссылки ведут на официальные разделы GPU. Данные на октябрь 2026, перепроверяйте на сайтах провайдеров.
Что важно из таблицы:
- Beget показывает готовые конфигурации с точной ценой за месяц — это самое простое для сравнения. Серверы размещаются в дата-центрах Tier III в Москве или Санкт-Петербурге. Tesla T4 с 16 ГБ — карта для небольших моделей и инференса; для моделей на 20 ГБ и больше посмотрите Blackwell-конфигурации.
- Cloud.ru — единственный из проверенных, кто публикует цены за минуту и час прямо на странице. Для разовых задач на A100 или H100 это самый прозрачный вариант. Если на странице две цифры для V100 (за минуту и за час), при заказе используйте калькулятор в личном кабинете.
- Timeweb Cloud — широкий список карт, но цены нужно узнавать в панели или у менеджера. Если вам нужен обычный VPS без видеокарты, у Timeweb Cloud он есть отдельно: VPS Timeweb Cloud. Реклама.
- Selectel — гибкая сборка ВМ из vCPU, RAM, GPU и дисков. Предупреждение на странице: выбранная конфигурация может быть недоступна в некоторых пулах.
Для Beget тоже есть партнёрская ссылка, но она ведёт на раздел обычных VPS: VPS Beget. Реклама. Для задач агента без видеокарты это нормальный вариант, а для GPU используйте страницу выше.
Yandex Cloud и Reg.ru мы в этом материале не сравниваем: при проверке их страницы с GPU не открылись без прохождения капчи, а данных по памяти и ценам мы не подтвердили. Посмотрите их сайты сами, если эти провайдеры вам удобны.
Как выбрать конфигурацию под задачу
- Определите модель. Выберите её в библиотеке Ollama или на Hugging Face и посмотрите размер.
- Прибавьте запас на контекст. Для короткого диалога хватит небольшого запаса, для длинных документов он будет заметным. Сверяйтесь с таблицей умолчаний Ollama.
- Проверьте драйвер и совместимость. Для Ollama — NVIDIA с compute capability 5.0+ и свежий драйвер; для других инструментов смотрите их документацию.
- Начните с короткой аренды. Сначала проверьте скорость ответа на вашей модели за пару часов, и только потом оформляйте помесячный тариф.
- Спросите про сеть и диски. Модель на десятки гигабайт нужно скачать, поэтому смотрите на объём диска и скорость канала.
Запуск и безопасность
На арендованном сервере с Ubuntu установка Ollama выглядит так же, как на ПК. После установки не открывайте порт модели в интернет: по документации, Ollama по умолчанию привязана к адресу 127.0.0.1 и порту 11434, и менять это без защиты не стоит. Если сервис нужен сотрудникам, ставьте перед ним обратный прокси с авторизацией или закрывайте доступ через фаервол. Базовые шаги описаны в статье «Как защитить AI-агента на VPS». Если на сервере будут персональные данные, уточните у провайдера, соответствует ли выбранная площадка вашим требованиям: Timeweb Cloud заявляет на странице соответствие 152-ФЗ, но решение по вашему проекту остаётся за вами и юристом.
Альтернатива: модель по API
Если вам нужны сильные модели, но нет желания администрировать GPU, посмотрите вариант с API. Тогда вы платите за токены, а не за часы сервера, и вам не нужен даже минимальный запас по видеопамяти. Учтите, что ChatGPT (OpenAI) и Claude (Anthropic) официально в России не работают: Россия не входит в список поддерживаемых стран, а российские карты не принимаются. Как поступают в этой ситуации, мы разбираем в статье «Как оплатить Claude из России». Выбирайте провайдера API, условия которого вы проверили сами, а локальная модель на арендованном GPU остаётся вариантом, когда важно держать данные у себя.
Частые вопросы
Нужна ли видеокарта для ИИ-агента?
Нет, если агент использует модель по API: вычисления выполняются у провайдера модели, а агенту хватит обычного VPS. Видеокарта нужна для запуска собственных моделей, дообучения и генерации изображений. Когда хватит обычного VPS, а когда нужен сервер с видеокартой, разобрано в статье «Сервер для нейросети».
Сколько стоит аренда сервера с GPU?
По официальным страницам на октябрь 2026: у Beget выделенные серверы с видеокартой начинаются от 35 700 ₽ в месяц (Tesla T4, 16 ГБ), у Cloud.ru цены указаны за минуту: A100 — от 4,5 ₽, H100 — от 9,5 ₽. У Timeweb Cloud и Selectel цены на страницах GPU не указаны, их нужно смотреть в калькуляторе или у менеджера.
Сколько видеопамяти нужно для модели?
Не меньше размера файла модели плюс запас на контекст. Например, qwen3:32b занимает 20 ГБ, поэтому в карту на 16 ГБ целиком не поместится. Точный расход зависит от длины контекста и числа одновременных запросов.
Что выгоднее: почасовая или помесячная оплата?
Для редких задач почасовая: платите только за время работы. Для круглосуточной работы выгоднее помесячная аренда выделенного сервера. Посчитайте оба варианта по вашей загрузке.
Можно ли запустить Ollama на арендованном GPU-сервере?
Да, если видеокарта NVIDIA поддерживается Ollama (compute capability 5.0 и выше, драйвер 550 и новее). Установка на Ubuntu делается так же, как на обычном компьютере, а доступ к модели нужно закрыть паролем или фаерволом.
Что делать, если GPU слишком дорогой?
Сначала попробуйте модель меньшего размера или более сильное квантование, затем сравните стоимость с оплатой токенов по API. Для многих бизнес-задач агенту на API вполне хватает обычного VPS.
Строю AI-агентов для своего бизнеса и клиентов, на сайте пишу о том, что запускал сам. Вопросы задавайте в Telegram.
@aaakalsin →

