aigenthubTelegram

Аренда сервера с GPU: где взять и сколько стоит в 2026

Где арендовать сервер с видеокартой под нейросети в России: для чего нужен GPU, как прикинуть видеопамять под модель, чем почасовая оплата отличается от помесячной и что показывают официальные страницы провайдеров в октябре 2026.

АК Алексей КальсинОбновлено 12 мин чтения
Содержание
  1. Для чего нужен GPU и когда он не нужен
  2. Сколько видеопамяти нужно модели
  3. Почасовая или помесячная оплата
  4. Российские провайдеры с GPU: что показывают страницы
  5. Как выбрать конфигурацию под задачу
  6. Запуск и безопасность
  7. Альтернатива: модель по API
  8. Частые вопросы

Аренда сервера с GPU нужна, если вы хотите запускать нейросеть на собственном железе: локальную языковую модель, дообучение или генерацию картинок. Для обычного ИИ-агента, который ходит к модели по API, видеокарта не нужна: хватит самого дешёвого VPS. Если же GPU нужен, у российских провайдеров есть три формата: облачные виртуальные машины с почасовой оплатой (например, Cloud.ru и Selectel), выделенные серверы с помесячной оплатой (Beget, Timeweb Cloud) и заказ под задачу через менеджера. По официальным страницам на октябрь 2026, помесячная аренда выделенного сервера с видеокартой Tesla T4 (16 ГБ) у Beget стоит от 35 700 ₽, а в облаке Cloud.ru тариф считается в минутах: A100 — от 4,5 ₽ за минуту. Ниже — как понять, нужна ли вам видеокарта, сколько видеопамяти требуется и где что лежит.

Коротко. GPU нужен для локальных моделей, дообучения и генерации изображений, но не для агентов на внешних API. Главный параметр — объём видеопамяти (VRAM): модель плюс контекст должны в неё поместиться. Для коротких задач и экспериментов выгоднее почасовая или поминутная оплата в облаке, для круглосуточной работы — помесячная аренда. На октябрь 2026: Beget — выделенные серверы с T4 от 35 700 ₽/мес; Cloud.ru — V100, A100, H100 с оплатой по часам и минутам; у Timeweb Cloud и Selectel цены на страницах GPU не указаны (на странице Timeweb — карты от GTX 1080 до H200, у Selectel — аренда на час, сутки или месяц). Прежде чем арендовать, посчитайте, не дешевле ли взять модель по API.

Для чего нужен GPU и когда он не нужен

Видеокарта умеет выполнять тысячи одинаковых вычислений параллельно, а нейросети состоят именно из таких вычислений. Поэтому на GPU модели обычно работают заметно быстрее, чем на процессоре. Но «нужен» ли он вам, зависит от задачи.

ЗадачаНужен ли GPUКомментарий
ИИ-агент или бот, который обращается к модели по APIНетВычисления идут у провайдера модели; на вашей стороне нужен обычный VPS. Подробнее о таких серверах — в статье «Хостинг для Telegram-бота»
Локальная языковая модель (Ollama, vLLM)ЖелательноНа процессоре модель запустится, но, как правило, медленнее; GPU даёт ощутимо более высокую скорость
Дообучение моделиДаТребует заметно больше видеопамяти, чем простой запуск той же модели
Генерация изображений (Stable Diffusion и подобные)ДаНа процессоре расчёт обычно идёт заметно дольше
Распознавание речи, обработка видеоЧасто даЗависит от модели и объёма

Если вы только присматриваетесь к локальным моделям, сначала попробуйте их на своём компьютере: как это сделать, описано в статьях «Ollama: установка и первые шаги» и «Локальный AI-агент на ПК». Аренда GPU оправдана, когда мощности вашего компьютера не хватает, нужен доступ круглосуточно или для нескольких человек.

Сколько видеопамяти нужно модели

Видеопамять (VRAM) — главный ограничитель. Если модель целиком не помещается в видеопамять, её часть уходит в обычную оперативную память, и скорость резко падает. В документации Ollama это видно в команде ollama ps: колонка PROCESSOR показывает, где загружена модель — «100% GPU» (целиком в видеопамяти), «100% CPU» (в оперативной) или смешанный вариант вроде «48%/52% CPU/GPU».

Общий принцип такой:

  1. Размер модели. Файл модели в формате с квантованием (сжатием весов) — это минимальный объём, который займёт загруженная модель. Размеры указаны на странице каждой модели в библиотеке Ollama.
  2. Контекст. Чем длиннее запрос и история диалога, тем больше памяти нужно на кэш контекста. Документация Ollama прямо говорит: больший контекст требует больше памяти.
  3. Запас. Нужен резерв на служебные нужды и на несколько одновременных запросов: при параллельной обработке контекст умножается на число запросов (параметр OLLAMA_NUM_PARALLEL).

Для ориентира — размеры нескольких моделей из библиотеки Ollama (по страницам ollama.com/library на октябрь 2026, это размер загружаемого файла):

МодельРазмер файла
qwen3:8b5,2 ГБ
qwen3:14b9,3 ГБ
gemma3:27b17 ГБ
qwen3:32b20 ГБ
llama3.1:70b43 ГБ

Отсюда простой расчёт: модель на 20 ГБ плюс запас на контекст не уместится в карту на 16 ГБ, а карте на 24 ГБ будет тесно при длинном контексте. Для модели на 43 ГБ нужна карта с 48 ГБ памяти или больше, либо несколько карт: по документации Ollama, если модель не помещается на одном GPU, она распределяется между всеми доступными.

Ещё два факта из документации Ollama, которые экономят память:

  • Контекст по умолчанию зависит от VRAM: меньше 24 ГиБ — 4 тыс. токенов, от 24 до 48 ГиБ — 32 тыс., от 48 ГиБ — 256 тыс. Увеличивать контекст выше умолчания можно, но память вырастет.
  • Квантование K/V-кэша: переменная OLLAMA_KV_CACHE_TYPE со значением q8_0 уменьшает расход памяти кэшем примерно вдвое по сравнению с f16 при очень небольшой потере точности (при включённом Flash Attention).

Также учтите: по документации, Ollama поддерживает видеокарты NVIDIA с compute capability 5.0 и выше и драйвером версии 550 и новее. Прежде чем арендовать старую карту, сверьтесь со списком на docs.ollama.com/gpu. Какие модели вообще брать, мы разбирали в статье «Лучшие модели для Ollama». Для vLLM и дообучения требования другие и зависят от модели, поэтому смотрите карточку модели на Hugging Face и документацию инструмента.

Почасовая или помесячная оплата

У разных провайдеров по официальным страницам встречаются три модели оплаты:

  • Поминутная и почасовая. Cloud.ru указывает цены за минуту и за час для виртуальных машин и называет эту модель pay-as-you-go. Selectel пишет на странице облачных серверов с GPU: «Аренда на час, сутки или месяц». Timeweb Cloud на странице серверов с GPU указывает, что тарифы формируются за месяц, а списания идут раз в час.
  • Помесячная. Выделенные серверы: у Beget в каждой карточке указана «Стоимость в месяц». Cloud.ru для выделенного сервера также указывает месяц как период тарификации.
  • Предоплата и заказ. На странице Timeweb для ряда карт (H200, H100, A100, L4, A6000, A5000) действует предзаказ с минимальным авансовым платежом от 5 000 ₽.

Как выбирать между ними, решает загрузка:

  • Эксперименты, дообучение раз в неделю, редкие пакетные задачи — платите по часам и выключайте машину. Простой пример расчёта: если A100 стоит от 4,5 ₽ за минуту (то есть 270 ₽ в час по умножению), то 40 часов работы в месяц обойдутся примерно в 10 800 ₽ — при условии, что вы остановили машину между запусками. Уточняйте, продолжается ли списание за остановленную машину и диски: это условие тарифа.
  • Модель должна отвечать круглосуточно (чат для сотрудников, внутренний ассистент) — выделенный сервер с помесячной оплатой предсказуемее. Для сравнения: 730 часов в месяце по цене 270 ₽ в час — около 197 тысяч рублей, так что для постоянной работы поминутный тариф обычно невыгоден.
  • Нагрузка неравномерная и небольшая — посчитайте вариант с API: возможно, оплата за токены окажется дешевле аренды.

Это арифметика на основе цены со страницы, а не прайс на конкретную конфигурацию: итоговую стоимость определяют также процессор, память, диск, трафик и налоги. Cloud.ru указывает цену «с НДС».

Российские провайдеры с GPU: что показывают страницы

Ниже — только то, что прямо указано на официальных страницах, открытых в октябре 2026. Цены и конфигурации меняются, наличие видеокарт тоже: уточняйте при заказе.

ПровайдерЧто предлагает по страницеЦена (октябрь 2026)Оплата
BegetВыделенные физические серверы. Lava №1: 6 ядер, 32 ГБ ОЗУ, 1 × Tesla T4 16 ГБ. Lava №2: 8 ядер, 64 ГБ ОЗУ, 1 × Tesla T4 16 ГБ. Blackwell №1: 1 × Quadro RTX PRO 5000, 48 ГБ. Blackwell №2 и №3: 1 × Quadro RTX PRO 6000, 96 ГБ35 700 ₽, 43 000 ₽, 184 500 ₽, 262 000 ₽ и 283 000 ₽ в месяц (по порядку конфигураций)Помесячная; 14 дней в подарок при оплате за 6 месяцев; нет установочного платежа; 30 ТБ трафика включено
Cloud.ru (Evolution)Виртуальные машины, выделенные серверы и ML-сервисы с ускорителями B300, H100, V100, A40 и A100V100 — от 2,5 ₽ за минуту (на той же странице также указано «от 240 ₽ за час»), A100 — от 4,5 ₽ за минуту, H100 — от 9,5 ₽ за минуту; выделенный сервер HGX (8 × H100 80 ГБ) — от 5 355 000 ₽ в месяц; цены с НДСВМ — почасовая, ML-сервис — месяц или минута, выделенный сервер — месяц
Timeweb CloudОблачные и выделенные серверы с GPU NVIDIA: GTX 1080, RTX 2080 Ti, 3080, 3090, 4090, серия A (A2, A30, A2000, A4000, A5000, A6000), Tesla T4; по предзаказу — H200, H100, A100, L4, A6000, A5000Цены на странице не указаны; для предзаказа — минимальный аванс от 5 000 ₽Списания раз в час (по странице); конфигурацию можно собрать с экспертом
SelectelОблачные ВМ с Tesla T4, A2, A30, A100, A2000, A5000, а также GTX 1080, RTX 2080 Ti, 4090, 6000 Ada, A100 NVLink; карта передаётся в ВМ как выделенное PCI-устройствоЦена на странице считается калькулятором и в статическом виде не указана; также указан грант для AI-проектов до 2 000 000 ₽ бонусамиЧас, сутки или месяц

Партнёрских ссылок на эти страницы нет; ссылки ведут на официальные разделы GPU. Данные на октябрь 2026, перепроверяйте на сайтах провайдеров.

Что важно из таблицы:

  • Beget показывает готовые конфигурации с точной ценой за месяц — это самое простое для сравнения. Серверы размещаются в дата-центрах Tier III в Москве или Санкт-Петербурге. Tesla T4 с 16 ГБ — карта для небольших моделей и инференса; для моделей на 20 ГБ и больше посмотрите Blackwell-конфигурации.
  • Cloud.ru — единственный из проверенных, кто публикует цены за минуту и час прямо на странице. Для разовых задач на A100 или H100 это самый прозрачный вариант. Если на странице две цифры для V100 (за минуту и за час), при заказе используйте калькулятор в личном кабинете.
  • Timeweb Cloud — широкий список карт, но цены нужно узнавать в панели или у менеджера. Если вам нужен обычный VPS без видеокарты, у Timeweb Cloud он есть отдельно: VPS Timeweb Cloud. Реклама.
  • Selectel — гибкая сборка ВМ из vCPU, RAM, GPU и дисков. Предупреждение на странице: выбранная конфигурация может быть недоступна в некоторых пулах.

Для Beget тоже есть партнёрская ссылка, но она ведёт на раздел обычных VPS: VPS Beget. Реклама. Для задач агента без видеокарты это нормальный вариант, а для GPU используйте страницу выше.

Yandex Cloud и Reg.ru мы в этом материале не сравниваем: при проверке их страницы с GPU не открылись без прохождения капчи, а данных по памяти и ценам мы не подтвердили. Посмотрите их сайты сами, если эти провайдеры вам удобны.

Как выбрать конфигурацию под задачу

  1. Определите модель. Выберите её в библиотеке Ollama или на Hugging Face и посмотрите размер.
  2. Прибавьте запас на контекст. Для короткого диалога хватит небольшого запаса, для длинных документов он будет заметным. Сверяйтесь с таблицей умолчаний Ollama.
  3. Проверьте драйвер и совместимость. Для Ollama — NVIDIA с compute capability 5.0+ и свежий драйвер; для других инструментов смотрите их документацию.
  4. Начните с короткой аренды. Сначала проверьте скорость ответа на вашей модели за пару часов, и только потом оформляйте помесячный тариф.
  5. Спросите про сеть и диски. Модель на десятки гигабайт нужно скачать, поэтому смотрите на объём диска и скорость канала.

Запуск и безопасность

На арендованном сервере с Ubuntu установка Ollama выглядит так же, как на ПК. После установки не открывайте порт модели в интернет: по документации, Ollama по умолчанию привязана к адресу 127.0.0.1 и порту 11434, и менять это без защиты не стоит. Если сервис нужен сотрудникам, ставьте перед ним обратный прокси с авторизацией или закрывайте доступ через фаервол. Базовые шаги описаны в статье «Как защитить AI-агента на VPS». Если на сервере будут персональные данные, уточните у провайдера, соответствует ли выбранная площадка вашим требованиям: Timeweb Cloud заявляет на странице соответствие 152-ФЗ, но решение по вашему проекту остаётся за вами и юристом.

Альтернатива: модель по API

Если вам нужны сильные модели, но нет желания администрировать GPU, посмотрите вариант с API. Тогда вы платите за токены, а не за часы сервера, и вам не нужен даже минимальный запас по видеопамяти. Учтите, что ChatGPT (OpenAI) и Claude (Anthropic) официально в России не работают: Россия не входит в список поддерживаемых стран, а российские карты не принимаются. Как поступают в этой ситуации, мы разбираем в статье «Как оплатить Claude из России». Выбирайте провайдера API, условия которого вы проверили сами, а локальная модель на арендованном GPU остаётся вариантом, когда важно держать данные у себя.

Частые вопросы

Нужна ли видеокарта для ИИ-агента?

Нет, если агент использует модель по API: вычисления выполняются у провайдера модели, а агенту хватит обычного VPS. Видеокарта нужна для запуска собственных моделей, дообучения и генерации изображений. Когда хватит обычного VPS, а когда нужен сервер с видеокартой, разобрано в статье «Сервер для нейросети».

Сколько стоит аренда сервера с GPU?

По официальным страницам на октябрь 2026: у Beget выделенные серверы с видеокартой начинаются от 35 700 ₽ в месяц (Tesla T4, 16 ГБ), у Cloud.ru цены указаны за минуту: A100 — от 4,5 ₽, H100 — от 9,5 ₽. У Timeweb Cloud и Selectel цены на страницах GPU не указаны, их нужно смотреть в калькуляторе или у менеджера.

Сколько видеопамяти нужно для модели?

Не меньше размера файла модели плюс запас на контекст. Например, qwen3:32b занимает 20 ГБ, поэтому в карту на 16 ГБ целиком не поместится. Точный расход зависит от длины контекста и числа одновременных запросов.

Что выгоднее: почасовая или помесячная оплата?

Для редких задач почасовая: платите только за время работы. Для круглосуточной работы выгоднее помесячная аренда выделенного сервера. Посчитайте оба варианта по вашей загрузке.

Можно ли запустить Ollama на арендованном GPU-сервере?

Да, если видеокарта NVIDIA поддерживается Ollama (compute capability 5.0 и выше, драйвер 550 и новее). Установка на Ubuntu делается так же, как на обычном компьютере, а доступ к модели нужно закрыть паролем или фаерволом.

Что делать, если GPU слишком дорогой?

Сначала попробуйте модель меньшего размера или более сильное квантование, затем сравните стоимость с оплатой токенов по API. Для многих бизнес-задач агенту на API вполне хватает обычного VPS.

АК
Алексей Кальсин

Строю AI-агентов для своего бизнеса и клиентов, на сайте пишу о том, что запускал сам. Вопросы задавайте в Telegram.

@aaakalsin →

Ещё в разделе «Установка и настройка»

Новые агенты и рабочие связки раньше, чем в блоге

Короткие разборы, промокоды и ответы на вопросы в Telegram-канале.

Подписаться в Telegram