Реклама
Меморина
Меморина
Меморина

Где арендовать GPU для инференса моделей: 6 сервисов

Разбираем, где арендовать GPU под инференс: конфигурации от T4 до B300, посекундная тарификация и оплата за токены, размещение в РФ и за рубежом, цены и ограничения.

Обложка: Где арендовать GPU для инференса моделей: 6 сервисов

Аренда GPU для инференса — это компромисс между ценой часа, доступностью нужных карт и объёмом рутины, которую команда готова взять на себя. Мы собрали пять сервисов, где можно поднять инференс LLM: от self-service облаков с посекундной оплатой до managed-платформ с тарификацией за токены. Для каждого разобрали доступные видеокарты, способы запуска, цены, документы для юрлиц и ограничения.

В подборке

immers.cloud — ВМ и выделенные серверы с 13 моделями NVIDIA вплоть до H200, каталог Foundation Models с бесплатными публичными эндпоинтами и приватными инстансами, посекундная тарификация и пополнение от 100 ₽; собственный ЦОД в Москве.

К2 Облако — ВМ и выделенные серверы с картами NVIDIA вплоть до H100, Managed Kubernetes с GPU и Model as a Service с оплатой за токены; конфигурации под задачу и инфраструктура в российских ЦОД.

Yandex Cloud — GPU-ВМ, ML-платформа DataSphere и serverless-инференс AI Studio с оплатой за токены; инфраструктура в России.

VK Cloud — Cloud GPU с картами вплоть до H200 и дробная аренда vGPU от 1/24 видеокарты L4; четыре ЦОД Tier III в Москве.

Cloud.ru — платформа Evolution с ВМ до 8×H100, serverless Foundation Models и максимальным комплектом аттестатов: 152-ФЗ по уровню УЗ-1, объекты КИИ, реестр российского ПО.

Nebius — зарубежное GPU-облако с картами вплоть до B300 и managed-инференсом Token Factory; с российскими юрлицами по условиям договора не работает.

Как мы выбирали сервисы

В подборку вошли платформы, которые прямо сейчас позволяют арендовать GPU под инференс: поднять виртуальную машину или выделенный сервер с видеокартой либо вызывать модели через управляемый API. Мы опирались только на официальные источники — продуктовые страницы, документацию и тарифные приложения — и сверяли пять критериев:

  • доступные модели GPU и способ их получения: из кабинета сразу или по запросу;
  • форматы запуска инференса: IaaS, managed-деплой моделей, serverless с оплатой за токены;
  • тарификация и минимальный чек: цена GPU-часа, хранение весов и данных, трафик;
  • размещение инфраструктуры и документы для российских юрлиц: договор, ЭДО, соответствие 152-ФЗ;
  • поддержка, SLA и ограничения, о которых лучше знать до старта.

1. immers.cloud — низкий порог входа

Облачная IaaS-платформа с собственным дата-центром в Москве: здесь арендуют виртуальные машины и выделенные серверы с GPU, а также запускают модели из каталога Immers Foundation Models. Отличается низким порогом входа — регистрация и пополнение баланса от 100 ₽ открывают доступ ко всему каталогу инстансов, без заявок и предзаказов.

Где арендовать GPU для инференса моделей: 6 сервисов_7
Создание GPU-сервера в личном кабинете immers.cloud

Кейсы клиентов и кому подойдёт

Провайдер приводит два показательных сценария использования:

  • Команда «КС Авто» развернула автономную систему круглосуточной модерации контента: мультимодальные модели работают через Ollama на трёх облачных RTX 4090 с NVMe, потоки изолированы по видеокартам. Система фильтрует сотни спам-атак ежедневно и полностью заменила штат из 15 модераторов.
  • В IBS собрали единую R&D-песочницу для AI-экспериментов: смешанная нагрузка (LLM, NLP, VLM) управляется через GPUStack и vLLM на пуле из A100, RTX 3090 и RTX 4090. Одиннадцать инстансов обслуживают 14 моделей, и новые гипотезы проверяют за часы, без выделения отдельных серверов.

Формат подходит стартапам с AI-продуктом, ML-инженерам, командам, которые собирают RAG-сервисы и чат-ботов, и продакшен-командам с постоянной нагрузкой. Развёртывание моделей от 70B, высокую параллельность запросов, обработку персональных данных и миграцию из другого облака провайдер рекомендует обсудить до старта.

Что можно развернуть

Пул включает 13 моделей видеокарт NVIDIA: H200 (141 ГБ), H100 NVL (94 ГБ) и H100 (80 ГБ), A100 (80 ГБ), V100 (32 ГБ), RTX 5090 (32 ГБ), RTX 4090 и RTX 3090 (24 ГБ), RTX 3080 (10 ГБ), RTX A5000 и A10 (24 ГБ), RTX 2080 Ti (11 ГБ), A2 и T4 (16 ГБ). Есть конфигурации с NVLink. На одну виртуальную машину подключается до восьми GPU, на выделенный сервер — до десяти.

Инференс запускается двумя путями. Первый — классический IaaS: маркетплейс готовых образов с предустановленными CUDA, vLLM и Jupyter сокращает развёртывание окружения до нескольких минут; совместимость подтверждена для vLLM, Ollama, Hugging Face и OpenAI-compatible API.

Второй — каталог Immers Foundation Models: более 200 моделей (Qwen, Gemma, GLM, Whisper и другие) с 1800 рекомендуемыми конфигурациями.

Для каждой указаны размер контекста, архитектура и оценочное потребление VRAM.

В каталоге есть публичные эндпоинты для бесплатного тестирования open-source-моделей, среди которых Unlimited-OCR, Gemma 4 26B A4B IT и Qwen3.5 35B A3B. Запросы можно отправлять через чат в личном кабинете или напрямую через API. Это позволяет проверить качество ответов и вызов инструментов, а также собрать прототип перед запуском приватного инстанса.

Бесплатный доступ действует только для публичных эндпоинтов и предоставляется на ограниченный период. Приватные инстансы оплачиваются за фактическое время работы сервера по стандартному тарифу, без дополнительных списаний за токены. Об изменении условий тестирования провайдер обещает сообщать заранее.

Где арендовать GPU для инференса моделей: 6 сервисов_19
Рекомендуемые конфигурации в 4-бита с карточки модели GLM-5.2 с возможностью перехода к деплою

Инфраструктура и экосистема

Платформа построена на OpenStack (релиз Zed) без модификаций API, поэтому работают openstack-cli, OpenStack SDK и Terraform-провайдер. Серверы размещены в собственном ЦОД уровня Tier III в Москве и охлаждаются иммерсионно — погружением в диэлектрическую жидкость, что исключает троттлинг при круглосуточной загрузке GPU. Сетевые параметры: интернет-канал до 20 Гбит/с, частная сеть до 20 Гбит/с, балансировщик и SSL из коробки; эндпоинты можно поднимать в приватных сетях или на публичном IP, с группами безопасности для трафика. SLA — 100% на vCPU, RAM и GPU. Масштабирование ручное: конфигурацию меняют через resize, эндпоинт пересоздают с нужным числом воркеров.

Отзывы и репутация

Агрегированные оценки и публичные рейтинги сервис не раскрывает. Из подтверждённой фактуры — описанные выше клиентские кейсы и сертификат ГОСТ Р ИСО/МЭК 27001-2021 по системе менеджмента информационной безопасности.

Поддержка и каналы связи

Техподдержка работает круглосуточно: чат на сайте, Telegram и Max, электронная почта; для клиентов доступен менеджер. Заявленное время реакции — до пяти минут. Поддержка помогает подобрать GPU под конкретную модель и нагрузку, настроить окружение, перенести модель, разобраться с сетью и документами. Гайды по работе с облаком собраны в FAQ на русском языке.

Тарифы, ограничения и условия

Тарификация посекундная: стоимость рассчитывается каждый час за фактически отработанные секунды, пополнение баланса — от 100 ₽. Простаивающую машину можно заморозить функцией Shelve: списания за железо останавливаются, оплачиваются только хранение тома и закреплённый IP-адрес. Действуют тарифы по предоплате на 30, 60, 180 и 360 дней и коммит по договору долгосрочной аренды; тестовый баланс и гранты выдают индивидуально по запросу.

Где арендовать GPU для инференса моделей: 6 сервисов_28
 Деплой модели GLM-5.2 и стоимость

Что именно можно арендовать

  • Оценка месяца инференса: модель 7B — около 49 215 ₽, 14B — около 92 755 ₽, тяжёлая LLM уровня 72B — около 286 104 ₽.
  • Рекомендуемые конфигурации из каталога: gemma-4-12B-it — от 46,94 ₽/час, GLM-5.2 на восьми A100 с NVLink — 1677,58 ₽/час.
  • Хранение: SSD — 9 ₽ за ГБ в месяц, HDD — 2 ₽ за ГБ в месяц. Трафик не тарифицируется.

Ограничения: нет managed Kubernetes и сертифицированного контура, для Foundation Models нет тарификации pay-per-token — модель работает на арендованном сервере, но есть бесплатные публичные модели для теста. Базовые квоты аккаунта — четыре инстанса, 16 vCPU и 128 ГБ RAM, повышаются по запросу.

Для компаний и организаций

Юридическим лицам доступны счета на оплату банковским переводом, ЭДО через Контур Диадок, работа по публичной оферте или рамочному договору, предоплата и постоплата.

Официальный сайт: immers.cloud

2. К2 Облако — конфигурации под задачу

Облачная платформа российского провайдера K2 Cloud: виртуальные машины и выделенные серверы с картами NVIDIA, Managed Kubernetes с GPU и ML-платформа K2 NeuroTech поверх. Отличается тем, что конфигурация собирается под задачу: соотношение vCPU и RAM выбирается из трёх схем, а под нетиповую нагрузку выделяют сервер с RAM до 4 ТБ. Отдельным сервисом идёт ИИ-консалтинг — от аудита до вывода модели в промышленную эксплуатацию.

Где арендовать GPU для инференса моделей: 6 сервисов_37

Кейсы клиентов и кому подойдёт

Провайдер приводит два сценария с подтверждёнными результатами:

  • Сервис заказа поездок Drivee вынес ML-сервисы на GPU NVIDIA T4 в публичном облаке: фотоконтроль водителя и автомобиля перед выходом на линию и модерация пользовательского контента. По описанию кейса ИИ закрывает 75% задач фотоконтроля без оператора, обрабатывает до 10 000 кейсов в сутки и проверяет водителя за 2–3 секунды вместо нескольких минут; модерация разбирает 20–30 тысяч комментариев в день. Данные обрабатываются по 152-ФЗ до УЗ-1 и PCI DSS 4.0.
  • Инвестиционная компания подняла ИИ-платформу для разработчиков на GPUaaS с NVIDIA H100. В инференсе — несколько моделей Qwen3: Coder 30B для написания и анализа кода, Embedder и Reranker на 4B и 0,6B. Балансировка запросов идёт через Nginx и LiteLLM, загрузка GPU снимается в Zabbix; исходный код и бизнес-логика остаются внутри контролируемого контура.
  • Мультиагентная система круглосуточного реагирования на инциденты работает на двух NVIDIA L40S.

К2 Облако подходит компаниям среднего и корпоративного сегмента, ИТ-компаниям, стартапам с AI-продуктами и продакшен-командам с постоянной нагрузкой. Подключение рекомендуется обсуждать с менеджером до старта: конфигурацию подбирают под задачу, а выделенный сервер готовят от трёх рабочих дней.

Что можно развернуть

Доступны пять моделей видеокарт NVIDIA: H100 (80 ГБ), A100 (80 ГБ), L40S (48 ГБ), L4 (24 ГБ) и T4 (16 ГБ) — все выдаются из личного кабинета без предзаказа. В одну виртуальную машину или выделенный сервер подключается до четырёх карт, объединение — через NVLink. Типовые конфигурации: одна H100 — 12 vCPU и 96 ГБ RAM, две H100 — 24 vCPU и 192 ГБ. Соотношение vCPU к RAM меняется по схемам 1:2, 1:4 и 1:8, диск — от 32 ГБ до 4 ТБ на том, до 16 томов на машину.

Где арендовать GPU для инференса моделей: 6 сервисов_44
Флейворы GPU accelerated computing в консоли К2 Облака: карта, число ядер и объём памяти

Форматы аренды: виртуальные машины с GPU, выделенные серверы, Managed Kubernetes с GPU (карта делится на изолированные инстансы через MIG) и Model as a Service с оплатой за токены. Инференс запускают через готовый образ, Docker, Kubernetes, SSH, API или Terraform; в образах предустановлены драйверы NVIDIA, CUDA, PyTorch, TensorFlow, Jupyter, vLLM, Ollama, Triton Inference Server и SGLang, отдельно заявлена совместимость с TGI, Ray, LangChain, LlamaIndex, Hugging Face и OpenAI-compatible API. На инфраструктуре запускают Llama, Qwen, Mistral, Gemma, DeepSeek, Stable Diffusion и Whisper — от 7B до 70B, включая MoE и vision-language модели. Веса хранят на сетевых дисках (HDD до 1000 IOPS, SSD до 10 000 и 50 000), на локальном NVMe (до 256 000 IOPS) или в S3-совместимом хранилище; загружают их из Hugging Face, GitLab, GitHub или приватного registry.

Где арендовать GPU для инференса моделей: 6 сервисов_46
Готовый образ Ubuntu 24.04 с CUDA в каталоге образов К2 Облака

Инфраструктура и экосистема

Мощности размещены в России: три территориально распределённых дата-центра уровня Tier III в Москве и один в Санкт-Петербурге. Скорость между дата-центрами — более 20 Гбит/с, интернет-канал — от 2 Гбит/с. Сеть закрывается в приватный контур: VPC, списки доступа на уровне подсетей, группы безопасности на интерфейсах ВМ, VPN as a Service, Direct Connect и выделенный L2-канал. Платформа даёт AWS-like API, поддерживаются Terraform, Ansible, CLI, SDK, Helm, Prometheus и Grafana; в кабинете и через API видны загрузка GPU и VRAM, CPU, RAM, диск, сеть, логи и алерты. Масштабирование — ручное изменение конфигурации, автоскейлинг, балансировщик и очереди. SLA на доступность виртуальных машин и выделенных серверов с GPU — 99,95%.

Отзывы и репутация

Агрегированные пользовательские оценки провайдер не публикует. Из подтверждённой фактуры — аттестаты соответствия: приказ ФСТЭК №21 с защитой персональных данных по 152-ФЗ до УЗ-1, PCI DSS 4.0, ГОСТ Р 57580.1-2017 с итоговой оценкой R=0,95, ГОСТ Р ИСО/МЭК 27001-2021, 27017-2021 и ГОСТ Р ИСО 9001-2015; в рейтинге российских поставщиков GPU услуг от Компьютерры сервис занял 7-е место. По условиям платформы запросы пользователей, ответы модели, веса и файлы не сохраняются.

Поддержка и каналы связи

Каналы связи: чат, Telegram-бот, электронная почта, телефон, тикет-система и выделенный менеджер. Заявленное время реакции по SLA — 10 минут. Поддержка разбирает инциденты, подбирает GPU под модель, помогает с окружением, переносом модели, сетью и документами. Документация ведётся на русском и английском языках: разделы по инстансам и GPU, API, безопасности и оплате собраны в docs.k2.cloud.

Тарифы, ограничения и условия

Виртуальные машины с GPU тарифицируются почасово по модели pay-as-you-go, минимальный срок аренды — один час; выделенный сервер оплачивается помесячно. При коммите на 3, 6 или 12 месяцев с ежемесячной оплатой действует скидка, в Model as a Service оплата идёт за токены. Стоимость конфигурации считается в калькуляторе на сайте; новым клиентам доступен бесплатный тестовый период на одну неделю.

Ограничения: публичного прайс-листа на GPU нет — цены выдаются по калькулятору или коммерческому предложению. Старшие карты H200 и Blackwell в линейке отсутствуют, потолок — H100; на одну машину подключается до четырёх GPU, против восьми у части провайдеров подборки. Виртуальная машина с GPU разворачивается от 10 минут, выделенный сервер — от трёх рабочих дней. Публичных или внутренних замеров производительности инференса провайдер не приводит.

Где арендовать GPU для инференса моделей: 6 сервисов_56
Калькулятор стоимости GPU-конфигурации K2 Cloud

Для компаний и организаций

Провайдер работает с юридическими лицами по договору, выставляет счёт в рублях с НДС, выдаёт закрывающие документы, поддерживает ЭДО и полную постоплату. Юридические документы и SLA опубликованы на сайте.

Официальный сайт: k2.cloud

3. Yandex Cloud — полный ML-стек

Облачная платформа Яндекса закрывает весь цикл работы с моделями: от Jupyter-ноутбуков в DataSphere до serverless-инференса с оплатой за токены в AI Studio. Подойдёт командам, которым нужен не просто сервер с видеокартой, а готовый ML-конвейер с документацией и туториалами на русском.

Кейсы клиентов и кому подойдёт

Типовые сценарии по официальной документации:

  • Инференс open-source моделей через AI Studio: YandexGPT и Model Gallery (gpt-oss, Qwen3, Llama, DeepSeek, Gemma) вызываются по API с оплатой за токены — без аренды серверов.
  • Продакшен-инференс собственных моделей на DataSphere Nodes — нодах эксплуатации с посекундной оплатой времени работы.
  • Запуск vLLM с Gemma на GPU-ВМ и сборка GPU-кластера под DeepSeek — в документации есть пошаговые туториалы.
  • Распределённое обучение на GPU-кластерах с сетью InfiniBand.
Где арендовать GPU для инференса моделей: 6 сервисов_65
Каталог моделей Yandex AI Studio с оплатой за токены

Что можно развернуть

Виртуальные машины Compute Cloud комплектуются от одной до восьми GPU: Tesla V100 (32 ГБ), T4 (16 ГБ) и T4i (24 ГБ), A100 (80 ГБ); платформы нового поколения предлагают по 80 и 141 ГБ видеопамяти на карту. В Marketplace доступны образы Ubuntu с предустановленными драйверами NVIDIA и CUDA. Managed Kubernetes поддерживает группы узлов с GPU из образа с готовыми драйверами. Поверх инфраструктуры работают DataSphere (ноутбуки, пакетные Jobs, ноды инференса) и AI Studio с файн-тюнингом моделей.

Где арендовать GPU для инференса моделей: 6 сервисов_68
Где арендовать GPU для инференса моделей: 6 сервисов_69
Конфигурации ВМ с GPU в Yandex Compute Cloud

Инфраструктура и экосистема

Инфраструктура размещена в России: пять зон доступности региона ru-central1 в собственных дата-центрах Яндекса, плюс регион в Казахстане. GPU-платформы поколений v1–v3 доступны в зонах ru-central1-a и ru-central1-b. Заявлена защита инфраструктуры в соответствии со 152-ФЗ, по сервисам действуют соглашения об уровне обслуживания.

Отзывы и репутация

Облачная платформа экосистемы Яндекса с публичной документацией, готовыми сценариями запуска LLM и программами для стартапов. Агрегированные оценки пользователей в официальных источниках не публикуются.

Поддержка и каналы связи

Три тарифа поддержки: Базовый (бесплатный), Бизнес и Премиум. Каналы — тикеты в центре поддержки, чат в консоли и чат в Telegram. Заявленное время ответа в чате — от 15 минут на Базовом тарифе до пяти минут на Бизнесе и Премиуме; критичные инциденты разбирают за 15–30 минут. Документация полностью на русском языке.

Тарифы, ограничения и условия

Compute Cloud тарифицируется посекундно; по прайс-листу Yandex Cloud GPU-час на A100 стоит 481,73 ₽ с НДС, конфигурация DataSphere с одной A100 — 542,88 ₽ в час. В AI Studio оплата идёт за 1000 токенов: YandexGPT Lite — 0,20 ₽ в синхронном режиме, gpt-oss-120b — 0,30 ₽, Llama-3.3-70B — 0,60 ₽. Для постоянных нагрузок есть резервы со скидкой за коммит на один и три года.

Где арендовать GPU для инференса моделей: 6 сервисов_78
Калькулятор цен Yandex Cloud с конфигурацией на A100

Ограничения: по умолчанию квота на GPU у новых аккаунтов нулевая и увеличивается по запросу из консоли; доступ к платформам нового поколения тоже выдаётся по запросу. GPU на ВМ работает в режиме TCC.

Официальный сайт: yandex.cloud

4. VK Cloud — дробная аренда GPU

Облако экосистемы VK с сервисом Cloud GPU: помимо целых карт здесь арендуют долю видеокарты — vGPU от 1/24 ускорителя L4. Это редкий для российского рынка формат, который удешевляет мелкий инференс и эмбеддинги.

Где арендовать GPU для инференса моделей: 6 сервисов_83
Как устроен vGPU в VK Cloud: физическая карта делится между виртуальными машинами через vGPU Manager. Источник: Блог VK Tech

Кейсы клиентов и кому подойдёт

  • Мелкий инференс на vGPU: компактные модели на 1–7B параметров, эмбеддинги, computer vision — провайдер заявляет экономию до 60% по сравнению с арендой целой карты.
  • Продакшен-serving моделей через MLflow Deploy: модель упаковывается в Docker-контейнер и разворачивается с REST API для запросов в реальном времени.
  • MLOps-контур на Cloud ML Platform: JupyterHub и MLflow преднастроены, GPU-шаблоны доступны сразу после создания проекта.
  • Графические рабочие места: пулы виртуальных десктопов на GPU-шаблонах.

Что можно развернуть

Виртуальные машины собираются из фиксированных шаблонов: Tesla V100 и V100S, A100 на 40 и 80 ГБ (в том числе SXM4), L4, L40S, A30 и H200 со 141 ГБ — в конфигурациях с одной или восемью картами; связка 8×H200 идёт с 240 vCPU и 2 ТБ оперативной памяти. Отдельно доступны vGPU-профили на базе L4 — от 1 ГБ видеопамяти до целой карты, лицензирование NVIDIA vGPU в образах VK Cloud уже настроено. Managed Kubernetes поддерживает узлы с GPU.

Где арендовать GPU для инференса моделей: 6 сервисов_88
Проброс GPU в виртуальную машину через passthrough — до восьми карт в одном флейворе. Источник: блог VK Tech

Инфраструктура и экосистема

Четыре дата-центра уровня Tier III в Москве (Гознак, DataLine NORD4, Медведково, Пахра) и два в Казахстане. Информационная система аттестована по требованиям приказа ФСТЭК №21, на странице сервиса заявлен высший уровень защищённости УЗ-1, отдельно существует продукт «Облако 152-ФЗ». SLA на доступность виртуальных машин — 99,95%.

Отзывы и репутация

Платформа входит в экосистему VK и позиционируется как корпоративное облако с акцентом на соответствие требованиям регуляторов. Агрегированные оценки и публичные рейтинги в официальных источниках не приводятся.

Поддержка и каналы связи

Работают портал поддержки с тикетами и персональный менеджер при подключении Cloud GPU; с развёртыванием ML-инфраструктуры помогают эксперты VK. Документация ведётся на русском языке.

Тарифы, ограничения и условия

Модель pay-as-you-go с поминутной тарификацией и минимальным сроком аренды ВМ в один час; доступны почасовой, помесячный и годовой планы. Входящий и исходящий трафик, а также мониторинг не тарифицируются. Публичного прайса на GPU-шаблоны нет: цены отображаются в настройках проекта по прайс-листу или условиям договора, для оценки предлагается калькулятор на сайте. Для новых клиентов заявлен тестовый период.

Ограничения: квоты на GPU-шаблоны выдаются по запросу в техподдержку; vGPU доступна только на базе L4 и не более одной на машину. Serverless-инференса с оплатой за токены в линейке нет — serving поднимается на собственных ВМ, в Kubernetes или через MLflow Deploy.

Официальный сайт: cloud.vk.com

5. Cloud.ru — максимальный комплаенс

Облачная платформа экосистемы Сбера (бывший SberCloud) с линейкой Evolution: виртуальные машины с GPU, выделенные серверы HGX, ML-сервисы и serverless-инференс с оплатой за токены. Главное отличие — регуляторный комплект: от 152-ФЗ по высшему уровню защищённости до аттестатов для объектов критической инфраструктуры.

Кейсы клиентов и кому подойдёт

  • Serverless-инференс через Evolution Foundation Models: более 20 моделей (GigaChat, Qwen3, DeepSeek, GLM-4.6, gpt-oss-120b, T-lite и T-pro) по OpenAI-compatible API, развёрнутых на серверах в России. Есть Guardrails для маскирования чувствительных данных.
  • Деплой собственных моделей через Evolution ML Inference — с автоматически генерируемой OpenAPI-спецификацией и Swagger UI для тестирования.
  • RAG-сервисы и AI-агенты как управляемые сервисы, файн-тюнинг на GPU.
  • Тяжёлые задачи на выделенных серверах HGX с восемью H100.
Где арендовать GPU для инференса моделей: 6 сервисов_103
Каталог Evolution Foundation Models с оплатой за токены

Что можно развернуть

Виртуальные машины Evolution Compute комплектуются картами V100 (32 ГБ), A100 (40 и 80 ГБ) и H100 (80 ГБ): до восьми H100 или A100 и до шестнадцати V100 на одну машину. Старшая конфигурация — 8×H100 с NVLink, 160 vCPU и 1488 ГБ RAM; для изоляции доступен bare metal HGX 8×H100. Managed Kubernetes поддерживает узлы с GPU. ML-контур собирается из Evolution Notebooks, ML Inference, ML Finetuning, Managed RAG и AI Agents, для multi-node обучения используется InfiniBand.

Инфраструктура и экосистема

Инфраструктура размещена только в России: девять дата-центров уровня Tier III, три зоны доступности в Москве, заявленная доступность платформы — до 99,982%. Комплект соответствий: 152-ФЗ по уровню УЗ-1, 187-ФЗ для объектов КИИ (аттестаты ФСТЭК), ГОСТ Р 57580 для финансового сектора, PCI DSS, ISO/IEC 27001 и 27701, лицензии ФСТЭК и ФСБ. Платформа Evolution включена в реестр российского ПО.

Отзывы и репутация

Провайдер — российское юридическое лицо ООО «Облачные технологии» из экосистемы Сбера; работает с компаниями, ИП и физлицами, для бизнеса доступны договор, ЭДО и постоплата. Публичные агрегированные оценки сервис не приводит.

Поддержка и каналы связи

Бесплатная круглосуточная поддержка: тикеты в консоли, почта support@cloud.ru и телефон 8-800-444-24-99; для бизнеса — персональный менеджер, для эскалации отдельный канал. Документация ведётся на русском и английском языках.

Тарифы, ограничения и условия

Посекундная тарификация pay-as-you-go. По тарифному приложению Evolution Compute GPU (редакция от 20.05.2026, цены без НДС): V100 — от 200 ₽ в час, A100 PCI — 260 ₽ в час, H100 PCI — 450 ₽ в час, H100 с NVLink — 700 ₽ в час; выделенный HGX 8×H100 — от 5 355 000 ₽ в месяц. В Foundation Models оплата идёт за миллион токенов: например, gpt-oss-120b — 13 ₽ за входные и 50 ₽ за выходные токены, GigaChat3-10B — по 10 ₽.

Где арендовать GPU для инференса моделей: 6 сервисов_114

Ограничения: для создания ВМ с GPU нужно пополнить баланс минимум на 15 000 ₽, бонусными средствами GPU не оплачиваются; машина создаётся при наличии свободной карты нужной модели. Зарубежных дата-центров нет.

Официальный сайт: cloud.ru

6. Nebius — зарубежные локации

Международное GPU-облако, выросшее из инфраструктурной команды Яндекса: нидерландская Nebius Group (листинг на Nasdaq, тикер NBIS) с собственным дата-центром в Финляндии и флагманскими картами вплоть до Blackwell Ultra. Важная оговорка: по условиям договора сервис не работает с компаниями и бенефициарами из России и Беларуси, поэтому в подборке это вариант для зарубежных команд.

Кейсы клиентов и кому подойдёт

  • Managed-инференс через Nebius Token Factory: более 60 open-source моделей (DeepSeek, Qwen, Llama, GLM, Kimi, gpt-oss, Mistral) по OpenAI-compatible API — публичные эндпоинты с оплатой за токены или выделенные с оплатой за GPU-час.
  • Файн-тюнинг (LoRA и полный) и пакетный инференс со скидкой 50% к базовой цене.
  • Развёртывание микросервисов NVIDIA NIM и Blueprints в один клик.
  • Обучение на GPU-кластерах с InfiniBand до 3,2 Тбит/с на хост — на Kubernetes или Slurm.
Где арендовать GPU для инференса моделей: 6 сервисов_121
Каталог моделей Nebius Token Factory

Что можно развернуть

Линейка GPU: L40S (48 ГБ), RTX PRO 6000 Server Edition (96 ГБ), H100 (80 ГБ), H200 (141 ГБ), B200 (180 ГБ) и B300 (270 ГБ). На одну машину ставится одна или восемь карт, через консоль доступно до 32 GPU; кластеры собираются из восьмикарточных конфигураций. Поверх работают Managed Kubernetes с бесплатным control plane, Slurm-оператор Soperator и Serverless AI для контейнерных ворклоадов с посекундной тарификацией.

Инфраструктура и экосистема

Публичные регионы: Финляндия (собственный ЦОД), Франция, Израиль, США и Великобритания, плюс приватные площадки в Исландии и Франции. Сертификация — SOC 2 Type II, ISO/IEC 27001 и 27799, NIS 2; для инференса заявлен режим zero-retention, при котором запросы и ответы моделей не сохраняются. SLA на выделенные эндпоинты Token Factory — 99,9%.

Отзывы и репутация

Компания торгуется на Nasdaq под тикером NBIS и отчитывается как независимый AI-инфраструктурный провайдер; в июне 2026 года завершила поглощение Eigen AI для оптимизации инференса. Агрегированные пользовательские оценки в официальных источниках не публикуются.

Поддержка и каналы связи

Круглосуточная поддержка через тикеты с приоритетами; для multi-node конфигураций бесплатно помогают solution architects. На корпоративном тарифе Token Factory доступны выделенный Slack-канал и кредиты на пилоты. Документация ведётся на английском языке.

Тарифы, ограничения и условия

Pay-as-you-go с биллингом за GPU-секунду, цены в долларах: H100 — 3,85 $ за GPU-час (прерываемые ВМ — 2,15 $), H200 — 4,50 $ (2,45 $), B200 — 7,15 $ (3,95 $), L40S — от 1,55 $. За долгосрочный коммит действуют скидки до 35%, исходящий трафик бесплатный. В Token Factory оплата идёт за миллион токенов: Llama-3.3-70B — 0,13 $ за вход и 0,40 $ за выход в базовом режиме, DeepSeek-V3 — 0,50 $ и 1,50 $ соответственно; на старте начисляют 1 $ кредитов.

Где арендовать GPU для инференса моделей: 6 сервисов_132
Цены на GPU в Nebius AI Cloud, июль 2026

Ограничения: пункт 20.10 договора запрещает использование сервиса клиентами, зарегистрированными в России или Беларуси, и их бенефициарными владельцами. Для новых тенантов квота на B200 и H200 в американском регионе по умолчанию нулевая и повышается по запросу; прерываемые ВМ могут быть вытеснены при нехватке мощностей.

Официальный сайт: nebius.com

Сравнение по ключевым критериям

Где арендовать GPU для инференса моделей: 6 сервисов_136
Сравнительная таблица 
  • Формат аренды: виртуальные машины с GPU есть у всех шести провайдеров. Выделенные серверы доступны у immers.cloud, К2 Облака и Cloud.ru; дробная аренда vGPU — у VK Cloud; прерываемые ВМ со скидкой — у Nebius. В К2 Облаке также есть Managed Kubernetes с GPU и разделением карты на изолированные инстансы через MIG.
  • Инференс с оплатой за токены предлагают Yandex Cloud в AI Studio, К2 Облако в формате Model as a Service, Cloud.ru через Evolution Foundation Models и Nebius в Token Factory. В immers.cloud приватные модели работают на арендованном сервере без оплаты за токены, а отдельные open-source-модели можно бесплатно протестировать через публичные эндпоинты. В VK Cloud модель также разворачивается на арендованных мощностях.
  • Флагманские GPU: H200 есть у immers.cloud, VK Cloud и Nebius, а B200 и B300 — только у Nebius. В К2 Облаке и Cloud.ru старшая доступная карта — H100. У Yandex Cloud доступны A100 и платформа со 141 ГБ видеопамяти.
  • Размещение: инфраструктура immers.cloud, Yandex Cloud, К2 Облака, VK Cloud и Cloud.ru находится в России. Nebius работает только в зарубежных регионах: ЕС, США, Израиле и Великобритании.
  • Документы для российских юрлиц: immers.cloud, Yandex Cloud, К2 Облако, VK Cloud и Cloud.ru работают по договору, выставляют счета в рублях и предоставляют закрывающие документы. Nebius по условиям соглашения не работает с российскими компаниями.
  • Минимальный чек: в immers.cloud баланс можно пополнить от 100 ₽, а использование GPU оплачивается посекундно. В К2 Облаке минимальный срок аренды виртуальной машины составляет один час, новым клиентам доступен тестовый период на одну неделю; публичного прайс-листа на GPU нет. В Cloud.ru для создания GPU-ВМ требуется от 15 000 ₽, в Yandex Cloud сначала нужно увеличить нулевую квоту, в VK Cloud стоимость определяется по прайс-листу проекта. Nebius предоставляет стартовые кредиты от 1 $, но сервис доступен только зарубежным командам.

Как выбрать сервис под свою задачу

Для быстрого старта без заявок подходят платформы с self-service онбордингом: в immers.cloud каталог инстансов открывается сразу после пополнения баланса, а модели можно тестировать через публичные эндпоинты ещё до аренды сервера. Если инференс — это вызовы API без собственного железа, логичнее serverless-формат: AI Studio у Yandex Cloud, Evolution Foundation Models у Cloud.ru или Token Factory у Nebius, где платят за токены, а не за часы простоя.

Для регулируемых отраслей и работы с персональными данными решающим становится комплект документов: максимальный набор аттестатов — у Cloud.ru, высший уровень защищённости ПДн заявлен и у VK Cloud. Зарубежным командам, которым нужны новейшие GPU и кластеры с InfiniBand, подойдёт Nebius — с оговоркой про ограничения договора.

Перед арендой посчитайте полную стоимость владения: цену GPU-часа, хранение весов и датасетов, трафик и время инженеров на поднятие окружения. У большинства провайдеров из подборки есть тестовые балансы или гранты — пилот на реальной модели покажет итоговую экономику точнее любого калькулятора.

Рекомендуем