Где арендовать GPU для инференса моделей: 6 сервисов
Разбираем, где арендовать GPU под инференс: конфигурации от T4 до B300, посекундная тарификация и оплата за токены, размещение в РФ и за рубежом, цены и ограничения.
, отредактировано
Аренда GPU для инференса — это компромисс между ценой часа, доступностью нужных карт и объёмом рутины, которую команда готова взять на себя. Мы собрали пять сервисов, где можно поднять инференс LLM: от self-service облаков с посекундной оплатой до managed-платформ с тарификацией за токены. Для каждого разобрали доступные видеокарты, способы запуска, цены, документы для юрлиц и ограничения.
В подборке
immers.cloud — ВМ и выделенные серверы с 13 моделями NVIDIA вплоть до H200, каталог Foundation Models с бесплатными публичными эндпоинтами и приватными инстансами, посекундная тарификация и пополнение от 100 ₽; собственный ЦОД в Москве.
К2 Облако — ВМ и выделенные серверы с картами NVIDIA вплоть до H100, Managed Kubernetes с GPU и Model as a Service с оплатой за токены; конфигурации под задачу и инфраструктура в российских ЦОД.
Yandex Cloud — GPU-ВМ, ML-платформа DataSphere и serverless-инференс AI Studio с оплатой за токены; инфраструктура в России.
VK Cloud — Cloud GPU с картами вплоть до H200 и дробная аренда vGPU от 1/24 видеокарты L4; четыре ЦОД Tier III в Москве.
Cloud.ru — платформа Evolution с ВМ до 8×H100, serverless Foundation Models и максимальным комплектом аттестатов: 152-ФЗ по уровню УЗ-1, объекты КИИ, реестр российского ПО.
Nebius — зарубежное GPU-облако с картами вплоть до B300 и managed-инференсом Token Factory; с российскими юрлицами по условиям договора не работает.
Как мы выбирали сервисы
В подборку вошли платформы, которые прямо сейчас позволяют арендовать GPU под инференс: поднять виртуальную машину или выделенный сервер с видеокартой либо вызывать модели через управляемый API. Мы опирались только на официальные источники — продуктовые страницы, документацию и тарифные приложения — и сверяли пять критериев:
- доступные модели GPU и способ их получения: из кабинета сразу или по запросу;
- форматы запуска инференса: IaaS, managed-деплой моделей, serverless с оплатой за токены;
- тарификация и минимальный чек: цена GPU-часа, хранение весов и данных, трафик;
- размещение инфраструктуры и документы для российских юрлиц: договор, ЭДО, соответствие 152-ФЗ;
- поддержка, SLA и ограничения, о которых лучше знать до старта.
1. immers.cloud — низкий порог входа
Облачная IaaS-платформа с собственным дата-центром в Москве: здесь арендуют виртуальные машины и выделенные серверы с GPU, а также запускают модели из каталога Immers Foundation Models. Отличается низким порогом входа — регистрация и пополнение баланса от 100 ₽ открывают доступ ко всему каталогу инстансов, без заявок и предзаказов.
Кейсы клиентов и кому подойдёт
Провайдер приводит два показательных сценария использования:
- Команда «КС Авто» развернула автономную систему круглосуточной модерации контента: мультимодальные модели работают через Ollama на трёх облачных RTX 4090 с NVMe, потоки изолированы по видеокартам. Система фильтрует сотни спам-атак ежедневно и полностью заменила штат из 15 модераторов.
- В IBS собрали единую R&D-песочницу для AI-экспериментов: смешанная нагрузка (LLM, NLP, VLM) управляется через GPUStack и vLLM на пуле из A100, RTX 3090 и RTX 4090. Одиннадцать инстансов обслуживают 14 моделей, и новые гипотезы проверяют за часы, без выделения отдельных серверов.
Формат подходит стартапам с AI-продуктом, ML-инженерам, командам, которые собирают RAG-сервисы и чат-ботов, и продакшен-командам с постоянной нагрузкой. Развёртывание моделей от 70B, высокую параллельность запросов, обработку персональных данных и миграцию из другого облака провайдер рекомендует обсудить до старта.
Что можно развернуть
Пул включает 13 моделей видеокарт NVIDIA: H200 (141 ГБ), H100 NVL (94 ГБ) и H100 (80 ГБ), A100 (80 ГБ), V100 (32 ГБ), RTX 5090 (32 ГБ), RTX 4090 и RTX 3090 (24 ГБ), RTX 3080 (10 ГБ), RTX A5000 и A10 (24 ГБ), RTX 2080 Ti (11 ГБ), A2 и T4 (16 ГБ). Есть конфигурации с NVLink. На одну виртуальную машину подключается до восьми GPU, на выделенный сервер — до десяти.
Инференс запускается двумя путями. Первый — классический IaaS: маркетплейс готовых образов с предустановленными CUDA, vLLM и Jupyter сокращает развёртывание окружения до нескольких минут; совместимость подтверждена для vLLM, Ollama, Hugging Face и OpenAI-compatible API.
Второй — каталог Immers Foundation Models: более 200 моделей (Qwen, Gemma, GLM, Whisper и другие) с 1800 рекомендуемыми конфигурациями.
Для каждой указаны размер контекста, архитектура и оценочное потребление VRAM.
В каталоге есть публичные эндпоинты для бесплатного тестирования open-source-моделей, среди которых Unlimited-OCR, Gemma 4 26B A4B IT и Qwen3.5 35B A3B. Запросы можно отправлять через чат в личном кабинете или напрямую через API. Это позволяет проверить качество ответов и вызов инструментов, а также собрать прототип перед запуском приватного инстанса.
Бесплатный доступ действует только для публичных эндпоинтов и предоставляется на ограниченный период. Приватные инстансы оплачиваются за фактическое время работы сервера по стандартному тарифу, без дополнительных списаний за токены. Об изменении условий тестирования провайдер обещает сообщать заранее.
Инфраструктура и экосистема
Платформа построена на OpenStack (релиз Zed) без модификаций API, поэтому работают openstack-cli, OpenStack SDK и Terraform-провайдер. Серверы размещены в собственном ЦОД уровня Tier III в Москве и охлаждаются иммерсионно — погружением в диэлектрическую жидкость, что исключает троттлинг при круглосуточной загрузке GPU. Сетевые параметры: интернет-канал до 20 Гбит/с, частная сеть до 20 Гбит/с, балансировщик и SSL из коробки; эндпоинты можно поднимать в приватных сетях или на публичном IP, с группами безопасности для трафика. SLA — 100% на vCPU, RAM и GPU. Масштабирование ручное: конфигурацию меняют через resize, эндпоинт пересоздают с нужным числом воркеров.
Отзывы и репутация
Агрегированные оценки и публичные рейтинги сервис не раскрывает. Из подтверждённой фактуры — описанные выше клиентские кейсы и сертификат ГОСТ Р ИСО/МЭК 27001-2021 по системе менеджмента информационной безопасности.
Поддержка и каналы связи
Техподдержка работает круглосуточно: чат на сайте, Telegram и Max, электронная почта; для клиентов доступен менеджер. Заявленное время реакции — до пяти минут. Поддержка помогает подобрать GPU под конкретную модель и нагрузку, настроить окружение, перенести модель, разобраться с сетью и документами. Гайды по работе с облаком собраны в FAQ на русском языке.
Тарифы, ограничения и условия
Тарификация посекундная: стоимость рассчитывается каждый час за фактически отработанные секунды, пополнение баланса — от 100 ₽. Простаивающую машину можно заморозить функцией Shelve: списания за железо останавливаются, оплачиваются только хранение тома и закреплённый IP-адрес. Действуют тарифы по предоплате на 30, 60, 180 и 360 дней и коммит по договору долгосрочной аренды; тестовый баланс и гранты выдают индивидуально по запросу.
Что именно можно арендовать
- Оценка месяца инференса: модель 7B — около 49 215 ₽, 14B — около 92 755 ₽, тяжёлая LLM уровня 72B — около 286 104 ₽.
- Рекомендуемые конфигурации из каталога: gemma-4-12B-it — от 46,94 ₽/час, GLM-5.2 на восьми A100 с NVLink — 1677,58 ₽/час.
- Хранение: SSD — 9 ₽ за ГБ в месяц, HDD — 2 ₽ за ГБ в месяц. Трафик не тарифицируется.
Ограничения: нет managed Kubernetes и сертифицированного контура, для Foundation Models нет тарификации pay-per-token — модель работает на арендованном сервере, но есть бесплатные публичные модели для теста. Базовые квоты аккаунта — четыре инстанса, 16 vCPU и 128 ГБ RAM, повышаются по запросу.
Для компаний и организаций
Юридическим лицам доступны счета на оплату банковским переводом, ЭДО через Контур Диадок, работа по публичной оферте или рамочному договору, предоплата и постоплата.
Официальный сайт: immers.cloud
2. К2 Облако — конфигурации под задачу
Облачная платформа российского провайдера K2 Cloud: виртуальные машины и выделенные серверы с картами NVIDIA, Managed Kubernetes с GPU и ML-платформа K2 NeuroTech поверх. Отличается тем, что конфигурация собирается под задачу: соотношение vCPU и RAM выбирается из трёх схем, а под нетиповую нагрузку выделяют сервер с RAM до 4 ТБ. Отдельным сервисом идёт ИИ-консалтинг — от аудита до вывода модели в промышленную эксплуатацию.
Кейсы клиентов и кому подойдёт
Провайдер приводит два сценария с подтверждёнными результатами:
- Сервис заказа поездок Drivee вынес ML-сервисы на GPU NVIDIA T4 в публичном облаке: фотоконтроль водителя и автомобиля перед выходом на линию и модерация пользовательского контента. По описанию кейса ИИ закрывает 75% задач фотоконтроля без оператора, обрабатывает до 10 000 кейсов в сутки и проверяет водителя за 2–3 секунды вместо нескольких минут; модерация разбирает 20–30 тысяч комментариев в день. Данные обрабатываются по 152-ФЗ до УЗ-1 и PCI DSS 4.0.
- Инвестиционная компания подняла ИИ-платформу для разработчиков на GPUaaS с NVIDIA H100. В инференсе — несколько моделей Qwen3: Coder 30B для написания и анализа кода, Embedder и Reranker на 4B и 0,6B. Балансировка запросов идёт через Nginx и LiteLLM, загрузка GPU снимается в Zabbix; исходный код и бизнес-логика остаются внутри контролируемого контура.
- Мультиагентная система круглосуточного реагирования на инциденты работает на двух NVIDIA L40S.
К2 Облако подходит компаниям среднего и корпоративного сегмента, ИТ-компаниям, стартапам с AI-продуктами и продакшен-командам с постоянной нагрузкой. Подключение рекомендуется обсуждать с менеджером до старта: конфигурацию подбирают под задачу, а выделенный сервер готовят от трёх рабочих дней.
Что можно развернуть
Доступны пять моделей видеокарт NVIDIA: H100 (80 ГБ), A100 (80 ГБ), L40S (48 ГБ), L4 (24 ГБ) и T4 (16 ГБ) — все выдаются из личного кабинета без предзаказа. В одну виртуальную машину или выделенный сервер подключается до четырёх карт, объединение — через NVLink. Типовые конфигурации: одна H100 — 12 vCPU и 96 ГБ RAM, две H100 — 24 vCPU и 192 ГБ. Соотношение vCPU к RAM меняется по схемам 1:2, 1:4 и 1:8, диск — от 32 ГБ до 4 ТБ на том, до 16 томов на машину.
Форматы аренды: виртуальные машины с GPU, выделенные серверы, Managed Kubernetes с GPU (карта делится на изолированные инстансы через MIG) и Model as a Service с оплатой за токены. Инференс запускают через готовый образ, Docker, Kubernetes, SSH, API или Terraform; в образах предустановлены драйверы NVIDIA, CUDA, PyTorch, TensorFlow, Jupyter, vLLM, Ollama, Triton Inference Server и SGLang, отдельно заявлена совместимость с TGI, Ray, LangChain, LlamaIndex, Hugging Face и OpenAI-compatible API. На инфраструктуре запускают Llama, Qwen, Mistral, Gemma, DeepSeek, Stable Diffusion и Whisper — от 7B до 70B, включая MoE и vision-language модели. Веса хранят на сетевых дисках (HDD до 1000 IOPS, SSD до 10 000 и 50 000), на локальном NVMe (до 256 000 IOPS) или в S3-совместимом хранилище; загружают их из Hugging Face, GitLab, GitHub или приватного registry.
Инфраструктура и экосистема
Мощности размещены в России: три территориально распределённых дата-центра уровня Tier III в Москве и один в Санкт-Петербурге. Скорость между дата-центрами — более 20 Гбит/с, интернет-канал — от 2 Гбит/с. Сеть закрывается в приватный контур: VPC, списки доступа на уровне подсетей, группы безопасности на интерфейсах ВМ, VPN as a Service, Direct Connect и выделенный L2-канал. Платформа даёт AWS-like API, поддерживаются Terraform, Ansible, CLI, SDK, Helm, Prometheus и Grafana; в кабинете и через API видны загрузка GPU и VRAM, CPU, RAM, диск, сеть, логи и алерты. Масштабирование — ручное изменение конфигурации, автоскейлинг, балансировщик и очереди. SLA на доступность виртуальных машин и выделенных серверов с GPU — 99,95%.
Отзывы и репутация
Агрегированные пользовательские оценки провайдер не публикует. Из подтверждённой фактуры — аттестаты соответствия: приказ ФСТЭК №21 с защитой персональных данных по 152-ФЗ до УЗ-1, PCI DSS 4.0, ГОСТ Р 57580.1-2017 с итоговой оценкой R=0,95, ГОСТ Р ИСО/МЭК 27001-2021, 27017-2021 и ГОСТ Р ИСО 9001-2015; в рейтинге российских поставщиков GPU услуг от Компьютерры сервис занял 7-е место. По условиям платформы запросы пользователей, ответы модели, веса и файлы не сохраняются.
Поддержка и каналы связи
Каналы связи: чат, Telegram-бот, электронная почта, телефон, тикет-система и выделенный менеджер. Заявленное время реакции по SLA — 10 минут. Поддержка разбирает инциденты, подбирает GPU под модель, помогает с окружением, переносом модели, сетью и документами. Документация ведётся на русском и английском языках: разделы по инстансам и GPU, API, безопасности и оплате собраны в docs.k2.cloud.
Тарифы, ограничения и условия
Виртуальные машины с GPU тарифицируются почасово по модели pay-as-you-go, минимальный срок аренды — один час; выделенный сервер оплачивается помесячно. При коммите на 3, 6 или 12 месяцев с ежемесячной оплатой действует скидка, в Model as a Service оплата идёт за токены. Стоимость конфигурации считается в калькуляторе на сайте; новым клиентам доступен бесплатный тестовый период на одну неделю.
Ограничения: публичного прайс-листа на GPU нет — цены выдаются по калькулятору или коммерческому предложению. Старшие карты H200 и Blackwell в линейке отсутствуют, потолок — H100; на одну машину подключается до четырёх GPU, против восьми у части провайдеров подборки. Виртуальная машина с GPU разворачивается от 10 минут, выделенный сервер — от трёх рабочих дней. Публичных или внутренних замеров производительности инференса провайдер не приводит.
Для компаний и организаций
Провайдер работает с юридическими лицами по договору, выставляет счёт в рублях с НДС, выдаёт закрывающие документы, поддерживает ЭДО и полную постоплату. Юридические документы и SLA опубликованы на сайте.
Официальный сайт: k2.cloud
3. Yandex Cloud — полный ML-стек
Облачная платформа Яндекса закрывает весь цикл работы с моделями: от Jupyter-ноутбуков в DataSphere до serverless-инференса с оплатой за токены в AI Studio. Подойдёт командам, которым нужен не просто сервер с видеокартой, а готовый ML-конвейер с документацией и туториалами на русском.
Кейсы клиентов и кому подойдёт
Типовые сценарии по официальной документации:
- Инференс open-source моделей через AI Studio: YandexGPT и Model Gallery (gpt-oss, Qwen3, Llama, DeepSeek, Gemma) вызываются по API с оплатой за токены — без аренды серверов.
- Продакшен-инференс собственных моделей на DataSphere Nodes — нодах эксплуатации с посекундной оплатой времени работы.
- Запуск vLLM с Gemma на GPU-ВМ и сборка GPU-кластера под DeepSeek — в документации есть пошаговые туториалы.
- Распределённое обучение на GPU-кластерах с сетью InfiniBand.
Что можно развернуть
Виртуальные машины Compute Cloud комплектуются от одной до восьми GPU: Tesla V100 (32 ГБ), T4 (16 ГБ) и T4i (24 ГБ), A100 (80 ГБ); платформы нового поколения предлагают по 80 и 141 ГБ видеопамяти на карту. В Marketplace доступны образы Ubuntu с предустановленными драйверами NVIDIA и CUDA. Managed Kubernetes поддерживает группы узлов с GPU из образа с готовыми драйверами. Поверх инфраструктуры работают DataSphere (ноутбуки, пакетные Jobs, ноды инференса) и AI Studio с файн-тюнингом моделей.
Инфраструктура и экосистема
Инфраструктура размещена в России: пять зон доступности региона ru-central1 в собственных дата-центрах Яндекса, плюс регион в Казахстане. GPU-платформы поколений v1–v3 доступны в зонах ru-central1-a и ru-central1-b. Заявлена защита инфраструктуры в соответствии со 152-ФЗ, по сервисам действуют соглашения об уровне обслуживания.
Отзывы и репутация
Облачная платформа экосистемы Яндекса с публичной документацией, готовыми сценариями запуска LLM и программами для стартапов. Агрегированные оценки пользователей в официальных источниках не публикуются.
Поддержка и каналы связи
Три тарифа поддержки: Базовый (бесплатный), Бизнес и Премиум. Каналы — тикеты в центре поддержки, чат в консоли и чат в Telegram. Заявленное время ответа в чате — от 15 минут на Базовом тарифе до пяти минут на Бизнесе и Премиуме; критичные инциденты разбирают за 15–30 минут. Документация полностью на русском языке.
Тарифы, ограничения и условия
Compute Cloud тарифицируется посекундно; по прайс-листу Yandex Cloud GPU-час на A100 стоит 481,73 ₽ с НДС, конфигурация DataSphere с одной A100 — 542,88 ₽ в час. В AI Studio оплата идёт за 1000 токенов: YandexGPT Lite — 0,20 ₽ в синхронном режиме, gpt-oss-120b — 0,30 ₽, Llama-3.3-70B — 0,60 ₽. Для постоянных нагрузок есть резервы со скидкой за коммит на один и три года.
Ограничения: по умолчанию квота на GPU у новых аккаунтов нулевая и увеличивается по запросу из консоли; доступ к платформам нового поколения тоже выдаётся по запросу. GPU на ВМ работает в режиме TCC.
Официальный сайт: yandex.cloud
4. VK Cloud — дробная аренда GPU
Облако экосистемы VK с сервисом Cloud GPU: помимо целых карт здесь арендуют долю видеокарты — vGPU от 1/24 ускорителя L4. Это редкий для российского рынка формат, который удешевляет мелкий инференс и эмбеддинги.

Кейсы клиентов и кому подойдёт
- Мелкий инференс на vGPU: компактные модели на 1–7B параметров, эмбеддинги, computer vision — провайдер заявляет экономию до 60% по сравнению с арендой целой карты.
- Продакшен-serving моделей через MLflow Deploy: модель упаковывается в Docker-контейнер и разворачивается с REST API для запросов в реальном времени.
- MLOps-контур на Cloud ML Platform: JupyterHub и MLflow преднастроены, GPU-шаблоны доступны сразу после создания проекта.
- Графические рабочие места: пулы виртуальных десктопов на GPU-шаблонах.
Что можно развернуть
Виртуальные машины собираются из фиксированных шаблонов: Tesla V100 и V100S, A100 на 40 и 80 ГБ (в том числе SXM4), L4, L40S, A30 и H200 со 141 ГБ — в конфигурациях с одной или восемью картами; связка 8×H200 идёт с 240 vCPU и 2 ТБ оперативной памяти. Отдельно доступны vGPU-профили на базе L4 — от 1 ГБ видеопамяти до целой карты, лицензирование NVIDIA vGPU в образах VK Cloud уже настроено. Managed Kubernetes поддерживает узлы с GPU.

Инфраструктура и экосистема
Четыре дата-центра уровня Tier III в Москве (Гознак, DataLine NORD4, Медведково, Пахра) и два в Казахстане. Информационная система аттестована по требованиям приказа ФСТЭК №21, на странице сервиса заявлен высший уровень защищённости УЗ-1, отдельно существует продукт «Облако 152-ФЗ». SLA на доступность виртуальных машин — 99,95%.
Отзывы и репутация
Платформа входит в экосистему VK и позиционируется как корпоративное облако с акцентом на соответствие требованиям регуляторов. Агрегированные оценки и публичные рейтинги в официальных источниках не приводятся.
Поддержка и каналы связи
Работают портал поддержки с тикетами и персональный менеджер при подключении Cloud GPU; с развёртыванием ML-инфраструктуры помогают эксперты VK. Документация ведётся на русском языке.
Тарифы, ограничения и условия
Модель pay-as-you-go с поминутной тарификацией и минимальным сроком аренды ВМ в один час; доступны почасовой, помесячный и годовой планы. Входящий и исходящий трафик, а также мониторинг не тарифицируются. Публичного прайса на GPU-шаблоны нет: цены отображаются в настройках проекта по прайс-листу или условиям договора, для оценки предлагается калькулятор на сайте. Для новых клиентов заявлен тестовый период.
Ограничения: квоты на GPU-шаблоны выдаются по запросу в техподдержку; vGPU доступна только на базе L4 и не более одной на машину. Serverless-инференса с оплатой за токены в линейке нет — serving поднимается на собственных ВМ, в Kubernetes или через MLflow Deploy.
Официальный сайт: cloud.vk.com
5. Cloud.ru — максимальный комплаенс
Облачная платформа экосистемы Сбера (бывший SberCloud) с линейкой Evolution: виртуальные машины с GPU, выделенные серверы HGX, ML-сервисы и serverless-инференс с оплатой за токены. Главное отличие — регуляторный комплект: от 152-ФЗ по высшему уровню защищённости до аттестатов для объектов критической инфраструктуры.
Кейсы клиентов и кому подойдёт
- Serverless-инференс через Evolution Foundation Models: более 20 моделей (GigaChat, Qwen3, DeepSeek, GLM-4.6, gpt-oss-120b, T-lite и T-pro) по OpenAI-compatible API, развёрнутых на серверах в России. Есть Guardrails для маскирования чувствительных данных.
- Деплой собственных моделей через Evolution ML Inference — с автоматически генерируемой OpenAPI-спецификацией и Swagger UI для тестирования.
- RAG-сервисы и AI-агенты как управляемые сервисы, файн-тюнинг на GPU.
- Тяжёлые задачи на выделенных серверах HGX с восемью H100.
Что можно развернуть
Виртуальные машины Evolution Compute комплектуются картами V100 (32 ГБ), A100 (40 и 80 ГБ) и H100 (80 ГБ): до восьми H100 или A100 и до шестнадцати V100 на одну машину. Старшая конфигурация — 8×H100 с NVLink, 160 vCPU и 1488 ГБ RAM; для изоляции доступен bare metal HGX 8×H100. Managed Kubernetes поддерживает узлы с GPU. ML-контур собирается из Evolution Notebooks, ML Inference, ML Finetuning, Managed RAG и AI Agents, для multi-node обучения используется InfiniBand.
Инфраструктура и экосистема
Инфраструктура размещена только в России: девять дата-центров уровня Tier III, три зоны доступности в Москве, заявленная доступность платформы — до 99,982%. Комплект соответствий: 152-ФЗ по уровню УЗ-1, 187-ФЗ для объектов КИИ (аттестаты ФСТЭК), ГОСТ Р 57580 для финансового сектора, PCI DSS, ISO/IEC 27001 и 27701, лицензии ФСТЭК и ФСБ. Платформа Evolution включена в реестр российского ПО.
Отзывы и репутация
Провайдер — российское юридическое лицо ООО «Облачные технологии» из экосистемы Сбера; работает с компаниями, ИП и физлицами, для бизнеса доступны договор, ЭДО и постоплата. Публичные агрегированные оценки сервис не приводит.
Поддержка и каналы связи
Бесплатная круглосуточная поддержка: тикеты в консоли, почта support@cloud.ru и телефон 8-800-444-24-99; для бизнеса — персональный менеджер, для эскалации отдельный канал. Документация ведётся на русском и английском языках.
Тарифы, ограничения и условия
Посекундная тарификация pay-as-you-go. По тарифному приложению Evolution Compute GPU (редакция от 20.05.2026, цены без НДС): V100 — от 200 ₽ в час, A100 PCI — 260 ₽ в час, H100 PCI — 450 ₽ в час, H100 с NVLink — 700 ₽ в час; выделенный HGX 8×H100 — от 5 355 000 ₽ в месяц. В Foundation Models оплата идёт за миллион токенов: например, gpt-oss-120b — 13 ₽ за входные и 50 ₽ за выходные токены, GigaChat3-10B — по 10 ₽.
Ограничения: для создания ВМ с GPU нужно пополнить баланс минимум на 15 000 ₽, бонусными средствами GPU не оплачиваются; машина создаётся при наличии свободной карты нужной модели. Зарубежных дата-центров нет.
Официальный сайт: cloud.ru
6. Nebius — зарубежные локации
Международное GPU-облако, выросшее из инфраструктурной команды Яндекса: нидерландская Nebius Group (листинг на Nasdaq, тикер NBIS) с собственным дата-центром в Финляндии и флагманскими картами вплоть до Blackwell Ultra. Важная оговорка: по условиям договора сервис не работает с компаниями и бенефициарами из России и Беларуси, поэтому в подборке это вариант для зарубежных команд.
Кейсы клиентов и кому подойдёт
- Managed-инференс через Nebius Token Factory: более 60 open-source моделей (DeepSeek, Qwen, Llama, GLM, Kimi, gpt-oss, Mistral) по OpenAI-compatible API — публичные эндпоинты с оплатой за токены или выделенные с оплатой за GPU-час.
- Файн-тюнинг (LoRA и полный) и пакетный инференс со скидкой 50% к базовой цене.
- Развёртывание микросервисов NVIDIA NIM и Blueprints в один клик.
- Обучение на GPU-кластерах с InfiniBand до 3,2 Тбит/с на хост — на Kubernetes или Slurm.
Что можно развернуть
Линейка GPU: L40S (48 ГБ), RTX PRO 6000 Server Edition (96 ГБ), H100 (80 ГБ), H200 (141 ГБ), B200 (180 ГБ) и B300 (270 ГБ). На одну машину ставится одна или восемь карт, через консоль доступно до 32 GPU; кластеры собираются из восьмикарточных конфигураций. Поверх работают Managed Kubernetes с бесплатным control plane, Slurm-оператор Soperator и Serverless AI для контейнерных ворклоадов с посекундной тарификацией.
Инфраструктура и экосистема
Публичные регионы: Финляндия (собственный ЦОД), Франция, Израиль, США и Великобритания, плюс приватные площадки в Исландии и Франции. Сертификация — SOC 2 Type II, ISO/IEC 27001 и 27799, NIS 2; для инференса заявлен режим zero-retention, при котором запросы и ответы моделей не сохраняются. SLA на выделенные эндпоинты Token Factory — 99,9%.
Отзывы и репутация
Компания торгуется на Nasdaq под тикером NBIS и отчитывается как независимый AI-инфраструктурный провайдер; в июне 2026 года завершила поглощение Eigen AI для оптимизации инференса. Агрегированные пользовательские оценки в официальных источниках не публикуются.
Поддержка и каналы связи
Круглосуточная поддержка через тикеты с приоритетами; для multi-node конфигураций бесплатно помогают solution architects. На корпоративном тарифе Token Factory доступны выделенный Slack-канал и кредиты на пилоты. Документация ведётся на английском языке.
Тарифы, ограничения и условия
Pay-as-you-go с биллингом за GPU-секунду, цены в долларах: H100 — 3,85 $ за GPU-час (прерываемые ВМ — 2,15 $), H200 — 4,50 $ (2,45 $), B200 — 7,15 $ (3,95 $), L40S — от 1,55 $. За долгосрочный коммит действуют скидки до 35%, исходящий трафик бесплатный. В Token Factory оплата идёт за миллион токенов: Llama-3.3-70B — 0,13 $ за вход и 0,40 $ за выход в базовом режиме, DeepSeek-V3 — 0,50 $ и 1,50 $ соответственно; на старте начисляют 1 $ кредитов.
Ограничения: пункт 20.10 договора запрещает использование сервиса клиентами, зарегистрированными в России или Беларуси, и их бенефициарными владельцами. Для новых тенантов квота на B200 и H200 в американском регионе по умолчанию нулевая и повышается по запросу; прерываемые ВМ могут быть вытеснены при нехватке мощностей.
Официальный сайт: nebius.com
Сравнение по ключевым критериям
- Формат аренды: виртуальные машины с GPU есть у всех шести провайдеров. Выделенные серверы доступны у immers.cloud, К2 Облака и Cloud.ru; дробная аренда vGPU — у VK Cloud; прерываемые ВМ со скидкой — у Nebius. В К2 Облаке также есть Managed Kubernetes с GPU и разделением карты на изолированные инстансы через MIG.
- Инференс с оплатой за токены предлагают Yandex Cloud в AI Studio, К2 Облако в формате Model as a Service, Cloud.ru через Evolution Foundation Models и Nebius в Token Factory. В immers.cloud приватные модели работают на арендованном сервере без оплаты за токены, а отдельные open-source-модели можно бесплатно протестировать через публичные эндпоинты. В VK Cloud модель также разворачивается на арендованных мощностях.
- Флагманские GPU: H200 есть у immers.cloud, VK Cloud и Nebius, а B200 и B300 — только у Nebius. В К2 Облаке и Cloud.ru старшая доступная карта — H100. У Yandex Cloud доступны A100 и платформа со 141 ГБ видеопамяти.
- Размещение: инфраструктура immers.cloud, Yandex Cloud, К2 Облака, VK Cloud и Cloud.ru находится в России. Nebius работает только в зарубежных регионах: ЕС, США, Израиле и Великобритании.
- Документы для российских юрлиц: immers.cloud, Yandex Cloud, К2 Облако, VK Cloud и Cloud.ru работают по договору, выставляют счета в рублях и предоставляют закрывающие документы. Nebius по условиям соглашения не работает с российскими компаниями.
- Минимальный чек: в immers.cloud баланс можно пополнить от 100 ₽, а использование GPU оплачивается посекундно. В К2 Облаке минимальный срок аренды виртуальной машины составляет один час, новым клиентам доступен тестовый период на одну неделю; публичного прайс-листа на GPU нет. В Cloud.ru для создания GPU-ВМ требуется от 15 000 ₽, в Yandex Cloud сначала нужно увеличить нулевую квоту, в VK Cloud стоимость определяется по прайс-листу проекта. Nebius предоставляет стартовые кредиты от 1 $, но сервис доступен только зарубежным командам.
Как выбрать сервис под свою задачу
Для быстрого старта без заявок подходят платформы с self-service онбордингом: в immers.cloud каталог инстансов открывается сразу после пополнения баланса, а модели можно тестировать через публичные эндпоинты ещё до аренды сервера. Если инференс — это вызовы API без собственного железа, логичнее serverless-формат: AI Studio у Yandex Cloud, Evolution Foundation Models у Cloud.ru или Token Factory у Nebius, где платят за токены, а не за часы простоя.
Для регулируемых отраслей и работы с персональными данными решающим становится комплект документов: максимальный набор аттестатов — у Cloud.ru, высший уровень защищённости ПДн заявлен и у VK Cloud. Зарубежным командам, которым нужны новейшие GPU и кластеры с InfiniBand, подойдёт Nebius — с оговоркой про ограничения договора.
Перед арендой посчитайте полную стоимость владения: цену GPU-часа, хранение весов и датасетов, трафик и время инженеров на поднятие окружения. У большинства провайдеров из подборки есть тестовые балансы или гранты — пилот на реальной модели покажет итоговую экономику точнее любого калькулятора.















