Реклама
Перетяжка // Коробка 3.0

5 российских облаков для запуска своих ИИ-моделей в 2026 году

Пять российских облаков для собственных ИИ-моделей: форматы запуска, GPU, инструменты разработки, условия оплаты и ограничения.

Обложка: 5 российских облаков для запуска своих ИИ-моделей в 2026 году

Свою нейросеть сегодня можно запустить даже без команды инженеров: открытые модели вроде Qwen, DeepSeek и Llama лежат в свободном доступе. Проблема в железе. Чтобы модель быстро отвечала, ей нужна мощная видеокарта, а локальное железо стоит как хорошая машина — и то, если его ещё удастся купить.

Выход — арендовать видеокарту в облаке. Разбираемся, чем такие облака отличаются друг от друга, сколько стоит час работы на мощной видеокарте и какие российские облака подойдут, если данные нельзя вывозить за границу. В конце — подсказка, что выбрать под вашу задачу.

Что сравниваем
  • GPU-серверы: контроль над окружением для обучения, дообучения и инференса.
  • Управляемый инференс: запуск модели с меньшим объёмом работ по развёртыванию инфраструктуры.
  • Инструменты ML-разработки: ноутбуки и трекинг экспериментов для командной работы.
  • Условия эксплуатации: доступность ускорителей, стоимость всей конфигурации, сеть и требования к данным.

Как выбирать облако под свою модель

В подборку вошли российские провайдеры с GPU-инфраструктурой или сервисами развёртывания ML-моделей. Сравниваем их по задаче, которую получает команда: настроить собственный сервер, организовать эксперименты или опубликовать модель для приложений. Порядок участников не означает превосходства по производительности: подходящая конфигурация зависит от модели и нагрузки.

Начните с видеопамяти: место нужно не только весам модели, но и рабочим данным, включая KV-кеш — память для хранения контекста уже обработанного текста при генерации ответа. Дообучение требует отдельного расчёта памяти под выбранный метод. Для нескольких GPU проверяйте соединение между картами и узлами: наличие восьми ускорителей само по себе ничего не говорит о скорости распределённого обучения.

Сравнивайте полную стоимость: GPU, CPU, RAM, диски, хранение датасетов, трафик и простаивающие ресурсы. Для сервиса с постоянными запросами дополнительно нужны мониторинг, резервирование и понятные условия масштабирования. Российское расположение дата-центра само по себе не закрывает требования 152-ФЗ: до загрузки персональных данных проверьте документы на конкретную услугу и распределение обязанностей между вами и провайдером.

1. immers.cloud — видеокарта на час, а не на год

Допустим, вы хотите запустить открытую нейросеть — Qwen или DeepSeek — или дообучить её на своих данных. Домашней видеокарты вам точно не хватит, но можно у immers.cloud арендовать железо: берёте сервер с нужной видеокартой, работаете сколько надо и платите только за это время — с точностью до секунды.

5 российских облаков для запуска своих ИИ-моделей в 2026 году_9
Страница каталога моделей (Immers Foundation Models - https://immers.cloud/ai/model/) 

Что это и кому подойдёт

immers.cloud — российское облако, которое сдаёт в аренду серверы с видеокартами NVIDIA. Сервер создаётся сам, через сайт или API: заявок и ожидания нет, обычно всё готово через несколько минут после регистрации и оплаты.

Кроме серверов у облака есть каталог готовых нейросетей Immers Foundation Models. По словам провайдера, в нём больше 200 открытых моделей — это крупнейший такой каталог в России. Для каждой указано, сколько видеопамяти ей нужно. Видеопамять — это рабочий стол нейросети: если модель на нём не помещается, она просто не запустится. Поэтому подсказка из каталога экономит часы проб и ошибок.

Два примера от провайдера:

  • Команда «КС Авто» вынесла круглосуточную модерацию контента на три облачные RTX 4090 с Ollama: потоки изолированы по видеокартам, система работает стабильно, а на старте это обошлось дешевле команды из 15 модераторов.
  • В IBS собрали песочницу для экспериментов с ИИ на GPUStack и vLLM: 11 серверов на A100, RTX 3090 и RTX 4090 обслуживают 14 моделей, и новую гипотезу проверяют за часы.

Облако рассчитано на тех, кто не боится командной строки: подключаться к серверу по SSH и настраивать окружение придётся самому. Мастера «в один клик» для всего ML-процесса здесь нет.

Какие видеокарты есть

Всего 13 моделей: H200, H100 NVL, H100, A100, V100, A10, A2, T4, RTX 5090, 4090, 3090, 3080 и 2080 Ti. В один сервер ставят до восьми карт, соединённых NVLink — быстрой шиной, через которую карты обмениваются данными, чтобы большая модель могла работать сразу на нескольких. InfiniBand для связи между серверами — по запросу.

Серверы стоят в дата-центре уровня Tier III в Москве, и всё оборудование там погружено в диэлектрическую жидкость — это называется иммерсионным охлаждением. Жидкость забирает тепло лучше воздуха, поэтому видеокарты не перегреваются и не сбрасывают частоту даже при круглосуточной нагрузке.

Как запустить модель

Есть три пути. Первый — публичный эндпоинт. Эндпоинт — это адрес, на который ваша программа отправляет вопрос и получает ответ модели. Проверить модель можно в чате на сайте или по API, ничего не разворачивая. На момент публикации это бесплатно, провайдер готовит переход на оплату за токены.

Второй — частный эндпоинт: модель разворачивается на арендованном сервере через vLLM. При создании можно указать несколько серверов — на каждом поднимется своя копия модели, а балансировщик раскидает между ними запросы.

5 российских облаков для запуска своих ИИ-моделей в 2026 году_22
Рекомендуемые конфигурации в 4-бита с карточки модели GLM-5.2 с возможностью перехода к деплою

Третий — обычный сервер: больше ста готовых образов в маркетплейсе, включая ComfyUI для генерации картинок. Управлять серверами можно через OpenStack API и Terraform.

Дообучать модели тоже можно, но своими скриптами на арендованном сервере: готового инструмента для этого нет. Данные хранят в S3, на момент публикации оно бесплатное.

Сколько стоит

Оплата посекундная, минимальный платёж — 100 ₽. Самый простой сервер с T4 стоит 20,34 ₽ в час, сервер с H200 — 423,04 ₽ в час. За предоплату на 30 или 60 дней дают скидку: на H200 — 10 и 15%, на T4 — 15 и 25%. Месяц H200 с предоплатой обойдётся в 274 129,80 ₽ вместо примерно 304 600 ₽.

Для новых пользователей есть тестовый период на 30 дней. Юрлица работают по оферте или договору через ЭДО, закрывающие документы приходят 5 числа каждого месяца. НДС провайдер не платит — он освобождён по статье 145.1 НК РФ.

Ограничения

  • Трекинга экспериментов, версионирования моделей и датасетов, интеграций с MLflow и Kubeflow нет — полный MLOps-процесс придётся собирать самому.
  • Одну модель на 400B+ параметров не получится разнести по нескольким серверам из коробки: потолок — восемь видеокарт в одной машине.
  • По умолчанию у нового аккаунта лимит: четыре сервера, 16 vCPU, 128 ГБ памяти и 1600 ГБ хранилища. Расширяют через поддержку.
  • В S3 нет версионирования, а скорость около 50 МБ/с и заметно плавает.
  • Юрлицам на общей системе налогообложения НДС к вычету принять не получится.

Поддержка и документы

Поддержка работает круглосуточно: чат на сайте, Telegram, Max, почта и личный менеджер. Заявленное время ответа — не больше пяти минут. Инструкции собраны в FAQ на сайте и на YouTube-канале. У провайдера есть сертификат ГОСТ Р ИСО/МЭК 27001-2021 по защите информации, а за время простоя он обещает компенсацию в полном объёме.

Сайт: immers.cloud

2. Selectel — гибкие GPU-конфигурации

Selectel предлагает GPU как выделенное PCI-устройство внутри виртуальной машины. Можно подобрать CPU, RAM и диски под конкретную задачу, а рядом разместить хранилище, базу данных и другие компоненты приложения.

Кейсы клиентов и кому подойдёт

В кейсе RobotMIA описана инфраструктура для голосовых роботов с облачными серверами, GPU и объектным хранилищем. Подобный набор подойдёт команде, которая разворачивает речевые модели или компьютерное зрение вместе с прикладным API. Ещё один сценарий — обучение на GPU с последующим переносом модели в контейнерный продакшен.

Что можно развернуть

На GPU-ВМ можно использовать TensorFlow, PyTorch и другие ML-фреймворки, устанавливать собственное ПО и загружать образ системы. Доступен Kubernetes с GPU для обучения и инференса. Такой вариант удобен, если команда уже поставляет приложения в контейнерах и хочет встроить модели в тот же процесс разработки.

Инфраструктура и экосистема

На странице продукта перечислены T4, A2, A30, A100, RTX 4090, RTX 6000 Ada и другие карты. Доступность зависит от пула. Управлять ресурсами можно через панель, API и Terraform; рядом доступны S3, IAM, балансировщики и резервное копирование дисков. Selectel заявляет соответствие серверов требованиям 152-ФЗ до УЗ-1: состав услуги и документы следует сопоставить с требованиями конкретной информационной системы.

Отзывы и репутация

Публичный кейс RobotMIA позволяет оценить применение инфраструктуры в работающем сервисе. Указанные в нём показатели относятся к конкретной архитектуре и не служат обещанием задержки для любой модели. Агрегированная пользовательская оценка на странице GPU-продукта не приведена.

Поддержка и каналы связи

Для подбора конфигурации на странице указаны sales@selectel.ru и телефон 8 800 555-06-75. Это каналы предварительной консультации; порядок обращения по техническим инцидентам и условия реакции лучше согласовать до запуска. Есть русскоязычная документация по созданию GPU-сервера, оплате, API и Terraform.

Тарифы, ограничения и условия

Оплата — по потреблению, стоимость выбранной конфигурации уточняется в калькуляторе на сайте. Для проектов аккаунта указаны 3 ТБ бесплатного внешнего трафика; дополнительный трафик — 0,90 ₽/ГБ. Услугой могут пользоваться физические и юридические лица: доступны пополнение картой и выставление счёта.

При выборе региона сначала проверьте наличие нужной GPU в конкретном пуле. Возможность отключить ускоритель помогает сокращать расходы между задачами, но оставшиеся ресурсы нужно учитывать отдельно. Аренда GPU-ВМ даёт инфраструктуру для ML; настройку окружения, запуск заданий и эксплуатацию модели должна организовать команда.

Официальный сайт: Selectel — облачные серверы с GPU.

3. Cloud.ru — управляемый инференс

Cloud.ru предлагает Evolution ML Inference для развёртывания моделей на GPU, в том числе из пользовательских Docker-образов. Это вариант для команды, которой нужно обслуживать запросы к готовой модели с автоматизацией развёртывания и масштабирования.

5 российских облаков для запуска своих ИИ-моделей в 2026 году_51

Кейсы клиентов и кому подойдёт

Разработчик может запустить модель из Hugging Face для текстового помощника; команда генеративной графики — развернуть обработку изображений; ML-инженер — передать собственное окружение в Docker. Это сценарии использования продукта, а не названные клиентские внедрения: на странице ML Inference конкретные заказчики не перечислены.

Что можно развернуть

Поддерживаются vLLM, TGI, Ollama, Diffusers и Transformers, а также языковые, трансформерные и диффузионные модели. Помимо Hugging Face и маркетплейса, предусмотрен запуск с пользовательским Docker-образом. Сервис описывает динамическое автомасштабирование при изменении числа запросов.

Инфраструктура и экосистема

Для ML Inference указаны V100 и H100, а также совместное использование GPU несколькими инференсами — Shared GPU. В экосистеме Evolution есть объектное хранилище, Kubernetes, реестр артефактов, мониторинг и логирование. Cloud.ru сообщает о дата-центрах в России; расположение ресурсов конкретного сервиса и доступную сетевую схему нужно проверить при проектировании.

Отзывы и репутация

На странице ML Inference нет агрегированной пользовательской оценки. При выборе сервиса полезнее проверить совместимость собственного образа, время запуска экземпляра и поведение под всплесками запросов. Известность провайдера не определяет эти характеристики для конкретной модели.

Поддержка и каналы связи

Стандартная техподдержка работает бесплатно круглосуточно. На странице поддержки перечислены личный кабинет, телефон 8 800 444-24-99, support@cloud.ru и Telegram. Для проектов с дополнительными требованиями есть премиальный тариф по запросу.

Тарифы, ограничения и условия

Стоимость уточняется на сайте для выбранной конфигурации. При расчёте бюджета учитывайте число одновременно работающих экземпляров и условия Shared GPU: экономия на разделяемом ускорителе должна соответствовать требованиям к задержке. Общие бонусы облака не стоит считать бесплатными GPU-часами без проверки условий конкретного предложения.

Существенное ограничение для закрытых данных: Private Endpoint на странице ML Inference помечен «скоро будет доступен». Если доступ без публичного интернета обязателен, подтвердите готовность функции до выбора сервиса. ML Inference предназначен для исполнения моделей; обучение и дообучение требуют отдельного решения и расчёта ресурсов.

Официальный сайт: Cloud.ru — Evolution ML Inference.

4. VK Cloud — инструменты ML-разработки

VK Cloud предлагает GPU-ВМ и Cloud ML Platform с преднастроенными JupyterHub и MLflow. Это сочетание вычислительных ресурсов, среды для ноутбуков и инструментов работы с экспериментами.

5 российских облаков для запуска своих ИИ-моделей в 2026 году_68

Кейсы клиентов и кому подойдёт

Команда дата-сайентистов может использовать платформу для совместной разработки и сравнения экспериментов. Для прикладных сервисов провайдер отдельно описывает инференс небольших языковых моделей, видеоаналитику и получение эмбеддингов для RAG-поиска. На странице GPU эти сценарии приведены без привязки к конкретным клиентам.

Что можно развернуть

GPU можно использовать для обучения и инференса на виртуальных машинах с Linux или Windows. В Cloud ML Platform доступны преднастроенные JupyterHub и MLflow; GPU-конфигурация подключается к среде разработки. Наличие этих инструментов уменьшает объём начальной настройки, но производственный API и процесс доставки модели всё равно нужно спроектировать.

Инфраструктура и экосистема

Среди ускорителей перечислены L4, L40S, A30, A100 и V100. Для небольших нагрузок заявлена аренда доли карты через vGPU — от 1/24 до целого ускорителя. Доступные профили и объём видеопамяти необходимо уточнять под модель. Провайдер указывает российские ЦОД уровня Tier III и аттестацию виртуальных серверов по 152-ФЗ до УЗ-1. Рядом доступны объектное хранилище и управляемые базы данных.

Отзывы и репутация

Агрегированный пользовательский рейтинг на странице Cloud GPU не указан. Для оценки платформы имеет смысл провести небольшой командный эксперимент: проверить доступ к ноутбукам, запись метрик в MLflow и воспроизводимость запуска. Это покажет, насколько готовая среда соответствует процессам вашей команды.

Поддержка и каналы связи

Технические вопросы можно направлять через портал поддержки. При подключении Cloud GPU через заявку назначается менеджер для расчёта конфигурации и коммерческого предложения. Также доступна русскоязычная документация по GPU.

Тарифы, ограничения и условия

На странице перечислены часовой, месячный и годовой тарифные планы. Минимальное время аренды GPU-ВМ — один час; цена выбранной конфигурации уточняется на сайте или у менеджера. Для подключения предлагается оставить заявку, поэтому сроки выдачи ресурсов лучше согласовать до начала проекта.

vGPU имеет смысл, когда задача не использует всю карту. Доля ускорителя ограничивает доступные ресурсы, поэтому нельзя выбирать её только по числу параметров модели: важны точность весов, длина контекста и параллельные запросы. Заявленный SLA 99,95% относится к доступности виртуальных машин и не означает такую же гарантию скорости ответов вашей модели.

Официальный сайт: VK Cloud — Cloud GPU.

5. Timeweb Cloud — облако и выделенные

Timeweb Cloud предлагает облачные и выделенные серверы с NVIDIA GPU. Провайдера можно рассмотреть для собственного ML-окружения и проектов, которым требуется отдельно подобрать физическую конфигурацию.

Кейсы клиентов и кому подойдёт

В каталоге историй на странице GPU есть проекты AI-компаний и голосовых роботов. Например, опубликована история миграции AI-сервиса и клиентских проектов. Для команды разработки практический сценарий — разместить модель рядом с бэкендом, S3 и базой данных. Для длительных вычислений можно отдельно обсудить выделенный сервер.

Что можно развернуть

На сервер разрешено устанавливать собственное ПО; доступны SSH, KVM-консоль и приложения из маркетплейса. Провайдер относит к GPU-сценариям обучение нейросетей, распознавание речи и изображений, рекомендательные системы и чат-боты. Стек обучения, зависимости и сервер инференса можно собрать под свою модель.

Инфраструктура и экосистема

В линейке перечислены T4, RTX 3090, RTX 4090 и карты серии A. Обычно провайдер предлагает от одной до четырёх GPU на сервер, большее количество обсуждается отдельно. В облаке есть Kubernetes, S3, базы данных и балансировщики. Наличие Kubernetes как соседнего продукта не следует автоматически считать подтверждением поддержки выбранной GPU-конфигурации в кластере.

Отзывы и репутация

Опубликованные истории позволяют увидеть работу облака с AI-сервисами и прикладной инфраструктурой. Их результаты относятся к отдельным проектам: кейс миграции сам по себе не подтверждает скорость обучения на GPU. Агрегированная пользовательская оценка на странице продукта не приведена.

Поддержка и каналы связи

Поддержка заявлена в режиме 24/7/365. На странице доступны чат, Telegram, форма обращения по электронной почте и телефон 8 800 700-32-92. Подбор нестандартной конфигурации и изменение выделенного сервера обсуждаются с командой провайдера.

Тарифы, ограничения и условия

Для облачных серверов указано почасовое списание, хотя тариф формируется за месяц. Стоимость GPU-конфигурации уточняется на сайте или через заявку. H100 и H200 находятся в разделе предзаказа: для него указан минимальный аванс от 5000 ₽. Это не цена месяца аренды и не подтверждение немедленной выдачи ускорителя.

У Timeweb Cloud есть российские и зарубежные площадки. Если данные должны оставаться в РФ, зафиксируйте российскую локацию и наличие нужной GPU именно в ней. Для выделенного сервера согласуйте срок подготовки и изменения конфигурации; обещание быстрого запуска облачной ВМ нельзя переносить на индивидуальную поставку оборудования.

Официальный сайт: Timeweb Cloud — серверы с GPU.

Сравнение по ключевым критериям

5 российских облаков для запуска своих ИИ-моделей в 2026 году_100
Сравнительная таблица сервисов из подборки
  • Самостоятельное окружение: immers.cloud — GPU-серверы и каталог моделей; Selectel — GPU-ВМ и Kubernetes с GPU; Timeweb Cloud — облачные и выделенные серверы с установкой собственного ПО.
  • Готовые инструменты: Cloud.ru — управляемый инференс с поддержкой Hugging Face, Docker и автомасштабирования; VK Cloud — Cloud ML Platform с JupyterHub и MLflow; immers.cloud — публичные и частные эндпоинты.
  • Оплата: immers.cloud заявляет посекундный учёт, Selectel — оплату по потреблению, Timeweb Cloud — почасовые списания за облачные серверы. У VK Cloud минимальная аренда GPU-ВМ составляет час. Стоимость Cloud.ru нужно рассчитать для выбранной конфигурации инференса.
  • Доступность: у Selectel состав GPU зависит от пула; VK Cloud предлагает подключение через заявку; H100 и H200 у Timeweb Cloud указаны как предзаказ. Наличие модели ускорителя в каталоге не гарантирует свободную конфигурацию на нужную дату.
  • Ограничения: в immers.cloud потребуется самостоятельная настройка ML-процесса; у Cloud.ru Private Endpoint для ML Inference пока обозначен как будущая функция. Для Timeweb Cloud отдельно выбирайте российскую локацию, если этого требуют условия обработки данных.

Что выбрать под вашу задачу

Для проверки открытой модели начните с каталога immers.cloud, а для управляемого исполнения с масштабированием изучите Cloud.ru. Если важны командные ноутбуки и трекинг экспериментов, рассмотрите VK Cloud. Для собственного контейнерного стека с GPU подойдёт к рассмотрению Selectel; для выбора между облачной ВМ и отдельным физическим сервером — Timeweb Cloud.

Перед длительной арендой проведите короткий тест на своих данных. Зафиксируйте используемую видеопамять, время обучения или задержку инференса, пропускную способность и итоговый расход средств. Эти показатели помогут выбрать конфигурацию точнее, чем сравнение названий GPU или стоимости одного часа.