immers.cloud запустил Foundation Models: каталог open-source LLM с арендой GPU и без платы за токены

Наконец кто-то посчитал, что pay-per-token — это финансовая лотерея

Обложка: immers.cloud запустил Foundation Models: каталог open-source LLM с арендой GPU и без платы за токены

Российский облачный провайдер immers.cloud запустил Foundation Models — каталог open-source моделей для инференса с автоматическим подбором GPU-конфигураций, предрассчитанными параметрами запуска и ценообразованием по принципу «платишь за время сервера, а не за токены».

Продукт адресован разработчикам и продуктовым командам, которые хотят запускать инференс LLM на серверах в РФ с предсказуемым бюджетом — без зависимости от зарубежных API-провайдеров и неожиданных счетов.

Что внутри каталога

Каждая модель в каталоге прошла ручную инженерную валидацию с описанием реального прорыва модели, её архитектурных ограничений и сценариев, где она выигрывает у аналогов. Модели добавляются сразу с весами в трёх квантизациях: 4, 8 и 16 бит.

Скриншот из каталога

Для каждой модели заранее рассчитаны:

  • рекомендуемый размер контекста
  • требования к VRAM для каждой квантизации
  • доступная память под пользовательские запросы
  • максимальное количество одновременных запросов (параллельность)
  • скорость генерации и пропускная способность в токенах в секунду (наполняется в процессе валидации)
4-битная конфигурация GLM-5.2

Система автоматически подбирает конфигурации: от бюджетных решений на одном GPU до кластерных сценариев с балансировщиками нагрузки и аппаратными NVLink/NVSwitch.

Как это работает экономически

В отличие от зарубежных облаков с pay-per-token, immers.cloud тарифицирует по времени работы виртуальной машины или выделенного сервера. Модель разворачивается на арендованном GPU-сервере под полным контролем пользователя: произвольная версия vllm, приватный доступ, кастомные веса, возможность масштабирования.

Создание частного эндпоинта

Для быстрого прототипирования без расходов доступны публичные эндпоинты с доступом по API — можно тестировать качество генерации до перехода на приватный инстанс.

Путь от идеи до начала активной разработки упирается в две взаимосвязанные проблемы: зарубежные облачные сервисы не всегда безопасны и предсказуемы по цене, а своя инфраструктура требует огромных вложений.
Павел СамойловРуководитель направления по ИИ в immers.cloud

По словам Павла Самойлова, система сама рассчитывает ресурсы с учётом квантования и разворачивает приватные эндпоинты, балансировщик и авторизацию в несколько кликов. При больших объёмах потребления токенов пользователь платит только за время работы сервера.

Для команд, которые не хотят самостоятельно настраивать окружение — доступна круглосуточная техническая поддержка и рекомендованные параметры деплоя.

Попробовать бесплатные модели и запустить приватный инстанс можно на immers.cloud/ai/model/. Там же — видеогайд по деплою приватных инстансов: YouTube, ВКонтакте, Rutube.

Реклама. Рекламодатель: ООО «ДТЛ» ИНН 9717073792, erid: 2W5zFHxMsBf