immers.cloud запустил Foundation Models: каталог open-source LLM с арендой GPU и без платы за токены
Наконец кто-то посчитал, что pay-per-token — это финансовая лотерея
Российский облачный провайдер immers.cloud запустил Foundation Models — каталог open-source моделей для инференса с автоматическим подбором GPU-конфигураций, предрассчитанными параметрами запуска и ценообразованием по принципу «платишь за время сервера, а не за токены».
Продукт адресован разработчикам и продуктовым командам, которые хотят запускать инференс LLM на серверах в РФ с предсказуемым бюджетом — без зависимости от зарубежных API-провайдеров и неожиданных счетов.
Что внутри каталога
Каждая модель в каталоге прошла ручную инженерную валидацию с описанием реального прорыва модели, её архитектурных ограничений и сценариев, где она выигрывает у аналогов. Модели добавляются сразу с весами в трёх квантизациях: 4, 8 и 16 бит.
Для каждой модели заранее рассчитаны:
- рекомендуемый размер контекста
- требования к VRAM для каждой квантизации
- доступная память под пользовательские запросы
- максимальное количество одновременных запросов (параллельность)
- скорость генерации и пропускная способность в токенах в секунду (наполняется в процессе валидации)
Система автоматически подбирает конфигурации: от бюджетных решений на одном GPU до кластерных сценариев с балансировщиками нагрузки и аппаратными NVLink/NVSwitch.
Как это работает экономически
В отличие от зарубежных облаков с pay-per-token, immers.cloud тарифицирует по времени работы виртуальной машины или выделенного сервера. Модель разворачивается на арендованном GPU-сервере под полным контролем пользователя: произвольная версия vllm, приватный доступ, кастомные веса, возможность масштабирования.
Для быстрого прототипирования без расходов доступны публичные эндпоинты с доступом по API — можно тестировать качество генерации до перехода на приватный инстанс.
Путь от идеи до начала активной разработки упирается в две взаимосвязанные проблемы: зарубежные облачные сервисы не всегда безопасны и предсказуемы по цене, а своя инфраструктура требует огромных вложений.
По словам Павла Самойлова, система сама рассчитывает ресурсы с учётом квантования и разворачивает приватные эндпоинты, балансировщик и авторизацию в несколько кликов. При больших объёмах потребления токенов пользователь платит только за время работы сервера.
Для команд, которые не хотят самостоятельно настраивать окружение — доступна круглосуточная техническая поддержка и рекомендованные параметры деплоя.
Попробовать бесплатные модели и запустить приватный инстанс можно на immers.cloud/ai/model/. Там же — видеогайд по деплою приватных инстансов: YouTube, ВКонтакте, Rutube.
Реклама. Рекламодатель: ООО «ДТЛ» ИНН 9717073792, erid: 2W5zFHxMsBf