<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:wfw="http://wellformedweb.org/CommentAPI/" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:sy="http://purl.org/rss/1.0/modules/syndication/" xmlns:slash="http://purl.org/rss/1.0/modules/slash/">
  <channel>
    <language>ru</language>
    <title>GPU</title>
    <description>Новости и обзоры видеокарт, графических процессоров для игр, майнинга и машинного обучения. Сравнения производительности, архитектуры GPU от NVIDIA, AMD и Intel.</description>
    <link>https://tproger.ru/tag/gpu</link>
    <atom:link href="https://tproger.ru/tag/gpu/feed" rel="self" type="application/rss+xml"/>
    <lastBuildDate>Sun, 04 Oct 2026 08:54:32 GMT</lastBuildDate>
    <sy:updatePeriod>hourly</sy:updatePeriod>
    <sy:updateFrequency>12</sy:updateFrequency>
    <image>
      <title>GPU</title>
      <link>https://tproger.ru</link>
      <url>https://tproger.ru/apple-touch-icon.png</url>
    </image>
    <item>
      <title>5 российских облаков для запуска своих ИИ-моделей в 2026 году</title>
      <link>https://tproger.ru/digest/5-rossijskih-oblakov-dlya-zapuska-svoih-ii-modelej-v-2026-godu</link>
      <comments>https://tproger.ru/digest/5-rossijskih-oblakov-dlya-zapuska-svoih-ii-modelej-v-2026-godu?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Евгений Стребков]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/digest/5-rossijskih-oblakov-dlya-zapuska-svoih-ii-modelej-v-2026-godu</guid>
      <description><![CDATA[<p>Сравниваем immers.cloud, Selectel, Cloud.ru, VK Cloud и Timeweb Cloud: GPU, обучение и инференс моделей, инструменты ML, условия оплаты и ограничения.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/digest/5-rossijskih-oblakov-dlya-zapuska-svoih-ii-modelej-v-2026-godu">5 российских облаков для запуска своих ИИ-моделей в 2026 году</a>»</p>]]></description>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Облачные технологии]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Подборки]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 30 Sep 2026 04:26:13 GMT</pubDate>
      <content:encoded><![CDATA[<p>Свою нейросеть сегодня можно запустить даже без команды инженеров: открытые модели вроде Qwen, DeepSeek и Llama лежат в свободном доступе. Проблема в железе. Чтобы модель быстро отвечала, ей нужна мощная видеокарта, а локальное железо стоит как хорошая машина — и то, если его ещё удастся купить.</p><p>Выход — арендовать видеокарту в облаке. Разбираемся, чем такие облака отличаются друг от друга, сколько стоит час работы на мощной видеокарте и какие российские облака подойдут, если данные нельзя вывозить за границу. В конце — подсказка, что выбрать под вашу задачу.</p><ul><li>GPU-серверы: контроль над окружением для обучения, дообучения и инференса.</li><li>Управляемый инференс: запуск модели с меньшим объёмом работ по развёртыванию инфраструктуры.</li><li>Инструменты ML-разработки: ноутбуки и трекинг экспериментов для командной работы.</li><li>Условия эксплуатации: доступность ускорителей, стоимость всей конфигурации, сеть и требования к данным.</li></ul><h2>Как выбирать облако под свою модель</h2><p>В подборку вошли российские провайдеры с GPU-инфраструктурой или сервисами развёртывания ML-моделей. Сравниваем их по задаче, которую получает команда: настроить собственный сервер, организовать эксперименты или опубликовать модель для приложений. Порядок участников не означает превосходства по производительности: подходящая конфигурация зависит от модели и нагрузки.</p><p>Начните с видеопамяти: место нужно не только весам модели, но и рабочим данным, включая KV-кеш — память для хранения контекста уже обработанного текста при генерации ответа. Дообучение требует отдельного расчёта памяти под выбранный метод. Для нескольких GPU проверяйте соединение между картами и узлами: наличие восьми ускорителей само по себе ничего не говорит о скорости распределённого обучения.</p><p>Сравнивайте полную стоимость: GPU, CPU, RAM, диски, хранение датасетов, трафик и простаивающие ресурсы. Для сервиса с постоянными запросами дополнительно нужны мониторинг, резервирование и понятные условия масштабирования. Российское расположение дата-центра само по себе не закрывает требования 152-ФЗ: до загрузки персональных данных проверьте документы на конкретную услугу и распределение обязанностей между вами и провайдером.</p><h2>1. immers.cloud — видеокарта на час, а не на год</h2><p>Допустим, вы хотите запустить открытую нейросеть — Qwen или DeepSeek — или дообучить её на своих данных. Домашней видеокарты вам точно не хватит, но можно у <a href="https://immers.cloud/?utm_source=tproger&amp;utm_medium=rating&amp;utm_campaign=ai-solutions">immers.cloud</a> арендовать железо: берёте сервер с нужной видеокартой, работаете сколько надо и платите только за это время — с точностью до секунды.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-09-30/4ed5bd8f-7914-4778-9ec6-c7cd072e2815.webp" alt="" /><figcaption>Страница каталога моделей (Immers Foundation Models - https://immers.cloud/ai/model/)</figcaption></figure><h2>Что это и кому подойдёт</h2><p>immers.cloud — российское облако, которое сдаёт в аренду серверы с видеокартами NVIDIA. Сервер создаётся сам, через сайт или API: заявок и ожидания нет, обычно всё готово через несколько минут после регистрации и оплаты.</p><p>Кроме серверов у облака есть каталог готовых нейросетей Immers Foundation Models. По словам провайдера, в нём больше 200 открытых моделей — это крупнейший такой каталог в России. Для каждой указано, сколько видеопамяти ей нужно. Видеопамять — это рабочий стол нейросети: если модель на нём не помещается, она просто не запустится. Поэтому подсказка из каталога экономит часы проб и ошибок.</p><p>Два примера от провайдера:</p><ul><li>Команда «КС Авто» вынесла круглосуточную модерацию контента на три облачные RTX 4090 с Ollama: потоки изолированы по видеокартам, система работает стабильно, а на старте это обошлось дешевле команды из 15 модераторов.</li><li>В IBS собрали песочницу для экспериментов с ИИ на GPUStack и vLLM: 11 серверов на A100, RTX 3090 и RTX 4090 обслуживают 14 моделей, и новую гипотезу проверяют за часы.</li></ul><p>Облако рассчитано на тех, кто не боится командной строки: подключаться к серверу по SSH и настраивать окружение придётся самому. Мастера «в один клик» для всего ML-процесса здесь нет.</p><h2>Какие видеокарты есть</h2><p>Всего 13 моделей: H200, H100 NVL, H100, A100, V100, A10, A2, T4, RTX 5090, 4090, 3090, 3080 и 2080 Ti. В один сервер ставят до восьми карт, соединённых NVLink — быстрой шиной, через которую карты обмениваются данными, чтобы большая модель могла работать сразу на нескольких. InfiniBand для связи между серверами — по запросу.</p><p>Серверы стоят в дата-центре уровня Tier III в Москве, и всё оборудование там погружено в диэлектрическую жидкость — это называется иммерсионным охлаждением. Жидкость забирает тепло лучше воздуха, поэтому видеокарты не перегреваются и не сбрасывают частоту даже при круглосуточной нагрузке.</p><h2>Как запустить модель</h2><p>Есть три пути. Первый — публичный эндпоинт. Эндпоинт — это адрес, на который ваша программа отправляет вопрос и получает ответ модели. Проверить модель можно в чате на сайте или по API, ничего не разворачивая. На момент публикации это бесплатно, провайдер готовит переход на оплату за токены.</p><p>Второй — частный эндпоинт: модель разворачивается на арендованном сервере через vLLM. При создании можно указать несколько серверов — на каждом поднимется своя копия модели, а балансировщик раскидает между ними запросы.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-09-30/03f00471-b950-4380-9195-d3f105a2ed0a.webp" alt="" /><figcaption>Рекомендуемые конфигурации в 4-бита с карточки модели GLM-5.2 с возможностью перехода к деплою</figcaption></figure><p>Третий — обычный сервер: больше ста готовых образов в маркетплейсе, включая ComfyUI для генерации картинок. Управлять серверами можно через OpenStack API и Terraform.</p><p>Дообучать модели тоже можно, но своими скриптами на арендованном сервере: готового инструмента для этого нет. Данные хранят в S3, на момент публикации оно бесплатное.</p><h2>Сколько стоит</h2><p>Оплата посекундная, минимальный платёж — 100 ₽. Самый простой сервер с T4 стоит 20,34 ₽ в час, сервер с H200 — 423,04 ₽ в час. За предоплату на 30 или 60 дней дают скидку: на H200 — 10 и 15%, на T4 — 15 и 25%. Месяц H200 с предоплатой обойдётся в 274 129,80 ₽ вместо примерно 304 600 ₽.</p><p>Для новых пользователей есть тестовый период на 30 дней. Юрлица работают по оферте или договору через ЭДО, закрывающие документы приходят 5 числа каждого месяца. НДС провайдер не платит — он освобождён по статье 145.1 НК РФ.</p><h2>Ограничения</h2><ul><li>Трекинга экспериментов, версионирования моделей и датасетов, интеграций с MLflow и Kubeflow нет — полный MLOps-процесс придётся собирать самому.</li><li>Одну модель на 400B+ параметров не получится разнести по нескольким серверам из коробки: потолок — восемь видеокарт в одной машине.</li><li>По умолчанию у нового аккаунта лимит: четыре сервера, 16 vCPU, 128 ГБ памяти и 1600 ГБ хранилища. Расширяют через поддержку.</li><li>В S3 нет версионирования, а скорость около 50 МБ/с и заметно плавает.</li><li>Юрлицам на общей системе налогообложения НДС к вычету принять не получится.</li></ul><h2>Поддержка и документы</h2><p>Поддержка работает круглосуточно: чат на сайте, Telegram, Max, почта и личный менеджер. Заявленное время ответа — не больше пяти минут. Инструкции собраны в FAQ на сайте и на YouTube-канале. У провайдера есть сертификат ГОСТ Р ИСО/МЭК 27001-2021 по защите информации, а за время простоя он обещает компенсацию в полном объёме.</p><p>Сайт:<a href="https://immers.cloud/?utm_source=tproger&amp;utm_medium=rating&amp;utm_campaign=ai-solutions"> immers.cloud</a></p><h2>2. Selectel — гибкие GPU-конфигурации</h2><p>Selectel предлагает GPU как выделенное PCI-устройство внутри виртуальной машины. Можно подобрать CPU, RAM и диски под конкретную задачу, а рядом разместить хранилище, базу данных и другие компоненты приложения.</p><h3>Кейсы клиентов и кому подойдёт</h3><p>В <a href="https://selectel.ru/blog/case-robotmia/">кейсе RobotMIA</a> описана инфраструктура для голосовых роботов с облачными серверами, GPU и объектным хранилищем. Подобный набор подойдёт команде, которая разворачивает речевые модели или компьютерное зрение вместе с прикладным API. Ещё один сценарий — обучение на GPU с последующим переносом модели в контейнерный продакшен.</p><h3>Что можно развернуть</h3><p>На GPU-ВМ можно использовать TensorFlow, PyTorch и другие ML-фреймворки, устанавливать собственное ПО и загружать образ системы. Доступен Kubernetes с GPU для обучения и инференса. Такой вариант удобен, если команда уже поставляет приложения в контейнерах и хочет встроить модели в тот же процесс разработки.</p><h3>Инфраструктура и экосистема</h3><p>На странице продукта перечислены T4, A2, A30, A100, RTX 4090, RTX 6000 Ada и другие карты. Доступность зависит от пула. Управлять ресурсами можно через панель, API и Terraform; рядом доступны S3, IAM, балансировщики и резервное копирование дисков. Selectel заявляет соответствие серверов требованиям 152-ФЗ до УЗ-1: состав услуги и документы следует сопоставить с требованиями конкретной информационной системы.</p><h3>Отзывы и репутация</h3><p>Публичный кейс RobotMIA позволяет оценить применение инфраструктуры в работающем сервисе. Указанные в нём показатели относятся к конкретной архитектуре и не служат обещанием задержки для любой модели. Агрегированная пользовательская оценка на странице GPU-продукта не приведена.</p><h3>Поддержка и каналы связи</h3><p>Для подбора конфигурации на странице указаны sales@selectel.ru и телефон 8 800 555-06-75. Это каналы предварительной консультации; порядок обращения по техническим инцидентам и условия реакции лучше согласовать до запуска. Есть русскоязычная документация по созданию GPU-сервера, оплате, API и Terraform.</p><h3>Тарифы, ограничения и условия</h3><p>Оплата — по потреблению, стоимость выбранной конфигурации уточняется в калькуляторе на сайте. Для проектов аккаунта указаны 3 ТБ бесплатного внешнего трафика; дополнительный трафик — 0,90 ₽/ГБ. Услугой могут пользоваться физические и юридические лица: доступны пополнение картой и выставление счёта.</p><p>При выборе региона сначала проверьте наличие нужной GPU в конкретном пуле. Возможность отключить ускоритель помогает сокращать расходы между задачами, но оставшиеся ресурсы нужно учитывать отдельно. Аренда GPU-ВМ даёт инфраструктуру для ML; настройку окружения, запуск заданий и эксплуатацию модели должна организовать команда.</p><p>Официальный сайт: <a href="https://selectel.ru/services/cloud/servers/gpu/">Selectel — облачные серверы с GPU</a>.</p><h2>3. Cloud.ru — управляемый инференс</h2><p>Cloud.ru предлагает Evolution ML Inference для развёртывания моделей на GPU, в том числе из пользовательских Docker-образов. Это вариант для команды, которой нужно обслуживать запросы к готовой модели с автоматизацией развёртывания и масштабирования.</p><figure><img src="https://media.tproger.ru/user-uploads/133946/2026-09-28/053ed011-30d7-4e92-b0d0-cf7460790f6c.webp" alt="Сервис Cloud.ru Evolution ML Inference" /></figure><h3>Кейсы клиентов и кому подойдёт</h3><p>Разработчик может запустить модель из Hugging Face для текстового помощника; команда генеративной графики — развернуть обработку изображений; ML-инженер — передать собственное окружение в Docker. Это сценарии использования продукта, а не названные клиентские внедрения: на странице ML Inference конкретные заказчики не перечислены.</p><h3>Что можно развернуть</h3><p>Поддерживаются vLLM, TGI, Ollama, Diffusers и Transformers, а также языковые, трансформерные и диффузионные модели. Помимо Hugging Face и маркетплейса, предусмотрен запуск с пользовательским Docker-образом. Сервис описывает динамическое автомасштабирование при изменении числа запросов.</p><h3>Инфраструктура и экосистема</h3><p>Для ML Inference указаны V100 и H100, а также совместное использование GPU несколькими инференсами — Shared GPU. В экосистеме Evolution есть объектное хранилище, Kubernetes, реестр артефактов, мониторинг и логирование. Cloud.ru сообщает о дата-центрах в России; расположение ресурсов конкретного сервиса и доступную сетевую схему нужно проверить при проектировании.</p><h3>Отзывы и репутация</h3><p>На странице ML Inference нет агрегированной пользовательской оценки. При выборе сервиса полезнее проверить совместимость собственного образа, время запуска экземпляра и поведение под всплесками запросов. Известность провайдера не определяет эти характеристики для конкретной модели.</p><h3>Поддержка и каналы связи</h3><p>Стандартная техподдержка работает бесплатно круглосуточно. На <a href="https://cloud.ru/support">странице поддержки</a> перечислены личный кабинет, телефон 8 800 444-24-99, support@cloud.ru и Telegram. Для проектов с дополнительными требованиями есть премиальный тариф по запросу.</p><h3>Тарифы, ограничения и условия</h3><p>Стоимость уточняется на сайте для выбранной конфигурации. При расчёте бюджета учитывайте число одновременно работающих экземпляров и условия Shared GPU: экономия на разделяемом ускорителе должна соответствовать требованиям к задержке. Общие бонусы облака не стоит считать бесплатными GPU-часами без проверки условий конкретного предложения.</p><p>Существенное ограничение для закрытых данных: Private Endpoint на странице ML Inference помечен «скоро будет доступен». Если доступ без публичного интернета обязателен, подтвердите готовность функции до выбора сервиса. ML Inference предназначен для исполнения моделей; обучение и дообучение требуют отдельного решения и расчёта ресурсов.</p><p>Официальный сайт: <a href="https://cloud.ru/products/evolution-ml-inference">Cloud.ru — Evolution ML Inference</a>.</p><h2>4. VK Cloud — инструменты ML-разработки</h2><p>VK Cloud предлагает GPU-ВМ и Cloud ML Platform с преднастроенными JupyterHub и MLflow. Это сочетание вычислительных ресурсов, среды для ноутбуков и инструментов работы с экспериментами.</p><figure><img src="https://media.tproger.ru/user-uploads/133946/2026-09-28/086af229-e9a2-40a6-bb3a-167ffd1c5329.webp" alt="Инструменты Cloud ML Platform в VK Cloud" /></figure><h3>Кейсы клиентов и кому подойдёт</h3><p>Команда дата-сайентистов может использовать платформу для совместной разработки и сравнения экспериментов. Для прикладных сервисов провайдер отдельно описывает инференс небольших языковых моделей, видеоаналитику и получение эмбеддингов для RAG-поиска. На странице GPU эти сценарии приведены без привязки к конкретным клиентам.</p><h3>Что можно развернуть</h3><p>GPU можно использовать для обучения и инференса на виртуальных машинах с Linux или Windows. В Cloud ML Platform доступны преднастроенные JupyterHub и MLflow; GPU-конфигурация подключается к среде разработки. Наличие этих инструментов уменьшает объём начальной настройки, но производственный API и процесс доставки модели всё равно нужно спроектировать.</p><h3>Инфраструктура и экосистема</h3><p>Среди ускорителей перечислены L4, L40S, A30, A100 и V100. Для небольших нагрузок заявлена аренда доли карты через vGPU — от 1/24 до целого ускорителя. Доступные профили и объём видеопамяти необходимо уточнять под модель. Провайдер указывает российские ЦОД уровня Tier III и аттестацию виртуальных серверов по 152-ФЗ до УЗ-1. Рядом доступны объектное хранилище и управляемые базы данных.</p><h3>Отзывы и репутация</h3><p>Агрегированный пользовательский рейтинг на странице Cloud GPU не указан. Для оценки платформы имеет смысл провести небольшой командный эксперимент: проверить доступ к ноутбукам, запись метрик в MLflow и воспроизводимость запуска. Это покажет, насколько готовая среда соответствует процессам вашей команды.</p><h3>Поддержка и каналы связи</h3><p>Технические вопросы можно направлять через <a href="https://support.mcs.mail.ru/login/oauth2/authorization/vkcloud">портал поддержки</a>. При подключении Cloud GPU через заявку назначается менеджер для расчёта конфигурации и коммерческого предложения. Также доступна русскоязычная документация по GPU.</p><h3>Тарифы, ограничения и условия</h3><p>На странице перечислены часовой, месячный и годовой тарифные планы. Минимальное время аренды GPU-ВМ — один час; цена выбранной конфигурации уточняется на сайте или у менеджера. Для подключения предлагается оставить заявку, поэтому сроки выдачи ресурсов лучше согласовать до начала проекта.</p><p>vGPU имеет смысл, когда задача не использует всю карту. Доля ускорителя ограничивает доступные ресурсы, поэтому нельзя выбирать её только по числу параметров модели: важны точность весов, длина контекста и параллельные запросы. Заявленный SLA 99,95% относится к доступности виртуальных машин и не означает такую же гарантию скорости ответов вашей модели.</p><p>Официальный сайт: <a href="https://cloud.vk.com/cloud-gpu/">VK Cloud — Cloud GPU</a>.</p><h2>5. Timeweb Cloud — облако и выделенные</h2><p>Timeweb Cloud предлагает облачные и выделенные серверы с NVIDIA GPU. Провайдера можно рассмотреть для собственного ML-окружения и проектов, которым требуется отдельно подобрать физическую конфигурацию.</p><h3>Кейсы клиентов и кому подойдёт</h3><p>В каталоге историй на странице GPU есть проекты AI-компаний и голосовых роботов. Например, опубликована <a href="https://timeweb.cloud/success-story/agima">история миграции AI-сервиса и клиентских проектов</a>. Для команды разработки практический сценарий — разместить модель рядом с бэкендом, S3 и базой данных. Для длительных вычислений можно отдельно обсудить выделенный сервер.</p><h3>Что можно развернуть</h3><p>На сервер разрешено устанавливать собственное ПО; доступны SSH, KVM-консоль и приложения из маркетплейса. Провайдер относит к GPU-сценариям обучение нейросетей, распознавание речи и изображений, рекомендательные системы и чат-боты. Стек обучения, зависимости и сервер инференса можно собрать под свою модель.</p><h3>Инфраструктура и экосистема</h3><p>В линейке перечислены T4, RTX 3090, RTX 4090 и карты серии A. Обычно провайдер предлагает от одной до четырёх GPU на сервер, большее количество обсуждается отдельно. В облаке есть Kubernetes, S3, базы данных и балансировщики. Наличие Kubernetes как соседнего продукта не следует автоматически считать подтверждением поддержки выбранной GPU-конфигурации в кластере.</p><h3>Отзывы и репутация</h3><p>Опубликованные истории позволяют увидеть работу облака с AI-сервисами и прикладной инфраструктурой. Их результаты относятся к отдельным проектам: кейс миграции сам по себе не подтверждает скорость обучения на GPU. Агрегированная пользовательская оценка на странице продукта не приведена.</p><h3>Поддержка и каналы связи</h3><p>Поддержка заявлена в режиме 24/7/365. На странице доступны чат, Telegram, форма обращения по электронной почте и телефон 8 800 700-32-92. Подбор нестандартной конфигурации и изменение выделенного сервера обсуждаются с командой провайдера.</p><h3>Тарифы, ограничения и условия</h3><p>Для облачных серверов указано почасовое списание, хотя тариф формируется за месяц. Стоимость GPU-конфигурации уточняется на сайте или через заявку. H100 и H200 находятся в разделе предзаказа: для него указан минимальный аванс от 5000 ₽. Это не цена месяца аренды и не подтверждение немедленной выдачи ускорителя.</p><p>У Timeweb Cloud есть российские и зарубежные площадки. Если данные должны оставаться в РФ, зафиксируйте российскую локацию и наличие нужной GPU именно в ней. Для выделенного сервера согласуйте срок подготовки и изменения конфигурации; обещание быстрого запуска облачной ВМ нельзя переносить на индивидуальную поставку оборудования.</p><p>Официальный сайт: <a href="https://timeweb.cloud/services/gpu">Timeweb Cloud — серверы с GPU</a>.</p><h2>Сравнение по ключевым критериям</h2><figure><img src="https://media.tproger.ru/user-uploads/133946/2026-09-28/3fae8618-9c06-40b9-ad0e-bbf0130c3282.webp" alt="Сравнительная таблица сервисов из подборки" /><figcaption>Сравнительная таблица сервисов из подборки</figcaption></figure><ul><li>Самостоятельное окружение: immers.cloud — GPU-серверы и каталог моделей; Selectel — GPU-ВМ и Kubernetes с GPU; Timeweb Cloud — облачные и выделенные серверы с установкой собственного ПО.</li><li>Готовые инструменты: Cloud.ru — управляемый инференс с поддержкой Hugging Face, Docker и автомасштабирования; VK Cloud — Cloud ML Platform с JupyterHub и MLflow; immers.cloud — публичные и частные эндпоинты.</li><li>Оплата: immers.cloud заявляет посекундный учёт, Selectel — оплату по потреблению, Timeweb Cloud — почасовые списания за облачные серверы. У VK Cloud минимальная аренда GPU-ВМ составляет час. Стоимость Cloud.ru нужно рассчитать для выбранной конфигурации инференса.</li><li>Доступность: у Selectel состав GPU зависит от пула; VK Cloud предлагает подключение через заявку; H100 и H200 у Timeweb Cloud указаны как предзаказ. Наличие модели ускорителя в каталоге не гарантирует свободную конфигурацию на нужную дату.</li><li>Ограничения: в immers.cloud потребуется самостоятельная настройка ML-процесса; у Cloud.ru Private Endpoint для ML Inference пока обозначен как будущая функция. Для Timeweb Cloud отдельно выбирайте российскую локацию, если этого требуют условия обработки данных.</li></ul><h2>Что выбрать под вашу задачу</h2><p>Для проверки открытой модели начните с каталога immers.cloud, а для управляемого исполнения с масштабированием изучите Cloud.ru. Если важны командные ноутбуки и трекинг экспериментов, рассмотрите VK Cloud. Для собственного контейнерного стека с GPU подойдёт к рассмотрению Selectel; для выбора между облачной ВМ и отдельным физическим сервером — Timeweb Cloud.</p><p>Перед длительной арендой проведите короткий тест на своих данных. Зафиксируйте используемую видеопамять, время обучения или задержку инференса, пропускную способность и итоговый расход средств. Эти показатели помогут выбрать конфигурацию точнее, чем сравнение названий GPU или стоимости одного часа.</p>]]></content:encoded>
    </item>
    <item>
      <title>Инференс под нагрузкой: как обслуживать модель и честно считать её стоимость</title>
      <link>https://tproger.ru/articles/inferens-pod-nagruzkoj-kak-obsluzhivat-model-i-chestno-schitat</link>
      <comments>https://tproger.ru/articles/inferens-pod-nagruzkoj-kak-obsluzhivat-model-i-chestno-schitat?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Tproger]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/inferens-pod-nagruzkoj-kak-obsluzhivat-model-i-chestno-schitat</guid>
      <description><![CDATA[<p>Куда уходит память видеокарты при инференсе, что дают PagedAttention и непрерывное пакетирование и как посчитать стоимость задачи до запуска. Разбираем с цифрами.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/inferens-pod-nagruzkoj-kak-obsluzhivat-model-i-chestno-schitat">Инференс под нагрузкой: как обслуживать модель и честно считать её стоимость</a>»</p>]]></description>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Высокие нагрузки]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Инфраструктура]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 07 Sep 2026 13:00:15 GMT</pubDate>
      <content:encoded><![CDATA[<p>Прототип агента на одном пользователе работает прекрасно. На пятидесяти одновременных он упирается в память видеокарты, короткие запросы начинают ждать длинных, а счёт за токены растёт быстрее, чем польза от них.</p><p>Обе проблемы решаются на слое, о котором в прототипе не думают вовсе: на слое обслуживания модели. Разбираем, куда уходит память при генерации, какие механизмы возвращают пропускную способность и как посчитать стоимость пакетной задачи до того, как сделан первый запрос.</p><p>Инференс — это применение уже обученной модели: веса зафиксированы, и модель предсказывает вывод по одному токену за раз. Учиться она перестала, но дешёвой от этого не стала: длинные запросы дороже в обработке, длинные ответы дороже в генерации, а множество одновременных запросов давит и на планировщик, и на память.</p><p>Генерация делится на две фазы с разной природой: разбор запроса грузит вычисления и хорошо распараллеливается, а генерация ответа последовательна и упирается в число шагов.</p><p>Главный потребитель памяти видеокарты — это кеш ключей и значений: для типовой конфигурации выходит около 128 КБ на каждый токен, и именно он ограничивает число одновременных запросов.</p><p>Один запрос пользователя к агенту превращается в десять, двадцать и больше обращений к модели, поэтому нагрузка получается неравномерной по памяти и по длительности.</p><p>Непрерывное пакетирование не даёт коротким запросам ждать длинных, а кеширование общего префикса убирает повторную обработку одного и того же системного промпта.</p><p>Расход токенов не является метрикой продуктивности: у неё тот же изъян, что у подсчёта строк кода, потому что она вознаграждает объём, а не результат.</p><h2>Две фазы инференса, которые дорожают по-разному</h2><p>Обслуживающая система делает две вещи: координирует запросы на стороне процессора и исполняет модель на ускорителе. Само исполнение <a href="https://www.freecodecamp.org/news/how-to-scale-llm-inference-for-ai-agents-using-vllm/">распадается на две фазы</a>, и путать их не стоит, потому что дорожают они от разных причин.</p><p><b>Разбор запроса</b> (в англоязычной документации prefill). Модель обрабатывает все токены входного промпта. Их можно считать параллельно, поэтому фаза упирается в вычислительную мощность. Длинный промпт с историей диалога, найденными документами и описаниями инструментов увеличивает задержку до первого символа ответа.</p><p><b>Генерация</b> (decode). Модель выдаёт по одному токену за раз, и каждый следующий зависит от предыдущих, поэтому распараллелить эту фазу нельзя. Длинный ответ означает много отдельных шагов исполнения модели.</p><p>Отсюда три коротких правила: длинные входы удорожают разбор, длинные ответы удорожают генерацию, а рост числа одновременных запросов давит одновременно на планирование и на память.</p><h2>KV-кеш: где на самом деле кончается память</h2><p>Внутри трансформера механизм внимания строит для каждого обработанного токена представления ключей и значений. Чтобы не пересчитывать их заново на каждом шаге генерации, модель хранит их в памяти. Это и есть кеш ключей и значений, без которого авторегрессивная генерация была бы непрактичной.</p><p>Платить за него приходится памятью видеокарты, и объём считается напрямую:</p><p>Для модели с 32 слоями, 8 KV-головами, размерностью головы 128 и половинной точностью получается примерно 128 КБ на один токен. У других моделей цифра будет своя, но зависимость одна: чем длиннее контекст, тем больше памяти занято. Именно поэтому длинные промпты, долгие диалоги и подтянутые из поиска документы делают инференс заметно дороже, а свободный объём этого кеша прямо определяет, сколько запросов сервер потянет одновременно.</p><h3>Почему агентская нагрузка тяжелее обычной</h3><p>Агент усиливает все перечисленные проблемы, потому что один запрос пользователя порождает множество обращений к модели: спланировать следующее действие, выбрать инструмент, разобрать его результат, свернуть найденное, восстановиться после ошибки, решить, нужна ли ещё работа, и наконец собрать ответ.</p><p>Одно взаимодействие легко превращается в десять или двадцать вызовов, а при сотне активных пользователей счёт идёт на тысячи. Вдобавок запросы неравноценны: в одном короткий вопрос, в другом длинный системный промпт с историей, документами и результатами инструментов. Получается динамическая нагрузка, где запросы приходят в разное время, занимают разный объём памяти и завершаются вразнобой.</p><h2>Четыре механизма, которые возвращают пропускную способность</h2><p>Именно на такую нагрузку рассчитаны специализированные движки обслуживания вроде <a href="https://docs.vllm.ai/">vLLM</a>. Вместо загрузки модели прямо в приложение и вызова метода генерации приложение обращается к серверу по HTTP, и логика агента отделяется от инфраструктуры под ней.</p><h3>Страничное внимание, оно же PagedAttention</h3><p>В наивной системе кеш каждой последовательности занимает один непрерывный участок памяти. Поскольку длины непредсказуемы, участки резервируются с запасом, и память утекает во фрагментацию. Страничная организация хранит кеш блоками фиксированного размера, которые выделяются по мере надобности и не обязаны лежать рядом. Завершился запрос — его блоки вернулись в общий пул и достались другому.</p><h3>Непрерывное пакетирование</h3><p>Обычное пакетирование работает раундами: сервер собирает группу запросов и держит её состав неизменным, пока цикл не отработает. Для генерации текста это плохо, потому что запросы заканчиваются в разное время.</p><p>Представьте: запросу A нужно сто токенов ответа, запросу B двадцать, а запрос C приходит, пока A ещё считается. При фиксированном пакетировании B освободится рано, но его место будет простаивать, а C дождётся конца всего цикла. Непрерывное пакетирование добавляет C в ближайший же шаг генерации, как только освободилось место. Ускоритель остаётся занят полезной работой.</p><h3>Кеширование общего префикса</h3><p>Агенты раз за разом отправляют один и тот же системный промпт, те же описания инструментов и ту же преамбулу рабочего процесса. Без кеширования этот префикс обрабатывается заново при каждом запросе:</p><p>С кешированием общая часть считается один раз и переиспользуется. Важное ограничение: выигрыш приходится только на фазу разбора запроса, генерацию новых токенов приём не ускоряет. Поэтому эффект тем заметнее, чем длиннее общий префикс.</p><p><b>Что здесь на самом деле новое:</b><br />Обычное кеширование ключей и значений есть в любой современной реализации авторегрессивной генерации, это не отличительная черта конкретного движка. Преимущество специализированных серверов в другом: в том, как они планируют запросы и как выделяют, переиспользуют и освобождают память кеша между конкурирующими нагрузками.</p><h3>Совместимый интерфейс</h3><p>Четвёртый пункт скучный, но на практике решающий: сервер выставляет интерфейс, совместимый с OpenAI. Существующие приложения и агентские фреймворки переключаются на него правкой конфигурации, а не переписыванием кода.</p><h2>Когда всё это действительно нужно</h2><p>Специализированный сервер инференса оправдан, когда вы держите модели с открытыми весами у себя и обслуживаете конкурентную нагрузку. Для одиночного прототипа на одного пользователя он избыточен: там хватит <a href="https://tproger.ru/articles/zapuskaem-llm-lokalno-cherez-ollama-gajd-ot-ustanovki-do-claude">локального запуска модели</a>, и вся описанная механика памяти просто не проявится.</p><p>Переломный момент наступает, когда прототип начинает принимать параллельный трафик, а агент проводит большую часть времени в ожидании модели. Тогда дешевле улучшить слой обслуживания под ним, чем переписывать логику самого агента.</p><h2>Вторая половина задачи: считать деньги до запуска</h2><p>Инфраструктура решает вопрос скорости. Вопрос стоимости она не решает, а иногда и обостряет, потому что удобная система располагает к длинным контекстам.</p><p>Дальше речь пойдёт и о тех, кто ходит в модель по чужому тарифу. Своя инфраструктура переводит счёт из токенов в часы работы видеокарт, но сама задача остаётся той же: понять цену задачи до запуска, а не после. Разница только в единице, в которой её считают.</p><h3>Реестр токенов вместо пробного запуска</h3><p>Пакетные задачи ломаются неприятным образом: счётчик прыгает по завершении, а не до старта; повтор удваивает расход без всякой обратной связи; системные промпты, длинные ответы и служебная разметка тоже считаются. <a href="https://dev.to/magickong/learn-to-budget-a-free-model-tier-by-building-a-tiny-token-ledger-3dde">Крошечный офлайновый реестр</a> превращает всё это в проверку до первого обращения к модели.</p><p>Оценка строится на грубой эвристике: для английского текста один токен занимает примерно четыре символа. Точность здесь и не нужна, задача — понять порядок величины:</p><p>Проверим на задаче из 6000 сводок, где промпт занимает около 21 000 символов, а ответ ограничен 500. Выходит 5250 токенов на промпт плюс 125 на ответ, то есть 5375 на вызов, а на всю задачу 32 250 000 токенов при лимите в 30 000 000. Задача не помещается с запасом минус 7,5%, и узнать это удалось, не потратив ни одного токена.</p><p>Соседняя задача с промптом в 4000 символов, тем же ограничением ответа в 500 символов и 10 000 вызовов даёт 1125 токенов на вызов и 11 250 000 на всё, помещаясь с запасом в 62,5%. Живая пробная отправка ни того, ни другого не покажет: она расскажет о поведении конкретной ручки прямо сейчас, но не о сумме по всей пачке, и вдобавок сама потратит токены.</p><h3>Почему расход токенов нельзя делать метрикой продуктивности</h3><p>Тут стоит остановиться отдельно, потому что соблазн велик. Расход токенов удобно считается и потому легко попадает в отчёты, но <a href="https://devops.com/why-tokenmaxxing-was-always-the-wrong-way-for-developers-to-measure-ai-productivity/">как метрика продуктивности он повторяет ошибку подсчёта строк кода</a>.</p><p>Возьмите двух разработчиков с одинаковой задачей и одним инструментом. Первый пишет размытые промпты, позволяет контексту разрастаться в длинной переписке и заставляет модель раз за разом восстанавливать одну и ту же вводную. Второй решает ту же задачу коротким настроенным сценарием. По расходу токенов первый выглядит продуктивнее, хотя на деле он просто шумнее.</p><p>Само по себе потребление токенов отвечает на вопрос, пользуется ли человек инструментом вообще. На раннем этапе внедрения этот сигнал полезен. Но он ничего не говорит о том, получилось ли в итоге что-то осмысленное, а «много ИИ» и «хорошо с ИИ» — разные вещи.</p><h3>Стоимость на результат</h3><p>Правильная постановка вопроса одна: что мы получили за то, что потратили. Оплата по токенам — совершенно разумная коммерческая модель со стороны поставщика вычислений. Ошибка возникает на стороне покупателя, когда единица биллинга поставщика переезжает во внутреннюю систему оценки работы.</p><p>Связь между расходом и результатом реальна, но не универсальна. Более способные модели действительно тратят больше токенов и на сложных задачах дают заметно лучший результат: расширенные рассуждения и многошаговые попытки стоят токенов и окупаются. При этом один и тот же расход при разных конфигурациях и стратегиях промптинга даёт совершенно разные результаты, а неудачная обвязка и небрежная работа с контекстом жгут токены без всякой отдачи.</p><p>Практический вывод: считайте отношение результата к затратам, а не сам объём. Для команды безопасности это стоимость одной подтверждённой находки, для продуктовой команды — доля задач, доведённых до готовой и проверенной функциональности.</p><h3>Слишком жёсткая квота выталкивает работу за периметр</h3><p>Обратная крайность встречается не реже. Когда организация выставляет квоты слишком консервативно, инженеры, которые видят реальную пользу от инструмента, упираются в искусственный потолок и начинают пользоваться личными аккаунтами и бесплатными тарифами.</p><p>Это рациональное поведение человека, которому нужно сдать работу. Но результат предсказуем: использование уходит из контролируемого контура, а вместе с ним пропадают наблюдаемость, возможность аудита и любая уверенность в том, что результат соответствует требованиям к качеству и безопасности. Осмысленная квота с измерением отдачи здесь работает лучше, чем экономная квота без измерений.</p><h2>Что забрать с собой</h2><p>Слой обслуживания модели, то есть инференса, становится узким местом раньше, чем логика приложения, и лечится он не переписыванием агента, а работой с памятью и планированием запросов. Кеш ключей и значений задаёт потолок конкурентности, страничная организация возвращает потерянную на фрагментации память, непрерывное пакетирование убирает простой, а кеширование префикса снимает повторную обработку одинаковых преамбул.</p><p>Со стоимостью работает та же логика: считать нужно до запуска и в единицах результата, а не расхода. Офлайновый расчёт пакета занимает двадцать строк и ловит ошибку формы задачи раньше, чем она превратится в исчерпанный лимит посреди ночного прогона.</p><p>Материалы разбора: <a href="https://www.freecodecamp.org/news/how-to-scale-llm-inference-for-ai-agents-using-vllm/">устройство обслуживания моделей под агентские нагрузки</a>, <a href="https://devops.com/why-tokenmaxxing-was-always-the-wrong-way-for-developers-to-measure-ai-productivity/">почему расход токенов не метрика продуктивности</a> и <a href="https://dev.to/magickong/learn-to-budget-a-free-model-tier-by-building-a-tiny-token-ledger-3dde">офлайновый расчёт бюджета пакетной задачи</a>.</p><p>Посчитайте свой самый крупный пакетный прогон по эвристике четырёх символов на токен и сравните с остатком лимита. Если не сходится, вы только что сэкономили ночь и деньги.</p>]]></content:encoded>
    </item>
    <item>
      <title>GPU-серверы для LLM-инференса: 5 решений, на чём запустить локально в 2026 году</title>
      <link>https://tproger.ru/digest/gpu-servery-dlya-llm-inferensa-5-rewenij-na-chyom-zapustit-lokal</link>
      <comments>https://tproger.ru/digest/gpu-servery-dlya-llm-inferensa-5-rewenij-na-chyom-zapustit-lokal?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Евгений Стребков]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/digest/gpu-servery-dlya-llm-inferensa-5-rewenij-na-chyom-zapustit-lokal</guid>
      <description><![CDATA[<p>Сравнили 5 GPU-платформ для запуска открытых LLM в России: immers.cloud, Cloud4Y, VK Cloud, HOSTKEY и AdminVPS. Разбираем конфигурации, цены и удобство для разработчиков.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/digest/gpu-servery-dlya-llm-inferensa-5-rewenij-na-chyom-zapustit-lokal">GPU-серверы для LLM-инференса: 5 решений, на чём запустить локально в 2026 году</a>»</p>]]></description>
      <category><![CDATA[Сервер]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Подборки]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 26 Aug 2026 06:59:58 GMT</pubDate>
      <content:encoded><![CDATA[<p>Если вы хотите запускать открытые языковые модели на своей инфраструктуре в России, аренда GPU-сервера зачастую удобнее и дешевле покупки железа. Собрали пять платформ, на которых можно развернуть vLLM, дообучить модель или организовать приватный API для команды — от каталога готовых моделей до корпоративных облаков с сертификациями.</p><p><b>immers.cloud</b> — каталог open-source моделей с автоподбором конфигураций: публичные эндпоинты для теста, приватные — с оплатой за время работы сервера.</p><p><b>Cloud4Y</b> — корпоративный облачный провайдер с LLM-платформой, широким выбором GPU от V100 до B300 и сертификациями под регуляторов.</p><p><b>VK Cloud</b> — облачные GPU как дополнение к виртуальным машинам, Kubernetes и Bare Metal; удобно для инференса в managed-контурах.</p><p><b>HOSTKEY</b> — аренда выделенных и виртуальных GPU-серверов с почасовой оплатой, GPU passthrough и кластерами H100/H200.</p><p><b>AdminVPS</b> — VPS и выделенные серверы с GPU, где в стоимость включено бесплатное администрирование и панель ISPmanager.</p><h2>Как мы выбирали</h2><p>В подборку вошли российские и доступные из России платформы с реальным парком GPU NVIDIA, поддержкой инференса LLM и понятной оплатой в рублях. Исключили провайдеры, которые по условиям задачи не подходят: Selectel, Timeweb Cloud и Cloud.ru. Оценивали по четырём критериям: доступные GPU и VRAM, удобство запуска моделей, форматы аренды и поддержка.</p><ul><li>GPU и память: наличие карт от RTX 4090 до H200/A100 для разных размеров моделей.</li><li>Запуск LLM: готовые образы, каталоги моделей, поддержка vLLM, Docker или Kubernetes.</li><li>Форматы аренды: виртуальные машины, bare metal, GPU passthrough, почасовая или посекундная тарификация.</li><li>Локальные ограничения: оплата в рублях, дата-центры в РФ, соответствие 152-ФЗ, русскоязычная поддержка.</li></ul><h2>1. immers.cloud — каталог моделей</h2><p>immers.cloud — российская облачная платформа аренды GPU с посекундной тарификацией и готовыми образами. Для LLM-инференса на ней есть отдельный продукт, Foundation Models: каталог из более чем 200 открытых моделей, по заявлению провайдера крупнейший в России. Платформа сама подбирает конфигурацию сервера под нужный объём VRAM и показывает стоимость.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-08-25/43b611b6-2973-458a-b917-d33f946fcbb5.webp" alt="" /><figcaption>Каталог моделей immers.cloud</figcaption></figure><h3>Кейсы клиентов и кому подойдёт</h3><ul><li>Команда «КС Авто» вынесла круглосуточную модерацию контента на три облачных RTX 4090 с Ollama: потоки изолированы по видеокартам, контур работает стабильно, а на старте это обошлось дешевле команды из 15 модераторов.</li><li>В IBS на GPUStack и vLLM собрали R&amp;D-песочницу: одиннадцать инстансов на A100 и RTX 3090/4090 обслуживают 14 моделей.</li><li>Подойдёт тем, кому нужен приватный API внутри России и кто готов настроить окружение сам: мастера в один клик здесь нет.</li></ul><h3>Что можно развернуть</h3><ul><li>Публичные эндпоинты с OpenAI-совместимым API — доступ по ключу сразу после регистрации, запрос из веб-чата или по API.</li><li>Приватные эндпоинты на vLLM и SGLang: платят за время работы сервера, а не за токены; поддерживаются GPTQ, AWQ, FP8 и INT4/INT8, GGUF — нет.</li><li>Более ста готовых образов из маркетплейса, свои Docker-контейнеры и любые версии inference-движков.</li></ul><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-08-25/27fb0b6e-25d2-4419-a4c4-4c092389eda4.webp" alt="" /><figcaption>Публичный эндпоинт и запрос на Python</figcaption></figure><h3>Инфраструктура и экосистема</h3><ul><li>Собственный ЦОД Tier III в Москве с иммерсионным охлаждением — по заявлению провайдера, первый такой в России.</li><li>Тринадцать моделей GPU NVIDIA: H200, H100 NVL и H100, A100, V100, RTX 5090, 4090, 3090, 3080 и 2080 Ti, A10, A2 и T4.</li><li>До восьми GPU в инстансе, GPUDirect и NVLink; NVSwitch и InfiniBand — на выделенных серверах.</li><li>Локальные NVMe до 1 500 000 IOPS, S3-хранилище, снапшоты по 2 ₽ за ГБ в месяц, сети до 20 Гбит/с, OpenStack API.</li></ul><h3>Отзывы и репутация</h3><p>Платформа неоднократно упоминалась в рейтинге CNews и редакционных материалах tproger.ru и Habr в контексте запуска каталога Foundation Models и тестирования новых open-source моделей. Публичных агрегированных рейтингов на независимых площадках мы не нашли.</p><h3>Поддержка и каналы связи</h3><ul><li>Онлайн-чат на сайте и Telegram.</li><li>Специализированная поддержка по нейросетям: nn@immers.cloud.</li><li>Отдел продаж: sale@immers.cloud.</li><li>База знаний, FAQ и видеогайды на YouTube, VK и Rutube.</li></ul><h3>Тарифы, ограничения и условия</h3><ul><li>Посекундная тарификация без минимального срока, платёж от 100 ₽; свыше 300 конфигураций в прайсе и скидки за долгую аренду.</li></ul><ul><li>На момент публикации публичные эндпоинты бесплатны — провайдер готовит переход на оплату за токены. Приватные эндпоинты и серверы тарифицируются посекундно, за время работы, независимо от числа сгенерированных токенов. Тестовый доступ выдают индивидуально по запросу до 30 дней.</li></ul><ul><li>Юрлицам — оферта или договор с ЭДО, УПД и акты 5 числа месяца.</li></ul><p>Ограничения: мультиузловых кластеров из коробки нет — модель не разносится между серверами, для архитектур от 400B нужна своя оркестрация. Формального SLA с компенсациями нет. Занятую конфигурацию придётся ждать.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-08-25/68de528f-1574-4453-9348-5d6345eeb132.webp" alt="" /><figcaption>Таблица конфигураций с ценами</figcaption></figure><p>Официальный сайт: <a href="https://immers.cloud/ai/model/">immers.cloud/ai/model</a></p><h2>2. Cloud4Y — корпоративный выбор</h2><p>Cloud4Y — российский облачный провайдер с собственной географически распределённой инфраструктурой. Для LLM предлагает отдельную LLM-платформу и GPU-облако с широким выбором ускорителей.</p><h3>Кейсы клиентов и кому подойдёт</h3><ul><li>Компаниям, которым нужно дообучать и хостить LLaMA, Mistral, GPT-подобные модели на сертифицированной инфраструктуре.</li><li>Корпоративным заказчикам с требованиями к 152-ФЗ, ФЗ-187, PCI DSS и сертификатам ФСТЭК/ФСБ.</li><li>Командам, которым нужны как бюджетные GPU для экспериментов, так и H200/B300 для production.</li></ul><h3>Что можно развернуть</h3><ul><li>Виртуальные машины и выделенные серверы с GPU NVIDIA.</li><li>LLM-платформу для запуска, дообучения и масштабирования LLM на собственной инфраструктуре.</li><li>DSVM-образы с предустановленным PyTorch, TensorFlow, Keras, XGBoost, CUDA, OpenCV и Jupyter Notebooks.</li><li>vGPU/RDSH-конфигурации для виртуальных рабочих мест и рендер-ферм.</li></ul><h3>Инфраструктура и экосистема</h3><ul><li>4 дата-центра уровня Tier III в России и за рубежом (Москва, Новосибирск, Германия, Нидерланды, Турция).</li><li>GPU от NVIDIA Tesla V100 до B300 и RTX 6000 Blackwell, включая RTX 4090/5090 и A6000 Ada.</li><li>SLA до 99,99%, оптическое кольцо, MetroCluster, бэкапы в geo-удалённый ЦОД (14 точек восстановления).</li><li>Сертификации: ФЗ-152, ФЗ-187, PCI DSS, CSA STAR, ISO/IEC 27001, ФСТЭК, ФСБ.</li></ul><h3>Отзывы и репутация</h3><p>Провайдер работает с 2009 года, по данным компании — более 2000 организаций-клиентов. По итогам 2024 года Cloud4Y стала лидером рейтинга TAdviser по числу завершённых IaaS-внедрений, весной 2026 получила бронзу рейтинга российских GPU-провайдеров от «Компьютерры». На сайте публикуются кейсы «Киномакс», «Сатурн-Юг», Фонда содействия реформированию ЖКХ и других.</p><h3>Поддержка и каналы связи</h3><ul><li>Телефон: +7 495 268-04-12.</li><li>Email: support@cloud4y.ru.</li><li>Техподдержка обещает ответ в течение 10 минут.</li><li>Онлайн-чат, тикет-система, блог и база знаний.</li></ul><h3>Тарифы, ограничения и условия</h3><ul><li>Почасовая и помесячная тарификация, pay-as-you-go.</li><li>По данным сайта, RTX 4090 — от ~66 ₽/час, H100 80 ГБ — от ~686 ₽/час (без НДС, цены могли измениться).</li><li>Бесплатная миграция инфраструктуры и тестовый период LLM-платформы до 10 дней.</li><li>Без обращения в поддержку можно менять ресурсы ВМ.</li></ul><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-08-25/182a3aa4-9da6-4499-b23d-7742ae151f8a.webp" alt="" /><figcaption>Публичный прайс Cloud4Y: от 66 ₽ в час за RTX 4090 до 1 123 ₽ за B200</figcaption></figure><p>Официальный сайт: <a href="https://www.cloud4y.ru/cloud-hosting/gpu/">cloud4y.ru/cloud-hosting/gpu</a></p><h2>3. VK Cloud — managed Kubernetes</h2><p>VK Cloud предлагает облачные GPU как дополнительную опцию к виртуальным машинам, Kubernetes, Bare Metal и VDI. Это удобный вариант, если вы уже работаете в экосистеме VK Cloud или хотите развернуть инференс в managed-контуре.</p><h3>Кейсы клиентов и кому подойдёт</h3><ul><li>Командам, которые используют Cloud Containers (managed Kubernetes) и хотят добавить GPU-ноды.</li><li>Разработчикам AI-агентов и RAG-ассистентов, которым нужны базы данных, брокеры сообщений и object storage рядом с GPU.</li><li>Компаниям, которым важна OpenStack-совместимость и Terraform-провайдер.</li></ul><h3>Что можно развернуть</h3><ul><li>Виртуальные машины Cloud Servers с подключёнными GPU NVIDIA.</li><li>Cloud Containers — managed Kubernetes с GPU-нодами для размещения vLLM или SGLang.</li><li>Bare Metal GPU для обучения крупных моделей с Infiniband до 400 Гбит/с.</li><li>Управляемые PostgreSQL, Redis, OpenSearch и Container Registry для полного AI-контура.</li></ul><h3>Инфраструктура и экосистема</h3><ul><li>GPU NVIDIA: L4 24 ГБ, L40S 48 ГБ, A30 24 ГБ, A100 40/80 ГБ, V100/V100S, H200 141 ГБ.</li><li>Готовые шаблоны конфигураций с фиксированным числом vCPU, RAM и GPU.</li><li>Дата-центры в России, соответствие 152-ФЗ, аттестаты ФСТЭК, PCI DSS.</li><li>vGPU для экономии на инференсе небольших моделей.</li></ul><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-08-25/514ab8ce-a59b-47ca-a460-b0108039f927.webp" alt="" /><figcaption>Шаблоны конфигураций Cloud GPU в VK Cloud: модель карты и число ускорителей зашиты в название флейвора</figcaption></figure><h3>Отзывы и репутация</h3><p>VK Cloud — крупный российский облачный провайдер, часть экосистемы VK. Kubernetes-сервис имеет CNCF-сертификацию. Публичных агрегированных рейтингов самого сервиса Cloud GPU на независимых площадках мы не нашли.</p><h3>Поддержка и каналы связи</h3><ul><li>Личный кабинет и документация cloud.vk.ru/docs.</li><li>Техническая поддержка через тикеты.</li><li>Блог с инструкциями по GPU и ML.</li></ul><h3>Тарифы, ограничения и условия</h3><ul><li>Оплата по фактическому использованию; точные цены уточняются в калькуляторе.</li><li>По данным прайс-листа, H200 с 44 vCPU и 256 ГБ RAM — от ~18 ₽/мин за 1 GPU (~793 000 ₽/мес) (актуальность цен проверяйте на сайте).</li><li>Минимальный срок аренды и SLA зависят от конфигурации.</li><li>Доступны российские операционные системы.</li></ul><p>Официальный сайт: <a href="https://cloud.vk.ru/cloud-gpu/">cloud.vk.ru/cloud-gpu</a></p><h2>4. HOSTKEY — широкий выбор GPU</h2><p>HOSTKEY специализируется на аренде выделенных и виртуальных GPU-серверов. Платформа подходит как для экспериментов с RTX 4090, так и для кластеров H100/H200 под обучение больших моделей.</p><h3>Кейсы клиентов и кому подойдёт</h3><ul><li>ML-инженерам, которым нужен bare metal или VPS с GPU passthrough без деления ресурсов.</li><li>Компаниям, которым важны локации за пределами России (Европа, США, Турция).</li><li>Командам, которым нужна почасовая оплата для R&amp;D и бенчмарков.</li></ul><h3>Что можно развернуть</h3><ul><li>Bare metal серверы и VPS с выделенной GPU-картой через passthrough.</li><li>Предустановленные фреймворки: TensorFlow, PyTorch, Caffe, Caffe2.</li><li>Docker, Kubernetes, NVIDIA Container Toolkit, Jupyter, Ollama из маркетплейса.</li><li>GPU-кластеры с NVLink/Infiniband для распределённого обучения.</li></ul><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-08-25/843a89f1-7110-4ee1-8282-572968974131.webp" alt="" /><figcaption>Маркетплейс HOSTKEY: модели разворачиваются на сервере без ручной настройки</figcaption></figure><h3>Инфраструктура и экосистема</h3><ul><li>GPU NVIDIA: H100, H200, A100, RTX 5090, RTX 6000 PRO 96 ГБ, RTX 4090/3090, AMD Radeon AI PRO R9700.</li><li>Процессоры AMD EPYC и Intel Xeon Scalable, DDR5 ECC, NVMe SSD.</li><li>Дата-центры Tier III в России (Москва), Нидерландах, Финляндии, Германии, Исландии, Франции, США, Турции.</li><li>IPMI/iDRAC, базовая DDoS-защита, безлимитный порт 1 Гбит/с, 10 Гбит/с по запросу.</li></ul><h3>Отзывы и репутация</h3><p>HOSTKEY давно работает на рынке хостинга и GPU-серверов. На сайте размещены отзывы от «Ай-Кью Хостинг», «ГРАН ЛИМИТЕД», Crytek, «Пульт.ру», МФТИ и других компаний. Публичных агрегированных рейтингов GPU-сервиса в независимых источниках не указано.</p><h3>Поддержка и каналы связи</h3><ul><li>Круглосуточная техподдержка, время ответа — до 15 минут.</li><li>Поддержка на русском и английском языках.</li><li>Маркетплейс приложений и база знаний.</li></ul><h3>Тарифы, ограничения и условия</h3><ul><li>Почасовая и помесячная оплата, скидки до 25% при долгосрочной аренде.</li><li>По данным сайта, VPS с RTX 4090 — от 15 000–25 000 ₽/мес, готовые серверы — от 16 000 ₽/мес, индивидуальные сборки — от 26 000 ₽/мес.</li><li>Тестовые серверы предоставляются только компаниям с корпоративным email.</li><li>Бесплатные GPU-серверы для научных проектов и соревнований по data science.</li></ul><p>Официальный сайт: <a href="https://hostkey.ru/gpu-dedicated-servers/">hostkey.ru/gpu-dedicated-servers</a></p><h2>5. AdminVPS — администрирование включено</h2><p>AdminVPS — российский хостинг-провайдер, который предлагает VPS/VDS и выделенные серверы с GPU. Ключевое отличие — бесплатное администрирование и включённая панель ISPmanager, что снижает порог входа для команд без выделенного DevOps.</p><h3>Кейсы клиентов и кому подойдёт</h3><ul><li>Малому и среднему бизнесу, которому нужен GPU-сервер, но нет ресурсов на самостоятельное администрирование.</li><li>Командам, которым важна панель управления и поддержка «под ключ».</li><li>Проектам с требованиями к защите данных: 152-ФЗ, GDPR.</li></ul><h3>Что можно развернуть</h3><ul><li>VPS и выделенные серверы с GPU NVIDIA: RTX A4000, A5000, A6000, H100, A100, RTX 4090/3090/3080.</li><li>Фреймворки TensorFlow, PyTorch, Caffe, Caffe2.</li><li>Кастомные конфигурации под проект, объединение карт по NVLink.</li><li>Контейнеры и произвольное ПО на основе Linux-образов.</li></ul><h3>Инфраструктура и экосистема</h3><ul><li>Дата-центры Tier III Plus в России, а также Нидерланды, Германия, Финляндия, Исландия, Беларусь, Казахстан, Польша.</li><li>KVM-виртуализация, NVMe SSD, защита от DDoS L2–L4 по умолчанию.</li><li>Панель ISPmanager включена в стоимость при выборе опции администрирования «Все включено».</li><li>Регистрация доменов в 760+ зонах, SSL, мониторинг, резервное копирование.</li></ul><h3>Отзывы и репутация</h3><p>Провайдер работает с 2012 года, по данным обзорных площадок — около 21 000 клиентов. Отзывы в профильных рейтингах отмечают высокий аптайм и оперативную поддержку. Публичных кейсов GPU-клиентов на сайте не указано.</p><h3>Поддержка и каналы связи</h3><ul><li>Круглосуточная техническая поддержка 24/7.</li><li>Бесплатное администрирование серверов.</li><li>Online-консультант на сайте, тикет-система в панели управления.</li><li>Телефон: +7 (495) 155-25-31.</li></ul><h3>Тарифы, ограничения и условия</h3><ul><li>GPU-VPS — от ~7 750 ₽/мес (по данным партнёрских обзоров); точные цены — в конфигураторе.</li><li>Трафик на скорости 1 Гбит/с.</li><li>Тестовый период 7 дней для виртуальных серверов в российских ЦОД.</li><li>MoneyBack: возврат средств за неиспользованные дни и 5-кратная компенсация простоев.</li></ul><p>Официальный сайт: <a href="https://adminvps.ru/vps/vps_gpu.php">adminvps.ru/vps/vps_gpu.php</a></p><h2>Сравнение по ключевым критериям</h2><figure><img src="https://media.tproger.ru/user-uploads/133946/2026-08-20/33f11c4b-7975-4d56-9765-adc847def2ef.webp" alt="Сравнительная таблица сервисов из подборки" /><figcaption>Сравнение GPU-платформ для LLM-инференса</figcaption></figure><p><b>GPU и память.</b> immers.cloud и HOSTKEY предлагают самый широкий выбор карт — от RTX 4090 до H200. Cloud4Y добавляет флагманские B200/B300 и RTX 6000 Blackwell. VK Cloud фокусируется на серверных ускорителях Tesla с готовыми шаблонами. AdminVPS закрывает задачи среднего сегмента на A4000–A6000 и RTX 4090.</p><p><b>Удобство для LLM.</b> immers.cloud выделяется каталогом моделей и готовыми эндпоинтами. Cloud4Y предлагает LLM-платформу и DSVM. VK Cloud интегрирует GPU в Kubernetes и Bare Metal. HOSTKEY даёт максимальную свободу конфигурации, а AdminVPS — поддержку и администрирование.</p><p><b>Тарификация.</b> У immers.cloud две модели: публичные эндпоинты по токенам, серверы и приватные эндпоинты — посекундно, что выгодно для коротких экспериментов. Cloud4Y, VK Cloud и HOSTKEY поддерживают почасовую оплату. AdminVPS ориентирован в первую очередь на помесячную аренду.</p><p><b>География и соответствие.</b> Все пять провайдеров имеют дата-центры в РФ и работают с российскими документами. Cloud4Y, VK Cloud и AdminVPS акцентируют сертификации; HOSTKEY — широчайший выбор зарубежных локаций.</p><h2>Выводы</h2><p>Для запуска открытых LLM в России в 2026 году есть несколько рабочих сценариев. Если важнее всего быстро протестировать модель и получить приватный API — удобен immers.cloud с каталогом Foundation Models. Для корпоративных проектов с требованиями к сертификациям лучше смотреть на Cloud4Y. Тем, кто уже живёт в экосистеме VK Cloud, подойдёт Cloud GPU в связке с Kubernetes. Если нужен bare metal или VPS с GPU passthrough и широкая география — HOSTKEY. А командам без собственного DevOps стоит присмотреться к AdminVPS с включённым администрированием.</p><p>Перед заказом сверьте актуальные цены в конфигураторах: GPU-рынок меняется быстро, и цены на H100/H200 могут существенно отличаться от указанных ориентиров.</p>]]></content:encoded>
    </item>
    <item>
      <title>Cloud.ru запустила Evolution Stack.ML для обучения ИИ-моделей в гибридном облаке</title>
      <link>https://tproger.ru/news/cloud-ru-zapustila-evolution-stack-ml-dlya-obucheniya-ii-modelej-v</link>
      <comments>https://tproger.ru/news/cloud-ru-zapustila-evolution-stack-ml-dlya-obucheniya-ii-modelej-v?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Евгений Стребков]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/cloud-ru-zapustila-evolution-stack-ml-dlya-obucheniya-ii-modelej-v</guid>
      <description><![CDATA[<p>Cloud.ru вывела в коммерческую эксплуатацию платформу Evolution Stack.ML для обучения ИИ-моделей. Для кого решение и какие цифры приводит компания.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/cloud-ru-zapustila-evolution-stack-ml-dlya-obucheniya-ii-modelej-v">Cloud.ru запустила Evolution Stack.ML для обучения ИИ-моделей в гибридном облаке</a>»</p>]]></description>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Облачные технологии]]></category>
      <category><![CDATA[Инновации]]></category>
      <category><![CDATA[Кибербезопасность]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Инфраструктура]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 22 Jun 2026 06:34:47 GMT</pubDate>
      <content:encoded><![CDATA[<p>22 июня 2026 года Cloud.ru запустила в коммерческую эксплуатацию платформу <b>Evolution Stack.ML</b>. Решение предназначено для распределённого обучения ИИ-моделей и разработки ИИ-приложений в частном и гибридном облаке.</p><p>Платформа позиционируется как инструмент для крупного бизнеса и государственных компаний, которым нужно сохранить контроль над данными и соответствовать требованиям регуляторов по безопасности. При необходимости вычислительные мощности можно масштабировать в публичное облако.</p><ul><li>Cloud.ru запустила Evolution Stack.ML — платформу для обучения ИИ-моделей в частном и гибридном облаке.</li><li>В основе лежит сервис Evolution Distributed Train: обучение, тюнинг, развёртывание моделей и совместная работа команд.</li><li>Платформа поддерживает изолированные рабочие пространства для более чем 200 команд одновременно.</li><li>По заявлению компании, утилизация GPU растёт с 35% до 90%, а окупаемость серверных мощностей составляет менее 3 месяцев.</li></ul><h2>Что умеет платформа</h2><p>Ядро продукта — сервис <b>Evolution Distributed Train</b>. Он объединяет инструменты для разработки, управления экспериментами и мониторинга в единую экосистему. Пользователи могут запускать изолированные рабочие пространства для более чем 200 команд одновременно.</p><p>Для распределения нагрузки используются механизмы очередей, приоритетов, аллокаций и спотов. По данным Cloud.ru, это позволяет поднять утилизацию GPU с 35% до 90% и окупить затраты на серверное оборудование менее чем за 3 месяца. Совместное использование кластеров, по оценке компании, ускоряет обучение и разработку новых ИИ-решений на 20%.</p><p>Встроенные механизмы self-healing автоматически обнаруживают сбои оборудования, перезапускают задачи и заменяют GPU-ноды. OSS-слой платформы Cloud.ru позволяет отслеживать загрузку инфраструктуры и контролировать расходы.</p><blockquote>Evolution Stack.ML помогает преодолеть барьеры для внедрения ИИ в крупном бизнесе и государственных компаниях — решение соответствует строгим требованиям к безопасности и нормам регуляторов. Evolution Stack.ML повышает экономическую эффективность использования собственного «железа» и при этом даёт доступ к самым современным технологиям и методам работы с ИИ.</blockquote><h2>Для кого это</h2><p>Решение рассчитано на организации с самыми высокими требованиями к безопасности: государственные и финансовые структуры, операторы ЦОДов и промышленные предприятия. Инфраструктура отвечает требованиям регуляторов к обработке и хранению персональных и финансовых данных, а также размещению ГИС и КИИ.</p><p>Cloud.ru также ссылается на собственное исследование: в России растёт спрос на гибридные сценарии. Среди наиболее востребованных — обработка данных и использование ИИ, разработка и тестирование в облаке, георезервирование и disaster recovery.</p><h2>Выводы</h2><p>Запуск Evolution Stack.ML — попытка Cloud.ru закрыть спрос на корпоративное ИИ-обучение с соблюдением регуляторных ограничений. Если заявленные цифры подтвердятся в реальных внедрениях, платформа может стать интересной альтернативой самостоятельной сборке инфраструктуры для машинного обучения.</p><p>Источник: <a>пресс-служба Cloud.ru</a>.</p><p>Реклама. Рекламодатель: ООО «Облачные технологии», ИНН 7736279160, erid: 2W5zFHcxyBP</p>]]></content:encoded>
    </item>
    <item>
      <title>NVIDIA представила RTX Spark — суперчип ARM + Blackwell с 128 ГБ памяти для ИИ-ПК</title>
      <link>https://tproger.ru/news/nvidia-predstavila-rtx-spark-superchip-arm-blackwell-s-128-gb</link>
      <comments>https://tproger.ru/news/nvidia-predstavila-rtx-spark-superchip-arm-blackwell-s-128-gb?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Евгений Стребков]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/nvidia-predstavila-rtx-spark-superchip-arm-blackwell-s-128-gb</guid>
      <description><![CDATA[<p>NVIDIA анонсировала RTX Spark с 128 ГБ памяти и 1 петафлопсом FP4. Разбираем, чем суперчип грозит Apple Silicon и когда ждать первые ноутбуки на рынке.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/nvidia-predstavila-rtx-spark-superchip-arm-blackwell-s-128-gb">NVIDIA представила RTX Spark — суперчип ARM + Blackwell с 128 ГБ памяти для ИИ-ПК</a>»</p>]]></description>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Процессор]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 03 Jun 2026 09:15:51 GMT</pubDate>
      <content:encoded><![CDATA[<p>NVIDIA на выставке Computex 2026 представила <b>RTX Spark</b> — систему на кристалле, которая объединяет 20-ядерный процессор ARM и GPU архитектуры Blackwell на одном кристалле. Устройство позиционируется как ответ Apple Silicon для рынка высокопроизводительных ИИ-ноутбуков под Windows.</p><p>Новый чип построен по 3-нм техпроцессу TSMC, содержит 70 млрд транзисторов и предлагает 128 ГБ общей памяти LPDDR5x с пропускной способностью 273 ГБ/с. Заявленная производительность ИИ-вычислений — <b>1 петафлопс в формате FP4</b> благодаря тензорным ядрам пятого поколения.</p><p>CPU включает 10 высокопроизводительных ядер Cortex-X925 и 10 ядер Cortex-A725 с частотой до 4,1 ГГц. GPU располагает 6144 CUDA-ядрами и поддерживает DLSS 4.5. Процессор и ускоритель связаны через соединение NVLink-C2C, что устраняет копирование данных через PCIe.</p><p>• RTX Spark — 20-ядерный ARM + GPU Blackwell на одном кристалле, 70 млрд транзисторов.</p><p>• 128 ГБ единой памяти позволяет запускать модели до 120 млрд параметров локально.</p><p>• 1 петафлопс FP4 на тензорных ядрах Blackwell — преимущество в ИИ-инференсе крупных моделей перед платформами без нативной поддержки FP4.</p><p>• Первые ноутбуки ASUS, Dell, HP, Lenovo, Microsoft и MSI — осенью 2026.</p><h2>Технические характеристики RTX Spark</h2><ul><li>Процессор: 20 ядер ARM (10× Cortex-X925 + 10× Cortex-A725), до 4,1 ГГц</li><li>GPU: Blackwell, 6144 CUDA-ядер, тензорные ядра 5-го поколения с FP4</li><li>Память: 128 ГБ LPDDR5x, 256-бит шина, 273 ГБ/с</li><li>Техпроцесс: TSMC 3 нм, 70 млрд транзисторов</li><li>TDP: до 140 Вт (десктоп DGX Spark)</li><li>Соединение: NVLink-C2C между CPU и GPU</li></ul><h2>Контекст: чем RTX Spark бросает вызов Apple Silicon</h2><p>RTX Spark — это переосмысленный чип <b>GB10 Grace Blackwell</b>, который уже используется в настольной системе DGX Spark за $4699. Теперь NVIDIA адаптировала его для мобильных устройств и настольных ПК от сторонних OEM-производителей.</p><p>Прямой конкурент — <b>Apple M4 Max</b>: у него выше пропускная способность памяти (546 ГБ/с против 273 ГБ/с), но меньше ИИ-производительность на NPU (38 TOPS INT8 против 1000 TOPS FP4 на GPU). Прямое сравнение некорректно из-за разных архитектур и форматов, однако для моделей свыше 50 млрд параметров преимущество RTX Spark становится критическим: он держит их в нативном FP4, тогда как Apple вынуждена идти на агрессивное сжатие.</p><p>Microsoft уже анонсировала <b>Surface Laptop Ultra</b> на базе RTX Spark. К осени 2026 года ожидается свыше 30 моделей ноутбуков от ASUS, Dell, HP, Lenovo, Microsoft и MSI.</p><h2>Выводы</h2><p>RTX Spark — попытка NVIDIA занять нишу, которую Apple удерживает с 2020 года: высокопроизводительные ARM-компьютеры с единой памятью. Но вместо копирования подхода Apple компания ставит на свою сильную сторону — тензорные ядра и экосистему CUDA.</p><p>Главный вопрос — насколько быстро созреет экосистема Windows on ARM и оптимизация приложений под новую архитектуру. NVIDIA утверждает, что оптимизированные приложения (например, Adobe Premiere) работают вдвое быстрее, чем на конкурирующих платформах, однако независимых тестов пока нет — устройства выйдут только осенью. Если разработчики адаптируют софт под Grace-ядра и FP4, RTX Spark может стать рабочей лошадкой для локальных LLM и генеративного ИИ.</p><blockquote>NVIDIA делает ставку не на победу во всех бенчмарках, а на доминирование в локальном выводе ИИ-моделей — там, где размер модели и формат вычислений решают больше, чем чистая пропускная способность памяти.</blockquote><p>Источник: <a href="https://awesomeagents.ai/hardware/nvidia-rtx-spark/">Awesome Agents — NVIDIA RTX Spark</a></p>]]></content:encoded>
    </item>
    <item>
      <title>«Серебряной пули не существует»: как RWB строит промышленный ИИ</title>
      <link>https://tproger.ru/articles/serebryanoj-puli-ne-sushhestvuet-kak-rwb-stroit-promywlennyj-ii</link>
      <comments>https://tproger.ru/articles/serebryanoj-puli-ne-sushhestvuet-kak-rwb-stroit-promywlennyj-ii?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Вика Овсянникова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/serebryanoj-puli-ne-sushhestvuet-kak-rwb-stroit-promywlennyj-ii</guid>
      <description><![CDATA[<p>Как Wildberries экономит миллионы с помощью ИИ: реальные кейсы, работающие решения и открытые инсайты от RWB, Avito, VK и Сбера.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/serebryanoj-puli-ne-sushhestvuet-kak-rwb-stroit-promywlennyj-ii">«Серебряной пули не существует»: как RWB строит промышленный ИИ</a>»</p>]]></description>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Инфраструктура]]></category>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 29 May 2026 08:40:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>На митапе Inside AI Meetup команда RWB (Wildberries &amp; Russ) и приглашенные эксперты из MWS, Avito, VK, МФТИ, M2, Сбера, red_mad_robot и Альфа-Банка честно разобрали, что на самом деле стоит за красивыми словами «мы внедряем ИИ». Спойлер: ИИ это не магия, а десятки неудачных экспериментов, open-source грабли и железо, которое ведет себя не так, как вы ожидаете.</p><h2>Не магическая кнопка, а десятки экспериментов</h2><p>Павел Раваев, директор по данным RWB, сразу же в начале митапа отсекает главный миф об искусственном интеллекте.</p><blockquote>«ИИ — это не какая-то магическая кнопка, на которую ты нажимаешь, и всё становится красиво и хорошо».</blockquote><p>За каждым запуском стоят данные, сотни экспериментов и огромная инженерная работа.</p><p>Масштаб Wildberries заставляет относиться к ИИ без иллюзий. Миллионы пользователей, десятки миллионов заказов в день — улучшение какого-то процесса даже на пару процентов превращается в сложнейшую инженерную задачу. Поэтому главный принцип компании звучит максимально прагматично: <i>«Мы не внедряем ИИ только ради ИИ. Сначала проблема, потом гипотеза, потом десятки экспериментов. Часть взлетает, часть откатываем»</i>.</p><p>И этот подход работает. ИИ в Wildberries уже давно вышел за рамки чат-ботов и модерации. Поиск и рекомендации превратились в сложные системы, учитывающие не только предпочтения пользователя, но и наличие товара на ближайшем складе, чтобы снизить логистические издержки.</p><p>Прогнозирование спроса и управление складскими операциями — то, что пользователь никогда не увидит, — экономят компании колоссальные деньги. Для селлеров работают инструменты генерации карточек товаров по фотографии и автоответы на отзывы. Только задумайтесь: ежедневно на WB оставляют около четырех миллионов отзывов и задают триста тысяч вопросов. Вручную это обрабатывать невозможно.</p><p>А еще Wildberries запускает автопереводы карточек товаров для других стран — руками это сделать невозможно из-за объемов.</p><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-05-28/9e732619-5ac0-46f1-b798-f0dde067f9b6.webp" alt="inside ai meetup" /><figcaption>Три главных принципа работы с AI, которыми поделился Павел Раваев на открытии митапа</figcaption></figure><p>Внутри компании ИИ тоже активно используется. У Wildberries есть, например, AI-агент DPO, который проверяет, что лежит в больших хранилищах данных. <i>«Он заменил целый пласт ручной работы с разметкой. Мы его сделали, попробовали, отдали безопасникам — и теперь это работает в зоне их ответственности»</i>, — рассказывает Павел. А еще есть собственные кодинг-ассистенты, инструмент для автоматического ревью кода (им пользуются около 200 команд).</p><p><i>«Колесо сансары замкнулось — программисты разрабатывали ИИ, и он начал их заменять»</i>, — смеется Юрий Софронов, руководитель направления моделей и сервисов для ИИ-ассистентов в RWB.</p><p>Главный вывод, который делает Раваев, звучит так: ИИ в крупной компании нужен не ради инноваций. Он помогает выстроить интеграцию в тысячи уже работающих процессов и нагрузку, которую не выдержит ни один коробочный фреймворк.</p><h2>Где заканчивается магия и начинается автоматизация</h2><p>Первый технический блок митапа начался с неожиданного признания. Руководитель ML-платформы Даниил Понизов и MLOps-инженер Роман Лазовский из RWB рассказывали о внедрении AIOps-практик, но их главный вывод звучал почти издевательски: <b>AI в AIOps-платформе оказался практически бесполезен.</b></p><p>Как это вообще могло случиться?</p><p>Проблема, которую они решали, знакома многим. В корпоративный чат падают тысячи алертов о недоутилизации ресурсов. Дежурные разбирают их вручную, но через неделю те же проблемы возвращаются. Кто-то берет десять GPU для обучения модели на десяти строчках данных, и никто не может этого предотвратить. В масштабах Wildberries с его тысячами ML-сервисов и сотнями владельцев ручные методы просто перестают работать.</p><p>Команда выбрала KeepHQ — единственную на тот момент open-source AIOps-платформу. Развернули, настроили интеграцию с Grafana, сделали бота в мессенджере, который ведет диалог с владельцами сервисов. Система дедуплицирует алерты (из почти 400 тысяч событий схлопывается 99%), обогащает их контекстом и автоматизирует рутину. Результат впечатляет: на одном из кластеров утилизация GPU выросла на 62%.</p><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-05-28/42fa2537-b808-4cff-9323-a2848776fb39.webp" alt="rwb ai meetup" /><figcaption>Доклад Даниила Понизова и Романа Лазовского</figcaption></figure><h3>Ирония, которая стоит особняком</h3><p>Когда платформа называется AIOps, ожидаешь, что искусственный интеллект будет играть в ней ключевую роль. На практике выяснилось, что в open-source версии KeepHQ AI-функции крайне ограничены. Встроенный LLM-провайдер из коробки не заработал — пришлось патчить ролевую модель. AI-ассистент для построения воркфлоу помогает генерировать YAML, но это просто ускоритель, а не интеллект.</p><p>«AIOps в нашем случае — это автоматизация мелких ручных действий, — резюмирует Даниил. — AI-фичи, доступные из коробки, нам пока не помогли. Мы уже разрабатываем отдельного AI-агента, который будет мониторить алерты из KeepHQ, а также обогащать их контекстом из других инструментов, чтобы автоматически заводить инциденты и открывать мердж-реквесты с предложениями по оптимизации ресурсов в сервисах».</p><p>Вывод, который стоит вынести из этого опыта: open-source решения для AIOps удобны, но будьте готовы патчить всё — от Python-степов до LLM-провайдеров. И главное — не ждите, что AI решит ваши проблемы с утилизацией. Сначала выстройте прозрачный процесс, а потом уже его автоматизируйте.</p><h2>Хорошая модель не спасет: данные, код и железо решают всё</h2><p>Юрий Софронов, руководитель направления моделей и сервисов для ИИ-ассистентов в RWB, разобрал самый опасный стереотип: заказчики думают, что если дать им «хорошую модель», всё заработает само. На самом деле LLM-продукт — это сложная система. Юрий выделяет как минимум три слоя: данные, код и железо, и без проработки каждого модель бесполезна.</p><p><i>«Никому не нужен чат-бот, который думает по 20 минут, — объясняет Юрий. — Модель без дополнительного контекста — это просто очень сложный вычислительный инструмент, который умеет генерировать токены и ничего не знает про ваш бизнес и вашего пользователя. Чтобы появился LLM-продукт, нужно воспринимать его как атомарную, неделимую сущность. Это огромный каскад и технических, и продуктовых решений»</i>.</p><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-05-28/cf502358-76f8-457d-b225-68d35cd6f70d.webp" alt="inside ai meetup" /><figcaption>Юрий Софронов, руководитель направления моделей и сервисов для ИИ-ассистентов в RWB</figcaption></figure><h3>Слой данных</h3><p>История, которой Юрий поделился, наглядно иллюстрирует проблему. Задача: автоматически отвечать на вопросы покупателей. Источников информации много: описание товара, предыдущие вопросы к селлеру, тысячи отзывов. На некоторые товары на Wildberries их оставлено больше сотни тысяч. Даже в современную модель с контекстом на 120-250 тысяч токенов всё это не помещается.</p><p>Команда пробовала стандартные подходы. Добавлять все отзывы в контекст — не лезет. Векторный поиск — нет хороших датасетов и эмбеддеров, нерелевантные примеры убивают качество.</p><p>Сработал агент под названием «Водолаз». Он раз в сутки анализирует весь контент карточки — вопросы, отзывы, обсуждения — и извлекает из него факты, которых нет в официальном описании товара. «Подошва не скользит зимой», «хорошо держит тепло» — такие факты складываются в понятную для LLM key-value структуру и индексируются.</p><p>В результате удалось закрыть пять процентов вопросов, на которые раньше ответить не могли. Цифра кажется небольшой, но в масштабе WB это десятки тысяч автоматических ответов в день.</p><p>Вывод прост: не пытайтесь скормить LLM сырой контекст. Приведите данные в порядок до того, как отдадите их модели. LLM не чинит данные — она только усиливает существующий хаос.</p><h3>Слой кода</h3><p>Здесь Юрий был категоричен. Low-code инструменты типа LangChain — это зло для продакшна.</p><p><i>«Благодаря своей универсальности эти инструменты не оптимизированы. Разбирая реализацию LangChain, ты попадаешь в пять-семь слоев абстракций, неэффективно реализованные компоненты».</i></p><p>Где их можно использовать? Для прототипов, демо заказчику, тестирования на малой группе пользователей. Но определенно не в продакшне.</p><p>«Если кто-то в WB собирается запускать клиентские продукты на таких технологиях, как LangChain, я сильно протестую и готов всеми силами это остановить».</p><p>Альтернатива, по мнению Юрия, — разделить систему на прозрачные слои: API, роутер сценариев, сборщики контекста, саму LLM, пост-процессинг. И использовать vLLM или Triton вместо нативного PyTorch. Базовая интеграция без оптимизаций дает буст в 10–15 раз по сравнению с Transformers.</p><p>Живой пример из практики Wildberries: готовая к запуску продовая инфра с 48 GPU на end-to-end тестировании функционала в приложении показывает такие же метрики производительности, что и на 4 GPU. Производительность идентична, хотя разница в ресурсах в 12 раз! Причина оказалась не в GPU и не в модели, а в ingress-слое — стояли дефолтные лимиты на количество соединений, которые буферизовали ответы. Кодовая инфраструктура заруинила отличную GPU-инфраструктуру.</p><h3>Слой железа</h3><p>Самая недооцененная часть LLM-продуктов. Классический L7-балансировщик балансирует сетевой трафик, но сетевой запрос не равен нагрузке на GPU. Две одинаковые ноды с одной моделью могут отвечать с совершенно разной скоростью, одна может работать в штатном режиме, другая — зациклиться в генерациях или повлечь за собой ошибку на уровне железа. Что работает вместо этого:</p><ul><li>Token-aware routing — оцениваем количество токенов, не отправляем тяжелый запрос на загруженную ноду.</li><li>KV-cache routing — используем уже посчитанный кэш на той же ноде, где он был. Трехкратный выигрыш по latency.</li><li>Спекулятивный роутинг — кидаем запрос на две-три ноды, берем самый быстрый ответ. Ускоряет ответ на 15–25%, снижает 95-й перцентиль latency на 15%.</li></ul><h2>Когда ИИ — это переплата, а когда — полезный помощник</h2><p>На панельной дискуссии встретились представители Альфа-Банка, Сбера, RWB, red_mad_robot.</p><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-05-28/a9f36fbb-d31f-492e-8ada-02c606e8d906.webp" alt="панельная дискуссия" /><figcaption>Участники панельной дискуссии, которая закрывала митап</figcaption></figure><h3>Где ИИ не нужен</h3><p>Самый частый ответ: если проблема решается эвристиками или регулярными выражениями, не нужно тащить LLM. В задачах кибербезопасности, например, многие пытаются применять большие языковые модели для фильтрации спама или борьбы с мошенничеством, но обычные классификаторы справляются с большинством задач намного лучше.</p><p>Красные флаги, которые заставляют команды отказываться от ИИ-решений, тоже довольно очевидны. Когда:</p><ul><li>заказчик требует стопроцентного качества — ИИ никогда его не даст.</li><li>у заказчика нет понимания, как решать задачу, и он думает, что ИИ — это серебряная пуля, которая всё исправит.</li><li>экономика не сходится — если стоимость защиты на базе ИИ выше, чем стоимость атаки и потенциального ущерба, смысла в таком решении нет.</li></ul><h3>Что важнее — модель или обвязка?</h3><p>Последние полгода мировая тенденция, которую подтвердили все участники дискуссии, — переход от промпт-инжиниринга к систем-инжинирингу. Важно не то, как вы запросили модель, а какой контекст в нее попадает, как описаны инструменты, как работает оркестрация агента.</p><p>Агентные системы ценны не своей автономностью, а тем, что человек может их контролировать через бизнес-правила. Например, если вы даете агенту задание посчитать выручку за прошлую неделю, а в хранилище данных пять разных таблиц с выручкой и у каждой свой способ расчета, никакая модель не разберется без правильной обвязки и контекста, который раньше жил только в головах аналитиков.</p><h3>Про деньги и веру</h3><p>Честный разговор об экономике получился, пожалуй, самым интересным. Экономика LLM-проектов часто не сходится. Но есть нюансы.</p><p>Первый: стоимость инференса токенов падает с каждым месяцем. То, что не окупается сегодня, может окупиться через полгода или год. Второй, и, возможно, более важный: стоимость неделания часто выше, чем стоимость эксперимента.</p><blockquote>«Когда вы начинаете делать пилот, вы выясняете кучу вещей, не связанных напрямую с ИИ. У вас могут быть не настроены права доступа или не готово DWH. Вы узнаете инсайты, которые можно применить и без ИИ. Компетенции дороже, чем небольшая переплата за видеокарты».</blockquote><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-05-28/645c182a-d1f2-4d39-9606-d3d2a781ddee.webp" alt="дискуссия про AI" /><figcaption>Александр Гирев, Android Team Lead WB Partners, RWB и Даниил Поляков, AI Lead и Архитектор AI / ML решений, red_mad_robot</figcaption></figure><p>И еще один важный тезис, прозвучавший в дискуссии: немодные ниши часто приносят больше денег, чем хайповые продукты. Из неочевидных примеров — 1С. Огромное количество предприятий в России работают на этой платформе, но LLM плохо обучены ее коду. Анализ тендеров — огромные объемы текста, высокая цена ошибки, государственные закупки. Также есть множество недооцифрованных ниш: строительство, добыча ресурсов, промышленные заводы и машиностроение, где ИИ имеет еще низкое проникновение и потенциально высокий абсолютный экономический эффект. Даже единицы процентов повышения эффективности в таких нишах в абсолютном значении выражаются в десятках и сотнях миллионов рублей позитивного экономического эффекта.</p><h2>Серебряной пули действительно не существует</h2><p>Не существует «магической кнопки», на которую можно нажать, чтобы всё заработало. Не существует платформы, которая решит инфраструктурные проблемы своим AI. Как не существует и модели, которая исправит хаос в данных или плохую архитектуру.</p><p>Всё, что работает в промышленном ИИ, работает потому, что за этим стоит тяжелая, нехайповая инженерная работа. И в этом, наверное, главный урок Inside AI Meetup для тех, кто собирается внедрять ИИ завтра.</p><p>ИИ — это инструмент, а не религия. Он все еще не может заменить вкус, душу и человеческое понимание контекста.</p><p><i>«Я недавно читал статью в Vogue "Can AI Ever Crack Taste?", — вспоминает Юрий Софронов. — Единственное, чего сейчас нет у ИИ — это вкуса. Я иногда смотрю на сгенерированный текст или картинку и чувствую, что что-то не так. Человек здесь по-прежнему далеко впереди»</i>.</p><p>Возможно, через пять лет мы будем вспоминать эти слова с улыбкой. А возможно с благодарностью за то, что кто-то вовремя сказал правду.</p>]]></content:encoded>
    </item>
    <item>
      <title>Подборка облачных GPU для ML 2026</title>
      <link>https://tproger.ru/articles/podborka-oblachnyh-gpu-dlya-ml-2026</link>
      <comments>https://tproger.ru/articles/podborka-oblachnyh-gpu-dlya-ml-2026?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Валерия Турчак]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/podborka-oblachnyh-gpu-dlya-ml-2026</guid>
      <description><![CDATA[<p>Разбираем облачные сервисы с GPU на 2026 год. Сравнение инфраструктуры, доступные видеокарты (от T4 до H200) и реальные цены на инстансы для ML и инференса.
</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/podborka-oblachnyh-gpu-dlya-ml-2026">Подборка облачных GPU для ML 2026</a>»</p>]]></description>
      <category><![CDATA[DevOps]]></category>
      <category><![CDATA[Облачные технологии]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Инфраструктура]]></category>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 21 May 2026 08:17:36 GMT</pubDate>
      <content:encoded><![CDATA[<p>Обучение моделей съедает время и бюджеты, особенно когда локального железа уже не хватает, а покупка собственных серверов под ML-задачи не бьётся с экономикой проекта. Переезд в облако кажется логичным шагом. Открываешь сайты провайдеров — и сразу тонешь в сложных калькуляторах, скрытых платежах за трафик и вечном дефиците инстансов с нужными карточками.</p><p>Мы собрали актуальный список облачных GPU-сервисов на 2026 год. Изучили доступные архитектуры, реальную производительность и особенности биллинга разных платформ.</p><p>Ниже разбираем железо: под какие сценарии подходят конкретные конфигурации, как устроено управление средой и на чём можно оптимизировать косты при развёртывании инфраструктуры.</p><h2>IaaS-платформа с иммерсионным охлаждением immers.cloud</h2><p>В <a href="https://immers.cloud/?utm_source=tproger&amp;utm_medium=research&amp;utm_campaign=may2026">immers.cloud</a> можно арендовать виртуальные машины и bare metal-серверы под ресурсоемкие задачи. Сервис ориентируется на обучение нейросетей, работу с LLM, инференс, 3D-рендеринг, обработку видео и сценарии, где локального железа уже мало, а покупать собственный парк серверов пока рано.</p><p>Инфраструктура размещена в Москве, в дата-центре уровня Tier-III. Базовый формат работы здесь классический для IaaS: пользователь поднимает ВМ или выделенный сервер и дальше сам собирает нужную среду под свою задачу.</p><h3>Какие GPU доступны</h3><p>У платформы собран пул из 13 моделей видеокарт NVIDIA под разные нагрузки. Для ML-задач с большим потреблением памяти доступны H200 на 141 ГБ  и H200 на 141 ГБ с NVLink, H100 на 80 ГБ и на 94GB с NVLink, A100 на 80 ГБ и Tesla V100 на 32 ГБ. Отдельно отметим, пожалуй, H100 и A100 с поддержкой GPUDirect и NVLink. Для задач, где нужен быстрый обмен данными между ускорителями, это полезная штука.</p><p>Если речь идет о небольших моделях, агентных сценариях или более легком инференсе, доступны Tesla T4 на 16 ГБ, A2 на 16 ГБ, A10 на 24 ГБ и RTX 3080 на 10 ГБ. Для рендеринга, графических задач и смешанных вычислений можно арендовать RTX 2080 Ti на 11 ГБ, RTX 3090 на 24 ГБ, RTX A5000 на 24 ГБ, RTX 4090 на 24 ГБ или RTX 5090 на 32 ГБ.</p><h3>Под какие сценарии подходит, как используют</h3><p>Платформу чаще используют под конкретные инфраструктурные задачи, бюджет и этап разработки. Самые популярные примеры:</p><ol><li>Если ML-стартапу нужно развернуть MVP или проверить гипотезу, нет смысла сразу брать флагманы. Под пилоты обычно поднимают инстансы среднего ценового сегмента — например, с RTX 3090, RTX 4090 или Tesla V100. Стенд обходится в 65–100 ₽ за час работы и позволяет тестировать модели без капитальных затрат на железо.</li><li>Для R&amp;D-команд, которые занимаются файн-тюнингом и обучением LLM, критичен объем видеопамяти. Адаптация предобученных моделей (в том числе через подготовку LoRA) уходит на тяжелые конфигурации с H200, H100 или A100.</li><li>Когда модель готова, её выносят в продакшн для стабильного инференса по API. Здесь выбор железа зависит от аппетитов самой нейросети: легкие модели и агенты спокойно крутятся на Tesla T4 или A10 (от 20 до 40 ₽/час), а высоконагруженные сервисы с крупными LLM забирают мощности с A100.</li><li>Для потоковой обработки видео, задач компьютерного зрения и 3D-рендеринга собирают стенды на профессиональных картах вроде RTX A5000 или топовых RTX 5090.</li></ol><h3>Как устроена инфраструктура и экосистема</h3><p>ML-команды больше не упираются в доступность GPU на рынке, они упираются в то, сколько стоит время экспериментов и насколько быстро можно масштабировать обучение и инференс без потери контроля над инфраструктурой.</p><p>Технически платформа immers.cloud — это инфраструктурный слой на базе OpenStack. Здесь пока нет управляемого Kubernetes-сервиса, а вся работа строится вокруг виртуальных машин. С одной стороны, придется собирать окружение на ВМ самостоятельно. С другой — это дает понятную модель управления, где можно поднимать ресурсы строго под свою сборку и не бороться с абстракциями, которые навязывает провайдер.</p><p>Чтобы снять часть рутины с настройкой среды, есть <a href="https://immers.cloud/marketplace/">маркетплейс готовых образов</a>. Там лежат преднастроенные шаблоны с CUDA, PyTorch, TensorFlow и Jupyter.</p><p>Отдельно развернут <a href="https://immers.cloud/ai/model/">Immers Foundation Models</a> — каталог моделей, который закрывает сразу два этапа разработки: от выбора модели до первого запуска. Для прототипирования и проверки гипотез доступны бесплатные публичные эндпоинты. Инженер просто прокидывает токен и адрес модели в код, собирает MVP и тестирует логику продукта без затрат на инфраструктуру.</p><p>Когда сервис протестирован и готов к нагрузкам, команда переезжает на выделенные мощности. Для этого в каталоге предусмотрен запуск нужной модели «одной кнопкой». Система сама оценивает требования к VRAM и разворачивает подходящую GPU-конфигурацию.</p><p>Каталог сокращает путь и делает проще запуск: инженеру не нужно вручную проверять совместимость, подбирать GPU-конфигурацию и оценивать требования к VRAM под разные сценарии инференса. Вместо разных репозиториев и документации команда получает готовую точку входа для быстрого тестирования моделей, оценки стоимости запуска и развёртывания собственного inference-стека.</p><p>Для работы с датасетами и промежуточными артефактами к платформе подключено S3-совместимое объектное хранилище, за которое сейчас не берут плату.</p><h3>Автоматизация и DevOps</h3><p>Инфраструктуру можно поднимать не только руками через веб-консоль, но и встраивать в привычный инженерный контур. У сервиса есть CLI через openstack-client и Terraform-провайдер OpenStack. Managed Kubernetes находится в разработке, поэтому оркестрация контейнеров из коробки пока недоступна.</p><h3>Тарификация</h3><p>У платформы собран пул из 13 моделей видеокарт NVIDIA под разные нагрузки. Для ML-задач с большим потреблением памяти доступны H200 на 141 ГБ  и H200 на 41 ГБ с NVLink, H100 на 80 ГБ и на 94GB с NVLink, A100 на 80 ГБ и Tesla V100 на 32 ГБ. Отдельно отметим, пожалуй, H100 и A100 с поддержкой GPUDirect и NVLink. Для задач, где нужен быстрый обмен данными между ускорителями, это полезная штука.</p><p>Если речь идет о небольших моделях, агентных сценариях или более легком инференсе, доступны Tesla T4 на 16 ГБ, A2 на 16 ГБ, A10 на 24 ГБ и RTX 3080 на 10 ГБ. Для рендеринга, графических задач и смешанных вычислений можно арендовать RTX 2080 Ti на 11 ГБ, RTX 3090 на 24 ГБ, RTX A5000 на 24 ГБ, RTX 4090 на 24 ГБ или RTX 5090 на 32 ГБ.</p><p>На платформе действует посекундная тарификация — оплата списывается только за фактическое время работы инстанса. Прерываемых (spot) машин нет.</p><p>Самая доступная конфигурация собирается на Tesla T4 16 ГБ (шаблон teslat4-1.4.8.60). Вместе с 4 vCPU, 8 ГБ RAM и сетью она обходится в 19,93 ₽ за час работы.</p><p>Стоимость других младших инстансов за час: A2 — 21,94 ₽, RTX 2080 Ti — 25,05 ₽, A10 — 36,55 ₽, RTX 3080 — 42,96 ₽.</p><p>Средний сегмент за час аренды: RTX 3090 — 66,76 ₽, RTX 4090 — 82,76 ₽, Tesla V100 — 96,61 ₽, RTX A5000 — 109,77 ₽, RTX 5090 — 130,76 ₽.</p><p>Тяжелые конфигурации в час: A100 — 211,77 ₽, H100 — 341,77 ₽, H100 NVL — 367,41 ₽, H200 — 423,04 ₽.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-05-20/e7c0d4db-4944-4fba-881c-b89971d5f4c3.webp" alt="" /></figure><p>Для долгосрочных заказов предусмотрена скидка от 10 до 50%, а списания при таком формате происходят раз в сутки.</p><h3>Особенности железа</h3><p>Ключевая особенность площадки — использование иммерсионного охлаждения. Серверное оборудование полностью погружается в диэлектрическую жидкость. Это помогает держать стабильно низкую температуру GPU, исключает риск троттлинга и сохраняет производительность на длинных сессиях с высокой нагрузкой. Провайдер первым в России внедрил технологию виртуализации для этих графических процессоров.</p><h3>Ограничения и безопасность</h3><p>Формат работы на платформе подойдет инженерам, которые умеют собирать окружение на ВМ и работать с OpenStack-логикой. Полноценной managed ML-платформы и онбординга для ML-команд здесь нет.</p><p>Инфраструктура имеет сертификат ГОСТ Р ИСО/МЭК 27001-2021 по системам менеджмента информационной безопасности, но не соответствует требованиям 152-ФЗ. Это стоит учитывать при работе с персональными данными.</p><h3>Поддержка и условия работы</h3><p>Вся базовая документация собрана в <a href="https://immers.cloud/faq/">подробном FAQ на русском языке</a>. Техническая поддержка отвечает в течение 20 минут через чат на сайте, Telegram, Max или email.</p><p>Юрлицам доступна работа по договору, предоставление закрывающих документов и постоплата. Для новых клиентов предусмотрен триальный баланс на проверку гипотез и первый прогон пайплайнов.</p><h2>Инфраструктура для high-load и ML-проектов ITGLOBAL.COM</h2><p>На<a href="https://itglobal.com/ru-ru//?utm_source=tproger&amp;utm_medium=cdc&amp;utm_campaign=selection_GPU_Tproger_2026"> ITGLOBAL.COM</a> разворачивают GPU-инфраструктуру для машинного обучения, высокопроизводительных вычислений (HPC), рендеринга и сложной аналитики. Форматов несколько: классические облачные инстансы, выделенные серверы, гибридные схемы и аренда суперкомпьютера на базе NVIDIA HGX. Платформа заточена под команды, которым нужны серьезные мощности Enterprise-уровня без капитальных затрат на закупку собственного железа.</p><h3>Какие GPU доступны</h3><p>В пуле провайдера стоят актуальные корпоративные решения. Главная техническая фича — поддержка vGPU. Физическую видеокарту можно делить между несколькими виртуальными машинами — части изолированы друг от друга, так что данные одной ВМ недоступны другим. Теперь ресурсы масштабируются только под задачу, а команда не переплачивает за ненужные мощности.</p><p>Например, NVIDIA RTX Pro 6000 Blackwell Server Edition на 96 ГБ можно нарезать на профили по 12, 24, 48 ГБ или забрать все 96 ГБ под одну ВМ. Для более тяжелых задач доступны инстансы с H200 на 141 ГБ и флагманские B300 на 288 ГБ.</p><p>Также в пуле есть A100 и A800 (по 80 ГБ), L40S на 48 ГБ, серверы с NVIDIA A16 (четыре чипа по 16 ГБ) и ускорители Sophgo SC7 HP75. Мощности Enterprise-уровня всегда держат в наличии под высоконагруженные проекты.</p><h3>География и форматы размещения</h3><p>Инфраструктура ITGLOBAL.COM размещена в Москве, Минске, Алматы, Ташкенте, Шэньчжэне, Амстердаме, Торонто, Нью-Джерси, Дубае и Сан-Паулу. Если проект требует строго локального размещения или интеграции с внутренним контуром безопасности, провайдер может выдать инфраструктуру с GPU прямо на площадку клиента.</p><h3>Под какие задачи подходит</h3><p>Ресурсы забирают под разные этапы для работы с данными. Команды Data Science обучают модели скоринга, прогнозирования оттока или рекомендательные алгоритмы на NVIDIA H200 и NVIDIA RTX PRO 6000 Blackwell Server Edition хорошо тянут видеоаналитику и Computer Vision для промышленных и логистических объектов, где нужно анализировать плотные видеопотоки.</p><p>Если речь идет про инференс LLM или запуск AI-приложений в high-load сценариях, инженеры обычно поднимают ресурсы уровня NVIDIA HGX H200 или кластеры NVIDIA HGX B300. Ограничений на фреймворки, оркестраторы или объем данных со стороны платформы нет. Клиент получает IaaS с полным контролем над средой, упираясь только в архитектурные лимиты самих чипов NVIDIA и поддерживаемые драйверы.</p><h3>Как устроена инфраструктура и экосистема</h3><p>Для управления ресурсами доступны API, CLI и возможность использования terraform провайдера, поэтому поднимать и гасить инстансы можно программно. Преднастроенные стеки с CUDA, PyTorch, TensorFlow или Jupyter собираются и уточняются на старте под конкретный проект. Для команд, которые хотят снять с себя часть инфраструктурной рутины, доступен Managed Kubernetes и управляемая ML-платформа.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-05-20/50a8b6df-a795-44db-8edc-20eddd519aa1.webp" alt="" /></figure><p>Для хранения объемных датасетов и работы с данными предусмотрен отдельный S3-совместимый сервис объектного хранилища.</p><h3>Тарификация и условия</h3><p>Жесткой публичной сетки тарифов за час здесь нет — провайдер работает по проектному ценообразованию. Итоговый чек зависит от модели GPU, конфигурации, сроков аренды и формата размещения. Прерываемых (spot) инстансов не предусмотрено, зато для долгосрочных и крупных проектов действуют индивидуальные скидки.</p><p>Пользователь сам управляет ресурсами и может собрать нужную конфигурацию. Рекомендуемая минимальная сборка включает 12 ГБ vGPU, 4 vCPU и 16 ГБ оперативной памяти. При необходимости параметры можно ужать до базового минимума: 12 ГБ vGPU, один vCPU (Xeon 2.8 ГГц), гигабайт RAM и гигабайт быстрого SSD (с возможностью добавить HDD).</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-05-20/fbb1a4e5-7431-4352-9dca-aff306536c4f.webp" alt="" /></figure><p>Оплата для юрлиц по умолчанию идет в формате постоплаты по договору с предоставлением всех закрывающих документов. Для тестирования гипотез новым клиентам открывают триальный период.</p><h3>Безопасность и соответствие</h3><p>Облако имеет аттестат соответствия требованиям 152-ФЗ. Также компания обладает сертификатами ФСТЭК и ФСБ. Все лицензии и документы<a href="https://itglobal.com/ru-ru/company/licenses/"> выложены в открытом доступе на сайте</a>.</p><h3>Поддержка и документация</h3><p>Влиться в работу помогает пресейл-команда: инженеры проводят проектный онбординг и помогают собрать нужную конфигурацию под конкретные ML-задачи. Техническая<a href="https://docs.itglobal.com/"> документация</a> полностью доступна на русском языке.</p><p>Первичные запросы обрабатывают в течение двух часов. Оставить заявку можно через<a href="https://itglobal.com/ru-ru/"> сайт</a>, почту sales@itglobal.com, по телефону +7 812 439 18 72 или через<a href="https://t.me/itg_techlab_bot"> Telegram-бота</a>. Действующие клиенты решают вопросы через личного менеджера, клиентский портал, облачную панель или выделенную почту support@itglobal.com.</p><h2>Кастомные GPU-серверы и Managed-сервисы от Selectel</h2><p>В <a href="https://selectel.ru/services/gpu/" rel="nofollow">Selectel</a> можно арендовать облачные инстансы и bare-metal серверы под ML-задачи, инференс, работу с графикой и сложные вычисления. Провайдер дает возможность гибко собрать нужную инфраструктуру: от быстрой аренды облачной ВМ на час до сборки кастомных физических серверов на базе процессоров Intel Xeon Scalable и AMD EPYC.</p><p>Базовый формат работы здесь строится вокруг классических серверов, но платформа позволяет объединять разные сервисы провайдера в сложную инфраструктуру и делегировать администрирование части слоев (например, баз данных).</p><h2>Какие GPU доступны</h2><p>У платформы собран широкий пул профессиональных и консьюмерских видеокарт NVIDIA под разные нагрузки. Для тяжелых ML-задач доступны NVIDIA A100 (в том числе в конфигурации на 40 ГБ) и NVIDIA V100. Из свежего железа в пуле есть NVIDIA A30.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-05-20/dcb5655d-1026-4d72-99cc-90ede10fc8b2.webp" alt="" /></figure><p>Если речь идет о небольших моделях, агентных сценариях или более легком инференсе, доступны Tesla T4, A2 и консьюмерская линейка — GTX 1080, RTX 2080 Ti и RTX 4090. Для рендеринга, графических задач и рабочих станций VDI можно арендовать профессиональные RTX A2000, A4000 и A5000.</p><h2>Под какие сценарии подходит, как используют</h2><p>Платформу чаще используют под конкретные инфраструктурные задачи и этапы разработки:</p><p>Для R&amp;D-команд, которые занимаются машинным обучением, файн-тюнингом и глубоким обучением (Deep Learning), берут тяжелые конфигурации с A100 или A30. Мощности позволяют быстро обучать нейросети под классификацию изображений, распознавание речи (face recognition) и проверку на фрод.</p><p>Когда модель готова, её выносят в продакшн для стабильного инференса. Под такие задачи и алгоритмы машинного обучения собирают стенды на видеокартах нужного объема.</p><p>Отдельный пласт задач — транскодинг видео и работа с графикой. На серверах с GPU разворачивают среды для стриминга (с поддержкой NVIDIA NVENC и разрешением до 8192×8192), 3D-моделирования, видеомонтажа онлайн и развертывания удаленных рабочих мест (VDI). Также инфраструктуру применяют для научного моделирования и сложных параллельных CUDA-вычислений в инженерии, физике и математике.</p><h2>Как устроена инфраструктура и экосистема</h2><p>Инженерам не нужно долго ждать железо: облачные серверы с GPU поднимаются меньше чем за минуту, а физические выделенные серверы — от двух минут. Вы можете собрать сервер под свои задачи в конфигураторе или выбрать готовую к запуску сборку.</p><p>Для тех, кто не хочет возиться с голой инфраструктурой, у Selectel есть готовые PaaS-решения. В первую очередь это Managed Kubernetes — он упрощает развертывание контейнеров, масштабирование, настройку микросервисной архитектуры и CI/CD пайплайнов (от 5 958 ₽/мес). Также провайдер берет на себя администрирование облачных баз данных вроде PostgreSQL и Timescale.</p><p>Для работы с датасетами, весами и бэкапами к платформе подключается S3-совместимое объектное хранилище (от 0,81 ₽/мес) с тройной репликацией данных. Для сложной инфраструктуры можно использовать файловое хранилище (от 138 ₽/мес) и объединять локальные и облачные сети через глобальный роутер или Direct Connect.</p><h2>Автоматизация и DevOps</h2><p>Инфраструктуру можно поднимать не только руками через панель управления Selectel, но и встраивать в инженерный контур с помощью API.</p><h2>Тарификация</h2><p>Аренда доступна на гибких условиях: серверы можно брать на час, день или месяц. Точная стоимость зависит от выбранной конфигурации и типа аренды (облако или выделенный сервер). Для облачных решений есть оплата только за потребленные ресурсы.</p><h2>Ограничения и безопасность</h2><p>Selectel делает сильный упор на защиту данных. Серверы соответствуют требованиям 152-ФЗ до первого уровня защищенности. Инфраструктура имеет сертификат PCI DSS, ISO 27001, аттестаты ГИС К1 и СТР-К 1Г. Это значит, что на серверах можно хранить чувствительные персональные данные, медицинскую информацию и данные платежных карт.</p><p>Дополнительно в Selectel работает IAM-система для разграничения доступов и ролей, которую можно связать с внутренним SSO. Все проекты бесплатно получают базовую защиту от DDoS-атак на уровнях L3 и L4. Если нужна защита серьезнее, можно подключить фильтрацию трафика на уровне приложений L7 (от 2 600 ₽/мес).</p><h2>Глобальная GPU-инфраструктура и гранты на тесты от Timeweb Cloud</h2><p>На <a rel="nofollow noopener" href="https://timeweb.cloud/services/gpu">Timeweb Cloud</a> можно арендовать облачные и выделенные серверы под параллельные вычисления: машинное обучение, аналитику бигдаты, 3D-рендеринг, IoT и гейминг. Инфраструктура развернута в дата-центрах уровня Tier III в России, СНГ, Европе и США. Провайдер делает ставку на быстрый старт — облачные инстансы поднимаются за пару минут, а вычислительные ресурсы можно быстро масштабировать.</p><h3>Какие GPU доступны</h3><p>Вычислительный парк провайдера построен исключительно на графических процессорах NVIDIA. Под тяжелые AI-вычисления, работу с бигдатой и профессиональное ПО предоставляются серверы с GPU серии A: A2, A30, A2000, A4000, A5000 и A6000. Для виртуализации и ML-сценариев в облаке доступна Tesla T4.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-05-19/18b760f0-44f5-4dc9-9298-dc0b554a4907.webp" alt="" /></figure><p>Для гейминга, стриминга и рендеринга можно арендовать серверы на базе GeForce GTX (1080 DDR5X, 1080 Ti) или RTX с поддержкой тензорных и рейтрейсинг-ядер (2080 Ti, 3080, 3090, 4090).</p><p>Топовые корпоративные ускорители под крупные модели — Tesla H200 (141 ГБ), H100 (80 ГБ), A100 (80 ГБ) и L4 (24 ГБ) — пока предоставляются в формате предзаказа.</p><h3>Под какие сценарии подходит, как используют</h3><p>Платформу применяют под конкретные инфраструктурные задачи и этапы разработки:</p><p>Для ИИ и машинного обучения берут инстансы под обучение нейросетей, deep learning, сборку рекомендательных систем, чат-ботов и распознавание речи и изображений. Здесь в ход идут карточки Tesla T4 и решения серии A.</p><p>Для 3D-моделирования, анимации, архитектурного дизайна и трансляции игрового процесса в реальном времени собирают стенды на консьюмерских RTX или профессиональных видеокартах. Они закрывают потребности в рендеринге сложной графики без закупки собственных дорогих рабочих станций.</p><p>Отдельный пласт задач — научные вычисления и аналитика бигдаты. Мощности арендуют под прогноз климата, изучение генома, моделирование физических процессов и обработку данных с IoT-устройств (беспилотного транспорта, умных домов, производственных конвейеров).</p><h3>Как устроена инфраструктура и экосистема</h3><p>Архитектура облака построена с тройным региононезависимым резервированием. Это собственная разработка провайдера, которая снижает риск потери данных при локальных сбоях.</p><p>Помимо ВМ, в экосистему входят Managed-сервисы. Для оркестрации контейнеров можно развернуть Managed Kubernetes. Для хранения весов моделей и датасетов есть S3-совместимое объектное хранилище и облачные базы данных. Также в пуле сервисов доступны балансировщики нагрузки и маркетплейс. Если команда не хочет тратить время на перенос инфраструктуры, инженеры провайдера берут миграцию данных на себя.</p><h3>Автоматизация и DevOps</h3><p>Управлять ресурсами можно через веб-панель или программно, встраивая запуск в инженерный пайплайн. Для этого доступны классические инструменты автоматизации: API, CLI, Terraform и Cloud-init.</p><h3>Тарификация</h3><p>Тарифы формируются за месяц, но оплата работает по часовой модели — деньги списываются раз в час за реально потребленное время. В любой момент можно добавить процессоры (vCPU), оперативную память (RAM) или диски без простоя системы.</p><p>Для проверки гипотез и тестирования среды предусмотрен грант до 1 000 000 ₽ на срок до шести месяцев. Это позволяет обкатать архитектуру перед финальным решением о переезде.</p><h3>Ограничения и безопасность</h3><p>Особенность площадки — широкая география присутствия. Дата-центры стоят в Москве, Санкт-Петербурге, Сибири, Казахстане, Нидерландах, Германии, Турции, Финляндии и Нью-Йорке.</p><p>Платформа включена в Единый реестр российского ПО, соответствует требованиям 152-ФЗ, международного стандарта PCI DSS и ISO. Облако по умолчанию защищено от DDoS-атак, при необходимости фильтрацию можно точечно усилить на уровнях L3, L4 и L7.</p><h3>Поддержка и условия работы</h3><p>Техническая поддержка работает в режиме 24×7×365. Для проектов с бюджетом от 50 000 ₽ в месяц включается премиум-обслуживание: прямая связь с топ-менеджментом (CEO, CTO), ответы в режиме ASAP, возможность овердрафта и повышенные скидки.</p><h2>Виртуальные серверы с GPU для машинного обучения от Cloud4Y</h2><p>В Cloud4Y можно арендовать облачные GPU-серверы с видеокартами NVIDIA. Инфраструктура заточена под машинное обучение (ML), искусственный интеллект (AI), параллельные вычисления, работу с большими данными и 3D-графикой. Виртуальные инстансы помогают командам ускорить обработку датасетов и тренировку нейронных сетей без закупки собственного железа.</p><h3>Какие GPU доступны</h3><p>Cloud4Y делает ставку на проверенные корпоративные решения. Для машинного обучения, работы с графикой и высокопроизводительных вычислений (HPC) платформа предлагает видеокарты NVIDIA Tesla V100 и NVIDIA Tesla P100.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-05-19/ba09b0fd-534d-4b77-9572-324c28b5c8d4.webp" alt="" /></figure><p>Ресурсы предоставляются по модели vGPU. Доступны конфигурации с разным объемом видеопамяти под конкретные задачи — например, P100 с 8 ГБ или 16 ГБ, а также V100 с 1 ГБ или 2 ГБ видеопамяти на борту.</p><h3>Под какие сценарии подходит, как используют</h3><p>Платформу применяют под ресурсоемкие задачи, где мощностей центрального процессора уже не хватает. Графические процессоры увеличивают скорость вычислений до 8 раз по сравнению с CPU.</p><p>Для задач Data Science и обучения нейросетей (Deep Learning) мощности берут под сборку алгоритмов и анализ больших массивов данных. Инстансы можно использовать для разработки приложений виртуальной и дополненной реальности, а также для параллельных вычислений на базе архитектуры CUDA.</p><p>Отдельный сценарий — 3D-графика, транскодинг видео и рендеринг. Для этих задач на облачных серверах поднимают удаленные рабочие столы по технологии VDI (Virtual Desktop Infrastructure). Ресурсы vGPU равномерно распределяются между сессиями пользователей, а доступ к рабочему месту с графикой идет через стандартный RDP-клиент.</p><h3>Как устроена инфраструктура и экосистема</h3><p>Чтобы сократить время от аренды до первого запуска модели, у Cloud4Y есть готовые образы — DSVM (Data Science Virtual Machine). Серверы разворачиваются с уже предустановленными пакетами приложений: PyTorch, TensorFlow, Keras, XGBoost, Scikit-learn, OpenCV и Jupyter Notebooks.</p><p>Также из коробки доступны библиотеки NumPy и Pandas для ускорения процесса обучения. Для сложной оркестрации ML-процессов провайдер может развернуть готовый шаблон с Kubeflow.</p><p>В экосистему платформы входит S3-совместимое объектное хранилище, облачные базы данных и сервис Managed Kubernetes. Для надежности предусмотрено резервное копирование в облако и услуга Disaster Recovery (аварийное восстановление).</p><h3>Тарификация</h3><p>Арендовать графические мощности можно с почасовым или помесячным биллингом. Расчет стоимости по итогу месяца идет с округлением до целых единиц в большую сторону. Сама услуга vGPU приобретается как дополнение к базовой IaaS-инфраструктуре (облачному серверу). Бесплатно предоставляется интернет-канал на 100 Mbps с возможностью расширения до 1 Гбит/с.</p><p>Стоимость зависит от выделенного объема видеопамяти и ресурсов сервера:</p><ul><li>Базовый вариант для VDI и графики (NVIDIA GRID P100 ML vGPU) начинается от 3,39 ₽ за час.</li><li>Конфигурация под вычисления с V100 1 Gb (6 vCPU, 64 RAM, 120 SSD) обойдется от 25 ₽ за час.</li><li>Инстанс с P100 8 Gb (4 vCPU, 32 RAM, 120 SSD) стоит от 24,5 ₽ за час.</li><li>Более тяжелая сборка с P100 16 Gb (16 vCPU, 64 RAM, 120 SSD) тарифицируется от 46 ₽ за час.</li></ul><p>Аренда облачного железа позволяет сократить расходы на оборудование до 70%. Если текущих конфигураций недостаточно, провайдер может собрать GPU-сервер по индивидуальному запросу.</p><h2>Поддержка и условия работы</h2><p>Доступ к графическим ресурсам и серверам возможен круглосуточно из любой точки мира. Для тестирования гипотез новым клиентам предоставляют бесплатный тестовый доступ.</p><p>Рынок облачных вычислений отошел от простой гонки за самую дешевую видеокарту. Сейчас команды выбирают инфраструктуру, отталкиваясь от стоимости времени инженеров и этапа развития продукта.</p><p>Если проект находится на стадии проверки гипотез и вам нужно быстро добежать до инференса без возни с настройкой окружения, логично смотреть в сторону площадок вроде<b> immers.cloud.</b> Там фокус смещен на снятие рутины через готовые хабы моделей и стабильную работу железа под нагрузкой. Когда же продукт обрастает энтерпрайз-требованиями и требует развертывания тяжелых кластеров с прицелом на глобальный рынок, инфраструктурный подход меняется, и здесь можно посмотреть в сторону решений <b>ITGLOBAL.COM</b>.</p><p>Когда выбираете провайдера, считайте не только цену за час аренды GPU. Смотрите на время, которое команда тратит на поднятие среды и поддержку узлов. Правильное облако должно ускорять релизы, а не подкидывать девопсам новые таски в бэклог.</p>]]></content:encoded>
    </item>
    <item>
      <title>От GPU к платформе: как Selectel строит AI-инфраструктуру для бизнеса</title>
      <link>https://tproger.ru/articles/ot-gpu-k-platforme-kak-selectel-stroit-ai-infrastrukturu-dlya-bi</link>
      <comments>https://tproger.ru/articles/ot-gpu-k-platforme-kak-selectel-stroit-ai-infrastrukturu-dlya-bi?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Вика Овсянникова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/ot-gpu-k-platforme-kak-selectel-stroit-ai-infrastrukturu-dlya-bi</guid>
      <description><![CDATA[<p>Selectel анонсировал новый AI-сервер и публичный каталог LLM на конференции «MLечный путь». Разбираемся, как сбалансированная инфраструктура и партнерства ускоряют внедрение ИИ в энтерпрайз.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/ot-gpu-k-platforme-kak-selectel-stroit-ai-infrastrukturu-dlya-bi">От GPU к платформе: как Selectel строит AI-инфраструктуру для бизнеса</a>»</p>]]></description>
      <category><![CDATA[Конференции]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[DevOps]]></category>
      <category><![CDATA[Облачные технологии]]></category>
      <category><![CDATA[Аналитика]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 12 May 2026 10:30:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>22 апреля 2026 года в Москве прошла конференция «MLечный путь», которую Selectel проводит уже в шестой раз. В этом году организаторы собрали в одном зале бизнес и технические команды: бизнес-трек ориентирован на руководителей (CEO, CIO, CTO), аналитиков и специалистов по стратегическому внедрению ИИ, а технический трек — на инженеров, архитекторов и DevOps. Искусственный интеллект перестал быть игрушкой с потенциалом — он стал инструментом, который уже приносит деньги. Однако путь от первого пилота до промышленной эксплуатации до сих пор проходит далеко не каждая компания.</p><p>Selectel, крупнейший независимый провайдер IT-инфраструктуры в России (более 33 000 клиентов, 17 лет на рынке), на этой конференции не только анонсировал новые продукты, но и предложил системный взгляд на то, как строить AI-инфраструктуру, чтобы она работала на бизнес, а не против него.</p><h2>Главные анонсы Selectel: новый AI-сервер и развитие платформы</h2><p>Первый и, пожалуй, ожидаемый анонс — новый высокопроизводительный <b>AI-сервер Selectel</b>. Решение разработано с акцентом на сбалансированную архитектуру. Сервер представляет собой 8U-платформу с собственной материнской платой, поддержкой двух процессоров Intel Xeon 6 (до 144 ядер) и возможностью установки до 8 ТБ оперативной памяти DDR5. Ключевая особенность — до 16 графических ускорителей на ноду и продуманная топология PCI-линий, минимизирующая задержки при передаче данных между CPU, памятью и GPU.</p><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-05-12/f4f1ffc4-078a-4843-8192-1798f7d3d48b.webp" alt="mlечный путь Selectel" /><figcaption>Запуск нового AI-сервера — часть стратегии Selectel по формированию собственного портфеля серверных решений для ИИ.</figcaption></figure><p><i>«Новая аппаратная платформа обеспечит стабильную, быструю и предсказуемую работу AI-моделей в реальных условиях с полным контролем над данными и производительностью»,</i> — прокомментировал Дмитрий Шиченко, руководитель отдела разработки встроенных систем Selectel.</p><p>Второй важный анонс касается AI-платформы Selectel. Обновлённый <b>Foundation Models Catalog</b> переведён в публичный статус и теперь доступен всем клиентам. Каталог позволяет разворачивать LLM на выделенной инфраструктуре с поддержкой автомасштабирования, получать логи и метрики инференса (observability), управлять сервисами через REST API. В качестве основного движка инференса используется vLLM — высокопроизводительный open-source фреймворк, увеличивающий производительность без роста затрат.</p><p>В каталог уже добавлены модели IBM Granite, Alibaba Qwen, DeepSeek, Microsoft Phi, Mistral AI, а в ближайшее время появятся Kimi, GLM, Gemma, Whisper и другие. Оплата сейчас идёт за фактические вычислительные ресурсы, а в ближайшее время станет доступна тарификация по токенам.</p><p><i>«Наша задача — обеспечить компаниям быстрый переход от экспериментов с AI к экономически эффективному применению. Мы предоставляем не просто "железо", а комплексный набор решений — от серверов c GPU до платформенных продуктов, закрывающих задачи пилотных проектов и промышленной эксплуатации»,</i> — отметил Александр Тугов, директор AI-вертикали Selectel.</p><h2>Единое окно для внедрения ИИ-агентов</h2><p>Ещё одно важное событие конференции — начало сотрудничества Selectel с российским вендором Data Sapience и консалтинговой группой GlowByte. Партнёры объявили о создании комплексных решений для корпоративных заказчиков: от бизнес-задачи до промышленной эксплуатации ИИ-агентов и больших языковых моделей.</p><p>В рамках партнёрства Selectel подтвердил технологическую совместимость инфраструктуры с платформой Kolmogorov AI от Data Sapience, которая обеспечивает полный цикл работы с моделями — от подготовки данных до мониторинга и оркестрации в промышленном контуре. Selectel предоставляет гибкую инфраструктуру (публичное и частное облако, аренду выделенных серверов, размещение GPU на площадке клиента, в том числе в аттестованных сегментах ЦОД), а GlowByte выступает интеграционным партнёром: консалтинг, архитектура, дообучение моделей и сопровождение.</p><p>Такой подход позволяет компаниям получать end‑to‑end предложение «из одного окна», сокращая время от пилота до реального внедрения и обеспечивая соответствие регуляторным требованиям. Решения ориентированы на автоматизацию сложных процессов, поддержку принятия решений, анализ больших данных и построение приватных ИИ-сред в условиях строгой безопасности.</p><p><i>«В партнёрстве с Data Sapience и GlowByte мы объединяем экспертизу инфраструктурного провайдера, вендора платформенных решений и консалтинговой компании, чтобы упростить компаниям путь к эффективному внедрению ИИ»,</i> — прокомментировал Александр Тугов.</p><h2>Экосистема вокруг платформы: что обсуждали на техническом треке</h2><p>Кроме докладов команды Selectel, на техническом треке выступили эксперты из других компаний. Своим опытом поделились:</p><ul><li>Антон Алексеев, MLOps-инженер AvitoTech рассказывал о построении централизованной ML-платформы;</li><li>Владислав Шевченко, CTO red_mad_robot рассказывал про кризис SDLC и объяснял, почему нельзя просто написать код и ждать результата;</li><li>Максим Пантелеев, руководитель направления Core M&amp;D. Wildberries &amp; Russ поделился последними результатами исследования интерпретируемости LLM по мотивам участия в сообществах и опыта работы над проектами red- и blue-teaming LLM.</li></ul><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-05-12/6d29af1b-d956-40ff-ac6c-753b79747834.webp" alt="Selectel конференция" /><figcaption>Антон Алексеев, MLOps-инженер AvitoTech делится своим докладом</figcaption></figure><p>Программа технического трека подтвердила главный тренд: ИИ-инфраструктура и платформенный подход становятся сквозной темой для разных отраслей.</p><h2>Почему AI-инфраструктура — это не просто GPU</h2><p>AI-инфраструктура не исчерпывается графическими ускорителями. В реальном пайплайне инференса LLM нагрузка распределяется между сетевыми картами, оперативной памятью, CPU (пред- и постобработка, токенизация, формирование батчей), PCI-шиной и только потом — GPU. Каждый этап может стать узким горлышком.</p><p><i>«Просто взять графический ускоритель и запустить на нём модель — это как поехать на болиде Формулы-1 по гравию. Двигатель мощный, но быстрее не станет»,</i> — пояснил Дмитрий Шиченко.</p><p>Именно поэтому при разработке нового AI-сервера в Selectel сделали упор на баланс ресурсов: процессоры последнего поколения с высокими частотами, 4 ТБ оперативной памяти на частоте 6400 МТ/с, высокоскоростные интерконнекты (до 128 ГБ/с между CPU и GPU, до 900 ГБ/с между GPU через NVLink). И топологию материнской платы с детерминированной архитектурой PCI-линий.</p><p><i>«Привычный закон Мура для AI больше не работает. У нас теперь закон Хуанга: GPU морально устаревают за 2 года, а не за 5–7. Амортизировать серверное железо по старым правилам — значит гарантированно проиграть по TCO»,</i> — считает Владислав Кирпинский,  директор по облачной интеграции Selectel.</p><h2>Как выглядит эффективный инференс на реальных задачах</h2><p>Технические результаты наглядно показывают, что даёт сбалансированная архитектура.</p><p>Сценарий 1.</p><ul><li>Модель на 400 млрд параметров (Qwen 3.5), длинный контекст, сотни одновременных пользователей.</li><li>Конфигурация: 8 × H100, 112 ядер CPU, 512 ГБ RAM.<br /></li><li>Результат: 500 токенов в секунду.<br /></li></ul><p><i>«При 150 токенах в секунду нейросеть уже отвечает быстрее, чем человек читает. А 500 токенов — это инференс с большим запасом для реальных Enterprise-нагрузок»,</i> поясняет Дмитрий Шиченко, руководитель отдела разработки встроенных систем Selectel.</p><p>Сценарий 2.</p><ul><li>Модель на 1 трлн параметров (Kimi k2, Mixture of Experts), ещё более длинный контекст, до 1000 пользователей.</li><li>Конфигурация: RTX 6000 Pro Server Edition (увеличенный объём VRAM), 2 ТБ RAM.<br /></li><li>Результат: 150 токенов в секунду — более чем достаточно для диалоговых систем и ассистентов.<br /></li></ul><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-05-12/de2672a9-818d-4337-9d0e-aac381428409.webp" alt="AI-сервер Selectel" /></figure><h2>Итоги: AI-инфраструктура как стратегический актив</h2><p>Конференция «MLечный путь» наглядно показала: рынок AI в России перешёл от экспериментов к промышленному внедрению. Но бизнес сталкивается с системными барьерами — от выбора правильного железа до построения платформ, которые позволяют масштабировать успешные пилоты.</p><p>Selectel на этом фоне предлагает комплексную историю:</p><ul><li>Инфраструктура — собственные сбалансированные AI-серверы, широкая линейка GPU (от потребительских до enterprise), гибкие модели потребления (BareMetal, облако, аренда на площадке клиента, гибрид).</li><li>Платформа — Foundation Models Catalog в публичном доступе, observability, API‑управление, поддержка vLLM.</li><li>Экспертиза — собственные инженеры, разработка серверов и материнских плат, независимость от поставщиков.</li><li>Развитие направления партнерств с ведущими российскими AI-вендорами, обладающими экспертизой для решения отраслевых и специализированных бизнес-кейсов.<br /></li></ul><p>Как отметил один из спикеров конференции: «GPU без платформы — это кирка без рудника». Selectel же предлагает и кирку, и рудник, и карту местности. Для Enterprise это означает снижение рисков, предсказуемое TCO и возможность сфокусироваться на бизнес‑результатах, а не на том, почему инференс тормозит или почему GPU не окупаются за 5 лет.</p><p>AI‑инфраструктура перестаёт быть историей про «купить железо». Она становится историей про управляемость, экономику и скорость изменений. Именно этот переход — от GPU к платформе — стал главным итогом «MLечного пути».</p>]]></content:encoded>
    </item>
    <item>
      <title>Сравнение гибридных языковых моделей класса 9B для промышленного инференса</title>
      <link>https://tproger.ru/articles/sravnenie-gibridnyh-yazykovyh-modelej-klassa-9b-dlya-promywlennogo</link>
      <comments>https://tproger.ru/articles/sravnenie-gibridnyh-yazykovyh-modelej-klassa-9b-dlya-promywlennogo?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Дмитрий Ходыкин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/sravnenie-gibridnyh-yazykovyh-modelej-klassa-9b-dlya-promywlennogo</guid>
      <description><![CDATA[<p>В материале сравниваются три открытые гибридные модели класса 9B (NVIDIA Nemotron‑Nano‑9B‑v2, Bamba‑9B‑v2, Qwen3.5‑9B) с референсной плотной Llama 3.1 8B. На основе моделирования под нагрузкой 4096 входных и 256 выходных токенов на одном H200</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/sravnenie-gibridnyh-yazykovyh-modelej-klassa-9b-dlya-promywlennogo">Сравнение гибридных языковых моделей класса 9B для промышленного инференса</a>»</p>]]></description>
      <category><![CDATA[Производительность]]></category>
      <category><![CDATA[Работа]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[IBM]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[Маркетинг]]></category>
      <category><![CDATA[QA]]></category>
      <category><![CDATA[Аналитика]]></category>
      <category><![CDATA[аналитик]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 30 Apr 2026 09:07:23 GMT</pubDate>
      <content:encoded><![CDATA[<p>Выбор языковой модели с 8–9 млрд параметров для задач промышленного инференса — инженерная задача, требующая учёта нескольких факторов. Модель должна работать на ограниченном парке ускорителей, обеспечивать приемлемую задержку и показывать достаточное качество на таких задачах, как чат-боты, саммаризация документов, генерация кода и аналитика длинных контекстов. Классический подход — использование проверенной плотной модели Llama 3.1 8B — даёт стабильный результат, однако упирается в расход памяти на KV‑кеш, что ограничивает число одновременно обслуживаемых запросов.</p><p>Альтернативой выступают гибридные архитектуры, в которых традиционное внимание чередуется с более экономичными механизмами: Mamba‑2, Gated DeltaNet. Разработчики этих моделей заявляют о радикальном снижении потребления памяти и повышении пропускной способности без потери качества. В данном материале рассматриваются три открытые гибридные модели — NVIDIA Nemotron‑Nano‑9B‑v2, Bamba‑9B‑v2 (IBM) и Qwen3.5‑9B (Alibaba) — и сравниваются с референсной плотной моделью Llama 3.1 8B.</p><p><b>Методика моделирования</b></p><p>Моделирование проводилось для одного ускорителя NVIDIA H200 с 141 ГБ видеопамяти при типичной нагрузке: 4096 входных токенов и до 256 выходных. Рассчитывались следующие метрики: память на один экземпляр с учётом весов, оверхеда и KV‑кеша (Instance VRAM); полное время ответа (E2E Latency); пропускная способность одного экземпляра в запросах в секунду (RPS per replica); требуемый объём памяти на единицу пропускной способности (VRAM/RPS); максимальное число параллельных запросов, ограниченное исключительно памятью. Расчёты верифицировались с помощью расширенного симулятора InferSim и по данным публичных бенчмарков.</p><p><b>Результаты</b></p><figure><img src="https://media.tproger.ru/user-uploads/137657/2026-04-30/213cf68a-3c91-4545-a4f4-ebba0d3f8bfe.webp" alt="" /><figcaption>Результаты моделирования относительно референсной Llama 3.1 8B</figcaption></figure><p><b>Особенности производительности моделей</b></p><p>Разница на порядок по KV-cashe у Nemotron обусловлена архитектурой. Модель содержит 56 слоёв, из которых лишь четыре используют полноценное внимание с KV‑кешем, а остальные 52 — сверхбыстрые Mamba‑2‑блоки. Mamba‑2 работает как рекуррентная сеть: вместо хранения растущей таблицы ключей и значений для каждого токена она обновляет компактное скрытое состояние фиксированного размера. В результате для запроса длиной 4096 + 256 токенов KV‑кеш Nemotron занимает около 68 МБ — примерно в восемь раз меньше, чем у Llama. Именно поэтому модель способна удерживать в памяти почти 2000 одновременных запросов; узким местом становится не память, а вычислительная мощность GPU.</p><p>Архитектура Qwen3.5 построена на чередовании Gated DeltaNet и Gated Attention. Большинство слоёв использует механизм линейного внимания, который подобно Mamba‑2 оперирует скрытым состоянием постоянного размера, не порождая тяжёлого KV‑кеша. Однако у этого подхода есть обратная сторона: Gated DeltaNet работает последовательно, послойно обновляя внутреннее состояние, и плохо утилизирует матричные вычисления GPU. На коротких дистанциях классический Attention с его эффективным матричным умножением способен загрузить видеокарту почти полностью, тогда как GDN‑слои проигрывают в чистой скорости. В результате TTFT у Qwen3.5 для 4096 токенов составляет 1.86 с против 1.32 с у Llama. На очень длинных контекстах (100K токенов и выше) ситуация меняется: классический KV‑кеш становится тормозом, а Gated DeltaNet продолжает работать с прежней эффективностью.</p><p><b>О качестве и специализации моделей</b></p><p>Каждая из рассмотренных моделей имеет собственную нишу, определяемую не только скоростью, но и метриками качества.</p><p>Llama 3.1 8B — референсная плотная модель. Показывает 69.4% на MMLU и 72.6% на HumanEval. Это проверенный универсал для задач, где важна предсказуемость и стабильность, а не максимальная производительность.</p><p>Nemotron‑Nano‑9B‑v2 позиционируется как математик и кодер. По данным NVIDIA, модель достигает 72.1% на AIME25, 97.8% на MATH500, 64.0% на GPQA Diamond и 71.1% на LiveCodeBench. Эти результаты делают её сильнейшим вариантом для задач, требующих точных вычислений и генерации корректного кода.</p><p>Qwen3.5‑9B является универсальным «эрудитом». Модель превосходит GPT‑OSS‑120B по MMLU‑Pro (82.5%) и GPQA Diamond (81.7%), а также показывает 83.2% на HMMT. Высокое качество на широком спектре тестов позволяет использовать её в сценариях, где важны широкий кругозор и точность ответов.</p><p>Bamba‑9B‑v2 — быстрый универсал, превосходящий Llama 3.1 8B по среднему баллу OpenLLM v2. Она не специализируется на одной задаче, но обеспечивает хорошее качество при заметно более высокой скорости.</p><p><b>Рекомендации</b></p><ul><li>Для чат-ботов и потоковой обработки с высокой пропускной способностью оптимален Nemotron‑Nano‑9B‑v2 — он в полтора раза быстрее Llama и примерно на 30% эффективнее использует память (VRAM/RPS 45.8 против 65.0 ГБ·с).</li><li>Для саммаризации, аналитики документов и агентных систем, где во главе угла широкий кругозор и качество ответа, лучше подходит Qwen3.5‑9B.</li><li>Bamba‑9B‑v2 занимает промежуточную позицию: она даёт заметный прирост скорости при сопоставимом с Llama объёме памяти и может использоваться как универсальный инструмент.</li></ul><p><b>Заключение</b></p><p>Большие языковые модели по‑прежнему требуют значительных вычислительных ресурсов. Однако прогресс в архитектурах — Mamba‑2, Gated DeltaNet — шаг за шагом снижает стоимость владения: на одном H200 теперь можно обслужить заметно больше клиентов, чем год назад. Выбор модели перестаёт быть гаданием по маркетинговым обещаниям и превращается в инженерную задачу с чёткими метриками.</p><p>Автор продолжает калибровку симулятора на реальных замерах и готов делиться обновлёнными данными. Читатели, имеющие опыт промышленного развёртывания этих или аналогичных моделей, приглашаются к обсуждению.</p>]]></content:encoded>
    </item>
    <item>
      <title>DLSS 5 — не провал. Будущее рендеринга: глубокий технический взгляд на новые подходы после 15-ти лет в геймдеве</title>
      <link>https://tproger.ru/articles/dlss-5-ne-proval-budushhee-renderinga-glubokij-tehnicheskij-vzg</link>
      <comments>https://tproger.ru/articles/dlss-5-ne-proval-budushhee-renderinga-glubokij-tehnicheskij-vzg?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Elijah]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/dlss-5-ne-proval-budushhee-renderinga-glubokij-tehnicheskij-vzg</guid>
      <description><![CDATA[<p>Сегодня мы с вами погрузимся в технические дебри революции графического рендеринга. Проследим историю его развития, и конечно, заглянем в ближайшее будущее, где стирается грань между "рендерингом" и "генерацией". В этой статье вы найдете технический разбор современных технологий рендеринга, а также узнаете, почему революция уже пришла, но как и прошлые революции, вы просто не помните о них.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/dlss-5-ne-proval-budushhee-renderinga-glubokij-tehnicheskij-vzg">DLSS 5 — не провал. Будущее рендеринга: глубокий технический взгляд на новые подходы после 15-ти лет в геймдеве</a>»</p>]]></description>
      <category><![CDATA[Разработка игр]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Компьютерная графика]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[3D-технологии]]></category>
      <category><![CDATA[Инновации]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Техника]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 30 Apr 2026 05:45:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>В этой статье мы опустим маркетинговый провал Nvidia и технически сырые демо-версии, а скорее погрузимся в недалекое техническое будущее, которое ждет нас в игровой индустрии, <b>пройдя через историю графического конвейера.</b></p><h2>Начало революции в графическом конвейере</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/4b29762f-5a22-4439-bafc-de1a5ecb45b0.webp" alt="DLSS vs FSR vs TSR" /><figcaption>DLSS vs FSR vs TSR</figcaption></figure><p>За последние пять лет <b>в архитектуре рендеринга в играх произошел по-настоящему огромный сдвиг</b>. Если на протяжении двух десятилетий до этого, прогресс упирался в неумолимую математику закона Мура, где улучшение качества рендеринга сводилось к росту вычислительной мощности и увеличению количества полигонов и шейдеров, то сегодня все изменилось. Теперь для достижения высокого визуального качества в играх стала не грубая сила в лоб, <b>а новые подходы, которые меняют устоявшуюся за десятилетия суть самого построения игровой картинки</b>, в том числе на основе технологий ИИ. На сегодняшний день более 80% всех пикселей на экране в самых передовых (с технической точки зрения) играх проходят не классический путь, а смешанные подходы и новые уловки (новые подходы в вычислении света, супер-семплинг на основе ИИ и др).</p><p><b>Сегодня мы остановимся на том, как повлиял (и будет дальше влиять) ИИ на рендеринг в играх</b>, чтобы понять суть сдвига в графике. Для этого мы изначально рассмотрим две ключевые темы: во-первых, фундаментальные отличия DLSS от всех предыдущих подходов к повышению разрешения и сглаживанию (от SSAA до TAAU), а во-вторых, место, которое нейросетевое масштабирование занимает в современном графическом конвейере, после чего сделаем обзор на ближайшее будущее рендеринга в играх.</p><h2>От супер-сэмплинга к нейронному синтезу сцены</h2><p>Чтобы оценить место DLSS (в том числе и будущей 5-ой версии) в графическом пайплайне, мы проследим путь эволюции сглаживания и масштабирования от самых первых реализаций до современного подхода с использованием ИИ-вычислений.</p><h2>Эпоха "чистой математики": SSAA, MSAA, FXAA и их ограничения</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/39c179b9-4119-4094-9c72-3ca0516138d1.webp" alt="" /><figcaption>Наверняка многие из нас вспомнят эти страшные сочетания букв при выборе сглаживания в настройках игр</figcaption></figure><p>Классические методы борьбы с "лесенками" на границах игровых объектов были основаны на простом, но дорогом для вычислений принципе: обработке изображения с более высоким разрешением или его частей.</p><p><b>Посмотрим на три классических алгоритма сглаживания в играх:</b></p><ul><li>SSAA (Supersampling Anti-Aliasing): Самый "честный", но и прожорливый метод. Сцена рендерится в разрешении, превышающем целевое у пользователя (например, в 4K для вывода на FHD-монитор), а затем полученный кадр сжимается обратно до нужного размера. SSAA обрабатывает каждый суб-пиксель, включая затенение, что дает эталонное качество картинки, но приводит к падению производительности (надеюсь, вы понимаете, почему). Для современных игр со сложными шейдерами и геометрией этот подход непрактичен.</li><li>MSAA (Multisample Anti-Aliasing): Этот метод появился, как попытка оптимизировать SSAA. Суть оптимизации сводится к тому, что обработка затенения производится только один раз для каждого примитива (например треугольника) внутри пикселя, а не каждый сэмпл, как это делает SSAA. Хотя такой подход и значительно снижает нагрузку на GPU, стоит учесть, что MSAA эффективно сглаживает только края геометрии, но не справляется с другими элементами пайплайна, как например, сглаживанием текстур. Также его стоимость все еще остается высокой для сложных сцен.</li><li>FXAA (Fast Approximate Anti-Aliasing): Сглаживание на уровне постобработки, которое анализирует уже готовый 2D-кадр, ищет в нем высоко-контрастные границы и размывает их. Это самый "дешевый" с точки зрения производительности метод, но его главный недостаток, в итоге - неизбежное "мыло" всей картинки, включая текстуры и элементы интерфейса, что приводит к потере четкости и детализации.</li></ul><h2>Эра темпорального накопления: TAA и его наследники (TAAU)</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/dc6e3baa-6653-4e17-93b3-7bba6a685619.webp" alt="" /><figcaption>TAAU в конвейере рендеринга</figcaption></figure><p>Ключевой прорыв произошел с переходом к темпоральным методам, которые используют информацию не только из текущего кадра, но и из предыдущих.</p><p><b>Что же изменилось в подходах:</b></p><ul><li>TAA (Temporal Anti-Aliasing): Вместо того чтобы рендерить каждый пиксель, TAA слегка смещает положение камеры каждый кадр, накапливает информацию с предыдущих кадров, используя моушн векторы объектов, и затем вычисляет среднее значение. Это позволяет получить качество, близкое к SSAA, при производительности, сопоставимой с одной отрисовкой кадра. TAA стал отраслевым стандартом на долгие годы, но у него есть свои фундаментальные проблемы: гоустинг, потеря детализации на мелких и быстро движущихся объектах и общее "мыльное" ощущение от картинки в некоторых реализациях и сценах.</li><li>TAAU (Temporal Anti-Aliasing Upsampling): Логическое развитие TAA. Понимая, что темпоральное накопление позволяет восстанавливать детали из субпиксельной информации, разработчики начали применять его для масштабирования изображения, рендеря сцену в более низком разрешении и "апскейля" в высокое, используя историю кадров.</li></ul><p><b>Именно TAAU является прямым предшественником DLSS</b>, но с одним критическим отличием: TAAU полагается на жестко заданные правила и не способен "понимать" сцену, а лишь математически усредняет пиксели, что часто приводит к артефактам.</p><h2>Революция DLSS: от CNN до Vision Transformer</h2><p><b>NVIDIA DLSS (Deep Learning Super Sampling)</b> и её аналог FSR совершили качественный скачок, заменив чисто математические подходы TAAU на модели машинного обучения, способные принимать более "интеллектуальные" решения о том, как именно восстанавливать изображение.</p><p>Первые поколения использовали <b>сверточные нейронные сети (CNN)</b>. Их главный недостаток - это "близорукость": модель анализировала пиксели только в рамках ограниченного пространственного окна (рецептивного поля или же область входного изображения). Это приводило к хорошо знакомым геймерам проблемам: если объект двигался слишком быстро, CNN "теряла" его из виду, что вызывало мерцание и гоустинг на мелких деталях вроде листвы, проводов или волос.</p><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/c9f00556-8591-421b-931f-8132ea6ee1fd.webp" alt="" /><figcaption>Как работают модели на Vision Transformer</figcaption></figure><p>Переход на архитектуру <b>Vision Transformer в 4-ой версии DLSS</b>, стал фундаментальным прогрессом. <b>В отличие от CNN</b>, Transformer может оценивать значимость и взаимосвязь любых пикселей в кадре, независимо от расстояния между ними, благодаря дополнительному механизму внимания. Модель научилась "понимать" контекст всей сцены, что позволило радикально повысить стабильность изображения, уменьшив количество артефактов и впервые приблизить картинку после апскейла очень близко сопоставимой с нативным разрешением (а иногда и превосходить её по четкости).</p><h2>Техническая интеграция в графический конвейер: Место DLSS в пайплайне рендеринга</h2><p><b>DLSS не является "черным ящиком"</b>, который просто получает на вход низкое разрешение и выдает высокое. <b>Это сложная система, глубоко интегрированная в процесс рендеринга</b>, требующая от разработчиков не только вызова API, но и подготовки специфических данных. <b>Поэтому, когда вы видите плохой DLSS - возможно, дело в самом разработчике игры, а не технологии.</b></p><p><b>Входные данные: что нужно для работы DLSS</b></p><p>Для корректной работы DLSS графический движок игры должен предоставить специальный набор буферов, <b>каждый из которых критически важен для алгоритма:</b></p><ol><li>Color Buffer: Грубо говоря, это кадр, отрендеренный в пониженном разрешении. Это "грубый набросок", на основе которого будет строиться финальное изображение.</li><li>Motion Vectors: Критически важный компонент. Для каждого пикселя этот буфер показывает, куда он переместился по сравнению с предыдущим кадром. Это позволяет DLSS понять динамику сцены, корректно связать пиксели из разных кадров и избежать эффекта гоустинга.</li><li>Depth Buffer: Информация о расстоянии от камеры до каждого пикселя. Он помогает модели понять структуру сцены и то, какие объекты перекрывают друг друга, что особенно важно для правильной обработки краев геометрии.</li><li>Jitter Offsets: Чтобы получить больше информации, чем содержится в одном кадре, камера в каждом кадре слегка смещается на долю пикселя по особому паттерну (как в ранее описанном TAA). DLSS должен точно знать величину этого смещения, чтобы "вычесть" его из векторов движения и корректно совместить пиксели из разных кадров.</li></ol><p><b>Как DLSS встраивается в конвейер</b></p><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/ecd8a218-4462-41a4-b3d1-7975c67f2ba2.webp" alt="" /><figcaption>Классические операции в конвейере</figcaption></figure><p><b>DLSS встраивается не в любой момент</b>, а в строго определенном месте графического пайплайна. Интеграция с игровым движком происходит через открытый SDK, который предоставляет интерфейс для технологий (DLSS, Reflex, и т.д.).</p><p><b>Пример этапов конвейера с учетом работы DLSS:</b></p><ol><li>Рендеринг геометрии и шейдинг: Игровой движок выполняет всю "тяжелую" работу: просчитывает геометрию, освещение, материалы и тени. Все это происходит в пониженном разрешении.</li><li>Ранний пост-процессинг: DLSS должен быть встроен до применения таких эффектов, как шум (film grain), хроматические аберрация, виньетки и, самое главное, до пользовательского интерфейса (UI). Это необходимо, чтобы нейросеть работала с "чистым" изображением сцены, а не с наложенными поверх эффектами, которые могут сбить ее с толку и исказить финальный результат.</li><li>Вызов DLSS: На этом этапе все подготовленные входные данные (буферы цвета, глубины, моушн векторы) передаются в DLSS. Модель обрабатывает их, используя свои веса, и генерирует финальный кадр в целевом (высоком) разрешении.</li><li>Поздний пост-процессинг и UI: После того как DLSS выполнил свою работу, поверх полученного высококачественного изображения накладываются эффекты, которые должны оставаться "родными" для разрешения монитора (хроматическая аберрация, виньетка и т.д.), и, что самое важное, интерфейс в целевом разрешении, оставаясь максимально четким и неискаженным.</li><li>Вывод на экран: Финальный кадр отправляется на дисплей.</li></ol><p>Всё это открывает путь к массовому внедрению технологий, в особенности, когда DirectX 12 и другие вендоры открывают новые подходы, подобные DLSS, на основе ИИ рендеринга (сжатие текстур, материалов) на уровне API, делая их стандартной частью инструментария современного разработчика.</p><h2>DLSS 5: сдвиг парадигмы к нейронному синтезу сцены</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/4d4dbe8e-3e83-45a9-9e02-54ab23cf883e.webp" alt="" /><figcaption>Nvidia DLSS 5</figcaption></figure><p><b>DLSS 5 дает старт переопределения самого подхода к постановке задачи.</b> Если предыдущие версии работали с уже отрендеренным кадром, восстанавливая или достраивая пиксели, то новая модель оперирует структурными данными движка: depth buffer, albedo, motion vectors, нормали, идентификаторы материалов и освещения. Сеть не просто «дорисовывает» - она переосмысливает визуальные свойства сцены.</p><p><b>NVIDIA заявляет, что DLSS 5 способен анализировать семантику сцены:</b> распознавать кожу, волосы, ткани, различные типы освещения, и генерировать более точные пиксели для подповерхностного рассеяния (subsurface scattering) на коже или более реалистичные отклики материалов. Речь идёт о контролируемой модификации финального изображения, остающейся детерминированной и темпорально стабильной.</p><p>То, что многие "эксперты" ругались на финальный результат, скорее сейчас - это просто сырость самой технологии и "рукастость" разработчиков, которые помогали создавать техно-демонстрацию. Стоит учитывать, что меняется сам подход к рендерингу, так что первые шаги будут шакальными, но этот путь проходили и более ранние технологии без ИИ.</p><h2>Multi Frame Generation: от линейной интерполяции к адаптивному синтезу</h2><h2>Математика генераций кадров</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/14681021-1cd5-4cae-b785-ee9e54bcf477.webp" alt="" /><figcaption>Большая часть технологий не была изобретена сразу - это эволюция, которую обыватель не замечал</figcaption></figure><p><b>В классической схеме генерации кадров (DLSS 3)</b> на каждый рендеренный кадр генерировался один интерполированный, что давало прирост в скорости примерно на 100%. DLSS 4 увеличил прирост еще примерно в два раза (три сгенерированных кадра на один рендеренный).</p><p><b>Ключевой вопрос:</b> при каком FPS это имеет смысл? Предположим, что при входном потоке 60 FPS после супер-сэмплинга выход может достигать 360 FPS на дисплее. Это соответствует временному окну ~16.6 мс между рендеренными кадрами, внутри которого нейросеть должна предсказать пять промежуточных состояний сцены. Подумайте сами над ответом и напишите в комметах.</p><p><b>Вообще, в архитектуре Blackwell, которая служит базой для предсказания движения</b>, на высоких коэффициентах генерации линейная интерполяция моушн векторов становится недостаточной. DLSS 4.5 добавляет динамическую регулировку коэффициента: в сценах с высокой сложностью (например, взрывы частиц) модель может снижать коэффициент, чтобы сохранить качество, а в относительно статичных сценах - повышать. <b>Однако опять же, дело за разработчиками.</b></p><p><b>И вот тут то стоит сделать ремарку. </b>Инженеры Nvidia - люди, которые работают сугубо над тем, чтобы двигать свою технологию вперед, а графические программисты, которые работают над рендерингом, мало того, что занесены в красную книгу, во-первых, привыкли к устоявшимся подходам и не могут быстро переключиться на обновленный пайплайн рендера ничего не сломав, а во-вторых, как и все придерживаются сроков релизов. <b>Если вы представляете примерно, что скрывается под "перестроить графический пайплайн", то должны понимать, почему на первых порах неизбежны косяки в использовании новой технологии.</b></p><h2>Проблема в задержках ввода (инпат-лаг) и решение через Reflex</h2><p>Генерация промежуточных кадров фундаментально увеличивает инпат-лаг: тобишь, сгенерированный кадр не содержит реакции на ввод пользователя, эта реакция появляется только в следующем рендеренном кадре.</p><p>NVIDIA компенсирует это технологией Reflex, которая синхронизирует CPU и GPU таким образом, чтобы очередь рендеринга была минимальной. Однако, реализация также сильно зависит от игрового движка и правильности встраивания в общий жизненный цикл рендеринга и остальной логики.</p><h2>А что, если сжимать данные, а не пиксели?</h2><p>DLSS - это конечно круто и у всех на слуху. Но это лишь один из подходов, где используется ИИ в процессе рендеринга. Давайте посмотрим на другие подходы.</p><h2>Сжатие текстур с использованием ИИ: экономия видео-памяти</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/81d5e613-2abc-4e47-94d3-7de6fd5f6c45.webp" alt="" /><figcaption>Зачем жать пиксели, если можно жать текстуры? Ведь они и так сжимаются.</figcaption></figure><p>Одна из наиболее острых проблем современного геймдева: огромный рост объёмов текстур. Традиционные блочные методы сжатия (BC1-BC7) достигают коэффициентов 4:1 &lt;=&gt; 8:1, но их эффективность упирается в фундаментальные ограничения: сжатие происходит независимо для каждого блока, без учёта глобальной структуры текстуры.</p><p><b>Инженеры решили подойти к задаче принципиально иначе:</b> вместо хранения сжатого изображения, хранится обученная нейросеть (или её веса), способная реконструировать текстуру произвольного разрешения в рантайме. <b>Например, NVIDIA, заявляет о семикратном сокращении использования VRAM</b> и системной памяти по сравнению с традиционными блочно-сжатыми текстурами при сопоставимом визуальном качестве.</p><p><b>Технически это работает следующим образом: </b>на этапе сборки игры текстуры пропускаются через процедуру обучения, занимающую менее минуты на тысячи ассетов (в зависимости от железа, конечно). Результатом является компактное представление для модели, которое при загрузке в память распаковывается тензорными ядрами в реальном времени. Поскольку распаковка происходит «на лету», отпадает необходимость хранить в видео-памяти одновременно все MIP-уровни. ИИ может генерировать нужный уровень по требованию.</p><p>Для AAA-игр это означает не только экономию видео-памяти, но и радикальное сокращение размера самих игр, ускорение загрузки и возможность увеличить плотность текстур без роста требований к памяти.</p><h2>Компрессия шейдеров и материалов</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/f6d48846-0836-4d0c-af22-4f62f8e3b3a0.webp" alt="" /><figcaption>Фото-реалистичные шейдеры - это так же удар по производительности</figcaption></figure><p><b>Сложные материалы - это слоистые структуры, комбинирующие десятки карт и сотни математических операций.</b> Рендеринг материалов высокого уровня (например, фарфор, шёлк, многослойная кожа) в реальном времени до сих пор был непрактична из-за высокой вычислительной стоимости.</p><p><b>ИИ-шейдеры используют обученные нейросети</b> для вычисления сложного шейдерного кода.</p><p><b>Архитектурно это означает,</b> что вместо выполнения полного графа шейдера на каждом пикселе, GPU выполняет инференс, который выдаёт финальные параметры шейдера. Выигрыш достигается за счёт того, что тензорные ядра выполняют матричные операции существенно эффективнее, чем шейдерные ядра.</p><h2>Инференс вместо трассировки лучей</h2><p>Все знают, насколько <b>прожорливой остается трассировка лучей</b> - Ray Tracing и, в особенности, Path Tracing. <b>Path tracing требует трассировки сотен или тысяч лучей на пиксель для схождения непрямого освещения. </b>Новый подход позволяет заменить большую часть этой работы инференсом: после трассировки одного-двух отскоков, нейросеть предсказывает результат бесконечного числа последующих отскоков.</p><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/ff7636f5-0838-427d-82c5-15fd2207e888.webp" alt="" /><figcaption>Пример сочетания Path Tracer и Nvidia Neural Radiance Cache</figcaption></figure><p>К примеру, подобная технология (NRC) уже стала доступна через RTX Global Illumination SDK и вскоре появится в RTX Remix. Практическое следствие такого подхода - это возможность достижения визуального качества традиционного Path Tracing с производительностью, сопоставимой с более простыми техниками глобального освещения.</p><p><b>Все описанные технологии опираются на специализированные вычислительные блоки.</b> Эволюция тензорных ядер от поколения к поколению напрямую определяет, насколько эффективно работают ИИ модели рендеринга.</p><p>Исходя из этого, пользователи RTX 20/30 серий получают идентичное качество изображения, к примеру от DLSS 4.5, но со значительным падением производительности из-за отсутствия родной поддержки FP8/FP4 в тензорных ядрах.</p><h2>Взглянем в неизбежное будущее: ИИ рендеринг, как новый стандарт</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/34734a50-94c1-4ea1-8e80-6c6a20b22988.webp" alt="" /></figure><p>Итак, поговорив о текущих технологиях и меняющемся подходе (где-то еще не идеальным, экспериментальным, но уже набирающем обороты), давайте заглянем в ближайшее будущее рендеринга в играх на базе ИИ.</p><h2>Траектория развития до 2030 года</h2><p>Проводя анализ текущих технологических векторов и уже доступных решений, можно смело спрогнозировать несколько ключевых направлений:</p><ol><li>Полная замена традиционных шейдеров на инференс: первые технологии, вроде RTX Neural Shaders уже демонстрируют, что нейросети могут ускорять сложные вычисления на материалах эффективнее, чем рукописный шейдерный код, в особенности из-за улучшения архитектуры тензорных ядер. Следующий шаг, безусловно, унификация всех материалов под ИИ модели, где шейдер компилируется в веса небольшого инференса.</li><li>Плавный переход от генерации кадров, к генерации сцены: уже существующие технологии работы с примитивами сцены (проработке геометрии, освещения, текстур), уводят шаг к более оптимизированному и продвинутому конвейеру производства игр на уровне сцены, что развяжет руки художникам и техническим артистам, избавив от рутинной работы по оптимизации сцен на уровне ИИ. А дальше, как вариант, это и генерация каких-либо примитивов, чтобы подобрать для артистов первоначальные наброски за секунды, а не часы ручной работы.</li><li>Гибридные вычислительные модели: Современные видео-карты уже содержат отдельные тензорные ядра, ядра для рейтрейсинга и шейдерные ядра. Будущие архитектуры, вероятно, ещё сильнее разнесут эти специализированные блоки, позволяя параллельно выполнять классический рендеринг, трассировку лучей и инференс.</li><li>Стандартизация ИИ-рендеринга: Microsoft уже добавила поддержку ИИ-рендеринга в DirectX, что открывает путь к универсализации (как минимум на уровне DirectX API). Те же ARM развивают собственные GDK для разработчиков, открывая двери для супер-семплинга и денойзинга на основе ИИ под мобильные устройства.</li></ol><p><b>Однако, при всех достижениях, остается ряд фундаментальных проблем, над решениями которых работают сотни инженеров:</b></p><ol><li>Детерминированность: Генеративные модели по своей природе случайны. Для соревновательного гейминга необходима попиксельная повторяемость результата, чего сложно достичь без фиксации сида. Однако развитие всё новых и новых подходов, сводит случайность к минимуму.</li><li>Энергопотребление: инференс безусловно жрет много энергии. В мобильном гейминге и на портативных устройствах (например Steam Deck, Nintendo Switch) это критическое ограничение. Но и в этом направлении ведётся огромная работа, предлагая новые варианты оптимизаций моделей.</li><li>Обратная совместимость: По мере роста вычислительных требований новых моделей старые GPU теряют способность эффективно их исполнять, что создаёт фрагментацию пользовательской базы. Здесь же скорее результат будет зависеть от скорости появления общепринятых стандартов в разработке, поскольку мы находимся лишь вначале пути.</li></ol><h2>В истории уже было отвращение к технологиям. Просто вы этого не помните. Как индустрия переваривала прошлые графические революции?</h2><p>Тейки, сопровождающие внедрение ИИ рендеринга: от "фейковых кадров нейрослопа" и "мыла вместо графики" до страха перед потерей контроля над визуальным результатом, звучат конечно очень громко, но не являются чем-то новым для индустрии. Практически каждое фундаментальное изменение в архитектуре рендеринга за последние 25 лет встречало схожее сопротивление, прежде чем стать новым стандартом.</p><h2>Compute шейдеры против обычного конвейера (2001–2004)</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/e577ad57-de06-41ed-8f5b-109555eead7e.webp" alt="" /><figcaption>Революция тех лет, показавшая плюсы пугающих технологий шейдеров</figcaption></figure><p><b>До появления GeForce 3 и DirectX 8</b> графический конвейер был жёстко заданной цепочкой операций: трансформация вершин, освещение по фиксированным формулам, растеризация, смешивание текстур. А потом нам разрешили программировать свои вершинные и пиксельные шейдеры для каждой стадии, что открыло дорогу к картам нормалей, динамическим теням и сложным материалам.</p><p><b>В то время, людей пугало, что шейдеры слишком медленные,</b> разработчики не справятся с написанием сложного кода, и что шейдеры, которые можно закодить - это костыли, а не шаг вперед.</p><p><b>В реальности же, всего через пять лет игры без шейдеров, стали пережитком прошлого.</b> Half-Life 2, Doom 3, Far Cry продемонстрировали, что программируемый пайплайн, это не просто замена старому, а инструмент, позволяющий создавать шедевры, невозможные ранее. Разработчики же быстро освоили HLSL и GLSL, а производительность выросла, благодаря аппаратному ускорению шейдерных блоков.</p><h2>Переход к отложенному освещению (Deferred Rendering, 2007–2011)</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/0b83107a-c0c9-436f-9e2d-fd661d40948b.webp" alt="" /><figcaption>Отложенное освещение - до сих пор один из стандартов</figcaption></figure><p><b>Классический прямой рендеринг (forward rendering)</b> пересчитывал освещение для каждого объекта, что делало множество динамических источников света непрактичным. <b>Отложенный рендеринг разделил процесс на два прохода:</b> сначала пишутся геометрические атрибуты в G‑буфер, а уже затем выполняется расчёт освещения только в экранном пространсвте. Это позволило использовать десятки и сотни динамических источников света в кадре. А ведь сегодня это кажется обыденностью.</p><p><b>Но в то время, многие утверждали,</b> что g-буфер будет жрать много памяти, мощное сглаживание MSAA придется выкинуть, а все прозрачные объекты чем-то заменить, ведь они ломаются.</p><p><b>Но в реальности, индустрия нашла компромиссы,</b> ведь плюсы перевешивали все минусы. И так, взамен MSAA появились сначала новые виды сглаживания (FXAA, SMAA, позднее замененные TAA и TAAU), которые в итоге даже превзошли по качеству. А сам подход стал индустриальным стандартом.</p><h2>Физически корректный рендеринг (PBR, 2013–2016)</h2><figure><img src="https://media.tproger.ru/user-uploads/137227/2026-04-23/d62f7baa-326e-4b1a-9d3e-bb8398087f28.webp" alt="" /><figcaption>Физически корректные материалы</figcaption></figure><p><b>В эпоху до PBR материалы описывались стандартными параметрами </b>(specular power, glossiness), которые вели себя по-разному при разном освещении и требовали ручной подгонки под каждую сцену. <b>Физически корректный подход ввёл единую модель BRDF</b>, основанную на измеряемых дополнительных свойствах реальных материалов: metallic, roughness, albedo.</p><p><b>Однако по-началу, реакция была жесткой</b> - говорили о том, что все игры станут одинаковыми и пластиковыми, старые текстуры придется переделывать с нуля, а художники потеряют творческий контроль.</p><p><b>Но случилось другое: </b>PBR не уничтожил стилизацию. Он дал художникам предсказуемую основу, поверх которой можно накладывать стилистические решения. Переход на PBR конечно потребовал до-обучения сотрудников и введения в работу новых инструментов (например, как Substance Painter, Quixel), но результатом стал скачок в реализме и стабильностью материалов между разными сценами и проектами. <b>Сегодня даже стилизованные мультяшные игры используют PBR-пайплайн, адаптированный под эстетику.</b></p><h2>Наши дни</h2><p><b>Вот и сейчас, начиная с 2018 года,</b> всё началось с переноса технологий рейтрейсинга из киношного рендера, в игровой. Первые реализации были скромными: только тени или отражения при низком количестве лучей на пиксель..</p><p><b>Спустя семь лет, трассировка лучей уже стала стандартом в AAA-сегменте.</b> Cyberpunk 2077 в режиме Path Tracing, Alan Wake 2, Black Myth: Wukong с полным RT: это примеры того, как технология созрела и стала стандартом. Денойзинг и апскейлинг (включая DLSS) эволюционировали, сделав RT играбельным. Консоли текущего поколения получили аппаратные RT-блоки, а AMD и Intel догоняют NVIDIA в производительности трассировки.</p><p><b>Текущий переход к ИИ рендерингу демонстрирует все те же паттерны, что и предыдущие революции.</b></p><h2>Нас ждет очередная революция? Подведем итоги</h2><p><b>Каждая из прошлых революций требовала времени на адаптацию, обновление инструментария, обучение разработчиков и оптимизацию железа.</b> ИИ рендеринг не является исключением.</p><p><b>Он не отменяет работу художников и программистов,</b> а даёт им новый уровень абстракции: вместо ручной борьбы с шумом, сглаживанием или оптимизацией материалов, разработчики смогут полагаться на модели, обученные на огромных дата сетах фото-реалистичного или же стилизованного контента.</p><p>Более того, как мы уже убедились выше, история показывает, что после принятия новой парадигмы или технологий, индустрия не просто возвращается к прежнему уровню качества, а выходит на новую ступень. <b>Шейдеры не убили 2D-спрайты</b>, но подарили нам карты нормалей и динамические тени. <b>PBR не сделал игры однообразными</b>, а дал новую основу, как для фото-реализма, так и для стилизации (например, Dishonored 2).</p><p><b>ИИ-рендеринг не уничтожит «ручную» графику</b>, а позволит достичь в реальном времени визуальной сложности.</p><p>Другой вопрос, как разработчики будут пользоваться технологиями, ведь есть примеры, где разработчики, даже при значительном скачке технологий, делают шаг назад (привет Battlefield 6).</p><p><b>Следующие пять лет определят, насколько ИИ рендеринг проникнет в каждый аспект создания игр. Судя по текущей траектории, к 2030 году грань между "рендерингом" и "генерацией" станет неразличимой, либо очень стертой.</b></p>]]></content:encoded>
    </item>
    <item>
      <title>Агенты в помощь: что Cloud.ru показал на GoCloud 2026</title>
      <link>https://tproger.ru/articles/agenty-v-pomoshh-chto-cloud-ru-pokazal-na-gocloud-2026</link>
      <comments>https://tproger.ru/articles/agenty-v-pomoshh-chto-cloud-ru-pokazal-na-gocloud-2026?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Вика Овсянникова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/agenty-v-pomoshh-chto-cloud-ru-pokazal-na-gocloud-2026</guid>
      <description><![CDATA[<p>Neocloud, EvoClaw, AI Workflows и безопасность LLM. Репортаж с конференции Cloud.ru — о том, почему разработчики становятся тимлидами агентов и сколько стоит арендовать HGX.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/agenty-v-pomoshh-chto-cloud-ru-pokazal-na-gocloud-2026">Агенты в помощь: что Cloud.ru показал на GoCloud 2026</a>»</p>]]></description>
      <category><![CDATA[Инструменты]]></category>
      <category><![CDATA[Безопасность]]></category>
      <category><![CDATA[Конференции]]></category>
      <category><![CDATA[DevOps]]></category>
      <category><![CDATA[Облачные технологии]]></category>
      <category><![CDATA[Информационная безопасность]]></category>
      <category><![CDATA[Kubernetes]]></category>
      <category><![CDATA[Low-code]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 17 Apr 2026 10:55:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>9 апреля Cloud.ru провёл конференцию GoCloud, посвященную ИИ и облакам. В этом году главные темы: AI-инфраструктура как отдельный продукт, управляемые агенты и безопасность LLM.</p><p>Рассказываем, что показала компания, о чём говорили спикеры и куда движется индустрия.</p><h2>Сначала цифры: как вырос Cloud.ru</h2><p>На конфренции Cloud.ru впервые публично раскрыла детальную финансовую отчётность. Выручка за 2025 год — 76,5 млрд рублей (+50% год к году). Чистая прибыль — 14,7 млрд(+86%).</p><p>Основной драйвер роста — инфраструктура для ИИ: обучение и инференс моделей дали 54% выручки. При этом классические облачные сервисы тоже выросли на 31%, что быстрее темпов роста рынка России.</p><p>По инфраструктуре Cloud.ru — один из крупнейших облачных провайдеров в стране. В парке находится 43 000+ единиц оборудования, 29 000+ серверов, 9 ЦОДов суммарной мощностью 56 МВт.</p><blockquote>По доле рынка мы уже давно занимаем большую часть, при этом продолжая расти быстрее рынка,</blockquote><p>Важный нюанс: убыточных направлений нет. Разные платформы находятся на разных стадиях развития, но инвестиции отбиваются в плановые сроки.</p><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-04-17/8164f5eb-78a8-48de-917e-722800735174.webp" alt="Михаил Лобоцкий, и. о. гендиректора Cloud.ru на конференции GoCloud" /><figcaption>Рост на 50% и доминирование AI в выручке не случайность. За этими цифрами стоит рыночный сдвиг: компании перестали экспериментировать с ИИ и начали внедрять его в реальные бизнес-процессы.</figcaption></figure><p>АФЛТ-Системс, например, уже в активной фазе перехода к регулярной эксплуатации AI. Павел Павленко, руководитель направления развития GenAI, говорит: <i>«GoCloud для меня в этом году — про то, как индустрия перешла от разговоров про потенциал GenAI к разговору про реальные внедрения, метрики и архитектурные решения. Мы строим внутреннюю AI-платформу, выстраиваем процессы и запускаем первые продукты, в том числе AI-фикацию пайплайна разработки. На таком этапе ценность партнёра измеряется не презентациями, а скоростью реакции и готовностью идти в эксперимент»</i>.</p><h2>Что происходит на рынке: от пилотов к промышленной эксплуатации</h2><p>Последние 2–3 года компании делали пилоты по внедрению генеративного ИИ в основном благодаря визионерской силе лидеров, CEO, директоров. Пилоты часто были точечными и экспериментальными: автоматизировали поддержку и отвечали на частые простые вопросы, генерировали контент.</p><p>Сейчас модели стали лучше, а бизнес опытным путем выяснил, какие функции эффективнее передавать ИИ. Результаты пилотов всё чаще признаются успешными.</p><p>Например, Артём Бондарь, руководитель направления NLP в Центре искусственного интеллекта Т-Банка, выделяет три ключевых направления GenAI-инструментов. Первое — агенты и копайлоты в полном цикле разработки. Второе — инструменты для HQ-профессий: от генеративных моделей для общих задач до вертикальных решений вроде автоматической генерации креативов «почти без касания людей».</p><p>Но прямой финансовый эффект особенно заметен в автоматизации поддержки и операционки. Здесь задействован весь спектр GenAI-подходов:</p><ul><li>пошаговая автоматизация с помощью LLM там, где есть регламентированный процесс,</li><li>агенты, которые ищут решение в сконструированной для них среде,</li><li>и AI-сотрудник Афанасий Иванов (АИ), который работает в компании уже больше года и использует те же интерфейсы, что и люди.</li></ul><p>Становится ясно, что перелом скоро наступит. И это точно не год.</p><p>Последует волнообразный рост спроса на инференс, а не только на обучение. Раньше инфраструктура была перекошена только в ту сторону, хоть и занимаются обучением единицы компаний в стране. Уже за последние полтора года спрос на инференс резко вырос. Скоро пропорция выровняется 50 на 50, а дальнейший переход будет зависеть от того, насколько быстро заработает агентная экономика.</p><p>DevOps-практики тоже перешли в практическую плоскость. В МТТЕХ выстроили модель GitOps, где Git — единый источник истины, а все изменения проходят через ревью и автоматизированный деплой. IaC-подход (Terraform, Ansible) и self-hosted GitLab в облаке позволяют управлять инфраструктурой как кодом.</p><blockquote>Если раньше поднятие инфраструктуры занимало недели и требовало вовлечения нескольких команд, то сегодня мы говорим про минуты и полностью автоматизированные процессы,</blockquote><p>При этом классические облачные нагрузки тоже растут. Цифровизация никуда не делась, а GenAI-трансформация косвенно драйвит и классику: нужны хранилища, CPU для сопутствующих задач, сети.</p><h2>Neocloud: GPU как отдельное направление</h2><p>На этом фоне Cloud.ru выделил AI-инфраструктуру в отдельное бизнес-направление — Neocloud. Это единая управляемая среда для полного цикла работы с моделями: от разработки и обучения до инференса и эксплуатации.</p><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-04-17/40683550-bfd1-4d25-a5fa-8e4c4c057645.webp" alt="Новое бизнес-направление Neocloud" /><figcaption>Фокус 2026 года — Neocloud</figcaption></figure><p>Нагрузки под ИИ сильно отличаются от классических. Для них нужны высокоскоростные соединения между GPU, умный шедулинг (днём — инференс, ночью — дообучение), возможность получить кластер из сотен HGX, а потом отпустить. Но на рынке такого предложения нет. Neocloud как раз решает управление вычислительными ресурсами на масштабе.</p><h3>В Neocloud есть:</h3><ul><li>Доступ к тысячам современных GPU в публичном облаке.</li><li>Поддержка гибридных сценариев (своя инфраструктура + облако).</li><li>Собственная платформа Distributed Train для распределённого обучения с проактивным мониторингом, автоматической заменой отказавших узлов и гибким управлением очередями.</li></ul><h3>Чем Neocloud выгодно разработчикам</h3><p>Решения такого уровня остаются доступными и для пользователей. Арендовать HGX теперь не проблема, они доступны буквально по цене обеда.</p><p>Выгодная стоимость для Cloud.ru остается приоритетом. Компания заявляет, что не планирует повышать цены в этом году.</p><p>Это не единственный аргумент в пользу облака. Как отмечает Артём Сычев, первый заместитель генерального директора РТ-Информационная безопасность, для госсектора и крупных компаний есть ещё одно важное преимущество: <i>«С облаком удобнее проходить закупочные процедуры. Ты сделал рамочный договор, и в любой момент, когда у тебя появился новый госзаказчик, быстро развернул инфраструктуру»</i>.</p><h2>Агенты: EvoClaw, Agent Space и новый способ общения с облаком</h2><p>Другой инструмент, о котором рассказали на конференции, — EvoClaw. Это управляемый облачный сервис для работы с OpenClaw и другими open source агентными фреймворками. ИИ-агент обеспечивает observability, мониторинг, логирование и поддерживает политики безопасности. Cloud.ru одним из первых в России приступил к открытому тестированию OpenClaw ещё в феврале 2026 года.</p><h3>Ключевые особенности EvoClaw:</h3><ul><li>Агент запускается в пару кликов.</li><li>Политики безопасности приведены к Zero Trust, привилегии — по минимальному принципу.</li><li>Агенты изолированы своим рабочим пространством.</li><li>Интеграция с AI Factory (Foundation Models, AI Agents, Managed RAG).</li></ul><p>EvoClaw — это другой способ общения с агентами. Он быстро разворачивается, на лету изучает новые скиллы, подтаскивает все необходимые функции. Он становится своего рода прокси между пользователем и сервисами и превращается в полноценного помощника.</p><blockquote>Это первый шаг к такому типу потребления, когда пользователь или организация перестают общаться напрямую с облаками и начинают общаться с агентами, которые с помощью доверенных им учёток, прав сами разворачивают инфраструктуру, сами её администрируют, дают нагрузку и так далее,</blockquote><p>Да, для облачных провайдеров это может звучать как риск, но на самом деле агенты пока что все так же будут ходить в API облаков и строить инфраструктуру там.</p><p>Ещё одно решение Cloud.ru для работы с агентами — <b>Agent Space</b> — мобильное и десктоп-приложение, которое позволяет чатиться с агентом. Оно работает на протоколе A2A (Agent-to-Agent). А в каталоге представлены уже более 20 бизнес-сценариев, среди которых и «Агент Python-разработчик».</p><h2>AI Workflows: low-code оркестратор</h2><p>Бизнес-процесс редко состоит из одного действия. Обычно это цепочка: проверить данные в 1С, прогнать их через LLM, создать задачу в Jira, отправить уведомление в Telegram.</p><p>Для таких сценариев Cloud.ru запустил AI Workflows — low-code конструктор, который сейчас находится в публичном тестировании.</p><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-04-17/8c3cab72-bcc9-44d7-a503-eabe0401555d.webp" alt="AI Workflows — low-code конструктор" /><figcaption>AI Workflow — low-code конструктор для последовательности действий</figcaption></figure><p>Пользователь собирает цепочку шагов в визуальном интерфейсе (как в n8n, но с ИИ-блоками). На каждом шаге можно подключить готовый коннектор к 1С, Jira, Confluence, PostgreSQL, почтовым клиентам, мессенджерам или внутренним сервисам через API. А между ними — вызовы LLM из Evolution Foundation Models, инференс-моделей или даже готовых агентов.</p><p>На старте AI Workflows ориентирован на готовые коннекторы и предсобранные кубики. Вставлять кастомные скрипты прямо в цепочку пока нельзя. Но в компании понимают, что разработчикам это нужно и планируют дать такую возможность, подчеркивает Анастасия Тафеенко, директор блока разработки платформы Cloud.ru Evolution.</p><p>На пресс-конференции прозвучала интересная мысль: AI Workflows — это тоже промежуточный этап. Через пару лет, когда компании привыкнут делегировать задачи ИИ, и этот уровень оркестрации станет не нужен, всё будет ИИ-фицировано насквозь.</p><h2>Безопасность: Guardrails и Container Security</h2><p>Агенты получают доступ к вашей инфраструктуре. Да, это удобно, но возникает закономерный вопрос: как не допустить, чтобы агент случайно (или специально) не отправил чувствительные данные во внешнюю LLM? Или не поднял контейнер с критической уязвимостью?</p><p>На GoCloud 2026 анонсировали два инструмента, которые закрывают эти риски — на уровне данных и на уровне инфраструктуры.</p><h3>Guardrails Filter: чтобы секреты не утекли</h3><p>Guardrails Filter — это фильтр между агентами и большой языковой моделью. Он сканирует исходящий запрос, находит потенциально чувствительные данные (ПДн, реквизиты, API-ключи, секреты), маскирует их и только потом отправляет в LLM. Когда модель возвращает ответ, фильтр восстанавливает реальные значения на месте.</p><blockquote>Guardrails как раз обеспечивает фильтрацию при обращении к внешним моделям. Наши же модели не дообучаются, данные не используются, не имеют доступа в интернет. Это проверено пен-тестами,</blockquote><h3>Evolution Container Security: чтобы контейнеры не стали дырой</h3><p>На уровне государства вводятся понятия «суверенного искусственного интеллекта», проходят публичные слушания по закону. Граница безопасности активно формируется. Cloud.ru отвечает на этот запрос и даёт широкую линейку сервисов безопасности, чтобы клиент мог выбрать нужный уровень под свой класс информационной системы.</p><p>По оценкам экспертов, порядка 80% запущенных кластеров Kubernetes содержат роли с избыточными привилегиями. И Evolution Container Security обеспечивает безопасность контейнерных сред Kubernetes. Сервис уже доступен в публичном тестировании.</p><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-04-17/5ee3868c-ba8a-41ad-b548-794414f9fefd.webp" alt="Воркшопы конференции GoCloud 2026" /></figure><h4>Возможности Evolution Container Security:</h4><ul><li>Сканирование контейнеров на уязвимости (включая БДУ ФСТЭК).</li><li>Встроенный ИИ-агент для генерации политик безопасности.</li><li>Создание и управление политиками через конфигуратор.</li><li>Проверка конфигураций во время развёртывания.</li></ul><blockquote>Это классическая контейнерная безопасность — он проходит по настройкам кластера через фреймворк. Есть агент, который помогает настройщику сделать это правильно,</blockquote><h4>Что еще волнует безопасников</h4><p>На круглом столе «Облако уже сегодня. Как получить конкурентное преимущество без компромиссов по безопасности» участники честно рассказали о своих страхах. Главный — потеря контроля. <i>«Облако — это чёрный ящик, который необходимо контролировать, обвязывать своими сервисами, чтобы перепроверять подрядчика»</i>, — поделился Артём Сычев, первый заместитель генерального директора РТ-Информационная безопасность.</p><p>На руку работают прозрачность архитектуры и метрики кибербезопасности в личном кабинете. Понимание процессов: как нарезаются доступы, как выдаются ключи, как часто проводятся пентесты. SLA с чёткими временами отклика и возможность выгружать логи гипервизоров для собственного анализа аномалий.</p><p>Облачные провайдеры, включая Cloud.ru, уже отвечают на эти запросы — едиными политиками безопасности, мониторингом и логированием как в публичном облаке, так и в гибридных средах.</p><p>Но есть и другой уровень безопасности — физический. Антон Фомин, CDO Navio, рассказывает, как GenAI помогает спасать жизни: <i>«Как собрать данные о лобовом столкновении, не отправляя водителя на встречную машину? Мы это делаем с помощью нашего фотореалистичного стимулятора. Вот настоящая польза генеративного ИИ: заглянуть за горизонт и научить машины ездить без риска»</i>.</p><h2>Гибридные облака: почему это сложно и как Cloud.ru стали одними из первых в этом поле</h2><p>Гибридное облако — одна из тех тем, о которой много говорят, но мало кто делает хорошо. На конференции Cloud.ru представил исследование, которое показывает: интерес к гибридной модели растёт, но её часто воспринимают как нечто сложное и размытое.</p><p>Что такое гибрид на самом деле? Если отбросить маркетинговые формулировки, гибрид — это частное облако (on-prem) + публичное облако + связь между ними под единой платформой. Из единого личного кабинета можно управлять ресурсами и там, и там, переезжать виртуальными машинами из публичного облака в свой ЦОД и обратно.</p><blockquote>Гибрид для меня — это возможность использования on-prem инфраструктуры, но с биллингом, управлением ресурсами, логированием, личным кабинетом</blockquote><p>Гибрид это всё ещё больно и дорого. Публичное облако можно обновлять постоянно — раз-два в день, а то и чаще. Если в сервисе появилась ошибка, её сразу исправляют. С гибридом так не получится. Релиз, который поедет к клиенту на on-prem инфраструктуру, нужно собирать, тестировать, сертифицировать. И каждый сервис внутри этого релиза должен работать без оглядки на внешние зависимости.</p><p>Плюс требования клиента: пройти ПСИ, подтвердить безопасность, соответствие регуляторным нормам. В публичном облаке за это отвечает провайдер. В гибриде — всё ложится на клиента и интегратора.</p><figure><img src="https://media.tproger.ru/user-uploads/111203/2026-04-17/9e2bc621-fd21-431f-85e8-cdd23aa6a9ac.webp" alt="Конференция GoCloud 2026" /></figure><h3>Почему индустрия всё равно придёт к гибриду</h3><ul><li>Безопасникам проще контролировать конфигурации и видеть всю инфраструктуру.</li><li>Финансистам — смотреть утилизацию оборудования.</li><li>CTO — видеть все виртуальные машины.</li><li>В on-prem сложно инвентаризировать legacy-системы. Гибрид даёт прозрачность.</li></ul><p>Cloud.ru начал строить гибридную платформу ещё на ранней стадии публичного облака. В прошлом году анонсировали Evolution Stack — платформу для создания частных и гибридных облаков. Клиенты уже могут получить единые политики безопасности, мониторинг и логирование для on-prem и публичного облака. Единой консоли управления «из облака» (модель Outpost, как у западных гиперскейлеров) пока нет. Но пилоты с единым центром управления готовы запускать уже сейчас.</p><p>В России почти нет провайдеров, которые могут предложить гибридное облако как отчуждаемый продукт, который можно установить у себя в ЦОДе. Cloud.ru сделал это за счёт того, что публичное облако и гибридная платформа построены на единой кодовой базе. Сервисы идентичны, пользовательский опыт одинаковый. Разработка начинается в публичном облаке, а прод уезжает на on-prem — и это работает, потому что сервисы внутри одни и те же.</p><h2>Что будет с разработкой: не паникуем, но не забываем готовиться</h2><p>Агенты уже пишут код, тестируют, разворачивают инфраструктуру. DevOps-инженер отдаёт помощнику создание виртуальных машин и настройку баз данных. SRE-агент сам поднимает метрики и ищет первопричины инцидентов. Вопрос, который возникает у каждого разработчика: «Меня заменят?»</p><p>В ближайшем будущем роли не отомрут, но изменятся. <i>«Разработчику нужно поднимать уровень, становиться тимлидом — а его тиммейтами будут агенты»</i>, считает Анастасия Тафеенко, директор блока разработки платформы Cloud.ru Evolution.</p><blockquote>Чем больше у разработчика экспертизы, чем лучше он понимает, как на самом деле устроен продукт, что такое репозитории, из каких блоков он состоит, — тем эффективнее он будет с агентами работать,</blockquote><p><b>Новый челлендж — экономика решений.</b> Можно написать агенту одну строчку, а потом 10 тысяч раз переделывать, уточнять, перезапускать. Каждый шаг — это токены. А токены — это деньги. Борьба будет не за то, кто быстрее написал код, а за то, сколько стоило решить задачу.</p><p><b>Новая роль — оркестратор агентов.</b> На круглом столе «DevOps инструменты в облаке» представители МТТЕХ, Familia, Ventra и «Технологии – и точка» сформулировали главный тренд: «Мы движемся к модели, где человек становится оркестратором агентов. Он их направляет, пишет принципы, управляет — как оргструктурой».</p><p>Количество агентов будет расти драматически — от десятков до тысяч. И тот, кто научится управлять этой «армией», останется востребованным.</p><p>Агенты не приходят на пустое место. Основной барьер для внедрения ИИ-агентов не технологический, а организационный. Если в компании данные разрознены, процессы не формализованы, а культура не готова делегировать решения машине — никакой агент не поможет. И наоборот: в компаниях, где данные структурированы и процессы прозрачны, агенты достигают 60–90% автоматизации.</p>]]></content:encoded>
    </item>
    <item>
      <title>ROCm идёт за CUDA «шаг за шагом»: AMD рассказала, как закрывает отставание в ИИ-софте</title>
      <link>https://tproger.ru/news/rocm-idyot-za-cuda-wag-za-wagom-amd-rasskazala-kak-zakryvaet</link>
      <comments>https://tproger.ru/news/rocm-idyot-za-cuda-wag-za-wagom-amd-rasskazala-kak-zakryvaet?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Евгений Стребков]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/rocm-idyot-za-cuda-wag-za-wagom-amd-rasskazala-kak-zakryvaet</guid>
      <description><![CDATA[<p>Интервью EE Times с VP AI Software AMD: OneROCm, ставка на Triton, открытый код, поддержка ноутбуков Strix Halo и переход на шестинедельный релизный цикл.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/rocm-idyot-za-cuda-wag-za-wagom-amd-rasskazala-kak-zakryvaet">ROCm идёт за CUDA «шаг за шагом»: AMD рассказала, как закрывает отставание в ИИ-софте</a>»</p>]]></description>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 14 Apr 2026 11:45:05 GMT</pubDate>
      <content:encoded><![CDATA[<p>Если вы пишете GPU-код или выбираете железо под инференс LLM, у вас теперь меньше причин завязываться на CUDA. AMD за последние два с половиной года перестроила <a href="https://rocm.docs.amd.com/">ROCm</a> в полноценный ИИ-стек: единый OneROCm для всех ускорителей, ставка на <a href="https://triton-lang.org/">Triton</a> как «великий уравнитель GPU-программирования», поддержка ноутбуков на Strix Halo из коробки и обещанный переход на шестинедельный релизный цикл. В эксклюзивном интервью EE Times вице-президент AMD по ИИ-софту Ануш Элангован объяснил, как именно ROCm догоняет CUDA — и почему конвертировать CUDA-ядра в HIP больше никто не просит. Разрыв в обучении и в зрелости сторонних библиотек у Nvidia пока остаётся, но в инференсе AMD догнала по сценарию использования.</p><ul><li>Конвертация CUDA → HIP перестала быть востребованной — большинство LLM-инференс-команд работает через <a href="https://github.com/vllm-project/vllm">vLLM</a> или <a href="https://github.com/sgl-project/sglang">SGLang</a> с нативной поддержкой ROCm.</li><li>Triton стал универсальным языком GPU-программирования: один и тот же код GPU-ядра запускается на AMD и Nvidia.</li><li>ROCm — на 100% открытый исходный код (кроме прошивок); часть фиксов в стек приходит от коммьюнити, а не только от AMD.</li><li>ROCm работает на ноутбуках со Strix Halo с теми же релизами, что и на дата-центровых Instinct.</li><li>AMD обработала все 1000+ жалоб из прошлогоднего GitHub-опроса (часть — силами AMD, часть — силами коммьюнити) и обещает шестинедельный релизный цикл по образцу Chrome.</li></ul><h2>Почему это важно сейчас</h2><p>Доля Nvidia в дата-центровых GPU держится во многом за счёт CUDA — её зрелого тулчейна, документации, библиотек и почти двух десятилетий кода в открытых репозиториях. Это и есть тот «ров», за который Nvidia стала самой дорогой компанией в мире. Чтобы откусить от этого пирога, AMD нужно не догнать CUDA по фичам, а сделать ROCm платформой, на которую разработчик вообще не обращает внимания. «Вы пользуетесь Chrome и не знаете, какая у вас версия — потому что это просто работает», — описывает цель Элангован в интервью <a href="https://www.eetimes.com/taking-on-cuda-with-rocm-one-step-after-another/">EE Times</a>.</p><p>Два с половиной года назад, когда AMD купила стартап <a href="https://nod.ai/">Nod.ai</a> Элангована (30 человек, пять-шесть лет работы над компиляторами для ИИ, ключевые контрибьюторы в <a href="https://github.com/nod-ai/SHARK-Studio">Shark</a>, <a href="https://github.com/llvm/torch-mlir">Torch.MLIR</a> и <a href="https://iree.dev/">IREE</a>), ROCm был, по словам самого Элангована, «набором кусков»: «Это росло из ASIC-прошивок: вот один кусок прошивки, вот другой — давайте свяжем». Сегодня команда релизит как софтверная компания, а не как производитель чипов.</p><h2>OneROCm: единый стек для всех ускорителей AMD</h2><p>Главное архитектурное изменение — унификация. Раньше AMD стремилась свести AI-стеки под разными типами железа — CPU, GPU и FPGA — в одну архитектуру. Внутренний проект OneROCm унифицировал стек: часть низкоуровневых компонентов остаётся железо-специфичной, но <b>любое ускорение теперь проходит через ROCm</b>. Это даёт переносимость между типами AMD-железа: код, написанный под Instinct в дата-центре, должен идти и на интегрированной графике ноутбука.</p><p>Переносимость <i>между</i> AMD и Nvidia два года назад была проблемой, а сегодня — почти нет. Разработчики ушли вверх по стеку, и место «общего знаменателя» занял Triton — открытый Python-DSL для GPU-ядер, который активно развивает OpenAI.</p><h2>Triton — великий уравнитель</h2><blockquote>Когда-то речь шла о конвертации CUDA-ядер в HIP. Но всё больше людей переходили на Triton, который стал великим уравнителем GPU-программирования. Этот уравнитель позволяет написать Triton-ядро и запустить его на AMD или Nvidia. Мы серьёзно вложились в Triton.</blockquote><p>Один из ключевых инженеров бывшей Nod возглавляет работу над Triton внутри AMD и тесно работает с OpenAI. Параллельно AMD вкладывается в <a href="https://mlir.llvm.org/">MLIR</a> — компиляторную инфраструктуру для ускорителей — и продолжает поддерживать Torch.MLIR, через который PyTorch-код можно перетаргетить на разное железо.</p><p>Запросы «сконвертируйте CUDA-кернел в HIP» Элангован называет редкостью среди клиентов AMD: «Большинство клиентов на инференсе используют vLLM или SGLang, гоняют одну из нескольких LLM и хотят максимум токенов в секунду. У нас есть Triton-ядра, и если появляется новый attention-алгоритм, который мы не предусмотрели, Triton — это catch-all. За пару дней мы делаем оптимизированную версию для скорости. Когда мы показываем, что развёртывание идентично, клиент делает pip install vLLM — и всё внутри».</p><p>Для HPC-сценариев <a href="https://github.com/ROCm/HIPIFY">HIPify</a> по-прежнему доступен и решает свою задачу — конвертацию CUDA-исходников в HIP. Для написания и валидации новых ядер Элангован полагается на ИИ-инструменты вроде <a href="https://claude.ai/">Claude</a>: <i>«Claude лучше HIPify — у него встроен веб-поиск»</i>.</p><h2>Полностью открытый код и коммьюнити</h2><p>ROCm — на 100% открытый исходный код, всё, кроме прошивок. Это держит стек под прицелом разработчиков, но даёт и преимущество: коммьюнити двигается быстрее, чем смогла бы любая компания.</p><blockquote>Каждый может зацепиться в той точке, в которой ему интересно — в компиляторе, в рантайме, где угодно. И ограничен только своими навыками, а не тем, как быстро AMD сможет подключить его к работе.</blockquote><p>Важная стратегическая ставка — ноутбуки на <a href="https://www.amd.com/en/products/processors/laptop/ryzen/ai-300-series/amd-ryzen-ai-9-hx-375.html">AMD Strix Halo</a>. ROCm на них работает «из коробки», а Windows-релизы выходят в тот же день, что и версия для дата-центрового Instinct. Логика очевидна — массовый разработчик не покупает MI300X на пробу, а ноутбук на Strix Halo — рабочий вариант, чтобы потрогать стек руками.</p><p>В прошлом году AMD провела на GitHub опрос про претензии к ROCm и собрала больше 1000 ответов. Многие касались поддержки старого железа — её закрыли либо силами AMD, либо коммьюнити. По словам Элангована, на сегодняшний день <b>все 1000+ жалоб обработаны</b> — часть силами AMD, часть силами коммьюнити. Сам он мониторит ключевые слова в X (включая <i>«ROCm sucks»</i> и <i>«AMD software not working»</i>) и отвечает лично — называет это «одной из своих side jobs».</p><h2>Что дальше: MI450 и шестинедельный цикл</h2><p>Следующий большой релиз — <a href="https://www.amd.com/en/products/accelerators/instinct/mi450.html">MI450</a>, который AMD планирует на вторую половину 2026 года. Параллельно команда ROCm ищет фичи, которые отличали бы стек от CUDA, а не просто закрывали отставание. Цель — релизный цикл в шесть недель и «невидимость» по образцу Chrome: версия не важна, потому что всё работает.</p><p>Параллельно AMD поглядывает в сторону ИИ-ассистированной разработки: сами инженеры ROCm используют LLM для генерации и валидации новых ядер. Это меняет экономику работы над стеком — то, на что раньше уходили месяцы, можно делать за дни, особенно для редких алгоритмических вариантов.</p><h2>Итог</h2><p>ROCm перестал быть «набором кусков» и превратился в стек, который AMD позиционирует как платформу на 10 лет вперёд. Главная ставка — не в том, чтобы конкурировать с CUDA по фичам, а в том, чтобы стать невидимым: разработчик не должен думать, на каком ускорителе он работает. На сегодняшний день этот сценарий хорошо работает на инференсе LLM; обучение, экосистема третьесторонних библиотек и инструментов профилирования у Nvidia всё ещё богаче — это и есть основной разрыв, который AMD предстоит закрывать.</p><p>Что делать сейчас: если вы выбираете железо под новый ИИ-проект, попробуйте развернуть vLLM на ROCm (AMD публикует <a href="https://hub.docker.com/r/rocm/vllm">готовые Docker-образы</a> и инструкцию по установке) и сравнить токены в секунду. Если вы пишете GPU-ядра — посмотрите Triton: переписать ядро под него один раз дешевле, чем поддерживать две версии под CUDA и HIP.</p><p>Источник: <a href="https://www.eetimes.com/taking-on-cuda-with-rocm-one-step-after-another/">EE Times — Taking on CUDA With ROCm: «One Step After Another»</a> (эксклюзивное интервью с Анушем Элангованом, AMD).</p>]]></content:encoded>
    </item>
    <item>
      <title>GPUBreach: через видеопамять GDDR6 получили root-доступ к хосту — даже с IOMMU</title>
      <link>https://tproger.ru/news/gpubreach-cherez-videopamyat-gddr6-poluchili-root-dostup-k-hostu</link>
      <comments>https://tproger.ru/news/gpubreach-cherez-videopamyat-gddr6-poluchili-root-dostup-k-hostu?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Евгений Стребков]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/gpubreach-cherez-videopamyat-gddr6-poluchili-root-dostup-k-hostu</guid>
      <description><![CDATA[<p>Новая атака GPUBreach позволяет через bit-flips в GDDR6-памяти GPU получить root shell на хосте, обходя IOMMU. Затрагивает облачные GPU-кластеры. Разбираем.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/gpubreach-cherez-videopamyat-gddr6-poluchili-root-dostup-k-hostu">GPUBreach: через видеопамять GDDR6 получили root-доступ к хосту — даже с IOMMU</a>»</p>]]></description>
      <category><![CDATA[Уязвимость]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Кибербезопасность]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 08 Apr 2026 06:39:46 GMT</pubDate>
      <content:encoded><![CDATA[<p>Если вы работаете с GPU в облаке или на общих серверах — появился новый класс атак, от которого пока нет надёжной защиты. Исследователи из Университета Торонто <a href="https://thehackernews.com/2026/04/new-gpubreach-attack-enables-full-cpu.html">продемонстрировали</a>, что через bit-flips в видеопамяти GDDR6 можно получить полный root-доступ к хост-системе — даже при включённом IOMMU.</p><p>Атака получила название <b>GPUBreach</b> и стала первым практическим доказательством того, что RowHammer-уязвимости в GPU-памяти позволяют не просто повредить данные, а полностью захватить машину.</p><ul><li>GPUBreach — первая атака, которая превращает bit-flips в GDDR6-памяти GPU в полную эскалацию привилегий до root на CPU</li><li>Работает даже при включённом IOMMU — ключевом механизме аппаратной изоляции памяти</li><li>Атака позволяет: извлечь криптографические ключи из NVIDIA cuPQC, деградировать точность ML-моделей до 80%, получить root shell</li><li>Затрагивает облачные ИИ-инфраструктуры, мультитенантные GPU-кластеры и HPC-среды</li><li>На десктопных/ноутбучных GPU (без ECC) защиты пока не существует</li></ul><h2>Что такое RowHammer и почему это касается GPU</h2><p><a href="https://en.wikipedia.org/wiki/Row_hammer">RowHammer</a> — известная с 2014 года проблема DRAM-памяти: многократное обращение к одной строке памяти вызывает электрические помехи, которые переворачивают биты в соседних строках (0→1 или 1→0). Это подрывает базовые гарантии изоляции памяти в операционных системах.</p><p>Производители DRAM внедрили аппаратные защиты — ECC (коды коррекции ошибок) и TRR (Target Row Refresh). Но до недавнего времени считалось, что GPU-память <b>неуязвима</b> для RowHammer из-за архитектурных особенностей.</p><p>В июле 2025 года те же исследователи из Университета Торонто <a href="https://thehackernews.com/2026/04/new-gpubreach-attack-enables-full-cpu.html">показали GPUHammer</a> — первую практическую RowHammer-атаку на NVIDIA GPU с GDDR6-памятью. Она использовала многопоточное параллельное «простукивание» для обхода архитектурных защит. Результат — деградация точности ML-моделей до 80%.</p><p>GPUBreach идёт дальше: от порчи данных — к полному захвату системы.</p><h2>Как работает GPUBreach</h2><p>Атака состоит из трёх этапов:</p><ol><li><b>RowHammer на GPU page tables.</b> Атакующий процесс (непривилегированный CUDA-ядро) вызывает bit-flips в таблицах страниц GPU-памяти, получая произвольный доступ на чтение/запись ко всей памяти GPU</li><li><b>Обход IOMMU.</b> Скомпрометированный GPU отправляет DMA-запросы в область CPU-памяти, которую IOMMU разрешает — буферы драйвера NVIDIA. Повреждая доверенное состояние драйвера, атака эксплуатирует баги безопасности памяти в ядерном модуле NVIDIA</li><li><b>Эскалация до root.</b> Через произвольную запись в ядро атакующий запускает root shell на хосте</li></ol><blockquote>GPUBreach показывает, что IOMMU недостаточно: повреждая доверенное состояние драйвера в буферах, разрешённых IOMMU, мы запускаем out-of-bounds запись на уровне ядра — полностью обходя защиту IOMMU без необходимости его отключать.</blockquote><p>Ключевое отличие GPUBreach от параллельных исследований (<b>GDDRHammer</b> и <b>GeForge</b>): те тоже используют RowHammer на GPU page tables, но GPUBreach — единственная атака, которая достигает <b>полной эскалации привилегий на CPU</b>. GeForge требует отключённого IOMMU, GDDRHammer работает только на уровне GPU-памяти.</p><h2>Что можно украсть</h2><p>Через GPUBreach исследователи продемонстрировали три сценария:</p><ul><li><b>Утечка криптографических ключей</b> из NVIDIA cuPQC (постквантовая криптографическая библиотека)</li><li><b>Деградация ML-моделей</b> — точность падает до 80% при работе на скомпрометированном GPU</li><li><b>Root shell на хосте</b> — полный контроль над машиной, включая доступ ко всем контейнерам и данным других пользователей</li></ul><p>Это особенно критично для <b>облачных ИИ-инфраструктур</b>, где несколько клиентов делят одни и те же GPU. Атакующий в одном виртуальном окружении может получить доступ к данным и моделям соседей.</p><h2>Как защититься</h2><p><b>Единственная известная мера</b> — включить ECC на GPU:</p><p>Если ECC выключен — включите (потребуется перезагрузка):</p><p>Но и ECC — не абсолютная защита:</p><ul><li>ECC корректирует 1-2 bit-flips, но атаки на DDR4/DDR5 <a href="https://thehackernews.com/2026/04/new-gpubreach-attack-enables-full-cpu.html">уже показали</a> возможность вызвать 3+ bit-flips — ECC такое не исправит</li><li>На <b>десктопных и ноутбучных GPU</b> ECC недоступен — и защиты для них <b>пока не существует</b></li><li>Серверные GPU (A100, H100) поддерживают ECC, но его нужно явно включить</li></ul><h2>Выводы</h2><p>GPUBreach меняет модель угроз для GPU-вычислений. До сих пор GPU-память считалась изолированной от CPU — теперь это не так. Атака работает даже при включённом IOMMU, который был последним рубежом аппаратной защиты.</p><p>Для команд, использующих GPU в продакшене: проверьте, включён ли ECC на ваших серверных GPU. Для облачных провайдеров — это сигнал пересмотреть модель изоляции мультитенантных GPU-инстансов. Для пользователей десктопных GPU — на данный момент защиты не существует.</p><p>Полное исследование опубликовано командой Гурураджа Сайлешвара из <a href="https://www.utoronto.ca/">Университета Торонто</a>.</p>]]></content:encoded>
    </item>
    <item>
      <title>Франкенштейн в медицине: как я скрестил ViT и ruGPT-3, чтобы научить ИИ читать рентген на русском</title>
      <link>https://tproger.ru/articles/frankenwtejn-v-medicine--kak-ya-skrestil-vit-i-rugpt-3--chtoby-nau</link>
      <comments>https://tproger.ru/articles/frankenwtejn-v-medicine--kak-ya-skrestil-vit-i-rugpt-3--chtoby-nau?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[максим митин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/frankenwtejn-v-medicine--kak-ya-skrestil-vit-i-rugpt-3--chtoby-nau</guid>
      <description><![CDATA[<p>Практический кейс: создание русскоязычной мультимодальной нейросети (Vision-Language) для анализа рентгеновских снимков. Скрещиваем ViT и ruGPT-3, решаем проблемы с датасетами на Kaggle и выкатываем ИИ в продакшн на Hugging Face. Открытый код на Python.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/frankenwtejn-v-medicine--kak-ya-skrestil-vit-i-rugpt-3--chtoby-nau">Франкенштейн в медицине: как я скрестил ViT и ruGPT-3, чтобы научить ИИ читать рентген на русском</a>»</p>]]></description>
      <category><![CDATA[Git]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[GitHub]]></category>
      <category><![CDATA[HR]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[Взлом]]></category>
      <category><![CDATA[Сбер]]></category>
      <category><![CDATA[Машин]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sun, 05 Apr 2026 06:30:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>Сейчас из каждого утюга рассказывают про мультимодальные нейросети: GPT-4o смотрит через камеру, Gemini анализирует видео. В медицине тоже есть крутые открытые ИИ-модели для анализа снимков (например, на базе датасетов MIMIC-CXR), но у них всех есть один фатальный недостаток для нашего рынка — они говорят исключительно на английском.</p><p>Мне стало интересно: а можно ли на бесплатных мощностях, буквально "на коленке", собрать русскоязычного ИИ-рентгенолога? Спойлер: можно. В этой статье расскажу, как я скрестил Vision Transformer от Google с ruGPT-3 от Сбера, как боролся с датасетами на Kaggle и что из этого вышло. В конце — ссылки на GitHub и рабочее демо.</p><h2>Архитектура: как пришить глаза к мозгу</h2><p>Чтобы нейросеть могла посмотреть на снимок и написать текст, нужна архитектура Vision-Language Model. Обучать такого монстра с нуля у меня не было ни ресурсов, ни желания. Поэтому я пошел по пути Hugging Face VisionEncoderDecoderModel.</p><p>Идея проста как кирпич:</p><ol><li>Энкодер (Глаза): Берем предобученный google/vit-base-patch16-224-in21k. Он отлично дробит картинку на патчи и извлекает визуальные фичи (понимает, где ребра, а где легкие).</li><li>Декодер (Язык): Берем ai-forever/rugpt3small_based_on_gpt2. У нее нет глаз, она умеет только генерировать текст.</li></ol><p>Чтобы их сшить, пришлось немного "взломать" конфиг ruGPT-3, принудительно сказав ей: «Теперь ты декодер, и у тебя есть слои кросс-внимания» (is_decoder=True, add_cross_attention=True). Hugging Face заботливо создал новые пустые веса между двумя моделями. Именно эти связи мне и предстояло обучить.</p><h2>Data Engineering: боль, страдания и Kaggle</h2><p>Найти 7-10 тысяч рентгеновских снимков с подробными заключениями на русском языке в открытом доступе — задача нереальная.</p><p>Поэтому я взял открытый американский датасет Indiana University Chest X-Ray (IU X-Ray). Там есть картинки и тексты от американских врачей.</p><p>Прямо на Kaggle я поднял пайплайн машинного перевода на базе Helsinki-NLP/opus-mt-en-ru. Закинул тексты в GPU батчами по 32 штуки и за 10 минут перевел более 7000 медицинских заключений на вполне сносный русский медицинский язык.</p><p>Но тут платформа подкинула сюрприз: Kaggle прячет часть файлов в виртуальной файловой системе (снимков 7000, а стандартный скрипт видел только 4). Пришлось писать суровый маппинг с глубоким сканированием (os.walk), отрезать расширения и жестко связывать ID в CSV с реальными путями на диске.</p><h2>Обучение: выжимаем все соки из бесплатных T4</h2><p>Обучение проходило на Kaggle (2x NVIDIA T4). Чтобы модель не умерла от нехватки памяти (OOM), а сессия не отвалилась по тайм-ауту, пришлось шаманить:</p><ul><li>Включил Mixed Precision (fp16) — ускорило обучение в 2 раза.</li><li>Настроил Gradient Accumulation — размер батча на видеокарту был всего 4, но виртуально мы накапливали до 16.</li><li>Столкнулся с тем, что Seq2SeqTrainer крашится при попытке сохранить промежуточный чекпоинт мультимодального "франкенштейна". Решение? Выключить промежуточные сохранения (save_strategy="epoch") и молиться, чтобы Kaggle не завис. (Кстати, спасает JS-скрипт в консоли браузера, делающий клик раз в 60 секунд).</li></ul><p>На 15 эпох ушло около 2.5 часов.</p><h2>Что получилось в итоге? (Потрогать руками)</h2><p>Получилась нейросеть, которая реально понимает, что изображено на рентгене, и сыпет терминами вроде «кальцифицированная гранулема» или «легочная васкулярность». Да, иногда она "галлюцинирует" (датасет в 7к снимков — это капля в море для ML), но базовые вещи вроде чистых легких или пневмоторакса сечет неплохо.</p><p>Я завернул модель в Gradio и выложил на Hugging Face Spaces. Можно зайти с телефона или ПК, загрузить любой снимок рентгена из гугла и посмотреть, что она выдаст.</p><p>👉 Потыкать лайв-демо тут: <a rel="noopener noreferrer" href="https://www.google.com/url?sa=E&amp;q=https%3A%2F%2Fhuggingface.co%2Fspaces%2Flivadies%2FAI-Radiologist-RU">Hugging Face Space</a></p><p>👉 Весь код, пайплайны и веса тут: <a rel="noopener noreferrer" href="https://www.google.com/url?sa=E&amp;q=https%3A%2F%2Fgithub.com%2Flivadies-collab%2FMultimodal-XRay-Analyzer-RU">GitHub Репозиторий</a></p><p>Буду рад, если кому-то этот код сэкономит время при создании своих мультимодальных сеток. Залетайте в репу, ставьте звездочки, форкайте. Если есть идеи, как улучшить датасет (может, прогнать переводы через LLM для чистки медицинского сленга) — пишите в комменты!</p><p>(Дисклеймер: модель обучена в исследовательских целях за вечер. Не суйте ей свои снимки вместо похода к реальному врачу)</p>]]></content:encoded>
    </item>
    <item>
      <title>Исследователи показали три Rowhammer-атаки, дающих полный контроль над машинами с GPU Nvidia</title>
      <link>https://tproger.ru/news/issledovateli-pokazali-tri-rowhammer-ataki--dayushhih-polnyj-kontro</link>
      <comments>https://tproger.ru/news/issledovateli-pokazali-tri-rowhammer-ataki--dayushhih-polnyj-kontro?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Евгений Стребков]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/issledovateli-pokazali-tri-rowhammer-ataki--dayushhih-polnyj-kontro</guid>
      <description><![CDATA[<p>Три Rowhammer-атаки на видеопамять GDDR6 карт Nvidia RTX дают эскалацию привилегий до root. GPUBreach работает даже с включённым IOMMU. Разбираем механику и защиту.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/issledovateli-pokazali-tri-rowhammer-ataki--dayushhih-polnyj-kontro">Исследователи показали три Rowhammer-атаки, дающих полный контроль над машинами с GPU Nvidia</a>»</p>]]></description>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[Уязвимость]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 03 Apr 2026 15:15:20 GMT</pubDate>
      <content:encoded><![CDATA[<p>Графические ускорители стоимостью от $8000 часто делят между десятками пользователей в облаке. Три независимых исследования, <a href="https://arstechnica.com/security/2026/04/new-rowhammer-attacks-give-complete-control-of-machines-running-nvidia-gpus/">опубликованные</a> на этой неделе, показали: атакующий может получить полный root-доступ к хост-машине, эксплуатируя Rowhammer-уязвимости в видеопамяти GDDR6 карт Nvidia.</p><p>Rowhammer — класс атак, при которых многократное обращение к одной строке DRAM-памяти вызывает электрические помехи в соседних строках, переключая биты (0 → 1 и наоборот). До сих пор атаки целились в оперативную память CPU. Теперь три команды независимо доказали: видеопамять GPU уязвима не меньше — и последствия критичнее.</p><ul><li>Три независимых атаки — GDDRHammer, GeForge, GPUBreach — дают полную эскалацию привилегий до root через видеопамять</li><li>Уязвимы карты RTX 3060 и RTX 6000 (архитектура Ampere). Новые поколения пока не проверены</li><li>GDDRHammer: 129 bitflip-ов на банк памяти — в 64 раза больше, чем предыдущий рекорд GPUHammer (2025)</li><li>GPUBreach работает даже с включённым IOMMU — обходит защиту через баги в драйвере Nvidia</li><li>Защита: включить IOMMU в BIOS (от GDDRHammer/GeForge) и ECC на GPU. Активных атак в дикой природе не зафиксировано</li></ul><p><i>По материалам <a href="https://arstechnica.com/security/2026/04/new-rowhammer-attacks-give-complete-control-of-machines-running-nvidia-gpus/">Ars Technica</a>.</i></p><h2>Rowhammer: от CPU к GPU за 10 лет</h2><p>Rowhammer-атаки <a href="https://users.ece.cmu.edu/~yoMDongg/doc/sec14-rowhammer.pdf">впервые продемонстрировали</a> в 2014 году на DDR3-памяти. За десятилетие техника эволюционировала: исследователи научились обходить ECC-защиту, атаковать DDR4 с Target Row Refresh, использовать Rowhammer для <a href="https://tproger.ru/news/v-telnet-nawli-uyazvimost-s-root-dostupom-v-odnu-stroku---ona-sk">эскалации привилегий</a> и кражи криптографических ключей.</p><p>В 2025 году <a href="https://www.computer.org/csdl/proceedings-article/sp/2025/223600a047/21B7QlXKEAE">GPUHammer</a> впервые показал, что видеопамять GDDR тоже уязвима — но результаты были скромными: всего 8 bitflip-ов, достаточных лишь для деградации нейросети на целевом GPU. Три новых исследования превращают эту демонстрацию в полноценное оружие.</p><h2>Три атаки: GDDRHammer, GeForge, GPUBreach</h2><h3>GDDRHammer: 129 bitflip-ов на банк</h3><p><a href="https://gddrhammer.com/">GDDRHammer</a> (Graphics DDR + Greatly Disturbing DRAM Rows) работает на RTX 6000 архитектуры Ampere. Используя новые паттерны «хаммеринга» и технику memory massaging, атака вызывает в среднем 129 bitflip-ов на банк памяти — в 64 раза больше, чем GPUHammer годом ранее.</p><p>Через манипуляцию GPU page table атакующий получает произвольный доступ на чтение и запись ко всей памяти GPU. Затем — перенаправляет page table на память CPU, получая полный контроль над хост-машиной.</p><blockquote>Rowhammer на видеопамяти GPU — такая же серьёзная угроза безопасности, как и на CPU. Все существующие аппаратные и программные защиты от Rowhammer на CPU недостаточны, если не учитывать угрозу со стороны GPU-памяти.</blockquote><h3>GeForge: 1171 bitflip на RTX 3060</h3><p>GeForge (Hammering GDDR Memory to Forge GPU Page Tables for Fun and Profit) использует похожий подход, но манипулирует page directory вместо page table. Результат — 1171 bitflip на RTX 3060 и 202 на RTX 6000.</p><p>Proof-of-concept на RTX 3060 завершается открытием root-shell на хост-машине. По словам авторов, это первый GPU-side Rowhammer-эксплойт, достигающий эскалации привилегий на хосте.</p><h3>GPUBreach: обход IOMMU</h3><p>GPUBreach принципиально отличается от первых двух атак. GDDRHammer и GeForge требуют отключённого IOMMU (Input-Output Memory Management Unit — модуль, ограничивающий доступ устройств к памяти хоста; отключён в BIOS по умолчанию). GPUBreach, продемонстрированный на RTX A6000, работает даже с включённым IOMMU.</p><p>Атака эксплуатирует баги безопасности памяти в самом драйвере Nvidia. Даже когда IOMMU ограничивает прямой доступ GPU к памяти хоста, GPUBreach повреждает метаданные внутри разрешённых буферов. Драйвер, работающий с привилегиями ядра на CPU, выполняет out-of-bounds записи под контролем атакующего.</p><h2>Memory massaging: как обойти защиту page table</h2><p>Драйвер Nvidia хранит GPU page table в защищённой области низкоуровневой памяти, где bitflip-ы от Rowhammer невозможны. Все три атаки используют технику memory massaging — перемещение page table в незащищённые регионы.</p><p>GDDRHammer и GeForge сначала «истощают» стандартный пул аллокатора через sparse UVM-обращения, затем освобождают целевой фрейм памяти в нужный момент — так, чтобы драйвер разместил page table именно в уязвимом регионе. После этого Rowhammer переключает биты в записях page table, перенаправляя указатели на память атакующего.</p><h2>Какие карты уязвимы и что делать</h2><p>Подтверждённо уязвимы RTX 3060 и RTX 6000 архитектуры Ampere (2020). Карты Ada Lovelace и более новых поколений пока не исследованы — GDDRHammer не смог атаковать RTX 6000 Ada из-за нового типа GDDR, который исследователи не стали реверс-инженерить.</p><ol><li>Включить IOMMU в BIOS — защищает от GDDRHammer и GeForge (но не от GPUBreach). По умолчанию IOMMU отключён для максимальной совместимости</li><li>Включить ECC на GPU командой nvidia-smi -e 1 — снижает объём доступной памяти, но затрудняет bitflip-ы</li><li>Следить за обновлениями драйверов Nvidia — компания <a href="https://nvidia.custhelp.com/app/answers/detail/a_id/5573">опубликовала рекомендации</a> по GPUHammer 2025 года, но патча для новых атак пока нет</li><li>Оценить риски для multi-tenant GPU-окружений — если несколько пользователей делят один GPU, атака возможна из непривилегированного CUDA-ядра</li></ol><p>Активных атак Rowhammer в дикой природе не зафиксировано. Исследования носят академический характер, но демонстрируют реальную угрозу для shared GPU-инфраструктуры.</p><p>Три исследования показали: защита от Rowhammer на CPU бесполезна без аналогичной защиты на GPU. Пока атаки носят академический характер, но с ростом shared GPU-инфраструктуры для ИИ-вычислений угроза становится практически значимой. О других актуальных уязвимостях — в материалах про <a href="https://tproger.ru/news/issledovatel-nawyol-tri-uyazvimosti-v-mongoose---oni-zatragivayut-">критические баги в Mongoose</a> и <a href="https://tproger.ru/articles/supply-chain-ataki-2026--axios--pypi-i-prompt-injection---chto-pr">supply chain атаки 2026 года</a>.</p><p>Подробности об исследованиях GDDRHammer и GeForge — <a href="https://arstechnica.com/security/2026/04/new-rowhammer-attacks-give-complete-control-of-machines-running-nvidia-gpus/">в материале Ars Technica</a>.</p>]]></content:encoded>
    </item>
    <item>
      <title>Аппаратное сжатие текстур: AFRC, PVRIC4 и Metal</title>
      <link>https://tproger.ru/translations/apparatnoe-szhatie-tekstur--afrc--pvric4-i-metal</link>
      <comments>https://tproger.ru/translations/apparatnoe-szhatie-tekstur--afrc--pvric4-i-metal?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Алексей Михайлишин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/translations/apparatnoe-szhatie-tekstur--afrc--pvric4-i-metal</guid>
      <description><![CDATA[<p>Сравнение трёх форматов аппаратного сжатия текстур — ARM AFRC, ImgTec PVRIC4 и Apple Metal Lossy. Точные данные RMSE, производительность в МПикс/сек, Vulkan BPC.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/translations/apparatnoe-szhatie-tekstur--afrc--pvric4-i-metal">Аппаратное сжатие текстур: AFRC, PVRIC4 и Metal</a>»</p>]]></description>
      <category><![CDATA[Низкоуровневое программирование]]></category>
      <category><![CDATA[Оптимизация]]></category>
      <category><![CDATA[Apple]]></category>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[Компьютерная графика]]></category>
      <category><![CDATA[ARM]]></category>
      <category><![CDATA[Алгоритмы сжатия]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Переводы]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 30 Mar 2026 15:22:10 GMT</pubDate>
      <content:encoded><![CDATA[<p>Перевод статьи <a href="https://www.ludicon.com/castano/blog/2026/03/hardware-image-compression/">Hardware Image Compression</a> Игнасио Кастаньо (Ignacio Castaño). Оригинал опубликован в марте 2026 года.</p><p>Одним из поводов для разочарования в области аппаратных форматов изображений всегда было медленное развитие. Разработчики обычно не решались поставлять текстуры в новом формате, пока он не становился повсеместно доступным — поддерживался большинством целевого железа и всеми вендорами без исключения. Сегодня три вендора предлагают собственные форматы аппаратного сжатия текстур на лету: ARM AFRC, ImgTec PVRIC4 и Apple Metal Lossy. Игнасио Кастаньо исследовал все три и сравнил их с программным сжатием реального времени Spark от NVIDIA.</p><p>— ARM AFRC (Pixel 8, Mali-G715) — явный победитель: по метрике RMSE значительно обходит Spark и других конкурентов во всех форматах.</p><p>— Apple Metal Lossy (A15/M2+) — коэффициент сжатия 1:2, API минималистичен: один флаг в дескрипторе текстуры.</p><p>— ImgTec PVRIC4 (Pixel 10) разочаровал: драйвер игнорирует запрошенный bitrate, качество хуже Spark для R и RG форматов.</p><p>— Vulkan-расширение VK_EXT_image_compression_control унифицирует доступ к аппаратному сжатию через параметр BPC (bits per component).</p><p>— Аппаратное сжатие — перспективная альтернатива программному, но пока ограничено современными топовыми устройствами.</p><h2>Контекст: почему это важно</h2><p>Разработчики обычно не решались поставлять текстуры в новом формате, пока он не становился широко доступным — то есть поддерживался большинством целевого железа и всеми вендорами. Например, хотя ATI представила форматы 3Dc в 2004 году вместе с Radeon X800 (R420) и открыла их через расширения D3D9, их использование не стало распространённым, когда Direct3D 10 стандартизировал их как BC4 и BC5 в 2007 году. Массовое применение началось лишь тогда, когда Direct3D 10 стал минимальным требованием к железу.</p><p><a href="https://www.crytek.com/games/crysis">Crysis</a> стала первой крупной игрой, поставляемой с BC5-текстурами, но большинство игр ещё долгие годы не решались устанавливать такое жёсткое требование к железу. Чтобы избежать задержек с принятием, форматы BC6 и BC7 разрабатывались совместно ATI и NVIDIA для Direct3D 11.</p><p>Именно поэтому сжатие текстур в реальном времени так интересно: когда кодировщик работает в реальном времени, внедрять новые аппаратные форматы значительно проще — не нужно ждать, пока будет подготовлен контент, целенаправленно созданный под них. Аппаратное сжатие устраняет эту проблему принятия: детали форматов не документируются, их использование абсолютно прозрачно — приложению не нужно явно указывать эти форматы, драйвер сжимает текстуры динамически в процессе рендеринга и загрузки изображений.</p><h2>Apple Metal: Lossy-сжатие</h2><p>Apple представила сжатие текстур с потерями в чипах A15 и M2 (оба используют одно поколение GPU). Оно обеспечивает коэффициент сжатия 1:2. Включить его на удивление просто — API минималистичен. Свойство compressionType дескриптора MTLTextureDescriptor принимает значение из перечисления MTLTextureCompressionType, и установка MTLTextureCompressionTypeLossy зачастую является единственным необходимым изменением:</p><p>Согласно таблицам возможностей Metal Feature Set Tables, все обычные пиксельные форматы поддерживают сжатие с потерями — включая 10-битные и форматы с плавающей точкой. Тестирование это подтвердило, однако основное внимание сосредоточено на форматах R8, RG8 и RGBA8.</p><p>Внутренний алгоритм Apple не задокументирован. По результатам реверс-инжиниринга lossy-форматов используется размер блока 8×4 пикселя — и они напоминают некоторые особенности форматов ETC и EAC. Несмотря на заявленное сжатие 1:2, на практике для каждого блока выделяется один байт метаданных, так что реальное потребление памяти чуть выше заявленного.</p><h3>Качество на M4 Pro</h3><p>Для форматов R и RG Metal Lossy показывает результаты лучше кодеков Spark EAC, но хуже BC4 и BC5. Результаты RMSE (Root Mean Square Error — среднеквадратичная ошибка; меньше = лучше):</p><p><b>Формат R:</b><br /><br /></p>МетрикаMetal Lossy (1:2)BC4 Medium (1:2)BC4 High (1:2)EAC_RG Low (1:2)EAC_RG Medium (1:2)EAC_RG High (1:2)RMSE1,85791,84691,71492,33992,29221,8636<p></p><p><b>Формат RG:</b><br /><br /></p>МетрикаMetal Lossy (1:2)BC5 Medium (1:2)BC5 High (1:2)EAC_RG Low (1:2)EAC_RG Medium (1:2)EAC_RG High (1:2)RMSE3,17573,30993,04424,22614,15923,3601<p></p><p>Прямое сравнение lossy RGBA8 с форматами Spark некорректно из-за разных коэффициентов сжатия: Metal Lossy поддерживает только 1:2, тогда как форматы Spark RGB(A) — 1:4. Тем не менее, для полноты картины:</p><p><b>Формат RGBA:</b><br /><br /></p>МетрикаMetal Lossy (1:2)ASTC 4×4 Low (1:4)ASTC 4×4 Medium (1:4)ASTC 4×4 High (1:4)BC7 Low (1:4)BC7 Medium (1:4)BC7 High (1:4)RMSE1,49476,29945,96865,36375,72135,35854,2136<p></p><h3>Производительность на M4 Pro</h3><p>С точки зрения производительности lossy-форматы показывают себя отлично и при достаточно большом размере текстуры упираются в пропускную способность памяти. Результаты на M4 Pro (16 ядер GPU) в МПикс/сек:</p><p></p>Метод409620481024512256Uncompressed (blit)41 61826 68043 74970 11144 939Metal Lossy (blit)41 80740 84743 10069 87348 729BC7 High (GPU)35 56342 23037 08234 22410 985<p></p><p>Обратите внимание, что пропускная способность стандартных блитов остаётся достаточно стабильной вне зависимости от размера текстуры. Кодеки Spark, напротив, имеют фиксированные накладные расходы, которые становятся заметнее при уменьшении размеров текстур. Интересен скачок скорости блитов при 512×512 — у него пока нет объяснения. Также стоит учесть, что кодеки Spark требуют дополнительного копирования из буфера вывода кодека в финальную сжатую текстуру — это дополнительные накладные расходы, которых можно было бы избежать, если бы Metal поддерживал запись в блочно-сжатые текстуры, как это делает Vulkan.</p><h2>Vulkan: расширение VK_EXT_image_compression_control</h2><p>В Vulkan расширение VK_EXT_image_compression_control даёт приложениям возможность запрашивать сжатие изображений с фиксированной скоростью. Расширение уже доступно на флагманских устройствах от ARM и Imagination. Включение потерявого сжатия в Vulkan несколько многословнее, чем в Metal, но на практике ненамного сложнее: нужно лишь расширить структуру VkImageCreateInfo, добавив в цепочку VkImageCompressionControlEXT.</p><p>Можно использовать флаг VK_IMAGE_COMPRESSION_FIXED_RATE_DEFAULT_EXT, чтобы позволить реализации самой выбрать параметры сжатия:</p><p>Альтернативно можно явно указать флаги фиксированной скорости для управления допустимыми коэффициентами сжатия:</p><p>BPC (bits per component — бит на компонент) — несколько нестандартная единица, но она позволяет задавать коэффициент сжатия единообразно вне зависимости от количества каналов. Для справки, BPC существующих форматов блочного сжатия GPU:</p><p></p>ФорматКаналыРазмер на пиксельРазмер на каналBC1RGB4 bpp~1,33 bpcBC4R4 bpp4 bpcBC5RG8 bpp4 bpcBC7RGBA8 bpp2 bpcASTC 4×4RGBA8 bpp2 bpcASTC 6×6RGBA~3,55 bpp~1,18 bpc<p></p><p>Расширение VK_EXT_image_compression_control также присутствует в некоторых драйверах AMD и Qualcomm, однако, насколько известно, ни один из этих вендоров не поддерживает аппаратное сжатие изображений с фиксированной скоростью. В случае AMD расширение присутствует в драйвере RADV, чтобы Proton мог отключать потерявое сжатие фреймбуфера в некоторых играх, где оно вызывало проблемы с корректностью — через флаг VK_IMAGE_COMPRESSION_DISABLED_EXT.</p><h2>ARM AFRC: лучший результат среди всех</h2><p>ARM Fixed Rate Compression (AFRC) было анонсировано в 2021 году и впервые появилось в Mali-G510 в 2022-м, однако широкого распространения этот дизайн не получил. По-настоящему массовым AFRC стало с выпуском Mali-G715 и Mali-G615 в том же году. Тестирование проводилось на Pixel 8 с GPU Mali-G715.</p><p>Устройство сообщило поддержку следующих форматов сжатия с фиксированной скоростью (возможности значительно шире Metal Lossy):</p><p></p>Формат2 bpc3 bpc4 bpc5 bpcR82 bpp3 bpp4 bpp—RG84 bpp6 bpp8 bpp—RGB86 bpp—12 bpp15 bppRGBA88 bpp12 bpp16 bpp—<p></p><p>В отличие от Metal Lossy, AFRC не использует дополнительных байт метаданных — все управляющие биты находятся внутри самого блока. Изображение делится на блоки 8×8 пикселей, в ряде случаев разбиваемые на подблоки меньшего размера. Размер каждого блока 8×8 в байтах:</p><p></p>Формат2 bpc3 bpc4 bpc5 bpcR8162432—RG8324864—RGB864—96128RGBA86496128—<p></p><p>По результатам реверс-инжиниринга удалось установить: AFRC представляет цвета с использованием преобразования YCoCg, а представление пикселей напоминает вейвлет Хаара. Для каждого подблока 4×4 используется 16 коэффициентов, квантование которых зависит от режима. Форматы RGB и RGBA принципиально одинаковы — флаг в заголовке просто указывает, присутствует ли альфа-канал или блок полностью непрозрачен.</p><h3>Качество AFRC</h3><p>Качество AFRC впечатляет. В отличие от Metal, здесь можно сделать прямое сравнение с ASTC в реальном времени, поскольку Mali поддерживает сжатие 1:4:</p><p><b>Формат R:</b><br /><br /></p>МетрикаAFRC (1:2)EAC_R Low (1:2)EAC_R Medium (1:2)EAC_R High (1:2)RMSE<b>1,4937</b>2,33992,29221,8636<p></p><p><b>Формат RG:</b><br /><br /></p>МетрикаAFRC (1:2)EAC_RG Low (1:2)EAC_RG Medium (1:2)EAC_RG High (1:2)RMSE<b>2,2079</b>4,22614,15923,3601<p></p><p><b>Формат RGBA:</b><br /><br /></p>МетрикаAFRC (1:2)AFRC (1:4)ASTC 4×4 Low (1:4)ASTC 4×4 Medium (1:4)ASTC 4×4 High (1:4)RMSE<b>0,6679</b><b>3,4184</b>6,29945,96865,3637<p></p><p>Во всех случаях RMSE значительно ниже, то есть AFRC превосходит Spark ASTC при нацеливании на ASTC с кодировщиком реального времени. Тем не менее есть несколько случаев, когда Spark даёт более высокое качество: на очень гладких изображениях сжатие AFRC приводит к заметным паттернам дизеринга, раскрывающим границы блоков. Это особенно заметно при использовании AFRC в качестве текстуры с увеличением, тогда как для сжатия фреймбуфера — основного сценария применения — такие паттерны практически незаметны.</p><figure><img src="https://media.tproger.ru/user-uploads/133946/2026-03-30/7b1601e9-42b2-4416-a0d0-dfda1bf1cafa.webp" alt="Сравнение AFRC с дизерингом и без: AFRC сохраняет детали значительно лучше конкурентов при том же bitrate" /><figcaption>Сравнение AFRC с дизерингом и без: AFRC сохраняет детали значительно лучше конкурентов при том же bitrate</figcaption></figure><h3>Производительность AFRC (Pixel 8)</h3><p>Включение AFRC не вызывает значительных накладных расходов по сравнению с несжатыми загрузками текстур, за исключением некоторых размеров. Результаты на Pixel 8 в МПикс/сек:</p><p></p>Метод409620481024512256Uncompressed4 9613 9513 0632 2902 337AFRC 4 bpc5 5083 7921 7712 3412 318AFRC 2 bpc5 0414 4332 5562 2672 332Spark ASTC Q04 8104 2072 5033 6622 259Spark ASTC Q24 4813 7152 3192 9501 903<p></p><p>Пропускная способность здесь масштабируется с размером текстуры, а не остаётся стабильной. Накладные расходы одинаково влияют на блиты и compute-шейдеры Spark. В отличие от секции Metal, где lossy-блиты явно доминировали над Spark на малых размерах, здесь картина смешанная: Spark вплотную приближается к AFRC или превосходит его. Это показывает, что кодирование текстур в реальном времени вполне конкурентоспособно с аппаратным сжатием. Абсолютные числа здесь значительно ниже, чем на M4 Pro, — это принципиально разные классы устройств.</p><h2>ImgTec PVRIC4: разочарование от Pixel 10</h2><p>ImgTec впервые анонсировала поддержку PVRIC4 ещё в 2018 году для GPU серии Series 6, однако протестировать её удалось только с выходом Pixel 10 на чипе Series D. Первоначальное объявление намекало на то, что, как и Metal Lossy, PVRIC4 поддерживает только 50%-е сжатие, но расширение декларирует более широкий спектр опций:</p><p></p>Формат1 bpc2 bpc3 bpc4 bpcR81 bpp2 bpp3 bpp4 bppRG82 bpp4 bpp6 bpp8 bppRGBA84 bpp8 bpp12 bpp16 bpp<p></p><p>К большому удивлению, качество вывода оказалось одинаковым вне зависимости от BPC. Дальнейшее расследование показало: <b>драйвер игнорирует запрошенный BPC и всегда использует 4 bpc (сжатие 1:2)</b>. Формат блоков PVRIC4 — наиболее сложный из всех трёх вендоров: размер блоков составляет 16×16 пикселей, и, как в Metal Lossy, присутствует один байт метаданных на блок. Сделать реверс-инжиниринг практически не удалось.</p><h3>Качество PVRIC4</h3><p>Качество оказалось разочаровывающим. Для форматов R и RG Spark фактически превосходит PVRIC4 при нацеливании на стандартные форматы блочного сжатия, поддерживаемые этим железом:</p><p><b>Формат R:</b><br /><br /></p>МетрикаPVRIC4 (1:2)BC4 Medium (1:2)BC4 High (1:2)EAC_R Low (1:2)EAC_R Medium (1:2)EAC_R High (1:2)RMSE3,43461,84691,71492,33992,29221,8636<p></p><p><b>Формат RG:</b><br /><br /></p>МетрикаPVRIC4 (1:2)BC5 Medium (1:2)BC5 High (1:2)EAC_RG Low (1:2)EAC_RG Medium (1:2)EAC_RG High (1:2)RMSE5,43923,30993,04424,22614,15923,3601<p></p><p>Для RGBA прямое сравнение невозможно из-за разных коэффициентов сжатия, но качество также значительно хуже других вендоров:</p><p><b>Формат RGBA:</b><br /><br /></p>МетрикаPVRIC4 (1:2)ASTC 4×4 Low (1:4)ASTC 4×4 Medium (1:4)ASTC 4×4 High (1:4)RMSE2,31606,29945,96865,3637<p></p><h3>Производительность PVRIC4 (Pixel 10)</h3><p></p>Метод409620481024512256Uncompressed2 2992 6292 6431 9091 178PVRIC4 4 bpc2 5822 9723 8512 8771 102Spark ASTC Q03 3273 5093 0972 051911Spark ASTC Q23 0022 7592 4981 485634<p></p><p>Кривая пропускной способности на этом устройстве существенно отличается от Pixel 8: пик приходится на размеры 1024–2048, а не монотонно возрастает с размером. На больших размерах пропускная способность Spark фактически выше, чем у несжатых загрузок текстур. Это характерно для устройств, ограниченных пропускной способностью памяти: обычный блит должен прочитать всё входное изображение и записать обратно тот же объём данных, тогда как Spark записывает лишь 1/4 входных данных. Экономия на записи зачастую перекрывает вычислительные затраты кодирования.</p><p><b>Комментарий PowerVR Dev (ImgTec)</b><br />PVRIC4 поддерживает только сжатие 1:2. TFBC (доступен исключительно в чипах Rogue XE) поддерживал соотношения 1:2, 1:4 и 1:3. Дизайн расширения был спорным — многим не нравилась многословность выбора BPC, поэтому было решено экспонировать все BPC в рамках поддерживаемых соотношений и повышать их до поддерживаемого ratio. Это считалось допустимым, поскольку качество не деградирует относительно запроса приложения, а приложение всё равно обязано запрашивать реальный размер изображения, который не гарантирует уменьшения.</p><figure><img src="https://media.tproger.ru/user-uploads/133946/2026-03-30/34deaeec-ec94-4d39-9a82-dd707dcf71a6.webp" alt="Сравнение Spark ASTC с дизерингом и без. Программный Spark показывает хорошие результаты, но AFRC его превосходит" /><figcaption>Сравнение Spark ASTC с дизерингом и без. Программный Spark показывает хорошие результаты, но AFRC его превосходит</figcaption></figure><h2>Spark: программная точка отсчёта</h2><p><a href="https://github.com/NVIDIA/Spark">Spark</a> — библиотека NVIDIA для программного сжатия текстур в реальном времени. Работает на GPU как compute shader, поддерживает форматы BC1–BC7 и ASTC. В тесте выступает базовой точкой сравнения как лучшее доступное программное сжатие без специализированного железа.</p><p>Spark показывает стабильные результаты по форматам, но требует явного вызова compute-прохода — это дополнительный этап в пайплайне. Аппаратное сжатие, напротив, встроено в рендеринг и не требует дополнительного кода. Отдельный плюс Spark — предсказуемое и согласованное поведение на всех устройствах, что важно, если унифицированный вывод критичен для вашего сценария. Ни один из форматов аппаратного сжатия пока не доступен через WebGPU — если это изменится, расширить spark.js для их поддержки будет несложно.</p><h2>Итоги: кто победил</h2><p>ARM AFRC — явный победитель. Это не только превосходит программные реализации вроде Spark, но и обходит все остальные форматы по всем метрикам. Итоговая таблица RMSE по всем протестированным форматам:</p><p></p>ФорматRMSE 1:2RMSE 1:4R8 Metal Lossy1,8579—<b>R8 AFRC</b><b>1,4937</b>—R8 PVRIC43,4346—Spark BC41,7149—RG8 Metal Lossy3,1757—<b>RG8 AFRC</b><b>2,2079</b>—RG8 PVRIC45,4392—Spark BC53,0442—RGBA8 Metal Lossy1,4947—<b>RGBA8 AFRC</b><b>0,6679</b><b>3,4184</b>RGBA8 PVRIC42,3160—Spark BC7—4,2136<p></p><p>Стоит оговориться: результаты PVRIC4 могут не отражать полного потенциала железа — драйвер игнорирует запрошенный коэффициент сжатия и всегда использует 1:2. Возможно, эти результаты удастся пересмотреть после исправления проблемы.</p><p>Аппаратное сжатие — убедительная альтернатива программному. Главная оговорка — оно сейчас ограничено современными топовыми устройствами, которые как раз и располагают наибольшим объёмом памяти и пропускной способностью.</p><p>Даже когда нативное аппаратное сжатие доступно, есть веские причины продолжать использовать Spark. Вывод аппаратного сжатия различается у разных вендоров, и в некоторых случаях — как мы видели с PVRIC4 — качество уступает кодировщику реального времени. Если для вашего сценария критичен единообразный и предсказуемый вывод на всех вендорах, Spark остаётся правильным выбором.</p>]]></content:encoded>
    </item>
    <item>
      <title>Разработчик написал inference-движок на Zig для запуска LLM на AMD GPU без ROCm</title>
      <link>https://tproger.ru/news/zinc---inference-dvizhok-na-zig-dlya-zapuska-llm-na-potrebitelski</link>
      <comments>https://tproger.ru/news/zinc---inference-dvizhok-na-zig-dlya-zapuska-llm-na-potrebitelski?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Алексей Михайлишин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/zinc---inference-dvizhok-na-zig-dlya-zapuska-llm-na-potrebitelski</guid>
      <description><![CDATA[<p>ZINC — inference engine на Zig и Vulkan для AMD RDNA3/RDNA4 GPU. Загружает GGUF, работает без ROCm. Разбираем бенчмарки и честную реакцию комьюнити.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/zinc---inference-dvizhok-na-zig-dlya-zapuska-llm-na-potrebitelski">Разработчик написал inference-движок на Zig для запуска LLM на AMD GPU без ROCm</a>»</p>]]></description>
      <category><![CDATA[Open Source]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[AMD]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 30 Mar 2026 03:50:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>Потребительские AMD-видеокарты серий RDNA3 и RDNA4 имеют от 16 до 32 ГБ VRAM и пропускную способность памяти до 960 ГБ/с — мощности для LLM-inference хватает. Но софтверная экосистема отстаёт: ROCm (фреймворк AMD для GPU-вычислений) поддерживает потребительские RDNA3 только с конца 2023 года, а Vulkan-бэкенд llama.cpp не использует специфику конкретных архитектур. Разработчик под ником Mammoth_Radish2 <a href="https://github.com/zolotukhin/zinc">решил написать</a> inference engine с нуля — на Zig и Vulkan, с ручной оптимизацией под RDNA4.</p><p><a href="https://github.com/zolotukhin/zinc">ZINC</a> (Zig INferenCe Engine) — inference-движок для больших языковых моделей, написанный на Zig и работающий через Vulkan API без зависимости от ROCm или CUDA. GGUF (формат хранения весов LLM, используемый в llama.cpp и Ollama) — единственный поддерживаемый формат моделей. Проект на ранней стадии: 149 звёзд на GitHub, около 5000 строк Zig и 2000 строк GLSL-шейдеров.</p><p>— ZINC — inference engine на Zig + Vulkan для AMD GPU (RDNA3/RDNA4)</p><p>— Загружает модели в формате GGUF, поддерживает квантизации Q4_K–F16</p><p>— Текущая скорость: 10 tok/s decode на Qwen3.5-35B-A3B, 7 tok/s на Qwen3.5-2B</p><p>— ~5000 строк Zig + 2000 строк GLSL-шейдеров — можно прочитать целиком</p><p>— Комьюнити указывает на неточности в README и возможный vibecoding</p><h2>Что умеет ZINC</h2><p>Движок загружает модели в формате GGUF (нативный парсер на Zig), маппит веса в VRAM видеокарты и выполняет decode-цикл трансформера. Список протестированных моделей пока узкий — автор публикует только те, что прошли полную валидацию. Поддерживаемые квантизации: Q4_K, Q5_K, Q6_K, Q8_0, F16.</p><p>Результаты на AMD Radeon AI PRO R9700 (RDNA4, 32 ГБ VRAM) — это профессиональная карта, не потребительская:</p><ul><li><b>Qwen3.5 2B Q4_K_M</b> — 8,33 tok/s prefill, 7,17 tok/s decode</li><li><b>Qwen3.5 35B-A3B UD Q4_K_XL</b> (MoE-модель) — 12,67 tok/s prefill, 10,10 tok/s decode</li></ul><p>Для сравнения: Vulkan-бэкенд llama.cpp на аналогичном железе и той же модели показывает около 127 tok/s — разница примерно в 12 раз. Автор ZINC объясняет это узким местом: 120 GPU-синхронизаций на токен (по одной на слой). Исправление — запись всего decode-графа в один command buffer — в работе.</p><h2>Почему Zig и Vulkan</h2><p>Автор проекта объясняет выбор стека: горячий путь — это Vulkan API-вызовы, управление GPU-памятью и запись command buffer'ов. Чистая системная работа, для которой Zig подходит хорошо благодаря нескольким возможностям языка:</p><ul><li>@cImport — прямой доступ к Vulkan C ABI без генераторов биндингов</li><li>comptime — генерация dispatch-таблиц для каждой квантизации на этапе компиляции</li><li>errdefer — автоматическое освобождение GPU-ресурсов при ошибках</li><li>zig build — компиляция GLSL-шейдеров в SPIR-V встроена в систему сборки</li></ul><p>Итог — один бинарник из одной команды. Кодовая база достаточно компактна (~7000 строк), чтобы прочитать целиком и понять, как устроен inference.</p><h2>Как попробовать</h2><p>Для сборки нужны Zig 0.15.2+ (это dev/nightly-версия, не стабильный релиз), Vulkan SDK и компилятор GLSL-шейдеров (glslc). На Linux с RDNA4 важно использовать системную версию glslc — новые релизы могут вызвать регрессию производительности.</p><p>Флаг RADV_PERFTEST=coop_matrix включает поддержку кооперативных матричных операций в драйвере Mesa RADV — без него производительность на RDNA4 будет значительно ниже. Команда --check проверяет Vulkan-устройство, скомпилированные шейдеры и совместимость GGUF-файла.</p><h2>Что говорит комьюнити</h2><p>Тред на <a href="https://www.reddit.com/r/LocalLLaMA/comments/1s79w6u/zinc_llm_inference_engine_written_in_zig_running/">r/LocalLLaMA</a> набрал 68 комментариев, и реакция скептическая. Разберём основные претензии.</p><h3>Неточности в README</h3><p>README заявляет, что «ROCm не поддерживает потребительские карты — только MI-серию для дата-центров». Это неверно: AMD добавила поддержку RDNA3 в ROCm осенью 2023 года. Как <a href="https://www.reddit.com/r/LocalLLaMA/comments/1s79w6u/zinc_llm_inference_engine_written_in_zig_running/">отметил</a> один из комментаторов: «Утверждение вроде этого в описании проблемы говорит о том, что разработчики не понимают рынок, под который строят продукт». Справедливости ради, поддержка ROCm для потребительских карт остаётся неполной — например, библиотеки Composable Kernel и Aiter до сих пор работают только с CDNA.</p><h3>Разрыв в скорости с llama.cpp</h3><p>Разработчик <a href="https://www.reddit.com/r/LocalLLaMA/comments/1s79w6u/zinc_llm_inference_engine_written_in_zig_running/">KoboldAI henk717</a> провёл детальный разбор. По его данным, Vulkan-бэкенд llama.cpp выдаёт 107 tok/s там, где ZINC показывает 7,6 tok/s. При этом README позиционирует llama.cpp как решение, которое «относится к RDNA4 как к второстепенному». Независимые бенчмарки из обсуждений llama.cpp на GitHub показывают ещё более высокие цифры — до 127 tok/s на R9700.</p><p>Также henk717 указал на противоречие: README обещает «обслуживание 4+ пользователей» с TurboQuant KV-кешем, но в таблице статуса проекта обе фичи (continuous batching и TurboQuant) помечены как нереализованные.</p><h3>Vibecoding: стоит ли волноваться?</h3><p>Несколько пользователей обратили внимание на признаки того, что проект написан с помощью ИИ: в репозитории есть .claude и CLAUDE.md, README содержит противоречия между заявленными и реализованными возможностями. Само по себе использование ИИ-инструментов для кодинга — нормальная практика в 2026 году. Проблема в другом: если ИИ написал README с ложными утверждениями, а автор не проверил — это вопрос к качеству инженерного процесса, а не к инструменту.</p><h2>Зачем за этим следить</h2><p>Потребительские AMD GPU стоят $500–1500 (против $10 000–15 000 за MI300X для дата-центров) и имеют 16–32 ГБ VRAM. Железо для inference есть у миллионов пользователей — нет хорошего софта. ZINC пока далёк от решения этой проблемы, но сам подход — нативный Zig с ручной настройкой Vulkan-шейдеров под конкретную архитектуру GPU — инженерно обоснован.</p><p>На текущий момент для inference на AMD GPU llama.cpp через Vulkan остаётся лучшим вариантом: в 12 раз быстрее, поддерживает десятки моделей, стабильный. ZINC имеет смысл отслеживать тем, кто интересуется низкоуровневой оптимизацией GPU или Zig как системным языком.</p><h2>Выводы</h2><p>ZINC — ранний эксперимент по созданию inference-движка на Zig + Vulkan для AMD GPU. Идея — использовать потребительские RDNA3/RDNA4 для LLM без ROCm — здравая. Реализация пока сырая: разрыв с llama.cpp в 12 раз по скорости, неточности в документации, незавершённые фичи.</p><p>Для практического использования прямо сейчас — llama.cpp через Vulkan. Для наблюдения и изучения подхода — ZINC интересен как пример того, как Zig и Vulkan работают вместе для GPU-вычислений.</p><p>Ссылки: <a href="https://github.com/zolotukhin/zinc">GitHub-репозиторий ZINC</a> | <a href="https://www.reddit.com/r/LocalLLaMA/comments/1s79w6u/zinc_llm_inference_engine_written_in_zig_running/">Обсуждение на r/LocalLLaMA</a></p>]]></content:encoded>
    </item>
    <item>
      <title>Студент собрал пайплайн на $500 GPU, который обходит Claude Sonnet на бенчмарке кодинга</title>
      <link>https://tproger.ru/news/student-sobral-pajplajn-na--500-gpu--kotoryj-obhodit-claude-sonn</link>
      <comments>https://tproger.ru/news/student-sobral-pajplajn-na--500-gpu--kotoryj-obhodit-claude-sonn?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Алексей Михайлишин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/student-sobral-pajplajn-na--500-gpu--kotoryj-obhodit-claude-sonn</guid>
      <description><![CDATA[<p>Open-source пайплайн ATLAS набирает 74,6% на LiveCodeBench с Qwen3-14B на RTX 5060 Ti — против 71,4% у Claude Sonnet 4.5. Разбираем, как это работает.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/student-sobral-pajplajn-na--500-gpu--kotoryj-obhodit-claude-sonn">Студент собрал пайплайн на $500 GPU, который обходит Claude Sonnet на бенчмарке кодинга</a>»</p>]]></description>
      <category><![CDATA[Open Source]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[GitHub]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sun, 29 Mar 2026 15:11:59 GMT</pubDate>
      <content:encoded><![CDATA[<p>Студент из колледжа собрал на одной видеокарте за $500 пайплайн, который <a href="https://github.com/itigges22/ATLAS">обходит Claude Sonnet 4.5</a> на бенчмарке кодинга — без файнтюнинга, без облака, без API-ключей. Проект <a href="https://www.reddit.com/r/BlackboxAI_/comments/1s3ja5n/500_gpu_outperforms_claude_sonnet_on_coding/">взорвал Reddit</a> и <a href="https://news.ycombinator.com/item?id=47533297">Hacker News</a>.</p><p>ATLAS (Adaptive Test-time Learning and Autonomous Specialization) — open-source система, которая оборачивает замороженную квантизированную модель Qwen3-14B в трёхфазный пайплайн генерации, верификации и починки кода. На бенчмарке <a href="https://livecodebench.github.io/leaderboard.html">LiveCodeBench v5</a> (599 из 880 задач) система <a href="https://github.com/itigges22/ATLAS">набрала</a> 74,6% — против 71,4% у Claude Sonnet 4.5.</p><p>— ATLAS набирает 74,6% на LiveCodeBench v5, используя замороженную Qwen3-14B на одной RTX 5060 Ti за ~$430</p><p>— Базовая модель набирает лишь ~55% — пайплайн добавляет почти 20 п.п. за счёт генерации нескольких решений, тестирования и починки</p><p>— Стоимость — ~$0,004 за задачу (электричество) против ~$0,066 за вызов API Claude Sonnet</p><p>— Сравнение не прямое: ATLAS использует best-of-3 + итеративную починку, а Claude тестировали в режиме single-shot на другом наборе задач</p><p>— На других бенчмарках (GPQA Diamond — 47%, SciCode — 14,7%) ATLAS значительно уступает фронтирным моделям</p><p>Автор проекта, студент Исаак Тиггес, <a href="https://github.com/itigges22/ATLAS">собрал</a> всё это на одной потребительской видеокарте RTX 5060 Ti 16 ГБ. Весь инференс локальный — данные не покидают машину, API-ключи не нужны.</p><h2>Как работает ATLAS</h2><p>ATLAS — это не новая модель, а инженерная обвязка вокруг существующей. В основе — замороженная квантизированная <a href="https://huggingface.co/Qwen">Qwen3-14B-Q4_K_M</a> от Alibaba, запущенная через патченный llama-server на K3s. Система работает в три фазы:</p><h3>Фаза 1: генерация</h3><p><b>PlanSearch</b> извлекает ограничения из задачи и генерирует несколько различных планов решения. <b>BudgetForcing</b> контролирует количество thinking-токенов. <b>DivSampling</b> обеспечивает разнообразие кандидатов. На выходе — три варианта решения (k=3).</p><p>Одна эта фаза поднимает результат с 54,9% до 67,3% — прирост 12,4 процентных пункта.</p><h3>Фаза 2: отбор лучшего кандидата</h3><p><b>Geometric Lens</b> — компонент, который оценивает качество каждого кандидата по внутренним представлениям модели и отправляет лучшего на исполнение в песочницу.</p><p>Важный нюанс: в текущей версии эта фаза <a href="https://github.com/itigges22/ATLAS/blob/main/V3_STATUS.md">не дала прироста</a> (+0,0 п.п.), потому что C(x) обучалась всего на ~60 примерах — слишком мало для осмысленного энергетического ландшафта. Автор планирует исправить это в V3.1.</p><h3>Фаза 3: починка провалов</h3><p>Если все кандидаты провалились, модель генерирует собственные тест-кейсы и запускает <b>PR-CoT</b> (multi-perspective chain-of-thought repair) — итеративную починку через рассуждение с нескольких точек зрения. Модель никогда не видит правильные ответы — только свои собственные тесты.</p><p>PR-CoT спасает 36 из 42 задач, попавших в фазу починки — 85,7% успеха. Суммарный прирост фазы 3 — ещё 7,3 п.п.</p><h2>Бенчмарки: что показывают цифры</h2><p>Результаты ATLAS V3 на трёх бенчмарках:</p><p>Метрика pass@1-v(k=3) означает, что для каждой задачи генерируются три кандидата, из которых выбирается лучший. Это значительно легче, чем классический pass@1, где модель даёт ровно один ответ без права на повторную попытку.</p><p>Для контекста — сравнение стоимости и результата на LiveCodeBench:</p><h2>Почему сравнение не совсем честное</h2><p>Автор ATLAS <a href="https://github.com/itigges22/ATLAS#cost-and-performance-context">сам признаёт</a> ключевое ограничение: сравнение — не контролируемый head-to-head.</p><ul><li>ATLAS тестировали на 599 задачах LiveCodeBench v5, а Claude — на 315 задачах из данных <a href="https://artificialanalysis.ai/">Artificial Analysis</a>. Это разные наборы задач</li><li>ATLAS генерирует три кандидата, отбирает лучшего и итеративно чинит провалы. Claude тестировали в режиме single-shot (один запрос, один ответ, без повторов)</li><li>ATLAS оптимизировался именно под LiveCodeBench — на GPQA Diamond (47%) и SciCode (14,7%) результаты значительно скромнее</li><li>Метрика ATLAS — pass@1-v(k=3), а не классический pass@1. Это принципиально разные вещи</li></ul><p>Как <a href="https://fordelstudios.com/research/500-dollar-gpu-beating-cloud-ai-means-nothing">отмечает</a> Fordel Studios, бенчмарки измеряют способность решать изолированные задачи с чёткими условиями — это около 5% того, что важно в продакшене. Остальные 95% — длинный контекст, неоднозначные требования, мультишаговое планирование.</p><h2>Что действительно впечатляет</h2><p>Несмотря на оговорки, проект демонстрирует несколько важных вещей:</p><ol><li><b>Инженерия побеждает масштаб.</b> Базовая Qwen3-14B набирает ~55% — пайплайн ATLAS добавляет почти 20 п.п. без единой строчки файнтюнинга. Это чистая системная инженерия</li><li><b>Порог входа падает.</b> Два года назад для локального инференса нужна была видеокарта за $2000+. Сегодня — RTX 5060 Ti за ~$430. Через два года это может быть карточка за $200</li><li><b>Полная автономность.</b> Данные не покидают машину. Нет API-ключей, нет счетов, нет зависимости от провайдера. Для сценариев с чувствительными данными — это принципиально</li><li><b>Стоимость.</b> ~$0,004 за задачу (электричество при $0,12/кВт·ч) — в 16 раз дешевле одного вызова Claude Sonnet API</li></ol><h2>Ограничения и планы</h2><p>Автор честно <a href="https://github.com/itigges22/ATLAS#known-limitations">документирует</a> проблемы текущей версии:</p><ul><li>Geometric Lens (фаза 2) не работает — обучалась на 60 примерах, что слишком мало</li><li>Метрический тензор G(x) неактивен — будет переработан или удалён в V3.1</li><li>Задачи обрабатываются последовательно — нет параллелизма</li><li>Баг SandboxAdapter со stdin — не работает tiebreaking через distinguishing input</li><li>Система оптимизирована только под LiveCodeBench — кросс-доменная генерализация на повестке V3.1</li></ul><p>В версии V3.1 <a href="https://github.com/itigges22/ATLAS#v31----in-progress">планируется</a> переход на Qwen3.5-9B с архитектурой DeltaNet (ускорение в 3–4 раза), переобучение Geometric Lens, параллелизация задач и расширение набора бенчмарков. Целевой результат — 80–90% на LiveCodeBench.</p><h2>Требования к железу</h2><p>Проект пока не plug-and-play — V3.1 обещает улучшить портативность. На текущий момент настройка под конкретное железо может потребовать ручной работы с параметрами: количество параллельных слотов, квантизация KV-кеша, размер контекста на слот.</p><h2>Выводы</h2><p>ATLAS — впечатляющая демонстрация того, как системная инженерия может компенсировать разрыв в масштабе моделей. Студент, одна видеокарта за $430, замороженная open-source модель — и результат, который на конкретном бенчмарке обходит коммерческую фронтирную модель.</p><p>Но важно не путать бенчмарк-результат с готовностью к продакшену. ATLAS решает задачи LiveCodeBench, генерируя и перебирая варианты. Фронтирные модели решают принципиально другой класс задач — работа с огромным контекстом, понимание неоднозначных требований, мультишаговое планирование.</p><blockquote>Бенчмарки измеряют, может ли модель решить игрушечную задачу. Продакшен измеряет, может ли она думать.</blockquote><p>Настоящий сигнал здесь — не в том, что локальный инференс «победил» облачный ИИ. А в том, что порог доступа к мощному ИИ-инференсу продолжает стремительно падать. Если у вас есть NVIDIA GPU с 16+ ГБ VRAM — <a href="https://github.com/itigges22/ATLAS">попробуйте ATLAS</a> на своих задачах и оцените результат.</p><p><b>Источники:</b> <a href="https://github.com/itigges22/ATLAS">ATLAS на GitHub</a> (1,2K звёзд) · <a href="https://livecodebench.github.io/leaderboard.html">LiveCodeBench Leaderboard</a> · <a href="https://news.ycombinator.com/item?id=47533297">обсуждение на Hacker News</a> · <a href="https://fordelstudios.com/research/500-dollar-gpu-beating-cloud-ai-means-nothing">анализ Fordel Studios</a></p>]]></content:encoded>
    </item>
    <item>
      <title>Google TurboQuant простыми словами: как сжать нейросеть в 6 раз и запустить на MacBook</title>
      <link>https://tproger.ru/articles/google-turboquant-prostymi-slovami--kak-szhat-nejroset-v-6-raz-</link>
      <comments>https://tproger.ru/articles/google-turboquant-prostymi-slovami--kak-szhat-nejroset-v-6-raz-?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Алексей Михайлишин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/google-turboquant-prostymi-slovami--kak-szhat-nejroset-v-6-raz-</guid>
      <description><![CDATA[<p>TurboQuant от Google сжимает KV-кеш LLM до 3 бит — ускорение до 8× на H100, Qwen на MacBook Air. Объясняем как работает и что это значит для вас.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/google-turboquant-prostymi-slovami--kak-szhat-nejroset-v-6-raz-">Google TurboQuant простыми словами: как сжать нейросеть в 6 раз и запустить на MacBook</a>»</p>]]></description>
      <category><![CDATA[Open Source]]></category>
      <category><![CDATA[Оптимизация]]></category>
      <category><![CDATA[Производительность]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sat, 28 Mar 2026 04:45:23 GMT</pubDate>
      <content:encoded><![CDATA[<p>На этой неделе в мире ИИ произошло землетрясение. Google Research опубликовал алгоритм TurboQuant, который сжимает потребление памяти нейросетей при инференсе в 6 раз и ускоряет вычисления в 8 раз — без потери качества. <a href="https://tproger.ru/news/google-turboquant-obvalil-akcii-proizvoditelej-pamyati-na-25----r">Акции производителей памяти обвалились на 25%</a>. Reddit кипит. Все суетятся — но мало кто реально понимает, что именно сделали в Google и почему это важно.</p><p>Мы разобрались. Объясняем так, чтобы было понятно всем — и тем, кто пишет нейросети, и тем, кто просто хочет запустить ChatGPT-подобную модель на своём ноутбуке.</p><p><b>TurboQuant</b> — алгоритм квантизации KV-кеша для больших языковых моделей (LLM), разработанный Google Research. Сжимает KV-кеш с 16 до 3 бит на значение, уменьшая потребление памяти при инференсе в 5–6 раз без переобучения модели и без потери качества. Представлен на ICLR 2026 (<a href="https://arxiv.org/abs/2504.19874">arXiv:2504.19874</a>).</p><h2>KV-кеш: почему нейросетям нужно столько памяти</h2><p>Когда вы общаетесь с ChatGPT, Gemini или любой другой LLM, модель должна «помнить» весь ваш диалог. Для этого она использует <b>KV-кеш</b> (Key-Value cache) — специальный буфер в памяти видеокарты, где хранятся промежуточные вычисления механизма внимания (attention).</p><p>Представьте: вы читаете книгу и делаете заметки на полях. KV-кеш — это те самые заметки. Без них модели пришлось бы каждый раз перечитывать весь текст с начала, чтобы ответить на ваш вопрос.</p><p>Проблема в масштабе:</p><ul><li>Модель Llama 3.1 70B при контексте 128K токенов тратит ~40 ГБ только на KV-кеш — это больше, чем весит сама модель в квантизированном виде</li><li>Чем длиннее контекст (переписка, документ, код) — тем больше памяти нужно, и это растёт линейно</li><li>Именно KV-кеш — главный ограничитель того, сколько текста модель может «видеть» одновременно</li></ul><p>И именно KV-кеш сжимает TurboQuant.</p><h2>Что такое TurboQuant</h2><p>TurboQuant — это алгоритм сжатия KV-кеша, разработанный Google Research. <a href="https://arxiv.org/abs/2504.19874">Статья</a> принята на ICLR 2026 — одну из топовых конференций по машинному обучению. Авторы — Amir Zandieh, Vahab Mirrokni (VP Google, известный исследователь в области алгоритмов) и коллеги.</p><ul><li>Сжимает KV-кеш до 3 бит на значение (с обычных 16) — уменьшение в ~5 раз</li><li>Не требует дообучения модели — работает с любой LLM «из коробки»</li><li>Не теряет качество на стандартных бенчмарках (LongBench, Needle in a Haystack, RULER)</li><li>Ускоряет вычисления attention до 8 раз на NVIDIA H100</li><li>Работает «на лету» — не нужно заранее обрабатывать данные</li></ul><p><b>Важно:</b> TurboQuant сжимает только KV-кеш при инференсе. Он НЕ сжимает веса модели (это делают GPTQ, AWQ, GGUF) и НЕ влияет на обучение. Это принципиально другая задача.</p><h2>Как работает TurboQuant: PolarQuant и QJL простыми словами</h2><p>TurboQuant работает в два этапа. Если упрощать — это как сжатие фотографии в JPEG, только для математических векторов в памяти нейросети.</p><h3>Шаг 1: PolarQuant — умное сжатие основных данных</h3><p>Обычно данные в нейросети хранятся в декартовых координатах — как «иди 3 блока на восток и 4 блока на север». PolarQuant переводит их в полярные координаты — «иди 5 блоков под углом 37 градусов». Перед конвертацией вектор случайным образом поворачивается — это делает распределение координат более однородным.</p><p>В полярных координатах данные распределены более предсказуемо. Это позволяет применить оптимальный квантизатор (Lloyd-Max) к каждой координате независимо, <b>без дополнительных битов на хранение параметров квантизации</b>. В обычных методах эти «служебные» биты съедают 1–2 бита на число — при 3-битной квантизации это колоссальные накладные расходы.</p><h3>Шаг 2: QJL — коррекция ошибок за 1 бит</h3><p>После PolarQuant остаётся небольшая ошибка. QJL (Quantized Johnson-Lindenstrauss) — алгоритм, который использует математическое преобразование Джонсона–Линденштрауса для сведения остаточной ошибки к <b>нулевому смещению</b>, тратя на это всего 1 дополнительный бит.</p><p>Если PolarQuant — это основной «сжиматель», то QJL — это математический «корректор», который гарантирует, что attention-скоры модели остаются точными. Вместе они дают 3-битное представление, которое <a href="https://arxiv.org/abs/2504.19874">математически доказано</a> как близкое к теоретическому пределу сжатия (с точностью до константы ~2,7).</p><h2>Чем TurboQuant отличается от обычной квантизации</h2><p>Если вы запускаете модели через llama.cpp, Ollama или LM Studio, вы уже используете квантизацию — те самые Q4, Q5, Q8 в названиях файлов. Но это квантизация <b>весов</b> модели. TurboQuant работает с совершенно другой сущностью.</p><p><b>Квантизация весов</b> (GPTQ, AWQ, GGUF) — сжимает параметры модели один раз перед запуском. Чем меньше бит — тем хуже качество. Иногда требует калибровки или дообучения.</p><p><b>TurboQuant</b> — сжимает KV-кеш (промежуточные вычисления) на лету во время работы. При 3,5 битах — нулевая потеря качества. Не требует дообучения вообще.</p><p>Эти подходы <b>комплементарны</b>. Вы можете использовать Q4-квантизированную модель И TurboQuant-сжатый KV-кеш одновременно. Одно не заменяет другое — они сжимают разные части системы.</p><h2>TurboQuant на практике: MacBook, видеокарты и облако</h2><h3>Если у вас MacBook или обычный ПК</h3><p>Энтузиасты уже <a href="https://www.reddit.com/r/LocalLLaMA/comments/1s5kdu0/google_turboquant_running_qwen_locally_on_macair/">запустили Qwen 3.5 9B на обычном MacBook Air M4</a> (16 ГБ) с контекстом <b>20 000 токенов</b> — раньше на таком железе длинные контексты были невозможны. Не MacBook Pro, не Mac Studio — обычный Air, самая дешёвая конфигурация. В Reddit-треде есть видео-демо.</p><p>Это значит: локальная нейросеть на вашем ноутбуке сможет «видеть» в 5 раз больше текста за раз. Длинные документы, полноценные кодовые базы, многостраничные переписки — всё это становится доступнее без покупки нового железа.</p><h3>Если у вас мощная видеокарта</h3><p>Один из разработчиков <a href="https://github.com/ggml-org/llama.cpp/discussions/20969">рассчитал</a> для модели 70B Q4_K_M с 34 ГБ свободной VRAM под KV-кеш:</p><ul><li>Без TurboQuant (FP16 KV-кеш): ~109K токенов контекста</li><li>С Q8 KV-кешем: ~218K токенов</li><li>С TurboQuant TQ3 (3 бита): ~536K токенов</li><li>Полное окно контекста 262K легко помещается на 3× RTX 3090</li></ul><h3>Если вы разрабатываете ИИ-продукты</h3><ul><li>В 5–6 раз меньше GPU-памяти на инференс при длинных контекстах</li><li>До 8× ускорение attention на H100</li><li>Снижение стоимости обслуживания каждого запроса к LLM</li></ul><p>Парадокс Джевонса: когда ресурс становится дешевле — его используют больше, а не меньше. Дешёвый инференс = больше компаний внедряют ИИ = спрос на железо в итоге растёт.</p><h2>TurboQuant в llama.cpp, MLX и PyTorch: кто уже пробует</h2><p>Прошло всего несколько дней с публикации, но Open Source сообщество уже на коне:</p><ul><li><a href="https://github.com/ggml-org/llama.cpp/discussions/20969">llama.cpp</a> — минимум 3 независимых реализации, обсуждение интеграции в основную ветку. Одна уже работает на Apple Silicon через Metal</li><li>MLX (Apple Silicon) — разработчики адаптируют алгоритм для маков</li><li>PyTorch + Triton — появились reference-реализации для CUDA-видеокарт</li><li>C/CUDA — рабочая реализация с 18 из 18 пройденных тестов, MSE совпадает с бумагой</li></ul><p>Пока реализации не оптимизированы. Бенчмарки показывают падение скорости генерации в 3–8 раз по сравнению с обычным Q8 KV-кешем. Причина — неоптимизированная операция поворота вектора. Разработчики уже работают над оптимизацией через преобразование Адамара.</p><h2>Как попробовать TurboQuant прямо сейчас</h2><p>Официального кода от Google нет, но сообщество уже сделало несколько рабочих реализаций. Вот как запустить TurboQuant на своём железе — три варианта в зависимости от платформы.</p><h3>На Mac (Apple Silicon M1–M5)</h3><p>Форк <a href="https://github.com/TheTom/llama-cpp-turboquant">llama-cpp-turboquant</a> от TheTom — самая зрелая реализация с Metal-ядрами для Apple Silicon. Работает на M1, M2, M3, M4, M5.</p><p>Флаг turbo3 включает 3,5-битную квантизацию KV-кеша (сжатие 4,6× vs FP16). На M5 Max 128 ГБ модель Qwen3.5-35B показывает 2747 tok/s на prefill — на уровне стандартного q8_0, при этом KV-кеш занимает в 4,6 раза меньше памяти.</p><h3>На PC с видеокартой NVIDIA или AMD</h3><p>Форк <a href="https://github.com/unixsysdev/llama-turboquant">llama-turboquant</a> поддерживает CUDA и ROCm. Тип кеша здесь называется tq3_0 (вместо turbo3).</p><h3>Python (для исследований и экспериментов)</h3><p><a href="https://github.com/tonbistudio/turboquant-pytorch">turboquant-pytorch</a> — reference-реализация на PyTorch. Подойдёт для изучения алгоритма и проверки сжатия на своих моделях.</p><p>Ollama и LM Studio пока <b>не поддерживают</b> TurboQuant — они используют свои сборки llama.cpp, в которые метод ещё не влит. Но можно поднять llama-server из форка выше и подключиться к нему как к OpenAI-совместимому API.</p><h2>Бенчмарки TurboQuant: результаты из бумаги и от сообщества</h2><p><b>Из бумаги Google</b> (тестировалось на Gemma и Mistral):</p><ul><li>LongBench, Needle in a Haystack, ZeroSCROLLS, RULER, L-Eval — при 3,5 битах «абсолютная нейтральность качества»</li><li>При 2,5 битах — «маргинальная деградация»</li><li>4-bit TurboQuant: ускорение attention до 8× на H100 по сравнению с 32-bit baseline</li><li>Сжатие KV-кеша минимум в 6 раз</li></ul><p><b>Из независимых реализаций:</b></p><ul><li>TQ3 (3 бита): MSE = 0,034, сжатие 4,9× vs FP16</li><li>TQ4 (4 бита): MSE = 0,009, сжатие 3,8× vs FP16</li><li>Размер блока: 52 байта на 128 значений (для TQ3)</li></ul><h2>Почему TurboQuant обвалил акции Micron — и стоит ли переживать</h2><p>Рынок отреагировал панически: Micron −25%, Samsung −4,7%, SK Hynix −6,2%. Но аналитики Morgan Stanley, JPMorgan, Citigroup и Goldman Sachs единодушны — реакция чрезмерна. Вот почему:</p><ol><li><b>TurboQuant не трогает обучение.</b> HBM-память, основной драйвер прибыли чипмейкеров, нужна для обучения моделей. TurboQuant сжимает только инференс</li><li><b>Это исследование, не продукт.</b> Официального кода от Google нет, эксперименты на моделях ~8B параметров</li><li><b>Прецедент DeepSeek.</b> В январе 2025 тоже обвалили чипмейкеров — затем спрос только вырос</li><li><b>Фиксация прибыли.</b> Micron был +300% за год, Samsung +200%. Инвесторы искали повод зафиксировать прибыль</li></ol><blockquote>Если TurboQuant снизит операционные расходы на ИИ до одной шестой от текущего уровня, компании, которые до сих пор не внедряли ИИ из-за высокой стоимости, войдут в ИИ-экосистему.</blockquote><p>Подробнее о реакции рынка — в <a href="https://tproger.ru/news/google-turboquant-obvalil-akcii-proizvoditelej-pamyati-na-25----r">нашей новости</a>.</p><h2>Часто задаваемые вопросы</h2><p><b>Чем TurboQuant отличается от GGUF/GPTQ/AWQ?</b><br />GGUF, GPTQ и AWQ сжимают <i>веса</i> модели (параметры). TurboQuant сжимает <i>KV-кеш</i> — временную рабочую память, которая используется во время инференса. Эти подходы дополняют друг друга.</p><p><b>Можно ли уже использовать TurboQuant?</b><br />Экспериментально — да. Несколько независимых реализаций для llama.cpp и MLX уже работают. Но в основную ветку llama.cpp и в Ollama/LM Studio метод пока не интегрирован. Ожидается в ближайшие недели–месяцы.</p><p><b>Нужно ли переобучать модель для TurboQuant?</b><br />Нет. TurboQuant — data-oblivious метод, который применяется к любой существующей LLM без дообучения и без калибровочных данных.</p><h2>TurboQuant: итоги и выводы</h2><ul><li>TurboQuant — прорыв в сжатии KV-кеша, но не «убийца GPU» и не «конец эпохи дорогого железа»</li><li>Работает <b>вместе</b> с обычной квантизацией весов, а не вместо неё</li><li>Реально позволяет запускать более длинные контексты на том же железе — в 5 раз длиннее</li><li>Сообщество уже пишет реализации для llama.cpp и MLX</li><li>До полноценного внедрения в популярные инструменты — недели или месяцы</li><li>Обвал акций — чрезмерная реакция, аналитики рекомендуют покупать на падении</li></ul><p>Следите за <a href="https://github.com/ggml-org/llama.cpp/discussions/20969">GitHub-дискуссией в llama.cpp</a> — именно там появится рабочая реализация для повседневного использования. А <a href="https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/">блог Google Research</a> и <a href="https://arxiv.org/abs/2504.19874">бумага на arXiv</a> — для тех, кто хочет погрузиться в математику.</p>]]></content:encoded>
    </item>
    <item>
      <title>Microsoft опубликовала официальные системные требования к игровым ПК на Windows 11</title>
      <link>https://tproger.ru/news/microsoft-opublikovala-oficialnye-sistemnye-trebovaniya-k-igrovym-pk-na-windows-11</link>
      <comments>https://tproger.ru/news/microsoft-opublikovala-oficialnye-sistemnye-trebovaniya-k-igrovym-pk-na-windows-11?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Булат Яббаров]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/microsoft-opublikovala-oficialnye-sistemnye-trebovaniya-k-igrovym-pk-na-windows-11</guid>
      <description><![CDATA[<p>Microsoft раскрыла официальные требования к игровым ПК на Windows 11 — рекомендации по CPU, GPU, ОЗУ, SSD и мониторам для 1080p, 1440p и 4K</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/microsoft-opublikovala-oficialnye-sistemnye-trebovaniya-k-igrovym-pk-na-windows-11">Microsoft опубликовала официальные системные требования к игровым ПК на Windows 11</a>»</p>]]></description>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[Windows]]></category>
      <category><![CDATA[Microsoft]]></category>
      <category><![CDATA[Советы]]></category>
      <category><![CDATA[Игра]]></category>
      <category><![CDATA[Windows 11]]></category>
      <category><![CDATA[Steam]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Процессор]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 15 Dec 2025 10:38:51 GMT</pubDate>
      <content:encoded><![CDATA[<p>Microsoft впервые <a href="https://www.neowin.net/news/microsoft-shares-official-windows-11-gaming-hardware-requirements-and-recommendations-guide/">опубликовала</a> подробные и вполне конкретные <b>рекомендации по сборке игровых ПК под Windows 11</b>.</p><p>Компания оформила их в виде привычных <b>минимальных</b> и <b>рекомендуемых</b> требований. Примерно так же делают разработчики игр перед релизом. Да и пользователям <b>Steam</b> такой подход должен быть знаком.</p><p>Документ охватывает <i>процессоры</i>, <i>видеокарты</i>, <i>оперативную память</i>, <i>накопители</i> и даже <i>мониторы</i>. Цель гайда — помочь пользователям собрать сбалансированную систему, не переплачивая за избыточную мощность.</p><h2>Процессоры и видеокарты: три уровня для разных сценариев</h2><p>Microsoft делит игровые ПК на <b>три условных класса</b>. Для <b>игр в 1080p на средних настройках</b> компания рекомендует:</p><ul><li>CPU: современные четырех- или шестиядерные процессоры, например Ryzen 5 5600 или Core i5-12400;</li><li>GPU: GTX 1660 Super или Radeon RX 6600.</li></ul><p>Для <b>1440p и высоких настроек</b>:</p><ul><li>CPU: минимум 6 ядер — Ryzen 5 7600 или Core i5-13600K;</li><li>GPU: RTX 3060 Ti / 4060 Ti или Radeon RX 6700 XT.</li></ul><p>Для <b>4K-гейминга</b>:</p><ul><li>CPU: 8 ядер и больше, например Ryzen 7 7800X3D или Core i7-13700K;</li><li>GPU: RTX 4080 или Radeon RX 7900 XTX.</li></ul><p>При этом Microsoft уточняет, что при высоких разрешениях <b>основная нагрузка ложится именно на видеокарту</b>, а не на процессор. Поэтому слепо гнаться за топовым CPU не всегда имеет смысл.</p><h2>Game Mode, память и накопители</h2><p>Отдельно компания напоминает о <b>Game Mode в Windows 11</b>. По словам Microsoft, он снижает фоновую активность системы и приоритизирует игровые процессы, помогая стабилизировать частоту кадров.</p><p>По памяти рекомендации довольно приземленные:</p><ul><li><b>16 ГБ ОЗУ</b> — достаточно для большинства современных игр;</li><li><b>32 ГБ</b> — для тяжелых проектов, модов и параллельных задач.</li></ul><p>Для хранения игр Microsoft советует <b>SSD от 1 ТБ</b>, подчеркивая важность <b>NVMe-накопителей</b>.</p><p>Они позволяют использовать технологию <b>DirectStorage</b>, при которой данные загружаются напрямую в видеокарту, сокращая загрузки и подгрузки уровней.</p><h2>Мониторы и здравый смысл</h2><p>В гайде есть и советы по выбору мониторов. Microsoft считает <b>144 Гц</b> оптимальным минимумом, а <b>165–240 Гц</b> — актуальными для соревновательных игр. Также компания рекомендует учитывать время отклика и тип матрицы — IPS, VA или OLED.</p><p>Отдельный акцент сделан на простом, но часто игнорируемом моменте: нет смысла покупать железо под 240 fps, если монитор физически не может их показать. Да, очевидно. Но кто-то этот момент может и упустить.</p>]]></content:encoded>
    </item>
    <item>
      <title>ИИ сломал рынок памяти: Transcend сворачивает выпуск SSD, Crucial закрывается</title>
      <link>https://tproger.ru/news/ii-slomal-rynok-pamyati--transcend-svorachivaet-vypusk-ssd--crucial-zakryvaetsya</link>
      <comments>https://tproger.ru/news/ii-slomal-rynok-pamyati--transcend-svorachivaet-vypusk-ssd--crucial-zakryvaetsya?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Булат Яббаров]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/ii-slomal-rynok-pamyati--transcend-svorachivaet-vypusk-ssd--crucial-zakryvaetsya</guid>
      <description><![CDATA[<p>ИИ-гонка вызвала дефицит NAND: Transcend остановила выпуск SSD, Crucial сворачивает потребительское направление, цены взлетели до 100%</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/ii-slomal-rynok-pamyati--transcend-svorachivaet-vypusk-ssd--crucial-zakryvaetsya">ИИ сломал рынок памяти: Transcend сворачивает выпуск SSD, Crucial закрывается</a>»</p>]]></description>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Microsoft]]></category>
      <category><![CDATA[Amazon]]></category>
      <category><![CDATA[Samsung]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[AMD]]></category>
      <category><![CDATA[Дата-центр]]></category>
      <category><![CDATA[Сервер]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 04 Dec 2025 08:38:10 GMT</pubDate>
      <content:encoded><![CDATA[<p>Рынок флеш-памяти входит в свой <b>самый тяжелый кризис за последние годы</b>. По данным <i>Transcend</i>, за <b>одну только неделю</b> стоимость NAND-чипов <b>выросла на 50–100%</b>.</p><p>Происходящее привело к тому, что компания официально предупредила партнеров: <b>производство, а также поставки SSD и другой продукции, завязанной на памяти, приостановлены</b>. Причина прозаична — выпускать стало просто нечего.</p><p><b>Проблемы тянутся еще с октября</b>, когда поставки NAND от ключевых производителей — Samsung и SanDisk — внезапно остановились. Цепочка разорвалась и пошли массовые перебои. Из-за этого <b>срывались контракты</b>, а <b>заказы невозможно было выполнить</b>.</p><p>В <a href="http://twitter.com/jukan05/status/1996105253545279875">письме</a> партнерам Transcend говорит о <b>«небывалой скорости удорожания»</b> и полном дефиците компонентов. Главный виновник — стремительный рост спроса со стороны ИИ-платформ и облачных дата-центров.</p><p>Amazon, Microsoft и другие крупные игроки выкупают огромные объемы NAND под собственные кластерные потребности. На традиционный рынок уходят <b>жалкие остатки</b> и цены там взлетают до небес.</p><figure><img src="https://media.tproger.ru/user-uploads/111041/2025-12-04/e4ce568e-10c5-4526-b8c9-3fc593aed5e9.jpeg" alt="" /></figure><h2>Производители уходят с рынка один за другим</h2><p>Кризис уже выбивает старых игроков. <i>Crucial</i> — один из самых известных брендов SSD и оперативной памяти — <b>фактически закрывает потребительское направление</b>.</p><p>Как <a href="https://www.cnews.ru/news/top/2025-12-04_stanovitsya_tolko_huzhevsemirno">пишет</a> CNews, компания уже <b>убрала из продажи большую часть ассортимента</b>, а выпуск SSD прекратит до апреля 2026 года.</p><p>Micron, владелец Crucial, <b>объясняет решение нестабильностью бизнеса</b>. Спрос смещается в промышленный и серверный сегменты, а массовые устройства тонут в дефиците и дорожающих компонентах. По словам компании, рынок «разрывает» спрос со стороны ИИ-кластеров и ферм на базе GPU NVIDIA и AMD. Туда же утекают NAND и DRAM.</p><h2>Дефицит будет только усиливаться</h2><p>Transcend <b>не считает происходящее временным</b>. Компания ждет, что давление на цепочки поставок сохранится еще минимум от трех до пяти месяцев, а пик кризиса придется на конец 2025 — начало 2026 года.</p><p>Это подтверждают и отраслевые источники. SanDisk уже подняла контрактные цены на NAND на 50%. Innolux и Apacer предупредили партнеров о срыве поставок и невозможности выполнять обязательства.</p>]]></content:encoded>
    </item>
    <item>
      <title>Как встроить локальную LLM в прод: от выбора модели до мониторинга токенов</title>
      <link>https://tproger.ru/articles/kak-vstroit-lokalnuyu-llm-v-prod--ot-vybora-modeli-do-monitoringa-tokenov</link>
      <comments>https://tproger.ru/articles/kak-vstroit-lokalnuyu-llm-v-prod--ot-vybora-modeli-do-monitoringa-tokenov?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Виктория Эберт]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-vstroit-lokalnuyu-llm-v-prod--ot-vybora-modeli-do-monitoringa-tokenov</guid>
      <description><![CDATA[<p>Разбираемся, как поднять локальную LLM в продакшне: от выбора модели и расчёта VRAM до настройки инференса через vLLM, распределения нагрузки, мониторинга TPS/TPM и контроля KV Cache.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-vstroit-lokalnuyu-llm-v-prod--ot-vybora-modeli-do-monitoringa-tokenov">Как встроить локальную LLM в прод: от выбора модели до мониторинга токенов</a>»</p>]]></description>
      <category><![CDATA[Инструменты]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Сервисы]]></category>
      <category><![CDATA[OpenAI]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[Сервер]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Инфраструктура]]></category>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 28 Nov 2025 08:30:03 GMT</pubDate>
      <content:encoded><![CDATA[<h2>Зачем вообще городить свой прод</h2><p>Поднимая модель внутри своего контура, вы получаете контроль и автономию. Данные не уходят на сервер третьей стороны и можно спокойно работать с чувствительными данными и внутренними документами под NDA, не рискуя, что они утекут в логах провайдера.</p><p>Горячий аргумент в пользу локальных LLM от <a href="https://www.reddit.com/r/selfhosted/comments/1ih4iee/selfhosting_llms_seems_pointlesswhat_am_i_missing/?utm_source=share&amp;utm_medium=web3x&amp;utm_name=web3xcss&amp;utm_term=1&amp;utm_content=share_button">юзеров Reddit</a>: пока внешние LLM относительно нейтральны, но это временно. Как только рынок окончательно созреет — корпорации будут закручивать гайки, чтобы зарабатывать больше.</p><p>Внешний API — это зависимость. Провайдер может в любой момент поменять правила игры: повысить тарифы, вывести старую модель из эксплуатации, ужесточить модерацию или ограничить доступ в определённом регионе. Качество ответов тоже не гарантировано: апдейты могут ухудшить выдачу, а сервисы могут падать в самый неподходящий момент — как это было с OpenAI API из-за сбоя у Cloudflare в <a href="https://status.openai.com/incidents/01KABE2437NJYKBFHT22SD3H92">ноябре 2025 года</a>.</p><p>Стоимость API. Если у компании очень много запросов, счёт может выйти в копеечку. Локальная модель на собственном сервере — это понятный набор расходов: железо + электричество + обслуживание, который окупается с ростом нагрузки.</p><p>Ну и главный плюс on-premise LLM: вы сами решаете, когда обновляться, какие фильтры включать, как модель отвечает, и при желании дообучаете её на своих данных под нужный tone-of-voice.</p><h2>Как выбрать модель и не пожалеть</h2><p>Выбирая самую «крутую» модель из лидерборда, можно легко попасть в ловушку. Рейтинги моделей — это усреднённая температура по больнице. Модель может блистать на общих бенчмарках, но провалиться на вашем внутреннем датасете. На практике ориентируйтесь не на хайп, а на три принципа:</p><h2>Размер имеет значение: больше ≠ лучше</h2><blockquote>Размер модели напрямую влияет на её возможности. Обычно чем она больше, тем лучше справляется с задачами. Но у этого есть обратная сторона: крупным моделям нужно значительно больше GPU-памяти, а значит — они дороже в обслуживании и поддержке. Если планируете поднимать локальную модель, оцените свои возможности в локальной развёртке моделей: сколько суммарно видеопамяти вообще есть (или сколько она будет стоить), и какой размер модели можно на ней поднять. Естьсервис, где это можно рассчитать:https://huggingface.co/spaces/Vokturz/can-it-run-llm</blockquote><p><b>TPS решает: сколько токенов модель выдаёт в секунду</b></p><blockquote>Скорость работы измеряют по показателю TPS (token-per-second) — сколько токенов (считай символов) генерируется в секунду. Чем больше LLM, тем дольше она отвечает. Обычно 15 TPS — это оптимальное значение для заданной пропускной способности.<br />Сейчас есть модели с архитектурой MOE (Mixture of Experts), которые во время инференса активируют только часть нейронов. За счёт такого строения модели работают быстрее и не сильно теряют в качестве.<br />Например, Qwen3-235B-A22B по скорости работает на уровне 14B-модели, но качество ответов намного лучше. Но и маленькие модели не стоит недооценивать — на узких задачах они не уступают своим собратьям побольше, но работают намного быстрее.</blockquote><h2>Качество на задаче: проверяем на своих данных</h2><blockquote>В идеальном мире под каждую задачу нужно подбирать или обучать определённую модель, которая умеет хорошо решать конкретно эту задачу. На практике не всегда достаточно ресурсов, чтобы поддерживать столько разных моделей. Качество работы можно оценить по публичным бенчмаркам, близким к вашей задаче. Например, если вы решаете задачу Text2SQL, можно проверить модели и статьи, которые ссылаются на бенчмарк Spider. Но всё же публичные лидерборды стоит учитывать только для первичного отбора моделей и подходов. Лучше собирать свой внутренний бенчмарк и оцениваться в нём.<br />Протестить open-source модель до того, как закупать железо можно на платформеopenrouter.ai. Обычно модели появляются там через несколько дней после релиза.</blockquote><h2>Инфраструктура, инструменты, мощности: с чего начать</h2><p>После того как вы определились с моделью, нужно продумать инфраструктуру и инструменты для инференса. Инференс — это использование модели на практике: когда она получает запрос и генерирует ответ.</p><blockquote>Чтобы выстроить минимальный, но надёжный прод для локальной LLM, нужны прямые руки DevOps, настроенный сервер/кластер с Nvidia CUDA и большое желание дебажить. Как собрать такой прод:</blockquote><p>🎬 Видеолекция от Мичила Егорова: «Построение инфраструктуры для работы с LLM: опыт X5 Tech»</p><h2>vLLM</h2><p>📄 <a href="https://docs.vllm.ai/en/latest/">Документация</a></p><p>vLLM — высокопроизводительная и удобная библиотека для инференса и обслуживания LLM. Изначально разработана в лаборатории Sky Computing Lab Калифорнийского университета в Беркли.</p><p>С чего начать:</p><ul><li>Запуск моделей с открытым исходным кодом: <a href="https://docs.vllm.ai/en/latest/">Quickstart Guide</a>.</li><li>Создание приложений с vLLM: <a href="https://docs.vllm.ai/en/latest/">User Guide</a>.</li><li>Сборка vLLM: <a href="https://docs.vllm.ai/en/latest/">Developer Guide</a>.</li></ul><h2>llama.cpp</h2><p>📄 <a href="https://github.com/ggml-org/llama.cpp">Документация</a></p><p>llama.cpp позволяет запускать LLM с минимальной настройкой и по словам разработчиков обеспечивает высокую производительность на разных устройствах — локально и в облаке. Изначально <a href="https://habr.com/ru/companies/ruvds/articles/923304/">была задумана</a> как библиотека на C/C++ для запуска модели LLaMA.</p><p>С чего начать:</p><ul><li>Установка llama.cpp через <a href="https://github.com/ggml-org/llama.cpp/blob/master/docs/install.md">brew, nix или winget</a>.</li><li>Запуск с <a href="https://github.com/ggml-org/llama.cpp/blob/master/docs/docker.md">Docker</a>.</li><li>Сборка из исходного кода: <a href="https://github.com/ggml-org/llama.cpp/blob/master/docs/build.md">руководство</a>.</li></ul><h2>Triton Inference Server</h2><p>📄 <a href="https://github.com/triton-inference-server/server#triton-inference-server">Документация</a></p><p>Triton Inference Server — высокопроизводительная платформа от Nvidia для инференса моделей. Поддерживает разнообразные фреймворки (TensorFlow, PyTorch, ONNX, OpenVINO и др.) и позволяет масштабировать модели в продакшне с минимальной доработкой кода.</p><p>С чего начать:</p><ul><li>Установка через <a href="https://github.com/triton-inference-server/server/blob/main/docs/customization_guide/build.md#building-with-docker">Docker</a>.</li><li>Установка <a href="https://github.com/triton-inference-server/server/blob/main/docs/customization_guide/build.md#building-without-docker">без контейнеров Docker</a>.</li><li>Сборка из исходного кода: <a href="https://github.com/triton-inference-server/server/blob/main/docs/customization_guide/build.md#building-on-unsupported-platforms">руководство</a>.</li></ul><h2>Где взять мощности для GPU</h2><p>Главный вопрос локального продакшна — видеопамять. От её объёма и пропускной способности зависит, сможете ли вы поддерживать стабильный отклик и масштабировать систему. Есть два основных пути: аренда мощностей в облаке или сборка собственного сервера/кластера с GPU.</p><p>Перед тем как выбирать стратегию хостинга, стоит заранее прикинуть аппетиты выбранной модели. Нельзя купить видеокарту «на глаз»: если модель не влезет в память, она просто не запустится, а если влезет «впритык» — будет падать при длинных диалогах.</p><p>🖩 Инструмент: <a href="https://huggingface.co/spaces/Vokturz/can-it-run-llm">Can you run it? LLM version</a> — калькулятор VRAM для LLM.</p><blockquote>Если у вас стартап — не спешите поднимать свои модели. Современные LLM API закрывают множество задач, вплоть до дообучения LoRa на своих данных. Если вы собираете свой первый продукт — лучше сконцентрироваться на сборе внутреннего бенчмарка, а про локальные LLM подумать уже позже.</blockquote><p>Для быстрого старта без вложений в собственное железо можно воспользоваться готовыми облачными GPU‑сервисами.</p><p>☁️ Подборка: <a href="https://tproger.ru/articles/gde-arendovat-gpu-v-2025--podborka-gpu-hostingov-s-adekvatnoj-cenoj-i-sla">Где арендовать GPU в 2025: подборка GPU‑хостингов с адекватной ценой и SLA</a></p><blockquote>Собственный сервер требует огромных вложений в моменте и дорог в обслуживании, может долго окупаться и быстро устареть. Я бы не советовал этот путь, если вы еще не определились, что конкретно будете решать, и как скоро можете окупить затраты. <br />Если ожидается экспоненциальное увеличение нагрузки (например, в стартапе), то лучше арендовать мощности. Если же нагрузка в ближайшее время не увеличится, вы знаете, как окупать эти инвестиции, и хотите играть на долгий срок — лучше идти в сторону своего сервера.</blockquote><h2>Мониторинг</h2><p>Недостаточно следить только за общим состоянием сервера и контейнера — жив ли он, какое время ответа, сколько запросов делается в секунду, насколько заполнены диски. Важно отслеживать показатели, связанные с процессом генерации:</p><ul><li>TPS и TPM (token-per-second и token-per-minute) — скорость генерации токенов.</li><li>Размер очереди на генерацию — количество запросов, ожидающих обработки. Если очередь растёт, это означает, что текущей мощности недостаточно для поступающей нагрузки.</li><li>Заполненность KV Cache (пар «ключ-значение») — кэш промежуточных вычислений, ускоряющий работу модели.</li></ul><p>В случае с vLLM всё это предоставляется из коробки в Prometheus.</p><h3>Лимиты токенов</h3><figure><img src="https://media.tproger.ru/user-uploads/111449/2025-11-27/60c1dc36-9f2a-41a9-845c-62ac8c8aa17a.png" alt="" /><figcaption>Источник: majorgeeks.com</figcaption></figure><p>В локальной инфраструктуре мониторинг токенов выполняет две функции: контроль загрузки железа и стабильности. Модель на своём сервере не выставляет вам счёт за токены, но берет своё временем выполнения и энергозатратами.</p><p>Если не настроить лимиты и алерты, можно сжечь ресурсы впустую: некорректно сформированная или очень длинная генерация может занять весь GPU и заблокировать всю очередь, вытеснив другие задачи. Если задать лимиты — прод останется стабильным, даже если пользователи попытаются заставить LLM написать «Войну и мир».</p><blockquote>В Х5 у каждого пользователя или сервиса есть квота на месяц и выставлены алерты. Также мы настраиваем ограничения по TPM (token-per-minute), чтобы избежать риска случайного или намеренного DDoSа моделей.</blockquote><h2>Типичные грабли инференса локальных LLM</h2><p>Даже если прод собран аккуратно и модель подобрана идеально, локальный инференс всё равно подкидывает сюрпризы.</p><blockquote>1. Китайские иероглифы и любые странные символы — они характерны для семейства моделей Qwen. На последних версиях такое возникает реже, но раньше промпт не излечивал полностью это поведение. Это можно исправить корректировкой генерации декодера: мы настраивали guided generation и обнуляли вероятности генерации китайских символов.<br />2. Неправильно подобранные системные токены. Они обозначают начало и конец генераций конкретных ролей (user, assistant, tool etc). Для разных типов моделей, и даже внутри одного типа (Mistral, Qwen, Llama, и др.) системные токены различаются. Например, при смене семейства моделей можно забыть исправить системные токены. А если использовать «чужие» токены или не использовать их вовсе, качество моделей сильно проседает, поэтому нужно внимательно за этим следить.. 3. Перезаполнение памяти. Каждая отдельная генерация и kv cache занимает какое-то количество видеопамяти. Если не уследить, то в какой-то момент память GPU может перезаполниться и весь контейнер упадёт. Поэтому нужно внимательно отслеживать заполнение и ставить лимиты на генерацию, чтобы этого не происходило.</blockquote>]]></content:encoded>
    </item>
    <item>
      <title>Эпоха LLM трещит по швам: со-основатель OpenAI и глава ИИ в *Meta объяснили, что будет дальше</title>
      <link>https://tproger.ru/news/epoha-llm-treshhit-po-wvam--so-osnovatel-openai-i-glava-ii-v--meta-obyasnili--chto-budet-dalwe</link>
      <comments>https://tproger.ru/news/epoha-llm-treshhit-po-wvam--so-osnovatel-openai-i-glava-ii-v--meta-obyasnili--chto-budet-dalwe?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Булат Яббаров]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/epoha-llm-treshhit-po-wvam--so-osnovatel-openai-i-glava-ii-v--meta-obyasnili--chto-budet-dalwe</guid>
      <description><![CDATA[<p>Суцкевер и Лекун заявили о конце эпохи масштабирования LLM: индустрии нужны новые методы, гибридные модели и подходы за пределами простого роста</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/epoha-llm-treshhit-po-wvam--so-osnovatel-openai-i-glava-ii-v--meta-obyasnili--chto-budet-dalwe">Эпоха LLM трещит по швам: со-основатель OpenAI и глава ИИ в *Meta объяснили, что будет дальше</a>»</p>]]></description>
      <category><![CDATA[Интернет]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[OpenAI]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Инфраструктура]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 27 Nov 2025 07:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p><b>Илья Суцкевер</b> (со-основатель OpenAI) и <b>Янн Лекун</b> (Chief AI Scientist в *Meta) почти синхронно <a href="https://www.abzglobal.net/web-development-blog/ilya-sutskever-yann-lecun-and-the-end-of-just-add-gpus">заявили</a>: <b>масштабирование LLM оказалось на пределе</b>.</p><p>Это важный момент — индустрия десятилетие жила по формуле <i>«больше данных → больше параметров → лучше модель»</i>. Теперь же оба лидера признают: следующий этап развития ИИ требует <b>новых идей</b>, а не просто новых кластеров с чипами H100.</p><h2>Что говорит Суцкевер: эпоха масштабирования закончилась</h2><p>Суцкевер делит историю ИИ на три периода:</p><ul><li><b>2012–2020 это эпоха исследований.</b> Здесь сфера получала новые архитектуры, CNN, внимание, RL.</li><li><b>2020–2025 это эпоха масштабирования.</b> Законы масштабирования обеспечивают стабильный прирост качества.</li><li><b>2025 и далее — возвращение к исследованиям. </b>GPU-фермы огромны, интернет конечен, эффект от роста моделей падает.</li></ul><p>Главными лимитами актуальных LLM он назвал то, что высокий балл в бенчмарках ≠ надежность в реальных задачах. Также Суцкевер отметил, что обучение моделей все еще  остается «черным ящиком, а обобщение все еще слабее человеческого — модели требуют тонны данных и сложные пайплайны пост-тюнинга.</p><p>Его новая компания SSI делает ставку именно на <b>новые методы обучения</b>, а не на «GPT-7, который такой же, но больше».</p><h2>Что говорит Лекун: LLM — тупиковая ветвь</h2><p>Лекун куда радикальнее. Он в принципе считает, что LLM глубоко ограничены. Связывает он это с тем, что они <b>предсказывают следующий токен</b>, а не понимают мир.</p><p>Еще к минусам нынешнего подхода он отнес тот факт, что каждый новый скачок дается все дороже, а отдача снижается. Ну и вишенка на торте — для настоящего интеллекта нужны <b>world models</b>. Т. е системы, которые учатся на видео, строят представления об объектах, времени и причинности.</p><p>К слову, *Meta активно продвигает архитектуру <b>JEPA</b>, нацеленную на обучение универсальных представлений, которые можно использовать для памяти, планирования и размышлений.</p><h2>Почему это важно для разработчиков</h2><p>Обе позиции сходятся на главном: <b>мир ИИ меняется</b>. Что это означает для тех, кто строит продукты?</p><h2>1. GPU перестают быть главным преимуществом</h2><p>Если масштабирование не дает прежнего прироста, то выигрыш дают:</p><ul><li>свои данные;</li><li>UX;</li><li>доменные сценарии;</li><li>собственные пайплайны обработки.</li></ul><h2>2. Бенчмарки больше ничего не гарантируют</h2><p>+2% к Abilities Arena вообще не означают меньше ошибок в рабочем процессе пользователя.</p><h2>3. Стек ИИ станет более разнообразным</h2><p>Появятся модели, которые:</p><ul><li>отвечают за физическое моделирование;</li><li>выполняют планирование;</li><li>работают поверх видео, а не текста;</li><li>комбинируются с LLM в гибридные системы.</li></ul><h2>4. Главный актив — данные и обратная связь</h2><p>По мнению экспертов, в ИИ-гонке победят не те, у кого лучший baseline-модель. Лидерство достанется тем, кто владеет качественными доменными данными, строит точные метрики качества и быстро (и итеративно) улучшает результат под свои процессы.</p><h2>Что дальше: тихий перелом эпохи</h2><p>Пятилетняя мантра «масштабирование — это все, что вам нужно» дала нам GPT-4, Claude, Gemini и всю текущую волну ИИ-продуктов. Но сегодня два главных человека в индустрии говорят: <b>масштаб больше не тянет нас вверх (Суцкевер) и LLM не приведут к настоящему ИИ (Лекун)</b>.</p><p>Начинается новая глава — где инфраструктура остается огромной, но реальные прорывы делает не <b>«больше»</b>, а <b>«иначе»</b>. И если на первых этапах это может быть неприятно и больно, то в долгосрочной перспективе такой подход может принести еще больше интересных открытий.</p>]]></content:encoded>
    </item>
    <item>
      <title>PewDiePie стал техноанархистом: свой сервер за $20 000, свой ИИ, свои данные</title>
      <link>https://tproger.ru/news/pewdiepie-stal-tehnoanarhistom--svoj-server-za--20-000--svoj-ii--svoi-dannye</link>
      <comments>https://tproger.ru/news/pewdiepie-stal-tehnoanarhistom--svoj-server-za--20-000--svoj-ii--svoi-dannye?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Булат Яббаров]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/pewdiepie-stal-tehnoanarhistom--svoj-server-za--20-000--svoj-ii--svoi-dannye</guid>
      <description><![CDATA[<p>PewDiePie собрал свой ИИ-сервер за $20 000, отказался от ChatGPT и бигтеха. Теперь он живет по принципу: «Если можешь — запускай у себя»</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/pewdiepie-stal-tehnoanarhistom--svoj-server-za--20-000--svoj-ii--svoi-dannye">PewDiePie стал техноанархистом: свой сервер за $20 000, свой ИИ, свои данные</a>»</p>]]></description>
      <category><![CDATA[Linux]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Raspberry Pi]]></category>
      <category><![CDATA[OpenAI]]></category>
      <category><![CDATA[YouTube]]></category>
      <category><![CDATA[Дата-центр]]></category>
      <category><![CDATA[Сервер]]></category>
      <category><![CDATA[Steam]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 06 Nov 2025 07:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Феликс Чельберг, он же <b>PewDiePie</b>, больше не просто ютубер.</p><p>Теперь он человек, который <b>собрал персональный дата-центр</b>, отказался от ChatGPT и крутит свои LLM локально. Об этом он <a href="https://www.youtube.com/watch?v=qw4fDU18RcU">рассказал</a> в своем свежем видео на YouTube.</p><h2>Свой «ИИ-совет» из восьми моделей</h2><p>В новом видео PewDiePie показал свой «суперкомпьютер» — 10 GPU уровня RTX 4090, на которых он одновременно запускает <b>до 64 моделей</b> вроде Llama 405B.</p><p>Ради фана он даже сделал «ИИ-совет»: восемь нейросетей спорят между собой и голосуют за лучший ответ на его запрос.</p><h2>Отмена ChatGPT и философия приватности</h2><p>Феликс <b>отписался от ChatGPT</b>, когда понял, что удаленные чаты все равно остаются в обучающей выборке OpenAI.</p><blockquote><i>«Когда Google или OpenAI знают мои личные данные — это странно. Но если мой ИИ хранит их у меня на ПК — это мои данные».</i></blockquote><p>PewDiePie теперь полностью живет в духе <b>цифрового суверенитета</b>: он отказался от Google, перешел на <b>Linux</b> и <b>GrapheneOS</b>, самохостит облако на <b>Raspberry Pi</b> и даже превратил <b>Steam Deck</b> в сервер.</p><figure><img src="https://media.tproger.ru/user-uploads/111041/2025-11-06/91128f6d-72de-42a5-982f-1e8d19aa0ab6.jpeg" alt="" /></figure><h2>Из мемного короля в философа самоконтроля</h2><p>Корни такого подхода — в 2017 году. После скандала с WSJ и разрыва контрактов с Disney и YouTube, Феликс понял, что <b>один заголовок может стереть твою карьеру</b>. С тех пор он выстраивает систему, где <b>не зависит ни от одной корпорации</b>.</p><p>Сегодня PewDiePie говорит языком open-source движения: локальные LLM, приватные данные, самохостинг, отказ от бигтеха.</p><p>Иронично, но один из символов массового YouTube стал манифестом <b>анти-YouTube эпохи</b> — когда твой главный девиз: <i>«Если можешь — запускай у себя»</i>.</p>]]></content:encoded>
    </item>
    <item>
      <title>Какие приложения установить на Windows и macOS</title>
      <link>https://tproger.ru/articles/kakie-prilozheniya-ustanovit-na-windows-i-macos</link>
      <comments>https://tproger.ru/articles/kakie-prilozheniya-ustanovit-na-windows-i-macos?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Валерия Турчак]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kakie-prilozheniya-ustanovit-na-windows-i-macos</guid>
      <description><![CDATA[<p>Список разбит по категориям: от браузеров и гейминга до утилит безопасности и инструментов для продуктивности.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kakie-prilozheniya-ustanovit-na-windows-i-macos">Какие приложения установить на Windows и macOS</a>»</p>]]></description>
      <category><![CDATA[API]]></category>
      <category><![CDATA[Linux]]></category>
      <category><![CDATA[Android]]></category>
      <category><![CDATA[Инструменты]]></category>
      <category><![CDATA[Git]]></category>
      <category><![CDATA[Apple]]></category>
      <category><![CDATA[Безопасность]]></category>
      <category><![CDATA[Производительность]]></category>
      <category><![CDATA[Практика]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[.NET]]></category>
      <category><![CDATA[Браузеры]]></category>
      <category><![CDATA[Windows]]></category>
      <category><![CDATA[iOS]]></category>
      <category><![CDATA[Slack]]></category>
      <category><![CDATA[Работа]]></category>
      <category><![CDATA[Microsoft]]></category>
      <category><![CDATA[Tor]]></category>
      <category><![CDATA[Windows 10]]></category>
      <category><![CDATA[Google Chrome]]></category>
      <category><![CDATA[GitHub]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Базы данных]]></category>
      <category><![CDATA[Управление проектами]]></category>
      <category><![CDATA[Rust]]></category>
      <category><![CDATA[HR]]></category>
      <category><![CDATA[VPN]]></category>
      <category><![CDATA[Telegram]]></category>
      <category><![CDATA[Xbox]]></category>
      <category><![CDATA[GitLab]]></category>
      <category><![CDATA[Сервисы]]></category>
      <category><![CDATA[Docker]]></category>
      <category><![CDATA[macOS]]></category>
      <category><![CDATA[Для продвинутых]]></category>
      <category><![CDATA[Intel]]></category>
      <category><![CDATA[MIT]]></category>
      <category><![CDATA[Adobe]]></category>
      <category><![CDATA[Firefox]]></category>
      <category><![CDATA[IBM]]></category>
      <category><![CDATA[Mozilla]]></category>
      <category><![CDATA[Avast]]></category>
      <category><![CDATA[Фронтенд]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[Маркетинг]]></category>
      <category><![CDATA[QA]]></category>
      <category><![CDATA[Мессенджер]]></category>
      <category><![CDATA[AMD]]></category>
      <category><![CDATA[YouTube]]></category>
      <category><![CDATA[Epic Games]]></category>
      <category><![CDATA[Игра]]></category>
      <category><![CDATA[Приложение]]></category>
      <category><![CDATA[Бета]]></category>
      <category><![CDATA[Safari]]></category>
      <category><![CDATA[Взлом]]></category>
      <category><![CDATA[PlayStation]]></category>
      <category><![CDATA[Microsoft Edge]]></category>
      <category><![CDATA[Discord]]></category>
      <category><![CDATA[Сервер]]></category>
      <category><![CDATA[RPA]]></category>
      <category><![CDATA[Дизайн]]></category>
      <category><![CDATA[Figma]]></category>
      <category><![CDATA[Графы]]></category>
      <category><![CDATA[Markdown]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Notion]]></category>
      <category><![CDATA[Дизайн интерфейсов и UX]]></category>
      <category><![CDATA[Steam]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[iPhone]]></category>
      <category><![CDATA[MacBook]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sun, 26 Oct 2025 14:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Итак, вы только что настроили новый компьютер. Операционная система установлена, драйверы обновлены, и теперь пора заняться самым интересным — установкой программ. Но с чего начать? Какие приложения действительно необходимы, а какие просто занимают место?</p><p>Редакция Tproger сделала и адаптировала <a href="https://www.techspot.com/article/2974-desktop-software-essentials/">перевод подборки  программ для Windows и macOS</a>. Здесь вы найдёте проверенные временем решения для работы, развлечений и повседневных задач. Мы сосредоточились на бесплатных и условно-бесплатных приложениях с отличной репутацией, которые решают реальные задачи без навязывания ненужных функций.</p><p>Список разбит по категориям: от браузеров и гейминга до утилит безопасности и инструментов для продуктивности.</p><p>Неважно, опытный вы пользователь или новичок — здесь найдётся что-то полезное для каждого.</p><h2>Браузеры</h2><p>Браузер — это, пожалуй, самое важное приложение на вашем компьютере. Именно через него проходит большая часть вашей цифровой жизни: работа, развлечения, коммуникации. Выбор браузера влияет не только на скорость загрузки страниц, но и на конфиденциальность, безопасность и удобство работы.</p><ul><li><b>Большинство пользователей:</b> Chrome, Edge или Safari</li><li><b>Защита приватности: </b>Firefox, Brave, Ungoogled Chromium</li><li><b>Опытные пользователи:</b> Vivaldi</li><li><b>Максимальная анонимность: </b>Tor Browser</li></ul><h3>Google Chrome</h3><p>Chrome остаётся самым популярным браузером в мире — и не просто так. Он быстрый, стабильный и отлично интегрируется с экосистемой Google. Огромная библиотека расширений из Chrome Web Store позволяет настроить браузер под любые задачи. Синхронизация между устройствами работает безупречно: вкладки, пароли, закладки и история всегда под рукой.</p><p>Минус один, но существенный: Chrome прожорлив. Если у вас открыто больше десятка вкладок, он может съесть несколько гигабайт оперативной памяти. На компьютерах с 8 ГБ RAM и меньше это становится проблемой.</p><h3>Mozilla Firefox</h3><p>Firefox — это выбор тех, кто ценит приватность и открытость. Mozilla не зарабатывает на продаже ваших данных, а сам браузер активно развивается сообществом. Встроенные инструменты защиты от трекинга работают из коробки, блокируя рекламные сети и скрипты слежения.</p><p>По скорости Firefox не уступает Chrome, а по потреблению памяти даже выигрывает. Библиотека расширений чуть меньше, чем у Chrome, но все основные инструменты доступны.</p><h3>Microsoft Edge</h3><p>Edge построен на том же движке Chromium, что и Chrome, но при этом лучше оптимизирован для Windows. Microsoft вложилась в производительность: браузер работает быстро, потребляет меньше ресурсов и отлично интегрируется с системой.</p><p>Особенно приятны функции вроде Collections (коллекции вкладок для организации исследований), режим чтения и встроенный скриншотер. Edge поддерживает все расширения Chrome, так что переход безболезненный.</p><h3>Brave</h3><p>Brave — это Chrome на стероидах приватности. Браузер блокирует рекламу и трекеры по умолчанию, что делает сёрфинг быстрее и безопаснее. При этом он полностью совместим с расширениями Chrome.</p><p>Есть интересная фишка: Brave Rewards позволяет зарабатывать криптовалюту за просмотр приватной рекламы (если захотите её включить). Спорная механика, но как опция — почему нет. Для тех, кто хочет Chrome без Google и с упором на приватность, Brave — отличный выбор.</p><h3>Safari (только macOS)</h3><p>Если у вас Mac, Safari заслуживает внимания. Это самый энергоэффективный браузер для macOS: на MacBook он даёт ощутимо больше автономности по сравнению с Chrome или Firefox. Интеграция с экосистемой Apple безупречна: Handoff, синхронизация через iCloud, Reading List, автозаполнение паролей.</p><p>Safari быстрый, безопасный и не перегружен функциями. Единственный минус — библиотека расширений заметно скромнее, чем у конкурентов. Но для большинства задач базового функционала хватает.</p><h3>Ungoogled Chromium</h3><p>Для ультраосторожных Ungoogled Chromium удаляет всё отслеживание и сервисы Google — но вам придётся настраивать всё самостоятельно, так как в нём нет автообновлений или встроенной синхронизации.</p><p>Для максимально осторожных пользователей — это Chrome, из которого убрали всю телеметрию Google, отслеживание и облачные сервисы. Браузер работает, но требует ручной настройки: отсутствуют автоматические обновления и встроенная синхронизация между устройствами.</p><h3>Tor Browser</h3><p>Выводя приватность на следующий уровень, Tor Browser маршрутизирует ваш трафик через сеть Tor, анонимизируя ваш IP и многократно шифруя соединение. Он медленнее по задумке, но идеален, если ваш приоритет — максимальная анонимность, а не скорость или удобство.</p><h3>Vivaldi</h3><p>Vivaldi — браузер мечты для тех, кто хочет полного контроля. Стекирование вкладок, тайлинг, кастомные горячие клавиши, встроенная почта и календарь, веб-панели — это полноценный десктопный опыт внутри браузера. Хотите боковую панель браузера, открывающую ваши заметки, RSS-ленты или любой нужный сайт? Vivaldi это умеет.</p><h3>Arc</h3><p>Наконец, Arc — когда-то новичок на рынке браузеров, нацеленный на переосмысление UX: замена традиционной панели вкладок на боковую панель, акцент на веб-приложениях, интегрированные разделённые виды и easels для заметок и доски. К сожалению, компания за Arc прекратила разработку, чтобы полностью переключиться на ИИ с новым браузером, который сейчас в закрытой бета-версии.</p><h2>Управление паролями</h2><ul><li><b>Лучший бесплатный выбор:</b> Bitwarden</li><li><b>Также отлично:</b> 1Password, Dashlane, KeePass</li></ul><p>Миллионы людей продолжают использовать одни и те же слабые пароли на всех сайтах — или, что ещё хуже, держатся за классику вроде «123456». Даже сильные пароли мало помогают, если их повторяют или забывают. Конечно, большинство браузеров предлагают встроенные менеджеры паролей, но они ограничены, привязаны к одному браузеру и менее безопасны, чем специализированные решения.</p><p>Также не будем забывать о passkeys (ключах доступа). Если говорить практически, можно сказать, что passkeys объединяют концепцию пароля и двухфакторной аутентификации (2FA) в одно плавное действие, но гораздо безопаснее и гораздо менее раздражающе.</p><h3>Bitwarden</h3><p>Полностью опенсорсный, зашифрованный и щедрый даже в бесплатной версии. Вы получаете неограниченное количество паролей, синхронизацию между устройствами и приложения для всех платформ. Премиум ($10/год) добавляет безопасный обмен файлами и инструменты 2FA. Также есть доступные семейные и командные планы.</p><h3>1Password</h3><p>Премиум-решение с отполированным интерфейсом, сильной кроссплатформенной поддержкой и отличными функциями вроде Travel Mode (режим путешествий) и полной интеграцией passkeys.</p><h3>Dashlane</h3><p>Предлагает мониторинг даркнета, интеграцию VPN и плавный пользовательский опыт. Есть бесплатный тариф с ограниченными функциями, но премиум-версия конкурентоспособна.</p><h3>KeePassXC</h3><p>Отличная оффлайн-альтернатива, если хотите полного контроля и не против ручной синхронизации (или использования чего-то вроде Syncthing или Dropbox для синхронизации базы данных).</p><p>Пропустите LastPass — когда-то фаворит, он упал в немилость после повторных утечек безопасности. Для душевного спокойствия лучше поискать в другом месте.</p><h2>Продвинутые утилиты и дополнения к ОС</h2><ul><li><b>Поиск + лаунчеры:</b> Everything или Wox (Windows), Alfred или Raycast (macOS)</li><li><b>Пакетные менеджеры: </b>WinGet, Homebrew (macOS)</li><li><b>Для пользователей Windows:</b> PowerToys</li><li><b>Для пользователей Mac: </b>Rectangle</li><li><b>История буфера обмена: </b>ClipClip, Flycut (macOS)</li><li><b>Скриншоты + аннотации: </b>Monosnap</li></ul><h3>Winget</h3><p><b></b>Официальный менеджер пакетов Microsoft, встроенный в Windows 10 и 11. Работает похоже на Chocolatey, но разработан и поддерживается Microsoft. Homebrew — самый популярный менеджер пакетов для macOS. Позволяет быстро устанавливать, обновлять и управлять приложениями и CLI-инструментами с помощью команд в терминале.</p><h3>Everything</h3><p>Что касается поиска, Everything остаётся золотым стандартом сверхбыстрого поиска по именам файлов в Windows. Он индексирует диски за секунды и выдаёт почти мгновенные результаты с минимальной нагрузкой на систему. Если нужен функционал шире базового поиска, Wox использует движок Everything и добавляет мощные возможности лаунчера: поиск файлов, запуск приложений, калькулятор, перевод текста и расширения через плагины. Получается более гибкий опыт в духе Spotlight для Windows.</p><h3>Command Palette/Alfred/Raycast</h3><p>В который раз Microsoft не смогла существенно улучшить встроенный поиск Windows, хотя <b>Command Palette</b> в PowerToys даёт неплохой компромисс для тех, кто не хочет ставить сторонние утилиты.</p><p>На macOS <b>Alfred</b> по-прежнему главный лаунчер и утилита поиска. Он быстрый, интуитивный и в бесплатной версии включает историю буфера и настраиваемые поиски; расширенная автоматизация и «воркфлоу» доступны в Powerpack.</p><p>Тем, кто хочет современную облачно-интегрированную альтернативу с готовыми расширениями и встроенной поддержкой Notion, GitHub и Slack, стоит присмотреться к <b>Raycast</b> — это стильный, дружественный к разработчикам вариант, который стремительно набирает популярность.</p><h3>Менеджеры буфера обмена</h3><p>Они позволяют возвращаться к ранее скопированному — тексту, изображениям, ссылкам — и сильно ускоряют рутинные операции.</p><p>В Windows встроенная история буфера (Win + V) кое-как выручает, но продвинутым пользователям обычно хочется большего. В числе бесплатных рекомендаций — <b>ClipClip</b> для Windows и <b>Flycut</b> для macOS.</p><p>Когда речь о скриншотах и аннотациях, штатные инструменты macOS и Windows заметно выросли. Но многим всё равно удобнее сторонние решения. Нам по-прежнему нравится <b>Monosnap</b> за простоту и возможность мгновенно заливать снимки в облако для шаринга (и это бесплатно).</p><p><b>PowerToys</b> — набор полезных утилит от Microsoft для продвинутых пользователей Windows, повышающих продуктивность и упрощающих рабочие процессы. Среди инструментов: FancyZones для продвинутого раскладывания окон, PowerRename для пакетного переименования, Keyboard Manager для ремапинга клавиш, универсальный color picker и другие.</p><p><b>Rectangle</b> и <b>Magnet </b>— два самых популярных приложения на macOS для закрепления окон: быстрые выравнивание и ресайз по хоткеям или перетаскиванием, примерно как по умолчанию в Windows. Пользователям, пришедшим с Windows и скучающим по системному снапингу, одно из них жизненно необходимо.</p><p>Широко используемая альтернатива в Windows — <b>FancyZones</b> (часть PowerToys), предлагающая продвинутое управление окнами: настраиваемые сетки, зоны привязки и поддержку нескольких мониторов — поэтому это фаворит пауэр-пользователей на Windows.</p><h2>Для рутины и создания проектов</h2><ul><li><b>Бесплатные инструменты: </b>FreeOffice, LibreOffice и WPS Office</li><li>Microsoft Office за единовременную плату $49, Office 2024 — $129</li><li><b>Заметки: </b>Notion, OneNote, Obsidian</li><li><b>Бесплатный PDF-редактор: </b>PDFsam</li><li><b>Почтовые клиенты:</b> Thunderbird, eM Client</li></ul><p>Независимо от того, пишете ли вы тексты, планируете проект, кодите или наводите порядок в цифровой жизни, правильные инструменты решают многое. Сегодня выбор топовых приложений для продуктивности и разработки — часто бесплатных — лучше, чем когда-либо.</p><p><b>Microsoft Office</b> остаётся отраслевым стандартом для профессиональной продуктивности. Подписка Microsoft 365 открывает доступ к Word, Excel, PowerPoint, Outlook и включает 1 ТБ облачного хранилища.</p><p>Среди бесплатных альтернатив LibreOffice — мощный open-source комплект с сильным сообществом (хотя интерфейс некоторым кажется старомодным). Если нужна внешне более майкрософтовская альтернатива, попробуйте<b> FreeOffice </b>или <b>WPS Office Free</b> — у них хорошая совместимость.</p><p>На macOS <b>Pages</b>, <b>Numbers</b> и <b>Keynote</b> предустановлены и более чем достаточны для большинства задач, особенно если вы в экосистеме Apple.</p><h3>Знания и ведение заметок</h3><p><b>Notion</b> стал универсальной платформой организации: заметки, базы данных, to-do, управление проектами, создания совместных рабочих пространств. Если нужны более локальные заметки с синхронизацией между устройствами и поддержкой Markdown, <b>Obsidian</b> — любимец студентов и исследователей.</p><p>Для быстрых кроссплатформенных заметок <b>OneNote</b> — крепкий бесплатный вариант от Microsoft. В качестве альтернатив — <b>Simplenote</b> или open-source <b>Joplin</b>.</p><p>Если вы занимаетесь академической работой и научными статьями, <b>Zotero</b> — отличный open-source менеджер источников с интеграцией в браузер и совместными коллекциями. <b>Milanote</b> предлагает визуальный подход к заметкам и планированию — идеально для креативных пользователей.</p><h3>Работа с PDF</h3><p>Хотя Adobe Acrobat остаётся премиальным редактором PDF, бесплатные альтернативы вроде <b>PDFsam</b> позволяют без усилий объединять, разбивать, редактировать и поворачивать страницы.</p><h2>Инструменты для дизайна и создания контента</h2><p>Для дизайна два выделяющихся приложения хорошо дополняют набор продуктивности. <b>Figma Desktop</b> — совместная платформа интерфейс-дизайна, широко используемая UI/UX-дизайнерами и фронтенд-разработчиками. Десктоп-версия работает быстрее, чем браузер, и лучше интегрируется с ОС — это удобно для сложных дизайн-систем и коллаборации в реальном времени.</p><p><b>Canva</b> с интуитивным drag-and-drop превосходно чувствует себя и как десктоп-приложение. Отлично подходит для быстрых графических материалов для соцсетей, маркетинга, постеров и презентаций. Благодаря тысячам шаблонов и совместной работе это фаворит как у профи, так и у новичков.</p><h2>Почтовые клиенты</h2><p>Если вы предпочитаете отдельный почтовый клиент, у <b>eM Client</b> много функций, бесплатный — до двух аккаунтов. <b>Mozilla</b> <b>Thunderbird</b> — мощная open-source альтернатива с удобной настраиваемостью, а <b>Mailbird</b> — вариант с упором на продуктивность для тех, кого не пугает подписка.</p><h2>Инструменты разработчика</h2><ul><li><b>Редакторы кода и текста:</b> VS Code, Cursor, Sublime Text</li><li><b>Система контроля версий:</b> SourceTree, GitHub Desktop</li><li><b>Контейнеры: </b>Docker</li><li><b>Локальные LLM: </b>Ollama</li><li><b>SFTP, загрузка файлов:</b> WinSCP, Forklift</li></ul><p>Для разработчиков <b>Visual Studio Code</b> — безусловный вариант. Бесплатный, лёгкий, но мощный, кроссплатформенный — тысячи расширений покрывают практически любой язык, фреймворк или инструмент. Набирающая популярность альтернатива — <b>Cursor</b>, редактор на базе VS Code с усиленной AI-помощью. Он подходит для связки с LLM: даёт inline-подсказки, генерирует код, рефакторит и позволяет редактировать кодовую базу.</p><p>При этом<b> Sublime Text </b>остаётся для скорости и простоты, а <b>Notepad++</b> — отличный лёгкий редактор для быстрых правок в Windows.</p><p>Для Git графические клиенты <b>SourceTree</b> и <b>SmartGit</b> дают понятный интерфейс для управления репозиториями на GitHub, GitLab и не только. <b>GitHub Desktop</b> раньше был простоват и не слишком хорош, но сейчас существенно прибавил — всё ещё простой для работы, но в хорошем смысле.</p><p>Для локальных окружений, API-тестирования или терминального воркфлоу инструментов — пруд пруди. Например, <b>Docker Desktop</b> стал стандартом для тех, кто собирает и запускает контейнеризированные приложения на разных платформах. Он упрощает настройку окружений и держит систему чистой.</p><p><b>Ollama</b> позволяет запускать большие языковые модели (LLM) локально с минимальной настройкой. Поддерживает модели вроде LLaMA, Mistral и другие open-weight альтернативы GPT, так что можно работать с ИИ прямо на своём компьютере без отправки данных в облако.</p><p>Если вы работаете с облачными хранилищами или SFTP, WinSCP (Windows) и ForkLift (macOS) — отличные клиенты с двухпанельным управлением файлами, синхронизацией и автоматизацией. На Mac также популярны <b>Commander One</b> и <b>Transmit</b> — у них есть встроенные подключения к удалённым и облачным путям.</p><h3>Безопасность</h3><p>И Windows, и macOS сегодня предлагают более чем достойную встроенную защиту. С защитой в реальном времени, интеграцией с файерволом и биометрией вроде <b>Windows Hello</b> и <b>Touch ID</b>. Для обычных пользователей, которые соблюдают гигиену безопасности: не скачивают сомнительное ПО, используют менеджеры паролей и включают 2FA — встроенной защиты часто хватает.</p><p>Для продвинутых пользователей есть дополнительные варианты.</p><p>Отличное первое дополнение — <b>Malwarebytes</b>. Это давний фаворит в обнаружении и удалении malware, adware и руткитов; бесплатная версия по-прежнему хороша для ручных сканов. В платной — защита в реальном времени без ощутимой просадки производительности.</p><p>Если не хочется ставить традиционный антивирус, есть достойные альтернативы. <b>Emsisoft Emergency Kit</b> — мощный портативный сканер, который можно запускать с флешки: идеально для редких глубоких сканов или лечения заражённых систем без установки чего-либо. Просто подключаете, когда нужно.</p><p>Ещё один отличный инструмент — <b>VirusTotal</b>: бесплатный веб-сервис, который проверяет файлы и URL через десятки антивирусных движков. Прежде чем открывать подозрительную загрузку, можно залить файл на VirusTotal.com или использовать их расширение для браузера, чтобы проверять ссылки в реальном времени. Быстро, просто и удобно для осторожных пользователей.</p><p>Мы не поклонники установки антивирусов на каждый компьютер и не полностью в курсе, какие сейчас показывают лучшие результаты. Тем не менее, <b>AV-Tes</b>t давно и регулярно оценивает популярные решения, поэтому советуем смотреть их свежие отчёты. В текущем списке высокооценённых — <b>Avast, BitDefender, ESET </b>и другие; многие из них предлагают бесплатные версии для пробы.</p><h3>Удалённый доступ и вспомогательные утилиты</h3><p><b>RustDesk</b> стал современным, ориентированным на приватность аналогом <b>TeamViewer</b>. Он с открытым исходным кодом, быстрый и работает кроссплатформенно.</p><p>Тем, кому нужны более устоявшиеся коммерческие решения, подойдёт <b>AnyDesk</b>, который остаётся лёгким и надёжным вариантом для личного и командного использования.</p><p>Превращение смартфона в пульт дистанционного управления компьютером бывает невероятно удобно — будь то презентации, потоковое видео или просто навигация с дивана.</p><p><b>Remote Mouse</b> — простой и эффективный способ эмулировать мышь и клавиатуру с телефона. Для более продвинутых сценариев можно использовать приложения вроде <b>Unified Remote.</b></p><h2>Редактирование изображений и видео</h2><ul><li><b>Профессиональный видеомонтаж:</b> DaVinci Resolve</li><li><b>Простой видеомонтаж: </b>CapCut</li><li><b>Редакторы изображений:</b> GIMP, PhotoDemon, Pixelmator Pro</li><li><b>Бесплатное улучшение изображений:</b> Upscayl</li><li><b>RAW-редактирование:</b> RawTherapee</li><li><b>Видеоконвертация:</b> HandBrake</li></ul><p>Если вам нужен бесплатный инструмент для редактирования изображений, <b>GIMP</b> — один из самых мощных вариантов. Он предоставляет профессиональные возможности, такие как слои, маски и настраиваемые плагины, что делает его идеальным для продвинутых пользователей. Если вы ищете более лёгкий редактор с чистым интерфейсом, стоит обратить внимание на <b>PhotoDemon</b>. Он работает как портативное приложение на Windows, поддерживает слои и редактирование — отличный выбор для быстрых правок или ретуши.</p><p>Если вы хотите увеличивать разрешение изображений без потери качества, <b>Upscayl</b> — мощный и бесплатный инструмент для апскейла. Он кроссплатформенный, и по нашим тестам показывает результаты на уровне платных решений вроде Topaz.</p><p>Для векторной графики — логотипы, иллюстрации — <b>Inkscape</b> является достойным open-source вариантом с полной поддержкой редактирования SVG. <b>Krita</b> — ещё один отличный бесплатный инструмент, особенно подходящий для цифровой живописи и художественного творчества.</p><p>Для редактирования RAW-фотографий, <b>Darktable</b> и <b>RawTherapee</b> — два высококлассных open-source аналога Adobe Lightroom. Их широко используют фотографы, которым нужна работа с изображениями без подписки.</p><p>Для простых GIF-анимаций <b>ScreenToGif</b> — удобная утилита, мгновенно записывающая область экрана и экспортирующая в GIF или другие форматы с оверлеями.</p><p>Среди платных фоторедакторов <b>Adobe Photoshop</b> остаётся лидером, но для macOS есть <b>Pixelmator Pro</b> — мощное приложение с разовой оплатой, а <b>Affinity Photo</b> предлагает профессиональные возможности по более доступной цене.</p><h3>Видеомонтаж и конвертация</h3><p><b>DaVinci Resolve</b> считается лучшим бесплатным профессиональным ПО. Его используют и энтузиасты, и профессионалы — от простого тримминга до цветокоррекции и сложного постпродакшена.</p><p><b>Shotcut</b> и <b>Kdenlive</b> — тоже сильные бесплатные варианты, предлагают более простой фукнционал с хорошим набором функций для новичков и продвинутых пользователей. <b>CapCut</b>, изначально мобильное приложение, теперь доступен на десктопе — идеально подходит для быстрых монтажей и роликов для соцсетей.</p><p>Для пользователей macOS <b>iMovie </b>предустановлен и остаётся надёжным вариантом для базовых видео. Если вам нужно просто конвертировать или сжимать видео в современные форматы, <b>HandBrake</b> — проверенное бесплатное решение с поддержкой и вариацией входных и выходных форматов.</p><p>Тем, кто ищет топовый профессиональный монтаж, подойдут <b>Adobe Premiere Pro</b> и<b> Final Cut Pro</b>, но там есть дорогая подписка и более высокий порог входа.</p><h2>Коммуникации и совместная работа</h2><ul><li><b>Для повседневной связи: </b>WhatsApp, Messenger и Zoom, если у вас нет FaceTime</li><li><b>Для приватности: </b>Signal</li><li><b>Для работы:</b> Slack, Teams</li><li><b>Для игр и общения: </b>Discord</li></ul><p>Выбор коммуникационных и мессенджерных приложений в первую очередь зависит от того, с кем вы общаетесь — с семьёй, друзьями, коллегами или игровым сообществом. Вот актуальная картина:</p><p>Для личной переписки <b>WhatsApp</b> и <b>Facebook Messenger</b> остаются самыми массовыми платформами по всему миру. У них есть десктопные клиенты и встроенное сквозное шифрование по умолчанию. <b>Telegram</b> также крайне популярен благодаря синхронизации между устройствами и поддержке крупных чатов. Пользователи Apple продолжают активно использовать <b>iMessage</b> для приватного, шифрованного общения в экосистеме Apple.</p><p>Из видеоконференций <b>Zoom</b> остаётся одним из лидеров для групповых звонков и онлайн-ивентов, предлагая локальные записи, демонстрацию экрана и комнаты (breakout rooms). Однако бесплатный тариф ограничивает 1:1 звонки 40 минутами, если не перейти на платный план. Zoom поддерживает сквозное шифрование, но при включении E2EE отключаются некоторые функции вроде облачной записи и комнат.</p><p><b>Google Meet</b> — отличный браузерный аналог без необходимости установки, который заметно улучшился по качеству и удобству использования. Многие компании применяют Meet в ежедневной работе и гибридных форматах. Если ваша организация использует Microsoft 365, скорее всего, вы работаете в <b>Microsoft Teams</b>, который уже заменил Skype на корпоративном уровне. Teams поддерживает большие созвоны, обмен файлами и глубоко интегрирован с Office. Сквозное шифрование доступно, но только для 1:1 звонков.</p><p><b>FaceTime</b> по-прежнему отличный для пользователей Apple, и благодаря новым обновлениям к звонку теперь могут присоединяться и пользователи Android/Windows по ссылке через браузер.</p><p>Когда приватность критична, <b>Signal</b> — один из лучших вариантов. Разработан некоммерческой организацией, бесплатен, open-source, без рекламы, использует надёжное сквозное шифрование для сообщений и звонков.</p><p>Для рабочих коммуникаций<b> Slack</b> и <b>Teams</b> продолжают использоваться в бизнес-среде. Бесплатный тариф Slack ограничивает историю 90 днями и звонки, но остаётся любимцем стартапов и малых команд благодаря интеграциям и ботам. <b>Cisco Webex</b> — также крепкий вариант, особенно популярен в корпоративной среде.</p><p>Если вы работаете с креативными командами, сообществами или геймерами, <b>Discord</b> стал явным лидером. Изначально созданный для игр, он превратился в полноценную коллаборативную платформу с текстом, голосом и видео, стримингом экрана и ботами для автоматизации. Многие комьюнити — и даже IT-компании — используют Discord как основной рабочий инструмент.</p><p>Для внутриигрового голосового чата <b>TeamSpeak </b>остаётся олдскульным достойным вариантом: можно использовать анонимно и получать полный контроль над сервером. Встроенный чат Steam лучше, чем раньше, и помогает в игровой координации, но большинство всё же выбирает Discord.</p><h2>Гейминг, моддинг и стриминг</h2><ul><li><b>Игровые платформы: </b>Steam, Epic Games, EA App, Ubisoft, GOG</li><li><b>Последние драйверы для GPU:</b> Nvidia GeForce, AMD Radeon, Intel Arc</li><li><b>Стриминг:</b> OBS Studio</li></ul><p><b>Steam</b> остаётся центром PC-игр. Это не только магазин, но и социальная платформа, лаунчер и площадка с модами, облачными сохранениями и встроенным стримингом. Регулярные распродажи, поддержка контроллеров и сообщества делают его обязательным для любого PC-геймера.</p><p>Не менее важно установить Epic <b>Games Store</b>. Хотя библиотека меньше, он регулярно раздаёт бесплатные игры, доступные любому с аккаунтом Epic. Это также must-have, если вы играете в Fortnite.</p><p>Помните: не все издатели размещают игры на Steam или Epic. Для тайтлов EA понадобится <b>EA App (ранее Origin)</b>, для Ubisoft — <b>Ubisoft Connect</b>, для Blizzard/Activision — <b>Battle.net</b>, а GOG Galaxy не только предлагает DRM-free классику, но и может агрегировать игры из других лаунчеров.</p><p>Некоторые сверхпопулярные игры распространяются отдельно: Minecraft (через Minecraft.net или Microsoft Store), Roblox, League of Legends и Valorant (через лаунчер Riot Games). Если вы новичок и ищете что-то лёгкое, можно начать с free-to-play тайтлов или классики вроде <b>Brutal Chess</b> или <b>GZDoom</b>.</p><p>Если вы играете с геймпадом, Windows поддерживает Xbox-контроллеры из коробки. PlayStation-контроллеры теперь тоже отлично работают: Steam через <b>Steam Input </b>поддерживает DualShock 4 и DualSense практически во всех играх. При необходимости глубокой кастомизации можно использовать DS4Windows, но большинству хватает возможностей Steam.</p><p>Если вас интересует моддинг, хороший менеджер модов время в этой жизни:</p><ul><li><b>Mod Organizer 2</b> — лучший для RPG Bethesda (Skyrim, Fallout).</li><li><b>Vortex (от Nexus Mods)</b> — дружелюбный к новичкам и поддерживает широкий перечень игр.</li></ul><p>Для записи геймплея или стриминга <b>Nvidia ShadowPlay</b> и <b>AMD Radeon ReLive</b> подходят для простых задач. Но для стриминга с вебкой, сценами, оверлеями или многосценовым продакшеном <b>OBS Studio</b> — безальтернативный лидер. Он бесплатный, open-source и подходит как новичкам, так и про-стримерам (Twitch, YouTube, Kick и т.д.). <b>SignalRGB</b> помогает синхронизировать весь RGB-зоопарк и задавать динамические эффекты.</p><h2>Мониторинг железа и разгон</h2><ul><li><b>Мониторинг: </b>CPU-Z, HWMonitor, HWiNFO64</li><li><b>Настройка и разгон:</b> Afterburner, FanControl, ThrottleStop, SignalRGB</li></ul><p>Одно из первых дел, которое стоит сделать после сборки ПК — убедиться, что компоненты соответствуют ожиданиям и работают корректно. К счастью, существует много инструментов, позволяющих мониторить, тестировать и настраивать железо.</p><p>Начать стоит с <b>CPU-Z</b> — классического бесплатного инструмента, показывающего информацию о CPU, материнской плате, оперативной памяти и других компонентах. Он также умеет запускать простой стресс-тест и бенчмарк для проверки стабильности.</p><p>Для более широкого мониторинга <b>HWMonitor</b> показывает температуры, напряжения и скорости вентиляторов в реальном времени. Если нужно ещё глубже и с более гибким интерфейсом — <b>HWiNFO64</b> считается одним из лучших: поддерживает логирование датчиков и интеграцию с оверлеями (например, RTSS или Rainmeter).</p><p>Чтобы проверить хранилище, <b>CrystalDiskMark</b> измеряет скорость чтения/записи SSD и HDD — это помогает понять, соответствует ли диск заявленным характеристикам. Глубже оценить здоровье накопителя можно в <b>Hard Disk Sentinel</b>, который анализирует SMART-данные, оценивает срок службы и предлагает ограниченный ремонт.</p><p>С точки зрения охлаждения, всё больше геймеров используют утилиты для настройки вентиляторов. <b>FanControl</b> — актуальный бесплатный фаворит: поддерживает сложные кривые оборотов, привязку к датчикам, и совместим с большинством современных материнских плат. На Mac одной из лучших утилит остаётся<b> Macs Fan Control.</b></p><p>Для настройки видеокарт долгое время стандартом был <b>MSI Afterburner</b> — для разгона, настройки вентиляторов и мониторинга с RTSS-оверлеем. Однако из-за замедления обновлений многие сегодня используют встроенные утилиты от <b>Nvidia (GeForce Experience/Control Panel)</b> и <b>AMD (Adrenalin Software)</b>.</p><p>Если вы меняете видеокарту или подозреваете проблемы с драйверами, обязательно используйте <b>Display Driver Uninstaller</b> (DDU) — он полностью очищает систему от старых драйверов перед переустановкой.</p><p>Если вы играете на ноутбуке или хотите снизить нагрев и повысить автономность, <b>ThrottleStop</b> остаётся одним из лучших инструментов для андервольта CPU и настройки энергопрофилей.</p><p>Тем, кто серьёзно подошёл к разгону CPU и GPU, пригодятся фирменные инструменты вроде <b>Intel XTU (для Intel) и AMD Ryzen Master</b> — они дают контроль над частотами, напряжениями и лимитами мощности.</p><h2>Управление файлами</h2><ul><li><b>Поиск больших файлов:</b> SpaceSniffer, WizTree, Disk Drill (macOS)</li><li><b>Поиск дубликатов: </b>dupeGuru</li><li><b>Архивы и ZIP: </b>PeaZip, The Unarchiver</li><li><b>Очистка: </b>BCUninstaller, CCleaner Portable, AppCleaner (macOS)</li></ul><p>Чтобы грамотно управлять файлами и освобождать место, нужно понимать, что именно занимает пространство. На Windows популярны <b>WinDirStat и WizTree </b>— быстрые бесплатные инструменты для визуализации диска. <b>SpaceSniffer</b> предоставляет динамическую схему.</p><p>На macOS — <b>GrandPerspective и Disk Drill </b>предлагают аналогичный функционал, а <b>DaisyDisk</b> — один из самых красивых платных вариантов с молниеносным сканированием.</p><p>Если дубликаты засоряют диск, <b>dupeGuru</b> (open-source) отлично справляется с поиском повторяющихся изображений и музыки, даже слегка изменённых.</p><p>Для пакетного переименования файлов (например, фоточек с камеры) существует гибкий <b>Bulk Rename Utility</b>. Если нужно что-то попроще: <b>PowerRename</b> из PowerToys (Windows) или встроенный инструмент в <b>Finder</b> (macOS) подходят большинству.</p><p>Встроенный <b>File Explorer</b> в Windows недавно получил вкладки и стал удобнее, но <b>Files</b> (open-source) — современная альтернатива с улучшенным UX. Кто-то ещё пользуется <b>Total Commander</b> или <b>Directory Opus</b>, благодаря расширяемости и скриптам, хотя новичкам они кажутся устаревшими. Для просмотра изображений по-прежнему незаменим <b>IrfanView</b>.</p><p>Для работы с архивами, если не устраивает встроенный ZIP-менеджер Windows, скачайте <b>7-Zip</b> или <b>PeaZip</b>. На Mac лучшим бесплатным инструментом остаётся <b>The Unarchiver</b>.</p><p>Для очистки системы важно выбирать надёжные утилиты. На Windows, <b>BCUninstaller (Bulk Crap Uninstaller)</b> — один из самых проверенных для удаления программ и их хвостов. <b>BleachBit</b> и <b>Wise Disk Cleaner</b> — безопасные альтернативы <b>CCleaner</b> (лучше использовать Portable-версию, так как стационарная испортила репутацию). На Mac <b>AppCleaner</b> всё ещё любим за полное удаление приложений без мусора.</p><p>Если вы организуете большую библиотеку медиа, стоит взглянуть на open-source <b>TagSpaces</b>, позволяющий тегировать файлы локально, без облака.</p><h2>Облачное хранилище и резервное копирование</h2><ul><li><b>Простая синхронизация: </b>Dropbox, Google Drive</li><li><b>Фото между устройствами:</b> Apple iCloud, Google Photos</li><li><b>Приватность: </b>pCloud, Proton Drive, Internxt</li><li><b>Полные бэкапы:</b> Backblaze, IDrive</li></ul><h3>Базовое облачное хранилище</h3><p><b>Dropbox</b> — один из самых простых в использовании, хотя бесплатных 2 ГБ мало.</p><p><b>
Google Drive</b> — 15 ГБ бесплатно, используется Gmail, Docs и Photos. Идеален для Android.</p><p><b>
OneDrive</b> — идёт в комплекте с Windows и Microsoft 365. 1 ТБ включён в большинство Office-планов. Хотя по скорости и интерфейсу уступает Dropbox/Google.</p><p><b>
iCloud Drive</b> — лучший выбор для пользователей Apple, глубокая интеграция с macOS/iOS. Бесплатно 5 ГБ, далее по планам до 2 ТБ.</p><p><b>
Proton Drive</b> — шифрованная альтернатива от создателей ProtonMail.</p><h3>Фото и видео</h3><p>На macOS приложение <b>Photos</b> автоматически создаёт альбомы по людям и локациям, синхронизирует всё через iCloud.</p><p>На Windows мы часто рекомендуем <b>Google Photos</b>, который предлагает аналогичный набор функций и автоматизацию. Для пользователей Android — это стандарт по умолчанию. Да, раньше было безлимитно, теперь фото занимают общее место Google Drive (15 ГБ), которое быстро заканчивается.</p><h3>Полные бэкапы</h3><p>Если требуется сохранять всю систему, терабайты медиа, состояние дисков используйте отдельные сервисы резервного копирования.</p><p><b>Backblaze</b> — топ в этой категории: фиксированная цена (~$8/месяц за устройство), безлимитное хранилище, минимум настроек: установил и забыл.</p><p><b>IDrive</b> — более контролируемый вариант, поддерживает несколько устройств, внешние диски и версионность файлов.</p><p>Простой для не-технарей — <b>Carbonite</b>, с возможностью быстрого восстановления и круглосуточной поддержкой.</p><p>Профессионалам — <b>Acronis Cyber Protect</b>: клон дисков, анти-вымогатель, гибридное облако.</p><h3>Для особо чувствительных данных</h3><p>Если вы храните личные финансовые документы или медицинские сведения, стоит выбрать end-to-end решений.</p><p><b>pCloud</b> предлагает клиентское шифрование (через платный «Crypto»). Даже при взломе аккаунта файлы не расшифруются без ключа.</p><p><b>Proton Drive </b>— аналогичный подход, с прозрачностью open-source.</p><h2>Прочие полезные инструменты, не вошедшие в другие разделы</h2><p><b>Google Earth</b> — для любителей карт и планировки.</p><p><b>qBittorrent</b> — лучший torrent-клиент: чистый, без рекламы, с поиском. Альтернатива — легковесный Transmission или кастомизируемый Deluge.</p><p><b> iMazing</b> — must-have для владельцев iPhone: резервные копии, экспорт медиа, проверка батареи, конвертация HEIC.</p><p><b>AirDroid</b> — аналог для Android: управление файлам, уведомления, SMS с ПК.</p><p><b>Rufus</b> — лидер по созданию загрузочных USB-дисков для Windows/Linux.</p><p><b>Open Shell </b>— возвращает классическое меню «Пуск» в стиле Windows 7.</p><p><b>Stretchly</b> — напоминает делать перерывы — полезно удалёнщикам и фрилансерам.</p><p><b>AutoHotkey</b> — скриптовый движок для Windows: переназначение клавиш, макросы, автоматизация.</p><p><b>VPN: </b>бесплатные — ProtonVPN, Windscribe, TunnelBear (с лимитом). Платные — ProtonVPN, NordVPN.</p><p><b>Calibre</b> — лучшее бесплатное решение для чтения, организации и конвертации e-book (EPUB, MOBI, PDF и др.).</p><h2>Заключение</h2><p>Итак, мы прошлись по основным категориям приложений, которые стоит установить на новый компьютер. Конечно, этот список не исчерпывающий — у каждого свои задачи и предпочтения. Но если вы установите хотя бы половину из перечисленного, ваш компьютер станет гораздо удобнее и функциональнее.</p><p>Несколько советов напоследок:</p><ol><li><b>Не захламляйте систему.</b> Устанавливайте только то, что действительно используете. Чем меньше фоновых процессов — тем быстрее работает компьютер.</li><li><b>Следите за обновлениями.</b> Большинство программ обновляются автоматически, но некоторые требуют ручного апдейта. Свежие версии — это не только новые функции, но и закрытые уязвимости.</li><li><b>Делайте резервные копии.</b> Никакие утилиты не спасут от отказа жёсткого диска. Регулярный бэкап на внешний носитель или в облако — обязательная практика.</li><li><b>Экспериментируйте. </b>Попробуйте несколько браузеров, редакторов, плееров. То, что подходит большинству, может не подойти именно вам.</li><li><b>Читайте отзывы.</b> Перед установкой незнакомого приложения загляните на форумы или Reddit. Сообщество быстро выявляет проблемы и подводные камни.</li></ol><p>Теперь ваш компьютер готов к работе, учёбе, развлечениям — и чему угодно ещё. Главное — не забывайте, что инструменты важны, но ещё важнее то, как вы их используете. Удачи!</p>]]></content:encoded>
    </item>
    <item>
      <title>Код власти: как партнерство NVIDIA и OpenAI создаёт новую мировую иерархию</title>
      <link>https://tproger.ru/articles/kod-vlasti--kak-partnerstvo-nvidia-i-openai-sozdayot-novuyu-mirovuyu-ierarhiyu</link>
      <comments>https://tproger.ru/articles/kod-vlasti--kak-partnerstvo-nvidia-i-openai-sozdayot-novuyu-mirovuyu-ierarhiyu?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Денис Кудерин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kod-vlasti--kak-partnerstvo-nvidia-i-openai-sozdayot-novuyu-mirovuyu-ierarhiyu</guid>
      <description><![CDATA[<p>Анализ сделки на 100 млрд долларов и ее последствий. Как контроль над вычислениями определяет будущее сверхинтеллекта и почему регуляторы бездействуют. Прогнозы для IT-индустрии.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kod-vlasti--kak-partnerstvo-nvidia-i-openai-sozdayot-novuyu-mirovuyu-ierarhiyu">Код власти: как партнерство NVIDIA и OpenAI создаёт новую мировую иерархию</a>»</p>]]></description>
      <category><![CDATA[Интернет]]></category>
      <category><![CDATA[Опрос]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Работа]]></category>
      <category><![CDATA[Oracle]]></category>
      <category><![CDATA[Intel]]></category>
      <category><![CDATA[OpenAI]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[Инновации]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Инфраструктура]]></category>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 03 Oct 2025 14:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Историю пишут победители, а будущим управляют те, кто контролирует критическую инфраструктуру. Партнёрство NVIDIA и OpenAI на 100 миллиардов долларов может стать основой для новой технологической цивилизации. Это долгосрочный проект, который в ближайшем будущем неизбежно повлияет на экономику, политику и общество.</p><p>Цифра в 100 миллиардов долларов вызывает когнитивный диссонанс. Это больше ВВП таких стран, как Хорватия, Беларусь или Уругвай. Сумма, которую человечество тратит на космические программы за десятилетия. Но здесь речь о частной сделке между двумя компаниями. Когда деньги достигают такого масштаба, они перестают быть просто деньгами, а становятся инструментом перераспределения глобальной власти.</p><h2>Эпохальная сделка: за рамками пресс-релиза</h2><p><a href="https://openai.com/index/openai-nvidia-systems-partnership/">Новость</a> от 22 сентября 2025 года выглядела стандартным корпоративным анонсом, хотя и разлетелась по всем мировым СМИ и tech-изданиям. NVIDIA и OpenAI объявили о стратегическом партнерстве с развёртыванием 10 гигаватт вычислительных систем. Цифры впечатляют, но вся суть кроется в деталях.</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-10-03/bddf5f12-6ae7-45a7-9b8f-f8dc3b786ae4.png" alt="" /></figure><p><a href="https://openai.com/index/openai-nvidia-systems-partnership/">По словам</a> Дженсена Хуанга, гендира NVIDIA, 10 гигаватт — это 4-5 миллионов графических процессоров. Столько же NVIDIA произведёт за весь 2025 год. Фактически, OpenAI получает доступ к годовому объёму производства ключевого ресурса для ИИ.</p><p>Инвестиция в $100 млрд структурирована прогрессивно — по мере развёртывания каждого гигаватта мощностей. Первый транш в $10 млрд поступит после запуска первого гигаватта во второй половине 2026 года.</p><p>Управляющий партнёр Requisite Capital Management Брин Токингтон <a href="https://habr.com/ru/news/949648/">заявил</a>: «NVIDIA инвестирует $100 млрд в OpenAI, которые OpenAI затем вернёт обратно». Он отметил, что этот проект будет полезен для NVIDIA.</p><p>Эксперты отмечают стратегическую глубину сделки. Как <a href="https://www.cnbc.com/video/2025/09/22/nvidia-openai-partnership-theme-seems-to-be-a-shortage-of-compute-says-bernsteins-stacy-rasgon.html">пишет сайт CNBC</a>, партнёрство «подчеркивает тесную связь между OpenAI и NVIDIA, двумя главными драйверами последнего бума в области ИИ». Фактически, это создает интегрированную экосистему, где успех одного напрямую подпитывает рост другого.</p><h2>Вычислительная гонка вооружений: как мощность стала новой нефтью</h2><p>OpenAI оказалась в парадоксальной ситуации. 700 млн еженедельных пользователей — это не только успех, но и колоссальная нагрузка. Каждый запрос к ChatGPT требует вычислений. Каждое улучшение модели — тысяч GPU.</p><p>Сэм Альтман предельно <a href="https://nvidianews.nvidia.com/news/openai-and-nvidia-announce-strategic-partnership-to-deploy-10gw-of-nvidia-systems">откровенен</a>: «Все начинается с вычислительных мощностей». В интервью CNBC он объясняет — без достаточных ресурсов нам придётся выбирать между исследованиями рака и бесплатным образованием. Никто не хочет такого выбора.</p><p>Но за этим кроется плачевная реальность. Современные большие языковые модели достигли такой точки роста, когда простое масштабирование требует экспоненциального роста вычислений. Обучение GPT-4 оценивали в $100 млн только на электричество. Следующие поколения будут дороже на порядки.</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-10-03/8ea1bb9d-59bd-48fa-8a5a-6e13129beaf5.jpg" alt="" /><figcaption>Президент OpenAI Грег Брокман, основатель и генеральный директор NVIDIA Дженсен Хуанг и генеральный директор OpenAI Сэм Альтман</figcaption></figure><p>Грег Брокман <a href="https://blogs.nvidia.com/blog/openai-nvidia/">сравнивает</a> текущую ситуацию с первым сервером DGX, который Хуанг лично доставил в офис OpenAI в 2016 году. «Теперь нам нужно в миллиард раз больше вычислительной мощности», — говорит он. Масштаб ошеломляет.</p><p>Мы наблюдаем фундаментальный сдвиг. Если раньше алгоритмы были ключевым ограничивающим фактором, теперь это исключительно вычислительные ресурсы. Тот, кто контролирует гигаватты, будет контролировать интеллект следующего поколения.</p><h2>Монополия на разум: стратегия NVIDIA</h2><p>NVIDIA — уже не только производитель чипов: компания строит экосистему, в которой её собственные технологии становится стандартом де-факто. Партнёрство с OpenAI — краеугольный камень этой стратегии.</p><p>Дженсен Хуанг скромно <a href="https://nvidianews.nvidia.com/news/openai-and-nvidia-announce-strategic-partnership-to-deploy-10gw-of-nvidia-systems">называет</a> это «началом». «Мы буквально подключим интеллект к каждому приложению, к каждому случаю использования, к каждому устройству», — говорит он. За этими словами — видение мира, где NVIDIA станет такой же необходимостью, как электричество.</p><p>Антимонопольные юристы уже <a href="https://www.reuters.com/business/nvidia-invest-100-billion-openai-2025-09-22/">выражают</a> обеспокоенность. Андре Барлоу, специалист по конкурентному праву, отмечает: «Сделка может изменить экономические стимулы NVIDIA и OpenAI и создать замкнутую систему, где доминирование на железо подкрепляет лидерство в программном обеспечении».</p><p>Особенно тревожным эксперты считают момент заключения сделки. Всего за неделю до объявления с OpenAI NVIDIA:</p><ul><li>приобрела долю в Intel за $5 млрд;</li><li>инвестировала $700 млн в дата-центровый британский стартап Nscale;</li><li>потратила $900 млн на поглощение разработчика ПО для ИИ-кластеров Enfabrica.</li></ul><p>Сейчас компания захватывает все уровни инфраструктуры. Аналитики Bloomberg <a href="https://www.bloomberg.com/opinion/articles/2025-09-26/nvidia-and-openai-s-100-billion-virtuous-circle-has-an-ugly-side">характеризуют</a> сделку как намеренное создание «порочного круга» на $100 млрд. Они указывают, что реальный риск для индустрии заключается не в лопнувшем пузыре, а в консолидации рынка, которая вытесняет конкурентов. NVIDIA создаёт то, что можно назвать «вычислительным картелем». Партнёрство с OpenAI — это сигнал рынку: альтернативы нашим чипам для серьезных AI-проектов просто нет.</p><h2>Тихая война сверхинтеллекта: глобальный контекст</h2><p>Партнёрство NVIDIA и OpenAI происходит на фоне глобальной гонки за сверхинтеллектом. Игроки понимают — кто первый создаст AGI*, получит беспрецедентное преимущество.</p><p>*AGI, искусственный общий интеллект — на текущий момент гипотетическая форма ИИ с самосознанием и способностями решать сложные интеллектуальные задачи лучше человека.</p><p>В июне 2025 года Марк Цукерберг объявил о реорганизации AI-подразделения Meta* с фокусом на сверхинтеллект. Александр Ванг, бывший CEO Scale AI, возглавил новое подразделение Meta* Superintelligence Labs.</p><p>*запрещена в РФ</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-10-03/fd0f16a4-fd8d-4a4c-ac4c-8f2b86ee2183.png" alt="" /><figcaption>Сооснователь OpenAI Илья Суцкевер, архитектор ChatGPT</figcaption></figure><p>Илья Суцкевер, сооснователь OpenAI, ушел из компании, чтобы создать Safe Superintelligence Inc. (SSI). Его организация сфокусирована исключительно на безопасности сверхинтеллекта — это явный признак того, что эксперты не считают создание AGI сугубо теоретическим вопросом.</p><p><a href="https://situational-awareness.ai/">Работы Леопольда Ашенбреннера,</a> бывшего исследователя OpenAI, обсуждаются в военно-политических кругах Вашингтона. Его эссе содержит прямой призыв обеспечить тотальное доминирование США в гонке ИИ. Технологии становятся вопросом национальной безопасности.</p><p>Китайские компании типа Baidu и Alibaba активно работают над собственными большими моделями, но сталкиваются с ограничениями доступа к передовым чипам — США сознательно создают искусственный барьер.</p><p>Аналитики <a href="https://www.firstonline.info/ru/%D0%98%D1%81%D0%BA%D1%83%D1%81%D1%81%D1%82%D0%B2%D0%B5%D0%BD%D0%BD%D1%8B%D0%B9-%D0%B8%D0%BD%D1%82%D0%B5%D0%BB%D0%BB%D0%B5%D0%BA%D1%82%3A-%D0%BA%D1%80%D1%83%D0%BF%D0%BD%D1%8B%D0%B5-%D0%B8%D0%BD%D0%B2%D0%B5%D1%81%D1%82%D0%B8%D1%86%D0%B8%D0%B8-Nvidia-%D0%B2-OpenAI-%D1%83%D0%B3%D0%BB%D1%83%D0%B1%D0%BB%D1%8F%D1%8E%D1%82-%D1%81%D0%B2%D1%8F%D0%B7%D0%B8-%D0%BC%D0%B5%D0%B6%D0%B4%D1%83-%D0%B3%D0%B8%D0%B3%D0%B0%D0%BD%D1%82%D0%B0%D0%BC%D0%B8--%D1%80%D1%8B%D0%BD%D0%BE%D0%BA-%D0%BE%D1%81%D1%82%D0%B0%D0%B5%D1%82%D1%81%D1%8F-%D0%BE%D0%BF%D1%82%D0%B8%D0%BC%D0%B8%D1%81%D1%82%D0%B8%D1%87%D0%BD%D1%8B%D0%BC./">отмечают</a>, что сделка между NVIDIA и OpenAI укрепляет связи в рамках целой сети партнёрств между технологическими гигантами, включая Microsoft, Oracle и SoftBank. Этот формирующийся «блок сотрудничества» оценивается в триллионы долларов, а его интересы, как отмечается в одном из обзоров, «очень сходятся» на фоне поддержки политики администрации США. Таким образом, сделка выходит за рамки корпоративной и приобретает черты национальной технологической стратегии.</p><h2>Регуляторный парадокс: почему молчат антимонопольные службы</h2><p>Тревожный аспект сделки — отсутствие серьёзного регуляторного сопротивления. Сравнение с другими громкими случаями показательно:</p><ul><li><a href="https://news.xbox.com/en-us/2023/10/13/xbox-activision-blizzard/">Сделка</a> Microsoft и Activision Blizzard годами изучалась регуляторами по всему миру. Споры велись о том, будут ли игры вроде Call of Duty эксклюзивными для Xbox. Речь шла о доступе к развлечениям.</li><li>Apple бесконечно судится с регуляторами ЕС из-за комиссий в App Store и предустановке сторонних магазинов. Битва идёт за проценты с продаж цифровых товаров.</li></ul><p>Но когда речь заходит о контроле над технологией, которая может переопределить будущее человечества, регуляторы молчат — антимонопольные службы США занимают мягкую позицию по этому вопросу.</p><p>Создаётся впечатление, что регуляторы понимают технологии прошлого, но не успевают за скоростью развития ИИ. Они видят угрозу в монополии на поиск в сети или социальные сети, но не осознают, что монополия на сверхинтеллект — это качественно другой уровень угрозы.</p><p>Европейский союз пытается догнать уходящий поезд. <a href="https://artificialintelligenceact.eu/">AI Act</a> вступил в силу в 2025 году, но фокусируется в основном на прозрачности и этике, а не на концентрации вычислительной мощи. Регуляторы борются с симптомами, а не с причиной.</p><h2>Будущее индустрии: новые правила игры</h2><p>Для разработчиков и IT-индустрии партнёрство создаёт новую реальность с чёткими последствиями. Доступ к вычислительным ресурсам становится ключевым конкурентным преимуществом. Стартапам будет сложно конкурировать с гигантами, обладающими гигаваттами мощности. Инновации могут сместиться от небольших лабораторий к корпорациям.</p><p>Централизация AI-мощностей ограничивает разнообразие подходов. Как отмечает Суцкевер, безопасность ИИ требует фундаментальных исследований, а не только масштабирования существующих моделей.</p><p>Мы наблюдаем рождение новой олигополии — рынка технологий без конкуренции. Если в интернете доминировали платформы, в мобильной эре — Apple и Google, то в эру ИИ власть будет у тех, кто контролирует модели и вычисления для их обучения. Остальные станут просто поставщиками данных.</p><p>В своей книге <a href="https://www.litres.ru/book/chris-dixon/chitay-pishi-upravlyay-blokcheyn-kak-novaya-era-interneta-71203627/">«Читай, пиши, управляй»</a> технологический евангелист и венчурный инвестор Крис Диксон напрямую связывает развитие ИИ с тенденцией к консолидации рынка. «Быстрое развитие искусственного интеллекта, вероятно, тоже ускорит тренд на консолидацию крупных технологических компаний. ИИ имеет огромный потенциал, но изначально благоприятствует щедро капитализированным компаниям с огромными массивами данных»</p><h2>Альтернативные пути: есть ли жизнь после NVIDIA</h2><p>Не все эксперты считают ситуацию безнадежной. Появляются признаки сопротивления доминированию NVIDIA:</p><ul><li>Google продолжает развивать собственные TPU и инвестирует в кремниевые инновации;</li><li>Amazon через AWS продвигает собственные чипы Inferentia и Trainium;</li><li>Microsoft работает над проектом Athena.</li></ul><p>Но разрыв огромен. Хуанг в августе 2025 года говорил инвесторам, что строительство одного гигаватта дата-центров стоит $50-60 млрд, из которых $35 млрд — оборудование NVIDIA. Конкуренты не могут просто купить рынок. Китай развивает национальные проекты в обход санкций, но пока выступает в роли догоняющего.</p><p>Наиболее перспективным направлением считаются фундаментальные исследования  новых архитектурах вычислений. Квантовые компьютеры, нейроморфные чипы, оптические вычисления — всё это может изменить правила игры.</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-10-03/edd7ef30-6bff-47d7-8674-21540270df97.jpg" alt="" /><figcaption>Первый нейроморфный чип</figcaption></figure><p>Тенденция к специализации аппаратного обеспечения для ИИ — новая реальность рынка. Анализ актуальных решений NVIDIA показывает, что компания давно отошла от универсальных архитектур и развивает целое семейство специализированных GPU, каждое из которых оптимизировано под конкретный тип задач:</p><ul><li>Для инференса (процесса применения уже обученной модели ИИ) и визуализации созданы ускорители NVIDIA L40, которые сочетают высокую производительность в AI с передовыми возможностями для графики.</li><li>Для масштабного инференса в дата-центрах предназначен низкопрофильный и энергоэффективный NVIDIA L4.</li><li>Для рабочих станций создана видеокарта NVIDIA RTX 6000 Ada Generation, архитектура которой обеспечивает почти двукратный прирост производительности в AI-задачах по сравнению с предшественниками.</li></ul><p>Тренд на специализацию открывает возможности для новых игроков. Они могут сфокусироваться на разработке узкоспециализированных решений, не пытаясь сразу конкурировать с гигантами и создавать универсальные GPU для обучения огромных моделей.</p><h2>Геополитический контекст: перерисовка карты влияния</h2><p>Сделка NVIDIA и OpenAI выходит далеко за рамки бизнеса. Технологическое лидерство всё больше определяет геополитическое влияние. Администрация президента Трампа рассматривает ИИ как область стратегического преимущества США.</p><p>Европейский союз пытается найти баланс между регулированием и инновациями, но не имеет собственных технологических наработок в этой сфере. Страны глобального Юга рискуют остаться потребителями технологии, которую не создают.</p><p>Бывший советник по национальной безопасности США Генри Киссинджер в своей последней <a href="https://wciom.ru/book-article/iskusstvennyi-razum-i-novaja-ehra-chelovechestva">книге</a> предупреждал: «ИИ станет новым ядерным оружием — тем, кто первым достигнет сверхинтеллекта, достанется возможность диктовать правила остальному миру».</p><p>Официальные военные доктрины ведущих стран уже давно сравнивают киберпространство с театром военных действий. Концентрация ресурсов для создания сверхинтеллекта в рамках частного партнерства стоимостью в сотни миллиардов долларов вызывает опасения у <a href="https://www.ox.ac.uk/news/2024-11-13-new-ethical-framework-help-navigate-use-ai-academic-research">экспертов</a> — нас могут ожидать новые формы геополитических противостояний.</p><p>Философ и футуролог Ник Бостром, автор книги <a href="https://www.litres.ru/book/nik-bostrom/iskusstvennyy-intellekt-16902546/">«Искусственный интеллект. Этапы. Угрозы. Стратегии»</a>, в недавнем интервью выразил обеспокоенность: «Ускорение гонки ИИ без адекватных механизмов контроля напоминает эксперименты с ядерной энергией в 1940-х, но с ещё более непредсказуемыми последствиями».</p><p>Сделку комментирует эксперт Максим Горшенин, автор инсайдерского канала про импортозамещение в России <a href="https://t.me/imaxairu">Imaxai</a>, соучредитель Ассоциации производителей компьютеров и периферийного оборудования:</p><blockquote>«Это стратегическая инициатива, тесно связанная с политикой США. Их цель — создавать американские продукты на американских вычислительных мощностях. Последствия такого подхода заключаются в создании замкнутой экосистемы: OpenAI — крупнейший потребитель вычислительных ресурсов, и партнерство с NVIDIA блокирует возможности проникновения на этот рынок конкурентов.                                                                                                              Второй ключевой аспект — сохранение технологического лидерства США. Все действия направлены на удержание позиций, включая лидерство в производстве и разработке чипов для ИИ. Этому способствует указ Трампа, предписывающий американским компаниям инвестировать миллиарды долларов в эту сферу.                                                                                                                                                              Что касается долгосрочных глобальных последствий — полный контроль над цивилизацией в ближайшее время вряд ли будет достигнут. Но лет через 30 — вполне возможно.                                                          Исторически США всегда делали ставку на технологическое превосходство через сотрудничество с Министерством обороны, что позволяло создавать более совершенное оружие.                                                                                                                                            Сейчас официально заявлено: кто обладает самым передовым ИИ, тот получает преимущество в войне, прогнозировании, предугадывании действий противника, создании умных бомб и других сферах. Это инвестиция в технологическое лидерство США, что создает негативные последствия для остальных стран и запускает гонку искусственного интеллекта — прежде всего между США и Китаем. Остальные страны в этом противостоянии практически не участвуют».</blockquote><p>Дело уже не в коммерческом превосходстве, а в том, кто будет контролировать технологию, способную переопределить будущее мировое влияние и безопасность. Битва за ИИ может оказаться новой масштабной войной. Победа в этой битве достанется не тому, у кого лучше армия, а тому, у кого сложнее алгоритмы и больше вычислительных мощностей.</p><h2>Этическая дилемма: кто будет контролировать контролеров</h2><p>Самый сложный вопрос — этический. Создание сверхинтеллекта поднимает проблемы, которые человечество никогда прежде не решало. Суцкевер <a href="https://trends.rbc.ru/trends/industry/676a3d789a79473b9003120f">предупреждает</a>, что существующие методы безопасности, основанные на человеческом контроле, не работают для сверхинтеллекта. Люди просто не смогут понять его действия.</p><p>OpenAI позиционирует себя как компанию, миссия которой — безопасный ИИ на благо человечества. Но структура партнёрства с NVIDIA ставит вопрос о приоритетах.</p><p>В ноябре 2024 года на сайте Оксфордского университета было <a href="https://www.ox.ac.uk/news/2024-11-13-new-ethical-framework-help-navigate-use-ai-academic-research">опубликовано</a> заявление профессора биоэтики Джулиана Савулеску, посвященное этике использования ИИ в научных исследованиях.</p><p>В нём он сказал следующее:</p><blockquote>«Большие языковые модели — это ящик Пандоры для академических исследований. Они могли бы уничтожить академическую независимость, креативность, оригинальность и саму мысль. Они также могли бы способствовать невообразимому со-творчеству и продуктивности. Мы должны быть осторожны, когда полагаемся на частные корпорации с их обязательствами перед акционерами, чтобы управлять технологиями, которые могут оказывать колоссальное влияние на человеческое будущее».</blockquote><p><br /></p><h2>Итоги: точка невозврата пройдена</h2><p>Партнерство NVIDIA и OpenAI — не рядовая сделка. Мы входим в новую эру, в которой вычислительная мощность становится главным ресурсом. Тот, кто контролирует ИИ, получает реальное влияние в мире.</p><p>Сам Альтман, президент OpenAI, признаёт:</p><blockquote>«Вычислительная инфраструктура станет основой экономики будущего».</blockquote><p>За этими словами — новый мир, в котором традиционные ресурсы вроде нефти или газа уступают место гигаваттам и гигафлопам.</p><p>Для программистов и IT-специалистов это означает необходимость адаптации к реальности, где доступ к большим AI-моделям дает возможности создания продуктов. Технологическое лидерство всё больше определяется не только кодом, но и вычислительными ресурсами.</p><p>Гонка сверхинтеллекта только начинается, но правила уже пишутся. И главное, что демонстрирует партнерство NVIDIA и OpenAI: в игре за будущее разума ставки выше, чем мы привыкли думать, а победитель, возможно, будет только один.</p>]]></content:encoded>
    </item>
    <item>
      <title>Как настроить MSI Afterburner для разгона видеокарты</title>
      <link>https://tproger.ru/articles/kak-nastroit-msi-afterburner-dlya-razgona-videokarty</link>
      <comments>https://tproger.ru/articles/kak-nastroit-msi-afterburner-dlya-razgona-videokarty?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Анна Ельцова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-nastroit-msi-afterburner-dlya-razgona-videokarty</guid>
      <description><![CDATA[<p>Пошаговое руководство по настройке MSI Afterburner: разгон видеокарты, настройка частот, кулеров и мониторинга. Безопасный оверклокинг — читай прямо сейчас!</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-nastroit-msi-afterburner-dlya-razgona-videokarty">Как настроить MSI Afterburner для разгона видеокарты</a>»</p>]]></description>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Производительность]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 17 Jun 2024 12:40:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>MSI Afterburner — удобный инструмент, который позволяет настраивать параметры видеокарт и отслеживать их работу. С помощью него можно контролировать и изменять частоты ядра и памяти видеокарты, регулировать напряжение и скорость вращения вентиляторов.</p><p>По сути, грамотная и безопасная настройка MSI Afterburner позволяет в разы увеличить производительность комплектующих без глубоких знаний в области оверклокинга — утилита не перегружена огромным количеством функций, а интерфейс понятный и дружелюбный.</p><p>В этом руководстве мы рассмотрим, как правильно настроить MSI Afterburner для безопасного разгона и мониторинга вашей видеокарты, чтобы обеспечить максимальную производительность.</p><h2>Знакомство с MSI Afterburner</h2><p>Проверьте, загружены ли у вас свежие драйверы для видеокарты и <a href="https://www.msi.com/Landing/afterburner/graphics-cards">скачайте</a> последнюю версию MSI Afterburner с официального сайта — сейчас это 4.6.5 или 4.6.6 Beta 3. В этой версии <a href="https://club.dns-shop.ru/digest/93160-vyishla-stabilnaya-msi-afterburner-4-6-5-s-podderjkoi-videokart-ge/?utm_referrer=https%3A%2F%2Fwww.google.com%2F">есть</a> поддержка 3D-ускорителей GeForce RTX 40, Radeon RX 7900 и GeForce RTX 3060 Ti с памятью GDDR6X, и экспериментальная поддержка процессоров Intel Core 13 и AMD Ryzen 7000.</p><p>После установки (в ней нет ничего сложного) запустится само приложение MSI Afterburner и появится рабочее пространство. Кстати, внешний вид пользовательского интерфейса можно поменять. Например, поставить скины MSI Mystic Afterburner skin или MSI Cyborg skin White by Derex Design  — это делается через «Настройки» —&gt; «Интерфейс».</p><p>Некоторые настройки и функции будут работать только с видеокартами MSI или определенными моделями от других производителей. Хотя MSI Afterburner совместим со всеми видеокартами (и NVIDIA, и AMD), не все параметры могут быть доступны.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-06-16/60fd0d25-fa5b-4f8e-8268-01a15310a61b.jpg" alt="" /><figcaption>Интерфейс MSI Afterburner</figcaption></figure><p><b>1. Основные параметры видеокарты:</b> частота графического процессора, частота памяти, напряжение в графическом процессоре, температура графического процессора.</p><p><b>2. Левое боковое меню сверху вниз:</b> помощь (с выходом в интернет), тест (через MSI Kombustor), информация, сканер разгона,  настройки, меню мониторинга.</p><p>Сканер разгона выполняет автоматический разгон видеокарты и тестирует стабильность ее работы с помощью технологии NVIDIA OC Scanner. По сути, это самый быстрый способ разогнать карту, но проверки стоит проводить в любом случае.</p><p>Утилита автоматически подбирает частоты, на которых компьютер может работать стабильно. Процесс занимает разное количество времени в зависимости от модели видеокарты. Правда, разгон не всегда будет стабильным — тогда программа выдаст «Results are considered unstable».</p><p><b>3.</b> <b>Настройка напряжения, частоты памяти и процессора и скорость работы вентиляторов:</b></p><ul><li><b>Core Voltage</b> (напряжение ядра) — регулирует напряжение, подаваемое на главный графический процессор. Эта функция доступна далеко не на всех моделях, а только на тех, где есть программируемые микросхемы регуляторов напряжения — обычно это указано в технических характеристиках. Внизу находится <b>Curve Editor </b>— редактор кривой напряжения/частот.</li></ul><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-06-16/ce5ea89d-fe84-4c8e-b459-ec601f6e1778.png" alt="" /><figcaption>Интерфейс Curve Editor в MSI Afterburner</figcaption></figure><ul><li><b>Core Clock/Memory Clock</b> (частота ядра/частота памяти). Настройка частоты ядра без изменения кривой может привести к различным сбоям. «Играться» с частотой памяти тоже нужно осторожно.</li><li><b>Fan</b> (вентиляторы): Power Limit отвечает за лимит энергопотребления ведущего графического процессора. В Temperature Limit выставляется предел нагрева ведущего ГП. Fan Speed регулирует скорость вращения кулера на ведущем ГП. Функция доступна не на всех моделях — нужно, чтобы на устройстве была микросхема регулирования кулеров/системы охлаждения.</li></ul><p><b>4. Профили.</b> Это ваши сохраненные настройки. Например, в профиле 1 могут быть параметры для рутинной работы с компьютером, в профиле 2 — для простых шутеров, а в профиле 3 — настройки с разгоном и фиксированной скоростью кулера для более тяжелых игр.</p><h2>Разгоняем видеокарту в Afterburner</h2><p>Разгон видеокарты зависит от конкретной модели, её конструкции, охлаждения и других параметров. Обычно производители предоставляют возможность небольшого разгона через программное обеспечение или специальные утилиты.</p><p>В прошлом году энтузиаст Аллен «Splave» Голиберзах <a href="https://3dnews.ru/1089207/ustanovlen-noviy-mirovoy-rekord-razgona-graficheskogo-protsessora-geforce-rtx-4090-3945-mgts">установил</a> мировой рекорд разгона GPU. Он смог разогнать ASUS GeForce RTX 4090 ROG Matrix до 3885 МГц. В ней стоит необслуживаемая система жидкостного охлаждения, но оверклокеру все равно пришлось её переделывать и даже использовать жидкий азот. Так, температура GPU была -34,6°С, а «горячей точки» — -40°С. Память при этом работала на частоте 1563 МГц. Среди других комплектующих — процессор Intel Core i9-13900KF, оперативная память DDR5-6446 и материнская плата ASRock Z690 Aqua OC.</p><p>Оптимальный разгон видеокарты обычно составляет около 10-20% от стандартной частоты GPU и памяти. Однако нужно помнить, что разгон может повлиять на срок службы видеокарты, стабильность её работы и тепловыделение. Поэтому перед этим стоит ознакомиться с инструкциями по безопасному разгону и следить за температурой и частотами. А ещё можно заглянуть в <a href="https://onedrive.live.com/view.aspx?resid=11F4002E1134F403%21666072&amp;authkey=!AI9oT4l-8nmTm7E">эту таблицу</a> предельного разгона частот GPU на разных видеокартах, собранную одним из энтузиастов. Если не соблюдать рекомендации, на экране появятся такие артефакты:</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-06-16/c5145f16-be4e-4150-b7ff-8f84a2cc4a0f.jpeg" alt="" /><figcaption>Артефакты на экране при нестабильном разгоне видеокарты</figcaption></figure><h3>Шаги для безопасного разгона видеокарты</h3><ol><li>Увеличьте мощность вашего графического процессора (Power Limit) на максимум. Не волнуйтесь, это полностью безопасно.</li><li>Постепенно повышайте тактовую частоту (Clock Speed), но не более чем на 5% за раз.</li><li>Увеличьте частоту памяти. Оптимально — на 10-20%. Конечно, можно поставить и более высокие настройки, но это уже из рубрики «Эксперименты».</li><li>Проведите бенчмарк-тест, например, с помощью 3DMark Time Spy, чтобы проверить стабильность работы компьютера. Это приложение нужно скачать отдельно. Если не появляются артефакты и синий экран, то можно продолжать постепенно повышать частоты.</li><li>Еще одна опция — оптимизация напряжения (Voltage) на видеокарте для бóльших экспериментов с разгоном и достижения высоких частот. Регулировка напряжения по дефолту заблокирована из соображений безопасности, поэтому, чтобы настраивать этот параметр, нужно снять блокировку в расширенных настройках. Но все на свой страх и риск: увеличивать Voltage нужно аккуратно, поскольку на компьютере может стоять некачественный блок питания, который может сгореть. Рекомендуется повышать напряжение с шагом 25 мВ или 0,025 В. Будьте готовы к тому, что это приведет к умеренному увеличению энергопотребления и тепловыделения.</li><li>Сохраните настройки и проведите еще один бенчмарк-тест. Если сбой в работе компьютера не произошел, значит, разгон стал стабильным, и вы можете продолжать экспериментировать с частотами GPU и памяти. Если компьютер все равно выходит из строя, нужно увеличить напряжение. В один момент графический процессор достигнет предела, и вам придется прекратить эксперименты с частотами и напряжением и выбрать стабильную и безопасную комбинацию.</li></ol><h2>Про кулеры</h2><p>MSI Afterburner позволяет эффективно управлять скоростью вращения вентиляторов видеокарты. Это особенно полезно при разгоне, когда видеокарта работает на повышенных частотах и требует усиленного охлаждения. В программе есть три варианта настройки:</p><ol><li><b>Автоматический режим.</b> Для этого нужно нажать кнопку А (Auto) в блоке Fan. В таком случае работа кулеров будет подстраиваться под температуру GPU.</li><li><b>Фиксированная скорость. </b>Нужно отключить автоматический режим и поставить бегунок Fan на нужную скорость. В таком случае кулеры будут крутиться всегда, например, на 100%.</li><li><b>Ручная настройка. </b>Зайдите в «Настройки» —&gt; «Кулер» —&gt; «Включить программный пользовательский авторежим». Нажмите на линию графика, чтобы добавить контрольные точки. Каждая точка будет соответствовать определенной температуре и скорости вращения вентилятора.<br /></li></ol><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-06-16/c4e3966f-94ac-4da1-9122-090d86d77ab9.png" alt="" /><figcaption>Кривая настройки скорости кулера</figcaption></figure><p>Также в MSI Afterburner вы можете создать несколько профилей вентиляторов для разных режимов работы (например, для игр и повседневного использования) и переключаться между ними.</p><h2>Мониторинг</h2><p>Настройка графиков мониторинга поможет вам отслеживать ключевые параметры:</p><ul><li>температуру каждого ядра центрального процессора;</li><li>загрузку всех ядер ЦП;</li><li>частоту памяти и ядра видеокарты;</li><li>температуру видеокарты;</li><li>загрузку памяти видеоядра.</li></ul><p>Это важно для обеспечения стабильной работы и предотвращения перегрева.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-06-16/e7184d52-c27b-40e9-bd86-fedc6b4334bf.png" alt="" /><figcaption>Меню мониторинга в MSI Afterburner</figcaption></figure><p>В «Настройках» —&gt; «Мониторинг» можно настроить параметры, которые программа будет отображать.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-06-16/c353c15d-e13a-4dda-97bc-10f603d78823.png" alt="" /></figure><p>К тому же MSI Afterburner интегрируется с <b>RivaTuner Statistics Server</b> (RTSS), которая предоставляет дополнительные возможности для настройки и отображения параметров мониторинга. RTSS обычно устанавливается вместе с MSI Afterburner. Если у вас его нет, вы можете скачать и установить его отдельно.</p><p>Утилита позволяет выводить информацию о работе видеокарты, например, FPS, поверх всех приложений — это особенно удобно в играх. В ней можно настроить параметры отображения, такие как размер шрифта, положение на экране и прозрачность. Это поможет сделать информацию мониторинга более удобной и наглядной без необходимости сворачивать игру и заходить в MSI Afterburner.</p><p>Разгон видеокарты с помощью MSI Afterburner — это эффективный способ повысить производительность вашей системы. Следуя этому руководству, вы сможете безопасно настроить MSI Afterburner для достижения оптимальной производительности вашей видеокарты. Не забывайте также о важности мониторинга и тестирования на стабильность, чтобы избежать возможных проблем. Помните, что разгонять видеокарту нужно осторожно — перед этим изучите технические характеристики модели.</p>]]></content:encoded>
    </item>
    <item>
      <title>Энтузиаст за 2 недели создал собственный GPU с нуля</title>
      <link>https://tproger.ru/news/entuziast-za-2-nedeli-sozdal-sobstvennyj-gpu-s-nulya</link>
      <comments>https://tproger.ru/news/entuziast-za-2-nedeli-sozdal-sobstvennyj-gpu-s-nulya?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Булат Яббаров]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/entuziast-za-2-nedeli-sozdal-sobstvennyj-gpu-s-nulya</guid>
      <description><![CDATA[<p>Инженер Адам Маджмудар взялся за разработку графического процессора (GPU), не имея при этом предварительного опыта в этой области</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/entuziast-za-2-nedeli-sozdal-sobstvennyj-gpu-s-nulya">Энтузиаст за 2 недели создал собственный GPU с нуля</a>»</p>]]></description>
      <category><![CDATA[DIY]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 01 May 2024 07:55:17 GMT</pubDate>
      <content:encoded><![CDATA[<p>Вдохновенный своим предыдущим проектом по созданию процессора с нуля, инженер Адам Маджмудар взялся за еще более амбициозную задачу — разработку графического процессора (GPU).</p><p>Не имея предварительного опыта в этой области, Адаму потребовалось всего две недели, чтобы завершить проект, что сам по себе является впечатляющим достижением.</p><figure><img src="https://media.tproger.ru/user-uploads/98945/2024-05-01/56284aa4-4823-4cf1-8ee4-66b4e9ff3736.jpeg" alt="" /></figure><p>Процесс создания начался с изучения основ GPU и закончился полноценным чипом, спроектированным в Verilog и проверенным с помощью программного обеспечения OpenLane EDA.</p><p>Адам описал весь процесс в соответствующем Twitter-треде, предоставив подробное описание каждого этапа разработки.</p><p>Проект был ориентирован на создание GPU для общих параллельных вычислений (GPGPU), что предусмотрело корректировку архитектуры инструкций, включающую всего 11 команд.</p><p>Это позволило оптимизировать процессор для выполнения сложных математических операций, таких как сложение и умножение матриц, что необходимо в графических задачах и машинном обучении.</p><figure><img src="https://media.tproger.ru/user-uploads/98945/2024-05-01/5859381b-f9c8-4578-9afa-f4444814f2a6.jpeg" alt="" /></figure><p>Несмотря на начальный успех, создание GPU в Verilog принесло ряд сложностей, связанных с памятью и реализацией расписания задач. Советы известного программиста Джорджа Хотца помогли Адаму преодолеть эти препятствия. Третья переработка кода решила проблемы с расписанием выполнения вычислений в вычислительных ядрах.</p><p>В итоге Адам добился работоспособности своего GPU, доказав это видео с демонстрацией работы ядра матричного сложения:</p><p>Хотя работа Адама не претендует на звание лучшей видеокарты, она отражает важность инноваций и DIY-подхода в технологической сфере.</p><p>По словам инженера, он насладился созданием визуализации своего дизайна GPU и с нетерпением ждет получения готового чипа.</p>]]></content:encoded>
    </item>
    <item>
      <title>Ядро Linux обновили до версии 4.18</title>
      <link>https://tproger.ru/news/linux-4-18-released</link>
      <comments>https://tproger.ru/news/linux-4-18-released?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Сергей Штукатуров]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/linux-4-18-released</guid>
      <description><![CDATA[<p>Изменения в Linux 4.18 затронули 13 067 файлов и коснулись работы CPU и GPU, ядро стало компактнее после удаления 677 480 участков кода.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/linux-4-18-released">Ядро Linux обновили до версии 4.18</a>»</p>]]></description>
      <category><![CDATA[Linux]]></category>
      <category><![CDATA[Open Source]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 14 Aug 2018 06:10:08 GMT</pubDate>
      <content:encoded><![CDATA[<p>12 августа 2018 года Линус Торвальдс <a href="http://lkml.iu.edu/hypermail/linux/kernel/1808.1/02806.html">объявил</a> о выходе ядра Linux 4.18. Изменения затрагивают 13 067 файлов. Разработчики смогли сделать ядро <a href="https://www.phoronix.com/scan.php?page=news_item&amp;px=Linux-4.18-rc1-Kernel-Released">компактнее</a>, удалив 677 480 участков кода и добавив 578 788.</p><h3>Предрелизная доработка ядра Linux 4.18</h3><p>Два месяца, прошедшие с момента <a href="https://www.phoronix.com/scan.php?page=news_item&amp;px=Linux-4.18-rc1-Kernel-Released">объявления релиз-кандидата</a> Linux 4.18-rc1, разработчики проводили тестирование и устраняли неполадки ядра. По словам Торвальдса, продукт планировалось выпустить неделей ранее, однако было решено исправить некоторые частные недочёты, связанные с сетью, а также с драйверами и VFS.</p><h3>Наиболее важные изменения</h3><p><a href="https://www.phoronix.com/scan.php?page=article&amp;item=linux-418-features&amp;num=1">Изменения</a> коснулись работы с процессорами, файловой системой и хранилищами данных, обработки графики. Некоторые новые возможности Linux 4.18 стоит выделить особо.</p><ul><li>Базовая поддержка Qualcomm Snapdragon 845 SoC.</li><li>Интеграция в ядро поддержки Steam Controller от Valve.</li><li>В ядро добавлена базовая инфраструктура для BPFILTER, обрабатывающего запросы API iptables и передающего их в программы BPF.</li><li>Вызов системы Restartable Services для быстрой обработки данных в user-space.</li><li>DRM-драйвер AMDGPU теперь поддерживает обработку графики VegaM на Intel Kabylake-G CPUs, а также <a href="https://www.techpowerup.com/244902/amd-demonstrates-7nm-radeon-vega-instinct-hpc-accelerator?utm_source=ixbtcom">готовящуюся к релизу</a> графическую карту, известную как GPU AMD Vega 20.</li><li>Различные улучшения управления питанием AMDGPU, такие как профили для Vega.</li><li>Вычислительный драйвер ядра AMDKFD теперь поддерживает оборудование GFX9/Vega.</li><li>Intel доработал поддержку микроархитектуры Ice Lake.</li><li>Реализован DM Writecache, который может применяться для кэширования операций записи блоков на SSD-накопителях или в постоянной памяти.</li><li>Доработана поддержка USB 3.2 и USB Type-C.</li></ul><p>Уже стартовала работа над <a href="https://www.phoronix.com/scan.php?page=news_item&amp;px=More-Linux-4.19-Activity">большим обновлением</a> Linux 4.19. Предполагается, что это будет последняя версия перед 5.0.</p>]]></content:encoded>
    </item>
    <item>
      <title>Дженсен Хуанг: развитие графических процессоров Nvidia опережает закон Мура</title>
      <link>https://tproger.ru/news/nvidia-new-law</link>
      <comments>https://tproger.ru/news/nvidia-new-law?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Мария Рогазинская]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/nvidia-new-law</guid>
      <description><![CDATA[<p>По словам Дженсена Хуанга, чипы Nvidia стали в 25 раз быстрее за пять лет, а обучение AlexNet на системе DGX-2 ускорилось в 500 раз.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/nvidia-new-law">Дженсен Хуанг: развитие графических процессоров Nvidia опережает закон Мура</a>»</p>]]></description>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 05 Apr 2018 11:42:46 GMT</pubDate>
      <content:encoded><![CDATA[<p>Главный исполнительный директор Nvidia Дженсен Хуанг (Jensen Huang) на конференции GPU Technology Conference объявил, что в связи с развитием технологий эволюция современных графических процессоров больше не подчиняется закону Мура.</p><figure><img src="https://media.tproger.ru/uploads/2018/04/1.jpg" alt="" /></figure><h3>Что это значит?</h3><p>В основном докладе конференции Хуанг указал на то, что графические чипы Nvidia стали в 25 раз быстрее, чем были 5 лет назад. Если бы процессоры развивались согласно закону Мура, то скорость увеличилась бы в 10 раз. Позже Хуанг рассмотрел увеличение мощности графических процессоров с точки зрения скорости обучения нейронной сети AlexNet, способной запоминать 15 млн картинок. 5 лет назад обучение нейросети на связке из двух видеокарт Nvidia GTX 580 заняло 6 дней. Теперь с системой <a href="https://www.nvidia.com/en-us/data-center/dgx-2/">DGX-2</a> это занимает 18 минут, то есть в 500 раз быстрее.</p><h3>Перспективы</h3><p>Дженсен Хуанг считает, что графические процессоры нуждаются в новом собственном законе. Так выгода будет получена сразу в нескольких сферах: архитектуре, связи, технологиях памяти и алгоритмах.</p><p>Графические процессоры работают быстрее, чем центральные процессоры, благодаря параллельной архитектуре.</p><p>Напомним, что на прошедшей в марте 2018 года конференции GDC Nvidia совместно с Microsoft <a href="https://tproger.ru/news/nvidia-microsoft-rtx/">представила</a> новую технологию трассировки лучей, которая стала реализуема благодаря передовой архитектуре от «лагеря зеленых» — Volta.</p>]]></content:encoded>
    </item>
    <item>
      <title>Курс «Вычисления на GPU. Основные подходы, архитектура, оптимизации»</title>
      <link>https://tproger.ru/video/gpu-computing</link>
      <comments>https://tproger.ru/video/gpu-computing?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Дмитрий Баранчук]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/video/gpu-computing</guid>
      <description><![CDATA[<p>Курс посвящён разработке программного обеспечения для параллельных вычислений на GPU NVIDIA: линейная алгебра, преобразования Фурье и библиотека Thrust.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/video/gpu-computing">Курс «Вычисления на GPU. Основные подходы, архитектура, оптимизации»</a>»</p>]]></description>
      <category><![CDATA[Обучающие курсы]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Библиотеки]]></category>
      <category><![CDATA[Видео]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sun, 10 Sep 2017 21:35:22 GMT</pubDate>
      <content:encoded><![CDATA[<p>Русскоязычный курс лекций, освещающий основные способы разработки программного обеспечения, использующего графические процессоры (GPU) NVIDIA в параллельных вычислениях.</p><p>Курс включает в себя обзор библиотек линейной алгебры, преобразования Фурье, генерации случайных чисел. Также рассмотрен процесс быстрой разработки с помощью STL-подобной библиотеки Thrust.</p>]]></content:encoded>
    </item>
    <item>
      <title>Facebook смогла ускорить обучение моделей для визуального распознавания</title>
      <link>https://tproger.ru/news/facebook-boosted-training-for-visual-recognition-models</link>
      <comments>https://tproger.ru/news/facebook-boosted-training-for-visual-recognition-models?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Мая Устинова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/facebook-boosted-training-for-visual-recognition-models</guid>
      <description><![CDATA[<p>Facebook ускорила обучение ResNet-50 на ImageNet с 29 часов до одного, увеличив пакет с 256 до 8192 изображений и число GPU с 8 до 256.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/facebook-boosted-training-for-visual-recognition-models">Facebook смогла ускорить обучение моделей для визуального распознавания</a>»</p>]]></description>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 13 Jun 2017 16:46:41 GMT</pubDate>
      <content:encoded><![CDATA[<p>Недавно Facebook <a href="https://web.archive.org/web/20170630054625/https://research.fb.com/publications/imagenet1kin1h/">опубликовала</a> документ, в котором подробно описывается подход компании к сокращению времени на обучение моделей для распознавания объектов. В нём утверждается, что компания смогла сократить время тренировки модели глубокого обучения ResNet-50 на наборе <a href="http://www.image-net.org">ImageNet</a> с 29 часов до одного.</p><h3>Как она это сделала?</h3><p>Facebook удалось существенно сократить время обучения за счет распределения больших по размеру пакетов данных на большее количество графических процессоров. Раньше пакеты из 256 картинок распределялись между восемью GPU, теперь же используются наборы из 8192 картинок, распределенных между 256 графическими процессорами.</p><p>На начальных этапах команде пришлось замедлить темпы обучения, чтобы преодолеть некоторые трудности, которые раньше не позволяли использовать пакеты больших размеров. Если не углубляться в детали, для обучения модели ResNet-50 используется стохастический градиентный спуск.</p><h3>Почему именно такой способ?</h3><p>Его ключевой переменной является скорость обучения — а именно, степень изменения весов во время процесса тренировки. Изменение этой переменной в зависимости от размера пакетов и является ключом к оптимизации.</p><p>При обучении нейронных сетей всегда приходится искать компромисс между точностью и скоростью. Чем больше наборы данных, тем дольше идёт обучение и тем точнее становится модель, но это занимает больше времени. Однако модель с низкой точностью, обучаемая за 20 секунд, тоже никому не нужна.</p><p>В отличие от большинства исследовательских проектов, команды Facebook AI Research (FAIR) и Applied Machine Learning (AML) работали над увеличением пакетов. В ходе исследований у учёных возникли дополнительные вопросы, которые они планируют решить. Питер Нордхаус, сотрудник AML, отметил:</p><blockquote>Эта работа дает больше вопросов, чем ответов. Например, когда количество изображений превышает 8 тысяч, частота ошибок снова увеличивается, и мы не знаем, почему.</blockquote><p>Facebook использовала для эксперимента Caffe2, свой открытый фреймворк для глубокого обучения, и серверы <a href="https://tproger.ru/news/facebook-big-basin/">Big Basin</a>.</p>]]></content:encoded>
    </item>
    <item>
      <title>Система из 8 миллионов частиц при 60 FPS</title>
      <link>https://tproger.ru/articles/particle-acceleration-on-gpu</link>
      <comments>https://tproger.ru/articles/particle-acceleration-on-gpu?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Типичный программист]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/particle-acceleration-on-gpu</guid>
      <description><![CDATA[<p>Морис Толлмиен выложил на GitHub проект рендеринга частиц на вычислительных шейдерах OpenGL: 8 миллионов частиц при 60 FPS на GTX-660.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/particle-acceleration-on-gpu">Система из 8 миллионов частиц при 60 FPS</a>»</p>]]></description>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 18 Jan 2016 22:22:52 GMT</pubDate>
      <content:encoded><![CDATA[<p>Пользователь Морис Толлмиен (Maurice Tollmien) <a href="https://github.com/MauriceGit/Partikel_accelleration_on_GPU">поделился</a> на GitHub своим проектом по рендерингу системы частиц на OpenGL и вычислительных шейдерах с использованием GPU. Морису удалось добиться симуляции 8 миллионов независимых частиц при 60 FPS на видеокарте GTX-660 (которая в принципе не плохая, но и отнюдь не топовая).</p><p>Он сообщает, что его работа по сути является наглядной демонстрацией для себя самого и всех желающих того, как можно использовать вычислительные шейдеры в OpenGL.</p><p>Напомним, вычислительные шейдеры — это программы, запущенные на видеокарте за пределами территории обычного рендеринга. Они могут быть использованы для массивных параллельных GPGPU алгоритмов или для ускорения элементов рендеринга программы.</p><p>Автор проверял работу своего творения только на Debian-based ОС (таких как Ubuntu или Mint, например), но работать по идее должно везде. Необходима поддержка OpenGL 4.3, а также наличие библиотек xorg-dev и mesa-common-dev. Если это всё у вас есть, то просто <a href="https://github.com/MauriceGit/Partikel_accelleration_on_GPU/archive/master.zip">скачивайте</a> и выполняйте cmake &amp;&amp; make &amp;&amp; cd bin/ &amp;&amp; ./particleSim.</p><p>Или посмотрите видео.</p>]]></content:encoded>
    </item>
    <item>
      <title>В чем разница между CPU и GPU?</title>
      <link>https://tproger.ru/articles/cpu-and-gpu</link>
      <comments>https://tproger.ru/articles/cpu-and-gpu?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Денис Глаз]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/cpu-and-gpu</guid>
      <description><![CDATA[<p>Объясняем разницу между CPU и GPU простым языком. Сравниваем архитектуру, количество ядер, кэш-память и многопоточность. Разбираемся, почему GPU быстрее для майнинга и машинного обучения.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/cpu-and-gpu">В чем разница между CPU и GPU?</a>»</p>]]></description>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[GPU]]></category>
      <category><![CDATA[Процессор]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 10 Nov 2015 17:43:27 GMT</pubDate>
      <content:encoded><![CDATA[<p>CPU и GPU — это процессоры. Между ними есть много общего, однако сконструированы они были для выполнения разных задач. В чём конкретно выражается разница между CPU и GPU, вы узнаете из этой статьи.</p><p><b>Ключевые выводы:</b><br />- CPU оптимизирован для последовательного выполнения сложных инструкций с минимальной задержкой<br />- GPU содержит тысячи ядер для массовой параллельной обработки однотипных задач<br />- CPU использует большой кэш и предсказание ветвлений, GPU — массив исполнительных блоков<br />- Для майнинга GPU подходит лучше, потому что вычисление хэшей — это миллионы независимых однотипных операций<br />- CPU и GPU дополняют друг друга: CPU управляет логикой программы, GPU ускоряет параллельные вычисления</p><p>Примечание Вы читаете улучшенную версию некогда выпущенной нами статьи.</p><p>Содержание:</p><ul><li><a href="https://tproger.ru/#part1">Что такое CPU</a></li><li><a href="https://tproger.ru/#part2">Что такое GPU</a></li><li><a href="https://tproger.ru/#part3">Отличие CPU от GPU</a></li><li><a href="https://tproger.ru/#part4">Почему для майнинга используется GPU, а не CPU</a></li><li><a href="https://tproger.ru/#faq">Часто задаваемые вопросы</a></li></ul><h2>Что такое CPU</h2><p>CPU — это центральный процессор (англ. central processing unit).</p><p>Основная функция — выполнение цепочки инструкций за максимально короткое время.</p><p>CPU спроектирован таким образом, чтобы выполнять несколько цепочек одновременно или разбивать один поток инструкций на несколько и, после выполнения их по отдельности, сливать их снова в одну, в правильном порядке. Каждая инструкция в потоке зависит от следующих за ней. Именно поэтому в CPU так мало исполнительных блоков, а весь упор делается на скорость выполнения и уменьшение простоев, что достигается при помощи кэш-памяти и конвейера.</p><p>Если вы хотите знать не только что такое CPU, но и как работает процессор, то <a href="https://tproger.ru/explain/how-cpu-works/">прочтите эту статью</a>.</p><h2>Что такое GPU</h2><p>GPU — это графический процессор (англ. graphics processing unit).</p><p>Основная функция — рендеринг 3D-графики и визуальных эффектов.</p><p>GPU получает на вход полигоны, а после проведения над ними необходимых математических и логических операций выдаёт координаты пикселей. По сути, работа GPU сводится к оперированию над огромным количеством независимых между собой задач. Поэтому он содержит огромное количество исполнительных блоков — в современных GPU их 2048 и более.</p><h2>Отличие CPU от GPU</h2><p>С понятиями разобрались, теперь посмотрим, в чём отличие CPU от GPU.</p><ol><li>Доступ к памяти. В GPU он связанный и легко предсказуемый — если из памяти читается элемент текстуры, то через некоторое время настанет очередь и соседних текселов. С записью ситуация аналогичная.</li><li>Размер кэш-памяти. Графическому процессору, в отличие от универсальных процессоров, не нужна кэш-память большого размера. Для текстур требуются лишь 128–256 килобайт.</li><li>Поддержка многопоточности. Центральный процессор исполняет 1––2 потока вычислений на одно ядро, а графический процессор может поддерживать несколько тысяч потоков на каждый мультипроцессор, которых в чипе несколько штук. И если переключение с одного потока на другой для CPU стоит сотни тактов, то GPU переключает несколько потоков за один такт.</li><li>Архитектура. В CPU большая часть площади чипа занята под буферы команд, аппаратное предсказание ветвления и огромные объемы кэш-памяти, а в GPU большая часть площади занята исполнительными блоками.</li></ol><h2>Почему для майнинга используется GPU, а не CPU</h2><p>Если CPU принимает решения в соответствии с указаниями программы, то GPU — производит огромное количество однотипных вычислений. Выходит, что если подавать на графический процессор независимые простейшие математические задачи, то он справится значительно быстрее, чем центральный процессор. Этим успешно пользуются майнеры биткоинов.</p><p>Суть майнинга заключается в том, что компьютеры решают математические задачи, в результате которых создаются биткоины. Все биткоин-переводы по цепочке передаются майнерам, чья работа состоит в том, чтобы подобрать из миллионов комбинаций один-единственный хэш, подходящий ко всем новым транзакциям и секретному ключу, который и обеспечит майнеру получение награды. Скорость вычисления напрямую зависит от количества исполнительных блоков. Поэтому GPU больше подходят для выполнения данного типа задачи, нежели CPU. Чем больше количество произведенных вычислений, тем выше шанс получить биткоины.</p><h2>Часто задаваемые вопросы</h2><p><b>Может ли GPU полностью заменить CPU?</b></p><p>Нет, GPU не может заменить CPU. Центральный процессор управляет операционной системой, обрабатывает ввод-вывод, принимает решения на основе условий и координирует работу всех компонентов. GPU эффективен только для массовых параллельных вычислений — рендеринга графики, обучения нейросетей, криптографии. Эти процессоры дополняют друг друга, а не конкурируют.</p><p><b>Почему в GPU так много ядер, а в CPU — мало?</b></p><p>CPU решает задачи, где каждая следующая инструкция зависит от предыдущей, поэтому ему нужны мощные ядра с большим кэшем и предсказанием ветвлений. GPU обрабатывает тысячи независимых задач одновременно (например, пиксели на экране), поэтому ему выгоднее иметь много простых ядер. Это фундаментальное различие архитектур: CPU — про скорость одного потока, GPU — про количество параллельных потоков.</p><p><b>Где ещё используется GPU кроме графики и майнинга?</b></p><p>GPU активно применяется в машинном обучении и обучении нейросетей (TensorFlow, PyTorch), научных вычислениях (моделирование молекул, прогноз погоды), обработке видео и рендеринге 3D-сцен, криптографии и шифровании. Технология GPGPU (General-Purpose computing on GPU) позволяет использовать видеокарты через фреймворки CUDA (NVIDIA) и OpenCL для любых параллельных вычислений.</p><p><b>Что такое CUDA и OpenCL?</b></p><p>CUDA — проприетарная платформа параллельных вычислений от NVIDIA, позволяющая программировать GPU как универсальный вычислитель. OpenCL — открытый стандарт, работающий на GPU разных производителей (NVIDIA, AMD, Intel). Оба фреймворка позволяют разработчикам запускать на GPU не только графические, но и произвольные параллельные вычисления, что используется в машинном обучении, обработке данных и научных расчётах.</p>]]></content:encoded>
    </item>
  </channel>
</rss>