<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:wfw="http://wellformedweb.org/CommentAPI/" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:sy="http://purl.org/rss/1.0/modules/syndication/" xmlns:slash="http://purl.org/rss/1.0/modules/slash/">
  <channel>
    <language>ru</language>
    <title>Big Data</title>
    <description>Рубрика, посвященная тому, что такое Big Data, инструментам для работы с большими данными и тому, как применить эту сферу IT на практике.</description>
    <link>https://tproger.ru/tag/big-data</link>
    <atom:link href="https://tproger.ru/tag/big-data/feed" rel="self" type="application/rss+xml"/>
    <lastBuildDate>Mon, 28 Sep 2026 09:50:09 GMT</lastBuildDate>
    <sy:updatePeriod>hourly</sy:updatePeriod>
    <sy:updateFrequency>12</sy:updateFrequency>
    <image>
      <title>Big Data</title>
      <link>https://tproger.ru</link>
      <url>https://tproger.ru/apple-touch-icon.png</url>
    </image>
    <item>
      <title>Эволюция архитектуры страниц данных в СУБД: от NSM до FastLanes</title>
      <link>https://tproger.ru/articles/evolyuciya-arhitektury-stranic-dannyh-v-subd-ot-nsm-do-fastlanes</link>
      <comments>https://tproger.ru/articles/evolyuciya-arhitektury-stranic-dannyh-v-subd-ot-nsm-do-fastlanes?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Виталий При]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/evolyuciya-arhitektury-stranic-dannyh-v-subd-ot-nsm-do-fastlanes</guid>
      <description><![CDATA[<p>Эволюция файлов данных в СУБД. Хотя NSM уже больше 15 лет, это архитектура продолжает использоваться ведущими  СУБД. Рассмотрим какие задачи решает модель PAX и ее оптимизированный вариант FastLanes.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/evolyuciya-arhitektury-stranic-dannyh-v-subd-ot-nsm-do-fastlanes">Эволюция архитектуры страниц данных в СУБД: от NSM до FastLanes</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[SQL]]></category>
      <category><![CDATA[Базы данных]]></category>
      <category><![CDATA[PostgreSQL]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 10 Sep 2026 17:27:01 GMT</pubDate>
      <content:encoded><![CDATA[<p>Когда вы пишете SELECT * FROM users WHERE age &gt; 30, вы
редко задумываетесь о том, как именно СУБД физически хранит эти данные на
диске. А между тем, от архитектуры страницы данных зависит, сколько лишних байт
будет прочитано, насколько эффективно используется кэш
процессора, и во что обойдутся обновления и удаления. В этой статье разберём
три классические модели — NSM, DSM и PAX, а также заглянем в будущее — формат
FastLanes, созданный специально под SIMD и GPU.<b></b></p><h3>1. Классика всех времен: страница NSM</h3><p>Традиционная и самая распространённая архитектура
в OLTP-СУБД (PostgreSQL, Oracle) — слотированная страница,
относящаяся к семейству NSM (N-ary Storage Model). Страница, как правило, имеет
фиксированный размер, чаще всего 8 или 16 КБ (может настраиваться параметром
БД), и делится на три логические области:</p><p>·      
<b>Заголовок страницы</b> — содержит
метаданные: размер страницы, количество слотов, смещение до свободного
пространства и флаги.</p><p>·      
<b>Таблица слотов</b> — массив записей
фиксированной длины, каждая из которых хранит смещение (offset) до начала
соответствующей строки. Слоты упорядочены по позиции строки в таблице.</p><p>·      
<b>Область данных</b> — сами кортежи,
расположенные последовательно, но в обратном порядке относительно таблицы
слотов (данные растут с конца страницы в начало, а слоты — с начала в конец).
Это позволяет эффективно управлять фрагментацией.</p><p><br /></p><figure><img src="https://media.tproger.ru/user-uploads/140096/2026-09-10/393863ea-b164-4e8d-8cdd-1ed31ffbac59.webp" alt="Пример таблицы" /><figcaption>1.1 Пример таблицы</figcaption></figure><figure><img src="https://media.tproger.ru/user-uploads/140096/2026-09-10/1523098a-dbbb-469e-a550-f3d7f8e23ee2.webp" alt="Пример файла данных для таблицы" /><figcaption>Рисунок 1.1 – Пример файла данных для таблицы</figcaption></figure><p><br /></p><h4>Особенности
работы с изменениями на уровне страницы:</h4><p>При обновлении строки, если её новый размер превышает старый,
на старом месте сохраняется указатель (forwarding pointer), а обновлённая
запись перемещается в свободную область страницы (или даже на другую страницу,
если свободного места недостаточно). Это порождает цепочки переадресации,
которые могут замедлять чтение.</p><p>При удалении строки соответствующий слот помечается как
недействительный (например, устанавливается флаг deleted или смещение
становится отрицательным). Физическое освобождение места происходит позже — при
сборке мусора (VACUUM в PostgreSQL) или при перестройке страницы.</p><h4>Главный недостаток:</h4><p>Для запросов, которые читают миллионы строк, но выбирают лишь 2–3 атрибута из 20, NSM необходимо просканировать всю страницу целиком. В результате в кэш CPU загружаются все атрибуты, включая ненужные. Это не только увеличивает время I/O, но и порождает промахи кэша (cache misses), поскольку полезные данные перемешиваются с не нужными.</p><h3>2. Колоночная страница DSM:</h3><p>Научная работа Джорджа П. Коупленда и Сетрага Н. Хошафяна «A
Decomposition Storage Model» (ACM SIGMOD) [1] предложила кардинально иной
подход к организации данных на странице, получивший название DSM (Decomposition
Storage Model).</p><p>В классической реализации DSM каждый атрибут таблицы хранится в
отдельном наборе страниц. При этом страницы внутри одного атрибута содержат
только значения этого столбца, расположенные в порядке строк. Для
восстановления полной записи используется либо позиционный идентификатор
(порядковый номер строки в странице), либо служебные битовые маски.</p><h4>Преимущества на уровне страниц:</h4><p>·      
Страница заполняется данными одного типа — это
даёт значительный прирост в сжатии (RLE, дельта-кодирование, битовые карты) по
сравнению с NSM-архитектурой.</p><p>·      
При сканировании одного-двух столбцов читается
ровно столько страниц, сколько нужно для этих атрибутов, без загрузки не используемых в запросе колонок.</p><h4>Обратная сторона:</h4><p>Вставка или обновление строки требуют записи в страницы всех
атрибутов, что превращается в доступ к множеству файлов и их соединение.
Запрос SELECT * для ограниченного числа строк также вынужден
выполнять дорогостоящее соединение страниц разных столбцов, что делает DSM
неэффективной для OLTP.</p><p>Первоначально модель не получила широкого распространения
именно из-за высокой стоимости сборки строк. Однако с ростом мощностей
процессоров и объёмов оперативной памяти она стала основой для колоночных СУБД
(Vertica, Greenplum, ClickHouse), где основная нагрузка — аналитические
запросы.</p><figure><img src="https://media.tproger.ru/user-uploads/140096/2026-09-10/31e86521-072e-4d3b-9983-21312d34a61b.webp" alt="Пример файла DSM" /><figcaption>Рисунок 2.1 – Пример файла DSM</figcaption></figure><p><br /></p><h3>3. PAX: гибридная модель данных</h3><p>В 2001 году на конференции VLDB была представлена работа
Анастасии Аламаки, Дэвида ДеВитта, Марка Хилла и Муниратнама Сивакумара
«Weaving Relations for Cache Performance» [2], в которой авторы предложили
комбинированный подход — PAX (Partition Attributes Crosswise).</p><h4>Ключевая идея модели:</h4><p>Страница остаётся целостной (содержит все атрибуты таблицы, как в
NSM), что позволяет избавиться от дорогостоящих соединений файлов данных. Но
внутри страницы данные разбиты по атрибутам: все значения первого атрибута
собираются в непрерывный мини-блок. Следом идёт мини-блок второго атрибута,
затем третьего, и так далее. В начале страницы располагается каталог
(directory), указывающий смещение и размер каждого мини-блока.</p><h4>Как происходит выборка данных:</h4><p>Для запроса, выбирающего два столбца, СУБД обращается к странице и читает только те два мини-блока — остальные не попадают в кэш
процессора, что снижает количество промахов.</p><p>Обновление
всей строки не требует записи в отдельные файлы (как в DSM) — достаточно
перезаписать соответствующие мини-блоки внутри одной страницы.</p><figure><img src="https://media.tproger.ru/user-uploads/140096/2026-09-10/09a94b94-0c05-469a-84ee-ff350607bddb.webp" alt="Схема страницы PAX" /><figcaption>Рисунок 3.1 – Схема страницы PAX</figcaption></figure><p><br /></p><h3>4. Современные реализации на основе PAX</h3><h4>Apache Parquet</h4><p>Прямой наследник PAX. Файл разбивается на Row Groups (группы строк,
типично 128 МБ – 1 ГБ), каждая из которых действует как крупная «страница» PAX.
Внутри Row Group данные организованы по Column Chunks — это и есть мини-блоки
разных атрибутов, только теперь они могут быть сжаты независимо друг от друга.
Parquet также добавляет индексы и статистику на уровне Column Chunk (min, max,
null count), что позволяет при сканировании пропускать целые блоки без
разжатия.</p><h4>Apache ORC (Optimized Row Columnar)</h4><p>Аналог Parquet, используемый в Hive, Presto и Trino. Внутри
ORC-файла выделяются Stripes (полосы), которые выполняют ту же роль, что и Row
Groups в Parquet. Внутри Stripe данные хранятся по колонкам с добавлением
индексов и словарей. По сути, это тоже PAX, но с более агрессивным сжатием и
встроенной фильтрацией.</p><h3>5. FastLanes — PAX, оптимизированный под SIMD и GPU</h3><p>PAX-архитектура значительно улучшила предыдущие модели
хранения данных, но она не учитывала характеристики процессора. Именно в этом
направлении происходит дальнейшее развитие архитектуры хранения данных. Петер
Бонч, учёный из исследовательского центра CWI (Нидерланды), предложил новый
формат FastLanes, который оптимизирует хранение данных под возможности
современных процессоров.</p><p>Файл FastLanes состоит из двух главных компонентов: Footer
(футер) и Data (данные). Футер содержит метаданные, описание данных и их
местонахождение в файле и может храниться отдельно от блока «Данные».</p><p>На верхнем уровне блок «Данные» повторяет архитектуру PAX:
данные делятся на группы строк и атрибуты. В отличие от существующих типов
файлов, в FastLanes группы строк содержат количество записей, кратное 1024. Это
позволяет избежать материализации данных в основной памяти и выполнять всю
работу на уровне процессора. Следующим важным нововведением является
использование сжатия LWC (Light-Weight-Compression).
Вместо тяжеловесных алгоритмов по типу Zstd, которые не позволяют
распараллелить обработку данных, применяются FSST, DICT, ALP при каскадном
(рекурсивном) применении которых достигается уровень сжатия Snappy за более
короткий промежуток времени [3]. Кроме этого, для каждой колонки данных могут
применяться разные операторы кодирования. Сжатые данные хранятся в сегментах, в
которых кроме самих данных хранятся смещения на отдельные вектора, что
позволяет читать данные на уровне одного вектора вместо целого блока, как в
старых форматах.</p><p>Когда данные читаются из
оперативной памяти в процессор, закодированный вектор, содержащий 1024
значения, разжимается и полностью помещается в кэш процессора. Напротив, старые
форматы файлов не только используют непараллельные алгоритмы сжатия, но и применяют
их к целым Row Group, что влечёт за собой использование основной памяти и
уменьшение скорости обработки [3].</p><figure><img src="https://media.tproger.ru/user-uploads/140096/2026-09-10/38442764-e882-48bd-abc8-e2389e2fbf91.webp" alt="Пример таблицы[3]" /><figcaption>Рисунок 5.1 – Пример таблицы[3]</figcaption></figure><p><br /></p><figure><img src="https://media.tproger.ru/user-uploads/140096/2026-09-10/53f16e51-def6-48b1-b0a6-3282b28622d7.webp" alt="Файл FastLane[3]" /><figcaption>Рисунок 5.2 – Файл FastLane[3]</figcaption></figure><p><br /></p><figure><img src="https://media.tproger.ru/user-uploads/140096/2026-09-10/b9a51ae2-6319-490c-bd67-4028b1b35e49.webp" alt="Футер файла FastLane[3]" /><figcaption>Рисунок 5.3 – Футер файла FastLane[3]</figcaption></figure><p><br /></p><figure><img src="https://media.tproger.ru/user-uploads/140096/2026-09-10/e52e3ea5-17fa-44d2-bc85-2f418e39150e.webp" alt="Операторы кодирования FastLane[3]" /><figcaption>Рисунок 5.4 – Операторы кодирования FastLane[3]</figcaption></figure><p><br /></p><h4>Использованные источники:</h4><ol><li>Copeland G.P., Khoshafian
     S.N. A Decomposition Storage Model. Proceedings of ACM
     SIGMOD, 1985.</li><li>Ailamaki A., DeWitt D., Hill
     M., Sivakumar M. Weaving Relations for Cache Performance. Proceedings
     of VLDB, 2001.</li><li>Boncz P., Afroozech A., et
     al. The FastLanes File Format: specification.</li></ol>]]></content:encoded>
    </item>
    <item>
      <title>Адресное хранение в гипермаркетах: SAP, Big Data и backend приложения в одной системе</title>
      <link>https://tproger.ru/articles/adresnoe-hranenie-v-gipermarketah-sap-big-data-i-backend-prilo</link>
      <comments>https://tproger.ru/articles/adresnoe-hranenie-v-gipermarketah-sap-big-data-i-backend-prilo?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Алла Антонова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/adresnoe-hranenie-v-gipermarketah-sap-big-data-i-backend-prilo</guid>
      <description><![CDATA[<p>Как гипермаркет с помощью Big Data и backend мобильного приложения определяет, где лежит товар и когда его донести до полки. Три слоя архитектуры, четыре типа автозадач и цена ошибки в данных.
</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/adresnoe-hranenie-v-gipermarketah-sap-big-data-i-backend-prilo">Адресное хранение в гипермаркетах: SAP, Big Data и backend приложения в одной системе</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Сервисы]]></category>
      <category><![CDATA[Приложение]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 09 Jul 2026 09:58:01 GMT</pubDate>
      <content:encoded><![CDATA[<p>В ретейл-проектах масштаба гипермаркета удобное приложение на ТСД — это верхушка айсберга. За экраном, на котором сотрудник видит задачу «пополни полку», стоят три слоя архитектуры, потоки данных между SAP и Data Lake и пять команд, которым нужно не только писать код, но и договариваться друг с другом.</p><p>В статье расскажу, о том, как устроена эта система изнутри, какие компромиссы пришлось принять и почему координация команд оказалась не легче самой разработки.</p><p>Я работаю в ретейле больше двадцати лет, и за это время успела убедиться: самые дорогие проблемы в магазине — не технические, а операционные. Товар лежит на складе, но не на полке. Покупатель уходит, продажа теряется. Мы с командой Lenta tech (ИТ-бренд «Группы Лента») решили, что пора выстроить платформу, которая сама определяет, какой товар донести до полки, из какой палеты и в каком порядке. Проектную группу собрали из сотрудников разных подразделений: Big Data, SAP, мобильная разработка, онлайн и операционный бизнес. Именно то, что за одним столом сидели инженеры, аналитики и люди, которые каждый день работают в торговом зале, позволило учесть все аспекты — от архитектуры до количества кликов на экране ТСД.</p><h2>Почему классические процессы перестали масштабироваться</h2><p>Гипермаркет — это не магазин у дома. Это десятки тысяч товарных позиций (SKU), сотни палет ежедневно и непрерывный поток перемещений между складскими зонами, верхними стеллажами и торговым залом. Ручной поиск товара, бумажные описи на палетах, выкладка «на глаз» — все это работало до определенного момента. Но при масштабах крупной сети процесс перестал справляться.</p><p>Главная проблема была не в хранении данных, а в принятии решений. Система понимала, что товар находится в магазине, но не знала, где именно, и выложен ли он на полку. А если не знала — не могла сформировать задачу. Все держалось на памяти и инициативе конкретных сотрудников.</p><h2>Три слоя архитектуры: что оставили, а что написали с нуля</h2><p>Архитектурно решение выстроили вокруг трех слоев: система планирования ресурсов предприятия (ERP) на базе SAP, слой больших данных (Big Data) и серверная часть мобильного приложения (backend), написанная с нуля.</p><p>SAP уже содержал информацию о запасах товаров. Для адресного хранения команда задействовала уже готовый механизм ячеечного размещения из модуля складской логистики SAP. Перестраивать эту часть не было смысла — она работала стабильно и закрывала задачу учета мест хранения.</p><p>Слой Big Data взял на себя аналитику и генерацию задач. Здесь лежит основной объем логики: обработка прогнозов, анализ расхождений между запасом и фактическими продажами, формирование потребностей к пополнению полки. Данные содержатся и обрабатываются в корпоративном хранилище (Data Lake), откуда потребности уходят дальше — в backend приложения.</p><p>Backend мобильного приложения — новый компонент, созданный специально для проекта. Команда мобильной разработки отвечала за этот слой с нуля: он получает от Big Data потребности к пополнению, формирует задания для сотрудников, обрабатывает операции изъятия товара из палет и передает информацию о местах хранения обратно в SAP. Помимо этого, backend взаимодействует с системой онлайн-заказов (PDA PickerApp): когда сборщик не находит товар на полке, событие поступает в backend и тоже превращается в задание.</p><p>Для директоров магазинов и руководителей секций предусмотрен веб-интерфейс (Web UI), где визуализируются списки задач, отчетность и статистика. Сотрудники торгового зала работают через мобильное приложение «Адресное хранение» на ТСД или смартфоне, где могут фильтровать задания, выполнять сверку ценников и управлять палетами.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-07-09/bf54b638-1e1f-4045-b1b9-01a3f83d7d0a.webp" alt="" /></figure><h2>Почему legacy не стало препятствием</h2><p>В крупных ретейл-проектах legacy-системы воспринимаются как неизбежное зло, с которым нужно «бороться». Наши архитекторы пошли другим путем: не боролись, а использовали legacy там, где это было эффективнее.</p><p>Решение о том, что оставить на существующих системах, а что вынести в новые сервисы, команда принимала прагматично. SAP отлично справлялся с учетом запасов и ячеечным хранением — зачем его дублировать? А вот логику формирования задач, приоритизацию, аналитику и мобильный интерфейс строили с нуля, потому что здесь нужны были скорость разработки и гибкость, которые legacy-контур дать не мог.</p><p>Аналогичный подход сформировали к интеграционным инструментам: на каждом стыке выбирали то решение, которое лучше всего справлялось с конкретным потоком данных. Никакой догматики — только инженерная целесообразность.</p><h2>Логика задач: прогнозы, приоритеты и пересечения списков</h2><p>Ключевая логика системы сосредоточена в механизме формирования задач. Эту часть взяла на себя команда Big Data. Нельзя проверить весь ассортимент — ресурс сотрудника ограничен. Поэтому система выдает только наиболее приоритетные задания, и логика их отбора довольно сложная. В продакшне работают несколько видов автоматических задач:</p><ul><li>Событие «нулевого пика» (zero pick). Сборщик онлайн-заказа не нашел товар на полке и ставит отметку в PickerApp. Система проверяет остаток: если он ненулевой, рассчитывает количество к выкладке и создает задание. Это самый «чистый» сигнал — живой человек уже подтвердил, что товара на месте нет.</li><li>Пустая полка. Раз в час Big Data сверяет остатки на основном складе магазина с запасом в палетах. Если эти цифры совпадают, значит, весь товар лежит в палетах — на полке ноль. Генерируется задача.</li><li>Недостаточный запас. Товар на полке есть, но система сопоставляет текущий остаток с прогнозом продаж. Если остатка не хватает для покрытия спроса, формируется задание на пополнение. Здесь важно, что задача возникает не по факту «полка пуста», а на опережение.</li><li>Товары без продаж. Если по позиции в течение недели не было ни одной продажи, система берет товары с наибольшим объемом запаса для каждой секции и собирает из них перечень задач на неделю. Если по позиции уже была отработка — повторно она не добавляется. Логика здесь в том, что большой запас без движения — потенциальный симптом невыложенного товара.</li></ul><p>Помимо автоматики, руководящий персонал может создать задачу вручную через Web UI.</p><p>Внутри каждого типа работает приоритизация. У нас есть перечни товаров — топы по продажам, топы по маржинальности. Алгоритм берет пересечение этих списков и на их основе определяет, какие позиции требуют внимания в первую очередь. Вычисление пересечений и ранжирование — одна из самых нетривиальных задач с точки зрения логики обработки данных.</p><h2>«Каждый лишний клик стоит денег»</h2><p>В крупных корпоративных проектах продуктовое мышление часто отходит на второй план; важнее интеграция, масштабирование, стабильность. Но в нашем случае пользователь — сотрудник торгового зала, и каждое лишнее действие в интерфейсе при тысячах операций в день превращается в колоссальные временные затраты.</p><p>Поэтому каждый клик в приложении проектная команда оценивала с позиции «что он дает» против «сколько стоит». Пример такого компромисса: когда сотрудник вытаскивает товар из палеты и фиксирует изъятие в системе, считается, что он донес продукцию до полки. Долгое время обсуждали, нужно ли дополнительное подтверждение выкладки — отдельное сканирование. Отказались: вероятность, что человек достал товар и не донес его до места, минимальна. А еще один клик на каждой позиции — это реальные часы, потерянные на масштабе сети.</p><p>Аналогичным образом команды балансировали между точностью данных и скоростью работы во всех сценариях: объединение палет, частичная разборка, перемещение. Адресное хранение — это полноценный инструмент управления палетами в магазине, а не просто учет ячеек.</p><h2>Пять команд и одна зона неопределенности</h2><p>Как я уже говорила, проектная группа была собрана из пяти подразделений: Big Data, SAP, мобильная разработка, команда онлайна и операционный бизнес. Каждое было опытным, каждое умело работать по своим задачам. Проблема проявилась на стыках.</p><p>Когда в продакшн-среде возникала ошибка, далеко не всегда было очевидно, какое именно подразделение ее допустило. Данные проходят через несколько слоев: Big Data сформировала потребность, backend ее получил, мобильное приложение отобразило задачу, SAP отдал информацию о палетах. Если задание некорректно, нужно пройти всю цепочку и определить, где произошел сбой. Разграничение зон ответственности и процедура разбора инцидентов — то, на что было заложено недостаточно времени на старте. Притирка заняла ощутимый ресурс, хотя ни одна из команд не была новичком.</p><p>Синхронизация изменений тоже требовала внимания: когда Big Data меняет логику формирования задач, backend должен корректно обработать новую схему, а мобильное приложение — отобразить результат. Каскадные доработки ускоряли одно звено и ломали соседнее. Со временем процесс выстроился, но в ретроспективе — это одна из главных недооцененных статей расхода по срокам.</p><h2>Лавина ложных задач и контроль качества данных</h2><p>Проект работал уже почти год, и серьезных инцидентов не случалось. Затем произошел сбой: из-за ошибки в одном из потоков данных массово сформировались ложные задания на пополнение. Магазины получили лавину задач, сотрудники приходили к полкам и обнаруживали, что товар на месте.</p><p>Технически разовая ошибка, но ее воздействие оказалось непропорционально масштабным. Магазины, которые до этого выстраивали доверие к платформе, моментально откатились к скепсису: зачем выполнять задания, если они могут быть ложными?</p><p>После этого инцидента команда Big Data совместно с мобильной разработкой и операционным бизнесом выстроила отдельный контур контроля качества данных. На входе проверяется полнота: сколько записей ожидалось и сколько поступило. Результаты сопоставляются со среднестатистическими значениями по магазину. Если фиксируется аномалия — превышение порога отклонений, — конвейер задач останавливается до ручного разбора. Дополнительно внедрили мониторинг потоков: трекинг задержек, разрывов и нестыковок между слоями. Цель — свести вероятность повторения подобного сценария к нулю, а не просто реагировать постфактум.</p><figure><img src="https://media.tproger.ru/user-uploads/99854/2026-07-09/1b05f2e3-5c07-4c34-bcb7-bda23dd9e064.webp" alt="" /></figure><h2>Волны, feedback loops и продукт, который менялся на ходу</h2><p>Внедрение разделили на пять волн, и это было осознанным инженерно-процессным решением, а не просто осторожностью.</p><p>Первая волна — пилотные магазины, директора которых вошли в рабочую группу. Они не просто тестировали продукт, а участвовали в согласовании технического задания, экранных форм и пользовательских сценариев. Обратная связь приходила быстро, и решение дорабатывалось уже в процессе раскатки.</p><p>Циклы обратной связи (feedback loops) работали следующим образом: магазин фиксирует проблему, операционная служба передает ее в проектную команду, разработка вносит изменение, следующая волна получает обновленную версию. Между этими этапами проводится анализ метрик дисциплины и качества отработки задач. Если магазины первой волны показывали низкие результаты, разбирались: проблема в инструменте или в процессе?</p><p>Обучение тоже выстраивалось итерационно. Изначально подготовили короткие видеоролики, объясняющие конкретные операции — как разметить палету, как зафиксировать изъятие, как работать со списком задач. По результатам внутреннего опроса удовлетворенности этот формат получил высокую оценку.</p><p>Важно отметить: два крупных проекта, требующих перестройки операционных процессов, невозможно вести на одном магазине одновременно. Команда столкнулась с этим ограничением и была вынуждена пропускать вперед параллельные инициативы, которые шли по графику. Это добавило к срокам проекта — вместо запланированных 12 месяцев реализация заняла 17.</p><h2>Что показал проект</h2><p>Дополнительная прибыль за 2025 год превысила целевые показатели на 7%. Но, помимо финансовых результатов, проектная группа вынесла несколько важных инженерных и процессных выводов.</p><p>Большие ретейл-технологические проекты — это всегда про процессы, а не только про код. Можно написать идеальный backend, но если магазин не размечает палеты, система бесполезна.</p><p>Качество данных — фундамент, а не надстройка. Контроль нужно закладывать с первого дня, а не встраивать после первого крупного инцидента.</p><p>Архитектура должна учитывать реальную работу людей. Каждый лишний клик — это деньги, и инженерное решение обязано проходить через фильтр продуктового мышления.</p><p>И наконец: метрики эффективности нужно проектировать заранее. Проектная команда начала разрабатывать инструменты замера дисциплины уже в процессе внедрения и потратила на это дополнительное время. Без них невозможно отличить ситуацию «гипотеза не работает» от ситуации «магазин не выполняет то, что должен». Именно кроссфункциональный состав команды — инженеры, аналитики данных и операционный бизнес за одним столом — позволил в итоге выстроить эти метрики так, чтобы они отвечали на вопросы каждой из сторон.</p>]]></content:encoded>
    </item>
    <item>
      <title>Сбер заменил ИИ до 25% разработчиков — от джунов до лидов</title>
      <link>https://tproger.ru/news/sber-zamenil-ii-do-25--razrabotchikov---ot-dzhunov-do-lidov</link>
      <comments>https://tproger.ru/news/sber-zamenil-ii-do-25--razrabotchikov---ot-dzhunov-do-lidov?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Булат Яббаров]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/sber-zamenil-ii-do-25--razrabotchikov---ot-dzhunov-do-lidov</guid>
      <description><![CDATA[<p>Сбер заменил ИИ до 25% IT-команды: тысячи разработчиков и тестировщиков уволены под видом «оптимизации», банк говорит об автоматизации</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/sber-zamenil-ii-do-25--razrabotchikov---ot-dzhunov-do-lidov">Сбер заменил ИИ до 25% разработчиков — от джунов до лидов</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[HR]]></category>
      <category><![CDATA[Сбер]]></category>
      <category><![CDATA[Тимлид]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 10 Oct 2025 09:32:36 GMT</pubDate>
      <content:encoded><![CDATA[<p>В Сбербанке проходит самая масштабная за последние годы <b>волна сокращений IT-специалистов</b>.</p><p>Под «оптимизацию» попали разработчики, аналитики, тестировщики и инженеры — от новичков до тимлидов. По данным <a href="https://www.cnews.ru/news/top/2025-10-07_sber_sokrashchaet_it-spetsialistov">источников</a> CNews и профсоюза работников IT, под сокращение может попасть <b>до 25% IT-команды</b>, то есть более <b>5000 человек</b>.</p><p>Официально увольнения объясняют <b>внедрением искусственного интеллекта</b> и автоматизацией процессов:</p><blockquote>Топ-менеджеры называют это оптимизацией, а не сокращением.</blockquote><p>При этом, по словам работников, реального эффекта от внедрения ИИ нет:</p><blockquote>На деле — гонка ради отчетности, а не улучшений.</blockquote><h2>Три волны и «мягкие» увольнения</h2><p>По информации профсоюза, запланированы <b>три волны</b> сокращений: первая прошла летом, вторая идет сейчас, третья ожидается к концу года.</p><p>Некоторым сотрудникам предлагают уйти «по соглашению сторон» с выплатой <b>двух-трех окладов</b> и сохранением годовой премии.</p><p>Тем, кто отказывается, могут предложить перевод в дочерние структуры — но, как утверждают источники, эти собеседования чаще всего заканчиваются отказом.</p><h2>Позиция банка</h2><p>В Сбербанке отрицают наличие массовых увольнений. «Мы не сокращаем команду, а пересматриваем функции и автоматизируем процессы», — заявили в пресс-службе.</p><p>По данным банка, сейчас открыто <b>около 4000 вакансий</b>, преимущественно в сфере ИИ и автоматизации.</p><h2>Последствия для рынка</h2><p>Эксперты предупреждают: волна увольнений может <b>существенно ударить по IT-рынку</b>. Уже сейчас средний разработчик получает меньше приглашений на собеседования, а конкуренция растет.</p><p>По словам аналитиков, крупные корпорации переходят от найма «на вырост» к <b>осознанной автоматизации</b>. Однако спрос на специалистов по ИИ, Big Data и кибербезопасности при этом продолжает расти.</p>]]></content:encoded>
    </item>
    <item>
      <title>Южная Корея может навсегда потерять 858 ТБ государственных данных после пожара в дата-центре</title>
      <link>https://tproger.ru/news/yuzhnaya-koreya-mozhet-navsegda-poteryat-858-tb-gosudarstvennyh-dannyh-posle-pozhara-v-data-centre</link>
      <comments>https://tproger.ru/news/yuzhnaya-koreya-mozhet-navsegda-poteryat-858-tb-gosudarstvennyh-dannyh-posle-pozhara-v-data-centre?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Даровская Маша]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/yuzhnaya-koreya-mozhet-navsegda-poteryat-858-tb-gosudarstvennyh-dannyh-posle-pozhara-v-data-centre</guid>
      <description><![CDATA[<p>В результате пожара в государственном дата-центре NIRS в Южной Корее уничтожено до 858 ТБ данных, включая хранилище G-Drive без резервной копии. Четыре человека арестованы, восстановление сетей идёт медленно.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/yuzhnaya-koreya-mozhet-navsegda-poteryat-858-tb-gosudarstvennyh-dannyh-posle-pozhara-v-data-centre">Южная Корея может навсегда потерять 858 ТБ государственных данных после пожара в дата-центре</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Дата-центр]]></category>
      <category><![CDATA[Инфраструктура]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 08 Oct 2025 08:17:20 GMT</pubDate>
      <content:encoded><![CDATA[<p>Южнокорейское правительство <a href="https://www.datacenterdynamics.com/en/news/858tb-of-government-data-may-be-lost-for-good-after-south-korea-data-center-fire/">сообщило</a> о возможной утрате 858 терабайт критически важных данных после пожара в государственном дата-центре National Information Resources Service (NIRS) в городе Тэджон.</p><p>Пожар произошёл 26 сентября 2025 года и, по данным издания DCD, был вызван возгоранием аккумуляторных <a href="https://www.datacenterdynamics.com/en/news/battery-fire-at-south-koreas-state-data-center-brings-government-services-offline/">батарей</a>. Инцидент парализовал работу ряда государственных ведомств, включая цифровые сервисы, кадровые системы и хранилища документов.</p><h2>Уничтожен сервер G-Drive — без резервной копии</h2><p>Наиболее серьёзной потерей может стать гибель правительственного G-Drive — внутреннего облачного сервиса хранения документов, который использовался всеми госслужащими.</p><p>«Система G-Drive не имела резервного копирования из-за колоссального объёма данных», — сообщил источник из правительства в интервью <a href="https://www.chosun.com/english/national-en/2025/10/02/FPWGFSXMLNCFPIEGWKZF3BOQ3M/">The Chosun</a>.</p><p>«Остальные 95 систем имели резервные копии — онлайн или офлайн, но этот диск был уязвим».</p><p>Всего, по официальным данным, в огне были полностью уничтожены 96 систем.</p><h2>Правительственные службы — фактически в стоп-режиме</h2><p>По информации Министерства управления персоналом, многие отделы не могут выполнять ежедневные операции:</p><p>«Сотрудники хранили все рабочие материалы на G-Drive. Сейчас работа практически остановлена».</p><p>На момент 5 октября восстановлено 115 из 647 сетей, что составляет лишь 17,8%.</p><p>Полное восстановление инфраструктуры может занять <a href="https://www.datacenterdynamics.com/en/news/south-korea-data-center-fire-government-services-could-be-offline-for-a-month/">до одного месяца.</a></p><p>Правительство планирует временно развернуть альтернативные сервисы для критически важных ведомств, но эксперты уже называют этот инцидент самой масштабной цифровой катастрофой в истории корейского госсектора.</p><p>Полиция Южной Кореи <a href="https://www.datacenterdynamics.com/en/news/four-arrests-over-south-korea-data-center-fire/">арестовала</a> четырёх человек, предположительно связанных с профессиональной халатностью, которая могла привести к возгоранию.</p><p>Расследование продолжается, в том числе изучаются условия хранения аккумуляторов и системы пожаротушения.</p><h2>Трагедия на фоне восстановления</h2><p>Как <a href="https://www.donga.com/en/article/all/20251004/5885938/1">сообщает</a> The Dong-A Ilbo, 3 октября трагически погиб 56-летний сотрудник Министерства цифровых инноваций, курировавший восстановление сетей NIRS.</p><p>Мужчину нашли в состоянии остановки сердца у здания правительства в Седжонге; по предварительным данным, он покончил с собой.</p><p>Министерство внутренних дел и безопасности уточнило, что погибший не участвовал в уголовном расследовании, однако проверяется версия переутомления и профессионального выгорания.</p>]]></content:encoded>
    </item>
    <item>
      <title>Многофакторное сравнение пяти популярных вычислительных движков для больших данных</title>
      <link>https://tproger.ru/articles/mnogofaktornoe-sravnenie-pyati-populyarnyh-vychislitelnyh-dvizhkov-dlya-bolwih-dannyh</link>
      <comments>https://tproger.ru/articles/mnogofaktornoe-sravnenie-pyati-populyarnyh-vychislitelnyh-dvizhkov-dlya-bolwih-dannyh?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[StarRocks]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/mnogofaktornoe-sravnenie-pyati-populyarnyh-vychislitelnyh-dvizhkov-dlya-bolwih-dannyh</guid>
      <description><![CDATA[<p>Эволюция от Hadoop к cloud‑native и ИИ‑архитектурам. Многомерное сравнение Spark, Presto, Trino, ClickHouse и StarRocks по скорости, масштабируемости, кэшам, SQL/Python, HA и др.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/mnogofaktornoe-sravnenie-pyati-populyarnyh-vychislitelnyh-dvizhkov-dlya-bolwih-dannyh">Многофакторное сравнение пяти популярных вычислительных движков для больших данных</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[SQL]]></category>
      <category><![CDATA[Базы данных]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 20 Aug 2025 14:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Скорость итераций в области Big Data вновь вернулась к стремительному темпу 2015–2016 годов. Область анализа данных — самая близкая к бизнесу, часто используемая и ценная, с жёсткими требованиями к стоимости и эффективности.</p><p>Разработчики на передовой всё реже запускают новые сервисы на «тяжёлой в эксплуатации» связке сервисов Hadoop и предпочитают формат «всё в одном» — унифицированный подход, объединяющий хранение и аналитику. Если раньше архитектуру больших данных приходилось «собирать из кубиков», то теперь она всё чаще становится более монолитной архитектурой (all‑in‑one).</p><p>Кроме того, с быстрым развитием ИИ изменились и объёмы, и типы данных, поэтому на стороне вычислительных движков были проведены соответствующие оптимизации и обновления: например, для OLAP‑аналитики векторизация де‑факто стала стандартной возможностью, а форматы озёр данных эволюционируют к поддержке мультимодальности (о мультимодальном хранении — ниже).</p><p>В этой статье разберём архитектуры популярных сегодня распределённых вычислительных движков и их плюсы/минусы. Проанализировав их, мы лучше поймём, какой движок уместнее использовать в тех или иных бизнес‑сценариях.</p><p>Реализации распределённых вычислительных движков обычно состоят из компонентов «Server» и «Worker». Узлы Worker, как правило, распределяются по множеству хостов и под координацией Server выполняют параллельные вычисления. Хотя логика вычислений и оптимизации у разных движков реализована по‑разному, базовые этапы похожи.</p><figure><img src="https://media.tproger.ru/user-uploads/116700/2025-08-15/587b10ca-1dff-4464-86df-9ee5f0956735.png" alt="" /></figure><h2>Базовые этапы выполнения запроса</h2><ol><li>Parsing — разбор: SQL‑запрос разбирается в синтаксическое дерево для валидации структуры и выявления задействованных таблиц.</li><li>Planning — планирование: формируется логический план, описывающий необходимые операции (например, фильтры, соединения) и их порядок.</li><li>Optimization — оптимизация: логический план преобразуется в эффективный физический план с помощью стоимостной (CBO) или правил‑ориентированной оптимизации.</li><li>Compilation — компиляция: физический план компилируется в низкоуровневые операции, байт‑код или аппаратно‑специфичные инструкции, подготавливаясь к исполнению.</li><li>Execution — исполнение: план распределяется узлам Worker, которые параллельно сканируют данные, применяют преобразования и обмениваются данными; промежуточные данные/метаданные возвращаются в главный процесс.</li><li>Result Serving — формирование и отдача результатов: результаты агрегируются, форматируются и возвращаются пользователю или нижестоящим системам (downstream).</li></ol><h2>Классификация движков по назначению</h2><ul><li>Универсальные вычислительные движки: например, Spark, Flink, MR (MapReduce), поддерживающие пакетные и сложные вычислительные задачи, различные типы данных и множество источников.</li><li>Интерактивные движки запросов: например, Presto, Trino — для ad hoc‑запросов, где важно быстро получать результаты и применять оптимизации, обеспечивая высокую скорость выполнения и интерактивность анализа.</li><li>OLAP‑движки: например, ClickHouse, StarRocks, Doris и др. — для быстрого анализа постоянно меняющихся данных. Поддерживают аналитику в реальном времени, субсекундную латентность запросов и серьёзные оптимизации в оптимизаторе выполнения.</li></ul><h3>Универсальные вычислительные движки</h3><p>Среди универсальных движков наиболее широко используется Apache Spark: он поддерживает офлайн‑вычисления, обработку, близкую к реальному времени (near real time), и интеграцию с фреймворками машинного обучения. Spark изначально создавался для преодоления ограничений Hadoop MapReduce. Spark Driver — центральный координатор Spark‑приложения: он управляет использованием CPU и памяти, широковещательными переменными (broadcast variables, для эффективного совместного использования данных между узлами Worker) и создаёт наборы данных RDD.</p><p>Ниже — схема архитектуры Apache Spark.</p><figure><img src="https://media.tproger.ru/user-uploads/116700/2025-08-15/108c7e1b-ca28-48aa-9eb9-d1c3e0ef8898.png" alt="Схема технической архитектуры Apache Spark" /><figcaption>Техническая архитектура Apache Spark</figcaption></figure><h3>Интерактивные движки запросов</h3><p>PrestoDB был создан в 2012 году в Facebook (Meta)* для предоставления быстрых распределённых возможностей SQL поверх различных источников (включая HDFS, S3, MySQL и Cassandra) без перемещения или преобразования данных. Trino появился в 2019 году как форк Presto, созданный его оригинальными авторами, с фокусом на улучшении производительности и добавлении поддержки облачных и современных Lakehouse‑архитектур. Эти движки остаются очень похожими и после форка различаются лишь в деталях.</p><p>*<i>Компания Meta признана экстремистской на территории РФ и запрещена</i></p><p>На следующей схеме показана архитектура Presto/Trino. В Presto и Trino координатор парсит и планирует запрос, затем создаёт набор задач и сплитов (splits) базовых внешних хранилищ; каждый сплит передаётся рабочим узлам для чтения соответствующих данных.</p><figure><img src="https://media.tproger.ru/user-uploads/116700/2025-08-15/ba93830b-dd17-4aac-a3a4-4675f70f642d.png" alt="Схема архитектуры Presto/Trino" /><figcaption>Архитектура Presto/Trino</figcaption></figure><h3>OLAP‑движки для работы в реальном времени</h3><p>StarRocks — высокопроизводительное аналитическое хранилище данных (DWH), реализующее многомерную аналитику, аналитику в реальном времени и высокую конкурентность за счёт векторизации, MPP‑архитектуры, CBO, умных материализованных представлений и колоночного движка с возможностью оперативных обновлений.</p><p>Архитектура StarRocks поддерживает две модели: Shared‑nothing и Shared‑Data. В Shared‑nothing данные загружаются в формат StarRocks и хранятся непосредственно в локальном хранилище узлов StarRocks Backend. Shared‑Data позволяет напрямую запрашивать внешние источники данных без копирования их в кластер StarRocks — аналогично Presto/Trino/Spark.</p><figure><img src="https://media.tproger.ru/user-uploads/116700/2025-08-15/86fc796c-72c0-4a6d-865c-1dc2bb802738.png" alt="Схема архитектуры StarRocks" /><figcaption>Архитектура StarRocks</figcaption></figure><p>Используются два типа узлов: Frontend (FE) и Backend (BE)/Compute (CN). Узлы FE отвечают за управление метаданными и построение плана выполнения. Узлы BE исполняют план и хранят данные, ускоряя запросы за счёт локального хранения и обеспечивая высокую доступность посредством репликации. В конфигурации с общими данными (Shared‑Data) вместо BE используются вычислительные узлы (CN), которые выполняют те же функции, но не хранят данные.</p><p>ClickHouse был разработан в 2009 году, изначально для сервиса Yandex.Metrica — высоконагруженной веб‑аналитической платформы, обрабатывающей миллиарды событий в день с низкой задержкой. Существующие базы данных не справлялись с таким масштабом для аналитики в реальном времени с высокой конкурентностью, особенно на сложных фильтрах, агрегациях и соединениях. В ответ появился ClickHouse — быстрая OLAP‑СУБД для решения этих задач.</p><figure><img src="https://media.tproger.ru/user-uploads/116700/2025-08-15/983e7058-86cb-4e2a-9eef-713eeed575d1.png" alt="Схема архитектуры ClickHouse" /><figcaption>Архитектура ClickHouse</figcaption></figure><p>Архитектура ClickHouse использует колоночное хранение; операции выполняются над векторами (колоночными блоками), а данные векторов размещаются в реплицируемых шардах ClickHouse, что обеспечивает быстрое выполнение запросов и отказоустойчивость. Кроме того, ClickHouse позволяет запрашивать данные из облачных хранилищ, аналогично внешним таблицам в традиционных DWH.</p><p>Каждый распределённый исполнительный движок имеет свои сильные стороны: хотя почти все исполняют один и тот же SQL, детали реализации заметно различаются — исполнительные подсистемы, подходы к оптимизациям, обработка shuffle, кэширование, уровни векторизации и т. п.</p><p>В сводной таблице ниже (по мотивам сравнения на сайте Onehouse и описанных в тексте критериев) каждому движку присваивается оценка: A = лучший вариант; B = хороший вариант; C = ниже среднего. Каждой оценке соответствует балл: A = 3, B = 2, C = 1. metascore — нормализованная сумма баллов по всем категориям.</p><h2>Сводная таблица сравнения (оценки A/B/C и metascore)</h2><p>Примечания:</p><ul><li>A = 3 балла, B = 2 балла, C = 1 балл.</li><li>metascore рассчитан как сумма баллов по 5 категориям, нормализованная к максимуму 15 (деление на 15 и умножение на 100%).</li><li>Таблица отражает выводы текста: «лучший/худший» в классе по каждой категории и качественные комментарии по архитектуре.</li></ul><figure><img src="https://media.tproger.ru/user-uploads/116700/2025-08-15/9aeaa77a-b35f-4a37-a239-d8bbb7887046.png" alt="Analytics Engines Metascore" /></figure><h3>Рейтинг по metascore</h3><ol><li>StarRocks — 73%</li><li>ClickHouse — 73%</li><li>Presto — 67%</li><li>Apache Spark — 60%</li><li>Trino — 60%</li></ol><h3>Сравнение по ключевым критериям</h3><p><b>Скорость выполнения.</b> Одним из ключевых критериев качества вычислительного движка выступает время ответа на запрос; также важны пропускная способность, отказоустойчивость и ресурсоёмкость.</p><p>Оптимизации на базе SIMD (Single Instruction, Multiple Data), позволяющие одной инструкции CPU обрабатывать сразу несколько элементов данных, дают заметное преимущество над поэлементной обработкой.</p><p>— 🏆 Лучший в классе: StarRocks, ClickHouse</p><p>— ❌ Худший в классе: Spark</p><p><b>Масштабируемость.</b> Способность масштабировать кластер вверх/вниз на старте и по завершении запроса — важная составляющая отличной производительности и оптимизации затрат. Архитектуры с разделением хранения и вычислений упрощают масштабирование. Presto обеспечивает наиболее простую операционную модель на больших масштабах. Локальное хранение у StarRocks/ClickHouse усложняет масштабирование. Spark чаще используется для крупномасштабных ETL‑заданий и менее удобен для эластики интерактивных нагрузок.</p><p>— 🏆 Лучший в классе: Presto</p><p>— ❌ Худший в классе: Apache Spark</p><p><b>Конкурентное чтение/запись. </b>Нужна эффективная обработка больших объёмов одновременных запросов с приоритизацией, чтобы важные запросы не блокировались. ClickHouse предоставляет самый тонкий и гибкий контроль над исполнением запросов. В отношении транзакций большинство движков ориентированы на OLAP и уступают типичным OLTP/онлайн‑БД.</p><p>— 🏆 Лучший в классе: ClickHouse</p><p>— ❌ Худший в классе: Apache Spark</p><p><b>Поддержка хранения</b>. В эпоху открытых табличных форматов (Data Lake) по стратегии Lakehouse важно уметь читать/писать множество форматов. Spark поддерживает самый широкий спектр: через источники данных — Parquet, JSON, ORC, Avro, CSV и др.</p><p>— 🏆 Лучший в классе: Apache Spark</p><p>— ❌ Худший в классе: ClickHouse</p><p><b>Поддержка языков запросов.</b> В эпоху ИИ и аналитики главные способы работы — SQL и Python. Apache Spark с PySpark обеспечивает лучший опыт работы с Python и позволяет выражать бизнес‑логику в Python‑функциях; другие движки обычно требуют определять логику на SQL через клиентские обёртки. Spark можно бесшовно использовать как Python‑библиотеку и как распределённый SQL‑движок.</p><p>— 🏆 Лучший в классе: Apache Spark</p><p>— ❌ Худший в классе: Trino, Presto</p><h2>Выводы</h2><p>Выбор оптимального движка для решения бизнес‑задач не ограничивается желаемыми техническими целями — он должен учитывать будущие потребности бизнеса и направление эволюции архитектуры.</p><p>Каждый движок имеет свои сильные стороны:</p><ol><li>Apache Spark обладает самой широкой поддержкой хранилищ и языков; он может подключаться к практически любым типам данных и работать с ними.</li><li>Trino — отличный интерактивный SQL‑движок для ad hoc‑аналитики.</li><li>Presto имеет общую историю с Trino, предоставляет превосходный интерактивный SQL и эффективно масштабируется.</li><li>StarRocks предлагает сверхбыстрый векторизованный движок, но поддержка форматов файлов у него не так широка.</li><li>ClickHouse также даёт сверхбыстрый векторизованный движок для ускорения OLAP, но ему не хватает эластичности масштабирования.</li></ol><p>Независимо от выбора движка, настоящая сила — в умении комбинировать движки, масштабировать их и интегрировать с другими компонентами экосистемы под задачи бизнеса, не заковываясь в единственную архитектурную парадигму.</p>]]></content:encoded>
    </item>
    <item>
      <title>Как выбрать облако под стартап: от серверов до биллинга</title>
      <link>https://tproger.ru/articles/kak-vybrat-oblako-pod-startap--ot-serverov-do-billinga</link>
      <comments>https://tproger.ru/articles/kak-vybrat-oblako-pod-startap--ot-serverov-do-billinga?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Валерия Турчак]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-vybrat-oblako-pod-startap--ot-serverov-do-billinga</guid>
      <description><![CDATA[<p>Запускаете стартап? Разбираем, какое облако подойдет под ваш проект — подборка платформ. </p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-vybrat-oblako-pod-startap--ot-serverov-do-billinga">Как выбрать облако под стартап: от серверов до биллинга</a>»</p>]]></description>
      <category><![CDATA[Инструменты]]></category>
      <category><![CDATA[Безопасность]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[DevOps]]></category>
      <category><![CDATA[GitHub]]></category>
      <category><![CDATA[Техподдержка]]></category>
      <category><![CDATA[Стартапы]]></category>
      <category><![CDATA[Персональные данные]]></category>
      <category><![CDATA[Дата-центр]]></category>
      <category><![CDATA[Сервер]]></category>
      <category><![CDATA[Kubernetes]]></category>
      <category><![CDATA[Пет-проект]]></category>
      <category><![CDATA[CDN]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 15 Aug 2025 12:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Когда запускаешь стартап, приходится сразу принимать много решений. Одно из самых важных — выбрать, где будет жить ваша инфраструктура. От этого зависят деньги, скорость запуска и стабильность всего продукта.</p><p>Чтобы сэкономить вам время и нервы, мы разобрали рынок и собрали подборку облачных платформ. В ней — топовые провайдеры с примерами, ценами и плюсами. Поможет выбрать решение под вашу задачу и бюджет, без длинных ресёрчей и сомнительных форумов.</p><h2>1. H3LLO.CLOUD: для быстрого старта</h2><p>Если вы запускаете стартап, делаете MVP или просто не хотите платить больше за инфраструктуру — у<a href="https://h3llo.cloud/ru?utm_source=tproger&amp;utm_campaign=choice&amp;utm_term=startup"> H3LLO.CLOUD</a> есть стартовый набор на 12 месяцев, который бесплатно выдается при создании аккаунта.</p><p>Специально собрали предложения под запросы небольших команд и стартапов: 2 базовые ВМ Capsule.S (1vCPU/2GB RAM/12,5 NVMe), 5GB Network SSD, 5GB Object Storage, 1 Basic LoadBalancer, 1 IPv4, мониторинг.</p><p>Этого набора более чем хватит, даже для довольно посещаемых проектов. А тем, кому нужно больше, в ассортименте полный набор IaaS и PaaS решений и дружелюбная команда, которая помогает с их внедрением.</p><p>Облако H3LLO CLOUD подойдет тем, кто:</p><ul><li>запускает MVP и хочет минимизировать издержки на старте;</li><li>работает с Big Data и аналитикой;</li><li>использует Kubernetes или контейнеризацию;</li><li>разворачивает inference-серверы под ИИ-модели;</li><li>делает бэкапы и настраивает восстановление после сбоев.</li></ul><p><a href="https://h3llo.cloud/">H3LLO CLOUD</a> работает с посекундной тарификацией: платите только за то, чем действительно пользуетесь. Можно выставлять счета на юрлицо, есть постоплата. Обещают добавить Cloud API, шаблоны деплоя, маркетплейс SaaS-решений и serverless — но даже сейчас по функциональности всё покрыто: базы управляемые, биллинг гибкий, интерфейс понятный.</p><p>Техподдержка отвечает быстро — от пары минут до пары часов. Для крупных клиентов — приоритетный канал связи.</p><h2>2. L1veStack: полный контроль бюджетов</h2><p>Если вы только запускаете проект и хотите чётко контролировать, за что платите — <a href="https://l1vestack.ru/?utm_source=tproger&amp;utm_campaign=choice&amp;utm_term=startup">L1veStack</a> делает ставку на полную прозрачность. Никаких округлений, скрытых тарифов и загадочного биллинга. Всё просто: используете ресурсы — платите посекундно, не используете — не платите вообще.</p><p>Что вы получаете на старте:</p><ul><li>На этапе беты L1veStack можно запустить до 3 проектов, каждый из которых может использовать до 1 vCPU и 4 ГБ RAM.</li><li>У них есть уникальный вариант тарификации: существует нетарифицируемый пороговый уровень для небольших проектов, и оплата начинается только при превышении этих значений. Идеально для пет-проектов и стартапов, когда вы еще не знаете точных потребностей в мощности.</li></ul><p>L1veStack построен как платформа, которая растёт вместе с вами:</p><ul><li>Этап 1: Пет-проекты и небольшие стартапы. Здесь вы используете нетарифицируемый порог.</li><li>Этап 2: Команды и фрилансеры. Сервис выгодно использовать для управления Dev и Stage окружениями.</li><li>Этап 3: Инструмент разработки для команд внутри enterprise. Предлагаются выгодные тарифы для dev/stage окружений и возможность переводить продакшен на собственные сервера под контроль ваших DevOps специалистов.</li></ul><p>Из дополнительного и про биллинг:</p><p>В целом, всё удобно, гибко, прозрачно — есть все необходимые функции: GitHub wizard, автоматический SSL-сертификат (авто-SSL) и понятные объяснения для переменных.</p><p>Плата только за фактические минуты использования CPU и RAM. Есть поминутный счетчик и предиктивная симуляция затрат, чтобы прогнозировать расходы до того, как они возникнут.</p><p>Сервис предоставляет Live-индикаторы, который отслеживает нагрузку в реальном времени, human-friendly ошибки и мгновенный preview изменений.</p><h2>3. Облачная платформа Selectel: Масштаб, безопасность и опытная поддержка</h2><p>Selectel предлагает более 50 продуктов — от виртуальных и выделенных серверов до готовых к работе баз данных, кластеров Kubernetes, объектного хранилища, CDN и решений для безопасности. Всё запускается за пару кликов через удобную панель управления, API или Terraform.</p><p><a href="https://selectel.ru/services/startups-grant/?utm_source=tproger&amp;utm_medium=referral">Для стартапов действует акция</a>: Кешбэк до 1 000 000 бонусов. Каждый месяц Selectel возвращает 30% бонусами от расходов на инфраструктуру. Кешбэк начисляется в течение 12 месяцев.</p><p>Selectel подходит под  задачи любой сложности:</p><ol><li>Разворачивать MVP и первые версии приложений — настраивать среды разработки и тестирования.</li><li>Запускать приложение в продакшен и масштабироваться под нагрузкой.</li><li>Хранить и обрабатывать данные — платформа позволяет хранить большие объемы данных на дисках объемом до 10 ТБ и более.</li><li>Защитить данные от сетевых атак — есть готовые инструменты защиты от DDoS-атак и инструменты резервного копирования ,</li><li>Соответствовать требованиям безопасности — платформа хранит персональные данные до 1 уровня защищенности и следует требованиям 152-ФЗ, 21 приказа ФСТЭК, PCI DSS, ISO 27001, ГОСТ Р 57580.</li></ol><h2>Насколько удобно работать</h2><p>Инфраструктура строится как конструктор: 50+ продуктов и сервисов можно объединить через глобальный роутер, связать с собственной инфраструктурой (настраивать гибридные решения), масштабироваться в несколько кликов. Не нужно разбираться со сложными настройками — запустить сервис можно в несколько кликов из панели управления или с помощью Terraform. Есть IAM-система для разграничения доступов и определения ролей пользователей, чтобы настроить федерации удостоверений через SSO и соответствовать требованиям корпоративной безопасности.</p><h2>Биллинг и поддержка</h2><p>Биллинг облачной платформы работает по модели pay-as-you-go: платите только за то, что реально используется. При этом можно сэкономить до 75%, с прерываемыми ВМ и функцией заморозки — удобно, если нужно приостановить проект или снизить расходы ночью.</p><p>Техподдержка работает 24/7, специалисты помогают с подбором необходимой инфраструктуры и решений, настройками и функциональностью. Берут полную ответственность за работу инфраструктуры и быстро решают любые возникающие вопросы. Для сложных задач, например, миграции на инфраструктуру Selectel можно подключить услугу Администрирования.</p><h2>4. RTCLOUD: Гибридное облако для стартапов с масштабом и безопасностью</h2><p><a href="https://www.rtcloud.ru/">RTCLOUD</a> — это гибридное облако, объединяющее локальные ресурсы с публичным облаком провайдера для создания гибкой, масштабируемой и безопасной ИТ-инфраструктуры. Подходит стартапам, которым нужно быстро адаптироваться к нагрузкам без крупных затрат.</p><p>RTCLOUD предлагает гибридное облако, объединяющее частное и публичное облако:</p><ul><li>Единый каталог приложений: Доступ к приложениям в обоих облаках без разделения.</li><li>Единое адресное пространство: Перемещение виртуальных машин и приложений без изменения сетевых настроек.</li><li>Унифицированное управление: Просмотр, копирование и перемещение нагрузок (виртуальные машины, vApp, шаблоны) между облаками.</li><li>Инструменты мировых лидеров: Veeam Backup &amp; Replication для репликации и управления восстановлением, vCloud Availability для миграции и Disaster Recovery (DR).</li></ul><p>Поддерживаются сценарии:</p><ul><li>Уменьшение нагрузки на локальные ресурсы.</li><li>Запуск сервисов с непроверенной нагрузкой.</li><li>Организация тестовой площадки.</li><li>Резервирование инфраструктуры.</li></ul><p><b>Дополнительные возможности</b></p><ul><li>Облачный ЦОД: Инфраструктура без капитальных затрат, высокая надёжность, масштабирование.</li><li>Резервный ЦОД: Быстрое восстановление с минимальным RTO.</li><li>Объектное хранилище S3: Хранение архивов, резервных копий и медиа-контента.</li><li>Kubernetes-as-a-Service: Готовая контейнерная инфраструктура с контролируемым периметром безопасности.</li><li>Облачный десктоп (VDI и VDI GPU): Доступ к рабочим местам, включая производительные для конструкторов.</li><li>Backup as a Service (BaaS): Управление копиями и расписанием для надёжного хранения.</li><li>Размещение оборудования: Дата-центры TIER III с интеграцией облачных сервисов.</li></ul><h2>Биллинг и поддержка</h2><ul><li>Гибкая оплата: Pay-as-you-go, без инсталляционных платежей, платите только за потреблённые ресурсы.</li><li>Экономия: Нет затрат на покупку или модернизацию оборудования, масштабирование по потребностям.</li><li>Техподдержка: 24/7, помощь с настройкой инфраструктуры, миграцией и решением задач.</li></ul><h2>На что ориентироваться при выборе облака</h2><p>Выбирайте облако, которое соответствует вашим задачам: гибкость для тестов, прозрачность для контроля бюджета или мощная инфраструктура для продакшена.</p><p>H3LLO.CLOUD делает ставку на доступность, предлагая стартовый набор за 5 000 рублей с виртуальными машинами, базами данных и объектным хранилищем, что идеально для небольших команд, работающих с Big Data или ИИ.</p><p>L1veStack выделяется прозрачным биллингом и нетарифицируемым порогом, помогая стартапам с ограниченным бюджетом точно прогнозировать расходы.</p><p>Selectel обеспечивает масштабируемость и безопасность, с инструментами для защиты данных, что важно для проектов с высокими требованиями к соответствию 152-ФЗ.</p><p>RTCLOUD предлагает гибридное облако, которое объединяет локальные и публичные ресурсы, позволяя масштабироваться под пиковые нагрузки и минимизировать расходы благодаря модели pay-as-you-go без инсталляционных платежей.</p>]]></content:encoded>
    </item>
    <item>
      <title>Что нужно знать о приватности данных в 2025, если вы разработчик</title>
      <link>https://tproger.ru/articles/chto-nuzhno-znat-o-privatnosti-dannyh-v-2025--esli-vy-razrabotchik</link>
      <comments>https://tproger.ru/articles/chto-nuzhno-znat-o-privatnosti-dannyh-v-2025--esli-vy-razrabotchik?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Денис Кудерин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/chto-nuzhno-znat-o-privatnosti-dannyh-v-2025--esli-vy-razrabotchik</guid>
      <description><![CDATA[<p>Актуальные требования к обработке персональных данных в 2025 году. Как разработчикам соблюдать закон и избежать штрафов. Практические советы по защите информации в коде и архитектуре приложений.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/chto-nuzhno-znat-o-privatnosti-dannyh-v-2025--esli-vy-razrabotchik">Что нужно знать о приватности данных в 2025, если вы разработчик</a>»</p>]]></description>
      <category><![CDATA[Безопасность]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Взлом]]></category>
      <category><![CDATA[Информационная безопасность: веб-пентест]]></category>
      <category><![CDATA[Законы]]></category>
      <category><![CDATA[Разработка]]></category>
      <category><![CDATA[Кибербезопасность]]></category>
      <category><![CDATA[DevSecOps]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 22 Jul 2025 10:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>В 2025 году приватность данных — уже не абстрактный термин, а неотъемлемая часть профессиональных навыков разработчика. Штрафы за нарушения в этой сфере достигают 6 млн рублей, а утечки информации разрушают репутацию компаний в считанные часы. При этом требования законодательства усложнились, а технологии сбора сведений стали более изощрёнными.</p><p>Разработчики оказались на передовой этой битвы. Каждая строчка вашего кода может как защитить пользователей, так и подвергнуть их риску. Но не стоит воспринимать это как проблему, скорее как вызов — грамотная работа с данными открывает новые возможности для создания надёжных и востребованных цифровых продуктов.</p><h2>Что изменилось в законодательстве: главные обновления 2025 года</h2><p>С 30 мая 2025 года в России вступили в силу <a href="https://companies.rbc.ru/news/LfIRlNzMxt/popravki-v-152-fz-chto-biznesu-nuzhno-znat-o-personalnyih-dannyih-v-2025/">поправки</a> к Федеральному закону №152-ФЗ «О персональных данных». Эти изменения стали самыми значительными за последнее десятилетие и затронули все компании, работающие с пользовательской информацией. Разработчиков эти нововведения касаются самым непосредственным образом.</p><p>Теперь даже сбор данных о поведении пользователей на сайте (клики, время просмотра) требует отдельного согласия. Файлы cookie, которые раньше работали по умолчанию, теперь нужно настраивать так, чтобы пользователь мог выбирать, какие данные он разрешает сайту о себе собирать.</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-07-17/cf2f56ed-ccb6-4899-bda3-5c8d048cc4b5.jpg" alt="" /></figure><p>Штрафы за нарушения выросли в разы. Например, за обработку данных без согласия теперь можно <a href="https://ntcneptunit.ru/blog/novye-pravila-zashchity-dannyh-2025">получить штраф</a> до 700 тысяч рублей для юридических лиц. Повторные нарушения могут привести к штрафу в 3% от годового оборота компании — изменения вступили в силу в конце мая.</p><p>Новый закон уже работает. В антирейтинге главных нарушителей 2025 года <a href="https://www.tadviser.ru/index.php/%D0%A1%D1%82%D0%B0%D1%82%D1%8C%D1%8F:%D0%A8%D1%82%D1%80%D0%B0%D1%84%D1%8B_%D0%B7%D0%B0_%D1%83%D1%82%D0%B5%D1%87%D0%BA%D1%83_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B2_%D0%A0%D0%BE%D1%81%D1%81%D0%B8%D0%B8#.2A_55.25_.D1.83.D0.B3.D0.BE.D0.BB.D0.BE.D0.B2.D0.BD.D1.8B.D1.85_.D0.B4.D0.B5.D0.BB_.D0.BE.D0.B1_.D1.83.D1.82.D0.B5.D1.87.D0.BA.D0.B0.D1.85_.D0.B4.D0.B0.D0.BD.D0.BD.D1.8B.D1.85_.D0.B2_.D0.A0.D0.BE.D1.81.D1.81.D0.B8.D0.B8_.D0.B7.D0.B0.D0.B2.D0.BE.D0.B4.D0.B8.D1.82.D1.81.D1.8F_.D0.BD.D0.B0_.D1.81.D0.BE.D1.82.D1.80.D1.83.D0.B4.D0.BD.D0.B8.D0.BA.D0.BE.D0.B2_.D0.BA.D0.BE.D0.BC.D0.BF.D0.B0.D0.BD.D0.B8.D0.B9_.D0.B2_.D1.81.D1.84.D0.B5.D1.80.D0.B5_.D1.81.D0.B2.D1.8F.D0.B7.D0.B8">лидируют компании телекоммуникационной отрасли</a> — на их долю приходится 55% всех расследований по статье 272 УК РФ о неправомерном доступе к информации. Следом за телекомом идут госструктуры (16% расследований) и финансовый сектор (15% случаев).</p><p>Для разработчиков это важный сигнал: при создании решений для этих отраслей необходимо уделять особое внимание встроенным механизмам защиты данных.</p><p>Особенно важно:</p><ul><li>реализовывать строгие протоколы аудита доступа для госсистем;</li><li>внедрять дополнительные уровни шифрования в банковских приложениях;</li><li>разрабатывать специализированные инструменты мониторинга для телеком-операторов.</li></ul><p>Такая отраслевая специфика требует от разрабов глубокого понимания не только общих принципов защиты данных, но и особых требований конкретных секторов экономики.</p><blockquote>В 2025 году 152 ФЗ о Персональных данных  уже получил несколько существенных поправок, и, похоже, скоро получит еще несколько. И это, в общем, хорошо: персональные данные — вещь серьезная, и мне бы очень хотелось, чтобы компании относились к их сбору, обработке и передаче соответствующе. Пусть даже из-под палки. Разделение труда предполагает, что в компаниях, особенно крупных, за compliance и связанные с ним практики отвечает менеджмент, а разработчик просто пишет код, но мой опыт показывает, что этого недостаточно. Ответственность и базовую цифровую гигиену необходимо развивать всем — программистам в том числе.</blockquote><h2>Какие данные считаются персональными в 2025 году</h2><p>Для разработчиков в 2025 году понимание классификации персональных данных — это основа проектирования архитектуры любого приложения. Закон четко разделяет информацию на три категории, и каждая требует особого подхода:</p><ol><li>Биометрические данные — отпечатки пальцев, сканы сетчатки глаза, голосовые образцы. Для них требуется письменное согласие человека.</li><li>Специальные — информация о здоровье, политических взглядах, религиозных убеждениях. Такие данные, как правило, требуют обезличивания.</li><li>Обычные — имя, телефон, email, адрес. Их можно обрабатывать после получения согласия через договор или специальную форму.</li></ol><p>Разработчикам важно понимать: комбинация из имени и номера телефона уже считается персональными данными. А IP-адрес вместе с геолокацией — тем более. Даже хешированные данные могут считаться персональными, если возможна деанонимизация.</p><p>При проектировании API и баз данных разработчикам важно учитывать:</p><ul><li>раздельное хранение разных категорий данных;</li><li>механизмы автоматического удаления по истечении срока;</li><li>разграничение доступа на уровне кода (например, @Secured аннотации)</li></ul><p>Совет: создавайте карту данных (data mapping) на этапе проектирования системы — это поможет избежать проблем с соответствием требованиям. Современные IDE предлагают плагины для автоматического анализа кода на предмет обработки персональных данных.</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-07-20/c16467e0-8dc6-40f3-a291-ffad5f15f080.jpg" alt="" /></figure><h2>Обязательные шаги для легальной работы с данными</h2><p>Если ваш проект собирает любую информацию о пользователях, разработчикам нужно учесть ряд юридических требований. Пропуск любого из этих пунктов может привести к серьезным штрафам:</p><ol><li>Публикация политики обработки данных — это не просто формальность. Документ должен чётко объяснять, какие данные вы собираете, зачем и как будете их защищать. Роскомнадзор рекомендует включать в политику несколько обязательных разделов: цели обработки, категории данных, порядок их уничтожения и т.д..</li><li>Согласие на обработку данных теперь нельзя прятать в общих условиях использования. Это должна быть отдельная форма с понятным интерфейсом.</li><li>Регистрация в Роскомнадзоре обязательна для всех, кто работает с персональными данными. На подачу уведомления даётся 30 дней с момента начала обработки данных. Штраф за отсутствие регистрации — до 300 тысяч рублей.</li></ol><h2>Технические аспекты защиты данных: что должен знать разработчик в 2025 году</h2><p>Для разработчиков в 2025 году работа с персональными данными начинается с архитектурных решений. Современные требования предполагают не просто формальное соблюдение норм, а глубокую интеграцию принципов безопасности в код. Рассмотрим ключевые технические аспекты, которые нельзя игнорировать.</p><p>Локализация данных стала строгим требованием. При выборе облачных провайдеров убедитесь, что их дата-центры физически расположены в России. Проверьте не только основное хранилище, но и резервные копии — они тоже должны находиться на территории РФ. Для веб-аналитики переходите на российские аналоги Google Analytics, такие как Яндекс.Метрика с опцией хранения данных в России или аналогичные решения от Mail.ru Group.</p><p>Шифрование данных требует особого внимания:</p><ul><li>TLS 1.3 стал минимальным стандартом для передачи данных;</li><li>для хранения используйте алгоритмы, сертифицированные ФСТЭК (ГОСТ Р 34.10-2021, ГОСТ Р 34.11-2021);</li><li>биометрические данные требуют дополнительного уровня защиты — рассмотрите использование специализированных HSM-модулей;</li><li>реализуйте ротацию ключей шифрования не реже чем раз в 90 дней.</li></ul><p>Системы контроля доступа должны быть:</p><ul><li>ролевыми (RBAC) с минимальными необходимыми правами;</li><li>с обязательной двухфакторной аутентификацией для доступа к персданным;</li><li>с сессионным контролем (автоматический выход при бездействии);</li><li>с детальным логированием всех операций (кто, когда, какие данные просматривал/изменял).</li></ul><p>Дополнительные меры:</p><ul><li>автоматическое маскирование данных в интерфейсах;</li><li>настройка алертов на подозрительную активность (множественные запросы, экспорт данных);</li><li>механизмы предотвращения SQL-инъекций и других уязвимостей из списка OWASP Top 10;</li><li>для мобильных приложений обязательна защита от перехвата трафика — внедрение SSL сертификата (certificate pinning).</li></ul><p>Разработчикам стоит обратить внимание на новые инструменты — например, фреймворки для автоматического обнаружения персональных данных в коде и их защиты. Также появились решения для автоматического составления Data Flow Diagrams, помогающие визуализировать пути движения данных в системе.</p><p>Петр Емельянов, СЕО компании <a href="https://bloomtech.ru/">Bloomtech</a>, отмечает:  «<i>Есть принцип Privacy by Design. Раньше, когда мы разрабатывали информационные системы, о конфиденциальности данных думали, скажем так, во вторую очередь. Из-за это часто приходилось действовать реактивно: что-то случилось, и мы вкорячивали "хот-фикс", ставили костыль. Архитертура набухала, расползалась, становилсь уродливой и рыхлой. Privacy by Design ставит конфиденциальность в один ряд с отказоустойчивостью, надежностью и производительностью. Конфиденциальность больше не какая-то там неинтересная деталь, которую можно отложить на потом, – это один из основных принципов программной архитектуры</i>».</p><h2>Как правильно собирать согласия пользователей</h2><p>Корректная реализация механизма получения согласий — важная архитектурная задача для разработчиков. Рассмотрим ключевые технические аспекты, которые нужно учитывать.</p><p>Форма согласия должна быть:</p><ul><li>отдельным API-эндпоинтом или микросервисом, а не частью основного функционала;</li><li>конкретной — каждый тип данных требует отдельного пункта согласия;</li><li>информированной — используйте понятные технические термины с пояснениями;</li><li>легко отзываемой — реализуйте метод DELETE в API для отзыва согласий.</li></ul><p>При реализации механизмов работы с cookie разработчикам необходимо учитывать несколько аспектов. Во-первых, создать гибкую систему приоритетов для различных категорий данных, чтобы пользователи могли осознанно выбирать, какие типы информации разрешают собирать. Во-вторых, важно предусмотреть механизм частичного согласия, позволяющий давать разрешение на отдельные виды обработки данных.</p><p>Особое внимание следует уделить синхронизации между клиентской и серверной частями приложения — любые изменения в предпочтениях пользователя должны мгновенно отражаться во всех компонентах системы.</p><p>Не менее важен надёжный механизм хранения истории изменений, который фиксирует все действия пользователя относительно его куки-настроек. С технической точки зрения это подразумевает создание отдельной таблицы в базе данных специально для хранения информации о согласиях. Обязательным требованием стало версионирование политик конфиденциальности — при их обновлении система должна запрашивать подтверждение новых условий.</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-07-17/b4e3bdad-d49e-4492-b9cb-579f3e7214af.jpg" alt="" /></figure><p>Отдельный технический вызов — реализация автоматической очистки данных при отзыве согласия. Система должна не просто помечать информацию как неактивную, а полностью удалять соответствующие записи из всех хранилищ. Особенно важно отметить новое требование 2025 года: API должно поддерживать возможность массового отзыва согласий, когда пользователь может одной операцией отозвать все ранее выданные разрешения.</p><h2>Действия разработчика при утечке данных: алгоритм реагирования в 2025 году</h2><p>Для технических специалистов утечка данных требует не только юридического, но и технического реагирования:</p><ol><li>Первые сутки критически важны — необходимо зафиксировать время и способ утечки через системные логи, оперативно изолировать уязвимый компонент системы (например, отключить проблемный API или заблокировать доступ к скомпрометированной базе данных), а также подготовить детальный технический отчет для регуляторов с указанием типов утекших данных, версий используемого ПО и примененных механизмов защиты.</li><li>Далее начинается этап технического расследования. Разработчикам необходимо провести forensic-анализ кода, изучить историю изменений в системе контроля версий и тщательно проанализировать логи доступа за последний месяц. Эти данные помогут не только понять причины инцидента, но и предотвратить подобные ситуации в будущем.</li><li>На этапе исправлений важно не просто устранить уязвимость, но и пересмотреть архитектурные решения. Для критических систем стоит реализовать механизм принудительной смены учетных данных, обновить библиотеки шифрования и пересмотреть политики доступа. Особое внимание следует уделить системам, обрабатывающим биометрические или специальные категории данных — к ним применяются наиболее строгие требования.</li></ol><p>При крупных утечках (более 100 тысяч записей) разработчикам следует быть готовыми к детальному аудиту кода со стороны контролирующих органов. В 2025 году особое внимание проверяющие уделяют реализации принципа минимальных привилегий, качеству журналирования операций и использованию сертифицированных алгоритмов шифрования.</p><p>Лучшая профилактика — внедрение проверок безопасности в процесс непрерывной интеграции и доставки (CI/CD), включая автоматизированное тестирование на распространенные уязвимости и регулярные аудиты кода.</p><h2>Инструменты и практики для разработчиков: как внедрить приватность в повседневную работу</h2><p>Работа с приватностью в 2025 году вышла далеко за рамки простого соблюдения законодательных требований. Сегодня это комплексный подход к проектированию систем. Пользователи все чаще выбирают сервисы, которые не только функциональны, но и прозрачно обращаются с их личной информацией. Как разработчик, вы можете превратить требования к приватности в возможность создать по-настоящему качественный продукт.</p><h3>Privacy by Design: защита данных с первого дня проекта</h3><p>Концепция Privacy by Design пережила серьезную эволюцию за последние годы. Если раньше она рассматривалась как дополнительная опция, то в 2025 году стала обязательным стандартом для любого серьезного проекта. Суть подхода проста — вопросы приватности должны решаться на этапе проектирования архитектуры, а не добавляться постфактум.</p><p>На практике это означает несколько важных принципов:</p><ul><li>Минимизация данных: собирайте только ту информацию, которая действительно необходима для работы сервиса. Например, если для регистрации достаточно email, не запрашивайте номер телефона «на будущее».</li><li>Сквозное шифрование: защищайте данные на всех этапах — при передаче, обработке и хранении. Особенно это важно для биометрической информации и медицинских данных.</li><li>Децентрализованное хранение: там, где это возможно, избегайте создания единых баз данных. Современные решения позволяют хранить информацию распределенно, снижая риски массовых утечек.</li></ul><p>Хороший пример — банковские приложения, которые теперь часто используют локальное хранение биометрических данных на устройстве пользователя вместо централизованных серверов.</p><p>Петр Емельянов, СЕО компании <a href="https://bloomtech.ru/">Bloomtech</a>, отмечает:  «<i>Раньше, когда мы разрабатывали информационные системы, о конфиденциальности данных думали, скажем так, во вторую очередь. Из-за этого часто приходилось действовать реактивно: что-то случилось, и мы вкорячивали хот-фикс, ставили костыль. Архитертура набухала, расползалась, становилсь уродливой и рыхлой. Privacy by Design ставит конфиденциальность в один ряд с отказоустойчивостью, надежностью и производительностью. Конфиденциальность больше не какая-то там неинтересная деталь, которую можно отложить на потом, </i>—<i> это один из основных принципов программной архитектуры</i>».</p><p>С технической точки зрения, по словам Петра, это значит:</p><p>1. Минимизация данных. Меньше собрали, меньше рисков создали.</p><p>2. Персональные данные граждан Российской Федерации нужно хранить в Российской Федерации, так что лучше не разворачиваться в забугорных облаках (даже если это дешевле) и не использовать инструменты вроде Google Sheets (даже если это удобно).</p><p>3. Разделение и токенизация данных. Не надо хранить все данные в одной условной плоской табличке, из которой кто угодно с минимальным знанием SQL получит ваши ФИОДР, телефон, адрес, номер паспорта и размер ноги впридачу.</p><p>4. Инвентаризация и классификация персональных данных. Нужно точно знать все места, где у вас хранятся ПДн, внедрять соответствующие политики доступа и журналировать все запросы и попытки запросов.</p><p>5. Хранение полных логов согласий с датой действия и привязкой к пользователю (но не с его ПДн) там, где их трудно будет потереть или удалить.</p><p>7. Развитие регламнентов реагирования на инциденты. Например, сейчас есть всего 24 часа, чтобы уведомить РКН об утечке. Так что, если вы поняли, что беда случилась, или считаете, что она вот-вот случится, не молчите.</p><p>8. Обязательное шифрование при хранении и передаче ПДн. Лучше сразу по ГОСТ, хотя закон этого напрямую не требует.</p><p>9.  Рекомендуемые РКН методы обезличивания данных.  Особенно важно в контексте поправок в 142 ФЗ, которые, вероятно, начнут действовать с сентября 2025.</p><p>10. Изучение новых технологий и способов защиты данных. Конфиденциальные вычисления, дифференциальная приватность, разные виды федеративного обучения — технологии защиты данных во время использования востребованы, их много, они развиваются. Рекомендую если не изучать, то послеживать.</p><h3>Анонимизация и псевдонимизация: технические нюансы</h3><p>Разработчикам важно понимать разницу между этими двумя подходами к защите данных, так как юридические последствия их применения существенно отличаются.</p><p>Анонимизация означает необратимое удаление связи между данными и конкретным человеком. После такой обработки восстановить персональные данные невозможно. Этот метод идеально подходит для аналитических систем, где важны общие тенденции, а не индивидуальные поведенческие паттерны.</p><p>Псевдонимизация — замена прямых идентификаторов (например, имени) на условные коды. Такой подход позволяет работать с данными, сохраняя возможность (при необходимости) установить связь с конкретным пользователем.</p><p>Важно: псевдонимизированные данные по-прежнему считаются персональными и требуют соответствующей защиты.</p><p>В 2025 году появились новые инструменты для работы с анонимизированными данными. Например, библиотеки дифференциальной приватности позволяют получать точную аналитику, не раскрывая информацию об отдельных пользователях.</p><h3>Регулярные аудиты и инвентаризация данных</h3><p>Практика показывает, что даже хорошо спроектированные системы со временем обрастают избыточными механизмами сбора данных. Регулярные проверки помогают выявить такие «накопления» и снизить связанные с ними риски.</p><p>Проводите аудит по следующему алгоритму:</p><ol><li>Картирование данных: составьте полный перечень всех типов собираемой информации, мест ее хранения и путей передачи.</li><li>Оценка необходимости: для каждого типа данных задайте вопрос — зачем мы его собираем и что будет, если перестанем?</li><li>Анализ рисков: определите, какие данные требуют особой защиты и соответствуют ли текущие меры их важности.</li><li>Планирование улучшений: разработайте дорожную карту по устранению выявленных проблем.</li></ol><p>Современные системы мониторинга данных (например, Data Protection Officer SaaS-решения) позволяют автоматизировать большую часть этого процесса.</p><h2>Инструментарий разработчика: что использовать в 2025 году</h2><p>Рынок инструментов для обеспечения приватности значительно расширился. Вот несколько категорий решений, которые стоит рассмотреть для своих проектов:</p><p>Фреймворки для Privacy by Design:</p><ul><li>OpenGDPR Framework — набор библиотек для встраивания принципов приватности в архитектуру приложений.</li><li>Microsoft Privacy Development Kit — инструменты для реализации сквозного шифрования.</li><li>Google’s Differential Privacy Library — решение для работы с анонимизированными данными.</li></ul><p>Средства мониторинга и аудита:</p><ul><li>OneTrust Data Mapping — облачное решение для инвентаризации данных.</li><li>TrustArc Privacy Intelligence — платформа для оценки рисков.</li><li>Osano Consent Management — система управления согласиями пользователей.</li></ul><p>Инфраструктурные решения:</p><ul><li>российские сертифицированные криптографические библиотеки;</li><li>облачные хранилища с российскими серверами и обязательным шифрованием;</li><li>Middleware для автоматического обезличивания данных перед их попаданием в аналитические системы.</li></ul><p>Важно помнить: выбор инструментов должен основываться на конкретных требованиях проекта и типах обрабатываемых данных. Слепая установка всех доступных решений защиты может только усложнить систему без реального повышения безопасности.</p><p><i>Эксперт Евгений Кокуйкин (Head of Raft Security) рекомендует:</i></p><p><i>   - Убедитесь, что в обучающих данных нет персональной информации.  </i></p><p><i>- Для анонимизации используйте специализированные инструменты, такие как <a href="https://microsoft.github.io/presidio/">Microsoft Presidio</a>.  </i></p><p><i>Если ваше ИИ-приложение включает пользовательские данные в системные промпты, убедитесь, что оно защищено от промпт-атак:</i></p><p><i>- Ориентируйтесь на рекомендации <a href="https://owasp.org/www-project-ai-security-and-privacy-guide/">OWASP AI Security and Privacy Guide</a> и <a href="https://owasp.org/www-project-top-10-for-large-language-model-applications/">OWASP Top 10 for LLM Applications</a>.</i></p><h2>Итоги: приватность как конкурентное преимущество</h2><p>В 2025 году забота о приватности — не просто соблюдение закона, а способ выделиться среди конкурентов. Пользователи стали более осознанно относиться к своим данным, и они выбирают сервисы, которые уважают их приватность.</p><p>Как разработчик, вы можете превратить эти требования в возможности:</p><ul><li>создавайте понятные интерфейсы для управления согласиями;</li><li>разрабатывайте системы, которые собирают только необходимый минимум данных;</li><li>используйте современные методы защиты информации;</li><li>будьте прозрачны в том, как используете данные пользователей.</li></ul><p>При правильном подходе работа с приватностью перестаёт быть головной болью и становится частью качественного пользовательского опыта. А в эпоху, когда данные стали новой валютой, такое отношение ценится особенно высоко.</p>]]></content:encoded>
    </item>
    <item>
      <title>Самые образованные поколения — самые невежественные?</title>
      <link>https://tproger.ru/articles/samye-obrazovannye-pokoleniya---samye-nevezhestvennye-</link>
      <comments>https://tproger.ru/articles/samye-obrazovannye-pokoleniya---samye-nevezhestvennye-?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Денис Кудерин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/samye-obrazovannye-pokoleniya---samye-nevezhestvennye-</guid>
      <description><![CDATA[<p>Образование растёт, но критическое мышление буксует. Почему «самые умные» поколения легко попадаются на дезинформацию? Исследуем парадокс цифрового невежества.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/samye-obrazovannye-pokoleniya---samye-nevezhestvennye-">Самые образованные поколения — самые невежественные?</a>»</p>]]></description>
      <category><![CDATA[Интернет]]></category>
      <category><![CDATA[Инструменты]]></category>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[Статистика]]></category>
      <category><![CDATA[Производительность]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Опрос]]></category>
      <category><![CDATA[Виртуальная реальность]]></category>
      <category><![CDATA[Новости]]></category>
      <category><![CDATA[Практика]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Социальные сети]]></category>
      <category><![CDATA[Работа]]></category>
      <category><![CDATA[Навыки]]></category>
      <category><![CDATA[HR]]></category>
      <category><![CDATA[Образование]]></category>
      <category><![CDATA[Soft Skills]]></category>
      <category><![CDATA[Россия]]></category>
      <category><![CDATA[TikTok]]></category>
      <category><![CDATA[Наука]]></category>
      <category><![CDATA[Законы]]></category>
      <category><![CDATA[Инновации]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 16 Jun 2025 14:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>В современной России высшее образование стало доступнее, чем когда-либо: <a href="https://t-j.ru/statistic-univercitites/#:~:text=%D0%BE%D1%86%D0%B5%D0%BD%D0%B8%D0%B2%D0%B0%D1%8E%D1%82%20%D0%B2%20%D0%BC%D0%B8%D1%80%D0%B5-,%D0%A1%D0%BA%D0%BE%D0%BB%D1%8C%D0%BA%D0%BE%20%D0%B2%20%D1%81%D1%82%D1%80%D0%B0%D0%BD%D0%B5%20%D1%81%D1%82%D1%83%D0%B4%D0%B5%D0%BD%D1%82%D0%BE%D0%B2,%D0%9E%D1%87%D0%BD%D0%BE%20%D1%83%D1%87%D0%B0%D1%82%D1%81%D1%8F%2062%25.">31% взрослых имеют дипломы вузов</a> — против 25% в начале 2000-х. Но параллельно с этим растет тревожная статистика: около трети россиян не могут назвать годы Великой Отечественной войны, 40% выпускников школ не понимают научных статей, фундаментальные знания о мире становятся редкостью, а не нормой.</p><p>Этот диссонанс — <a href="https://www.oecd.org/en/about/programmes/piaac.html">не исключительно российская проблема</a>. В Германии 20% взрослых функционально неграмотны, а в США 37% выпускников колледжей отрицают теорию эволюции и другие базовые научные парадигмы. Чем больше дипломов получает население, тем меньше оно знает. Почему?</p><p>Главная причина — подмена целей. Образование превратилось в формальность: школы натаскивают на ЕГЭ, вузы штампуют «корочки», а студенты учатся не думать, а запоминать. Даже  преподаватели признают: современные программы развивают память, но не критическое мышление.</p><p>Из статьи вы узнаете, почему диплом перестал быть гарантией знаний, как интернет, соцсети и ИИ усугубляют кризис, какие решения нужно принять, пока проблема не переросла в катастрофу.</p><h2>Дипломы есть у всех. А где знания?</h2><p>Кажется, мы живем в <a href="https://www.forbes.ru/education/518299-naselenie-zemli-stanovitsa-bolee-obrazovannym">эпоху всеобщей образованности</a>. Цифры выглядят впечатляюще: почти половина молодежи в мире (48% в возрасте 25–34 лет) сегодня заканчивает вузы — против 27% в 2000-м. В Южной Корее и Канаде дипломы есть у двух третей взрослого населения, а Китай за 30 лет увеличил число студентов в 10 раз — с 3,8 млн до 50 млн. В России почти каждый третий взрослый человек имеет «вышку».</p><p>Но вот вопрос: если дипломов стало больше, почему мир не превратился в цитадель просвещенных эрудитов? Почему вместо этого мы получаем армии «специалистов», которые не могут отличить ДНК от РНК, путают Гражданскую войну с Отечественной и верят, что Земля плоская?</p><h2>Глобальный бум высшего образования</h2><p>Тренд очевиден — мир массово учится. В OECD (Организации экономического развития) <a href="https://www.oecd.org/en/publications/education-at-a-glance-2023_e13bef63-en.html">подсчитали</a>, что среди 25–34-летних женщин и мужчин дипломы об образовании есть у 50%. Лидеры — Южная Корея (69%) и Канада (66,4%), но даже отстающие страны вроде Турции или Мексики показывают рост. Европа к 2030 году планирует довести долю людей с высшим образованием до 45%, а Китай уже сейчас значительно превысил этот показатель.</p><p>В России цифры скромнее, но динамика похожая: если в 2000-х вузы заканчивали 25% работающих, то сейчас — 31%. В Москве и Питере дипломы среди молодежи 25–34 лет есть у 41%. Однако наличие «корочки» еще не гарантирует реальных знаний.</p><p>На этом графике показан процент сотрудников с высшим образованием:</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-05-17/88444cc5-dac2-440e-b656-3dbe01e2d965.png" alt="" /></figure><h3>Почему все рвутся в вузы</h3><p>Ответ прост: рынок требует. В развитых странах ручной труд и низкоквалифицированные работы вытесняются автоматизацией, а в развивающихся образование стало социальным лифтом. Китай, например, делает ставку на массовую подготовку инженеров и IT-специалистов, чтобы удержать экономический рост.</p><p>Но есть и обратная сторона. Когда диплом превращается в формальность (нужен «для галочки» при приеме на работу), его ценность падает. В России, например, 45% трудоспособного населения имеют среднее профобразование — то есть фактически «отсидели» в колледжах, но не получили глубоких знаний. С вузовскими дипломами ситуация не лучше.</p><h2>Парадокс: больше дипломов — меньше грамотности</h2><p>Казалось бы, если образование доступно, люди должны становиться умнее. Но данные PISA и TIMSS (центры международных исследований и оценки компетенций) показывают обратное: школьники в развитых странах стабильно теряют навыки чтения, математики и науки.</p><p>В причинах подобной ситуации мы будем подробно разбираться в одном из следующих разделов, но основные факторы нужно указать сразу. Современная система образования во многих странах нацелена на «прохождение» программ, а не на понимание. Тесты вроде ЕГЭ учат запоминать и угадывать, а не мыслить.</p><p>Перекос в сторону STEM-образования (то есть естественных и технических дисциплин) снижает значимость гуманитарных знаний (история, философия, логика). В итоге прогер умеет писать сложный код, но не отличает пропаганду от фактов.</p><p>Важный фактор — инфошум. Соцсети и алгоритмы заменяют глубокий анализ кликбейтом. Зачем учить историю, если «все и всех» уже разоблачили в Ютубе или ТикТоке?</p><p>Пока система не перестанет штамповать «корочки» и не начнет учить думать, парадокс будет только усугубляться.</p><h3>Образованный  — не значит умный</h3><p>По данным Росстата, за последние 20 лет доля людей с дипломами среди трудоспособного населения выросла с 25% до 35%. В Москве и Санкт-Петербурге показатели еще выше — здесь вузы заканчивают около половины жителей. Казалось бы, перед нами общество образованных граждан.</p><p>Но <a href="https://www.nix.ru/computer_hardware_news/hardware_news_viewer.html?id=213729">реальность разбивает</a> этот стереотип:</p><ul><li>30% россиян не могут назвать точные годы ВОВ.</li><li>Каждый пятый уверен, что Солнце вращается вокруг Земли.</li><li>15% считают, что радиоактивное молоко становится безопасным после кипячения.</li></ul><p>Эти цифры — не статистические погрешности. Они отражают системный кризис, когда формальное образование перестало гарантировать реальные знания.</p><p><i>К слову, многие американцы уверены, что шоколадное молоко дают коричневые коровы, не говоря уже о том, что более 40% населения в Штатах с трудом умеют читать и писать. </i></p><h2>Глобальная картина: образованные, но неграмотные</h2><p>Проблема носит мировой характер. В Германии, некогда известной своей качественной системой образования, пятая часть взрослых испытывают трудности с пониманием инструкций к лекарствам. Во Франции 40% выпускников школ не могут объяснить, что собой представляют молекулы и атомы.</p><p>В США, где 38% населения имеют степень бакалавра, <a href="https://medium.com/@worldhistory/why-americas-most-educated-generations-are-so-ignorant-89801882b13f">ситуация еще тревожнее</a>:</p><ul><li>треть американцев не могут назвать три ветви власти;</li><li>37% отрицают теорию эволюции;</li><li>41% не знают исторического значения Освенцима.</li></ul><p>Особенно удручает ситуация с исторической памятью. В Европе 40% молодежи не могут объяснить, что такое Холокост. В России, по данным статистических агентств, около половины респондентов путаются в исторических событиях XX века. При этом подавляющее большинство этих людей имеют как минимум среднее образование.</p><h2>Информационный хаос vs. знания</h2><p>Социальные сети окончательно подорвали традиционные образовательные парадигмы. Алгоритмы TikTok и YouTube сознательно продвигают контент, который вызывает эмоции, а не формирует фундаментальные знания.</p><p>Последствия:</p><ul><li>около половины молодых россиян получают новости из Telegram-каналов сомнительной достоверности;</li><li>каждый третий выпускник вуза верит хотя бы в одну теорию заговора;</li><li>60% студентов не проверяют информацию, если она выглядит правдоподобно.</li></ul><h2>Причины: почему образованные люди становятся невежественными</h2><p>Дипломы перестали быть гарантией эрудиции — сегодня даже выпускники престижных вузов могут верить в плоскую Землю или отрицать эволюцию. В чем корень проблемы?</p><h3>Образование, которое не учит думать</h3><p>Система обучения все чаще работает на количественные показатели, а не на качество знаний. В России за последнее десятилетие число часов на историю и литературу в школах сократилось на 20%, тогда как технические дисциплины сохранили свои позиции. Школьникам с раннего возраста внушают, что единственная цель образования — получить навыки и дипломы, которые помогут им заработать деньги во взрослой жизни</p><p>Это не значит, что STEM-науки не важны — проблема в дисбалансе. Когда из программы исчезают философия, логика и анализ источников, даже талантливый инженер может стать жертвой манипуляций.</p><p>ЕГЭ и аналогичные системы оценивания усугубляют ситуацию. Школы натаскивают на тесты, а не учат работать с информацией. Результат:выпускники не могут отличить научную публикацию от псевдонаучного текста. Они запоминают формулы, но не понимают, как применять знания в реальной жизни.</p><h3>Информационный потоп: когда правда тонет в шуме</h3><p>Алгоритмы поощряют контент, который вызывает эмоции, а не размышления:</p><ul><li>видео с теориями заговора набирают втрое больше просмотров, чем научно-популярные ролики;</li><li>множество пользователей соцсетей никогда не проверяют факты, если заголовок соответствует их убеждениям.</li></ul><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-05-17/deb3190b-d171-4753-b3fb-0a0c9e475e4e.jpg" alt="" /></figure><p>Эксперты называют это «эффектом обратного отбора»: чем громче и увереннее звучит заявление, тем больше у него шансов распространиться. В результате блогер-дилетант с миллионной аудиторией становится для многих авторитетнее профессора. Упадок экспертного сообщества — довольно значимая причина нашего невежества.</p><h2>Культура быстрых ответов</h2><p>Раньше образование было инвестицией в себя. Сегодня большинство студентов рассматривают вуз как «пункт выдачи дипломов» для работодателя.</p><p>Это меняет мотивацию:</p><ul><li>вместо глубокого изучения предмета — стратегия «сдать и забыть»;</li><li>вместо чтения первоисточников — поиск кратких конспектов в интернете;</li><li>вместо дискуссий с преподавателями — готовые ответы от ИИ.</li></ul><p>Книги проигрывают клиповому контенту: за 10 лет среднее время чтения у россиян сократилось до нескольких часов в неделю. Когда человек привыкает получать информацию порциями по 15 секунд, он теряет способность анализировать сложные тексты.</p><p>Эти тенденции не фатальны. В следующих разделах мы разберем, какие решения предлагают ученые — от реформы образования до цифровой гигиены. Пока же ясно одно: диплом больше не защищает от невежества. В мире, где правду приходится фильтровать вручную, критическое мышление становится важнее любых корочек.</p><h2>Эволюция ИТ и уровень знаний: почему доступ к информации не сделал нас умнее</h2><p>За последние 20 лет информационные технологии радикально изменили способ получения знаний. В 2005 году только 25% россиян имели постоянный доступ к интернету, сегодня — около 90%. Казалось бы, это должно было привести к взрывному росту образованности. Но парадокс в том, что, получив неограниченный доступ к информации, люди разучились ей пользоваться.</p><h3>Доступ к информации и девальвация знаний</h3><p>Интернет устранил географические барьеры: студент из провинции может слушать лекции МГУ, а школьник — изучать квантовую физику по YouTube. В России за последнее десятилетие число онлайн-курсов выросло в десятки раз, а дистанционное обучение <a href="https://1economic.ru/lib/111889">стало нормой даже в традиционных вузах</a>. Однако большинство студентов использует эти ресурсы для поверхностного изучения темы, а не системного образования.</p><p>Проблема не в отсутствии информации, а в ее избытке. Когда Google выдает 400 тысяч ссылок по запросу «информационные технологии в экономике», <a href="https://top-technologies.ru/ru/article/view?id=25948">лишь 5% из них содержат достоверные данные</a>.</p><h3>Цифровой разрыв: когда технологии не помогают, а мешают</h3><p>ИТ создал новый тип неравенства — доступ к информации есть у всех, но лишь единицы способны ее обрабатывать и критически оценивать</p><p>При этом:</p><ul><li>Школы до сих пор делают акцент на запоминании, а не анализе. Хотя 90% учебных заведений оснащены компьютерами, <a href="https://pedsovet.org/article/plyusy-i-minusy-primeneniya-informatsionno-kommunikatsionnyh-tehnologiy-v-obrazovanii">лишь 15% учителей используют их</a> для развития критического мышления.</li><li>Университеты внедряют ИТ формально. Например, 70% преподавателей применяют PowerPoint, но только 10% — интерактивные симуляторы или виртуальные лаборатории.</li></ul><p>Особенно тревожит «эффект Google»: студенты запоминают не факты, а пути к ним. Значительная часть пользователей не может воспроизвести информацию, найденную в сети, уже через неделю после прочтения.</p><h3>ИТ vs. фундаментальные навыки</h3><p>Технологии изменили не только способы обучения, но и содержание. В России за 10 лет вдвое сократилось количество часов на историю и литературу, зато программирование ввели даже в начальной школе.</p><p>Это создало перекос:</p><ul><li><a href="https://www.karma-group.ru/education/">Технические навыки растут</a>. Каждый третий студент IT-специальностей к выпуску имеет опыт коммерческой разработки.</li><li><a href="https://sky.pro/wiki/profession/informacionnye-tehnologii-v-obrazovanii-kak-oni-menyayut-obuchenie/">Гуманитарная грамотность падает</a>. Треть молодых специалистов не может написать отчет без шаблонов, многие путают Гражданскую войну с Отечественной.</li></ul><p>При этом сами ИТ-компании жалуются на дефицит soft skills. Но даже сильный программист не справится с проектом, если не понимает логики исторических процессов или не видит причинно-следственных связей.</p><p>ИТ — это инструмент, который усиливает существующие тенденции. Если система образования продолжит делать акцент на тестах и «корочках», технологии лишь ускорят деградацию знаний. Но если пересмотреть подходы — например, заменить зубрежку анализом Big Data или дискуссиями в виртуальных лабораториях — у следующего поколения есть шанс стать по-настоящему образованным.</p><h2>Последствия: чем это грозит обществу</h2><p>Когда дипломы перестают гарантировать компетентность, а критическое мышление становится роскошью, страдает вся общественная система. Последствия этого кризиса уже видны в политике, науке и экономике.</p><h3>Политика: эпоха манипуляций</h3><p>Недостаток базовых знаний делает избирателей уязвимыми для популизма. В Великобритании уровень образования оказался ключевым фактором в голосовании за Brexit — менее образованные граждане в основном поддерживали выход из ЕС, даже не понимая экономических последствий. В России лишь единицы способны объяснить, как санкции реально влияют на экономику.</p><p>Проблема глубже, чем кажется. Когда люди не разбираются в механизмах власти или не знают содержание Конституции, они голосуют не за программы, а за эмоции. В результате политики тратят ресурсы не на решения, а на пиар-кампании, где громкий лозунг важнее, чем факты.</p><h3>Наука: война с фактами</h3><p>Антивакцинное движение, отрицание эволюции и вера в плоскую Землю — это не просто курьезы. Если 25% населения сомневается в шарообразности планеты, такие заблуждения напрямую угрожают прогрессу:</p><ul><li>Медицина. Неверие в науку тормозит внедрение генетических технологий, хотя именно они, по прогнозам, к 2030 году позволят лечить рак и наследственные заболевания. Уже сейчас значительная часть населения не доверяет вакцинам — определенные основания для опасений есть, но полное отрицание вакцинации повышает риски эпидемий.</li><li>Технологии. В США более трети выпускников вузов отрицают, что люди произошли от других видов. Если будущие инженеры не понимают базовых принципов биологии, как они создадут биосенсоры или отредактируют геном?</li></ul><p>Особенно тревожит рост «альтернативных экспертов». Блогеры без образования обсуждают квантовую физику или эпидемиологию, собирая миллионы просмотров, а профессиональные ученые теряют авторитет. В результате общество делится на два лагеря: те, кто верит в «тайные знания», и те, кто устал спорить.</p><h3>Экономика: дипломы без навыков</h3><p>Российские компании уже сталкиваются с дефицитом квалифицированных кадров. Многие работники не умеют грамотно пользоваться компьютерами в профессиональной деятельности, при этом работодатели жалуются, что сотрудники не умеют решать нестандартные задачи.</p><p>Вузы продолжают выпускать специалистов, чьи знания не соответствуют рынку:</p><ul><li>Производительность труда в РФ ниже чем в КНР и ряде развитых стран. Одна из причин — образовательная система не учит применять знания на практике. Вместо анализа кейсов студенты зубрят теорию для экзаменов.</li><li>Инновации. Российские компании неохотно инвестируют в разработки, хотя уровень образования — не единственная причина такого состояния. Однако факт налицо — без критического мышления сотрудники не способны генерировать новые идеи, а бизнес предпочитает копировать успешные западные модели.</li></ul><p>Формально образованных людей больше, чем когда-либо, но экономика страдает от нехватки реальных компетенций. Закрыть этот разрыв можно только пересмотром подходов к обучению — но система продолжает штамповать «корочки».</p><p>Общество, где дипломы есть у многих, а знания — у единиц, рискует скатиться в эпоху «нового средневековья». Уже сейчас мы видим последствия: наука теряет доверие, уступая место теориям заговора., а экономика тормозит из-за кадрового кризиса.</p><p>Исправить ситуацию можно, только вернув в образование главный критерий — не количество дипломов, а качество мышления. Пока же тренд обратный: хотя в 2025 году <a href="https://wciom.ru/analytical-reviews/analiticheskii-obzor/budushchee-uzhe-ne-to-chto-prezhde">россияне среди ключевых навыков будущего назвали</a> «умение адаптироваться» (27%) и «критическое мышление» (22%), школ и вузов, которые действительно учат этому, — единицы.</p><h2>Как вернуть знаниям ценность: инструкция по спасению образования</h2><p>Кризис, при котором дипломы перестали гарантировать компетентность, требует системных решений. Ситуация парадоксальна: вузы выпускают рекордное число специалистов, но работодатели жалуются на дефицит квалифицированных кадров. Исправить это можно, если пересмотреть три ключевых аспекта: содержание образования, методы работы с информацией и роль технологий.</p><h3>Перезагрузка школы: от тестов к мышлению</h3><p><a href="https://pedsovet.org/article/pat-pricin-effektivnosti-finskoj-modeli-obrazovania">Финская модель</a> давно доказала: зубрежка уступает анализу. В России тоже начинают понимать эту необходимость. С 2024 года в школах внедряют <a href="https://hi-tech.mail.ru/news/119215-v-rossii-poyavilis-pervye-uchebniki-po-ii-dlya-5-9-klassov/">учебники по искусственному интеллекту для 5–9 классов</a>, где учат не просто запоминать алгоритмы, а понимать принципы их работы. Однако этого недостаточно.</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-05-17/eac4bb38-e21c-419c-b2f5-f0b0c3884f7e.png" alt="" /></figure><p>Основная проблема — ЕГЭ в том виде, в котором эта институция существует в настоящий момент. Система, созданная для объективности, превратилась в «натаскивание на варианты». Учителя тратят больше половины учебного времени на подготовку к тестам, сокращая часы на дискуссии и анализ источников.</p><p>Альтернатива — постепенный отказ от формата «единственно верного ответа». Пилотные проекты в Москве и Казани уже экспериментируют с заданиями, где нужно сопоставлять точки зрения или находить скрытые логические ошибки.</p><p>Гуманитарные дисциплины — второй фронт борьбы за знания. Сокращение часов на историю и литературу привело к тому, что студенты технических вузов не могут аргументированно поддержать беседу о классической культуре. Возвращение логики и философии в программы — не ностальгия по СССР, а необходимость. Как показывает практика, студенты, изучавшие основы критического мышления, гораздо реже попадаются на фейки в соцсетях.</p><h3>Медиагигиена: прививка от дезинформации</h3><p>В 2025 году в российских школах запустили проект «Медиаритм». Ученики создают контент, разбирают кейсы фейков и учатся работать с нейросетями. Важный акцент — не просто технические навыки, а этика: как не стать распространителем дезинформации даже случайно. Первые результаты обнадеживают: участники программы реже репостят непроверенные новости.</p><p>Но одних курсов мало. Нужна «цифровая гигиена» на уровне привычек:</p><ul><li>Проверка источников. Простой лайфхак: если новость не публикуют минимум три крупных СМИ, ей нельзя доверять.</li><li>Критика алгоритмов. Видеохостинги показывают то, что вызывает эмоции, а не то, что соответствует истине. Об этом стоит напоминать чаще.</li><li>Практика дискуссий. В том же «Медиаритме» школьники проводят дебаты, где учатся аргументировать позицию без перехода на личности.</li></ul><h3>Технологии как инструмент, а не замена знаниям</h3><p>ИИ — не враг образования, если использовать его правильно. Студенты применяют нейросети для учебы, но лишь некоторые из них делают это осознанно: задают уточняющие вопросы, проверяют факты. Остальные просто копируют ответы.</p><p>Перспективное решение — интеграция ИИ в учебный процесс как «собеседника». В некоторых вузах уже тестируют систему, где нейросеть не дает готовых решений, а задает наводящие вопросы, помогая студенту прийти к выводу самостоятельно. Например, вместо «Вот формула дискриминанта» — «Как ты думаешь, почему в этом уравнении нельзя просто извлечь корень?».</p><p>Виртуальная реальность — еще один инструмент. Вместо сухих параграфов о Древнем Риме школьники надевают VR-очки и гуляют по Форуму, видя, как работали законы и общество. Пилотные проекты в Москве показали: такой материал запоминается гораздо лучше.</p><p>Изменения уже начинаются. В 2025 году большая часть педагогов поддержала идею внедрения ИИ в обучение, а многие вузы разрабатывают курсы по медиаграмотности. Но скорость реформ отстает от вызовов времени.</p><p>Чтобы диплом снова стал символом знаний, а не формальностью, нужно:</p><ul><li>пересмотреть приоритеты ЕГЭ, заменив тесты на задачи с анализом;</li><li>вернуть в школы философию и логику — не как «лишние предметы», а как основу мышления;</li><li>сделать медиаграмотность таким же обязательным навыком, как чтение.</li></ul><p>Как показали проекты типа Skillbox или «ТопБЛОГ», молодежь готова учиться — если давать не абстрактные теории, а практические инструменты. Осталось сделать этот запрос системным.</p><p>Главный вывод прост: образование должно готовить не к экзаменам, а к реальной жизни. Когда диплом перестанет быть самоцелью, а станет подтверждением навыков, мы наконец преодолеем разрыв между количеством «образованных» и качеством их знаний. Пока же каждый может начать с себя — развивать привычку проверять информацию и учиться не для галочки, а для понимания мира.</p>]]></content:encoded>
    </item>
    <item>
      <title>Geeks do it better: как прошла конференция GoCloud 2025 от Cloud.ru</title>
      <link>https://tproger.ru/articles/geeks-do-it-better--kak-prowla-konferenciya-gocloud-2025-ot-cloud-ru</link>
      <comments>https://tproger.ru/articles/geeks-do-it-better--kak-prowla-konferenciya-gocloud-2025-ot-cloud-ru?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Анна Ельцова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/geeks-do-it-better--kak-prowla-konferenciya-gocloud-2025-ot-cloud-ru</guid>
      <description><![CDATA[<p>Недавно мы побывали на большой конференции по облакам и искусственному интеллекту GoCloud, которую ежегодно проводит Cloud.ru. Делимся итогами конференции и рассказываем, как компании удается создавать топовые облачные сервисы и драйвить коммьюнити.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/geeks-do-it-better--kak-prowla-konferenciya-gocloud-2025-ot-cloud-ru">Geeks do it better: как прошла конференция GoCloud 2025 от Cloud.ru</a>»</p>]]></description>
      <category><![CDATA[API]]></category>
      <category><![CDATA[Open Source]]></category>
      <category><![CDATA[Инструменты]]></category>
      <category><![CDATA[Безопасность]]></category>
      <category><![CDATA[Производительность]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Конференции]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[DevOps]]></category>
      <category><![CDATA[Сервисы]]></category>
      <category><![CDATA[Docker]]></category>
      <category><![CDATA[Облачные технологии]]></category>
      <category><![CDATA[Анализ данных]]></category>
      <category><![CDATA[Сервер]]></category>
      <category><![CDATA[Kubernetes]]></category>
      <category><![CDATA[Инновации]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Разработка]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 23 Apr 2025 11:15:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>Cloud.ru — лидер рынка облачных сервисов и AI-технологий, который делает доступ к облакам и искусственному интеллекту простым и удобным. В прошлом году компании исполнилось пять лет — за это время Cloud.ru из облачного технологического стартапа вырос до провайдера, который предлагает больше 100 IaaS- и PaaS-сервисов. Они охватывают практически любые задачи и сценарии использования клиентами облачных технологий: инфраструктурные сервисы, платформенные решения, инструменты для разработки, хранения и обработки больших данных и работы с ИИ в облаке.</p><p>Сейчас рынок облачных сервисов — крайне перспективная отрасль. В России процент проникновения облачных услуг по данным провайдера — всего 28%, поэтому возможности для роста очень большие.10 апреля компания провела масштабную конференцию, которую посетили более 5500 айтишников онлайн и офлайн. На открытии GoCloud 2025 топ-менеджеры представили новую платформу для работы с данными, AI-решения, заявили о внедрении AI-агентов в свои платформы, а также рассказали, что такое гибридное облако, почему искусственный интеллект нужен почти всем компаниям, а главное — какие релизы Cloud.ru готовит в будущем.</p><p>На конференции было три трека:</p><ol><li><b>Инфраструктура и сервисы</b> — здесь спикеры Cloud.ru рассказывали о новых сервисах и платформах, особенно про публичное облако Cloud.ru Evolution</li><li><b>AI&amp;ML</b> — был посвящен новым AI-фичам и работе с ML-моделями, которые улучшат клиентский опыт и упростят жизнь разработчикам и пользователям</li><li><b>Сценарии работы в облаке</b> — здесь выступали спикеры из крупных компаний и делились своим опытом использования облаков.</li></ol><p>В статье рассказываем о главных анонсах Cloud.ru и итогах конференции.</p><h2>Что нового в Cloud.ru Evolution</h2><p><a href="https://cloud.ru/evolution?utm_source=tproger&amp;utm_medium=pr_article&amp;utm_campaign=gocloud2025_review">Cloud.ru Evolution</a> — публичное облако, построенное на собственных разработках и open source, где интегрированы самые необходимые разработчикам сервисы.</p><p>На прошлой конференции в 2024 году Cloud.ru уже успели представить много новых компонентов в платформе — тогда в ней было доступно 20 сервисов. За год ей воспользовались 39 тыс. человек, а число сервисов выросло в 2 раза.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-04-23/393169d9-8660-44f7-9e96-954c47c1a3d3.jpeg" alt="" /><figcaption>Все сервисы в Cloud.ru Evolution</figcaption></figure><p>В мае этого года пользователям будут доступны новые платформенные сервисы для работы с большими данными в облаке. Они работают по модели PaaS, используют контейнерную архитектуру и предлагают автомасштабирование, гибкость и безопасность. Сервисы упрощают обработку и анализ данных, подходят для AI/ML-задач, интегрируются с S3, Artifactory Registry и Evolution DBaaS.</p><p>Некоторые из них можно попробовать уже сейчас:</p><ul><li><a href="https://cloud.ru/products/evolution-managed-arenadatadb?utm_source=tproger&amp;utm_medium=pr_article&amp;utm_campaign=gocloud2025_review">Evolution Managed Arenadata DB</a> — это управляемая PaaS-база на Greenplum для хранения и обработки до 50 ТБ данных. Подходит для аналитики, AI/ML, отчетности, а оплата проходит по модели pay-as-you-go.</li><li><b>Evolution Data Platform</b> — это платформа от Cloud.ru для работы с большими данными. Уже можно протестировать: Evolution Managed Trino — SQL-движок для работы с разными источниками данных, Evolution Managed Metastore — хранилище метаданных, Evolution Managed Spark — сервис для распределенной обработки данных.</li></ul><p>Evolution Managed Trino и Metastore выйдут в коммерческий доступ во втором квартале 2025, а Evolution Managed Airflow и Evolution Managed BI станут доступны для тестирования.</p><p>Также в Cloud.ru Evolution появится AI-помощник, который будет закрывать базовые задачи.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-04-23/1aa772ea-38a5-497a-ac63-3db7fa0cd040.png" alt="" /></figure><blockquote>Помощник должен автоматизировать рутинные задачи и максимально снизить порог входа в облака и работу с ними, в перспективе значительно упростит работу DevOps. Всю ответственность за то, что он делает, будем нести мы, как провайдер. Помощник будет эволюционировать и закрывать все больше рутинных задач: реагировать на alert и monitoring, следить за автоматизацией, а в будущем поможет управлять эффективностью облачной инфраструктуры, ее масштабированием и стабильностью. С момента запуска помощники будут доступны в публичных, гибридных и частных облаках Cloud.ru.</blockquote><h2>Cloud.ru Evolution Stack + AI — один из главных анонсов конференции</h2><p>В марте Cloud.ru выпустили на рынок <a href="https://cloud.ru/evolution-stack?utm_source=tproger&amp;utm_medium=pr_article&amp;utm_campaign=gocloud2025_review">Cloud.ru Evolution Stack</a> — платформу для создания частных и гибридных облаков. Решение рассчитано на крупный бизнес, госсектор, финтех, ритейл и промышленность. Платформу можно развернуть в собственном ЦОДе или объединить с публичным облаком Cloud.ru Evolution. Внутри — всё, что нужно: виртуализация, инструменты для работы с ML, PaaS- и IaaS-сервисы, управляемый Kubernetes, S3-хранилище, очереди сообщений и даже витрина приложений в формате маркетплейса.</p><p>Для удобства администрирования есть Multicloud Manager и VM Manager — с их помощью проще управлять виртуальными машинами, следить за инфраструктурой, учитывать ресурсы и подключать SIEM-системы для безопасности.</p><blockquote>Cloud.ru Evolution Stack — наше самое большое достижение за год. Мы создавали его из одной кодовой базы с публичным облаком Cloud.ru Evolution, но пришлось серьезно перестроить процессы. Циклы разработки каждой из платформ отличаются. В публичном облаке можно деплоить непрерывно: если в одном из сервисов появилась ошибка, ее можно сразу же исправить. А в гибриде, релиз которого мы делаем два раза в год, так не получится, поскольку на первый план выходят качество сборки, unit-тесты, интеграционные и нагрузочные тестирования. Процесс разработки усложнился, но мы максимально автоматизировали его. Это серьезная нагрузка, но без серьезного влияния на наш time-to-market.</blockquote><p>При разработке Cloud.ru Evolution Stack главным вызовом была смена подхода. Cloud.ru создает софт для одного публичного облака, а здесь нужен продукт, который можно ставить многократно у разных заказчиков — это радикально меняет процессы и мышление команды. Однако понимая запросы рынка на гибрид и потребности клиентов, компания начала разработку этой платформы еще на ранней стадии Cloud.ru Evolution. Если бы решение было старше, переход на дистрибутив съел бы гораздо больше времени и ресурсов.</p><p>Многие пользователи уже успели протестировать Cloud.ru Evolution Stack. Вот положительные фидбек:</p><ul><li>Платформа предлагает не только виртуализацию и контейнеризацию, но и полный набор сервисов — аудит, IAM, логирование, мониторинг. Это позволяет сразу запускать частное облако для внутренних подразделений без необходимости настраивать личные кабинеты или доступы.</li><li>Платформа легко интегрируется с системами мониторинга, кибербезопасности и авторизации заказчика, выступая как подчинённый компонент, что упрощает внедрение.</li><li>Интерфейс Cloud.ru Evolution Stack полностью кастомизируется — можно красить во всевозможные цвета, поставить свой логотип и так далее.</li></ul><blockquote>Cloud.ru Evolution Stack — мощная платформа со множеством функций, которые расширяют возможности собственной IT-инфраструктуры компаний за счет сервисов публичного облака. Решение может сначала озадачить, но мы всегда рядом: помогаем заказчикам разобраться, обеспечиваем эксплуатацию и полное сопровождение.</blockquote><p>Приступая к работе над Cloud.ru Evolution Stack, поменялись и подходы к продуктовой разработке. Главное — начали сертификацию процесса безопасной разработки по стандарту РБПО, чтобы соответствовать требованиям к надежности и безопасности ПО для критически важных систем. Это ускорит сертификацию Cloud.ru Evolution Stack для крупных заказчиков с полугода-года до квартала.</p><p>На GoCloud Cloud.ru анонсировали <b>Evolution Stack AI-bundle</b> — новую платформу для локального запуска AI-сервисов. Платформа упрощает разработку и масштабирование AI-продуктов, сохраняя полный контроль над данными. По сути, это первое в России гибридное облако с поддержкой AI.</p><p>Что внутри:</p><ul><li>Jupyter Lab для дата-сайентистов;</li><li>инструменты для обучения, дообучения и инференса моделей;</li><li>инфраструктура — Managed Kubernetes с GPU, реестр артефактов, виртуалки с GPU, S3-хранилище и файловая система для ML.</li></ul><p>Платформа гибкая: можно обучать модели в публичном облаке, а инференс запускать в закрытом контуре on-prem или переключаться при нагрузках. Она поддерживает мультитенантность, мониторинг и управление доступом. Плюс, её можно дополнить другими сервисами Cloud.ru для комплексных решений.</p><p>Cloud.ru Evolution Stack AI-bundle входит в реестр российского ПО, соответствует требованиям импортозамещения и будет доступна как софт или программно-аппаратный комплекс по подписке.</p><h2>AI, ML и облака (не роботы)</h2><p>Из других больших анонсов — <b>Cloud.ru</b> <b>Evolution AI Factory.</b> Это новая платформа для создания приложений и AI-агентов в облаке, запускать планируют этим летом.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-04-23/457415d5-f313-4bd5-91e1-0d3b014131e0.png" alt="" /></figure><p>По своей сути, это цифровая «фабрика», которая объединяет инструменты для работы с искусственным интеллектом — от обучения моделей до запуска сложных мультиагентных систем. Вот, что внутри:</p><ul><li><a href="https://cloud.ru/products/evolution-ml-inference?utm_source=tproger&amp;utm_medium=pr_article&amp;utm_campaign=gocloud2025_review">Evolution ML Inference</a> — с помощью нее можно запускать ML-модели (Hugging Face, Docker-образы) на GPU с поддержкой vLLM, TGI, Ollama, Diffusers, Transformers. Использует Shared GPU, то есть использует столько ресурсов, сколько нужно, для запуска модели.</li><li><b>Foundation Models</b> — доступ к популярным моделям, вроде GigaChat и Gemma, плюс среда AI Playground для тестирования идей.</li><li><b>AI Assistants</b> — создание агентов с подключением к внешним системам и автоматизацией задач.</li><li><b>Cloud.ru ML Space</b> — платформа для глубокого обучения, работает в облаке и on-premise.</li></ul><p>Платформа делает работу с AI <b>проще и доступнее.</b> Не нужно быть экспертом в программировании или тратить кучу денег на серверы — всё уже готово в облаке. Она помогает компаниям быстрее создавать свои AI-продукты: агентов, аналитические системы или что-то совсем кастомное. Внутри будут встроенные ассистенты — новички могут легко собрать целое приложение, а профи — все кастомизировать. Это экономит время, снижает затраты на инфраструктуру и ускоряет запуск новых идей на рынок.</p><p>Ещё одно преимущество — <b>гибкость</b>. Платформа подходит для самых разных задач: от проверки гипотез до создания сложных корпоративных решений — и все в одном месте.</p><p>В Cloud.ru считают, что за нейронками — будущее. И компания уже видит эффект: разработчики активно используют AI-инструменты в задачах, которые не требуют креатива и разработки критических сервисов. Правда, измерить этот эффект пока непросто — слишком уж разные задачи и технологии.</p><blockquote>Я точно знаю, что AI помогает в разработке: используют code assistant, применяют CoPilot. Разработчики уже не представляют работу без него — это как Google лет 15 назад, когда им еще не все широко пользовались, а сейчас он у всех в смартфоне. AI помогает развиваться, ускоряет выполнение ежедневных задач. То, что раньше делали месяц, теперь можно уложить в две недели.</blockquote><h2>Что будет дальше: планы Cloud.ru</h2><p>В 2025 году Cloud.ru продолжат развивать собственные облачные платформыи PaaS . Сейчас запросы российского бизнеса, особенно крупных B2B-клиентов, часто совпадают с западными стандартами, так как многие из них уже работали с крупнейшими облачными провайдерами. Помимо базовых требований к надежности и безопасности, заказчики ждут продвинутых решений.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-04-23/23a10643-5754-4cb4-81a0-d919fff6bf92.png" alt="" /></figure><blockquote>Три четверти нашего бэклога — это запросы заказчиков, а четверть — инновации и создание трендов. У нас в России требовательные клиенты, особенно крупные B2B-компании, и они знают, что такое хорошее облако. Помимо надежности и кибербезопасности им нужны продвинутые инструменты — AI, Big Data, высокая производительность. Cloud.ru AI Factory — наш главный фокус, до конца года мы выпустим много новых сервисов. Cloud.ru Evolution Stack будем тиражировать в продакшен, чтобы помогать бизнесу.</blockquote><p>А ещё Cloud.ru продолжит прокачивать <b>AI-комьюнити</b> — компания предоставляет открытую экосистему для вендорских продуктов. В ней можно создавать конкурентные решения, например, fully-managed сервисы в Cloud.ru Evolution с помощью Partner API. Так вход в облачные технологии становится еще проще и удобнее.</p><p><i>Реклама. Рекламодатель: ООО «Облачные технологии», ИНН 7736279160, erid: 2W5zFJ5hRC4.</i></p>]]></content:encoded>
    </item>
    <item>
      <title>Язык Julia: что это и почему он популярен в научных вычислениях</title>
      <link>https://tproger.ru/articles/yazyk-julia--chto-eto-i-pochemu-on-populyaren-v-nauchnyh-vychisleniyah</link>
      <comments>https://tproger.ru/articles/yazyk-julia--chto-eto-i-pochemu-on-populyaren-v-nauchnyh-vychisleniyah?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Денис Кудерин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/yazyk-julia--chto-eto-i-pochemu-on-populyaren-v-nauchnyh-vychisleniyah</guid>
      <description><![CDATA[<p>Что такое язык Julia. Показываем сравнение языка Джулия с другими. Рассматриваем преимущества и основные нюансы ✔ Tproger</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/yazyk-julia--chto-eto-i-pochemu-on-populyaren-v-nauchnyh-vychisleniyah">Язык Julia: что это и почему он популярен в научных вычислениях</a>»</p>]]></description>
      <category><![CDATA[C++]]></category>
      <category><![CDATA[Многопоточность]]></category>
      <category><![CDATA[Инструменты]]></category>
      <category><![CDATA[Производительность]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Опрос]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Работа]]></category>
      <category><![CDATA[Tor]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Анализ данных]]></category>
      <category><![CDATA[QA]]></category>
      <category><![CDATA[Сервер]]></category>
      <category><![CDATA[Библиотеки]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 11 Apr 2025 14:20:31 GMT</pubDate>
      <content:encoded><![CDATA[<p>Согласно <a href="https://www.tiobe.com/tiobe-index/">индексу TIOBE</a>, Julia входит в топ-50 самых актуальных языков программирования в 2025 году и занимает в рейтинге 34-ю строчку.</p><p>Julia получил признание благодаря универсальности, скорости, понятному синтаксису и множеству других достоинств, о которых мы расскажем в статье. Этот идеальный вариант для научных вычислений в любых отраслях — от анализа огромных массивов данных до расчетов прочности архитектурных объектов.</p><p>Узнаем, каковы особенности и преимущества языка программирования Julia, почему он популярен в научных вычислениях, чем отличается от других топовых языков и где применяется.</p><h2>Основные особенности языка Julia</h2><p>Язык программирования с романтическим женским именем был создан в 2012 году профессором Массачусетского технологического института Аланом Эдельманом в сотрудничестве с группой студентов. Инструмент изначально разрабатывался с прицелом на использование в научных вычислениях. По замыслу команды, язык должен был занять нишу, в которой находились MATLAB с его многочисленными клонами и R, а также совместить удобство и простоту Python с производительностью С++ и Fortran.</p><p>Растущая популярность Julia демонстрирует, что планы разработчиков были по большей части реализованы. И хотя этот язык еще продолжает развиваться и совершенствоваться, уже сейчас его возможности широко используются для сложных математических вычислений, анализа данных и машинного обучения. Последнее направление приобретает все большую актуальность, поскольку нейросети и технологии на основе ИИ внедряются во все нашей сферы жизни и нуждаются в корректном, эффективном и быстром обучении.</p><p>Julia действительно устраняет разрыв между высокоуровневыми интерпретируемыми и низкоуровневыми компилируемыми языками, демонстрируя высокую производительность без утраты простоты применения и продуктивности. В числе других достоинств языка — поддержка многопоточности и параллелизма.</p><p>Рассмотрим более подробно главные плюсы Julia.</p><h2>Скорость и производительность</h2><p>Скорость, которая напрямую определяет производительность, входит в число ключевых преимуществ языка. Показатель в первую очередь обусловлен наличием компилятора, работающего в формате Just-In-Time. Это позволяет создавать эффективный нативный код, который обеспечивает работу сложных алгоритмов на реальном оборудовании.</p><p>Как это реализуется на практике? Представьте, что вам нужно перемножить две огромные матрицы или промоделировать климат в Московской области на 50 лет вперед. На Python это может занять часы, на C — требует тонн низкоуровневого кода. Julia справляется с такими задачами почти так же быстро, как C, но с лаконичностью Python.</p><p>Julia не интерпретирует код построчно, как Python, а сразу компилирует его в эффективный машинный код, как это делает C. Это дает ускорение в 10–100 раз в сравнении с чисто интерпретируемыми языками.</p><p>Скорость особенно актуальна в  машинном и глубоком обучении. Ускоренная обработка обширных массивов данных и такие же быстрые сложные вычисления существенно ускоряют разработку инструментов на основе нейросетей.</p><p>Вот несколько фактов, чтобы вы не сомневались в производительности Julia:</p><ul><li>NASA использует Julia для моделирования полетов — код работает в 15 раз быстрее, чем предыдущая версия на Python + Cython.</li><li>В тестах линейной алгебры Julia обгоняет Python (NumPy) в 2–3 раза, а с нативными типами — почти догоняет C.</li><li>Пакет DifferentialEquations.jl решает сложные уравнения в 100 раз быстрее SciPy (Python).</li></ul><ul><li>Обучение нейросетей (Flux.jl) ускоряется в 3–5 раз против Python + TensorFlow/PyTorch.</li><li>Анализ геномов в биоинформатике занимает минуты вместо часов.</li></ul><p>При этом скорость Julia не наносит ущерба удобству применения.</p><h2>Гибкость</h2><p>Качество языка, которое часто называют «дружелюбием», позволяет юзерам без особых проблем осваивать и использовать Julia для решения самого широкого круга задач. Тем, кто знаком с Python или MATLAB, перейти на Джулию еще проще.</p><p>При этом высокоуровневый синтаксис позволяет выражать сложные алгоритмы минимальными средствами. Лаконичность языка делает его предельно доступным для изучения.</p><p>В Julia можно присваивать переменные, не объявляя их тип, при этом язык поддерживает все широко используемые алгоритмические структуры и способы хранения данных (словари, матрицы). Для работы со сложными типа данных есть бесплатные библиотеки.</p><h2>Мощная экосистема пакетов</h2><p>Для Julia создано огромное количество библиотек и фреймворков, существенно расширяющих ее функциональность.</p><p>Обратите внимание на эти инструменты:</p><ul><li>Flux, MLJ и Knet — написанные на Julia пакеты для глубокого обучения. Позволяют создавать многослойные нейросети и модели непосредственно на этом языке.</li><li>DataFrames.jl — набор фреймворков для работы с данными. Выполняет те же задачи, что и Pandas для Python. Включает полезные и высокоэффективные инструменты для управления данными и их анализа.</li><li>JuliaImages — пакет библиотек для работы с изображениями. Включает инструменты для загрузки, обработки и трансформации картинок.</li><li>Jump.jl — специализированный язык моделирования, интегрированный в Julia. Предназначен для математической оптимизации с использованием линейного, нелинейного и комбинированного программирования.</li></ul><p>Это лишь несколько примеров специальных пакетов. На практике можно найти десятки других инструментов в зависимости от поставленных задач.</p><h2>Поддержка многопоточности и параллельных вычислений</h2><p>Многопоточность обеспечивает языку Julia мощность без сложностей. Если требуется выполнить масштабные вычисления, можно задействовать все ядра процессора одновременно. Julia делает это настолько просто, что даже новичок сможет ускорить свой код в разы.</p><p>В отличие от Python, где многопоточность требует сложных библиотек, в Julia она встроена в сам язык. Чтобы запустить этот процесс, достаточно одной строки:</p><p>Что дает языку многопоточность «из коробки»:</p><ul><li>Ускорение в N раз (где N — число ядер). Например, на 8-ядерном процессоре тяжелый цикл выполнится почти в 8 раз быстрее.</li><li>Никаких заморочек с разделением памяти — Julia сама позаботится о корректности.</li></ul><p>Кроме того, Julia умеет распределять задачи даже между несколькими серверами. Это полезно в машинном обучении для параллельной обработки датасетов, в физическом моделировании, в финансовой сфере — обеспечивает моментальный анализ рисков для тысяч инвестиционных портфелей.</p><p>Благодаря параллелизму Джулия существенно опережает в скорости R/MATLAB. Даже в специализированных математических пакетах параллельные вычисления часто требуют сложной настройки. В Julia это 2–3 строки кода.</p><h2>Развитое сообщество</h2><p>Когда вы только начинаете работать с новым языком, важно знать, что у вас есть поддержка — и тут Julia выигрывает у многих конкурентов. За последние 10 лет вокруг языка сформировалось активное сообщество ученых, инженеров и разработчиков, которые не только пишут код, но и помогают новичкам.</p><p>Вот почему это важно:</p><ul><li>Быстрая помощь. На <a href="https://discourse.julialang.org/">официальном форуме</a> и в чатах вам ответят даже на базовые вопросы — без снисходительности, характерной для некоторых других языков.</li><li>Готовые решения. В <a href="https://juliapackages.com/">реестре пакетов</a> уже есть 7 000+ библиотек для всего — от машинного обучения до астрофизики.</li><li>Открытость. Создатели Julia сами участвуют в обсуждениях, а многие пакеты разрабатываются университетами (MIT, Stanford) и компаниями (NASA, IBM).</li></ul><p>Пример: если вы застряли с дифференциальными уравнениями, просто спросите в чате — и с вероятностью 90% вам ответит либо автор пакета DifferentialEquations.jl, либо кто-то, кто уже решил такую же проблему.</p><p>Сообщество Julia — это редкий случай, когда «экспертность» не означает «закрытость». Здесь ценят и новичков, потому что каждый когда-то начинал с “Hello World”.</p><h2>Почему Julia популярен в научных вычислениях</h2><p>Представьте язык, который понимает ваши математические формулы буквально с полуслова. Julia родился именно таким — как универсальный инструмент для ученых, уставших выбирать между «понятно» и «быстро».</p><p>Вот что делает его особенным:</p><ul><li>пишете, почти как в тетради: 2x + 3y вместо 2*x + 3*y;</li><li>получаете скорость как у Фортрана, без головной боли с компиляцией;</li><li>матричные операции летают в разы быстрее, чем в Python;</li><li>сложные дифференциальные уравнения решаются за пару секунд.</li></ul><p>Секрет успеха — в продуманной начинке:</p><ul><li>встроенные суперспособности для математики;</li><li>может растягивать вычисления на все ядра процессора;</li><li>легко подключает библиотеки Python, R и даже C.</li></ul><p>При этом Julia универсален: подходит биологам для анализа ДНК, физикам, моделирующим квантовые системы, архитекторам, вычисляющим прочностные параметры конструкций. Библиотека Flux.jl строит нейросети быстрее PyTorch, а DataFrames.jl обрабатывает гигабайты данных без тормозов.</p><p>Это не просто язык — это турбодвигатель для научных открытий. Хотите говорить с компьютером на языке математики? Julia станет вашим переводчиком.</p><h2>Сравнение Julia с другими языками</h2><p>Чтобы в полной мере оценить особенности языка Julia, сравним его с ближайшими конкурентами.</p><h2>Julia vs Python</h2><p>Python по праву считается универсальным языком программирования — он прост в освоении, обладает огромным количеством библиотек и поддерживается многомиллионным сообществом разработчиков. Однако когда речь заходит о сложных численных расчетах и высокопроизводительных вычислениях, Julia предлагает ряд неоспоримых преимуществ.</p><p>Главное достоинство Julia — его фокусировка на научных задачах. Этот язык создавался специально для работы с большими объемами данных и сложными математическими операциями. Хотя комьюнити Julia пока меньше python-сообщества, оно состоит преимущественно из специалистов в области Data science, физики и математического моделирования.</p><p>При этом Julia не исключает использование Python. Напротив, благодаря встроенным инструментам взаимодействия — таким как PyCall, разработчики могут комбинировать сильные стороны обоих языков. Использовать Julia для ресурсоемких вычислений, а Python — для других компонентов системы. Такой симбиоз позволяет достичь максимальной эффективности в научных проектах.</p><p>При этом Julia превосходит Python в скорости, имеет более удобный для математиков синтаксис. Параллелизм в Джулия встроенный — для Питона придется использовать сторонние библиотеки.</p><h2>Julia vs R</h2><p>R уже много лет остается верным помощником статистиков — его создавали специально для работы с данными, и в этом он действительно хорош. Но сегодня на сцену выходит Julia — современный язык, который сочетает удобство R с невероятной скоростью работы.</p><p>Те же операции с таблицами данных Julia выполняет в несколько раз быстрее. Если R справляется с задачей за минуту, Julia сделает это за 15-30 секунд. А когда дело доходит до сложных расчетов — разница становится еще заметнее.</p><p>Что действительно выделяет Julia:</p><ul><li>Это не просто язык для статистики, а полноценная платформа для научных вычислений.</li><li>Можно работать с искусственным интеллектом, физическими моделями и даже квантовыми вычислениями.</li><li>При этом сохраняется доступ ко всем привычным R-библиотекам.</li></ul><p>Для тех, кто только начинает погружаться в анализ данных, Julia — отличный выбор. Вам не придется сначала осваивать R для простых задач, а потом переучиваться на другие языки для сложных вычислений. Все есть в одном месте — от базовой статистики до работы с большими данными.</p><h2>Julia vs MATLAB</h2><p>MATLAB долгие годы был как дорогой швейцарский нож для ученых и инженеров — удобный, но привязанный к лицензии. А теперь представьте, что появился инструмент с теми же возможностями, но бесплатный и который можно модифицировать под свои нужды. Это Julia.</p><p>Скорость работы — первое, что замечают при переходе. Типичные расчеты в Julia идут на пятую-треть быстрее. А когда дело доходит до сложных проектов, разница становится еще заметнее.</p><p>Но главная магия — в экосистеме:</p><ul><li>7000+ бесплатных пакетов вместо платных тулбоксов;</li><li>возможность заглянуть «под капот» любого алгоритма;</li><li>сообщество, которое постоянно добавляет что-то новое.</li></ul><p>Синтаксис намеренно сделали похожим на MATLAB — переход ощущается как смена автомобиля той же марки на новую модель. Все знакомо, но едет быстрее и без ограничений по пробегу.</p><p>Для студентов это просто подарок — мощный инструмент без дорогой подписки. А для научных групп — возможность делиться кодом без оглядки на лицензии. Julia не просто догоняет MATLAB, она задает новые стандарты в научных вычислениях.</p><h2>Julia vs C++</h2><p>Если снова воспользоваться сравнением из автомобильной тематики, то C++ — это ручная коробка передач в мире программирования. Можно выжать максимум скорости, но каждая строчка кода требует ювелирной работы с памятью и указателями. Julia предлагает другой подход — это автоматическая трансмиссия, которая разгоняется почти так же быстро, но без головной боли.</p><p>Секрет Julia — умный переводчик (JIT-компилятор), который:</p><ul><li>в реальном времени превращает ваш код в машинные инструкции;</li><li>сам решает, как оптимально использовать память;</li><li>не заставляет вас ковыряться в низкоуровневых деталях.</li></ul><p>Разница особенно заметна в математических задачах. В Джулии не нужно приписывать все детали реализации в отличие от C++.</p><h2>Примеры кода на Julia</h2><p>Эти примеры демонстрируют все преимущества Julia в сфере математических вычислений.</p><h2>Вычисление факториала</h2><p>Это действительно просто:</p><p>Для больших чисел (n &gt; 20) стоит использовать factorial(big(n)), что автоматически переключает вычисления на длинную арифметику.</p><h2>Матричные операции</h2><p>Julia создан для работы с матрицами и линейной алгеброй. Вот несколько примеров, демонстрирующих его выразительность и производительность.</p><p>Базовые операции с матрицами:</p><p>Решение системы линейных уравнений:</p><p>Julia предоставляет удобные инструменты для параллельных вычислений. Вот как можно легко распараллелить задачи:</p><h2>Где применяется Julia</h2><p>Сферы использования Julia в науке, бизнесе, ИТ и других отраслях практически не ограничены. Рассмотрим наиболее актуальные направления.</p><h2>Научные исследования</h2><p>Julia активно используется в фундаментальных и прикладных науках благодаря своей скорости и удобству для математических расчетов:</p><ul><li>В физике с его помощью моделируют квантовые системы (например, в пакете QuantumOptics.jl) и решают дифференциальные уравнения (DifferentialEquations.jl).</li><li>В биоинформатике Julia применяют для анализа ДНК и белковых структур.</li><li>В астрономии — для обработки данных телескопов и симуляции галактик. Например, NASA использует Julia для расчета траекторий космических аппаратов.</li></ul><h2>Финансовые вычисления</h2><p>В финансах Julia ценят за высокую производительность при работе с большими массивами данных. Банки и брокеры применяют его для:</p><ul><li>Алгоритмического трейдинга — быстрого тестирования стратегий.</li><li>Риск-анализа — моделирования кризисных сценариев.</li><li>Оптимизации портфелей — решения задач линейной алгебры с миллионами переменных.</li></ul><p>Пакеты вроде JuliaQuant и Temporal.jl делают его отличной альтернативой Python (Pandas) и R.</p><h2>Искусственный интеллект и машинное обучение</h2><p>Хотя Python все еще доминирует в ML, Julia набирает популярность в этой сфере благодаря:</p><ul><li>скорости — обучение моделей в Flux.jl (аналог PyTorch) иногда в 2–3 раза быстрее;</li><li>гибкости — можно легко комбинировать нейросети с численными методами.</li></ul><p>Например, Julia используют для обработки изображений в реальном времени. Пакет MLJ объединяет сотни алгоритмов в едином интерфейсе.</p><h2>Анализ данных и обработка больших массивов информации</h2><p>Julia идеален для работы с Big Data:</p><ul><li>DataFrames.jl предоставляет инструменты, знакомые пользователям Pandas/R, но работает быстрее.</li><li>Поддержка многопоточности и распределенных вычислений (через интерфейс DistributedArrays.jl) позволяет обрабатывать терабайты данных.</li></ul><p>Компании используют Julia для анализа страховых рисков, а ученые — для обработки огромного количества данных, полученных в процессе исследований.</p><h2>Итоги</h2><p>Julia — это не просто язык для академиков. Он уже используется в реальной сфере везде, где важны скорость, точность и масштабируемость. Уже сейчас мы наблюдаем, как MATLAB-разработчики массово переходят на Julia, устав от закрытой экосистемы, а научные группы выбирают Julia для сложных вычислений там, где Python слишком медленный.</p><p>Тренд только набирает обороты. Добавляются новые функции типа встроенной поддержка GPU, а количество вакансий для разработчиков на Julia, особенно в сфере машинного обучения, постоянно растет.</p><p>Ты точно программист, если читаешь это! Больше мемов, инсайтов и боли кодеров <a href="https://t.me/+ajgz7pDecB4xZTI6">тут</a>.</p>]]></content:encoded>
    </item>
    <item>
      <title>Сравниваем Pandas, Polars и PySpark: что выбрать аналитику?</title>
      <link>https://tproger.ru/articles/sravnivaem-pandas--polars-i-pyspark--chto-vybrat-analitiku-</link>
      <comments>https://tproger.ru/articles/sravnivaem-pandas--polars-i-pyspark--chto-vybrat-analitiku-?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Татьяна Жукова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/sravnivaem-pandas--polars-i-pyspark--chto-vybrat-analitiku-</guid>
      <description><![CDATA[<p>Pandas, Polars или PySpark — что выбрать для работы с данными? Вместе с Никитой Егоровым, ведущим аналитиком в МТС Диджитал, разбираем отличия, плюсы и минусы каждого инструмента.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/sravnivaem-pandas--polars-i-pyspark--chto-vybrat-analitiku-">Сравниваем Pandas, Polars и PySpark: что выбрать аналитику?</a>»</p>]]></description>
      <category><![CDATA[Производительность]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[SQL]]></category>
      <category><![CDATA[Аналитика]]></category>
      <category><![CDATA[аналитик]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 09 Apr 2025 10:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>В мире аналитики данных выбор правильного инструмента — ключ к эффективной и быстрой работе. Pandas, Polars и PySpark помогают обрабатывать большие объемы числовой информации, но каждый из них предназначен для разных сценариев. Если выбрать неподходящий инструмент, можно столкнуться с проблемами: скрипты будут работать медленно, потреблять слишком много памяти или вовсе падать с ошибками.</p><p>Вместе с Никитой Егоровым, ведущим аналитиком в МТС Диджитал и автором тг-канала<a href="https://t.me/data_analysis_it"> Дата аналитикс</a>, разберем, чем отличаются Pandas, Polars и PySpark, какие у них сильные и слабые стороны, и какой инструмент выбрать в зависимости от задач.</p><p>P.s. Если не видели <a href="https://tproger.ru/articles/kak-ponyat-particionirovanie--dwh-dlya-gumanitariev">первую часть</a> из нашей дата-серии, самое время исправить. Там рассказываем про партиционирование.</p><h2>Почему важно выбрать правильный инструмент для работы с данными?</h2><p>От выбора инструмента зависит не только удобство работы, но и производительность системы. Вот краткое сравнение трех решений:</p><ul><li>Pandas — идеален для небольших данных (до 1-3 ГБ). Простой, удобный, но начинает «задыхаться» на больших объемах.</li><li>Polars — работает в 1.5–10 раз быстрее Pandas за счет многопоточности и использования Rust. Отлично справляется с 7-25 ГБ, но требует больше памяти.</li><li>PySpark — создан для работы с огромными объемами данных (30+ ГБ). Позволяет распределять вычисления по кластерам, но сложнее в настройке.</li></ul><figure><img src="https://media.tproger.ru/user-uploads/102593/2025-04-09/bc3e2c44-b330-41d9-9d54-9744fdc2d816.png" alt="" /><figcaption>Тесты на CPU Intel i7-11800Н, 32 ГБ ОЗУ, данные синтетические</figcaption></figure><p><b>

Как понять, что ваш инструмент больше не справляется?</b></p><p>Если ваш скрипт выполняется дольше, чем вы пьете кофе, или падает с ошибкой MemoryError, пора задуматься о переходе на Polars или PySpark.</p><h2>Pandas: золотой стандарт для аналитиков</h2><h3>Почему Pandas остается первым выбором?</h3><p>Pandas — это удобство, простота и огромное количество готовых решений. Он идеально подходит для:</p><ul><li>Разведочного анализа данных (EDA) — позволяет понять структуру данных, выявить пропуски, выбросы и тренды.</li><li>Обработки файлов CSV/Excel до 1-3 ГБ.</li><li>Интеграции с библиотеками визуализации (Matplotlib, Seaborn).</li></ul><h3>Ограничения Pandas</h3><ul><li>Проблемы с памятью. Например, датафрейм весом ~20 ГБ уже вызовет MemoryError.</li></ul><ul><li>Скорость обработки. Данные объемом 1 ГБ при 32 ГБ ОЗУ и процессоре Intel Core i7 11800H обрабатываются за 12.4 секунды на синтетических данных.</li></ul><ul><li>Нагрузка на систему. При обработке 2-5 ГБ ваш ноутбук может начать перегреваться и замедлять работу.</li></ul><h2>Polars: быстрая и оптимизированная альтернатива Pandas</h2><h3>Почему Polars быстрее?</h3><p>Polars написан на Rust, а это компилируемый язык без накладных расходов, который выполняется в 10-100 раз быстрее, чем интерпретируемый Python. Полностью поддерживает многопоточность, что делает его значительно быстрее Pandas.</p><h2>Когда использовать Polars?</h2><ul><li>При обработке данных 5-30 ГБ (например, логи, транзакции).</li><li>Когда Pandas уже не справляется, но PySpark кажется избыточным.</li><li>Для SQL-подобных операций (group_by, join).</li></ul><h2>Недостатки Polars</h2><ul><li>Меньше документации и примеров — интеграция с Seaborn и Matplotlib отсутствует.</li><li>Некоторые методы работают иначе. Например, фильтрация в Pandas и Polars:</li></ul><p>Polars — это как Pandas, но после курса энергетиков — синтаксис похож, но под капотом всё оптимизировано и разогнано</p><h2>PySpark: для работы с огромными объемами данных</h2><h3>Когда использовать PySpark?</h3><ul><li>Если объем данных превышает 30 ГБ;</li><li>Если нужны распределенные вычисления (кластеры, облака);</li><li>Для потоковой обработки данных (например, Kafka + Spark).</li></ul><h3>Какие сложности у PySpark?</h3><ol><li>Требует JVM (Java), правильных версий Spark/Hadoop, совместимости Python-библиотек.</li><li>Нужно настраивать spark-defaults.conf, выделять память (spark.driver.memory, spark.executor.memory). Это особенно критично для больших данных.</li><li>Частые проблемы с путями, отсутствием классов Java (ClassNotFoundException), конфликтами версий.</li><li>Локальный режим ≠ продакшен. Локальный Spark (например, local[*]) не всегда корректно эмулирует кластер, что маскирует проблемы масштабирования.</li></ol><p>Нужно ли аналитикам учить PySpark, если они не работают с Big Data?
Если ваши данные умещаются в Excel — нет. Но если планируете работать с большими объемами или в BigTech, лучше изучить хотя бы основы.</p><h2>Какой инструмент выбрать аналитику?</h2><p>Исходя из сводной таблички, делаем вывод, какой минимальный набор инструментов должен знать аналитик в 2025 году:</p><figure><img src="https://media.tproger.ru/user-uploads/102593/2025-04-09/5912f5ef-2c2d-4c18-93b9-06065bcd8851.png" alt="" /></figure><ul><li>Pandas — обязательно.</li><li>Polars — желательно.</li><li>PySpark — если работаете с большими данными.</li></ul><p>Таким образом, выбирайте инструмент под задачу, а не под моду:</p><ul><li>Pandas — для разведочного анализа и небольших данных.</li><li>Polars — когда нужны скорость и многопоточность.</li><li>PySpark — для распределенных вычислений и огромных объемов данных.</li></ul><p>Понимание этих инструментов поможет работать эффективнее и выбирать правильные решения для каждой задачи.</p>]]></content:encoded>
    </item>
    <item>
      <title>Курсы по Big Data, включая онлайн-обучение для аналитиков больших данных</title>
      <link>https://tproger.ru/articles/kursy-po-big-data--vklyuchaya-onlajn-obuchenie-dlya-analitikov-bolwih-dannyh</link>
      <comments>https://tproger.ru/articles/kursy-po-big-data--vklyuchaya-onlajn-obuchenie-dlya-analitikov-bolwih-dannyh?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Анастасия Шишкина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kursy-po-big-data--vklyuchaya-onlajn-obuchenie-dlya-analitikov-bolwih-dannyh</guid>
      <description><![CDATA[<p>Самые лучшие курсы по Big Data. В предложенной подборке актуальные варианты обучения от проверенных школ, а так же рейтинги и цены на курсы для аналитиков Big Data</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kursy-po-big-data--vklyuchaya-onlajn-obuchenie-dlya-analitikov-bolwih-dannyh">Курсы по Big Data, включая онлайн-обучение для аналитиков больших данных</a>»</p>]]></description>
      <category><![CDATA[Алгоритмы и структуры данных]]></category>
      <category><![CDATA[Для начинающих]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Практика]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Образование]]></category>
      <category><![CDATA[Обучающие курсы]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 28 Mar 2025 18:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Освоить востребованное направление в области аналитики данных помогут Big Data курсы. Онлайн-обучение в этой области предоставляет возможность овладеть навыками работы с большими данными, что открывает перспективы для карьеры в таких сферах, как IT, финансы, маркетинг и многих других. На курсах обучат методам сбора, обработки и анализа данных, работе с распределенными системами и инструментами для обработки данных в реальном времени, что позволяет стать ценным специалистом в самых динамичных и высокооплачиваемых областях.</p><p>Совместно с экспертами<a href="https://kursfinder.ru/"> Kursfinder</a> я проанализировала более 80 предложений, чтобы отобрать 56 лучших курсов по Big Data. В начале статьи представлены 10 самых лучших, нам мой взгляд, учебных программ. Далее идет список из 19 курсов по Data Science, за ним следуют 11 курсов Power BI и 7 курсов по машинному обучению. В конце статьи вы найдете подборку бесплатных вариантов по изучению аналитики и дополнительную информацию о профессии специалиста по работе с большими данными. Полный список <a href="https://kursfinder.ru/big-data/">курсов по Big Data</a> вы найдете в каталоге Kursfinder.</p><h2>ТОП-10 лучших курсов по Big Data в 2026 году</h2><ol><li><a href="https://experts2.ru/PZakoj?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=1">Python, BI и BigData </a>от ProductStar — программа для изучения инструментов аналитики с нуля при поддержке ИИ-помощника.</li><li><a href="https://experts2.ru/dZHkfh?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=2">Менеджмент AI- и BigData-продуктов</a> от ProductStar — быстрый старт в профессии.</li><li><a href="https://experts2.ru/YxilFf?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=3">Большие данные (Big Data) и интернет вещей (IoT)</a> от МИПО — обучение в рамках профессиональной переподготовки специалистов.</li><li><a href="https://experts2.ru/zseJQl?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=4">Большие данные (Big Data) и интернет вещей (IoT)</a> от Профессионального стандарта — востребованная специальность в сжатые сроки.</li><li><a href="https://experts2.ru/pwQqbD?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=5">Аналитик данных</a> от Eduson Academy — обучение у топовых экспертов.</li><li><a href="https://experts2.ru/zaUXlx?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=6">Программирование для анализа данных</a> от Skypro — углубленный курс по бизнес-аналитике.</li><li><a href="https://experts2.ru/TcpsgA?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=7">Профессия Data Analyst</a> от GeekBrains — бесплатные консультации для успешного развития карьеры.</li><li><a href="https://experts2.ru/gnljXP?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=8">Аналитик данных</a> от Яндекс Практикум — курс с возможностью стажировки в компаниях-партнерах.</li><li><a href="https://experts2.ru/FrpbDy?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=9">Аналитик данных</a> от Skypro — комплексная программа с содействием в трудоустройстве.</li><li><a href="https://experts2.ru/VltrcW?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=10">Машинное обучение</a> от Skillfactory — магистратура с престижным дипломом МФТИ.</li></ol><p>Курсы адресованы тем, кто стремится освоить современные технологии обработки данных, машинное обучение, методы аналитики и визуализации. Big Data обучение подойдет как новичкам, желающим начать карьеру в Data Science, так и действующим аналитикам, разработчикам и специалистам смежных профессий для улучшения навыков и расширения компетенций.</p><h2>Онлайн-курсы по Big Data</h2><p><b>1.</b> <a href="https://experts2.ru/PZakoj?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=1">Python, BI и BigData</a> | <b>ProductStar</b></p><p>Онлайн-курс технологии Big Data не требует специальной подготовки и адресован широкой аудитории слушателей. Вы освоите высокоуровневый язык программирования Python, научитесь использовать язык запросов SQL и нейросети для работы с данными, сможете разрабатывать рекомендательные системы и визуализировать данные с помощью популярных инструментов Power BI и Tableau. В конце обучения выполняется финальный проект, который пополнит ваше профессиональное портфолио.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-03-24/3f54b63c-5c29-41f3-a454-e57e42c90c0d.png" alt="" /></figure><ul><li>Стоимость: 109 451 рублей</li><li>Длительность: 6 месяцев</li><li>Формат обучения: видеолекции, текстовые материалы, практические задания, работа над итоговым проектом</li><li>Сертификат: электронный диплом о прохождении обучения</li></ul><p><b>Кому подойдет:</b> новичкам для старта в аналитике, специалистам для систематизации знаний или перехода на новый карьерный уровень.</p><p><b>Преимущества:</b></p><ul><li>доступна оплата в рассрочку;</li><li>постоянно обновляемые учебные материалы;</li><li>обширная библиотека знаний по профессии;</li><li>отработка практических навыков составляет 70% учебного времени;</li><li>бонусные курсы по программированию, английскому языку, Google Sheets и Excel;</li><li>ИИ-помощник для эффективной учебы;</li><li>бесплатные консультации по развитию карьеры.</li></ul><p><b>Недостатки:</b></p><ul><li>без гарантии трудоустройства.</li></ul><p><b>Программа обучения:</b></p><ul><li>Введение в Python</li><li>Системы контроля версий</li><li>Разработка API</li><li>Анализ и визуализация с Yandex DataLens</li><li>Работа с Power BI и Tableau</li><li>SQL для анализа данных</li><li>Python и создание ML-моделей</li><li>Нейросети, NLP, рекомендательные системы</li></ul><p><a href="https://experts2.ru/PZakoj?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=1">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>2. </b><a href="https://experts2.ru/dZHkfh?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=2">Менеджмент AI- и BigData-продуктов</a> | <b>ProductStar</b></p><p>Онлайн-курс в интенсивном формате поможет за короткий срок освоить методы внедрения ML-задач и создания AI-стратегий, а также познакомит со спецификой взаимодействия с командами аналитиков, маркетологов и разработчиков. Участники научатся работать с большими данными, рассмотрят способы создания датасетов и их применением в машинном обучении. Отработка практических навыков выполняется на реальных кейсах IT-компаний.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-03-24/db6b1688-bb4f-4909-b5c1-50091d7a18bb.png" alt="" /></figure><ul><li>Стоимость: 45 540 рублей</li><li>Длительность: 2 месяца</li><li>Формат обучения: видеолекции, текстовые материалы, практические задания, работа над итоговым проектом</li><li>Сертификат: электронный диплом о прохождении обучения</li></ul><p><b>Кому подойдет:</b> для желающих точечно прокачать навыки работы с данными.</p><p><b>Преимущества:</b></p><ul><li>возможность быстрого старта в профессии;</li><li>обучение в индивидуальном темпе;</li><li>помощь ментора на весь период учебы;</li><li>наполнение портфолио выполненными проектами;</li><li>карьерные консультации.</li></ul><p><b>Недостатки:</b></p><ul><li>обратная связь от ментора может быть с задержкой.</li></ul><p><b>Программа обучения:</b></p><ul><li>Возможности ML для оптимизации бизнеса</li><li>Машинное обучение и ИИ-продукты</li><li>Внедрение задач машинного обучения</li><li>Создание и запуск датасетов, работа с моделями</li><li>Введение в SQL</li><li>Нейронные сети и рекомендательные системы</li><li>Методы анализа Big Data</li><li>Хранение, обработка и масштабирование данных</li></ul><p><a href="https://experts2.ru/dZHkfh?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=2">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>3.</b> <a href="https://experts2.ru/YxilFf?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=3">Большие данные (Big Data) и интернет вещей (IoT)</a> | <b>МИПО</b></p><p>Содержательный курс в рамках профессиональной переподготовки подойдет специалистам любого уровня, включая новичков. К обучению приглашаются слушатели со средним профессиональным или высшим образованием. Под руководством российских и зарубежных экспертов с многолетним опытом студенты научатся обрабатывать и анализировать большие объемы информации, работать с базами данных и интернетом вещей, познакомятся с digital-экономикой и методами цифровой трансформации. Выпускники могут претендовать на позиции аналитика Big Data или IoT-аналитика.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-03-24/590fa0a8-382a-486c-9567-c72b18f54ea2.png" alt="" /></figure><ul><li>Стоимость: 58 249 рублей</li><li>Длительность: 4 месяца</li><li>Формат обучения: лекции, онлайн-вебинары, текстовые материалы, упражнения, тесты</li><li>Сертификат: официальный диплом о переподготовке</li></ul><p><b>Кому подойдет: </b>начинающим специалистам любого профиля со средним профессиональным или высшим образованием, инженерам и тем, кто планирует сменить сферу деятельности.</p><p><b>Преимущества:</b></p><ul><li>учебная программа соответствует актуальным требованиям рынка;</li><li>доступна оплата в рассрочку;</li><li>можно обучаться в ускоренном темпе;</li><li>кураторская поддержка с обратной связью;</li><li>отработка практических навыков на реальных кейсах.</li></ul><p><b>Недостатки:</b></p><ul><li>нужно дождаться старта очередного потока обучения.</li></ul><p><b>Программа обучения:</b></p><ul><li>Работа с базами данных</li><li>Обработка и интерпретация данных</li><li>Цифровая экономика</li><li>Технологическое обновление бизнеса</li><li>Big Data</li></ul><p><a href="https://experts2.ru/YxilFf?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=3">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>4.</b> <a href="https://experts2.ru/zseJQl?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=4">Большие данные (Big Data) и интернет вещей (IoT)</a> | <b>Профессиональный стандарт</b></p><p>Big Data обучение с нуля подойдет для освоения востребованной профессии в сжатые сроки. Занятия в дистанционном формате охватывают современные технологии и методы работы с большими данными. Вы изучите особенности анализа и хранения информации, познакомитесь с инструментами визуализации данных, системного администрирования и возможностями их применения в бизнесе.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-03-24/674c35fa-c828-419a-9cb4-80cd7db7ab04.png" alt="" /></figure><ul><li>Стоимость: 18 000 рублей</li><li>Длительность: 3 месяца</li><li>Формат обучения: предзаписанные видеоуроки, учебники, дополнительные материалы, практические задания, тесты</li><li>Сертификат: диплом установленного образца о профессиональной переподготовке</li></ul><p><b>Кому подойдет: </b>желающим освоить новую инженерию в сфере Big Data.</p><p><b>Преимущества:</b></p><ul><li>доступная стоимость при высоком качестве обучения;</li><li>есть рассрочка оплаты;</li><li>соответствует требованиям профессиональных стандартов;</li><li>обучение без отрыва от работы;</li><li>помощь персонального куратора во время учебы.</li></ul><p><b>Недостатки:</b></p><ul><li>только для участников, имеющих среднее профессиональное или высшее образование.</li></ul><p><b>Программа обучения:</b></p><ul><li>Введение в профессию</li><li>Цифровая экономика и цифровая трансформация</li><li>Методы и системы обработки Big Data</li><li>Оборудование для хранения больших данных</li><li>Инструменты визуализации и презентация результатов</li><li>Аналитика и управление данными</li></ul><p><a href="https://experts2.ru/zseJQl?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=4">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>5. </b><a href="https://experts2.ru/pwQqbD?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=5">Аналитик данных</a> | <b>Eduson Academy</b></p><p>Качественный курс, разработанный топовыми аналитиками. Предназначен для освоения профессии с нуля. Для прохождения обучения достаточно школьных знаний математики. Изучаются основные инструменты анализа, обработки и визуализации Big Data, прогнозирование с помощью Python, создание базы данных, работа с SQL-запросами и применение различных видов аналитики. Также вы освоите методологию Agile и принципы командной работы, научитесь создавать информативные презентации, закрепите практические навыки на интерактивном тренажере.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-03-24/7df254d2-c0c0-4b3f-a123-71152ff5939f.png" alt="" /></figure><ul><li>Стоимость: 98 200 рублей</li><li>Длительность: 6 месяцев</li><li>Формат обучения: лекции, тренажеры, решение кейсов, домашние задания</li><li>Сертификат: удостоверение государственного образца о повышении квалификации, диплом о прохождении курса</li></ul><p><b>Кому подойдет: </b>новичкам без опыта в IT.</p><p><b>Преимущества:</b></p><ul><li>обучение в комфортном темпе;</li><li>более 70% учебы — практика на реальных задачах;</li><li>8 проектов для портфолио;</li><li>материалы курса и обновления доступны всегда;</li><li>годовая кураторская поддержка;</li><li>подготовка к собеседованиям;</li><li>гарантированное трудоустройство или возврат денег.</li></ul><p><b>Недостатки:</b></p><ul><li>набор группы под конкретную дату.</li></ul><p><b>Программа обучения:</b></p><ul><li>Задачи и сферы работы аналитика</li><li>Возможности Excel для обработки данных</li><li>Автоматизация работы</li><li>Анализ данных для бизнеса</li><li>Юнит-экономика и создание системы метрик</li><li>Описательная, диагностическая и маркетинговая аналитика</li><li>Проведение А/В-тестирования</li><li>SQL и Python для аналитика</li></ul><p><a href="https://experts2.ru/pwQqbD?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=5">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>6.</b> <a href="https://experts2.ru/zaUXlx?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=6">Программирование для анализа данных</a> | <b>Skypro</b></p><p>Курс ориентирован на новичков, желающих освоить популярные инструменты для работы с данными, включая Python и SQL. В программу включено изучение программирования, математической статистики, логики и бизнес-процессов. С помощью экспертов-аналитиков студенты научатся обрабатывать и анализировать большие массивы данных, работать с бизнес-метриками, отслеживать динамику рынка и тренды, проводить статистические тесты, формулировать и проверять гипотезы.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-03-24/4de4ab1d-127b-43a3-afa4-187bb966de6c.png" alt="" /></figure><ul><li>Стоимость: от 191 988 рублей</li><li>Длительность: определяется индивидуально</li><li>Формат обучения: уроки в видеоформате, онлайн-вебинары, упражнения</li><li>Сертификат: диплом о профпереподготовке</li></ul><p><b>Кому подойдет: </b>для обучающихся с нуля, независимо от предыдущего опыта работы.</p><p><b>Преимущества:</b></p><ul><li>стандартный или индивидуальный тариф;</li><li>возможно обучение в мобильном браузере;</li><li>общение с экспертами в формате Q&amp;A;</li><li>домашние задания с проверкой;</li><li>доступ к учебным материалам без ограничений по времени;</li><li>бесплатный годовой курс разговорного английского языка;</li><li>обучение работе с нейросетями — в подарок;</li><li>бесплатные консультации по старту и развитию карьеры;</li><li>помощь с трудоустройством.</li></ul><p><b>Недостатки:</b></p><ul><li>набор группы под конкретную дату;</li><li>гарантия трудоустройства только при обучении на индивидуальном тарифе.</li></ul><p><b>Программа обучения:</b></p><ul><li>Инструменты аналитики</li><li>Основы математической статистики</li><li>Обработка данных</li><li>Автоматизация работы с Big Data</li><li>Методы прогнозирования экономических показателей</li><li>Формулирование гипотез на основе данных</li></ul><p><a href="https://experts2.ru/zaUXlx?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=6">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>7. </b><a href="https://experts2.ru/TcpsgA?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=7">Профессия Data Analyst</a> | <b>GeekBrains</b></p><p>Углубленный курс, предназначенный для стартующих в аналитике данных с нуля. Под руководством опытных преподавателей вы научитесь применять продвинутые инструменты для сбора и обработки информации из различных источников, работать с Big Data, проверять гипотезы, проводить сплит-тестирование, визуализировать результаты анализа данных. После каждого теоретического занятия выполняются практические упражнения, а выполненный во время обучения проект пополнит ваше профессиональное портфолио.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-03-24/2dc4c24a-ef48-4512-817f-f46b6722284d.png" alt="" /></figure><ul><li>Стоимость: 133 416 рублей</li><li>Длительность: 12 месяцев</li><li>Формат обучения: онлайн-занятия, уроки в записи, практические упражнения, тесты, проектная работа</li><li>Сертификат: официальный сертификат о прохождении обучения</li></ul><p><b>Кому подойдет: </b>новичкам без специальных знаний.</p><p><b>Преимущества:</b></p><ul><li>беспроцентная рассрочка;</li><li>живое общение с преподавателями;</li><li>обратная связь от кураторов по результатам домашних заданий;</li><li>проекты для портфолио;</li><li>более 500 часов практики;</li><li>дополнительные курсы по основам математики и статистики;</li><li>помощь карьерных специалистов в подготовке к трудоустройству.</li></ul><p><b>Недостатки:</b></p><ul><li>обучение рассчитано на длительный период.</li></ul><p><b>Программа обучения:</b></p><ul><li>Знакомство с Data Science</li><li>Возможности Python для работы с данными</li><li>Язык запросов SQL</li><li>Методы прогнозирования</li><li>A/B-тестирование</li><li>Маркетинговая и продуктовая аналитика</li><li>Алгоритмы и структуры данных</li><li>BI-инструменты</li></ul><p><a href="https://experts2.ru/TcpsgA?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=7">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>8. </b><a href="https://experts2.ru/gnljXP?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=8">Аналитик данных</a>  |<b> Яндекс Практикум</b></p><p>Онлайн-курс с регулярно обновляемой программой и специалистами Яндекса в качестве наставников. Участники подробно узнают о профессии, освоят ключевые инструменты аналитики, включая Python, SQL и BI, изучат методы тестирования и способы визуализации данных, пройдут основы линейной алгебры, познакомятся с алгоритмами и машинным обучением. Предусмотрены стажировки у партнеров, выполнение проектов для портфолио, прохождение технических собеседований.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-03-24/2916612a-ef33-4a84-a5e7-6a4867506cd9.png" alt="" /></figure><ul><li>Стоимость: от 102 820 рублей</li><li>Длительность: от 7 месяцев</li><li>Формат обучения: интерактивный учебник, воркшопы, практические задания, работа над проектами</li><li>Сертификат: диплом о профессиональной переподготовке</li></ul><p><b>Кому подойдет: </b>начинающим с нуля и Junior-специалистам.</p><p><b>Преимущества:</b></p><ul><li>базовый или расширенный курс;</li><li>обучение можно совмещать с работой;</li><li>первые занятия доступны без оплаты;</li><li>актуальная учебная программа;</li><li>более 70% программы отводится практике;</li><li>онлайн-консультации с экспертами;</li><li>возможно пройти стажировку в компаниях-партнерах;</li><li>бесплатный курс по нейросетям для аналитиков;</li><li>содействие в трудоустройстве.</li></ul><p><b>Недостатки:</b></p><ul><li>нужно дождаться старта очередного потока обучения.</li></ul><p><b>Программа обучения:</b></p><ul><li>Функции и задачи аналитика данных</li><li>SQL и BI для работы с данными</li><li>Возможности Python для обработки и анализа данных</li><li>Продвинутая аналитика для бизнес-задач</li><li>Специализация по продуктовой или BI-аналитике</li></ul><p><a href="https://experts2.ru/gnljXP?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=8">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>9. </b><a href="https://experts2.ru/FrpbDy?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=9">Аналитик данных</a> | <b>Skypro</b></p><p>Онлайн-курс для желающих освоить профессию с нуля. Студенты учатся работать с данными, осваивают SQL, Python, Excel и Power BI. Программа предполагает выполнение практических заданий, мастер-классы с реальными кейсами, поддержку наставников, помощь в подготовке резюме и портфолио специалиста. Выпускники получают диплом о профессиональной переподготовке и содействие в трудоустройстве.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-03-24/5a466510-9656-405b-ad47-f5955b0df282.png" alt="" /></figure><ul><li>Стоимость: 169 596 рублей</li><li>Длительность: определяется индивидуально</li><li>Формат обучения: уроки в видеоформате, онлайн-вебинары, упражнения</li><li>Сертификат: диплом о профпереподготовке</li></ul><p><b>Кому подойдет: </b>новичкам без IT-образования и независимо от предыдущего опыта работы.</p><p><b>Преимущества:</b></p><ul><li>выбор из 2 тарифных планов;</li><li>живое общение с экспертами;</li><li>можно учиться с мобильного устройства;</li><li>проверка домашних заданий с ревью от преподавателей;</li><li>бессрочный доступ к материалам программы;</li><li>курсы по визуализации данных и английскому языку в подарок;</li><li>консультации со специалистами по развитию карьеры;</li><li>гарантия устройства на работу.</li></ul><p><b>Недостатки:</b></p><ul><li>набор группы под определенную дату;</li><li>трудоустройство гарантируется при обучении на более дорогом тарифе.</li></ul><p><b>Программа обучения:</b></p><ul><li>Введение в профессию</li><li>Инструменты и технологии для аналитики данных</li><li>Работа с данными и автоматизация процессов</li><li>Обработка больших массивов данных</li><li>Методы прогнозирования</li><li>Проверка гипотез</li><li>Виды тестирования</li></ul><p><a href="https://experts2.ru/FrpbDy?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=9">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>10. </b><a href="https://experts2.ru/VltrcW?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=10">Машинное обучение</a> | <b>Skillfactory</b></p><p>Онлайн-программа в рамках магистратуры МИФИ по направлению «‎Прикладная математика и информатика»‎ поможет с азов освоить работу с данными и ML-моделями. Вы научитесь разрабатывать системы прогнозирования и принятия решений, исследовать гипотезы, автоматизировать процессы с помощью технологий машинного обучения, собирать, обрабатывать и анализировать большие данные, проводить е A/B-тестов, применять инструменты маркетинговой аналитики и многое другое. Фундаментальный курс помимо содержательной теоретической базы включает интенсивное практическое обучение, которое позволит наработать опыт и создать профессиональное портфолио.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-03-24/5fa4d6fb-9ccd-472d-87cd-ff77f95ac220.png" alt="" /></figure><ul><li>Стоимость: 198 000 рублей за семестр</li><li>Длительность: 2 года</li><li>Формат обучения: предзаписанные материалы, онлайн-лекции, семинары, тесты, проекты, хакатоны, тренажеры</li><li>Сертификат: диплом магистра</li></ul><p><b>Кому подойдет:</b> специалистам без опыта в IT, выпускникам и действующим специалистам технических направлений.</p><p><b>Преимущества:</b></p><ul><li>удобное расписание;</li><li>обучение с нуля до продвинутого уровня;</li><li>актуальные учебные материалы;</li><li>преподаватели — эксперты в области Data Science и ML;</li><li>реальные кейсы от партнеров в качестве проектов для портфолио;</li><li>диплом престижного вуза;</li></ul><p><b>Недостатки:</b></p><ul><li>для поступления требуется диплом бакалавра или специалиста по любому направлению;</li><li>старт программы раз в год.</li></ul><p><b>Программа обучения:</b></p><ul><li>Программирование на Python</li><li>Математика для анализа данных</li><li>Сплит-тестирование</li><li>Машинное обучение</li><li>Внедрение ML-моделей</li><li>SQL для работы с базами данных</li><li>Big Data и рекомендательные системы</li></ul><p><a href="https://experts2.ru/VltrcW?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=10">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><h2>Еще 19 курсов по Data Science</h2><p>Предлагаю ознакомиться с подборкой курсов, охватывающих изучение современных технологий и аналитических методов для работы с данными.</p><ol><li><a href="https://experts2.ru/EqokLw?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">BIG DATA для менеджеров</a> от Product Live — онлайн-курс научит применять ИИ, большие данные и машинное обучение для оптимизации бизнес-процессов и повышения прибыли. Программа длится 6 месяцев и ориентирована на владельцев компаний, руководителей отделов и направлений. Участники научатся работать с фреймворками и датасетами, организовывать работу с DS-командой и планировать BD-проекты, решат 18 бизнес-кейсов, разберут внедрение искусственного интеллекта на реальном примере. Проводятся индивидуальные консультации с ментором.</li><li><a href="https://experts2.ru/PbdrkM?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Введение в Data Science</a> от Skillbox — авторский курс от экспертов Сбера рассчитан на полгода. Подходит новичкам и начинающим аналитикам. Вы с нуля изучите инструменты дата-сайентиста, подтянете математику, статистику и теорию вероятностей, научитесь писать код, работать с данными, разрабатывать ML-модели, выполнять когортный и разведочный анализ, формулировать гипотезы и прогнозировать результаты. Практическая часть включает 50 заданий и выполнение итогового проекта, который войдет в ваше портфолио.</li><li><a href="https://experts2.ru/tBhGnp?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Библиотеки Python для Data Science: Numpy, Matplotlib, Scikit-learn</a> от GeekBrains — практико-ориентированный курс содержит более 400 часов упражнений для отработки навыков. Эксперты объяснят, как извлекать необходимую информацию из API, баз данных и файлов, как эффективно работать с большими массивами данных, проводить анализ, формулировать и проверять гипотезы. Дополнительно изучаются основы математики и статистики. Предоставляется бесплатный доступ к облачной платформе Yandex для практики во время учебы. Проводятся карьерные консультации.</li><li><a href="https://experts2.ru/tclEzV?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Data Science: быстрый старт</a> от ProductStar — интенсивная программа поможет всего за пару месяцев освоить Python, писать чистый код, работать с ML-инструментами, создавать рекомендательные системы. Обучение можно проходить в индивидуальном темпе и совмещать с работой. После каждого урока проводится разбор кейсов и выполнение практических заданий. После завершения учебы выдается сертификат, а в поиске работы помогают специалисты Карьерного центра.</li><li><a href="https://experts2.ru/stkIuY?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Data Science в медицине</a> от GeekBrains — специализированный курс фокусируется на применении аналитики в медицине, использовании машинного обучения и статистики для работы с Big Data. Подходит для обучения с нуля. Занятия рассчитаны на 9 месяцев и включают знакомство с языками программирования и базами данных, изучение финансовой математики, статистических методов, сплит-тестирования и юнит-экономики. Предусмотрена бесплатная консультация перед началом обучения, отработка практических навыков на интерактивных тренажерах, проверка работ с ревью от преподавателей, выполнение командных проектов.</li><li><a href="https://experts2.ru/hgVfsZ?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Математика + Machine Learning для Data Science</a> от Skillfactory — объединенный онлайн-курс длится 5,5 месяцев, за которые участники разберутся в применении математических и статистических закономерностей в ML и нейросетях. Программа ориентирована на новичков. Студенты разбирают практические кейсы и участвуют в хакатонах, решают задачи по машинному обучению, предобработке данных, линейной и логистической регрессии, изучают принципы работы с алгоритмами и методы построения рекомендательных систем. Выдается сертификат о завершении обучения, предоставляется бесплатная консультация по развитию карьеры.</li><li><a href="https://experts2.ru/bVcyWr?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Data Science в медицине</a> от Skillfactory — совместная программа с Сеченовским университетом адресована специалистам в сфере исследований, медицины, фармакологии, биологии. Обучение можно совмещать с работой. Участники освоят Python и его библиотеки, научатся обрабатывать и визуализировать данные, применять DS-инструменты и ML-алгоритмы для решения задач в своих сферах деятельности, получат доступ к цифровой платформе больших медицинских данных и опыт работы над реальным проектом. Выпускникам выдается диплом о переподготовке.</li><li><a href="https://experts2.ru/qrhuDT?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Профессия Специалист по Data Science плюс</a> от Яндекс Практикума — углубленное обучение займет 15 месяцев, в течение которых вы научитесь анализировать Big Data, строить ML-модели для принятия решений и  прогнозирования, создавать рекомендательные системы, а также выполните более 20 проектов. Курс подойдет как новичкам без технического образования или опыта в IT, так и специалистам по работе с данными. Первые занятия доступны для бесплатного изучения.</li><li><a href="https://experts2.ru/rkZwvP?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Data Science: введение в машинное обучение</a> от Слёрма — программа для начинающих DS-специалистов, владеющих Python, поможет разобраться в алгоритмах и задачах ML. Эксперты курса расскажут о ключевых подходах к созданию нейросетей и форматах работы с данными, объяснят, как использовать библиотеки для анализа данных и применять машинное обучение для решения задач бизнеса. На отработку практических навыков отводится более 130 часов. Обучение без углубления в математику, выполнение итогового проекта, отработка вопросов с собеседования.</li><li><a href="https://experts2.ru/oyqVKp?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Data Science для Маркетинг Директора</a> от Digital Business School — курс для собственников бизнеса, маркетологов, product-менеджеров и других специалистов, которые хотели бы использовать аналитику данных для повышения эффективности маркетинга и бизнеса в целом. Состоит из 3 уроков и 3 практикумов. Вы узнаете, как собирать и обрабатывать информацию, использовать метрики для решения маркетинговых задач и внедрить DS в своей компании. Есть бесплатное вводное занятие. Доступ к остальным учебным материалам открывается сразу после оплаты.</li><li><a href="https://experts2.ru/lNgLqh?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Онлайн-курсы Python для аналитиков</a> от Международной школы профессий — двухнедельное обучение для тех, кто хочет освоить программирование с нуля и получить практический опыт работы с популярным языком. Курс охватывает такие темы, как основы синтаксиса и структуры данных, работу с файлами и библиотеками, расчет метрик и визуализацию данных. Вы также освоите Selenium WebDriver для автоматизации задач и системой контроля версий. В ходе обучения слушатели создадут три полноценных проекта, которые можно добавить в портфолио. Обучение проходит в онлайн-формате и длится два месяца, что дает возможность совмещать занятия с работой.</li><li><a href="https://experts2.ru/xeAikR?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Специалист по Data Science</a> от Яндекс Практикума — содержательный курс предназначен для тех, кто хочет освоить профессию аналитика данных с нуля. В течение 8 месяцев студенты изучают Python, библиотеки для анализа данных, SQL, методы машинного обучения, а также выполняют практические проекты для портфолио. Программа включает содействие в трудоустройстве, по окончании выдается диплом о профессиональной переподготовке.</li><li><a href="https://experts2.ru/iAorCq?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Data-инженер</a> от Слёрма — онлайн-занятия адресованы разработчикам, аналитикам данных, специалистам по управлению базами данных. За 4 месяца студенты изучат автоматизацию ETL-задач, инструменты для визуализации и отчетности, для обработки, интеграции и хранения данных. Проводятся регулярные встречи с практикующими экспертами. Для ознакомления с форматом обучения предоставляется трехдневный бесплатный доступ к курсу.</li><li><a href="https://experts2.ru/tHBxmh?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Data Scientist с нуля</a> от Брунояма — углубленный курс для начинающих рассчитан на 8 месяцев. За это время освоите программирование на Python, работу с SQL и базами данных, изучите методы машинного обучения, обработки и визуализации данных, рассмотрите этапы проведения A/B-тестирования, познакомитесь с возможностями применения нейронных сетей. Удобный график обучения, акцент на практику, поддержка наставника, индивидуальная помощь с трудоустройством.</li><li><a href="https://experts2.ru/cNykzY?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Аналитик PRO</a> от Changellenge Education — комплексный курс посвящен изучению ключевых инструментов аналитики данных и адресован тем, кто только начинает карьеру в этом направлении, Junior-специалистам и представителям смежных профессий. Опытные преподаватели научат использовать Python, SQL и Excel, создавать продвинутые финансовые модели, тестировать бизнес-гипотезы, работать с маркетинговой и продуктовой аналитикой, Tableau и BI-системами. Вас ждет более 300 часов практики, встречи с экспертами, командная и самостоятельная работа над проектами.</li><li><a href="https://experts2.ru/hwmvPQ?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Курс DP-100: Проектирование и реализация решений Data Science в Azure</a> от Эврики — трехдневный семинар по использованию служб Azure для различных целей машинного обучения. Программа, состоящая из 10 модулей, ориентирована на дата-сайентистов со знанием Python. С помощью эксперта вы научитесь применять инструменты Azure Machine Learning Tools, тренировать модели в ML Designer, создавать хранилища данных, взаимодействовать с вычислительной средой, создавать и запускать конвейеры. По окончании выдается сертификат.</li><li><a href="https://experts2.ru/TzlGaw?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Программирование на Python. Уровень 4. Анализ и визуализация данных: Pandas, Numpy, Matplotlib</a> от Специалист.ru — интенсивная программа для аналитиков, программистов, представителей научных специальностей. Вы познакомитесь с возможностями популярного высокоуровневого языка, применяемыми для анализа и визуализации данных, освоите работу с библиотеками, различные способы построения диаграмм и графиков. Занятия построены на реальных кейсах из сферы обработки данных. Предусмотрено тестирование, выдается удостоверение о повышении квалификации.</li><li><a href="https://experts2.ru/xfusTF?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Data Science проекты</a> от New Professions Lab — экспресс-курс для менеджеров и дата-сайентистов включает 4 видеоурока и 2 тестовых задания. Участники рассмотрят, из каких этапов состоит анализ данных, как определиться с метрикой для оценки ML-модели и оценить эффективность ее внедрения, каким образом проводится сплит-тестирование и как визуализировать результаты DS-проекта. Учебные материалы доступны бессрочно, после прохождения обучения выдается сертификат.</li><li><a href="https://experts2.ru/czeAWt?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Большие данные с BigData Team</a> от BigDataTeam — аналитика big data обучение подойдет разработчикам, аналитикам и другим специалистам по работе с данными. За 10 занятий общей длительностью 80 часов участники научатся взаимодействовать с распределенными файловыми системами, освоят такие инструменты Hadoop, MapReduce, Hive, Spark, Kafka и Cassandra, научатся эффективно обрабатывать и анализировать большие данные, готовить отчеты на основе больших массивов информации. Практические задания выполняются студентами на реальном кластере, что позволяет получить опыт работы в реальных условиях.</li></ol><h2>Еще 11 дополнительных курсов Power BI</h2><p>Power BI представляет собой комплексное программное решение для анализа и визуализации данных. В этом разделе представлены специализированные курсы, которые помогут улучшить навыки аналитики, автоматизации отчетности и построения эффективных дашбордов.</p><ul><li><a href="https://experts2.ru/cspMUi?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Профессия Data-аналитик</a> от Skillbox.ru — углубленное обучение в течение 12 месяцев предназначено для желающих с нуля освоить новую профессию в сфере аналитики данных. Программа включает изучение математических основ анализа и статистики, программирование на Python, применение SQL для работы с базами данных, а также визуализацию с помощью Power BI. Слушатели научатся извлекать, очищать и анализировать данные, строить аналитические отчеты и дашборды, проводить сплит-тесты и формулировать гипотезы. Выпускники смогут претендовать на должности маркетингового, продуктового или финансового аналитика, специалиста по Data Science или BI-аналитика.</li><li><a href="https://experts2.ru/IEtbrf?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Excel и Google-таблицы: от новичка до эксперта</a> от Eduson Academy — двухнедельный онлайн-курс адресован пользователям, желающим освоить все функции Excel и Google-таблиц для эффективной работы с данными. Программа охватывает темы от работы с формулами и функциями до анализа данных и создания сложных отчетов. Участники научатся обрабатывать большие объемы информации, использовать сводные таблицы и графики, а также автоматизировать задачи с помощью макросов. Обучение проводится на интерактивных тренажерах.</li><li><a href="https://experts2.ru/suDIfw?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Power BI и Power Query</a> от SF Education — интенсивная программа продолжительностью 1 месяц подходит широкой аудитории слушателей и нацелена на изучение инструментов для сбора, обработки и анализа данных. Участники научатся собирать информацию из различных источников и подготавливать ее для анализа, интегрировать BI c различными приложениями, использовать возможности BI-системы для аналитических задач и визуализации данных. По окончании выдается диплом международного образца.</li><li><a href="https://experts2.ru/wpQGgt?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">BI-аналитик</a> от Eduson Academy — онлайн-курс предназначен для тех, кто хочет пройти big data обучение и стать специалистом в области бизнес-анализа, работать с большими объемами данных. Обучение длится 4 месяца. Участники освоят навыки работы с  Power BI и Tableau, научатся создавать отчеты, дашборды и анализировать данные для принятия стратегических решений. Программа курса включает темы по основам статистики, прогнозированию, построению аналитических моделей и визуализации данных, а также предполагает выполнение практических заданий, что помогает закрепить теорию на реальных примерах.</li><li><a href="https://experts2.ru/sqQPir?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Профессия BI-аналитик</a> от GeekBrains — обучение продолжительностью 8 месяцев поможет вам стать востребованным специалистом в области бизнес-анализа. Занятия включают изучение таких инструментов для работы с данными, как Python, SQL, Power BI, Power Query и другими. Вы освоите методы обработки информации, формирования аналитических отчетов и создания дашбордов. Предусмотрены практические задания, в том числе на реальных кейсах, индивидуальные консультации с наставниками и помощь в трудоустройстве.</li><li><a href="https://experts2.ru/luGzRc?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">«BI-аналитик» с нуля</a> от Skypro — программа в рамках профессиональной переподготовки. Участники изучат основы Python, научатся писать запросы на SQL, собирать из разных источников и преобразовывать, использовать функционал BI-систем для аналитики, визуализировать данные в виде графиков, диаграмм и презентовать результаты своей работы. Занятия проводятся на собственной образовательной платформе онлайн-школы, предоставляется кураторская поддержка и помощь в трудоустройстве.</li><li><a href="https://experts2.ru/yJHdur?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">BI-аналитика</a> от OTUS — онлайн-обучение для аналитиков данных, продуктовых и маркетинговых аналитиков, product- и project-менеджеров, стремящихся углубить свои знания в области бизнес-аналитики. Продолжительность курса составляет 4 месяца. Вы научитесь работать с большими данными и применять решения с открытым исходным кодом, визуализировать метрики с помощью Power BI, Tableau и отечественной системы Analytic Workspace, создавать интерактивные дашборды с использованием Python и его библиотек. Особенностью курса является акцент на практическом применении знаний и погружение в решение реальных кейсов.</li><li><a href="https://experts2.ru/dwULqv?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Аналитик Power BI c 0 </a>от IQBI — практико-ориентированная программа для изучения аналитики с применением Power BI. Подойдет как новичкам, так и действующим аналитикам, желающим систематизировать свои знания. Рассматриваются инструменты Power Query, DAX и M, автоматизация процессов, работа с базами данных и визуализация сведений. Длительность варьируется от 5 недель при обучении на базовом уровне и до 5 месяцев при выборе тарифа PRO. Важной особенностью курса является получение сертификата от партнеров Microsoft.</li><li><a href="https://experts2.ru/ifbBtF?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Анализ данных в Power BI</a> от Специалист.ru — экспресс-курс знакомит с функционалом программных решений для бизнес-анализа. Освоите основные операции в BI и инструменты визуализации, научитесь обрабатывать информацию и создавать модели данных, писать запросы и сценарии на языке DAX, передавать данные в облачную платформу Power BI и вести там совместную работу над отчетами. Выдается удостоверение о повышении квалификации и диплом международного образца. Можно учиться очно.</li><li><a href="https://experts2.ru/uvTAji?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Power BI для бизнес-аналитики</a> от Stepik — комплексное обучение для всех, кто хочет овладеть инструментами Power BI и научиться преобразовывать сырые данные в интерактивные и визуально привлекательные отчеты. Вы научитесь подключать различные источники информации, работать с Power Query для преобразования и очистки данных, создавать сложные модели с использованием DAX-функций, разрабатывать и публиковать отчеты для различных пользователей и устройств. Более 80 уроков, домашние задания, тесты, доступ к электронному учебнику и файлам проекта, персональная поддержка преподавателя.</li><li><a href="https://experts2.ru/qroFdP?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Power BI: от новичка до уверенного бизнес-пользователя</a> от Udemy — авторский курс для начинающих пользователей, желающих быстро освоить функциональные возможности Power BI. Состоит из 128 лекций общей продолжительностью 15,5 часов. В рамках обучения вы научитесь импортировать сведения из различных источников (Excel, PDF, Web, CRM и ERP системы), очищать и трансформировать ее, создавать модели данных, визуализировать информацию в понятных отчетах и настраивать дашборды. Доступ к лекциям остается навсегда. По окончании программы выдается сертификат.</li></ul><h2>Еще 7 дополнительных курсов по машинному обучению</h2><p>В этой подборке собраны курсы, которые охватывают специализированные темы по ML, такие как нейронные сети, работа с большими данными и продвинутые методы анализа. Эти курсы подойдут как для тех, кто уже знаком с основами машинного обучения, так и для начинающих.</p><ul><li><a href="https://experts2.ru/pViNcd?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Машинное обучение</a> от Нетологии — углубленный курс создан для разработчиков, аналитиков и Junior-специалистов в сфере машинного обучения. Программа длится 10 месяцев. Участники познакомятся с возможностями нейронных сетей, научатся грамотно формулировать задачи для проектов Data Science, определять алгоритмы и метрики, разрабатывать ML-модели, составлять отчеты об исследованиях и создавать рекомендательные системы.  Выпускникам выдается диплом о профессиональной переподготовке, и предоставляется помощь в трудоустройстве.</li><li><a href="https://experts2.ru/kRfjUq?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Профессия Machine Learning Engineer </a>от Skillbox — годовое обучение востребованной профессии с нуля по обновленной программе. Научитесь уверенно работать с Python и SQL, извлекать и обрабатывать информацию из различных источников, включая файлы, API и базы данных. Получите опыт в проведении EDA, d создании ML-моделей, включая нейросети и трансформеры. Сможете решать задачи прогнозирования, внедрять решения в бизнес-процессы с использованием Big Data и алгоритмов машинного обучения. Выполните более 80 практических заданий и 3 проекта, которые пополнят ваше портфолио.</li><li><a href="https://experts2.ru/CUsxkg?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Machine Learning и Deep Learning</a> от Skillfactory — углубленная программа рассчитана на 20 недель и разработана для новичков, программистов и аналитиков со знанием Python. Студенты учатся применять этот язык для обработки и анализа данных, полученных из разных источников. Также изучаются ML-модели и алгоритмы, построение рекомендательных систем, разработка и оптимизация нейросетей. Выпускникам предоставляется помощь с поиском стажировки и работы.</li><li><a href="https://experts2.ru/xiGYav?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Программирование Python и машинное обучение</a> от Coddy School — занятия для школьников 12-16 лет, желающих научится программировать и познакомиться с базовыми концепциями машинного обучения. Ребята изучат популярные библиотеки Python и научатся применять их для решения практических задач, разберут принципы Machine Learning и методы анализа данных. Курс занимает от 7 месяцев, включает разработку простых ML-моделей и их применение на практике. Программа адаптирована для юной аудитории, что позволяет эффективно усваивать сложные темы в доступной форме.</li><li><a href="https://experts2.ru/ZeRlay?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Machine Learning. Advanced</a> от Otus — дистанционный курс продолжительностью 6 месяцев адресован аналитикам, программистам, дата-сайентистам и инженерам машинного обучения. Вы познакомитесь с продвинутыми методами ML, сможете настраивать окружение и писать код, применять инструменты автоматизации, решать сложные кейсы с временными рядами, обучением с подкреплением и системами рекомендаций. Живые вебинары с опытными преподавателями, активная практика и работа над проектами. После окончания курса можно претендовать на позицию дата-сайентиста уровня Middle+.</li><li><a href="https://experts2.ru/fUtTwk?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Онлайн-курс по машинному обучению</a> от Irs.academy — 9 онлайн-уроков для новичков, программистов и аналитиков. Студенты изучат методы предобработки данных, освоят работу с линейной и логической регрессией, получат навыки работы с алгоритмами, построения рекомендательных систем и визуализации полученных данных. 3 тарифа обучения, комфортный график занятий, новые уроки открываются при условии выполнения домашних заданий, которые проверяются экспертами. После защиты проекта выпускники получают сертификат.</li><li><a href="https://experts2.ru/xbqZPa?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Python: анализ данных и машинное обучение</a> от LoftSchool — интенсивный курс для начинающих поможет за 7 недель освоить популярный язык программирования Python и его библиотеки, применяемые для аналитики. Также вы научитесь использовать возможности нейросетей, работать с Machine Learning, подбирать метрики для оценки качества алгоритмов и выполните проект для портфолио. Отработаете навыки на практических воркшопах, поработаете в команде, получите экспертное ревью вашего проекта.</li></ul><h2>Бесплатные курсы по теме</h2><p>Освоить методы работы с большими данными можно без затрат на обучение. Бесплатные курсы отлично подходят тем, кто начинает карьеру в сфере Data Science и ML.</p><p><b>1.</b> <a href="https://experts2.ru/qGsNgf?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Введение в аналитику</a> — <b>Skillbox</b></p><p>Занятия для всех, кто хочет изучить основы аналитики данных и выбрать подходящую профессию в этой области. Программа рассчитана на 1 месяц, за который вы узнаете о различных специализациях, выявите свои сильные стороны, определитесь с дальнейшим обучением и получите представление о своей будущей карьере.</p><p><b>Главное о курсе: </b></p><ul><li>обзор 11 направлений, включая BI и продуктовую аналитику;</li><li>интерактивный разбор с реальными примерами;</li><li>содержит профориентационный тест;</li><li>предоставляется бессрочный доступ к материалам.</li></ul><p><b>2. </b><a href="https://experts2.ru/kjXGyt?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Введение в Data Science‎ и машинное обучение</a> —<b> Stepik</b></p><p>Вводный курс для широкой аудитории. Вы познакомитесь с методами машинного обучения, включая деревья решений и нейронные сети, научитесь использовать популярные библиотеки Python, работать с базами данных, удаленными серверами и системой контроля версий.</p><p><b>Главное о курсе: </b></p><ul><li>подходит для начального уровня;</li><li>30 уроков, тесты, практические упражнения;</li><li>рекомендации от ведущих специалистов в области DS и ML;</li><li>выдается сертификат о прохождении обучения.</li></ul><p><b>3. </b><a href="https://experts2.ru/teqfWZ?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Введение в дата-аналитику</a> — <b>Хекслет </b></p><p>Мини-курс для начинающих, который знакомит с профессией и задачами аналитика данных. Участники узнают, чем такой специалист может помочь бизнесу и какие существуют направления в аналитике, как применяется Python для анализа данных. В практической части вы научитесь работать с электронными таблицами Google, писать запросы к базе данных на SQL, выполнять визуализацию.</p><p><b>Главное о курсе: </b></p><ul><li>обновленная учебная программа;</li><li>обучение в комфортном темпе;</li><li>практика на интерактивных тренажерах;</li></ul><p><b>4.</b><a href="https://experts2.ru/vRcGwz?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop"> Нейронные сети</a> — <b>Stepik</b></p><p>Онлайн-занятия для школьников старших классов, студентов, научных работников. Для успешной учебы необходимо знать математику на школьном уровне и уметь программировать на Python. Участники ознакомятся с алгоритмами, применяемыми для обучения различных нейросетей, научатся проводить анализ данных и визуализировать результаты исследований.</p><p><b>Главное о курсе:  </b></p><ul><li>для обучения достаточно школьного уровня математики;</li><li>24 видеоурока, тесты, задачи;</li><li>доступ к материалам открывается сразу после регистрации на сайте;</li><li>предоставляется сертификат Института биоинформатики.</li></ul><p><b>5. </b><a href="https://experts2.ru/fpXJxh?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Анализ данных в R</a>‎ — <b>Stepik</b></p><p>Программа подходит для студентов, научных работников и старшеклассников. Охватывает основные этапы статистического анализа с помощью языка программирования R, включая обработку данных, применение статистических методов и визуализацию данных.</p><p><b>Главное о курсе:  </b></p><ul><li>длительность — 3 недели, по 4–5 часов в неделю;</li><li>основы статистического анализа в R;</li><li>работа с данными и библиотеками;</li><li>инструменты визуализации результатов.</li></ul><p><b>6.</b> <a href="https://experts2.ru/zwiShY?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Основы Python и анализа данных</a> — <b>Яндекс.Практикум</b></p><p>Курс для желающих освоить профессию аналитика данных с нуля. Студенты изучат основы анализа данных с помощью SQL, Python и инструментов BI, что поможет получить востребованные навыки для работы в различных сферах аналитики.</p><p><b>Главное о курсе:  </b></p><ul><li>более 70% обучения отведено практике;</li><li>работа с SQL, Python, PostgreSQL и DataLens;</li><li>проекты на основе реальных кейсов.</li></ul><p><b>7. </b><a href="https://experts2.ru/BewsgA?sub1=tproger-kf&amp;sub2=big-data-kursy&amp;sub4=netop">Hadoop. Система для обработки больших объемов данных</a> — <b>Stepik</b></p><p>Занятия подготовлены для студентов старших курсов и разработчиков начального или среднего уровня. Учащиеся познакомятся с методами обработки и хранения больших данных с использованием платформы Hadoop.</p><p><b>Главное о курсе: </b></p><ul><li>актуальные учебные материалы;</li><li>33 урока, 12,5 часов видео;</li><li>более 200 тестов и 29 интерактивных задач;</li><li>занятость — 3 часа в неделю.</li></ul><p><b>8. </b><a href="https://www.youtube.com/watch?v=kxjr9OcxvlM&amp;list=PLcsjsqLLSfNCB0yQMHoGsVFx2axpqjlSR">Основы программирования и анализа данных на Python</a> — <b>teach-in</b></p><p>Видеоурок по основам работы с Python с нуля. Рассматриваются возможности этого языка, области его применения, базовые принципы программирования, такие как работа с циклами, условиями, рекурсией и автоматизацией. Обучение сопровождается практическими примерами.</p><p><b>Главное о курсе:  </b></p><ul><li>длительность — 1,5 часа;</li><li>введение в Python и его применение в различных сферах;</li><li>основы программирования;</li><li>ответы на вопросы студентов.</li></ul><p><b>9. </b><a href="https://www.youtube.com/playlist?list=PL15mR4o-R9Ng3Fh8Z2HpLdQeJQHSoNKcp">Курс лекций по Big Data</a> — <b>Sergey Petrovich</b></p><p>10 уроков на платформе YouTube посвящены основам работы с большими данными и машинному обучению. Big Data обучение ориентировано на студентов, начинающих специалистов в сфере Data Science, а также всех, кто хочет разобраться в принципах анализа, хранения и обработки больших объемов информации. Рассматриваются ключевые концепции больших данных, алгоритмы машинного обучения, регрессия, глубокое обучение и другие актуальные темы.</p><p><b>Главное о курсе:  </b></p><ul><li>введение в машинное обучение;</li><li>Python для анализа данных;</li><li>взаимосвязь Интернета вещей (IoT) и Big Data;</li><li>регрессия и методы прогнозирования.</li><li>технологии хранения и анализа данных;</li><li>основы глубокого обучения.</li></ul><h2>Профессия аналитика больших данных</h2><p>Сфера Big Data стремительно набирает популярность в мире, поскольку данные становятся основой для принятия решений в бизнесе, медицине, финансах и других отраслях.</p><h2>Чем занимается аналитик больших данных?</h2><p>Аналитик больших данных (или специалист по Big Data) — это профессионал, который занимается обработкой и анализом массивов данных, которые невозможно эффективно обрабатывать с помощью традиционных инструментов. Его работа заключается в создании и оптимизации алгоритмов, которые позволяют извлекать полезную информацию из больших объемов данных, чтобы сделать бизнес-процессы более эффективными и прибыльными. Это включает в себя работу с различными источниками данных, их очистку, а также создание моделей, которые помогают в принятии обоснованных решений.</p><h2>Навыки специалиста по Big Data</h2><p>Успешный аналитик больших данных обладает следующими знаниями и навыками:</p><ul><li>знание языков программирования, например, Python, R;</li><li>опыт работы с SQL, NoSQL, Hadoop, Hive;</li><li>уверенное владение рабочими программами Excel и Power BI;</li><li>умение применять алгоритмы машинного обучения для прогнозирования и анализа данных;</li><li>математическое и статистическое мышление, внимательность, способность анализировать данные и выявлять закономерности;</li><li>знание бизнес-анализа и отчетности, понимание того, как данные могут помочь в принятии бизнес-решений;</li><li>умение работать в команде;</li><li>навыки презентации для представления результатов исследований.</li></ul><h2>Где учиться на аналитика больших данных?</h2><p>Фундаментальное образование по этой специальности можно получить в высших учебных заведениях. Например, в Санкт-Петербургском государственном университете есть очная программа бакалавриата <a href="https://spbu.ru/postupayushchim/programms/bakalavriat/iskusstvennyy-intellekt-i-nauka-o-dannykh">Искусственный интеллект и наука о данных</a>, которая займет 4 года. Пройти дистанционное обучение <a href="https://www.hse.ru/ma/bigdata-analytics/">аналитик больших данных</a> по двухлетней магистерской программе предлагает Высшая школа экономики.</p><p>Если вас интересует быстрый старт в профессии или точечное совершенствование знаний, имеет смысл обратить внимание на онлайн-курсы. При выборе такого формата обучения на освоение инструментов аналитики данных, Machine Learning и работы с Big Data вам понадобится от нескольких недель до 1 года. Самостоятельный поиск подходящего курса может занять много времени, поэтому предлагаю вам воспользоваться подборкой, представленной в этой статье.</p><h2>Сколько зарабатывает аналитик больших данных?</h2><p>Зарплата аналитиков больших данных зависит от опыта специалистов, региона и типа компании. Согласно данным <a href="http://hh.ru">hh.ru</a>, крупного онлайн-портала по поиску работы и сотрудников, <a href="https://hh.ru/vacancy/117880799?query=big+data&amp;hhtmFrom=vacancy_search_list">начинающие специалисты по Big Data</a> могут рассчитывать на заработную плату от 60 0000 рублей до 100 000 рублей в месяц. Зарплата <a href="https://hh.ru/vacancy/118128471?query=%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D1%82%D0%B8%D0%BA+big+data&amp;hhtmFrom=vacancy_search_list">опытного специалиста</a> составляет в среднем от 150 000 рублей в месяц и выше.</p><h2>Заключение</h2><p>Аналитика данных становится основой для принятия решений и развития бизнеса. Технологии обработки больших данных применяются во многих сферах, включая финансовые услуги, здравоохранение, маркетинг, науку, что создает постоянный спрос на высококвалифицированных специалистов. Если вы хотите стать экспертом в одной из самых перспективных областей, Big Data курсы станут первым шагом на пути к успешной карьере. Это отличный способ не только изучить теорию, но и развить практические навыки, освоить новейшие инструменты для работы с большими данными и повысить свою конкурентоспособность на рынке труда.</p><p><b>Подборки по схожим темам:</b><b></b></p><ol><li><a href="https://tproger.ru/articles/kursy-po-analitike-dannyh">Лучшие курсы по анализу данных</a></li><li><a href="https://tproger.ru/articles/kursy-po-biznes-analitike">Лучшие курсы для бизнес-аналитиков</a></li><li><a href="https://tproger.ru/articles/kursy-sistemnogo-analitika">Лучшие курсы по системной аналитике</a></li></ol><p><i>Если вы обнаружили в статье устаревшую или некорректную информацию, сообщите, пожалуйста, об этом в комментариях. Там же вы можете поделиться информацией о проверенном вами онлайн-курсе, и я с удовольствием добавлю его в подборку.</i></p>]]></content:encoded>
    </item>
    <item>
      <title>Анатомия данных: как устроено управление информацией</title>
      <link>https://tproger.ru/articles/anatomiya-dannyh--kak-ustroeno-upravlenie-informaciej</link>
      <comments>https://tproger.ru/articles/anatomiya-dannyh--kak-ustroeno-upravlenie-informaciej?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Анна Ельцова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/anatomiya-dannyh--kak-ustroeno-upravlenie-informaciej</guid>
      <description><![CDATA[<p>Объем информации растет, но без системного подхода данные превращаются в шум. Разбираемся, как в компаниях структурируют, анализируют и защищают данные, чтобы они работали на бизнес, а не создавали хаос.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/anatomiya-dannyh--kak-ustroeno-upravlenie-informaciej">Анатомия данных: как устроено управление информацией</a>»</p>]]></description>
      <category><![CDATA[Интернет]]></category>
      <category><![CDATA[Безопасность]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Сервер]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Разработка]]></category>
      <category><![CDATA[Кибербезопасность]]></category>
      <category><![CDATA[Анализ данных]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 14 Mar 2025 08:30:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>Данные — новая нефть, золото, уран? Забудьте. Данные — это океан, который заливает сервера, базы и облака, пока инженеры пытаются не захлебнуться в логах и аналитике. Управление данными — одна из самых молодых и недооценённых дисциплин в IT. Её не было 15 лет назад, но сегодня без неё невозможно представить ни один крупный бизнес.</p><p>Какого масштаба поток данных? Несколько лет назад мы прикинули: на каждого жителя Земли уже тогда приходилось по шесть Ленинских библиотек информации. А теперь умножьте это на два — каждый год. Гигабайты превращаются в терабайты, петабайты в зетабайты, а полезного в этом потоке — крохи. Львиная доля — шум: багованные логи, дубли, мемы и бесконечные тиктоки.</p><p>Но и нужных данных становится больше. Ещё недавно с корпоративной информацией работали в основном финансисты и риск-менеджеры. Сегодня же данные — фундамент всех бизнес-процессов. Без них не запустишь персонализированные продукты, не оптимизируешь расходы и не предскажешь спрос.</p><p>Задача на ближайшие годы — не просто накапливать информацию, а научиться управлять этим потоком так, чтобы он работал на бизнес, а не создавал хаос. Но как?</p><h2>Цифровой профиль вместо личного визита: как банки превратились в дата-платформы</h2><p>Еще десять лет назад банковское обслуживание выглядело совсем иначе: клиент приходил в отделение, садился напротив операциониста, показывал документы и так подтверждал свою личность. После чего совершал нужные операции. Сегодня всё решает смартфон — в приложении можно совершить большую часть финансовых операций, а банки повсеместно используют алгоритмы, чтобы сделать обслуживание еще более удобным и персонализированным. Эта эволюция не случилась за ночь. Сначала были «банк-клиенты», потом интернет-банки, затем мобильные приложения. Теперь банки становятся экосистемами, обменивающимися данными в реальном времени. А значит, объём собираемой информации растёт экспоненциально.</p><h2>Как обуздать поток данных</h2><p>Как же устроена работа с данными в крупных организациях? В ее основе — корпоративное хранилище данных (КХД), своего рода фундамент, где собирается информация из всех внутренних систем компании. Это может быть классическая реляционная база, озеро данных или другая технология — главное, чтобы существовала централизованная площадка для консолидации информации. Без такого фундамента невозможно выстроить эффективную систему управления.</p><p>Еще один ключевой элемент — системы класса MDM (Master Data Management), отвечающие за управление основными данными. Они собирают информацию из разных источников и устраняют несоответствия, создавая единое представление о каждом объекте: клиенте, продукте, сделке, контрагенте. В результате формируется так называемый «золотой профиль» — наиболее точная и полная версия данных.</p><p>Пример из жизни: клиентка выходит замуж и меняет фамилию, контактные данные, адрес. MDM-система анализирует изменения, понимает, что это все тот же человек, и сохраняет его историю взаимодействий с банком, включая информацию о счетах и сбережениях. При этом существуют разные типы MDM-систем: для работы с физическими и юридическими лицами, для учета сделок и контрактов, а также для управления справочными данными.</p><p>Данных в корпоративных хранилищах огромное количество — порой они исчисляются петабайтами. Однако без удобных инструментов остаются неструктурированным массивом, с которым сложно работать. Представьте, что атрибуты в системе названы по сложному шаблону (Naming Convention), и вам приходится разбираться с названиями вроде «CustActStatCD345x». Даже если они более-менее понятны, разобраться, какие именно данные скрываются за каждым атрибутом, все равно бывает непросто.</p><p>Чтобы упростить поиск и обработку информации, в организациях внедряются репозитории метаданных, каталоги и глоссарии. По сути, они работают как корпоративный аналог голосового помощника: сотрудник вводит запрос на понятном языке, а система подсказывает, где искать нужные сведения. Благодаря этому время на поиск информации сокращается в разы.</p><p>Но у каталогов и глоссариев есть еще одна важная функция — создание единого языка внутри компании. Например, слово «клиент» в разных отделах может означать совершенно разные вещи. Для одних это любой человек, заключивший договор, для других — только активные заемщики, для третьих — все, у кого когда-либо был счет. В результате одно подразделение может считать, что у компании 5 миллионов клиентов, другое — что 10 миллионов, а третье — всего 2 миллиона. И все будут правы в рамках своих критериев.</p><p>Такие расхождения не просто усложняют подготовку отчетности, но и приводят к ошибкам в стратегическом планировании. Поэтому важно четко формализовать термины и их значения: «активные клиенты», «кредитные клиенты», «клиенты с открытыми счетами» и т. д. Это не просто вопрос удобства, а критически важный аспект для точности бизнес-аналитики и принятия решений.</p><h2>Когда ошибок не избежать: темная сторона больших данных</h2><p>Ошибки в данных неизбежны. Человеческий фактор никто не отменял: сотрудник может пропустить букву, перепутать цифры или случайно нажать не ту клавишу. Даже автоматические системы ввода, например, OCR для распознавания документов, тоже не дают 100% точности. Машины, конечно, ошибаются реже (для сравнения: у авиадиспетчеров всего одна ошибка на тысячу операций, а в автоматизированной системе ошибки возникают на порядки реже), но полностью исключить погрешности невозможно.</p><p>Однако настоящая угроза не в самих ошибках, а в том, как они распространяются. Одна неточность в первичных данных, попадая в систему, начинает размножаться как вирус — заражает новые массивы, реплицируется при каждом использовании информации и в итоге распространяется каскадом по всей организации.</p><p>Исправлять такие ошибки — адская работа. Нужно не просто найти источник сбоя, но и проследить весь путь ошибки: где она появилась, куда распространилась, какие данные уже испорчены. Например, исправление всего одной неточности в персональных данных может занять до двух часов. Теперь умножьте это на тысячи подобных случаев — и получите астрономические затраты.</p><p>Бороться с ошибками проще на этапе их предотвращения, чем потом выгребать последствия. Поэтому компании внедряют сотни и тысячи системных проверок, чтобы отсекать брак ещё на входе. Некоторая информация очевидна: например, серия паспорта РФ — это всегда четыре цифры, а номер — шесть. Подобные форматные проверки легко автоматизировать.</p><p>Но есть и более сложные кейсы. Если человек запрашивает кредит, его возраст явно не может быть 12 или 120 лет. Или, скажем, в анкете указано имя «Екатерина», а в графе «пол» значится «мужской» — это очевидная ошибка. Такие проверки интегрируются прямо в фронт-офисные системы, чтобы сотрудники физически не могли ввести неадекватные данные.</p><p>Разработка и внедрение этих механизмов требует времени и ресурсов. Но если посмотреть на цифры, становится понятно: это копейки по сравнению с теми суммами, которые пришлось бы тратить на армию корректировщиков, устраняющих миллионы ошибок.</p><h2>Хранители цифрового будущего</h2><p>Централизация данных — не просто тренд, а необходимость. Без консолидации информации не построить ни предиктивную аналитику, ни эффективные государственные системы. Конечно, можно мечтать о мире, где всё хранится в изолированных базах, но это так же бессмысленно, как пытаться заменить автомобили конной тягой.</p><p>Однако большие данные — большая ответственность. Мы все знаем, как часто звонят «следователи МВД» или «капитаны ФСБ» с предложением срочно перевести деньги. Основная угроза — не внешние кибератаки, а человеческий фактор. Большинство утечек персональных данных — не результат сложного взлома, а банальный «вынос» информации инсайдерами.</p><p>Хотя нас пока не уничтожает «Скайнет» из фильмов 90-х, бережное отношение к данным — уже не вопрос выбора, а необходимость. Три базовых принципа цифровой гигиены помогут снизить риски:</p><ol><li><b>Минимум данных.</b> Если сервису нужен только email, не указывайте номер телефона и адрес. Чем меньше информации вы раздаёте, тем сложнее её украсть.</li><li><b>Выбор надёжных сервисов.</b> Крупные компании вкладываются в кибербезопасность, потому что их репутация на кону. У небольших организаций ресурсы на защиту ограничены, а контроль слабее.</li><li><b>Здравый смысл.</b> Самые сложные системы защиты бесполезны, если пользователь игнорирует элементарные правила безопасности.</li></ol><p>Сегодня мы лишь в общих чертах коснулись темы управления данными. За кадром остались вопросы технологий, контроля качества и информационной безопасности. Но ясно одно: способность эффективно работать с данными — ключевой фактор конкурентоспособности любой крупной компании, а специалисты в этой сфере сейчас необходимы.</p>]]></content:encoded>
    </item>
    <item>
      <title>Python vs C++: какой язык быстрее найдет все простые числа до миллиарда</title>
      <link>https://tproger.ru/articles/python-vs-c----kakoj-yazyk-bystree-najdet-vse-prostye-chisla-do-milliarda</link>
      <comments>https://tproger.ru/articles/python-vs-c----kakoj-yazyk-bystree-najdet-vse-prostye-chisla-do-milliarda?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Анна Ельцова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/python-vs-c----kakoj-yazyk-bystree-najdet-vse-prostye-chisla-do-milliarda</guid>
      <description><![CDATA[<p>Рассказываем, какие есть алгоритмы для поиска простых чисел и реализуем наиболее популярный и простой на Python и C++. </p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/python-vs-c----kakoj-yazyk-bystree-najdet-vse-prostye-chisla-do-milliarda">Python vs C++: какой язык быстрее найдет все простые числа до миллиарда</a>»</p>]]></description>
      <category><![CDATA[C++]]></category>
      <category><![CDATA[Математика и теория вероятностей]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[PyCharm]]></category>
      <category><![CDATA[Библиотеки]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 12 Mar 2025 10:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Баттлы языков — извечная тема, которая никогда себя не изживет. Понятно, что язык программирования нужно выбирать под конкретные цели. Но если мы только учимся, можно попробовать решить какую-нибудь задачку с помощью двух разных инструментов — хотя бы для того чтобы понять, какой нравится больше.</p><p>Сегодня будем искать все простые числа до миллиарда с помощью кода на Python и C++. Если вы думаете, что результат совсем очевиден, то это не так.</p><p>Напоминание: простые числа — те, которые имеют два различных делителя. Простыми словами, они делятся только сами на себя и на единицу. Например: 2, 3, 5, 7 и так далее.</p><h2>Для начала: быстро окунемся в математику</h2><p>Есть несколько алгоритмов, которые помогут найти все простые числа до N. Это материал для отдельной статьи, поэтому пробежимся по основным.</p><h3>Решето Эратосфена</h3><p>Один из самых древних и известных алгоритмов, чтобы найти простые числа до N. Плюс он понятный, не занимает слишком много памяти (если речь не идет об очень больших N). Работает так:</p><ol><li>Создается список чисел от 2 до N.</li><li>Все кратные числа кратные 2 (4, 6, 8, ...) помечаются как составные.</li><li>Переходим к 3 и вычеркиваем все числа, кратные ему.</li><li>То же самое повторяем со всеми числами из списка до N</li><li>Так до тех пор, пока не проверятся все числа до N.</li></ol><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-03-11/8466855f-2da2-46d1-8909-a34038f42911.png" alt="" /></figure><h3>Решето Сундарама</h3><p>Этот алгоритм работает немного по другой логике:</p><ol><li>Создается список чисел от 1 до (N-1)/2.</li><li>Исключаются числа типа i + j + 2ij, где i и j — натуральные числа, и i &lt;= j.</li><li>Оставшиеся числа умножаются на 2 и увеличиваются на 1 — так получаем простые числа.</li></ol><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-03-11/ab4a7c6c-33b2-4dab-a225-357ea26415ec.png" alt="" /></figure><p>Этот алгоритм занимает меньше памяти, чем решето Эратосфена, поскольку работает только с половиной диапазона. Но при этом он сложнее в плане понимания и реализации.</p><h3>Решето Аткина</h3><p>Это уже современный алгоритм (появился в начале 21 веке). Он использует более сложные математические концепции и работает так:</p><ol><li>Создается список чисел от 1 до N.</li><li>Используются квадратичные формы, чтобы предварительно отсеять составные числа.</li><li>Затем составные числа просеиваются финально для полного исключения.</li></ol><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-03-11/cc0e9ecb-d8d1-4f41-8d7c-95b8e7535408.png" alt="" /></figure><p>Решето Аткина более эффективно, когда речь идет об огромных числах, по сравнению с первыми двумя алгоритмами. Оно тоже не простое в реализации, плюс может быть медленнее при работе с небольшим N.</p><p>Это три основных алгоритма для поиска простых чисел до N. Сейчас существуют различные оптимизации этих методов, например, колесная факторизация (оптимизированный алгоритм Эратосфена).</p><h2>Ищем простые числа до миллиарда на Python и C++</h2><p>Python — не самый быстрый язык для таких операций. Если не использовать библиотеки, то программа выдает ограничение и не может завершиться. Например, вот код на чистом Питоне с алгоритмом Эратосфена:</p><p>PyCharm с ограничением 1 000 000 000 не завершает программу. Если же поставить лимит = 100 000 000, то получим такой результат (почти 8 секунд!):</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-03-11/d2086e6c-85d5-41de-95e9-88aa65628a1a.png" alt="" /></figure><p>Теперь попробуем проделать то же самое с библиотекой numpy, которая как раз подходит для работы с большими числами:</p><p>Результат будет таким:</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-03-11/14794680-eb0d-456e-8966-64abc5818d50.png" alt="" /><figcaption>Учитывайте, что мы искали здесь числа до миллиарда!</figcaption></figure><p>Давайте попробуем сделать то же самое на С++:</p><p>Эта программа будет выполняться больше минуты:</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-03-11/4631c3ff-2fb6-48ad-b3fd-0731d0a31cb8.png" alt="" /></figure><p>Чтобы оптимизировать программу, можно использовать сегментированное решето Эратосфена:</p><p>Время выполнения уменьшилось на 20 секунд:</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-03-11/09b3746b-ebac-403a-85da-354744d06079.png" alt="" /></figure><h2>Итоги</h2><p>В нашей задачке numpy действительно может оказаться быстрее, чем обычная реализация на C++. На то есть несколько причин:</p><ol><li>Если в NumPy используется эффективный векторизованный алгоритм — в нашем случае решето Эратосфена, — преимущества SIMD-операций (одновременное выполнение одной операции над множеством данных) могут сильно ускорить вычисления.</li><li>Неоптимизированная реализация решета на C++ с обычными циклами может быть медленнее оптимизированной векторизованной реализации в NumPy.</li><li>NumPy использует внутренне оптимизированные C/C++ библиотеки, в которых есть куча оптимизаций для работы с массивами.</li></ol><p>Но эффективно оптимизированный код на C++ (например, с использованием SIMD-инструкций, оптимизации кэш-памяти, параллелизма) почти всегда будет быстрее любой реализации на Python/numpy. Правда, такой код будет занимать сотни строк.</p><p>Производительность зависит от конкретных алгоритмов, поэтому так себе метод на C++ проиграет хорошему на numpy. Во многих задачах по работе с большими данными плюсы будут более быстрыми, но для типичного пользования numpy — отличная альтернатива.</p>]]></content:encoded>
    </item>
    <item>
      <title>От университета к дата-сайенс в МТС за год: как я проходил обучение в Школе аналитиков</title>
      <link>https://tproger.ru/articles/ot-universiteta-k-data-sajens-v-mts-za-god--kak-ya-prohodil-obuchenie-v-wkole-analitikov</link>
      <comments>https://tproger.ru/articles/ot-universiteta-k-data-sajens-v-mts-za-god--kak-ya-prohodil-obuchenie-v-wkole-analitikov?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[МТС]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/ot-universiteta-k-data-sajens-v-mts-za-god--kak-ya-prohodil-obuchenie-v-wkole-analitikov</guid>
      <description><![CDATA[<p>Максим Коновалов расскажет, как стал Data Scientist в МТС, пройдя школу аналитиков данных МТС и стажировку. </p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/ot-universiteta-k-data-sajens-v-mts-za-god--kak-ya-prohodil-obuchenie-v-wkole-analitikov">От университета к дата-сайенс в МТС за год: как я проходил обучение в Школе аналитиков</a>»</p>]]></description>
      <category><![CDATA[Обучение программированию]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Навыки]]></category>
      <category><![CDATA[Стажировка]]></category>
      <category><![CDATA[HR]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Pet-проекты]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 20 Feb 2025 14:52:20 GMT</pubDate>
      <content:encoded><![CDATA[<p>Привет! Я Максим, дата-сайентист из МТС. Работаю в команде банковского скоринга: наш продукт определяет кредитные риски и вероятность мошенничества. В компанию я попал через школу аналитиков данных МТС и стажировку. Сегодня расскажу, как попасть на работу в крутую компанию без 10 лет опыта работы.</p><h2>С чем я пришел в Школу</h2><p>До поступления в школу я занимался программированием, сейчас учусь в университете на специальности «Робототехника и искусственный интеллект». У нас в программе, разумеется, есть курсы по машинному обучению и Python с практикой. В дополнение я проходил бесплатные курсы на Stepik и похожих платформах, был на митапах по Data Science, пробовал проходить стажировки. Плюсом делал небольшие pet-проекты, но коммерческих работ не было.</p><p>Год назад я наткнулся на лендинг Школы. Мне понравилось, как расписана программа, кем являются преподаватели — это и подкупило. Последним аргументом стала возможность попасть на стажировку в МТС.</p><p>В итоге я подал заявку, прошел вступительный экзамен (в форме теста), написал мотивационное письмо — и, наконец, попал на обучение. Из огромного числа заявок прошли отбор лишь 120 человек.</p><h2>Много математики, много домашки и баллы за кофе с одногруппниками: как строилось обучение</h2><p>Обучение началось через несколько дней после зачисления в Школу. Иногда я думал о том, что программа может оказаться такой же, как на курсах, которые проходил раньше: структура не очень, все в записи, часть материала потеряла актуальность и так далее. Но оказалось все наоборот.</p><p>Занятия были очень интенсивными: два раза в неделю мы слушали лекции, по три часа каждая (всего мы отучились 360 часов!). Весь материал читали преподаватели во время трансляции. Там же отвечали на вопросы студентов по теме лекции или о себе и работе. Живое общение очень мотивировало посещать трансляции, а не ждать записи и откладывать «на потом».</p><p>Программа состояла из нескольких блоков: SQL, Python, математическая статистика, оптимизация, классический ML, визуализация, временные ряды и A/B-тесты, Big Data, RecSys, NLP, кейсы в ML и System Design. Около половины программы заняла теория: математика, статистика, теория вероятности и прочее. Другая половина — это работа с данными, Python, машинное обучение.</p><blockquote>За пятнадцать лет работы в DS я пришел к выводу, что с коллегами, которые ловко освоили хайповые либы и не обладают фундаментальными знаниями, работается как на минном поле — никогда не знаешь где рванет. Часто эти ошибки касаются базовой статистики, интервальных оценок, а еще чаще — работы алгоритмов. Строгие теоретические выкладки подменяются мифами, а давно преодоленные ограничения старых реализаций алгоритмов становятся догматами. Отсюда и идет целеполагание нашей программы. При этом учить одну лишь теорию скучно, и у студентов возникнут справедливые вопросы о применимости знаний. При создании программы я старался дать за весьма ограниченный срок (всего год) и базу, и практические навыки. Это нужно, чтобы специалист на выходе стал самостоятельным: мог построить end2end-приложение с ML — от скраппинга данных до деплоя и оценки эффективности решения в деньгах. Это действительно сложно: начать с занятий Python и SQL и за год дойти до Spark и PyTorch, параллельно двигаясь от алгебры, оптимизации и статистики до устройства трансформерных архитектур и проблем смещений (bias) в рекомендательных системах. При этом базовые блоки выступают фундаментом для дальнейших занятий, и курс с середины не пройти.</blockquote><p>Многие преподаватели делили их на теорию и практику: изучили материал на лекции и сразу попробовали применить его при выполнении какой-то задачи.</p><p>Почти после каждого занятия мы получали домашнее задание на неделю — или более объемную итоговую работу, если закончили какой-то блок. Разумеется, все по теме лекции: от посчитать какую-то вероятность до написать бэкенд сайта для бронирования книг.</p><p>Что-то было довольно простым, например, все тот же <a href="https://github.com/BigMak1/Book-Store">сайт</a>. Но иногда приходилось довольно долго думать.</p><p>Хороший пример — итоговая работа по Big Data. Нам дали файлы датасетов, по которым надо было выполнить четыре задачи:</p><ol><li>Проанализировать данные, описать проблемы, которые в них содержатся (проблемы хранения тоже считаются), и предложить решения.</li><li>Реализовать поток данных из топика, который бы удовлетворял конкретные условия.</li><li>Реализовать batch-поток для обработки исторических данных и построить на его основе четыре отчета.</li><li>Спроектировать модель данных и таблицы для хранения информации из предыдущих задач. И протестировать эту модель на нескольких запросах.</li></ol><p>Многие домашки были построены так, что их можно сразу класть в портфолио и подавать как пет-проекты. Например, домашкой по ML было близкое к реальному техническое задание от продакт-оунера: внедрить ML-модель в прод.</p><p>До начала курса я был знаком с основами математической статистики, SQL, Python и ML, и Школа аналитиков данных смогла дать мне главное — практический опыт, которого не хватало. С каждым месяцем обучение становилось интереснее: я начал узнавать вещи, о которых никогда не слышал.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-02-18/3a846a1c-7b83-45cb-b837-7924adf6036e.png" alt="" /></figure><p>А еще меня впечатлила сама организация. Спасибо Алине Веденской и Марии Теплинской за то, что регулярно постили анонсы и новости курса и всегда быстро давали обратную связь.</p><h2>Еще нас мотивировали с помощью челленджей</h2><p>Мы получали баллы за посещение лекций, домашки и внешнюю активность — те самые челленджи. Это могли быть пост про Школу в своих соцсетях или фотка, на которой ты пьешь кофе с другими студентами. За очки можно было купить мерч, плюс на их основе строился рейтинг студентов.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-02-18/21532edb-6c33-402b-9ba9-a93f537c33fa.jpeg" alt="" /><figcaption>Вот такими были задания, за которые давали баллы.</figcaption></figure><p>Хотя должен признать, что мне не хватило нетворкинга и живого общения: лекций, конференций, мероприятий в офлайне. Но большинство студентов живут в разных городах и учатся/работают параллельно со Школой аналитиков данных, так что вряд ли это вообще возможно реализовать.</p><h2>Высокий рейтинг — возможность попасть на стажировку</h2><p>У топ-5 студентов по учебному рейтингу была возможность пройти все этапы отбора на стажировку в упрощенном порядке: мы сразу выбирали отдел, в котором хотели бы работать, и попадали на интервью с руководителем команды.</p><p>У остальных студентов и других кандидатов все было сложнее: нужно пройти первичное интервью с рекрутером, дождаться его решения, и только потом, если оно окажется положительным, тебя пригласят на интервью с руководителем команды, в которую хочешь попасть.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2025-02-18/1e273997-ffff-4988-a44b-f5c9d3695aa4.jpeg" alt="" /><figcaption>Мой сертификат выглядел так.</figcaption></figure><h2>А потом пошли стажировки и адаптация</h2><p>Благодаря учебе у меня появилась хорошая теоретическая база, небольшие проекты в портфолио, навыки работы с конкретными инструментами и контакты с коллегами, которые раньше были нашими преподавателями. Но было все равно сложновато.</p><p>Все потому, что появился огромный объем информации: по процессам, по продуктам, по ролям — все, что скопилось у отдела за много лет работы. И этот объем надо было как-то усвоить в максимально сжатые сроки: изучать документацию, читать чужой код, разбираться, что этот код сделал и почему именно так.</p><p>Но я всегда мог написать вопрос в общий чат, и коллеги помогали разобраться с конкретной задачей.</p><p>Конечно, параллельно с первого дня стажировки я начал работать. Например, первой задачей было построить скоринговую ML-модель — по типу тех, которые делают коллеги. Делать нужно было все:</p><ul><li>сборку и расчет данных;</li><li>препроцессинг;</li><li>фильтрацию стабильных признаков во времени по PSI;</li><li>построение и сохранение ансамбля моделей;</li><li>расчет метрик качества;</li><li>создание отчета по построенной модели.</li></ul><p>И здесь помогло обучение в Школе аналитиков данных (особенно блок Big Data). Мы учились на тех инструментах, которыми я пользовался на стажировке и пользуюсь до сих пор. Например, когда я только попал на стажировку, уже очень хорошо разбирался в модуле Spark, успел позапускать на нем код — так что тратить время на изучение инструмента не пришлось.</p><h2>Так, очень быстро и незаметно пробежали три месяца</h2><p>Как такового перехода из стажировки в штат у меня не было — я закрывал спринты, постепенно брал на себя более сложные задачи (например, строил внешнюю модель для внешнего заказчика). Мне даже сложно прочертить четкую границу между работой стажера и на нынешней должности, потому что проекты остались теми же:</p><ul><li>реализовывать новые фичи для ML-моделей на основе данных телекома;</li><li>сделать аналитику по продуктам финтеха;</li><li>построить ML-модель для потока внешних клиентов и так далее.</li></ul><p>Тем не менее появилось планирование и долгосрочные цели. Если раньше я был «на подхвате», и тимлид давал по задаче за раз, то теперь потихоньку начал формироваться бэклог на следующий квартал: мне начали ставить конкретные задачи с дедлайнами.</p><p>Как я узнал от HR, после завершения стажировки около 60% сотрудников переходят в штат компании. Это меня удивило и замотивировало — не хотелось попасть в оставшиеся 40%.</p><h2>Что осталось рассказать</h2><p>Я остался доволен учебой в Школе и дальнейшим треком по нескольким причинам:</p><ul><li>качественные и хорошо структурированные знания, которые вы либо не сможете найти в открытом доступе, либо потратите на это кучу времени;</li><li>преподаватели — действующие сотрудники МТС, опытные специалисты с огромной экспертизой;</li><li>классное, открытое общение: и менеджеры, и преподаватели всегда готовы помочь;</li><li>домашки не были абстрактными и больше походили на пет-проекты — с такими точно можно собрать портфолио и стучаться в крупные IT-компании.</li></ul><p>В целом, этот курс стал для меня отличным стартом в мире Data Science. Моей целью было получить навыки и знания, которые могут помочь мне попасть на стажировку в МТС — и я их получил. Заранее изучил теорию, с которой буду сталкиваться на работе, и отточил ее на домашних заданиях, выяснил, как все устроено в командах, и познакомился с будущими коллегами.</p><p>А тем, кто только поступает в Школу, я советую быть активными: ходить на лекции, выполнять домашки и получать баллы. Звучит просто и обыденно, но от этого действительно зависит, сможете ли вы попасть на стажировку и получить работу.</p>]]></content:encoded>
    </item>
    <item>
      <title>Кем стать: дата-сайентистом, аналитиком, инженером данных или ML</title>
      <link>https://tproger.ru/articles/kem-stat--data-sajentistom--analitikom--inzhenerom-dannyh-ili-ml</link>
      <comments>https://tproger.ru/articles/kem-stat--data-sajentistom--analitikom--inzhenerom-dannyh-ili-ml?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Денис Кудерин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kem-stat--data-sajentistom--analitikom--inzhenerom-dannyh-ili-ml</guid>
      <description><![CDATA[<p>Специализации в Data Science — дата-сайентист, аналитик, дата-инженер, ML-инженер. Кем стать. </p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kem-stat--data-sajentistom--analitikom--inzhenerom-dannyh-ili-ml">Кем стать: дата-сайентистом, аналитиком, инженером данных или ML</a>»</p>]]></description>
      <category><![CDATA[Интернет]]></category>
      <category><![CDATA[Оптимизация]]></category>
      <category><![CDATA[Статистика]]></category>
      <category><![CDATA[Производительность]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[SQL]]></category>
      <category><![CDATA[Карьера]]></category>
      <category><![CDATA[Базы данных]]></category>
      <category><![CDATA[Навыки]]></category>
      <category><![CDATA[HR]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Аналитика]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 13 Feb 2025 10:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Data Science — обширная область знаний на стыке аналитики, статистики, математики, программирования и машинного обучения. Специалисты в этой сфере работают с данными — они их хранят, обрабатывают, анализируют, находят закономерности и используют для прогнозирования. Результаты труда используются для решения самого широкого круга задач — от повышения розничных продаж до анализа ДНК по результатам лабораторных тестов.</p><p>С Data Science в ИТ связан ряд профессий. Наиболее востребованные из них — дата-сайентист, дата-аналитик, инженер данных и ML-инженер (специалист по машинному обучению). Узнаем, чем занимаются представители этих профессий, сколько зарабатывают и каковы их перспективы на современном рынке труда.</p><h2>Data Science — почему это направление ИТ актуально</h2><p>Джунам, студентам и тем, кто только выбирает свое направление в ИТ, стоит обратить на Дата-сайенс самое пристальное внимание. Специалисты в этой нише востребованы уже сейчас и входят в число сотрудников с самыми высокими зарплатами. В ближайшее десятилетие, даже с учетом нестабильной экономической ситуации, спрос на профессионалов Data Science во всем мире будет только расти.</p><p>Периодически в этом сегменте возникают всплески популярности. Значимый скачок произошел в 2023 году после появления GPT-4. Компании принялись в спешном порядке осваивать технологии машинного обучения (machine learning, ML) для создания нейросетей для бизнеса и чат-ботов, использующих естественный язык. Количество вакансий в отрасли существенно возросло — в особенной степени это коснулось ML-инженеров.</p><p>Сложность профессий, связанных с Data Science, в том, что эта сфера стремительно прогрессирует. Специалистам приходится постоянно актуализировать свои знания и осваивать смежные области. При этом, глубокое знание языков программирования и умение кодить остаются базой для каждого сотрудника этого направления.</p><p>Компании хоть и предъявляют повышенные требования к уровню знаний и навыков, но предлагают специалистам достойный уровень оплаты. Медианная зарплата, согласно данным сайта <a href="https://getmatch.ru/salaries/data_science">Getmatch</a>, составляет 205 тыс. руб. Джунам работодатели готовы платить от 100-110 тыс., а сеньорам — от 350 тыс. и выше.</p><p>На российском рынке труда количество вакансий в этой сфере в несколько раз превышает число опубликованных резюме. Дефицит кадров в 2024-25 годах достиг максимальных значений за весь период наблюдений. Несмотря на негласные стереотипы в ИТ-сегменте, востребованы кандидаты любых возрастов, в том числе из группы 35+. Для людей с техническим складом ума и опытом работы в ИТ это отличная возможность расширить свои компетенции или освоить новую профессию с нуля.</p><p>Какие направления Data Science наиболее популярны и почему, рассмотрим далее.</p><h2>Дата-сайентист (Data Scientist)</h2><p>Дата-сайентист — специалист по работе с данными, использующий статистику, программирование и машинное обучение для построения прогностических математических моделей и их тестирования.</p><h3>Чем занимается Data Scientist</h3><p>Data Scientist находит закономерности в больших массивах информации и прогнозирует будущие значения. Этот специалист — властелин больших данных. Он может найти работу в любых сферах — от розничных продаж и банков до молекулярной биологии. Модели дата-сайентисты создают при помощи алгоритмов machine learning, а для работы с базами данных используют SQL — структурированный язык запросов.</p><p>Методы аналитики универсальны, а одно из самых востребованных направлений сейчас — создание и обучение нейронных сетей, например, для исследований генома, прогнозирования уровня заболеваемости и т.д. В этих направлениях дата-сайентисты, как правило, работают в связке с ML-инженерами.</p><p>Перечислим основные  задачи, которым занимается дата-сайентист:</p><ul><li>собирает большие объемы данных из разных источников;</li><li>анализирует собранную информацию, используя математические модели и алгоритмы ML;</li><li>визуализирует данные — превращает цифры в диаграммы и графики, делая информацию наглядной и более доступной для восприятия;</li><li>строит модели прогнозирования — для предсказания поведения посетителей сайтов, выявления подозрительных операций в финансовой сфере и для других целей;</li><li>тестирует модели и проводит их оптимизацию — выявляет ошибки, дорабатывает их с целью повышения точности прогнозов.</li></ul><p>Простой пример. В розничной торговле дата-сайентист собирает обширные массивы данных о поведении пользователей, после чего создает модель оптимального ценообразования. Продажи увеличиваются, средний чек растет, компания получает больше прибыли.</p><p>Для онлайн-кинотеатров специалист разрабатывает модели ИИ, которые анализируют поведение конкретных пользователей и на основании личных интересов подбирают для них фильмы и сериалы.</p><p>В крупном бизнесе в работе дата-сайентиста заинтересованы все отделы. Логистам они помогают оптимизировать маршруты, используя данные с GPS-трекеров. На производстве рассчитывают нагрузку оборудования с учетом срока службы и текущего состояния.</p><p>Какие скиллы требуются:</p><ul><li>Программирование. Специалист должен знать Python и его основные библиотеки, SQL и другие языки программирования, включая скриптовые для оптимизации рабочих процессов.</li><li>Математика и статистика. Линейная алгебра, теория вероятностей, статистический анализ.</li><li>Навыки работы с Big Data и базами данных, а также инструментами для их обработки (Spark, Hadoop и другими).</li><li>Моделирование, машинное обучение. Дата-сайентист создает модели для классификации, использует алгоритмы ML и технологии глубокого обучения.</li><li>Визуализация данных. Построение графиков, диаграмм с помощью Matplotlib, Seaborn и прочих инструментов.</li><li>Критическое мышление. Оно потребуется для формирования гипотез и тестирования созданных моделей.</li></ul><p>Кроме того, дата-сайентист должен уметь коммуницировать, отстаивать свою точку зрения и грамотно презентовать свою работу.</p><h3>Актуальность и перспективы профессии</h3><p>Бизнес готов платить за ту пользу, которую приносят специалисты, поэтому зарплаты в этой сфере постоянно растут. Данных становится все больше, это значит, что дата-сайентисты требуются везде. Это одна из самых быстрорастущих профессий в ИТ — кратный рост количества вакансий наблюдается ежегодно.</p><p>На Хабр.Карьере медианная зарплата в этой сфере составляет 200 тыс. рублей. Стажеры и джуны получают от 55 до 100 тыс., мидлы с опытом работы от 3 лет — 250 тыс., сеньоры с обширным стеком технологий и стажем от 5 лет могут рассчитывать на 400-700 тыс.</p><h2>Дата-аналитик (Data Analyst)</h2><p>Дата-аналитик — специалист по анализу данных. Сырые факты, сведения и цифры он преобразует в полезную информацию.</p><h3>Чем занимается дата-аналитик</h3><p>Задача аналитика — не просто работать с данными, а делать на их основании важные для проекта выводы. Data Analyst выявляет тренды и паттерны, необходимые для принятия взвешенных и эффективных решений.</p><p>Прежде всего, такие специалисты востребованы в разных отраслях бизнеса. В отличие от дата-сайентиста, аналитик не создает модели для прогнозирования, он работает с уже случившимися событиями.</p><p>Пример. Компания провела масштабную маркетинговую кампанию. Дата-аналитик изучает полученные данные, находит инсайты, узнает причины, которые повлияли на результат, и предлагает меры по улучшению ситуации.</p><p>Перечислим основные задачи, которые выполняет дата-аналитик:</p><ul><li>Собирает данные. Подключает к интернет-ресурсам аналитические системы, работающие в автоматическом режиме, использует API для сбора информации из приложений и платформ.</li><li>Выгружает эти данные, соединяет информационные блоки из разных систем в общую базу.</li><li>Подготавливает данные — сортирует, фильтрует, разбивает на составляющие.</li><li>Анализирует информацию. Для интерпретации данных дата-аналитик использует методы математики и статистики, самостоятельно созданное ПО, которое помогает находить закономерности и зависимости.</li><li>Готовит отчеты, графики и дашборды с объективными выводами и методическими рекомендациями. Эти данные поступают руководству и сотрудникам.</li></ul><p>Сверхзадача аналитика — выявить скрытые закономерности, которые нельзя распознать при поверхностном анализе, и извлечь пользу из полученной информации.</p><p>Какими навыками должен обладать дата-аналитик:</p><ul><li>Знание Python и библиотек (Pandas, NumPy, Scikit-Learn и других), языка запросов SQL.</li><li>Умение работать с базами данных (PostgreSQL, MongoDB) и софтом для их обработки (Spark, Hadoop), программами для построения графиков (Matplotlib, Seaborn, Plotly), инструментами аналитики (Tableau, Power BI, Google Analytics).</li><li>Знание математики, статистического анализа, теории вероятностей.</li><li>Аналитическое мышление. Способность видеть в цифрах, показателях и фактах реальные проблемы или возможности для роста и развития.</li><li>Внимательность и усидчивость. Несмотря на автоматизацию рабочих процессов, риск ошибки сохраняется, а малейшая неточность в отчетах может привести к некорректным выводам.</li></ul><h3>Востребованность специалистов на рынке труда</h3><p>По данным портала Хабр.Карьера, медианная зарплата дата-аналитика составляет 175 тыс руб. Джунам платят от 60 до 100 тыс., мидлам — 140-170 тыс., сеньорам — 250-280 тыс.</p><p>Поскольку объем цифровых данных постоянно увеличивается, а компании поголовно переходят на автоматизацию бизнес-процессов, потребность в аналитиках постоянно растет. Компании готовы брать студентов без опыта, а также компетентных специалистов на удаленную работу.</p><h2>Инженер данных (Data Engineer)</h2><p>Такой специалист создает, тестирует и поддерживает архитектуру данных в конкретных проектах.</p><h3>Чем занимается инженер данных</h3><p>Дата-инженер имеет дело с обширными базами данных, хранилищами и системами обработки информации. Он работает с первичными данными, подготавливает их для прогнозистов и аналитиков, создает пайплайны — алгоритмы по обслуживанию информационных баз.</p><p>Data Engineer может выполнять обязанности архитектора или работать в связке с таким сотрудником. Компаниям выгоднее иметь универсала с более расширенными компетенциями, поэтому архитектура баз данных часто входит в круг обязанностей дата-инженера.</p><p>Какие задачи выполняет:</p><ul><li>Проектирует и создает хранилища и базы данных, занимается их обслуживанием, поддерживает производительность и обеспечивает масштабируемость.</li><li>Разрабатывает процессы ETL — извлечение, преобразование и загрузку данных из разных источников.</li><li>Создает системы автоматизации для сбора, обработки и анализа данных. Настраивает мониторинг и уведомления.</li><li>Интегрирует в систему модели машинного обучения.</li></ul><p>Какие скилы нужны дата-инженеру:</p><ul><li>Знание языков программирования — в первую очередь, это Python и Scala. Специалисту потребуются программные средства для автоматизации процессов.</li><li>Навыки работы с базами данных различного типа, глубокие знания SQL — языка запросов.</li><li>Опыт работы с облачными сервисами — AWS, GCP, Azure и другими платформами для управления данными и инфраструктурой.</li><li>Знание технологий Big Data, опыт работы с Hadoop, Spark и подобными инструментами.</li><li>Понимание практик DevOps — методологии автоматизации процессов сборки, тестирования и развертывания ПО.</li></ul><p>Знание математики и умение писать код — базовые условия для входа в профессию. Наличие ИТ-бэкграунда существенно упростит освоение основных навыков.</p><h3>Потребность в специалистах на рынке труда</h3><p>Дата-инженеры выполняют сложные задачи и обладают глубокими компетенциями. По этой причине их медианная зарплата выше, чем у представителей других специальностей в Data Science, и составляет 220 тыс. руб. На такой оклад может рассчитывать мидл с опытом работы до 3 лет. Джунам платят от 100 тыс., сеньорам — в диапазоне от 350 до 700 тыс.</p><p>Поскольку данных становится только больше, компании вынуждены выискивать новые способы их хранения, обработки и использования. Для этого нужны мощные платформы и компетентные сотрудники, которые занимаются оптимизацией процессов. Дата-инженеры работают в тандеме с сайентистами, поставляя им подготовленные и структурированные массивы данных</p><h2>ML Engineer (инженер машинного обучения)</h2><p>Технологии машинного обучения охватывают все больше сфер нашей жизни. Боты воспринимают естественную речь и отвечают как люди, сайты предвидят музыкальные и кинематографические предпочтения пользователя, нейросети представлены в образовании и медицине. Разработкой и внедрением моделей Machine Learning занимаются ML-инженеры.</p><h3>Что за профессия</h3><p>Такой специалист разрабатывает алгоритмы и на их основе создает модели, способные к обучению. Материалом для ML служат различные данные, представленные в виде таблиц, текстов, картинок и других источников информации.</p><p>ML-инженер выявляет сложные закономерности в базах данных, которые помогают моделям максимально точно прогнозировать результаты каких-либо процессов и принимать решения. Машинное обучение — важнейший элемент в разработке нейросетей, выполняющих задачи в реальном времени.</p><p>Сферы использования машинного обучения и нейросетей многообразны:</p><ul><li>Финансовая отрасль. Помощь банкам в принятии решений о выдаче кредитов, виртуальное общение с клиентами.</li><li>Транспорт. Управление беспилотными машинами, построение оптимальных маршрутов.</li><li>Продажи. Планирование поставок, персонифицированные предложения клиентам, оптимизация ценообразования.</li><li>Здравоохранение. Диагностика на основе сложных медицинских анализов, разработка наиболее эффективных протоколов терапии.</li><li>Развлечения. Подбор музыки, фильмов и игр на основе поведения и предпочтений пользователя.</li></ul><p>Кроме того, машинное обучение востребовано в промышленности, логистике, страховании и многих других сферах. Такие технологии используют крупнейшие мировые корпорации Google, Netflix, Apple, а также отечественные компании — Сбер, Т-Банк, МТС, Билайн и многие другие.</p><p>Чем занимается ML Engineer:</p><ul><li>Собирает данные, используя как можно больше релевантных источников информации.</li><li>Подготавливает данные, очищает их,  преобразует и структурирует.</li><li>Разрабатывает модели. Для этого инженер использует специальные алгоритмы — линейную регрессию, деревья решений и т.д.</li><li>Тестирует модели — проверяет их точность перед внедрением в реальные процессы.</li><li>Интегрирует модели в системы, сайты и приложения для практического использования.</li><li>Поддерживает работу алгоритмов, делает обновления.</li></ul><p>Внутри профессии есть разные специализации — работа с глубокими нейронными сетями, обработка естественного языка, обучение моделей в робототехнике.</p><p>В ML-инженеры сложно прийти с нулевой подготовкой. Специалисту потребуется знание математики и статистики, алгоритмов машинного обучения, языков программирования Python и R. Кроме того, он должен обладать навыком тестирования моделей; уметь работать с Big Data с использованием таких инструментов, как SQL, Pandas, Scikit-learn и многих других.</p><p>Сотрудник должен быть в курсе свежих исследований в сфере ML и AI, осваивать и применять новые методики и технологии, делая это раньше конкурентов.</p><h3>Нужны ли в ИТ ML-инженеры</h3><p>Все больше сервисов, компаний и проектов заинтересованы в технологиях машинного обучения. Существенно увеличивается число чат-ботов, задействованных в клиентской поддержке. Неподготовленному пользователю уже сложно понять, с кем он разговаривает, когда звонит в тот или иной сервис — с живым человеком или моделью. Беспилотные средства уже работают в доставке, грузовых и пассажирских перевозках.</p><p>Это значит, что потребность в специалистах по машинному обучению будет только расти. В особенной степени это касается квалифицированных сотрудников с опытом.</p><p>Зарплаты джунов в ML-инженерии — 100-150 тыс. руб., мидлы могут рассчитывать на 250-300 тыс., сеньоры получают 350-500 тыс и больше.</p><p>Data Science — обширная область знаний, которая становится все более актуальной в бизнесе, науке, образовании. Для быстрого входа в ИТ с нуля это направление не подходит — нужны знания математики, теории вероятности и статистики, языков программирования. Однако потратив время на подготовку и освоение необходимых навыков, можно рассчитывать на зарплату от 100-150 тыс. уже в статусе джуна.</p><p>Если AI, ML, нейросети, аналитика — ваша тема, и вы уже задумались о профессиях, ждем в нашем <a href="https://vk.com/away.php?to=https%3A%2F%2Ft.me%2F%2Bp-vyEfLAjkJmMTIy&amp;utf=1">тг-канале.</a></p>]]></content:encoded>
    </item>
    <item>
      <title>Лучшие курсы по анализу данных для начинающих с нуля — онлайн обучение Data Analyst</title>
      <link>https://tproger.ru/articles/kursy-po-analitike-dannyh</link>
      <comments>https://tproger.ru/articles/kursy-po-analitike-dannyh?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Анастасия Шишкина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kursy-po-analitike-dannyh</guid>
      <description><![CDATA[<p>Лучшие курсы для аналитика данных: рейтинг актуальных обучающих программ. Подборка онлайн-обучения профессии Data Analyst с нуля и для специалистов с опытом</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kursy-po-analitike-dannyh">Лучшие курсы по анализу данных для начинающих с нуля — онлайн обучение Data Analyst</a>»</p>]]></description>
      <category><![CDATA[Для начинающих]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Навыки]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Анализ данных]]></category>
      <category><![CDATA[Аналитика]]></category>
      <category><![CDATA[Обучающие курсы]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 12 Feb 2025 17:00:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>На сегодняшний день курсы аналитика данных позволяют изучить основы статистики, машинного обучения, обработки естественного языка, анализа социальных сетей и других методов, используемых в анализе данных. Также можно научиться работать с популярными инструментами и библиотеками, такими как Python, R, SQL, Tableau, Power BI и другими.</p><p>Вместе с экспертами <a href="https://kursfinder.ru/">Kursfinder</a> я проанализировала более 60 предложений, чтобы составить рейтинг из 50 курсов по аналитике данных. В статье они распределены по подборкам для удобства навигации: в начале я собрала 10 самых лучших, по моему мнению, программ обучения. Далее идет дополнительный список, а в конце статьи вы найдете подборку бесплатного обучения. Полный список <a href="https://kursfinder.ru/data-analytics/">курсов по аналитике данных</a> ищите в каталоге Kursfinder.</p><h2>ТОП-10 лучших курсов по аналитике данных в 2026 году</h2><ol><li><a href="https://experts2.ru/pwQqbD?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=1">Аналитик данных</a> от Eduson Academy — лучшее обучение data analyst с личным куратором.</li><li><a href="https://experts2.ru/jXdTep?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=2">Профессия: Аналитик</a> от ProductStar — отличное обучение профессии с помощью в трудоустройстве.</li><li><a href="https://experts2.ru/FrpbDy?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=3">Аналитик данных</a> от Skypro — самое быстрое обучение с азов.</li><li><a href="https://experts2.ru/XutvJx?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=4">Аналитика с 0: быстрый старт</a> от ProductStar — лучшее обучение на аналитика данных с нуля.</li><li><a href="https://experts2.ru/KcsjxL?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=5">Mini-MBA: Аналитик 2.0</a> от SF Education —  лучший курс MBA по аналитике.</li><li><a href="https://experts2.ru/zaUXlx?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=6">Программирование для анализа данных</a> от Skypro — лучший курс по программированию для анализа данных.</li><li><a href="https://experts2.ru/yckVQp?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=7">Аналитик данных</a> от SF Education — отличное повышение квалификации.</li><li><a href="https://experts2.ru/ZuAryo?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=8">Аналитик данных с нуля</a> от Нетологии — отличный вариант для отработки практики на реальных проектах.</li><li><a href="https://experts2.ru/rbLuKe?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=9">Аналитик данных</a> от Бруноям — живое общение с преподавателями.</li><li><a href="https://experts2.ru/zhWEty?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=10">Аналитик данных ISA</a> от Skillfactory — возможность участия в стажировках.</li></ol><p>Онлайн-обучение на аналитика данных может быть полезно новичкам, которые только начинают свой путь в этой области, и профессионалам, желающим расширить свои компетенции. Кроме того, программы могут быть интересны и тем, кто не планирует связывать свою карьеру с анализом данных, но хочет лучше понимать, как работают современные технологии и какие возможности они предоставляют.</p><h2>Онлайн-курсы для аналитика данных</h2><p><b>1. </b><a href="https://experts2.ru/pwQqbD?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=1">Аналитик данных</a> |<b> Eduson Academy </b></p><p>На программе от Eduson Academy студенты изучат методы сбора, обработки и анализа данных, а также научатся создавать дашборды для визуализации результатов. Они освоят SQL и NoSQL для работы с базами данных и познакомятся с инструментами, такими как Python, R и Tableau. Курс также поможет им решать бизнес-задачи, развивая критическое мышление и коммуникативные навыки.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-02-07/a68a288d-2b5b-49a4-bebb-e249e2348970.png" alt="" /></figure><ul><li>Стоимость: 136 464 рубля</li><li>Длительность: 6 месяцев</li><li>Формат обучения: видеолекции, скринкасты, тренажеры, тесты</li><li>Сертификат: удостоверение о повышении квалификации + диплом</li></ul><p><b>Кому подойдет: </b></p><ul><li>новичкам с нуля.</li></ul><p><b>Преимущества:</b></p><ul><li>постоянная помощь от личного куратора;</li><li>можно выбрать свой график обучения;</li><li>содействие в поиске работы;</li><li>первые уроки предоставляются бесплатно.</li></ul><p><b>Недостатки:</b></p><ul><li>техническая поддержка отвечает с задержками.</li></ul><p><b>Программа обучения:</b></p><ul><li>Анализ проблемы для принятия решения</li><li>Системный подход в управлении</li><li>Процесс анализа в компании</li><li>Создание консолидированных таблиц</li><li>Оптимизация процессов и повышение эффективности</li></ul><p><a href="https://experts2.ru/pwQqbD?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=1">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>2. </b><a href="https://experts2.ru/jXdTep?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=2">Профессия: Аналитик</a> | <b>ProductStar </b></p><p>Освоите основы анализа данных. Научитесь изучать потенциальных клиентов, рынок и конкурентов, а также выявлять перспективы развития мобильных приложений. Познакомитесь с методами оптимизации процессов и применением технологий машинного обучения. Вы научитесь понимать смысл информации, используя математические методы. Сможете анализировать бизнес-процессы и представлять данные в виде удобных и информативных дашбордов.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-02-07/fb65b727-db69-40c3-a653-78ae8f8c7475.png" alt="" /></figure><ul><li>Стоимость: от 112 752 рублей</li><li>Длительность: 10 месяцев</li><li>Формат обучения: видеоуроки, вебинары, домашняя работа</li><li>Сертификат: есть</li></ul><p><b>Кому подойдет: </b></p><ul><li>новичкам с нуля.</li></ul><p><b>Преимущества:</b></p><ul><li>крупные проекты для портфолио;</li><li>без навыков кодинга;</li><li>рассрочка без процентов;</li><li>три мини-программы в подарок;</li><li>стажировки в партнерских компаниях.</li></ul><p><b>Недостатки:</b></p><ul><li>в первом тарифе нет доступа к смежным курсам.</li></ul><p><b>Программа обучения:</b></p><ul><li>Цели и методы работы специалиста по анализу данных</li><li>Место и функции аналитика в коллективе</li><li>Разбивка показателей: система метрик и их структура</li><li>Анализ метрик и работа с индивидуальными показателями</li><li>Основные математические операции и алгоритмы</li><li>Модификация, интеграция и исключение информации</li></ul><p><a href="https://experts2.ru/jXdTep?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=2">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>3. </b><a href="https://experts2.ru/FrpbDy?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=3">Аналитик данных</a> | <b>Sky Pro</b></p><p>Программа обучает собирать и анализировать данные для нахождения ценных инсайтов и принятия обоснованных решений. Вы освоите инструменты и методы статистического анализа, машинного обучения и визуализации данных. Научитесь применять эти навыки для решения бизнес-задач, таких как прогнозирование и оптимизация. Познакомитесь с популярными инструментами, такими как Python, R и Tableau, и научитесь создавать отчеты и презентации для представления результатов.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-02-07/cd5d6051-b047-4d79-b223-0f913dbd652f.png" alt="" /></figure><ul><li>Стоимость: 178 956 рублей</li><li>Длительность: 12 месяцев</li><li>Формат обучения: вебинары, домашняя работа, тестирования</li><li>Сертификат: удостоверение о повышении квалификации или диплом</li></ul><p><b>Кому подойдет: </b></p><ul><li>новичкам с нуля.</li></ul><p><b>Преимущества:</b></p><ul><li>множество способов оплатить обучение;</li><li>проводятся регулярные групповые занятия;</li><li>предусмотрены индивидуальные встречи с преподавателем;</li><li>оплата производится через месяц.</li></ul><p><b>Недостатки:</b></p><ul><li>ограниченное количество мест на программу.</li></ul><p><b>Программа обучения:</b></p><ul><li>Работа с ячейками и таблицами в Excel</li><li>Применение базовых формул в Excel</li><li>Основные экономические индикаторы</li><li>Чем отличаются разные типы расходов</li><li>Как работают логические операторы</li><li>Ключевые виды хранилищ информации</li></ul><p><a href="https://experts2.ru/FrpbDy?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=3">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>4. </b><a href="https://experts2.ru/XutvJx?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=4">Аналитика с 0: быстрый старт</a> | <b>ProductStar </b></p><p>Программа обучает основам аналитики, сбору и анализу данных, работе с инструментами аналитики, статистике, машинному обучению, Data Science и визуализации данных. Участники узнают, как применять аналитику в бизнесе, работать с большими данными и базами данных. Освоите базовые показатели IT-продуктов и научитесь создавать их иерархию. Ментор контролирует ваш прогресс и помогает успешно пройти испытательный срок при приеме на работу.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-02-07/12bc4571-bbd7-47bb-9643-7b5fb1d4def7.png" alt="" /></figure><ul><li>Стоимость: 59 232 рубля</li><li>Длительность: 2 месяца</li><li>Формат обучения: видеоуроки, вебинары, домашняя работа</li><li>Сертификат: есть</li></ul><p><b>Кому подойдет: </b></p><ul><li>новичкам с нуля.</li></ul><p><b>Преимущества:</b></p><ul><li>рассрочка без процентов;</li><li>три мини-программы в подарок;</li><li>комфортный темп работы;</li><li>стажировки в партнерских компаниях.</li></ul><p><b>Недостатки:</b></p><ul><li>маловато времени для обучения.</li></ul><p><b>Программа обучения:</b></p><ul><li>Цели специалиста по анализу данных</li><li>Инструменты для работы</li><li>Образ идеального аналитика</li><li>Как формулировать корректные вопросы</li><li>Что представляет собой HADI</li><li>Как функционирует HADI</li><li>Все стадии процесса дизайн-мышления</li><li>Как оптимизировать работу с метриками</li></ul><p><a href="https://experts2.ru/XutvJx?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=4">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>5. </b><a href="https://experts2.ru/KcsjxL?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=5">Mini-MBA: Аналитик 2.0</a> |<b> SF Education </b></p><p>Курс обучает анализу данных и принятию обоснованных решений. Вы освоите методы сбора, обработки и визуализации данных, научитесь работать с большими массивами и разрабатывать стратегии. Курс поможет вам выявлять проблемные места в бизнес-процессах, оптимизировать работу компаний и управлять рисками. Вы научитесь представлять данные наглядно и эффективно работать в команде.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-02-07/9f90c80f-a84e-4f9f-a9e5-e85ef5e972bb.png" alt="" /></figure><ul><li>Стоимость: 166 248 рублей</li><li>Длительность: 9 месяцев</li><li>Формат обучения: видеоуроки, практика, домашняя работа</li><li>Сертификат: диплом</li></ul><p><b>Кому подойдет: </b></p><ul><li>новичкам с нуля;</li><li>начинающим специалистам.</li></ul><p><b>Преимущества:</b></p><ul><li>три дня обучения бесплатно;</li><li>курс в подарок;</li><li>экономия до 75%;</li><li>помощь с устройством на работу.</li></ul><p><b>Недостатки:</b></p><ul><li>иногда происходят технические сбои.</li></ul><p><b>Программа обучения:</b></p><ul><li>Основные умения работы в Excel</li><li>Углубленные навыки работы в Excel</li><li>Разработка программ на языке Python</li><li>Выступления для специалистов</li><li>Знакомство с основами бизнес-анализа</li><li>Работа с разработчиками</li><li>Освоение основ финансового учета и анализа</li></ul><p><a href="https://experts2.ru/KcsjxL?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=5">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>6. </b><a href="https://experts2.ru/zaUXlx?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=6">Программирование для анализа данных</a> | <b>Skypro </b></p><p>На программе вы освоите основные языки программирования: Python, SQL и R. Научитесь обрабатывать и анализировать большие массивы данных, используя библиотеки и фреймворки для ускорения разработки. Получите навыки решения практических задач, таких как прогнозирование и классификация. Освоите создание отчетов и презентаций для визуализации результатов анализа.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-02-07/b1eed0c4-10a2-42db-b327-4c4e6138929e.png" alt="" /></figure><ul><li>Стоимость: 169 596 рублей</li><li>Длительность: по запросу</li><li>Формат обучения: вебинары, домашняя работа, тестирования</li><li>Сертификат: удостоверение о повышении квалификации или диплом</li></ul><p><b>Кому подойдет: </b></p><ul><li>новичкам с нуля.</li></ul><p><b>Преимущества:</b></p><ul><li>множество способов оплатить обучение;</li><li>проводятся регулярные групповые занятия;</li><li>предусмотрены индивидуальные встречи с преподавателем;</li><li>оплата производится через месяц.</li></ul><p><b>Недостатки:</b></p><ul><li>не указана длительность обучения.</li></ul><p><b>Программа обучения:</b></p><ul><li>Знакомство с программированием</li><li>Основы работы с Python</li><li>Графики и визуализация данных</li><li>Основы работы с Big Data</li><li>Работа с Hadoop и Spark</li><li>Классификация и регрессия</li><li>Кластеризация и нейронные сети</li><li>Работа с NoSQL базами данных</li></ul><p><a href="https://experts2.ru/zaUXlx?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=6">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>7.</b> <a href="https://experts2.ru/yckVQp?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=7">Аналитик данных</a> |<b> SF Education  </b></p><p>Занятия обучают основам анализа данных и работе с большими объемами информации. Вы научитесь собирать, обрабатывать данные, работать с базами данных и SQL, анализировать данные с помощью Python и Power BI, строить математические модели и прогнозировать результаты. Курс включает работу с реальными кейсами, что помогает создать портфолио для поиска работы.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-02-07/7fb2d77f-52cd-47da-8f2b-58cb9e257937.png" alt="" /></figure><ul><li>Стоимость: 83 184 рубля</li><li>Длительность: 4 месяца</li><li>Формат обучения: видеоуроки, практика, домашняя работа</li><li>Сертификат: диплом</li></ul><p><b>Кому подойдет: </b></p><ul><li>продолжающим специалистам.</li></ul><p><b>Преимущества:</b></p><ul><li>три дня обучения бесплатно;</li><li>курс в подарок;</li><li>экономия до 75%;</li><li>помощь с устройством на работу.</li></ul><p><b>Недостатки:</b></p><ul><li>не для новичков.</li></ul><p><b>Программа обучения:</b></p><ul><li>Основы работы с Excel</li><li>Углубленные знания и умения в Excel</li><li>Работа с информацией в Power Query</li><li>Разработка программ на Python</li><li>Основы математики</li><li>Модуль по развитию карьеры</li><li>Навыки межличностного общения</li></ul><p><a href="https://experts2.ru/yckVQp?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=7">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>8.</b> <a href="https://experts2.ru/ZuAryo?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=8">Аналитик данных с нуля</a> | <b>Нетология  </b></p><p>На программе учат собирать, обрабатывать и визуализировать данные, работать с базами данных и SQL/NoSQL, разрабатывать алгоритмы и прогнозировать события. Студенты научатся автоматизировать процессы, интерпретировать результаты анализа и работать с популярными инструментами, такими как Python, R, Tableau и Power BI. Курс готовит к карьере в анализе данных или к продолжению обучения на более продвинутых программах.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-02-07/d1667a06-bc0a-4fee-a451-36342359ee6d.png" alt="" /></figure><ul><li>Стоимость: от 99 000 рублей</li><li>Длительность: от 6 месяцев</li><li>Формат обучения: видео лекции, практические задания, теория, домашние задания, итоговые проекты</li><li>Сертификат: диплом о профессиональной переподготовке</li></ul><p><b>Кому подойдет: </b></p><ul><li>новичкам с нуля.</li></ul><p><b>Преимущества:</b></p><ul><li>крутые дополнительные материалы;</li><li>техническая поддержка высокого уровня;</li><li>удобное мобильное приложение;</li><li>уведомления о сроках выполнения задач;</li><li>возможность возврата денежных средств.</li></ul><p><b>Недостатки:</b></p><ul><li>скидка скоро закончится.</li></ul><p><b>Программа обучения:</b></p><ul><li>Знакомство с Google Таблицами</li><li>Продвинутые возможности Google Таблиц</li><li>Как работает аналитическое мышление</li><li>Основы статистического анализа</li><li>Усовершенствованное представление данных</li><li>Python как средство для анализа данных</li><li>Машинное обучение в повседневной жизни</li></ul><p><a href="https://experts2.ru/ZuAryo?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=8">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>9. </b><a href="https://experts2.ru/rbLuKe?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=9">Аналитик данных</a> | <b>Бруноям </b></p><p>Студенты научатся собирать, обрабатывать и анализировать большие объемы данных, визуализировать результаты с помощью инструментов, таких как Python, R и SQL, создавать дашборды и отчеты для их представления, а также автоматизировать рутинные задачи. Они получат навыки интерпретации данных в различных предметных областях, таких как бизнес, медицина и финансы, и научатся эффективно коммуницировать результаты анализа.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-02-07/babdc95c-4950-4bc0-a808-7a546bb77e5c.png" alt="" /></figure><ul><li>Стоимость: 29 900 рублей</li><li>Длительность: 4 месяца</li><li>Формат обучения: видео уроки, дополнительные материалы, чат с личным наставником</li><li>Сертификат: есть</li></ul><p><b>Кому подойдет: </b></p><ul><li>новичкам;</li><li>специалистам смежных профессий.</li></ul><p><b>Преимущества:</b></p><ul><li>теория без излишней академичности;</li><li>большое количество практических заданий;</li><li>интуитивно понятный интерфейс платформы;</li><li>возможность оформить рассрочку на выгодных условиях.</li></ul><p><b>Недостатки:</b></p><ul><li>в группе более 10 человек.</li></ul><p><b>Программа обучения:</b></p><ul><li>Определение и рассмотрение темы</li><li>Разногласия в понимании целей</li><li>Стандартные задачи Data Analyst</li><li>Инструменты и платформы для работы</li><li>Взаимодействие с другими отраслями</li><li>Реальные сценарии и образцы</li><li>Обзор ключевых хранилищ информации</li></ul><p><a href="https://experts2.ru/rbLuKe?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=9">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><p><b>10. </b><a href="https://experts2.ru/zhWEty?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=10">Аналитик данных ISA</a> | <b>Skillfactory   </b></p><p>Программа обучает работе с большими данными, статистике, машинному обучению, Data Science и Data Engineering. Вы научитесь собирать и обрабатывать данные, применять алгоритмы для прогнозирования и классификации, создавать нейронные сети, работать с распределенными вычислениями и визуализировать данные. Курс также включает изучение основ Data Science и Data Engineering для старта карьеры в этих областях.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-02-07/415a0c6b-3c11-4de5-8347-af2f5ed05273.png" alt="" /></figure><ul><li>Стоимость: от 185 076 рублей</li><li>Длительность: 14 месяцев</li><li>Формат обучения: тренажеры, тесты, видеоуроки, онлайн-митапы и проекты</li><li>Сертификат: диплом о профессиональной переподготовке установленного образца</li></ul><p><b>Кому подойдет: </b></p><ul><li>новичкам с нуля.</li></ul><p><b>Преимущества:</b></p><ul><li>обучение под контролем экспертов;</li><li>поддержка от коллектива специалистов;</li><li>предоставление учебных материалов;</li><li>обучение в рамках организации.</li></ul><p><b>Недостатки:</b></p><ul><li>кому-то программа может показаться слишком долгой.</li></ul><p><b>Программа обучения:</b></p><ul><li>Анализ бизнес-моделей и методов анализа данных</li><li>Логические задания для интервью</li><li>Работа с аналитическими документами</li><li>Углубление знаний на примерах из практики</li><li>Метрики, связанные с продуктами и маркетингом</li><li>Пирамида метрик и анализ экономики на уровне юнитов</li></ul><p><a href="https://experts2.ru/zhWEty?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=10">Ознакомиться с полной программой &gt;&gt;&gt;</a></p><h2>Еще 21 дополнительных курсов аналитики данных</h2><p>Дополнительные программы помогут вам углубить понимание основных концепций и методов, а также освоить новые инструменты и техники.</p><ul><li><a href="https://experts2.ru/xRVmga?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Аналитика данных с МФТИ</a> от Нетологии. На программе вы изучите основы анализа данных и получите необходимые навыки для работы с большими объемами информации. Обучение идет с акцентом на практику.</li><li><a href="https://experts2.ru/NymqjQ?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Аналитик данных</a> Яндекс Практикум. На конкретных примерах вы сможете понять, чем занимаются специалисты по анализу данных, узнаете, какие навыки вы получите в процессе обучения, и выполните свои первые практические упражнения.</li><li><a href="https://experts2.ru/XwHlxk?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Финансы и анализ данных</a> от Нетологии. Освойте программу высшего образования в дистанционном формате, делая акцент на практической составляющей.</li><li><a href="https://experts2.ru/uXvqRz?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Аналитик данных</a> от Хекслета. Освойте ключевые показатели деятельности компаний и научитесь самостоятельно их рассчитывать, применяя SQL и Google Sheets. Проведите когортный анализ и составьте прогноз, представив данные в виде графиков с помощью Superset и Python.</li><li><a href="https://experts2.ru/PbdrkM?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Введение в Data Science</a> от Skillbox. Вы сможете примерить на себя роль дата-инженера, аналитика и эксперта в области машинного обучения.</li><li><a href="https://experts2.ru/raGwhJ?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Аналитик данных</a> от OTUS. Научитесь эффективно анализировать данные: изучите требования, освойте статистику и работу с инструментами бизнес-аналитики.</li><li><a href="https://experts2.ru/oQAwhz?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Аналитик данных</a> от Международной Школы Профессий. Станьте специалистом по анализу данных: работайте с системами управления базами данных, создавайте отчеты и визуализируйте данные в Power BI, изучите Python для работы с базами данных.</li><li><a href="https://experts2.ru/PZakoj?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Python, BI и BigData </a>от ProductStar. Освойте искусство анализа данных с использованием Python, и вы станете незаменимым специалистом в любой цифровой компании.</li><li><a href="https://experts2.ru/dZHkfh?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Менеджмент AI- и BigData-продуктов</a> от ProductStar. Освойте искусство разработки продуктов на основе больших данных и научитесь использовать искусственный интеллект.</li><li><a href="https://experts2.ru/xEguHt?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Data Analyst </a>от Skillbox. Вы будете проводить анализ, представлять данные в наглядном виде и создавать интерактивные панели управления в системах бизнес-аналитики.</li><li><a href="https://experts2.ru/gaTvHt?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Data Analyst</a> от Skillfactory. Вы получите надежную базу для развития в профессии аналитика данных: научитесь аналитически мыслить и освоите основные инструменты.</li><li><a href="https://experts2.ru/mfqzDB?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Статистические методы анализа данных</a> от «Специалист». Вы освоите методы ввода и обработки информации в программе SPSS Statistics, а также получите начальные знания о статистическом анализе данных и ключевых подходах прикладной статистики.</li><li><a href="https://experts2.ru/iOthZr?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Инженер-экономист в сфере экономики и анализа данных</a> от Профессионального стандарта. Программа даст вам возможность получить востребованную и хорошо оплачиваемую профессию инженера-экономиста в области экономики и анализа данных.</li><li><a href="https://experts2.ru/ueLibF?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Big Data</a> от Профессиональный стандарт. Программа даст вам возможность получить знания и навыки, которые позволят вам стать специалистом в области обработки больших объемов информации и работы с Интернетом вещей.</li><li><a href="https://experts2.ru/tBhGnp?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Библиотеки Python для Data Science: Numpy, Matplotlib, Scikit-learn</a> от GeekBrains. Познакомьтесь с базовыми принципами и определитесь, что вам ближе: разработка алгоритмов для машинного обучения или анализ данных.</li><li><a href="https://experts2.ru/QgzItr?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Онлайн магистратура "Науки о Данных"</a> от Skillfactory. Станьте обладателем диплома магистра по направлению «Наука о данных» от МФТИ. Получите практические навыки, работая над реальными проектами.</li><li><a href="https://experts2.ru/BefJkp?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Математика для анализа данных</a> от Нетологии. Школа поможет специалистам в области анализа данных разобраться в математических принципах: научиться выявлять закономерности в больших объемах информации и делать достоверные предсказания.</li><li><a href="https://experts2.ru/mvgxEW?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Excel для работы</a> от Skypro. Научитесь эффективно работать с таблицами, что позволит вам повысить производительность и получать доход от работы на фрилансе.</li><li><a href="https://experts2.ru/FabNig?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Математика для анализа данных</a> от Яндекс Практикум. Программа поможет восполнить пробелы в знаниях статистики, разобраться в контексте использования статистических тестов и освоить способы визуализации больших объемов информации.</li><li><a href="https://experts2.ru/fstTlW?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Аналитик BI c 0 до PRO</a> от IQBI. Вы освоите способы получения доступа к информационным ресурсам, обработки и анализа данных, а также научитесь создавать интерактивные дашборды в Power BI.</li><li><a href="https://experts2.ru/FabNig?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Математика для анализа данных плюс</a> от Яндекс Практикум. Углубленный курс для тех, кто уже освоил базовую программу «Математика для анализа данных».</li></ul><h2>Еще 5 курсов по SQL для анализа данных</h2><p>Курсы по SQL для анализа данных помогут вам освоить основы работы с базами данных и научиться писать простые запросы.</p><ul><li><a href="https://experts2.ru/FzxyiQ?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Обработка и анализ данных в SQL</a> от SF Education. Для всех, кто желает освоить работу с таблицами, разработку запросов и анализ данных, в SF Education создана программа обучения SQL с нуля.</li><li><a href="https://experts2.ru/IxBvsk?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">SQL и получение данных</a> от Нетологии. Вы научитесь пользоваться одним из ключевых инструментов для работы с данными и их анализа. Сможете выполнять аналитические задания и расширите свои перспективы для профессионального роста и развития.</li><li><a href="https://experts2.ru/uatTgJ?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">SQL для анализа данных</a> от Skypro. Освойте профессию, и вы можете трудиться из дома, самостоятельно определяя график работы, и получать доход, используя свои аналитические способности.</li><li><a href="https://experts2.ru/dRezjI?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">SQL с 0 для анализа данных</a> от ProductStar. Вам предстоит работать с массивами информации и находить в них закономерности, используя для этого SQL, Python и другие средства.</li><li><a href="https://experts2.ru/luUaXy?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Онлайн-курс SQL для анализа данных</a> от Бруноям. За два месяца вы сможете освоить SQL для работы с данными: вы научитесь составлять запросы, извлекать необходимые сведения и анализировать их без привлечения разработчиков.</li></ul><h2>Еще 3 курсов по Python для анализа данных</h2><p>С помощью программ по Python для анализа данных вы научитесь работать с библиотеками, такими как NumPy, Pandas, Matplotlib, Seaborn и другими, а также освоите основы машинного обучения и Data Science.</p><ul><li><a href="https://experts2.ru/hlcMrE?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Python для анализа данных</a> от Нетологии. Вы научитесь пользоваться главным инструментом для обработки данных и применения методов машинного обучения. Освойте работу с информацией на всех стадиях: от сбора, обработки и анализа до представления в наглядном виде.</li><li><a href="https://experts2.ru/pEuRlg?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Python для анализа данных</a> от Яндекс Практикум. В течение трех месяцев вы сможете овладеть актуальным инструментом для анализа и обработки информации.</li><li><a href="https://experts2.ru/McFxga?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Python Аналитик данных</a> от EasyUM. Получите новую специальность всего за пять месяцев. Научитесь работать с данными и извлекать из них выгоду для бизнеса.</li></ul><h2>Бесплатные курсы аналитики данных</h2><p>Станьте профессионалом и откройте для себя новые возможности в карьере. Бесплатные курсы по аналитике данных помогут вам освоить основы и начать применять полученные знания на практике.</p><p><b>1. </b><a href="https://experts2.ru/FbojsI?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Аналитик данных: первые шаги для погружения в профессию</a> — <b>Eduson Academy</b></p><p>В процессе обучения вы не только получите базовые знания в области анализа данных, но и сможете применить их на практике, используя специализированные онлайн-симуляторы.</p><p><b>Главное о курсе:</b></p><ul><li>длительность — две недели;</li><li>подойдет любому уровню.</li></ul><p><b>2.</b> <a href="https://experts2.ru/cwHtyL?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Основы анализа данных и Python</a> — <b>Яндекс Практикум</b></p><p>Школа поможет освоить азы, познакомим с языком программирования Python и определим, насколько вам подходит работа с данными.</p><p><b>Главное о курсе:</b></p><ul><li>четыре кейса по работе;</li><li>подойдет людям без опыта.</li></ul><p><b>3. </b><a href="https://experts2.ru/BTlqns?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Введение в аналитику данных</a> — <b>Хекслет</b></p><p>Вы освоите базовые принципы и способы анализа информации, а также научитесь применять инструменты для ее обработки и наглядного представления результатов.</p><p><b>Главное о курсе:</b></p><ul><li>самостоятельное изучение;</li><li>неограниченный доступ к теории.</li></ul><p><b>4.</b><a href="https://experts2.ru/zRdpZi?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop"> Какую профессию выбрать в анализе данных</a> —<b> Яндекс Практикум</b></p><p>Вы узнаете о различных типах аналитиков и их обязанностях, а также о том, к чему следует быть готовым и на какой доход можно рассчитывать. Это поможет вам принять решение о выборе профессии, которая вам подходит.</p><p><b>Главное о курсе: </b></p><ul><li>информация о разных профессиях;</li><li>длительность — два часа.</li></ul><p><b>5. </b><a href="https://youtube.com/playlist?list=PL5qhgSQBDXlcW4IEhlN6fuMzM9GSiBX74&amp;si=yJjJJja2cOHXyTLS">Python для начинающих аналитиков</a> — <b>Skypro: онлайн-университет</b></p><p>Канал опубликовал уроки по анализу данных с использованием Python от Skypro в открытом доступе, чтобы вы могли самостоятельно изучить этот инструмент.</p><p><b>Главное о курсе:</b></p><ul><li>девять уроков;</li><li>для аналитиков.</li></ul><p><b>6. </b><a href="https://youtube.com/playlist?list=PLDyJYA6aTY1kcb2fIGFZ9064fi-u1sLyf&amp;si=TogUD89gL8aLzJw7">Курс по Data Analytics</a> — <b>Школа itProger / Программирование</b></p><p>В процессе обучения вы освоите навыки работы в области анализа данных и научитесь применять различные библиотеки для обработки информации.</p><p><b>Главное о курсе:</b></p><ul><li>основы работы;</li><li>вводная часть по анализу.</li></ul><p><b>7. </b><a href="https://experts2.ru/fpXJxh?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Анализ данных в R</a> — <b>Stepik</b></p><p>Участники освоят базовые принципы программирования на языке R, что даст им возможность оперативно и результативно справляться с разнообразными задачами, связанными с обработкой информации.</p><p><b>Главное о курсе:</b></p><ul><li>19 уроков;</li><li>26 тестов;</li><li>50 интерактивных задач.</li></ul><p><b>8. </b><a href="https://youtu.be/uZ-l13XzejA?si=mF0FiMMB6b44z-QS">Анализ данных. Введение в Python</a> — <b>VK Team</b></p><p>Задача программы — дать слушателям представление о том, как устроен анализ данных, какие инструменты используются, с какими проблемами и методами работы сталкивается специалист в этой области.</p><p><b>Главное о курсе:</b></p><ul><li>длительность — два часа;</li><li>базовые инструменты при работе с данными.</li></ul><p><b>9. </b><a href="https://experts2.ru/qhFwoM?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Анализ данных просто и доступно</a> — <b>Stepik</b></p><p>В процессе решения практических заданий участники смогут освоить базовые принципы машинного обучения в интересной и понятной форме.</p><p><b>Главное о курсе: </b></p><ul><li>108 уроков;</li><li>36 тестов.</li></ul><p><b>10. </b><a href="https://experts2.ru/zFrksQ?sub1=tproger-kf&amp;sub2=analitika-dannykh-kursy&amp;sub4=netop">Основы статистики</a> — <b>Stepik</b></p><p>В рамках программы слушатели познакомятся с ключевыми концепциями и подходами математической статистики.</p><p><b>Главное о курсе: </b></p><ul><li>29 уроков;</li><li>105 тестов.</li></ul><p><b>11. </b><a href="https://youtu.be/MwlgWMK_GZE?si=2bH8sw-RoRcowdY7">Все, что нужно знать о профессии аналитика данных</a> — <b>faces &amp; cases</b></p><p>Татьяна поделилась тем, что ее больше всего мотивирует в работе и как можно объяснить суть этой профессии даже пожилому человеку.</p><p><b>Главное о курсе: </b></p><ul><li>введение в профессию;</li><li>роль аналитика в команде и в жизни.</li></ul><h2>Профессии, связанные с аналитикой данных</h2><ul><li>Data Scientist — специалист, который занимается анализом больших объемов данных с помощью алгоритмов машинного обучения и статистики. Он может работать с различными типами данных и решать разнообразные задачи.</li><li>Бизнес-аналитик — профессионал, который анализирует бизнес-процессы компании и предлагает решения для оптимизации этих процессов. Он может использовать данные для выявления тенденций, определения слабых мест и разработки стратегий развития.</li><li>Аналитик данных — специалист, который анализирует данные, чтобы выявить закономерности, тенденции и тренды. Он может работать с разными типами данных (например, с текстовыми, графическими, аудио- и видеоданными) и использовать различные методы анализа (например, статистические, машинное обучение, глубокое обучение).</li><li>Системный аналитик — профессионал, который занимается анализом информационных систем компании. Он может разрабатывать требования к новым системам, оптимизировать существующие системы и обеспечивать их бесперебойную работу.</li><li>Аналитик социальных медиа — специалист, который анализирует данные из социальных медиа для выявления трендов, интересов аудитории и эффективности рекламных кампаний.</li><li>Аналитик маркетинговых данных — профессионал, который использует данные для анализа эффективности маркетинговых кампаний и определения наиболее эффективных каналов продвижения.</li><li>Аналитик интернет-трафика — специалист, который анализирует данные интернет-трафика для выявления тенденций, определения популярных сайтов и разработки стратегий продвижения.</li><li>Аналитик Big Data — профессионал, который работает с большими объемами данных и использует специальные инструменты и технологии для их анализа.</li><li>Аналитик информационной безопасности — специалист, который анализирует данные о безопасности информационных систем компании и разрабатывает меры по их защите.</li><li>Аналитик продуктов — профессионал, который анализирует данные о продуктах компании и определяет их сильные и слабые стороны. Он может разрабатывать стратегии развития продуктов и оптимизировать их характеристики.</li></ul><h2>Как долго учиться?</h2><p>Срок обучения может варьироваться в зависимости от выбранного формата обучения, интенсивности занятий и начального уровня знаний.</p><p>Если вы выбираете очное обучение в вузе, то это может занять от четырех до шести лет для получения степени бакалавра и дополнительно полтора-два с половиной года для получения степени магистра. Однако, помимо теоретических знаний, важно также получить практические навыки работы с инструментами и методами анализа данных.</p><p>Если вы предпочитаете более короткие сроки обучения, можно рассмотреть онлайн-курсы или краткосрочные программы профессиональной переподготовки. Они могут длиться от нескольких месяцев до года или более, в зависимости от интенсивности занятий и выбранной программы.</p><h2>Требования и необходимые навыки</h2><p>Требования и навыки могут варьироваться в зависимости от конкретной компании и проекта, но, как правило, включают в себя следующее:</p><ul><li>Знание основ статистики и математики: специалист должен понимать и применять статистические методы для анализа данных, такие как среднее, медиана, мода, дисперсия, ковариация, корреляция, регрессионный анализ и другие.</li><li>Умение работать с базами данных и системами управления данными (СУБД): профессионал должен знать, как хранить, извлекать и обрабатывать данные из различных источников.</li><li>Навыки программирования: знание языков программирования, таких как Python, R, SQL, может быть полезным для автоматизации задач и обработки данных.</li><li>Понимание алгоритмов и структур данных: работник должен знать, как работают алгоритмы и структуры данных, чтобы эффективно обрабатывать и анализировать большие объемы данных.</li><li>Умение работать с инструментами для анализа данных: знание таких инструментов, как Tableau, Power BI, Excel, Google Data Studio, может быть полезным для визуализации данных и создания отчетов.</li><li>Понимание бизнес-процессов: специалист должен понимать, как бизнес-процессы работают и как данные могут быть использованы для улучшения этих процессов.</li><li>Аналитическое мышление: способность анализировать данные и выявлять тенденции и закономерности может быть полезной для выявления проблем и возможностей.</li><li>Умение работать с большими объемами данных: аналитик должен уметь обрабатывать и анализировать большие объемы данных, чтобы выявить скрытые закономерности и тенденции.</li><li>Умение работать с облачными сервисами: знание облачных сервисов, таких как Google Cloud Platform, Amazon Web Services, может быть полезным для хранения и обработки данных.</li><li>Знание методов машинного обучения: понимание методов машинного обучения может быть полезным для создания моделей и прогнозирования будущих событий.</li><li>Знание основ информационной безопасности: понимание принципов информационной безопасности может быть полезным для защиты данных и предотвращения несанкционированного доступа.</li></ul><h2>Уровень заработной платы</h2><p>Размер заработной платы определяется уровнем квалификации и местом работы. В столице, например, для начинающих специалистов диапазон дохода составляет от 60 000 до 180 000 рублей в месяц, для специалистов среднего уровня — от 200 000 до 300 000 рублей, а для опытных работников — до 400 000 рублей.</p><p>Чтобы получить актуальную информацию о вакансиях и зарплатах, рекомендуется обратиться к специализированным ресурсам, таким как <a href="https://hh.ru/vacancies/analitik-dannyh">hh.ru.</a> На этих сайтах вы сможете найти предложения от прямых работодателей с указанием требований и условий оплаты труда.</p><h2>Заключение</h2><p>Курсы аналитика данных помогают освоить основы статистики, машинного обучения и других методов анализа, а также научиться работать с популярными инструментами и библиотеками. Это может быть полезно профессионалам, а также новичкам, которые только начинают свой путь в анализе данных. Для того чтобы стать успешным кандидатом, необходимо постоянно совершенствовать свои знания, следить за тенденциями в области и быть готовым к постоянному обучению.</p><p><b>Подборки по схожим темам:</b><b></b></p><ol><li><a href="https://tproger.ru/articles/top-35-kursov-po-sozdaniyu-sajtov--onlajn-obuchenie-po-razrabotke-sajtov-s-nulya">Лучшие курсы по созданию сайтов</a></li><li><a href="https://tproger.ru/articles/top-61-kursov-veb-razrabotchika--luchwee-onlajn-obuchenie-programmirovaniyu-besplatno-i-platno">Лучшие курсы веб-разработчика</a></li><li><a href="https://tproger.ru/articles/kursy-verstki-html-i-css-253340">Лучшие курсы HTML и CSS</a></li><li><a href="https://tproger.ru/articles/kursy-c---i-c-">Лучшие курсы по языкам программирования</a></li></ol><p><i>В случае, если вы заметили в списке неактуальную информацию или хотите добавить в него проверенную программу или учебное заведение, пожалуйста, дайте мне знать в комментариях.</i></p>]]></content:encoded>
    </item>
    <item>
      <title>Как настроить интеграцию между Great Expectations и Impala для работы с большими данными</title>
      <link>https://tproger.ru/articles/kak-nastroit-integraciyu-mezhdu-great-expectations-i-impala-dlya-raboty-s-bolwimi-dannymi</link>
      <comments>https://tproger.ru/articles/kak-nastroit-integraciyu-mezhdu-great-expectations-i-impala-dlya-raboty-s-bolwimi-dannymi?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Анна Ельцова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-nastroit-integraciyu-mezhdu-great-expectations-i-impala-dlya-raboty-s-bolwimi-dannymi</guid>
      <description><![CDATA[<p>Рассказываем, как мы заставили GX подружиться с Impala. </p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-nastroit-integraciyu-mezhdu-great-expectations-i-impala-dlya-raboty-s-bolwimi-dannymi">Как настроить интеграцию между Great Expectations и Impala для работы с большими данными</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[MySQL]]></category>
      <category><![CDATA[SQL]]></category>
      <category><![CDATA[Базы данных]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 04 Feb 2025 14:29:07 GMT</pubDate>
      <content:encoded><![CDATA[<p>Всем привет, меня зовут Ольга Вишницкая, и я работаю главным аналитиком данных в одном из департаментов Газпромбанка. Работа эта, помимо прочего, сводится к постоянному наблюдению за новыми инструментами, призванными хоть немного облегчить жизнь тому, кто имеет дело с массивами данных. Мы тестируем, пробуем, отбрасываем неудачное и внедряем полезное.</p><p>В какой-то момент наши коллеги, отвечающие за качество данных, обратили внимание на Great Expectations (GX). Библиотека многообещающая: умеет валидировать, профилировать и даже составлять документацию автоматически. Однако есть одно «но»: Impala, наш основной SQL-движок для Hadoop, официально не поддерживается.</p><p>Мы решили схитрить и пустить данные через pandas DataFrame — инструмент, с которым GX ладит отлично. Тестовые прогонки показали обнадеживающие результаты, но когда дело дошло до настоящих объемов, стало ясно: DataFrame справляется с 15 000 строк за раз, а дальше — дробление, тормоза, потеря части функционала. Итог: сутки на обработку вместо минут, которые нужны Impala.</p><p>Вывод напрашивался сам собой: надо заставить GX работать с Impala напрямую. Теоретически это возможно — Impala ведь оперирует теми же данными куда быстрее. Практически же — GX о подобной интеграции ничего не знает. Документация хранит молчание. Пришлось экспериментировать.</p><p>После нескольких попыток, ошибок и обходных маневров мы нашли решение. Им и хочу поделиться.</p><p>Примечание: в статье описана работа с GX версии 0.17.19. Вышли новые релизы, но общий подход и логика решений остались прежними.</p><h2>Настройка проекта: подключаем Impala и кастомные проверки</h2><h3>Подключение к базе данных</h3><p>Перед тем, как приступить к работе, необходимо настроить подключение к Impala и организовать структуру проекта. Начнем с самого основного — соединения с базой данных:</p><p>Для этого используем функцию create_engine из SQLAlchemy, которая позволяет установить связь с Impala. Более детальную информацию о возможных параметрах конфигурации можно найти в <a href="https://docs.sqlalchemy.org/en/20/core/engines.html">официальной документации</a>.</p><h3>Добавляем кастомные проверки</h3><p>Теперь пришло время интегрировать собственные проверки. К сожалению, GX не предоставляет прямого механизма подключения проверок из произвольных папок — в документации указаны лишь способы через plugins или GitHub. Однако решение оказалось довольно простым:</p><ol><li>Создаем папку для пользовательских проверок в директории с основным кодом GX;</li><li>Подключаем нужные проверки в коде, указав путь к ним:</li></ol><p>Так, мы обеспечиваем корректное подключение кастомных правил в систему, позволяя использовать их наряду со стандартными инструментами Great Expectations.</p><h2>Основные проблемы, с которыми мы столкнулись</h2><h3>Проблема №1: Регулярные выражения</h3><p>Первым камнем преткновения стала попытка использовать проверки на регулярные выражения — expect_column_values_to_match_regex. При запуске на Impala они попросту не срабатывали, так как некоторые выражения Regex не поддерживались для этого диалекта.</p><p>Ошибки выглядели так:</p><p>У нас было два пути:</p><ol><li>Сделать pull request с изменениями в библиотеку GX. Но это означало бы долгое ожидание и, вероятно, последующие сложности с обновлениями версии в банковской инфраструктуре.</li><li>Создать свою собственную проверку, игнорируя диалект и подгоняя регулярные выражения под Impala. Именно этот путь мы и выбрали.</li></ol><h2>Решение</h2><p>Сначала копируем исходный файл проверки регулярных выражений в свою директорию. Не забываем изменить его название, а также поменять наименование проверки во всех местах, где она указана. В нашем случае мы добавили суффикс _impala:</p><p>В файле expect_column_values_to_match_regex_impala подключаем файл с проверкой:</p><p>Главное — заменить все названия проверок на свои.</p><p>Далее копируем еще один <a href="https://github.com/great-expectations/great_expectations/blob/f7fc2919b2950165bd490ceeced20320fefc4e25/great_expectations/expectations/metrics/column_map_metrics/column_values_match_regex.py#L26">файл</a> в свою директорию, меняем его название. В самом файле модифицируем переменные condition_metric_name и regex_expression. Метод SQLAlchemy использует функцию get_dialect_regex_expression, которая вызывает ошибку диалекта, так как Impala не входит в <a href="https://github.com/great-expectations/great_expectations/blob/f7fc2919b2950165bd490ceeced20320fefc4e25/great_expectations/expectations/metrics/util.py#L82">поддерживаемые базы данных</a>. Поэтому мы отключаем вызов этой функции и формируем наше регулярное выражение (переменная regex_expression) под Impala, взяв за основу выражение из MySQL:</p><p>Теперь формируем условие регулярного выражения с помощью класса BinaryExpression из SQLAlchemy, где:</p><ul><li>column — проверяемая колонка</li><li>sqlalchemy.literal(regex) — регулярное выражение</li><li>sqlalchemy.custom_op("REGEXP") — оператор</li></ul><p>После выполнения этого выражения получается строка вида table_nm REGEXP '%abv', в которой:</p><ul><li>table_nm — колонка</li><li>REGEXP — оператор</li><li>'%abv' — регулярное выражение</li></ul><p>Важно! Не забудьте добавить подключение BinaryExpression. Используйте literal(regex). Именно literal — без него не отработает.</p><h3>Проблема №2: Зарезервированные слова</h3><p>В процессе работы GX на Impala мы столкнулись с синтаксическими ошибками. Как оказалось, причина заключалась в том, что GX, при формировании запросов к базе данных, использует зарезервированные в Impala слова. Эти слова не могут быть использованы в качестве идентификаторов в базе данных. Вот примеры ошибок:</p><h4>Решение</h4><p>Для устранения данной проблемы необходимо заменить метку (label)  на другое подходящее имя, которое не вызывает конфликтов с диалектом. Например, в первой ошибке ключевым словом было condition, и мы заменили его на другое, обновив все файлы, где использовалась эта проверка.</p><p>В случае с типом NUMERIC достаточно просто заменить его на INTEGER, который как раз и предложен в ошибке в качестве корректного варианта.</p><p>Вот пример изменений в коде:</p><p>Было:</p><p>Стало:</p><p>Чтобы понять, в каких именно файлах необходимо внести изменения, мы обратились к логам. Логи содержат информацию о пути возникновения ошибок. Так мы находили проблемные файлы на GitHub, а затем прослеживали цепочку подключений, чтобы выяснить, откуда пришла функция проверки.</p><h3>Проблема №3: Подзапросы в Impala</h3><p>Следующая трудность, с которой мы столкнулись, касалась использования подзапросов. При работе с некоторыми проверками GX (например, ExpectColumnValuesToBeUnique) мы сталкивались с ошибкой:</p><p>Дело в том, что GX использует вложенные подзапросы в разделе SELECT, которые запрещены в Impala.</p><h4>Решение</h4><p>Эту проблему можно обойти, если вынести не поддерживаемый Impala подзапрос в отдельный запрос и его результат подставить в основной подзапрос.</p><p>За основу мы взяли запрос из переменной unexpected_condition в файле map_condition_auxilliary_methods.py, вывели его через print и с помощью методов конструктора запросов SqlAlchemy сформировали такой же запрос в поддерживаемом Impala формате.</p><p>Вот как выглядит исходный запрос:</p><p>Из этого запроса нужно выделить подзапрос, который Impala не может обработать:</p><p>С помощью метода SqlAlchemy этот запрос будет выглядеть так:</p><p>После выполнения мы получаем результат (назовем его условно result_impala) и подставляем в окончательный запрос:</p><h2>Последовательность замены файлов</h2><p>В процессе работы над проблемами, связанными с зарезервированными словами и подзапросами, нам понадобилось заменить несколько файлов. Вот полная последовательность этих изменений:</p><ol><li>Заменяем наименование проверок (чтобы они отличались от стандартных вариантов в GX) в подключении и классах: <a href="https://github.com/great-expectations/great_expectations/blob/f7fc2919b2950165bd490ceeced20320fefc4e25/great_expectations/expectations/core/expect_column_values_to_be_unique.py">great_expectations/expectations/core/expect_column_values_to_be_unique.py</a></li><li>Меняем только подключение в следующем файле: <a href="https://github.com/great-expectations/great_expectations/blob/f7fc2919b2950165bd490ceeced20320fefc4e25/great_expectations/expectations/metrics/column_map_metrics/column_values_unique.py">great_expectations/expectations/metrics/column_map_metrics/column_values_unique.py</a></li><li>Выполняем изменения здесь: <a href="https://github.com/great-expectations/great_expectations/blob/f7fc2919b2950165bd490ceeced20320fefc4e25/great_expectations/expectations/metrics/map_metric_provider/column_map_metric_provider.py">great_expectations/expecttions/metrics/map_metric_provider/column_map_metric_provider.py</a></li><li>Также изменяем этот файл: <a href="https://github.com/great-expectations/great_expectations/blob/f7fc2919b2950165bd490ceeced20320fefc4e25/great_expectations/expectations/metrics/map_metric_provider/map_metric_provider.py">great_expectations/expectations/metrics/map_metric_provider/map_metric_provider.py</a></li><li>И, наконец, меняем файл, как описано в разделе «Проблема №1: Регулярные выражения»: <a href="https://github.com/great-expectations/great_expectations/blob/f7fc2919b2950165bd490ceeced20320fefc4e25/great_expectations/expectations/metrics/map_metric_provider/map_condition_auxilliary_methods.py">great_expectations/expectations/metrics/map_metric_provider/ map_condition_auxilliary_methods.py</a></li></ol><p>В результате наших поисков и экспериментов мы обрели решение, которое соединяет GX с Impala. Да, порой наш путь не был изысканным — подмена файлов библиотеки могла бы вызвать сомнения у стороннего наблюдателя. Но в тех случаях, когда нужно было получить работающий инструмент немедленно, этот способ оказался вполне оправданным. И если у вас есть мысли о том, как можно было бы обойтись без таких компромиссов, — смело делитесь ими в комментариях.</p>]]></content:encoded>
    </item>
    <item>
      <title>Big Data в 2025: Как изменились технологии работы с данными и что нас ждет дальше?</title>
      <link>https://tproger.ru/articles/big-data-v-2025---tehnologii-raboty-s-bolwimi-dannymi---tproger</link>
      <comments>https://tproger.ru/articles/big-data-v-2025---tehnologii-raboty-s-bolwimi-dannymi---tproger?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Ксения Андреева]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/big-data-v-2025---tehnologii-raboty-s-bolwimi-dannymi---tproger</guid>
      <description><![CDATA[<p>Big Data в 2025. Показываем основные технологии работы с большими данными. Рассматриваем пошаговую инструкцию ✔ Tproger </p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/big-data-v-2025---tehnologii-raboty-s-bolwimi-dannymi---tproger">Big Data в 2025: Как изменились технологии работы с данными и что нас ждет дальше?</a>»</p>]]></description>
      <category><![CDATA[Инструменты]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[JSON]]></category>
      <category><![CDATA[SQL]]></category>
      <category><![CDATA[Советы]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Библиотеки]]></category>
      <category><![CDATA[аналитик]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 24 Jan 2025 10:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Большие данные — не просто модное слово, которое сейчас звучит из каждого утюга. Это один из главных инструментов для более глубокой аналитики спроса, принятия стратегически правильных решений и прогнозирования будущих тенденций в проекте.</p><p>IoT, искусственный интеллект и облачные решения развиваются каждый день. Объёмы информации, с которой необходимо работать, только растут. А значит, появляется новая задача — научиться работать с информацией для прогнозирования всех возможных изменений и увеличения продаж.</p><p>Сегодня рассмотрим 5 главных Big Data решений, которые стоит изучить каждому, кто хочет развивать себя и свой проект.</p><h2>Apache Kafka</h2><p><a href="https://kafka.apache.org/">Apache Kafka</a> называют «почтальоном» в мире IT. Это система-брокер для потоковой передачи данных с открытым исходным кодом.</p><p>Проект разработан инженерами LinkedIn в 2010 году при поддержке фонда Apache Software Foundation. Kafka предназначена для работы с данными в реальном времени. При этом сохраняется высокая скорость передачи при минимальных задержках — и это одна из причин, почему распределённую систему так любят.</p><p>Apache Kafka используют 80% компаний из списка Fortune 100: например, с технологией работают 10 из 10 компаний в сфере производства и страхования.</p><p>Система используется для создания конвейеров потоковых данных и приложений потоковой аналитики. Kafka хороша тем, что обеспечивает бесперебойную доставку сообщений.</p><p><b>Пример кода на Python с использованием библиотеки kafka-python для отправки и получения информации:</b></p><figure><img src="https://media.tproger.ru/user-uploads/106063/2025-01-22/f2a336b1-2fc1-440d-ba98-e9632f781fc9.png" alt="" /><figcaption>Тот, кто создаёт сообщения — producer, а тот, кто их получает, — consumer. Topic — это темы (другими словами, группы), куда поступают сообщения. Все подписчики (consumers) «вступают» в нужные им темы и после получения сообщений получают уведомления.</figcaption></figure><p>Ещё один плюс системы — простая масштабируемость без потери производительности, сколько бы источников одновременно ни обрабатывалось. Это особенно важно для компаний, которые собирают и анализируют информацию сразу из нескольких источников.</p><p>А ещё Kafka хороша тем, что автоматически сохраняет все данные на сервере — если что-то сломается или перестанет работать, сообщения все равно сохранятся.</p><p><b>Kafka часто используется для:</b></p><ul><li>Системы мониторинга приложений для оперативной реакции на изменение данных о системе;</li><li>Аналитики действий пользователей;</li><li>Обработки данных от подключенных устройств для контроля состояния оборудования.</li></ul><h2>Apache Spark</h2><p><a href="https://spark.apache.org/">Apache Spark</a> — фреймворк для обработки больших данных. Платформа популярна благодаря своей высокой производительности и гибкости.</p><figure><img src="https://media.tproger.ru/user-uploads/106063/2025-01-22/0df80626-06d8-429d-8e1e-baebdb3c0ba3.jpeg" alt="" /><figcaption>Структура Apache Spark</figcaption></figure><p>В 2025 году Spark продолжает оставаться одной из главных технологий в обработке данных. Особенно когда речь идёт об интеграции данных с ML и аналитикой.</p><p>Одна из особенностей Apache Spark — способность быстро обрабатывать большие массивы данных с помощью использования памяти для хранения промежуточных вычислений. Например, задачи, которые занимают часы в Hadoop MapReduce, в Spark можно выполнить за несколько минут.</p><p><b>Пример кода на Python с использованием PySpark для обработки данных:</b></p><p><b>Здесь выполняются 5 этапов работы:</b> выгрузка данных из Spark сессии, создание самой сессии, загрузка данных из CSV-файла, фильтрация данных и отображение результата.</p><p>Apache Spark предоставляет инструменты для интеграции с библиотеками ML и аналитики. MLlib — библиотека машинного обучения, встроенная в Spark. С помощью нее можно проводить сложные анализы и создавать модели:</p><p><b>Здесь описано 5 основных действий при создании модели линейной регрессии:</b> импорт данных с сайта, подготовка данных для обучения, разделение данных на обучающие и тестовые, создание и обучение моделей регрессии и тестовая оценка модели.</p><h2>Snowflake</h2><p><a href="https://www.snowflake.com/en/">Snowflake</a> — это DaaS (Desktop as a Service) решение для работы с данными. Платформа помогает с хранением, обработкой и аналитикой данных — и всё это в одном облачном решении.</p><p>С помощью Snowflake можно решать одновременно несколько задач, связанных с большими данными, обеспечивая при этом высокую производительность и масштабируемость. Все пользователи платформы могут легко загружать, хранить и управлять данными в облаке без физической инфраструктуры. А это неплохо экономит деньги.</p><figure><img src="https://media.tproger.ru/user-uploads/106063/2025-01-22/b8e26b27-ed8d-4b7a-8ae1-426a15a58370.png" alt="" /><figcaption>Принцип работы Snowflake</figcaption></figure><p>Главный принцип работы Snowflake можно объяснить так: это система, которая предоставляет виртуальные «рабочие столы», где можно хранить и работать с любой загруженной информацией. А ещё данными можно обмениваться с любым количеством пользователей в реальном времени через Snowflake Data Share.</p><p>С помощью безопасного подключения к Data Lake можно извлекать неограниченное количество данных из любых источников и потом их анализировать с помощью других инструментов. Это важно для аналитики и принятия стратегических решений в компании.</p><p>Ключевое преимущество Snowflake в гибкости. Система сама увеличивает и уменьшает мощность вычислительных ресурсов без прерывания работы. Фактически это динамическая система, которая сама подстраивается под объёмы данных. При этом, количество запросов в обработке не ограничено.</p><p>С помощью Snowflake можно выполнять сложные аналитические запросы в несколько кликов. <b>Пример использования Snowflake для анализа больших данных:</b></p><p><b>Здесь описано 4 этапа: </b>подключение к Snowflake, загрузка данных из облака, выполнение запроса и отображение результата.</p><h2>Delta Lake</h2><p><a href="https://delta.io/">Delta Lake</a> — это фреймворк для хранения данных, с помощью которого можно создавать <a href="https://www.cidrdb.org/cidr2021/papers/cidr2021_paper17.pdf">архитектуру Lakehouse</a>. Платформа работает с 12 движками (в том числе с Snowflake, Spark и Google BigQuery) для Scala, Java, Rust и Python.</p><figure><img src="https://media.tproger.ru/user-uploads/106063/2025-01-22/025bb9b1-4040-4b6e-a821-2993f13d5b0f.jpg" alt="" /><figcaption>Принцип работы Delta Lake</figcaption></figure><p>Традиционные хранилища данных имеют много ограничений, которые мешают управлению и анализу больших массивов информации:</p><ul><li>У обычных хранилищ данных нет единого источника истины, что гарантирует несогласованность данных;</li><li>Традиционные системы не справятся с большими объёмами потоковых данных;</li><li>Для того, чтобы масштабировать обычные системы, нужно потратить много времени и денег. Это дни доработок.</li></ul><p>Delta Lake решает эти проблемы с помощью собственной архитектуры на базе Apache Spark. О плюсах Apache Spark мы говорили выше, если коротко: бесперебойное получение информации вне зависимости от объёма данных.</p><p>Кроме того, Delta Lake работает и с ACID-транзакциями (транзакции, для выполнения которых важны 4 главных требования: атомарность, согласованность, изолированность, долговечность — АСИД / ACID). А это значит, что данные будут «целыми» и будут передаваться даже при высоких нагрузках.</p><p>С помощью Delta Lake можно управлять данными в гибридных средах — средах с разными источниками информации и интеграцией различных типов данных.</p><p><b>Ещё к плюсам решения можно отнести:</b></p><ul><li>Поддержку разных форматов данных (Parquet, JSON);</li><li>Возможность работы как на локальных серверах, так и в облаке;</li><li>Оптимизацию чтения и записи благодаря архитектуре Apache Spark.</li></ul><p><b>Пример кода на Python с использованием Delta Lake для чтения и записи данных:</b></p><p><b>Здесь описано 6 этапов работы:</b> импорт Spark-сессии, создание сессии, чтение данных из таблицы, выполнение преобразования данных, запись преобразованной информации в таблицу и завершение Spark-сессии.</p><h2>Google BigQuery</h2><p><a href="https://cloud.google.com/bigquery">Google BigQuery</a> — сервис для анализа больших данных на базе SQL. Одно из главных преимуществ BigQuery — возможность обрабатывать большие объёмы практически в реальном времени.</p><p>Например, BigQuery можно использовать для анализа поведения пользователей на сайтах, обработки потоков данных, IoT и оптимизации цепочек поставок программного обеспечения (SSP).</p><figure><img src="https://media.tproger.ru/user-uploads/106063/2025-01-22/e783eb12-eddb-4931-bfd8-6c715e38b7a0.png" alt="" /><figcaption>Принцип работы Google BigQuery</figcaption></figure><p>Систему можно интегрировать с любыми решениями экосистемы GCP, например, Google Data Studio для визуализации или TensorFlow для машинного обучения.</p><p>Ещё один плюс BigQuery — уникальная архитектура, где предусмотрено разделение хранения данных и вычислительных функций. А значит, пользователь платформы платит только за те ресурсы, которыми он фактически пользуется.</p><p>В системе можно хранить до 10 гибибайтов (GiB) данных и запускать до 1 тебибайта (TiB) запросов в месяц на бесплатном тарифе. При этом масштабировать систему данных можно без необходимости «ручной» работы. И всё это на базе SQL.</p><p><b>Пример использования Google BigQuery для вывода и анализа данных о продажах:</b></p><h2>Советы по изучению технологий</h2><p>Большие данные требуют от специалистов постоянного обучения и адаптации к новым инструментам и методам. Здесь мы расскажем, как изучать технологии больших данных, какие ресурсы использовать и на что важно обращать внимание.</p><h3>Ресурсы для обучения</h3><ul><li><b>Один из лучших способов изучить новую технологию — обратиться к официальной документации.</b> Например, для Apache Spark или Google BigQuery документация поможет не только понять принцип работы решений в теории, но и на практике.</li><li><b>Курсов по Big Data становится всё больше и больше. </b>Помним о том, что не всем понравились зарубежные курсы по программированию, поэтому советуем российские 🙂 <a href="https://mipo.msk.ru/professions/IT%20technologies/bolshie-dannye-big-data-i-internet-veshhej-io-t">МИПО</a>, <a href="https://practicum.yandex.ru/data-scientist/">Яндекс.Практикум</a>, <a href="https://productstar.ru/analytics">ProductStar</a> — все они предлагают хорошие курсы в направлении Data Science.</li><li><b>Ещё один эффективный способ освоить Big Data — практика.</b> Участвуйте в конкурсах и тематических мероприятиях или работайте над собственными проектами.</li></ul><h3>Советы для успешного освоения новых инструментов</h3><ul><li><b>Не пытайтесь объять необъятное. </b>А «необъятное» — это именно про Big Data. Сфокусируйтесь на одной технологии и изучайте её шаг за шагом.</li><li><b>Общайтесь с другими специалистами для обмена опытом и решения задач.</b> Для этого есть тематические форумы, группы в соцсетях. Да и просто нетворкинг сам по себе хорош.</li><li><b>После каждого пройденного модуля обучения делайте заметки</b> о том, что вы узнали и как это можно применить на практике.</li><li><b>Постоянно практикуйтесь</b> в небольших проектах или решайте разовые задачи по аналитике данных.</li></ul><p>Изучение ИИ, облачных вычислений, блокчейна, IoT и новых платформ по типу Snowflake или Delta Lake поможет вам освоиться в биг дате и проводить такую аналитику данных, которая поможет бизнесу решать стратегические задачи, а вам — больше зарабатывать. Направление очень прибыльное и относительно российского рынка новое, так что, освоив 5 главных решений, вы точно будете востребованы на рынке труда! 😉</p>]]></content:encoded>
    </item>
    <item>
      <title>Как выбрать ноутбук или ПК для программирования?</title>
      <link>https://tproger.ru/articles/kak-vybrat-noutbuk-ili-pk-dlya-programmirovaniya-</link>
      <comments>https://tproger.ru/articles/kak-vybrat-noutbuk-ili-pk-dlya-programmirovaniya-?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Вадим Егорцев]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-vybrat-noutbuk-ili-pk-dlya-programmirovaniya-</guid>
      <description><![CDATA[<p>Как выбрать ноутбук или ПК для программирования. Показываем требования к железу для программистов. Рассматриваем основные нюансы ✔ Tproger</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-vybrat-noutbuk-ili-pk-dlya-programmirovaniya-">Как выбрать ноутбук или ПК для программирования?</a>»</p>]]></description>
      <category><![CDATA[Linux]]></category>
      <category><![CDATA[Apple]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Windows]]></category>
      <category><![CDATA[iOS]]></category>
      <category><![CDATA[Работа]]></category>
      <category><![CDATA[HR]]></category>
      <category><![CDATA[macOS]]></category>
      <category><![CDATA[Intel]]></category>
      <category><![CDATA[Разработка]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 03 Jan 2025 09:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Выбор ноутбука или ПК для программирования — трудное решение для разработчика. От компьютера зависит не только комфорт работы, но и производительность, что напрямую влияет на эффективность и скорость разработки.</p><p>В статье рассмотрим факторы, на которые стоит обратить внимание при выборе компьютера для программирования.</p><h2>Основные требования для разработчика</h2><p>Прежде чем переходить к характеристикам, определимся с требованиями к будущему компьютеру.</p><h2>Операционная система</h2><p>Первый вопрос — выбор операционной системы: Windows, macOS или Linux. Решение зависит от личных предпочтений, опыта работы с каждой ОС и типа приложений, которые планируется разрабатывать:</p><ul><li><b>Windows </b>— это универсальная ОС. Подходит для разработки под любые платформы, кроме нативных приложений для macOS и iOS. Имеет максимальную совместимость с ПО и периферией.</li><li><b>macOS </b>— оптимальный выбор, если планируется разрабатывать приложения под экосистему Apple. Реже используется для кросс-платформенной разработки. Преимущества — удобство, стабильность, встроенные средства разработки Xcode.</li><li><b>Linux </b>— предпочтительный выбор для опытных пользователей. Популярное решение для разработки серверных и мобильных приложений, а также в областях, связанных с безопасностью, анализом данных и машинным обучением. Преимущества — бесплатность, открытость, возможность тонкой настройки.</li></ul><p>Направление разработки тоже влияет на выбор ноутбука или ПК. Например, самые низкие требования к производительности компьютера во фронтенде, самые высокие — в сфере машинного обучения и Big Data.</p><h2>Направление и специфика разработки</h2><p>Требования к мощности компьютера во многом определяются технологическим стеком проектов.</p><ul><li><b>Веб-разработка</b> (frontend, backend) — скромные требования к производительности ПК. Акцент на ОЗУ и SSD для комфортной работы в IDE и ускоренной компиляции проектов.</li><li><b>Мобильная разработка</b> (iOS, Android) — повышенные требования к CPU и ОЗУ для работы в Android Studio и при запуске эмуляторов устройств. Важен объем SSD, если планируется хранить множество SDK и поддерживать сборки под разные версии ОС и устройств.</li><li><b>Desktop-разработка</b> (Windows, macOS, Linux) — высокие требования к частоте и количеству ядер CPU, а также к объему RAM.</li><li><b>Разработка игр на Unity/Unreal Engine</b> — повышенные требования к CPU и GPU. Для работы в редакторах и рендеринга нужен процессор с 6-8 ядрами, игровая видеокарта уровня RTX 2070/3060. Также важен объем ОЗУ.</li><li><b>Data Science</b> (анализ данных, ML, AI) — максимальные требования к мощности CPU и объему RAM. Для обучения моделей нужны процессоры с 8-16 ядрами и 64-128 ГБ памяти.</li></ul><p>Универсальный совет — берите максимум CPU и RAM, которые позволяет бюджет. Апгрейд этих компонентов в ноутбуках затруднителен, а для ПК потребует существенных вложений в будущем.</p><h2>Процессор (CPU)</h2><p>От процессора напрямую зависит производительность компьютера.</p><p>При выборе CPU для программирования смотрите на следующие характеристики:</p><ul><li><b>Количество ядер и потоков</b>. У многопоточного процессора больше запас мощности на будущее. Рекомендуемый минимум — 4 ядра/8 потоков.</li><li><b>Тактовая частота</b>. Чем выше частота процессора, тем быстрее отклик системы. Оптимальный диапазон — от 2.3-2.8 ГГц на ядро.</li></ul><p>По соотношению цены и возможностей идеальный ноутбук для работы оснащен процессором Intel Core i5/i7 8-11 поколения или AMD Ryzen 5/7/9 2000-5000 серии. Сравнить процессоры по мощности можно <a href="https://technical.city/ru/cpu">тут</a>.</p><p>Конкретная модель зависит от бюджета и запланированных нагрузок:</p><ul><li>для <b>веб-разработки</b> подойдут 4-ядерные Intel Core i5 или 6-ядерные AMD Ryzen 5;</li><li>для <b>мобильной, десктопной разработки и геймдева</b> лучше выбирать 6-8 ядерные Intel Core i7 или 8-12 ядерные AMD Ryzen 7;</li><li>для работы с <b>ресурсоемкими проектами</b> стоит рассмотреть 8-10 ядерные Intel Core i9 или 12-16 ядерные AMD Ryzen 9.</li></ul><p>Нельзя экономить на процессоре, так как он определяет общую производительность системы, напрямую влияет на скорость компиляции, отклик IDE и время выполнения ресурсоемких операций.</p><h2>Оперативная память (RAM)</h2><p>Оперативная память используется для хранения исполняемого кода, активных приложений и данных. Чем больше объем и скорость RAM — тем шустрее работает система.</p><p>Минимальный объем для программирования — 8 ГБ. Этого достаточно для веб-разработки, простых проектов и обучения. Комфортный объем RAM — от 16 ГБ.</p><p>При выборе оперативной памяти обращайте внимание на следующие факторы:</p><ul><li><b>Тип памяти</b>. Оптимальный вариант — DDR4 с частотой от 2400 МГц. Чем выше частота — тем чаще память обменивается данными с процессором.</li><li><b>Латентность или тайминги</b>. Это задержки при чтении данных из памяти. Чем меньше значения CL, tRCD, tRP, tRAS — тем отзывчивее память. В целом частота важнее, чем тайминги.</li><li><b>Возможность апгрейда</b>. Выбирайте компьютер для программирования с 2-4 слотами под планки оперативной памяти, чтобы в будущем можно было расширить RAM до 32-64 ГБ.</li></ul><p>Для большинства задач программисту подойдет 2х8 ГБ DDR4-2666/3000/3200 МГц с латентностью CL16-18. Для топовых конфигураций можно рассмотреть комплекты 2х16 ГБ и частоты от 3200 МГц.</p><h2>Хранение данных: SSD vs HDD</h2><p>Рекомендуется выбирать системы с SSD-накопителем, а HDD использовать в качестве дополнительного хранилища.</p><p>Преимущества SSD для разработки:</p><ul><li>Скорость чтения и записи — до 5-10 раз быстрее, чем HDD. Ускоренный запуск ОС и приложений, открытие и сохранение проектов.</li><li>Отсутствие механических частей и шума. SSD не боятся вибраций и ударов, меньше греются.</li><li>Продолжительный срок службы в сравнении с HDD за счет отсутствия износа механических компонентов.</li></ul><p>Минимальный объем SSD для разработки — 256 ГБ. Этого хватит для ОС, программ и ведения нескольких проектов. Оптимальный объем — от 512 ГБ.</p><p>На HDD система работает медленнее, чем на SSD. Жесткий диск лучше использовать для хранения данных, не критичных к скорости доступа. Например, на HDD можно вынести архивы проектов, фильмы, игры и т. д.</p><h2>Графическая карта (GPU)</h2><p>Выбор видеокарты для разработчика не так критичен, как CPU, RAM и SSD. Исключение — работа с 3D-графикой, игровыми движками, рендерингом видео, машинным обучением и научными расчетами.</p><h2>Встроенная или дискретная графика?</h2><p>В ноутбуках до 50 000 ₽ используется <b>встроенная графика</b>. Ее мощности достаточно для большинства задач разработки:</p><ul><li>работа в IDE, текстовых редакторах и терминале;</li><li>просмотр видео, видеозвонки;</li><li>отладка и тестирование;</li><li>простая 2D/3D-визуализация.</li></ul><p>Встроенная графика ограничивает возможности апгрейда, так как видеокарта интегрирована в процессор. Ее преимущества — низкое энергопотребление, отсутствие шума и нагрева.</p><p><b>Дискретная видеокарта</b>, в отличие от интегрированной, оснащена отдельным графическим процессором и видеопамятью. Она мощнее, но потребляет больше энергии и нуждается в охлаждении.</p><p>Сравнить видеокарты по мощности можно <a href="https://technical.city/ru/video">тут</a>.</p><h2>Экран и разрешение</h2><p>Выбор дисплея важен в первую очередь для ноутбуков, так как для настольного ПК можно подобрать внешний монитор с любыми характеристиками.</p><p>При поиске ноутбука для программирования обращайте внимание на диагональ экрана и матрицу.</p><h3>Диагональ</h3><p><b>13-14″</b> — подойдет тем, кто часто перемещается и работает в коворкингах. Платой за компактность выступает комфорт — придется постоянно увеличивать интерфейс IDE и сворачивать панели инструментов.</p><p><b>15-16″</b> — оптимальный размер экрана. Удобно работать в режиме разделения экрана. При этом ноутбук остается достаточно мобильным.</p><p><b>17″+</b> — максимальное пространство экрана. Будьте готовы к весу от 3 кг и сложностям с транспортировкой.</p><h3>Разрешение</h3><p>Разрешение влияет на плотность пикселей и четкость картинки.</p><p>Для работы с кодом подойдет Full HD (1920×1080). На 15″+ дисплеях доступны разрешения вплоть до 4K (3840×2160).</p><p>QHD (2560×1440) обеспечивает оптимальное сочетание четкости и размера элементов интерфейса: текст легко читается, а на экране помещается много информации.</p><p>Модели с 4K лучше выбирать с диагональю от 17″.</p><h3>Тип матрицы</h3><p><b>IPS </b>— идеальный выбор. Это широкие углы обзора, точная цветопередача и запас яркости.</p><p><b>OLED</b> превосходит IPS по качеству цветопередачи и глубине черного цвета. При длительном отображении статичной картинки (элементы интерфейса IDE) возможно выгорание пикселей.</p><p><b>TN </b>— узкие углы обзора, посредственная цветопередача. Такие матрицы встречаются в бюджетных ноутбуках как альтернатива TFT.</p><h3>Частота обновления</h3><p>Стандартные 60 Гц подойдут для решения задач программиста. Экраны 90-120-144 Гц отличаются плавностью анимации — актуальны в игровых моделях, но для программирования не критичны.</p><h2>Вес и размеры</h2><p>Если предполагается частая работа вне дома или офиса, то важными факторами становятся вес и размеры устройства. В таком случае лучше выбрать ноутбук для программирования с балансом между портативностью и производительностью.</p><p>В погоне за компактностью производители жертвуют такими параметрами, как объем оперативной памяти, емкость накопителя и набор портов.</p><h2>Клавиатура и другие особенности</h2><p>Для настольного ПК можно выбрать любую внешнюю клавиатуру. В ноутбуках же производитель делает выбор за вас — приходится пользоваться тем, что есть.</p><p>Обращайте внимание на следующие параметры:</p><ul><li><b>Тип переключателей</b>. У ножничных клавиш более четкий ход и тактильный отклик. Мембранные клавиатуры дешевле и тише.</li><li><b>Раскладка</b>. В идеале нужна полноразмерная клавиатура с нампадом и физическими кнопками F1-F12.</li><li><b>Подсветка</b>. Помогает комфортно работать в темноте и в сумерках.</li><li><b>Программируемые клавиши</b>. Некоторые модели ноутбуков имеют ряд программируемых кнопок, на которые можно назначить макросы и сочетания клавиш IDE.</li></ul><p>При выборе компьютера проверяйте наличие необходимых портов:</p><ul><li>USB 3.1/3.2 Type-A — для подключения периферии, флешек, внешних накопителей.</li><li>USB Type-C / Thunderbolt 3/4 — для подключения мониторов, SSD.</li><li>HDMI / mini DisplayPort — для вывода изображения на внешние экраны и проекторы.</li><li>Разъем Ethernet — для проводного подключения к сети.</li><li>Слот для SD-карт — может пригодиться для работы с медиа-файлами и резервного копирования.</li><li>Аудиоразъем — для подключения наушников и колонок.</li></ul><p>В стационарных ПК набор портов намного шире. При необходимости можно установить плату расширения.</p><h2>Бюджет и выбор ноутбука или ПК</h2><p>Ноутбуки — это свобода передвижения. Однако они дороже аналогичных по характеристикам настольных компьютеров. ПК предлагают гибкость в плане апгрейда и возможность подключения нескольких мониторов.</p><p>При выборе конкретной модели ноутбука или ПК нужно ориентироваться на бюджет и приоритетные характеристики. Например, если важна портативность, то можно присмотреться к ультрабукам с процессорами Intel Core i5-i7, 16 ГБ RAM и SSD.</p><p>Цены на ноутбуки, которые подойдут для обучения и работы, стартуют от 40 000 ₽.</p><p>Если требуется максимальная производительность и мобильность не нужна, то хорошим выбором станет настольный компьютер на базе процессоров Intel Core i7 или AMD Ryzen 7, 32 ГБ оперативной памяти, SSD и видеокарты на 4-6 ГБ. Конфигурацию можно собрать самостоятельно или найти готовое решение от брендов.</p><p>Цены на производительный компьютер (без учета периферии) начинаются от 50 000 ₽.</p><h2>Подводим итоги</h2><ul><li>Выбор ОС зависит от личных предпочтений и типа разрабатываемых приложений. Направление разработки тоже влияет на требования к производительности.</li><li>Процессор — ключевой компонент компьютера. Оптимальный выбор — Intel Core i5/i7 8-11 поколения или AMD Ryzen 5/7/9 2000-5000 серии c 4-16 ядрами в зависимости от типа проектов.</li><li>Оперативная память — минимум 8 ГБ, комфортно от 16 ГБ. Важны тип (DDR4), частота (от 2400 МГц) и возможность апгрейда.</li><li>На SSD система работает быстрее. Минимум — 256 ГБ, оптимально от 512 ГБ.</li><li>Встроенной видеокарты достаточно для большинства задач программирования. Дискретная нужна для игр, 3D и машинного обучения.</li><li>Рекомендуется выбирать экраны с IPS-матрицей, диагональю 15-16″, разрешением не менее Full HD, 60 Гц.</li><li>Ноутбуки дороже, чем ПК с аналогичными характеристиками. Настольный компьютер предпочтителен для максимальной производительности и возможностей апгрейда, подключения нескольких мониторов.</li></ul>]]></content:encoded>
    </item>
    <item>
      <title>Повышение качества данных с использованием Zero Bug Policy</title>
      <link>https://tproger.ru/articles/povywenie-kachestva-dannyh-s-ispolzovaniem-zero-bug-policy</link>
      <comments>https://tproger.ru/articles/povywenie-kachestva-dannyh-s-ispolzovaniem-zero-bug-policy?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Марина Орлова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/povywenie-kachestva-dannyh-s-ispolzovaniem-zero-bug-policy</guid>
      <description><![CDATA[<p>Олег Харатов, Technical Unit Lead в Авито, рассказывает, как навести порядок в огромном хранилище и не сойти с ума.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/povywenie-kachestva-dannyh-s-ispolzovaniem-zero-bug-policy">Повышение качества данных с использованием Zero Bug Policy</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 17 Dec 2024 11:55:52 GMT</pubDate>
      <content:encoded><![CDATA[<p>Привет! Я Олег Харатов, занимаю должность Technical Unit Lead в Авито. Я руковожу двумя командами: первая отвечает за Data Quality и Data Governance, а во второй мы создаем BI и IDE инструменты.</p><p>Сегодня я расскажу, как мы смогли общими усилиями минимизировать риски возникновения багов в хранении данных. Мы поговорим о том, почему в целом важно следить за качеством данных, как быстро найти и исправить ошибки в хранилище на 1 Pb и почему это поможет сохранить бизнесу деньги.</p><h2>Как и где хранятся данные в Авито и почему их так много</h2><p>Начнем с контекста: вот так выглядит стек технологий, которые мы используем для построения DWH.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/41cbfb3d-068c-48c7-a29d-cbc6eb4f9173.png" alt="" /></figure><p>В нем есть хранилища ClickHouse и Vertica. Сейчас мы данные из Vertica переносим в Trino — почему, рассказывали <a href="https://www.youtube.com/watch?v=KYAiIJG0RAs">в этом видео</a>.</p><p>Для хранилищ мы создаем разные сервисы, которые помогают искать данные и управлять ими. Сервисы мы пишем на golang и Python, данные вытягиваем из kafka, для front-end используем react. Как вы поняли, мы в DWH команде любим программировать.</p><p>Про стек в целом я рассказываю просто для того, чтобы было понятно, как именно устроены наши процессы. Если у вас все организовано по другому — ничего страшного, потому что сейчас это роли не играет. Проблемы с данными могут возникнуть в Vertica, в GreenPlum, в BigQuery и даже в Excel. Наша задача — разобраться в причинах и найти универсальное решение для любого хранилища.</p><p>Порядок в данных важен для любого бизнеса, который принимает решение на их основе. Например, компания может понять, что пора расширять географию поставок или оценить потребности клиентов. Если в хранилище данных царит хаос, бизнес упустит выгоду или будет долго принимать решение, а следовательно, потеряет деньги.</p><h2>Когда мы поняли, что нужно создать продуманную систему исправления багов</h2><p>Сначала мы внедряли какие-то новые решения, чтобы улучшить работу с данными, но со временем поняли, что их недостаточно. Для начала разберемся, как было организовано хранение данных в Авито.</p><p>После очисток и дедупликаций только в Vertica у нас хранится 1 Pb данных. Сначала данные загружаются в детальный слой. Для него мы используем Anchor Modeling — это шестая нормальная форма. На картинке ниже покажу, в чем ее суть.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/d476039a-5aa7-4e80-a3b8-8841f30cdfa8.png" alt="" /></figure><p>В тот момент, когда они загружаются в наше хранилище, мы получаем шесть табличек, потому что каждый атрибут в Anchor Modeling должен укладываться в свою отдельную таблицу детальнее можно прочитать <a href="https://habr.com/ru/companies/avito/articles/322510/">в этой статье</a>. По этой причине в детальном слое таблиц у нас очень много — несколько десятков тысяч. Наши аналитики строят витрины данных, а на них — другие витрины данных и так далее. Делают они это для того, чтобы было удобно работать с таким количеством информации.</p><p>Есть DDS-слой и существуют витрины данных, которые зависят и от себя же, и от DDS-слоя. Таких витрин у нас больше 2,5 тысяч и над тем, чтобы все данные в них посчитались, работает 17-20 воркеров.</p><p>Каждая витрина — это SQL-файл, в котором есть три блока:</p><ul><li>Шапка. В ней хранится мета-информация — название, владелец, что является первичным ключом, как считать и так далее.</li><li>DDL-таблица. Название DDL-витрины, куда мы будем create table.</li><li>SQL-выражение для заполнения витрин. SQL-запросы от одного до бесконечности, которые загрузили в DDL-таблицу.</li></ul><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/4e05ab75-d078-463f-8506-9c872987065e.png" alt="" /></figure><p>До какого-то момента все витрины в Авито вручную создавали data-инженеры. Процесс было удобно контролировать, но в то же время он был «бутылочным горлышком» в поставках: специалистов не так много, а бизнес растет. Поскольку вместе с этим растет количество аналитиков и запросов, мы пошли в сторону self-service. Тогда мы обложили витрины метриками, чтобы при публикации запускались тесты. Все функционировало отлично, но количество витрин резко увеличилось. Подробнее про витрины данных в Авито <a href="https://avito.tech/tpost/lcp68ip301-vitrini-dannih-v-avito-i-ih-primenenie-v">рассказывал Илья Салманов</a>.</p><p>Сейчас в Авито работает около 300 аналитиков, которые занимаются витринами. В какой-то момент они читают их содержимое и могут возникать вопросы, например как исправить ошибки, почему сохранились не те данные и так далее. В этом случае аналитики приходят к нам, как к владельцам хранилища, и просят разобраться. Чем больше времени прошло с момента сохранения неверных данных, тем сложнее найти источник проблемы.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/3f36050c-845b-49f3-b6a7-5b14d0c94f69.png" alt="" /><figcaption>«У меня есть небольшая витринка — всего 3 тысячи строк кода. В какой-то из них есть ошибка. Найди ее, пожалуйста. А то данные не грузятся уже месяц, а завтра сдавать отчетность»</figcaption></figure><p>Чтобы быстрее реагировать на такие ситуации и в целом свести их к минимуму, мы ввели чекеры двух видов, которые автоматически запускаются при расчете любой витрины. Базовые проверяют наличие пустых строк и дублей по первичным ключам. Если есть проблемы, alert уходит нужному получателю. Бизнесовые чекеры помогают аналитикам быстро создавать проверку на бизнес-условия. Например, если бы у Авито были склады, то это позволило бы нам избежать условной ситуации, когда мы продали больше товаров, чем есть в наличии.</p><p>Чекеры помогли нам оперативно получать информацию об ошибках, но в какой-то момент стало сложно отслеживать и быстро фиксить их из-за большого объема. Количество витрин с каждым месяцем росло, при этом, мы тогда еще не определили зоны ответственности и не знали, кто и за что должен отвечать. Например, у нас был формальный оунер витрины, но не было понимания, что это действительно он должен исправлять баг.</p><p>Но на этом этапе мы поняли, что пора организовать процесс по другому и стали искать свои «слабые места».</p><h2>Почему важно помнить, что не все ошибки в данных одинаковые и систематизировать их</h2><p>В результате проб и ошибок мы выделили для себя несколько важных моментов, которые помогли улучшить весь рабочий процесс:</p><p>1. Все ошибки разные. Важно понимать, какие из них более срочные, чтобы решать их быстрее. Например, если совсем нет данных — это очень плохо. Если стрельнул чекер и просигналил, что две строки из миллиарда задублированы — это не всегда страшно.</p><p>Еще нужно помнить, что когда витрина загружается в хранилище, она проходит тесты. На следующий день состав данных может поменяться и джоины, которые были эффективны вчера, уже не эффективны. Владельцу нужно исправить это, чтобы поставка данных не задерживалась.</p><p>2. У всех витрин разный уровень важности. Вот, какие мы выделили:</p><p>Критичные. Витрины, на которых строится аналитика всей компании. Например, от них зависит половина хранилища или это отчеты с огромным количеством просмотров.</p><p>Важные. Например, это витрины, которые охватывают целую вертикаль. В Авито вертикалью считаются разделы — «Авто», «Недвижимость» и так далее. Просмотров у дашбордов, построенных на этих витринах, поменьше.</p><p>Стандартные. На эти витрины смотрит только несколько команд и собираются метрики.</p><p>Неважные. Например, я создал витрину и начал копить данные, чтобы использовать их в этом материале. Кроме меня ими никто пользоваться не будет, поэтому если вылезет баг, никто не обратит на него внимание.</p><p>С теорией мы разобрались — разметили витрины и баги в них по важности. Осталось самое главное — превратить все это в отлаженный рабочий процесс.</p><h2>Как мы внедрили Zero Bug Policy и почему аналитики сначала с нами не согласились</h2><p>Суть Zero Bug Policy заключается как раз сортировке багов, о которой я говорил выше. На какие-то из багов надо реагировать моментально, а на какие-то можно вообще забить.</p><p>Мы сделали матрицу, где указали ошибки, расставили приоритеты, например Р0 — самая критичная, Р4 — фигня. Тогда предполагалось, что исправлять баги будут ответственные за витрины аналитики.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/0938a157-2175-4160-8041-6d77c9bf104b.png" alt="" /><figcaption>Мы пришли к лидам аналитиком и сказали им примерно следующее «Ребята, с данными есть проблемы. Нам кажется, что если случился баг, то вы должны бросить свои продуктовые исследования, которые могут принести огромные деньги, и исправить витрину». Нас в ответ назвали фантазерами</figcaption></figure><p>В итоге через долгие переговоры пришли к более лайтовому решению и внесли важные дополнения в матрицу.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/7efdb40f-847a-47d4-bbf1-15f66697d63f.png" alt="" /></figure><p>В первую очередь договорились, что если ошибка уровня Р0, то в помощь аналитикам выделяется data quality-инженер. Так мы пришли к взаимопониманию — ни одна из команд не окажется брошенной наедине с большим количеством багов. Кстати, на практике получилось так, что мы бегаем за аналитиками, которые показали большой уровень ответсвенности, и предлагаем свою помощь. Ребята, если вы это читаете, вы можете обращаться к нам!</p><p>Когда мы определились, что и как делать, перешли на стадию запуска и столкнулись с новыми сложностями.</p><h2>Как мы нашли ответственных за витрины и актуализировали их</h2><p>Вот так выглядит наш интерфейс по поиску витрин и их изучению.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/e7549515-c955-48bb-84e4-ecbf0bd0b60b.png" alt="" /></figure><p>В нем можно посмотреть, кто отвечает за каждую витрину. В этот момент выяснилось, что большинство ответственных за витрины сотрудников уволились, перевелись в другие отделы.</p><p>На следующем этапе начались еще и технические сложности. Оказалось, что даже если нашелся компетентный человек, который может взять на себя роль ответственного, просто вписать его имя в систему нельзя.</p><p>Для внесения изменений в витрине нужно сделать pull request в Git, после этого запускаются тесты, а минут через 20 начинают вылезать ошибки. В итоге пришлось воткнуть в систему опцию быстрой замены ответственного. А еще сделали полезный вывод — списки сотрудников, отвечающих за витрины, надо периодически проверять. Например, если человек уволился, то логично его витрину сразу перевесить на нового ответственного.</p><p>Еще мы поняли, что нужно вовремя актуализировать важность витрины, потому что от этого зависит скорость реагирования на баги. Бизнес может довольно быстро масштабироваться и потребности в аналитике, а значит и в определенных витринах, меняются. Этот процесс тоже нужно сделать автоматическим, потому что вручную контролировать такое количество данных сложно, и доверие к системе может пропасть, если что-то пойдет не так.</p><h2>Почему важно трекать процесс исправления багов</h2><p>Если у вас есть бесконечное количество посуды, то ее можно не мыть, а просто ставить в раковину после использования и в какой-то момент у вас станет очень грязно. В целом, можно сказать, что мы обнаружили у себя в системе «грязную посуду». Это были некритичные баги, которые глобально не влияли на работу всей платформы, но тем не менее, их нужно было устранить.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/c4441414-6802-4528-a0df-d3e0fc3d844b.png" alt="" /></figure><p>Из-за накопленного бэклога воодушевление у команды упало почти до нуля, а ведь нас всего три человека. Нужно было не только разобраться с багами, но и выстроить работу так, чтобы эта ситуация не повторялась в будущем.</p><p>Когда из огромной кучи мусора вытаскиваешь истинные проблемы, то не замечаешь, как ты наносишь пользу. Очень важно этот момент отслеживать и трекать. Команда будет мотивироваться, если увидит, как список проблем уменьшается. Кстати, стейкхолдерам, которые выделяют на это деньги, такие отчеты тоже нужно показывать.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/3204541e-baac-46d3-b8bf-ac1bad0f4fe2.png" alt="" /></figure><p>У построения треков есть несколько нюансов. Вести список багов можно в Google или Яндекс-таблицах или, например в Jira. У меня есть ощущение, что Jira слишком тяжеловесная, чтобы быстро создавать в ней новые таски. Таблицы в свою очередь могут теряться или множиться с невероятной скоростью, что тоже неудобно.</p><p>Поэтому мы пошли третьим путем: создали свою простую систему и интегрировали ее с нашим Mattermost — служебным мессенджером. На этой основе мы начали строить свою аналитику: следили, как быстро мы разгребаем баги, где есть пробелы по SLA и так далее.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/0c1e8d0f-77da-456f-9f56-a8f8f607068d.png" alt="" /></figure><p>Там же мы смотрели метрику, чтобы понять, где есть повторы багов. Плохо, если один и тот же критичный баг прилетает несколько дней подряд. Со временем заметили, что стало лучше, в первую очередь потому, что мы сразу же бежали к коллегам-аналитикам и быстро все чинили.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/9c96893f-fc01-493a-afdf-45461a5f42b1.png" alt="" /></figure><p>Постепенно мы разобрались со всеми накопившимися багами, актуализировали витрины и теперь работаем только с новыми задачами. На это потребовалось пол года и три инженера.</p><h2>Как выглядит рабочий процесс сейчас. Спойлер: все работает автоматически</h2><p>Каждое утро в наш мессенджер приходит список проблемных витрин, где указан уровень бага, ответственные и так далее.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/d6937fd4-1a3b-4247-b3fb-d58b53e13ed6.png" alt="" /></figure><p>Раньше мы вручную создавали в системе запись, теперь это происходит автоматически.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/c21c5e66-39d8-428b-b957-f3137f085d40.png" alt="" /></figure><p>Пользователю в публичный чат уходит уведомление, что есть ошибка. Дальше обсуждаем, кто и как это будет чинить. Затем, собственно, исправляем ошибку.</p><figure><img src="https://media.tproger.ru/user-uploads/109956/2024-12-13/64ed4141-1095-43ce-8d81-ffb5957095ff.png" alt="" /></figure><p>Допустим, на исправление ушло два дня. После этого нужно пересчитать данные «в прошлое», потому что мы с плохим кодом жили эти два дня и лили неправильные данные в хранилище. Сейчас процесс довольно простой: заходим в нашу систему по управлению данными, открываем калькулятор, выбираем витрину и дату, за которую делаем пересчет. Указываем, надо ли по зависимостям делать пересчет вниз или нет и все.</p><h2>Несколько важных выводов, которые мы сделали в процессе работы</h2><ul><li>Прежде, чем бороться с багами в данных, оцените текущие масштабы. Если у вас десять витрин и прилетает один баг в неделю, то все, о чем я говорил выше, вам пока не нужно. Но если бизнес растет, начните с внедрения метрик. Так вы будете знать, например какой ущерб наносится, как быстро вы реагируете на это. Это те моменты, которые в будущем придется прокачивать, и чем раньше вы соберете информацию, тем проще будет разбираться потом.</li><li>Расставьте приоритеты по багам и витринам. Возможно у вас будет своя система, не такая, как в Авито. Но в любом случае есть смысл из сотни витрин выбрать те, что используются каждый день, и те, которые лежат до востребования.</li><li>Согласуйте свои ожидания от запуска. Убедитесь, что ответственные сотрудники знают, что и как им нужно делать, а еще лучше, пропишите это в KPI.</li><li>Измеряйте полученные результаты. Создайте метрики и корректируйте их по мере необходимости, чтобы рабочий процесс не буксовал и команда видела свои результаты в понятных графиках или списках.</li></ul><p>Предыдущая статья: <a href="https://habr.com/ru/companies/avito/articles/781892/">Архивная репликация в PostgreSQL: пошаговая инструкция</a></p>]]></content:encoded>
    </item>
    <item>
      <title>Python в Data Science: топовые библиотеки и фреймворки, которые будут популярны в 2025</title>
      <link>https://tproger.ru/articles/python-v-data-science--biblioteki-i-frejmvorki--kotorye-budut-populyarny-v-2025</link>
      <comments>https://tproger.ru/articles/python-v-data-science--biblioteki-i-frejmvorki--kotorye-budut-populyarny-v-2025?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Анна Ельцова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/python-v-data-science--biblioteki-i-frejmvorki--kotorye-budut-populyarny-v-2025</guid>
      <description><![CDATA[<p>Python в Data Science. Показываем основные библиотеки и фреймворки, которые будут популярны в 2025. Рассматриваем преимущества и недостатки ✔ Tproger</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/python-v-data-science--biblioteki-i-frejmvorki--kotorye-budut-populyarny-v-2025">Python в Data Science: топовые библиотеки и фреймворки, которые будут популярны в 2025</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Фреймворки и библиотеки]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 03 Dec 2024 10:00:00 GMT</pubDate>
      <content:encoded><![CDATA[<p>Python  в сфере Data Science остается топ-1 языком — это основная технология для для обработки данных, машинного обучения и разработки аналитических моделей. Например, в машинном обучении Питон <a href="https://medium.com/@byanalytixlabs/master-python-for-data-science-a-comprehensive-guide-for-beginners-62c87913eb4f">используют</a> 69% разработчиков. И в 2025 году году этот тренд будет только расти благодаря как развитию существующих инструментов, так и созданию новых.</p><p>Разработчики выбирают Python для аналитики данных и машинного обучения из-за его гибкости, универсальности, низкого порога входа и силы комьюнити. Он позволяет интегрироваться с практически любой технологией, а также поддерживает мощные библиотеки, такие как Pandas, NumPy и Scikit-Learn. А еще язык постоянно развивается — не так давно разработчики <a href="https://tproger.ru/articles/retro--kakie-novye-tehnologii-poyavilis-dlya-programmistov-i-razrabotchikov">выкатили</a> новую версию 3.13, в которой сильно улучшилась производительность. Ниже рассказываем о топовых фреймворках и библиотеках, которые будут популярны в 2025 году.</p><h2>Библиотеки для сложных вычислений</h2><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-11-28/d1d38bd4-0b83-4bfe-ace7-35b37a68b695.png" alt="Python в Data Science" /></figure><h3>NumPy и SciPy</h3><p>NumPy стала основой для большинства других библиотек, включая TensorFlow и PyTorch. Он используется для работы с массивами и числовыми данными. В машинном обучении почти каждый проект основан на эффективных математических функциях NumPy и точных операциях с массивами. И в плане векторов и многопоточности эта библиотека незаменима — на ней все держится.</p><p>Например, NVIDIA <a href="https://www.nvidia.com/en-us/glossary/numpy/">разрабатывает</a> CUDA — платформу параллельных вычислений и модель программирования для работы на графических процессорах NVIDIA. CUDA Array Interface стандартизирует формат передачи массивов GPU между библиотеками без копирования данных. Так, CuPy реализует массивы NumPy на GPU NVIDIA с использованием CUDA, а Numba компилирует Python-код для GPU с прямой поддержкой массивов NumPy. Apache MXNet использует NDArray — аналог NumPy для GPU, ускоряющий работу моделей глубокого обучения. Это к слову о том, что NumPy уже стала стандартом.</p><p>Поверх NumPy можно использовать SciPy — она расширяет способности базовой модели для статистики и моделирования.</p><h3>Pandas</h3><p>Pandas — еще один базовый инструмент для работы с данными в Python, который остается в топе благодаря производительности (Панды отлично справляются с огромным количеством данных). Она, кстати, тоже используется поверх NumPy.</p><p>Возможно, в будущем мы увидим улучшение поддержки многопоточности и оптимизацию для работы с большими наборами данных — это сделает библиотеку ещё актуальнее.</p><p>Панды используют для подготовки данных во многих проектах — от финансового анализа до биоинформатики. Например, в здравоохранении с помощью Pandas анализируют электронные медицинские записи и прогнозируют эпидемии.</p><h3>Dask</h3><p>Dask используется для распределённых вычислений и параллельной обработки больших массивов данных. Он является топовым дополнением к Pandas в случаях, когда объемы данных превышают возможности оперативной памяти. В будущем всё больше компаний будут применять связку Pandas + Dask, чтобы масштабировать свои аналитические системы.</p><h3>JAX</h3><p>Новая селебрити в вычислениях от Google! JAX активно набирает популярность за счет своей способности ускорять численные расчеты и различать собственные функции Python и NumPy. Ожидается, что к 2025 году JAX будет активно применяться для статистического моделирования и разработки новых алгоритмов.</p><h2>Топовые фреймворки для Machine и Deep Learning</h2><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-11-28/5f929938-1acb-4401-b59d-142dd7e0ae6c.png" alt="Библиотеки и фреймворки для Python в Data Science" /></figure><h3>TensorFlow — базовая база</h3><p>TensorFlow от Google остается основным инструментом в машинном обучении благодаря своей мощной экосистеме, включающей компоненты для обучения, развертывания и мониторинга моделей. Сейчас он выделяется улучшенной интеграцией с облачными платформами (особенно с Google Cloud) и поддержкой edge-устройств — это упрощает развертывание моделей в разных средах.</p><p>Так, TensorFlow Lite позволяет запускать модели на мобильных устройствах, IoT-устройствах и микроконтроллерах — инструмент используют в приложениях для распознавания речи и обработки изображений в реальном времени, в том числе и на смартфонах. А в TensorFlow Extended (TFX) есть фичи для построения масштабируемых пайплайнов, таких как автоматическая настройка моделей (TensorFlow Model Analysis) и эффективное развертывание (TensorFlow Serving). Это особенно полезно для продакшн-сред.</p><h3>PyTorch</h3><p>PyTorch стал любимчиком в среде разработчиков из-за удобства динамических вычислительных графов и pythonic-подхода, что упрощает отладку и разработку. PyTorch известен тем, что предоставляет две из самых высокоуровневых функций — тензорные вычисления с мощным графическим ускорением и поддержку построения глубоких нейронных сетей на ленточной системе autograd.</p><h3>Keras</h3><p>Сейчас Keras максимально интегрирован с TensorFlow, поэтому порог входа в машинное и глубокое обучение становится все ниже. Его высокоуровневый API позволяет разработчикам создавать прототипы сложных нейронных сетей с минимальным количеством кода, сохраняя при этом возможность выполнять операции более низкого уровня.</p><h3>Scikit-learn</h3><p>Scikit-learn сохраняет статус универсального инструмента для классического машинного обучения. Простота использования, стабильный API и широкая документация делают его максимально подходящим для задач от классификации до сложных пайплайнов, с акцентом на интеграцию с фреймворками глубокого обучения. В последних обновлениях улучшилась поддержка многопоточности и ускорений на основе Cython, а значит, работа с большим наборами данных идет быстрее.</p><h3>FastAI</h3><p>Фреймворк основан на PyTorch и продолжает демократизировать глубокое обучение. Действительно инновационный трендовый инструмент, особенно в области компьютерного зрения и NLP-задач.</p><h3>PyCharet</h3><p>Эта low-code библиотека превратилась в большое комплексное решение для автоматизации задач AutoML. Подходит для тестирования гипотез или базовых моделей, которые можно улучшать по мере необходимости, а еще крута в прототипировании.</p><h3>Ray</h3><p>Это унифицированный фреймворк для распределенных вычислений. То, что нужно в машинном обучении.</p><h2>Библиотеки для визуализации данных</h2><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-11-28/ba7c9de0-a6b3-43dc-9670-47669dcbd026.png" alt="" /><figcaption>Визуализация с помощью Matplotlib</figcaption></figure><h3>Matplotlib</h3><p>Основная библиотека для создания статических графиков. Отлично подходит для базовой визуализации, такой как линейные графики, столбчатые диаграммы, гистограммы и так далее.</p><h3>Seaborn</h3><p>Построена поверх Matplotlib и предлагает более стильные и готовые к использованию графики. Удобна для работы с табличными данными (например, из pandas DataFrame).</p><p>Подходит для визуализации распределений, тепловых карт, корреляций.</p><h3>Plotly</h3><p>Интерактивная библиотека, поддерживающая 2D и 3D-графики. Удобна для создания сложных визуализаций, которые можно использовать в веб-приложениях. Поддерживает интеграцию с Jupyter Notebook.</p><h3>Bokeh</h3><p>Еще одна интерактивная библиотека, подходящая для работы с большими наборами данных. Отлично работает с динамическими и веб-графиками.</p><h3>Altair</h3><p>Легкая и интуитивная библиотека, построенная на основе декларативных спецификаций. Удобна для быстрого создания сложных интерактивных графиков.</p><h3>Yellowbrick</h3><p>Расширяет возможности scikit-learn для визуализации моделей, метрик и диагностик. Включает визуализацию обучения, важности признаков и другие функции.</p><h3>Mayavi</h3><p>Для 3D-графики, особенно в научных и технических приложениях. Подходит для визуализации поверхностей, полей данных.</p><h3>TensorBoard</h3><p>Инструмент от Google для визуализации экспериментов TensorFlow. Удобен для анализа потерь, градиентов и обучения.</p><h2>Библиотеки для NLP</h2><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-11-28/d82c39be-4384-44b5-8b74-978b442234eb.png" alt="" /></figure><h3>Hugging Face Transformers</h3><p>Библиотека Transformers произвела революцию в обработке естественного языка, сделав современные модели доступными для всех. Здесь и BERT, и GPT — в общем, благодаря ей внедрение инновационных технологий стало доступно как никогда.</p><h3>NLTK и spaCy</h3><p>NLTK предоставляет комплексные образовательные ресурсы и исследовательскую платформу, а spaCy фокусируется на производительности. Если применять их вместе, то  библиотеки закроют весь пул потребностей в NLP — от академических исследований до промышленного применения.</p><h2>Библиотеки для работы с медицинскими данными</h2><p>Да-да, биотехнологии сейчас как никогда в тренде. И Python в них, можно сказать, впереди планеты всей. С помощью библиотек и фреймворков исследователи и разработчики могут анализировать сигналы мозга, строить прогнозы для пациентов и использовать AI для улучшения медицинской диагностики. Ниже — о них.</p><figure><img src="https://media.tproger.ru/user-uploads/101078/2024-12-03/88f305c7-09f7-4aae-a0f2-8b5151d70702.png" alt="" /><figcaption>0</figcaption></figure><h3>MNE</h3><p>MNE — это незаменимый инструмент для работы с сигналами мозга, такими как магнитоэнцефалография (MEG) и электроэнцефалография (EEG). Он позволяет не только обрабатывать, но и визуализировать сложные временные ряды. Анализ данных мозга стал проще: загружаем файл, настраиваем фильтры и видим всё в наглядных графиках. Отличный выбор для нейрофизиологов и исследователей.</p><h3>Nilearn</h3><p>Nilearn делает анализ данных нейровизуализации, таких как fMRI, доступным даже для новичков. Построение тепловых карт активности мозга, изучение соединений и интеграция с машинным обучением через scikit-learn — всё это в одной библиотеке. Инструмент помогает мостить путь от простого анализа до сложных моделей ИИ.</p><h3>MONAI</h3><p>Если нужно внедрить глубокое обучение в медицинскую визуализацию, то MONAI — ваш выбор. Построенная на базе PyTorch, эта библиотека идеально подходит для задач сегментации и классификации медицинских изображений. Поддержка форматов DICOM и NIfTI и совместимость с ускорением на GPU делают её незаменимой для медицинских исследований и стартапов.</p><h3>NiBabel</h3><p>Когда нужно работать с нейровизуализационными данными и понимать все эти сложные форматы (NIfTI, MINC, Analyze), на помощь приходит NiBabel. Она помогает легко конвертировать и анализировать данные перед дальнейшей обработкой в Nilearn или MNE. Простота использования и мощный функционал — за это её любят исследователи.</p><h3>Lifelines</h3><p>Клинические исследования и прогнозирование событий, например, рецидивов или смертности, невозможны без анализа выживаемости. Lifelines предоставляет мощные инструменты для построения каплан-майеровских графиков и моделей Кокса. Простота синтаксиса и визуализация наглядных графиков делают её популярной среди медиков и биостатистиков.</p><p>Python в сфере Data Science популярен не просто так. Его применяют в реальных задачах — от анализа поведения пользователей до прогнозирования эпидемий. Инструменты Python делают сложные задачи проще и помогают бизнесу, науке и технологиям развиваться быстрее.</p>]]></content:encoded>
    </item>
    <item>
      <title>Генерация данных с помощью Python: зачем это нужно и как применять</title>
      <link>https://tproger.ru/articles/generaciya-dannyh-s-pomoshhyu-python--zachem-eto-nuzhno-i-kak-primenyat</link>
      <comments>https://tproger.ru/articles/generaciya-dannyh-s-pomoshhyu-python--zachem-eto-nuzhno-i-kak-primenyat?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Денис Кудерин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/generaciya-dannyh-s-pomoshhyu-python--zachem-eto-nuzhno-i-kak-primenyat</guid>
      <description><![CDATA[<p>Генерация данных с помощью Python. Зачем это нужно и как применять. Рассматриваем основные библиотеки и примеры ✔ Tproger</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/generaciya-dannyh-s-pomoshhyu-python--zachem-eto-nuzhno-i-kak-primenyat">Генерация данных с помощью Python: зачем это нужно и как применять</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Анализ данных]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 27 Nov 2024 10:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Генераторы — эффективный инструмент в Python, который позволяет создавать и определенным образом обрабатывать последовательности данных. Это один из ключевых элементов в экосистеме Python, предназначенный для работы с данными в более продуктивном режиме. Тем, кто только начинает осваивать программирование на Питоне, важно понять ценность генераторов и научиться обращению с этим инструментом для решения практических задач.</p><p>Опытные программисты говорят, что генераторы — это способ избавить оперативную память от избыточного потока информации и тем самым сэкономить ресурсы. Это сугубо прикладное решение, которое помогает разработчикам делать больше, тратя при этом меньше программных средств. Однако важно правильно пользоваться генераторами и знать о возможностях их практического применения.</p><p>Узнаем, что собой представляет генерация данных в Python, как используется этот инструмент и какие библиотеки применяются для работы с генераторами.</p><h2>Основные области применения генерации данных</h2><p>В языке Python генераторы — это специальные функции, предназначенные для создания итераторов, то есть объектов, которые используются для перебора некоторых последовательностей значений. В отличие от стандартных функций, генераторы могут «приостанавливать» работу с сохранением текущего состояния и при следующем вызове продолжать выполнение команды с того же места.</p><p>Такая функция нужна, чтобы обрабатывать огромные объемы информации, при этом не загружая все данные в память. Генераторы существенно экономят ресурсы компьютера и делают работу с данными более эффективной и быстрой.</p><p>Ключевое отличие генераторов от стандартных итерируемых объектов в использовании команды yield вместо return. Таким образом, функция с yield автоматически становится генератором. Когда разработчик вызывает такую функцию, она выполняется не в полном объеме, а возвращает объект каждый раз по мере новой генерации данных.</p><p>Понять работу генераторов проще на примерах. Если у вас есть файл, который весит десятки гигабайт, и в нем нужно найти и обработать строки, подходящие под определенное условие, или сравнить с данными другого большого файла, то генератор будет наиболее эффективным способом выполнить задачу.</p><p>Или другой пример. Нужно проанализировать почти бесконечный поток данных (показания счетчиков, котировки на бирже, сетевой трафик), рассчитать наступление вероятности конкретного события и вычислить математическую последовательность. Загрузить в компьютер такой объем данных нереально — для них просто не хватит оперативной памяти, а иногда и жесткого диска. Наиболее целесообразное решение в такой ситуации — обрабатывать данные частями, чтобы не перегружать процессор. Как раз для этого используются генераторы Python.</p><h3>Где применяется генерация данных</h3><ul><li><b>Тестирование программного обеспечения.</b> Сложные программные продукты нуждаются в проверке перед запуском. Генерация тестовых данных используется для проверки функциональности программ.</li><li><b>Машинное обучение.</b> С помощью генерации синтетических данных выполняется обучение моделей и нейросетей.</li><li><b>Анализ и визуализация данных.</b> Посредством генераторов Python в ускоренном режиме подготавливаются данные для презентаций и демонстраций.</li><li><b>Прототипирование. </b>Генерация данных Python используется для первичной отладки макетов и черновых версих программных продуктов.</li></ul><p>Генераторы — это инструменты, которые позволяют функциям возвращать последовательность полученных результатов вместо единственного значения. Такой способ идеален для создания итераторов.</p><h3>Основные плюсы генераторов</h3><ul><li><b>Существенная экономия памяти.</b> Данные загружаются по мере необходимости, а не сплошным потоком, что позволяет без излишних затрат времени и оперативных ресурсов обрабатывать значительные объемы информации.</li><li><b>Ленивая загрузка. </b>Инструменты поддерживают ленивую загрузку, то есть генерируют значения исключительно при запросе, что на порядок ускоряет выполнение программ.</li><li><b>Удобство.</b> С помощью генераторов создают последовательности данных, используя минимальное количество строк кода, что делает их максимально удобными для практического применения.</li><li><b>Управление потоком.</b> Благодаря генераторам достигается максимальный контроль при исполнении программы, при этом сохраняется состояние функции, а управление передается коду. При следующем вызове программа исполняется с места, на котором она была приостановлена.</li></ul><p>Для понимания работы генераторов важно усвоить концепцию ленивой загрузки. Она означает, что значения вычисляются и генерируются исключительно в тот момент, когда они нужны, а не загружаются предварительно целиком. Эта опция актуальна при работе с большими данными — она оптимизирует ресурсы и ускоряет процесс вычислений.</p><p>Вот один из примеров ленивой загрузки:</p><p>Здесь значения в диапазоне от 0 до 4 вычисляются и выводятся на экран в порядке очереди, но при этом в памяти компьютера не сохраняются. Значение генерируется только в момент запроса, а не автоматически. Такой алгоритм позволяет работать с огромными объемами данных, которые не загружаются целиком в память устройства.</p><p>Ленивые вычисления особенно ценны при работе с потенциально бесконечными последовательностями — числами Фибоначчи, потоками данных и другими. Если бы генераторов данных в Python не было, такие программы могли бы просто исчерпать память, после чего выполнение задачи было бы невозможно.</p><h2>Библиотеки Python для генерации данных</h2><p>Использование специальных библиотек, то есть файлов с готовыми шаблонами кода, существенно упрощает работу программистов. Такие пакеты создают, чтобы разработчики не набирали каждый раз заново с нуля одинаковый код. Достаточно выбрать нужный файл из конкретной библиотеки, открыть его, ввести свои значения и почти мгновенно получить результат.</p><p>Рассмотрим самые популярные библиотеки Python для генерации данных.</p><h2>Faker</h2><p>Библиотека используется для генерации фейковых текстовых данных с различной локализацией. Подходит для множества ситуаций — тестирования написанного года, заполнения баз данных, в том числе обширных, анонимизации данных.</p><p>Библиотеку Faker используют, когда требуется проверить функциональность приложения. Если это софт для работы с обширными базами данных пользователей, его нужно протестировать на практике. Но вводить реальную информацию в программу некорректно и небезопасно.</p><p>Поэтому разработчики пользуются «Фейкером». Эта библиотека генерирует в нужном количестве данные несуществующих пользователей — их имена и фамилии, даты рождения, номера телефонов, адреса и другую информацию. Синтетические данные создаются случайным образом каждый раз, когда пользователь запускает атрибут.</p><p>Faker поддерживается на Python в версии 3.7 и выше. Список данных, которые может сгенерировать программа, довольно велик, при этом каждый пункт имеет подпункты для дополнительных настроек. То есть фейковая информация, создаваемая этим инструментом, будет довольно детальная.</p><h2>NumPy и SciPy</h2><p>Это библиотеки для генерации числовой и статистической информации.</p><h3>NumPy</h3><p>Незаменимый инструмент для работы с числовыми значениями и сложной математикой, а также с векторами и матрицами. В библиотеке содержатся готовые способы применения различных математических операций — от расчета детерминанта и сингулярного разложения до решения квадратных уравнений. Значительно упрощает работу с многомерными массивами — в этом формате передаются данные для моделей в методах глубокого машинного обучения. По этой причине NumPy входит в базовый пул библиотек для работы с нейросетями.</p><h3>SciPy</h3><p>Библиотека основана на NumPy и существенно расширяет ее функционал. Здесь используется линейная алгебра и методы работы с распределением вероятностей, интегральными исчислениями, преобразованиями Фурье. SciPy предназначена для сложных математических вычислений, в ней огромное количество функций, которые используются для научного анализа. Библиотека расширяет функции NumPy и использует методы продвинутой математики.</p><p>В пакете программ есть функции для построения графиков и оперативной обработки изображений. При этом используются сложные и трудоемкие операции, которые довольно просто описываются в виде кода. SciPy можно использовать для обработки различных сигналов, в том числе фото и видео.</p><h2>Pandas</h2><p>Библиотека для обработки и анализирования структурированных баз данных, в том числе результатов исследований и вычислений, представленных в виде таблиц. Исходный код Pandas в открытом доступе есть на GitHub — пользователи могут самостоятельно дополнять способы обработки и делать обновления.</p><p>Pandas — эффективный инструмент для дата-сайентистов и аналитиков данных. С этой библиотекой специалисты могут группировать, обрабатывать, визуализировать массивы данных, создавать таблицы, распределять информацию по определенным признакам.</p><p>Библиотека успешно используется для маркетинговой, продуктовой, математической аналитики. Основное преимущество инструмента — возможность обработки больших данных для их дальнейшего использования в машинном обучении. «Пандас» поддерживает базовые статистические методики, используемые для работы с данными.</p><h2>Scikit-Learn</h2><p>Библиотека базируется на NumPy и SciPy, содержит алгоритмы для аналитической работы с информацией — кластеризации, распределения по классам, регрессии и других операций. Scikit-Learn используется также для машинного обучения.</p><p>По мнению экспертного сообщества, Scikit входит в число лучших библиотек для обработки огромных массивов данных. Ее используют такие сервисы, как Spotify, Evernote и другие. Генерация данных лежит в основе алгоритмов, с которыми работает этот пакет.</p><p><b>Область применения библиотеки:</b></p><ul><li><b>Рекомендательные системы.</b> Сюда относится реклама, основанная на интересах пользователя, сервисы с музыкой, кино, книгами, которые предлагают наименования специально для конкретного посетителя.</li><li><b>Распознавание текста и изображений.</b> Система переводит в цифру текстовый формат и картинки.</li><li><b>Прогнозирование.</b> Алгоритмы предсказывают действия пользователей, финансовые колебания на бирже и другие события на основе существующих данных.</li><li><b>Обработка результатов.</b> Библиотека используется для анализа результатов научных, медицинских и прочих исследований.</li></ul><p>Машинное обучение — это обширная отрасль с широкими перспективами. Scikit-Learn используется для тестирования моделей и совершенствования различных программных продуктов.</p><h2>Mimesis</h2><p>Высокопроизводительный генератор, альтернатива Faker. Обладает теми же базовыми функциями, но имеет дополнительный расширенный функционал. Библиотека используется для загрузки реалистичных фейковых данных в средах тестирования и разработки.</p><h2>Примеры использования для различных задач</h2><p>Генератор представляет собой объект, который не вычисляет значение сразу всех загруженных элементов, а действует последовательно. В его памяти хранится только последний элемент, при этом переход к следующему происходит только при выполнении метода next(). Предыдущее значение утрачивается.</p><p>Рассмотрим несколько конкретных примеров применения генерации данных на Python.</p><h3>Faker</h3><p>Начнем с библиотеки Faker. Она используется для тестирования кода, генерирования данных для тестирования программных продуктов, анонимизации.</p><p>Пример кода на Python выглядит следующим образом:</p><p>Пользователь импортирует библиотеку, объявляет генератор фейковых данных и помещает в переменную fake. Этот генератор создается с поддержкой русского языка, что указывается с помощью команды "ru_RU". На последней строчке появляется случайное ФИО.</p><h3>NumPy</h3><p>С помощью библиотеки NumPy можно задать генерацию случайных чисел. Делается это через модуль numpy.random. Код будет выглядеть следующим образом:</p><p>Такой код создает массивы из случайных данных.</p><h3>Scikit-learn</h3><p>Библиотека Scikit-learn генерирует достаточный объем данных для тестирования различных моделей с целью их обучения.</p><p>Например, функция sklearn.datasets.load_moscow () содержит условные данные о ценах на недвижимость в Москве. Матрица содержит 506 наблюдений и 13 столбцов.</p><p>Такой набор используется для многовариантной регрессии.</p><h2>Советы по эффективному применению генерации данных</h2><p>Генераторы в Питоне — не просто теоретические конструкции, но действенный инструмент для практического использования в реальных сценариях.</p><p>Функции и библиотеки для генерации используют для обработки огромных массивов информации. Например, если необходимо проверить объемный файл в формате CSV, можно применить генератор для его построчного чтения и последующей обработки. При этом загрузка файла в память не понадобится.</p><p>Применение генераторов будет полезно для <b>видео-скрапинга</b> — извлечения данных из веб-страниц и их анализа. Инструмент будет извлекать HTML-страницы поочередно, отбирая необходимые данные и отбрасывая ненужные. Такой способ позволяет работать с большими ресурсами без сбоев в системе, зависаний и остановок.</p><p>Генераторы незаменимы <b>в сетевом программировании</b>, например, когда требуется принять или отправить огромный поток данных. При взаимодействии с протоколами HTTP и другими можно запустить генератор, который будет получать данные из сети порционно и поэтапно с ними работать. Таким способом можно обойтись без буферизации памяти.</p><p>Актуально использование генераторов <b>в разработке игры</b>. С их помощью разрабатывается процедурный контент — например, ландшафты игрового мира, уровни или встречи с препятствиями. Генерируя контент в динамическом режиме по мере надобности, инструменты создают условно бесконечные либо случайные игровые элементы, тем самым обеспечивая полноценный геймплей.</p><p>Опытные разработчики советуют тщательно тестировать и отлаживать генераторы. Эти функции могут быть сложными для понимания в сравнении с обычным, поэтому важно уделять максимум вниманию проверке корректной работы инструментов. Рекомендуется применять тесты для проверки работы генераторов и понимания особенностей потока данных. Это поможет исправить возникающие проблемы.</p>]]></content:encoded>
    </item>
    <item>
      <title>Python и SQL: что изучать в первую очередь для анализа данных</title>
      <link>https://tproger.ru/articles/python-i-sql--chto-izuchat-v-pervuyu-ochered-dlya-analiza-dannyh-</link>
      <comments>https://tproger.ru/articles/python-i-sql--chto-izuchat-v-pervuyu-ochered-dlya-analiza-dannyh-?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Ксения Андреева]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/python-i-sql--chto-izuchat-v-pervuyu-ochered-dlya-analiza-dannyh-</guid>
      <description><![CDATA[<p>Python и SQL — самые популярные инструменты для работы с данными. Но какой из них изучать первым? Разбираемся в статье.  </p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/python-i-sql--chto-izuchat-v-pervuyu-ochered-dlya-analiza-dannyh-">Python и SQL: что изучать в первую очередь для анализа данных</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[SQL]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Анализ данных]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 22 Nov 2024 09:10:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>Два самых популярных инструмента для работы с данными — Python и SQL. Они хороши для обработки, анализа данных и для их визуализации и интерпретации. У новичков часто возникает вопрос: начать изучение с Python или SQL? В этой статье расскажем о каждом языке и как они взаимно дополняют друг друга.</p><h2>Коротко про Python</h2><p>Python — это язык программирования, известный своей простотой и читаемостью кода. Он популярен благодаря мощным библиотекам (Pandas, NumPy и Matplotlib), которые помогают эффективно обрабатывать данные, выполнять сложные вычисления и визуализировать результаты. Ещё Python используется для машинного обучения — с помощью библиотек Scikit-learn и TensorFlow.</p><h2>Коротко про SQL</h2><p>SQL— стандартный язык управления базами данных. Он используется для извлечения данных из баз данных по типу MySQL, PostgreSQL или SQLite. Знание SQL необходимо для работы с большими объёмами уже структурированных данных — от простых до сложных запросов.</p><h2>Как эти инструменты дополняют друг друга</h2><p>Python и SQL часто используются совместно в анализе данных. SQL применяется на начальном этапе работы для извлечения нужных датасетов из баз данных. Так специалисты получают доступ к необходимым данным без необходимости выгрузки больших массивов информации вручную.</p><p>Как только данные извлечены с помощью SQL, на помощь приходит Python. С его помощью можно легко преобразовать «сырые» данные в удобный формат для более глубокого анализа. Библиотеки помогают буквально очистить данные от шумов и пропущенных значений, проводить детальный анализ с использованием статистических методов или алгоритмов ML.</p><h2>Почему Python стал стандартом для анализа данных</h2><ul><li><b>Простота и хорошая читаемость. </b>Python интуитивно понятен и лёгок в освоении, потому подходит для начинающих аналитиков данных.</li><li><b>Самые разные библиотеки. </b>NumPy, Pandas и Matplotlib позволяют проводить сложные вычисления и визуализацию данных практически без усилий.</li><li><b>Сообщество и поддержка. </b>Большое сообщество разработчиков поддерживает и развивает язык. А значит, существует много ресурсов для обучения, форумов поддержки и готовых решений для рядовых задач анализа данных.</li><li><b>Универсальность. </b>Python используется не только для анализа данных, но и в веб-разработке, научных исследованиях, ML и многом другом. Потому этот язык — универсальный инструмент для решения самых разных задач.</li></ul><p><a href="https://numpy.org/">NumPy</a> — библиотека для работы с многомерными массивами чисел, матрицами и выполнения высокоуровневых математических функций. Основной объект NumPy — это массив (numpy array). Библиотека позволяет выполнять операции над массивами целиком без использования циклов for, а это ускоряет работу.</p><p><a href="https://pandas.pydata.org/">Pandas</a> даёт возможность работать с высокоуровневыми структурами (Series и DataFrame)  для удобного хранения и работы. DataFrame — двумерная таблица с метками строк и столбцов, похожая на таблицы SQL или Excel. В Pandas легко фильтровать данные и группировать их по выбранным критериям.</p><p><a href="https://matplotlib.org/">Matplotlib</a> — это основная библиотека для создания статических визуализаций. В библиотеке можно работать над визуализацией данных от простых линейных графиков до сложных диаграмм. Matplotlib легко интегрировать с другими инструментами Python (та же Pandas), а значит, можно создавать графики на основе уже обработанных данных.</p><h2>SQL в управлении и извлечении данных из баз</h2><p>Одной из ключевых фишек SQL является возможность извлечения нужных наборов данных на основании заданных критериев — особенно важно для аналитиков, которым нужно «вытащить» информацию из больших массивов данных. А ещё с помощью SQL можно проводить агрегации, сортировки и фильтрации. Так легко подготовить данные для дальнейшего анализа и/или визуализации.</p><p><b>В SQL много команд для работы с данными:</b></p><ul><li>SELECT используется для выборки данных из одной или нескольких таблиц с указанием конкретных столбцов и условий;</li><li>WHERE для указания условий фильтрации записей в тандеме с SELECT. С помощью WHERE можно ограничивать результаты запроса только теми данными, которые соответствуют заданным критериям.</li><li>JOIN используется для объединения строк из двух или более таблиц на основе логической связи. С помощью JOIN можно комбинировать данные из разных источников в одном запросе;</li><li>GROUP BY применяется для группировки строк по указанным столбцам. Поможет при подсчёте среднего значения или суммы;</li><li>ORDER BY помогает сортировать результаты запроса по одному или нескольким столбцам как в возрастающем (ASC), так и убывающем (DESC) порядке.</li></ul><h2>Что изучать первым?</h2><p>Оба языка имеют свои особенности и применяются для самых разных задач в работе с данными. В первую очередь нужно понять, какой из языков изучать первым. И это зависит от ваших задач и целей.</p><p><b>При выборе между Python и SQL стоит учитывать:</b></p><ul><li><b>Цели.</b> Если ваша цель — научиться строить модели для ML или проводить глубокий анализ данных с визуализацией, лучше начать именно с Python. Если же ваша цель — извлечение и обработка больших объёмов данных из баз данных, разумнее будет начать с SQL.</li><li><b>Структуру данных.</b> Если вы планируете работать преимущественно таблицами, то на первых порах лучше уйти в освоение SQL.</li><li><b>Глубину анализа. </b>Для более сложных аналитических задач, требующих написания алгоритмов или автоматизации процессов обработки данных, подойдёт Python благодаря большому количество библиотек, доступных для работы.</li></ul><p><b>Если вы решили начать с Python:</b></p><ol><li>Изучите основы языка — переменные, условные операторы, циклы и функции;</li><li>Узнайте больше о ключевых библиотеках для анализа данных — Pandas (для работы с таблицами), NumPy (для числовых операций) и Matplotlib (для визуализации);</li><li>Пробуйте реализовать простые проекты и задачи по анализу реальных данных для закрепления теории: это могут быть и простые задачи по анализу продаж, и проекты по аналитике данных покупателей. Главное здесь — это пробовать и закреплять теорию на практике!</li></ol><p><b>Если вы решили начать с SQL:</b></p><ol><li>Освойте основные команды SELECT, INSERT, UPDATE и DELETE;</li><li>Научитесь использовать WHERE для фильтрации результатов запросов и ORDER BY для их сортировки;</li><li>Изучите функции COUNT(), SUM(), AVG() и другие функции для создания сводки информации;</li><li>Изучите основы JOIN-операций для объединения нескольких таблиц на основе общих полей.</li></ol><h2>Python + SQL</h2><p>Совместное использование Python и SQL — по-настоящему сильный инструмент для аналитики, который позволяет объединить возможности программирования и работы с базами данных.</p><p>SQL идеально подходит для извлечения данных из таблиц, а Python хорош своей гибкостью в обработке и анализе полученных с помощью SQL данных. Ещё Python используют для написания скриптов, которые выполняют SQL-запросы к базе данных. Так можно легко автоматизировать процесс извлечения данных и дальнейшей обработки их в Python.</p><p>Используйте библиотеку Pandas для взаимодействия с базами данных через системы по типу <a href="https://www.sqlalchemy.org/">SQLAlchemy</a> и другими ORM. SQLAlchemy — популярная библиотека, которая даёт пользователям набор высокоуровневых интерфейсов для работы с базами данных в Python. Она поддерживает разные системы управления баз данными и помогает взаимодействовать с ними более эффективно.</p><h4>Разбор кейса использования Python и SQL для решения реальной задачи аналитики</h4><p>Дано: компания занимается e-commerce и стремится улучшить свою маркетинговую стратегию на основе анализа покупательских данных. Цель: определение сегментов пользователей, которые приносят наибольший доход, и выявление факторов, влияющих на их поведение.</p><p><b>Шаг 1 — сбор данных</b></p><p>Здесь используем SQL для извлечения данных из базы компании. Например, таблицы с информацией о клиентах и их транзакциях могут выглядеть так:</p><p>Здесь мы объединяем таблицы customers и transactions, получая полную информацию о каждой покупке.</p><p><b>Шаг 2 — анализ данных</b></p><p>После извлечения данных с помощью SQL, используем Python для их анализа. Здесь пригодятся библиотеки Pandas и Matplotlib для обработки и визуализации информации:</p><p>Загрузка данных из SQL-запроса в DataFrame Pandas:</p><p>Группировка по пользователям и расчёт общего дохода:</p><p>Визуализация распределения дохода по пользователям:</p><p>Здесь мы видим распределение доходов по пользователям и определяем ключевые сегменты клиентов.</p><p><b>Шаг 3 — прогнозирование и стратегия</b></p><p>Используя библиотеки Python для машинного обучения (например, Scikit-learn), можно создать модель прогнозирования вероятности дополнительных покупок или ухода клиента:</p><p>Подготовка данных для модели — признаки и целевая переменная:</p><p>Разделение на обучающую и тестовую выборки:</p><p>Обучение модели классификации:</p><p>Оценка точности модели на тестовых данных:</p><p>Так мы можем определить вероятных «ушедших» клиентов, равно как и тех, кто может совершить повторную покупку.</p><h2>Ресурсы для обучения</h2><p>Сейчас на рынке онлайн-обучения доступно великое множество онлайн-курсов, книг и других материалов, способных помочь как начинающим, так и опытным специалистам.</p><p><b>Онлайн-курсы:</b></p><ol><li><b>Coursera</b> — например, курс «Python for Everybody» от университета Мичигана поможет изучить основы программирования на Python с акцентом на работу с данными;</li><li>В <b>edX</b> можно найти курсы по SQL от университетов Гарвард или MIT. Курс «Introduction to SQL» поможет освоить базовые принципы работы с базами данных;</li><li><b>DataCamp</b> специализируется на обучении работе с данными и предлагает интерактивные курсы по Python и SQL.</li></ol><p><b>Книги:</b></p><ol><li><a href="https://www.ozon.ru/product/python-for-data-analysis-python-dlya-analiza-dannyh-na-angl-yaz-214809222/">«Python для анализа данных» Уэса МакКинни</a> подходит для тех, кто хочет освоить Python именно в контексте анализа данных;</li><li><a href="https://www.ozon.ru/product/sql-dlya-chaynikov-9-e-izdanie-teylor-allen-dzh-627957958/">9-ое издание «SQL для чайников» Аллена Тейлора</a> — простое введение в мир SQL поможет новичкам быстро понять основы работы с базами данных;</li><li><a href="https://www.ozon.ru/category/mark-lutts-izuchaem-python/">«Изучаем Python» Марка Лутца</a> — одно из самых популярных пособий для начинающих.</li></ol><p><b>Ещё материалы:</b></p><ol><li><b>YouTube-каналы.</b> Например, на канале <a href="https://www.youtube.com/channel/UCCezIgC97PvUuR4_gbFUs5g">Corey Schafer</a> есть много полезных и практических видео по Python;</li><li><a href="https://ru.stackoverflow.com/">Stack Overflow</a> — хорошая площадка для поиска ответов на специфические вопросы по программированию;</li><li><b>Изучение официальной документации к языкам и библиотекам</b> (например, юзер гайд по <a href="https://pandas.pydata.org/docs/user_guide/index.html">Pandas</a> или алфавитный список вопрос по <a href="https://www.sqlite.org/doclist.html">SQLite</a>) поможет расширить знания.</li></ol><h2>В заключение</h2><p>В современном мире аналитики данных владение и Python, и SQL одинаково важны и нужны для обработки и визуализации информации. Python поможет проанализировать большие объёмы неструктурированных данных с помощью библиотек по типу Pandas и NumPy, а SQL поможет извлечь информацию из таблиц.</p><p>Работая одновременно с Python и SQL, можно не только эффективно обрабатывать данные из разных источников, но и извлекать из них полезные выводы для принятия решений на основе сухих фактов: сколько заказов было сделано, сколько отменено, как ведут себя пользователи.</p><p>Начав изучение с одного языка и постепенно переходя к другому, вы только укрепите свои позиции как аналитик данных и сможете лучше и эффективнее работать.</p>]]></content:encoded>
    </item>
    <item>
      <title>Работа с большими данными: введение в Apache Hadoop и Spark</title>
      <link>https://tproger.ru/articles/rabota-s-bolwimi-dannymi--vvedenie-v-apache-hadoop-i-spark</link>
      <comments>https://tproger.ru/articles/rabota-s-bolwimi-dannymi--vvedenie-v-apache-hadoop-i-spark?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Вадим Егорцев]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/rabota-s-bolwimi-dannymi--vvedenie-v-apache-hadoop-i-spark</guid>
      <description><![CDATA[<p>Работа с большими данными. Рассказываем об основах Apache Hadoop и Spark. Рассматриваем пошаговую инструкцию по внедрению распределенной системы ✔ Tproger</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/rabota-s-bolwimi-dannymi--vvedenie-v-apache-hadoop-i-spark">Работа с большими данными: введение в Apache Hadoop и Spark</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Фреймворки и библиотеки]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sat, 02 Nov 2024 10:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<h2>Что такое Apache Hadoop?</h2><p><b>Apache Hadoop</b> — это платформа для хранения и работы с большими объемами данных. Ее преимущество заключается в распределении вычислений между множеством узлов. Hadoop разбивает большую задачу на много маленьких и решает их одновременно на разных компьютерах.</p><p>Основные компоненты фреймворка:</p><ul><li><b>Hadoop Distributed File System (HDFS)</b> — файловая система для хранения больших данных с потоковым доступом. HDFS оптимизирована под работу с файлами до десятков терабайт, а кластеры могут хранить петабайты информации.</li><li><b>MapReduce </b>— модель для обработки записей из HDFS. MapReduce разбивает задачу на две фазы. На этапе «Map» данные обрабатываются параллельно на разных узлах кластера, а на этапе «Reduce» результаты объединяются.</li><li><b>Yet Another Resource Negotiator (YARN)</b> — система управления ресурсами кластера и планирования задач. YARN расширяет возможности Hadoop и поддерживает другие модели обработки помимо MapReduce — Spark, Flink.</li></ul><p>HDFS, MapReduce и YARN образуют основу Hadoop, обеспечивая хранение, обработку и управление ресурсами соответственно.</p><figure><img src="https://media.tproger.ru/user-uploads/105601/2024-10-20/446c84b0-9bfc-4650-b210-eb5626b26f54.jpg" alt="" /><figcaption>Основные компоненты Apache Hadoop</figcaption></figure><p>Hadoop используют для анализа логов пользователей, чтобы, например, улучшить таргетирование рекламы. Онлайн-ритейлеры применяют Hadoop для рекомендаций товаров на основе истории покупок и просмотров. Распределенная система также применяется в банковской сфере для обработки транзакций.</p><h2>Преимущества Hadoop</h2><p><b>Масштабируемость</b>. Систему Hadoop можно расширять до тысяч узлов. Компании наращивают вычислительные мощности по мере роста объемов данных.</p><p><b>Экономия</b>. Дешевые сервера на базе Hadoop объединяются в мощный вычислительный кластер. Компании используют Hadoop, чтобы не инвестировать в дорогостоящее оборудование.</p><p><b>Отказоустойчивость</b>. Благодаря распределенной архитектуре и автоматической репликации Hadoop работает даже при отказе отдельных узлов кластера.</p><p><b>Гибкость</b>. Hadoop применяется в проектах со структурированными и неструктурированными данными.</p><h2>Что такое Apache Spark?</h2><p>Apache Spark — это система распределенных вычислений. Она используется для преодоления ограничений Hadoop MapReduce и интегрируется поверх HDFS.</p><p>Spark до 100 раз быстрее Hadoop MapReduce благодаря обработке данных в памяти. Также Spark предоставляет API на Java, Scala, Python. Еще поддерживаются пакетная обработка, интерактивные запросы, потоковая обработка и машинное обучение.</p><figure><img src="https://media.tproger.ru/user-uploads/105601/2024-10-20/3f226d96-3f71-4add-bbf7-bd9773a012f7.jpg" alt="" /><figcaption>Основные компоненты Apache Spark</figcaption></figure><p>Компоненты Apache Spark:</p><ul><li>Spark Core — движок для распределенной обработки больших данных. Включает в себя API для работы с Resilient Distributed Datasets (RDD) — основной абстракцией данных в Spark.</li><li>Spark SQL — модуль для работы со структурированными данными, поддерживающий SQL-запросы.</li><li>Spark Streaming — компонент для обработки потоковых данных в реальном времени.</li><li>MLlib — библиотека машинного обучения с алгоритмами для классификации, регрессии, кластеризации и фильтрации данных.</li><li>GraphX — движок для визуализации данных на графиках.</li></ul><h2>Преимущества Spark</h2><p><b>Скорость. </b>Spark быстрее Hadoop. Производительность заметна при интерактивной обработке информации и задачах с низкой задержкой.</p><p><b>Отказоустойчивость. </b>Как и Hadoop, Spark устойчив к сбоям за счет распределенного хранения и обработки информации.</p><p><b>Универсальность. </b>Spark подходит для разных видов обработки информации: пакетной, потоковой, SQL-запросов, машинного обучения и графовых алгоритмов.</p><p><b>Интерактивность. </b>Благодаря производительности, с помощью Спарка можно анализировать информацию в реальном времени.</p><h2>Hadoop vs Spark: сравнение и различия</h2><p>Оба инструмента предназначены для работы с массивами информации, но их подходы и возможности существенно различаются.</p><h3>Производительность</h3><p>Hadoop был создан как решение для распределенной обработки информации, позволяющее разделить нагрузку между множеством серверов. Spark же появился позже как ответ на ограничения Hadoop, предлагая более быструю и гибкую альтернативу пакетной обработке.</p><p>Hadoop эффективен для пакетной обработки больших данных, но не отличается высокой скоростью из-за постоянного обращения к внешнему хранилищу. Это делает его подходящим для задач, не требующих мгновенного отклика, например, для анализа ежемесячных отчетов.</p><p>Спарк ориентирован на обработку в реальном времени. Он копирует информацию в оперативную память, что значительно ускоряет процесс. Такой подход позволяет Spark превосходить Hadoop как в простых, так и в сложных операциях.</p><p><b>Hadoop</b>:</p><ol><li>Записывает промежуточные результаты на диск, что замедляет выполнение задачи.</li><li>Эффективен для пакетной обработки, когда время выполнения не критично.</li><li>Предпочтительнее для обработки данных, которые не помещаются в память кластера.</li></ol><p><b>Spark</b>:</p><ol><li>Хранит промежуточные результаты в памяти, минимизируя операции ввода-вывода.</li><li>Использует направленный ациклический граф (DAG) для оптимизации задач.</li><li>До 100 раз быстрее Hadoop MapReduce, когда данные помещаются в память.</li></ol><h3>Программные модели</h3><p>Основа Hadoop — собственная распределенная файловая система HDFS, которая разбивает массивы данных на мелкие блоки и распределяет их по кластеру. Спарк не имеет встроенной файловой системы, поэтому использует HDFS Hadoop для хранения и управления базой.</p><p><b>Hadoop</b>:</p><ol><li>Двухэтапная модель map и reduce.</li><li>Сложно реализовывать алгоритмы с несколькими этапами обработки данных.</li></ol><p><b>Spark</b>:</p><ol><li>Более гибкая модель с использованием Resilient Distributed Datasets (RDD) и DataFrame API.</li><li>Поддерживает функциональное программирование, что упрощает написание итеративных алгоритмов.</li></ol><p>Hadoop изначально разрабатывался с учетом высоких требований к безопасности и включает функции шифрования и контроля доступа. Spark имеет ограниченные встроенные механизмы защиты и требует дополнительных мер безопасности при развертывании.</p><h3>Поддержка различных типов данных и возможностей машинного обучения</h3><p>Функционал Spark в обработке данных гораздо шире, чем у Hadoop.</p><p><b>Hadoop</b>:</p><ol><li>Поддержка структурированных данных через Hive.</li><li>Обработка неструктурированных данных через MapReduce.</li><li>Ограниченная поддержка потоковых данных.</li><li>Ограниченная поддержка графовых данных.</li><li>Работа с CSV, JSON через Hive.</li><li>Нет встроенной библиотеки машинного обучения.</li><li>Ограниченный набор алгоритмов ML через внешние инструменты.</li><li>Ограниченные возможности интерактивного анализа данных.</li><li>Обработка текста через MapReduce.</li><li>Ограниченные возможности анализа графов.</li><li>Проблемы с реализацией алгоритмов машинного обучения.</li></ol><p><b>Spark</b>:</p><ol><li>Поддержка структурированных данных через Spark SQL.</li><li>Обработка неструктурированных данных через RDD API.</li><li>Полная поддержка потоковых данных через Spark Streaming.</li><li>Полная поддержка графовых данных через GraphX.</li><li>Работа с CSV, JSON, Parquet и другими форматами через Spark SQL.</li><li>Встроенная библиотека машинного обучения MLlib.</li><li>Широкий набор алгоритмов ML в MLlib.</li><li>Широкие возможности интерактивного анализа через Spark Shell.</li><li>Обработка текста через RDD API и MLlib.</li><li>Реализованы алгоритмы PageRank, Connected Components, Shortest Paths.</li><li>Относительно простая реализация сложных алгоритмов ML.</li></ol><h2>Интеграция Hadoop и Spark</h2><p>Платформы интегрируются вместе на проектах, где необходимо хранить данные долговременно и быстро их обрабатывать:</p><ul><li>HDFS используется как основное файловое хранилище, предоставляя масштабируемую инфраструктуру для хранения информации.</li><li>Spark обрабатывает и трансформирует данные в реальном времени.</li><li>YARN распределяет вычислительные мощности между платформами.</li></ul><p>Расширить функционал системы можно при помощи следующих инструментов:</p><ul><li><b>Apache Hive</b> — позволяет выполнять SQL-подобные запросы к данным, хранящимся в HDFS, используя Спарк в качестве движка.</li><li><b>Apache Kafka</b> — система обмена сообщениями, часто используемая вместе со Spark Streaming для обработки в реальном времени.</li><li><b>Apache HBase</b> — NoSQL на основе HDFS, которая может быть использована совместно со Спарком для быстрого доступа к данным.</li></ul><p>Чтобы выбрать оптимальную архитектуру системы и компоненты, нужно определить требования и цели проекта. Например, если требуется обрабатывать потоковые данные, то помимо Hadoop и Spark понадобиться Apache Kafka.</p><p>Следующий этап — планирование инфраструктуры. Необходимо рассчитать объемы данных, которые будут храниться в HDFS, и спроектировать кластер. Нужно выделить достаточно ресурсов для процессов Спарка, учитывая пиковые нагрузки.</p><h2>Шаг 1. Определите источники данных и их характеристики</h2><p>Составьте список всех источников данных, которые будут загружаться в HDFS. Для каждого источника выясните:</p><ul><li>формат (CSV, JSON, Avro, текстовые логи),</li><li>частоту поступления (раз в час/день/неделю, непрерывный поток),</li><li>объем, поступающий за один период,</li><li>ожидаемый рост в будущем.</li></ul><p><b>Пример</b>:</p><p>Есть 3 источника данных об активности пользователей на сайте, о покупках и логи сервера приложений. Данные поступают каждый день в формате JSON, со средним объемом 5 ГБ, 10 ГБ и 20 ГБ соответственно. Ожидаемый ежегодный прирост — 20%.</p><h2>Шаг 2. Определите время хранения данных</h2><p>Решите, как долго хранить каждый тип данных, исходя из требований бизнеса. Иногда достаточно хранить только свежие данные за последний месяц.</p><p><b>Пример</b>:</p><p>Решили хранить данные об активности и покупках за последние 2 года, а логи сервера — за 6 месяцев.</p><h2>Шаг 3. Рассчитайте общий объем сырых данных</h2><p>Для каждого источника рассчитайте ожидаемый объем данных за требуемый период хранения. Учитывайте ожидаемый рост.</p><p><b>Пример</b>:</p><ul><li>Активность: 5 ГБ × 365 дней × 2 года × 1.2 (прирост 20% в год) = 4.38 ТБ</li><li>Покупки: 10 ГБ × 365 дней × 2 года × 1.2 = 8.76 ТБ</li><li>Логи: 20 ГБ × 182 дня × 1.1 (за полгода прирост около 10%) = 4 ТБ</li><li>Итого сырых данных: 4.38 + 8.76 + 4 = 17.14 ТБ</li></ul><h2>Шаг 4. Учтите репликацию</h2><p>По умолчанию HDFS хранит 3 копии каждого блока данных для обеспечения отказоустойчивости. Поэтому оценку объёма данных нужно умножить на коэффициент репликации.</p><p><b>Пример</b>:</p><p>С учетом репликации потребуется 17.14 ТБ × 3 = 51.42 ТБ</p><h2>Шаг 5. Добавьте пространство для промежуточных данных</h2><p>В процессе обработки данных в Hadoop создаются временные файлы, результаты ETL-процессов, агрегаты. Нужно зарезервировать под них дополнительное пространство — обычно 20-30% от объема сырых данных.</p><p><b>Пример</b>:</p><p>Добавляем 30% к оценке: 51.42 ТБ × 1.3 = 66.85 ТБ</p><h2>Шаг 6. Спланируйте разделение по папкам</h2><p>Для удобства управления данными в HDFS их нужно разделить по папкам — например, по типам, по бизнес-доменам. Примерная структура:</p><ul><li>/data/raw/,</li><li>/data/processed/,</li><li>/data/tmp/,</li><li>/user/,</li><li>/apps/.</li></ul><p>Это позволит выставлять разные политики хранения для разных типов данных, ограничивать права доступа.</p><p>В HDFS планируется разместить около 66.85 ТБ данных с учетом двухлетнего срока хранения, ожидаемого роста, репликации и промежуточных сведений. На основе этой оценки можно принимать решения о конфигурации кластера. В реальных проектах могут быть и другие факторы, влияющие на расчеты — например, сжатие больших данных, нагрузка на кластер.</p><h2>Пример проекта с большими данными на Hadoop и Spark</h2><p>Предположим, что есть большой набор данных о продажах в сети розничных магазинов. Наша задача — проанализировать собранные сведения, чтобы получить бизнес-инсайты. Будем использовать HDFS для хранения информации, а Spark — для их обработки.</p><p>Сначала загрузим датасет в HDFS. Информация о продажах содержится в CSV-файле sales_data.csv. Загрузим его в HDFS с помощью bash-команды:</p><p>Пример кода на PySpark для анализа данных из sales_data.csv:</p><p>Скрипт создает сессию Spark с конфигурацией для работы с HDFS, читает данные из CSV-файла. Далее запускается 3 вида анализа:</p><ul><li>Расчет общих продаж по категориям товаров.</li><li>Определение средней цены продукта по брендам.</li><li>Выявление ТОП-5 продуктов по количеству продаж.</li></ul><p>В конце скрипт выводит результаты анализа на экран и сохраняет их в HDFS в формате CSV.</p><h2>Заключение</h2><p>Hadoop и Spark открывают огромные возможности для работы с большими данными, но их внедрение — это непросто. Каждый проект уникален, и опыт использования этих технологий может сильно различаться.</p><p>А вы уже использовали Hadoop и Spark на своих проектах?</p><p>Поделитесь опытом в комментариях:</p><ul><li>Какие задачи вы решали с помощью этих инструментов?</li><li>С какими трудностями столкнулись при внедрении?</li><li>Какие недостатки обнаружили?</li></ul><p>Ваши истории будут очень полезны для тех, кто только начинает изучать Hadoop и Spark.</p>]]></content:encoded>
    </item>
    <item>
      <title>Как быстро и эффективно работать с большими JSON-файлами</title>
      <link>https://tproger.ru/articles/kak-bystro-i-effektivno-rabotat-s-bolwimi-json-fajlami</link>
      <comments>https://tproger.ru/articles/kak-bystro-i-effektivno-rabotat-s-bolwimi-json-fajlami?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Лена Капаца]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-bystro-i-effektivno-rabotat-s-bolwimi-json-fajlami</guid>
      <description><![CDATA[<p>Как работать с большими JSON файлами. Показываем основные способы работы с Big JSON и возможные проблемы. Рассматриваем пошаговую инструкцию ✔ Tproger
</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-bystro-i-effektivno-rabotat-s-bolwimi-json-fajlami">Как быстро и эффективно работать с большими JSON-файлами</a>»</p>]]></description>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[JSON]]></category>
      <category><![CDATA[Redis]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 12 Aug 2024 15:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Разработчики используют API каждый день, и подавляющее их число отдает данные в виде JSON-массивов, будь то логи бота или резюме кандидатов с площадок по поиску работы. С небольшими файлами.json учат обращаться на многих курсах программирования, но что делать, если объем такого вывода становится некомфортно большим? Или вы регулярно «упираетесь» в ошибки, вызванные разнородной структурой элементов? В этой статье мы познакомим вас с тремя решениями, которые помогут эффективно работать с большими JSON файлами.</p><p>Если вы только-только начали изучать способы хранения, знания JSON можно освежить <a href="https://tproger.ru/articles/chto-takoe-json-vvedenie">здесь</a>.</p><h2>Способ первый: параллельная обработка</h2><p>Классическое решение, задействующее навыки параллелизации. К примеру, если признак name каждого элемента требует обновления:</p><p>Мы можем задать две функции. Первая из них добавляет значению name префикс Test:</p><p>А вторая пушит обновление:</p><p>В итоге мы распараллеливаем запуск этих функций с помощью asyncio:</p><h2>Способ второй: пакетная обработка в binary</h2><p>В комьюнити Hadoop и Spark (для хранения больших данных) особое признание обрел формат Parquet. Когда речь идет об огромных объемах информации, удобство ее обработки превалирует над читаемостью. Здесь вообще рекомендую избегать подключения pandas и перевода в человекочитаемый формат в промежутке.</p><p>Такой код:</p><ol><li>«Заморозит» вашу программу, если файл слишком большой;</li><li>Не учитывает массивы с меняющейся структурой.</li></ol><p>А до этого RAM вообще может закончится на шаге конвертации JSON в датафрейм.</p><p>В такой ситуации поможет библиотека ijson:</p><p>К примеру, конверсия кортежа в binary:</p><p>Превратит числа вот в такую компактную и быстродейственную абракадабру:</p><h2>Способ третий: перейти в другой формат</h2><p>На курсах повышения квалификации нашу группу познакомили с Redis — альтернативой классическим базам вроде PostgreSQL. Так здорово осознавать, что до тебя немало людей уже отстрадались на ниве JSON и даже создали целое решение, «бьющее» самые распространенные проблемы — разнородность элементов массива, вложенные узлы.</p><p>Представьте, сколько энергии потребуется даже с ChatGPT, чтобы написать скрипт на Python, который «схлопнет» до табличного состояния данные кандидатов ниже?</p><p>Пару лет назад я занималась подобным перед загрузкой логов бота в BigQuery (SQL-подобная база), а потом была вынуждена обрабатывать ситуацию «забытых» полей (они проявлялись реже, чем раз в неделю, на которой опробовали скрипт выгрузки). Это приводило к необходимости обновлять схему таблицы, заниматься перезаливом и в целом фрустрироваться ситуацией.</p><p>Теперь понимаю: лучший способ сократить мороку при обращении с массивами — отойти от формата строго заданной структуры как можно раньше. Redis буквально создан для этого. В подгружаемом массиве через месяц появился экземпляр кандидата с новым полем portfolio? «Редиска» положит к себе и такое, причем без множественных ошибок. Захотите в дальнейшем использовать данные таблично? Вычитайте сет с помощью самописной функции:</p><figure><img src="https://media.tproger.ru/user-uploads/79101/2024-08-11/41302dc2-592a-4eae-bfd9-03a029629440.png" alt="Методы работы с Big JSON" /></figure><p>И что немаловажно, данные хранятся в оперативной памяти сервера, что ускоряет обращение с ними, даже в случае с большими порциями. Если ваша компания, конечно, не испытывает проблем с масштабируемостью.</p><p>Приятный бонус: логика сета (это аналог таблицы в базе) подразумевает уникальные значения. То есть очистка от повторений будет произведена автоматически. И тут ощущаются спасенные человекочасы.</p><figure><img src="https://media.tproger.ru/user-uploads/79101/2024-08-11/958b52d3-0efd-441c-a7a7-f6d27159d2a7.jpg" alt="Как работать с большими JSON файлами" /></figure><p>Многие провайдеры облачных серверов предлагают преднастроенный Redis, который за 5-10 минут встанет из-под Docker-контейнера, и цены на такие услуги стремятся к тем же минимумам, что и голый Ubuntu на миникалках (300 рублей в месяц против 130).</p><p>Среди недостатков «редиски» отмечу, что переход от таблиц к сетам может вызвать у разработчика с информационной перегрузкой дополнительный стресс: документация весьма непростая и перестроиться на нетабличное восприятие поначалу потребует много энергии. Но тут очень здорово помогает ChatGPT.</p><h2>Заключение</h2><p>Если вы дорасли до проектов с массивными объемами данных, это уже прекрасно. Порой стоит позволить себе наошибаться при обращении с ними, пока не подберете наилучшее для ситуации решение. ijson немного сложнее поддерживать, Redis плохо подходит новичкам, asyncio тоже не идеален. В каждом проекте свои тонкости — они и определят, какое из решений оптимальное.</p>]]></content:encoded>
    </item>
    <item>
      <title>В чём разница между Data Scientist, Data Analyst и Data Engineer</title>
      <link>https://tproger.ru/articles/v-chyom-raznica-mezhdu-data-scientist--data-analyst-i-data-engineer</link>
      <comments>https://tproger.ru/articles/v-chyom-raznica-mezhdu-data-scientist--data-analyst-i-data-engineer?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Дух айтишной эмо школы]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/v-chyom-raznica-mezhdu-data-scientist--data-analyst-i-data-engineer</guid>
      <description><![CDATA[<p>Англоязычный блогер Daniel Dan сравнил должностные роли в мире данных: Data Scientist, Data Analyst и Data Engineer. </p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/v-chyom-raznica-mezhdu-data-scientist--data-analyst-i-data-engineer">В чём разница между Data Scientist, Data Analyst и Data Engineer</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Работа]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 25 Jan 2024 11:09:38 GMT</pubDate>
      <content:encoded><![CDATA[<p>Англоязычный блогер Daniel Dan сравнил должностные роли в мире данных: Data Scientist, Data Analyst и Data Engineer. Среди самых популярных профессий, связанных с данными, эти три являются наиболее востребованными. В ролике обсудили их основные обязанности, различия, сходства, навыки и, наконец, требования с возможностями карьерного роста.</p><p>О чём Дэниель говорит в ролике:</p><ol><li>Данные играют ключевую роль в современном мире, и вокруг них строятся важные решения и планы.</li><li>Три основные профессии, связанные с данными, это: data scientist (специалист по данным), data analyst (аналитик данных) и data engineer (инженер по данным).</li><li>Data scientist использует статистику, машинное обучение и навыки программирования для анализа сложных данных, выявления тенденций и прогнозирования будущего.</li><li>Чтобы стать data scientist, необходимо овладеть продвинутой статистикой, машинным обучением и обработкой данных.</li><li>Data analyst собирает, очищает и анализирует данные, помогая бизнесу принимать обоснованные решения, и может начать карьеру с входного уровня.</li><li>Для работы data analyst важны знания в области статистики, умение работать с данными, моделирование и составление отчетов.</li><li>Data engineer отвечает за создание и управление системами, которые используют data scientists и analysts, обеспечивая сбор, хранение и анализ данных.</li><li>Для карьеры data engineer требуются технические навыки, знание API, понимание работы с данными и поддержание инфраструктуры данных.</li><li>Все три роли связаны с обработкой данных и их использованием, но каждая имеет свои уникальные задачи и навыки.</li><li>Эти профессии востребованы во многих отраслях, включая здравоохранение, технологии, электронную коммерцию и финансы.</li><li>Data scientists требуются более глубокие знания программирования и статистики, в то время как data analysts больше ориентированы на математику и бизнес, а data engineers – на компьютерные науки и инженерию.</li><li>Выбор между этими профессиями зависит от личных навыков и интересов, и важно обладать аналитическими способностями и умением решать проблемы.</li><li>Коммуникативные навыки также критичны для представления результатов анализа руководству.</li><li>Существует множество онлайн-ресурсов и курсов для обучения data science, data analytics и data engineering.</li><li>Заработная плата специалистов по данным в США варьируется: data analysts зарабатывают более $120,000 в год, data scientists – до $190,000, а data engineers – около $190,000, при этом фрилансеры в этих областях имеют различные ставки в час.</li></ol><p>Ниже — транскрибированный перевод ролика на русском языке.</p><p>Хорошо, давайте поговорим о чем-то важном – о данных. В современном мире все вращается вокруг них.</p><p>Любое умное решение или план сводится к цифрам. В настоящее время существуют три основных профессии, связанные с данными – data scientist, data analyst и data engineer. Но в чем их различия и какие навыки нужны, чтобы стать одним из них? Меня зовут Даниэль, и сегодня мы собираемся погрузиться в каждую из этих профессий и выяснить, что делает их уникальными? И если вы хотите узнать больше о этих профессиях и навыках, которые они включают, я оставил несколько полезных ссылок в описании.</p><p>Не стесняйтесь посмотреть их после просмотра этого видео. Ладно, люди, приступим. Data scientist против data analyst против data engineer. Кто они? Чаще всего я замечаю, что люди не очень уверены, в чем заключаются эти профессии. Некоторые даже думают, что они все одинаковые.</p><p>Но это не так, ребята. Поэтому прежде чем сравнивать эти три роли, давайте что-то проясним. Что это за профессии и какие задачи они включают?</p><h2>Data scientists</h2><p>Эта профессия занимается изучением сложных цифровых данных, расшифровкой их сложностей. Они используют статистику, машинное обучение и навыки программирования, чтобы понять, что данные пытаются нам сообщить. Это похоже на решение головоломок в данных, выявление тенденций и прогнозирование будущих событий.</p><p>Теперь вы можете спросить, что мне нужно, чтобы получить эту роль? Ну, подумайте о том, чтобы получить опыт и овладеть навыками, такими как продвинутая статистика, машинное обучение и обработка данных. Основные задачи для этой роли обычно включают очистку беспорядочных данных, работу с моделями машинного обучения, выявление тенденций в данных, делание прогнозов и докладывание о своих открытиях своему руководству. Хорошо, теперь давайте посмотрим на data analysts. Ребята, если вы планируете работать с данными и хотите начать с начального уровня, data analyst – это ваш выбор.</p><h2>Data analysts</h2><p>Data analysts собирают, очищают и анализируют данные, чтобы помочь бизнесу принимать умные решения. Представьте их как рассказчиков, которые превращают данные в понятные отчеты и красивые визуализации. И если вы хотите стать data analyst, вам нужно всего лишь бакалаврский диплом и хорошее понимание статистики. Но на самом деле, ребята, сегодня формальное образование не является обязательным. Потому что важнее ваши навыки. Просто убедитесь, что у вас есть некоторые знания о работе с данными, моделировании и отчетности.</p><p>И вы в порядке. Понимание бизнес-аспектов было бы большим плюсом. Вот что обычно делают data analysts. Сбор данных из разных источников. Очистка и организация данных.</p><p>Анализ данных для выявления тенденций. Создание отчетов и визуализаций и деление своих результатов с другими. Наконец, давайте поговорим о data engineers.</p><h2>Data engineers</h2><p>Data engineer настраивает и управляет системами для data scientists и analysts.</p><p>Они являются архитекторами за кулисами. Они убеждаются, что данные собираются, хранятся и анализируются без сбоев. Их работа включает создание и управление потоками данных, обеспечение безопасного и эффективного хранения данных. Так что, чтобы стать data engineer, у вас обычно есть два варианта. Получить степень магистра в области данных, получить опыт работы и вырасти из data analyst. Некоторые ключевые навыки, которые вам понадобятся, это хорошее техническое понимание, умение создавать и использовать API и понимание потоков данных и обеспечение их бесперебойной работы.</p><p>Задачи data engineering обычно включают управление потоками данных, обеспечение безопасного и организованного хранения данных, обеспечение качества данных и поддержание инфраструктуры данных. Так что, ребята, как вы видите, некоторые повседневные задачи, которые выполняют эти профессионалы, похожи. Конечно, есть определенное пересечение.</p><p>Нет сюрприза. Все эти роли связаны с работой с данными и деланием их полезными. Еще одна важная вещь, которую я хотел бы добавить, это то, что эти роли востребованы во многих отраслях. Например, сферы, такие как здравоохранение, технологии, электронная коммерция и финансы, нуждаются в компетентных data scientists, analysts и engineers. Ладно, теперь вы знаете, чем занимаются data scientists, data analysts и data engineers.</p><h2>Навыки для всех трёх профессий</h2><p>Теперь давайте ближе рассмотрим эти роли, чтобы увидеть, какие навыки им нужны для работы. Data scientists и data analysts имеют много общих навыков, но data scientists углубляются глубже. Они могут создавать базы данных и объединять информацию из различных источников.</p><p>Ребята, важно помнить, что в отличие от data analysts, data scientists нужны продвинутые навыки программирования, им нужно хорошо понимать языки программирования, такие как Python, C++ или Java, плюс некоторая экспертиза в SQL. Другие навыки data scientists включают машинное обучение и глубокое обучение, data mining, Apache Spark, Apache Hive, Apache Peak и Hadoop, визуализацию данных и бизнес-аналитику. Data analysts.</p><p>Вот суть, ребята. Аналитики данных приходят из самых разных сфер. Традиционно аналитик данных может иметь степень в математике или информатике, но в наши дни они могут приходить из любой области, которая имеет дело с цифрами, включая бизнес или естественные науки, поэтому становление аналитиком данных не строго привязано к определенному образованию, это скорее о ваших навыках работы с данными и их интерпретации, поэтому если вы планируете стать аналитиком данных, вам может захотеться изучить навыки, такие как хранение данных, базовое программирование, скриптование и статистика, базы данных и SQL, Excel и инструменты визуализации данных.</p><p>Ладно, люди, а теперь давайте поговорим о навыках, необходимых для становления инженером данных. Инженеры данных. Они похожи на архитекторов и хранителей мира данных. Их основная работа связана со системами баз данных. Исходя из этого, их набор навыков включает продвинутое программирование, хранение данных и ELT, глубокие знания систем баз данных, Hadoop, MapReduce, Hive, поток данных и архитектуру данных с созданием конвейеров. Я знаю, друзья, до сих пор мы видели много сходств между этими тремя профессиями. Но теперь давайте поговорим о том, что делает их уникальными.</p><h2>В чём отличия между специалистами</h2><p>Различия. Хорошо, давайте разберем различия между учеными по данным, аналитиками данных и инженерами данных. Ученые по данным похожи на решателей проблем в мире данных. Они погружаются в сложные вопросы и используют данные для прогнозирования. Аналитики данных – это детективы данных. Они собирают, очищают и анализируют данные, чтобы помочь бизнесу принимать более умные решения. Инженеры данных – это технические строители. Они создают и поддерживают системы, которыми пользуются ученые по данным и аналитики для работы с данными.</p><p>В дополнение к этому, есть некоторые дополнительные детали. Ученые по данным склонны к статистике и машинному обучению. Аналитики склонны к математике и бизнесу. А инженеры имеют крепкий фундамент в информатике и инженерии.</p><p>Итак, как вы можете видеть, друзья, у каждой роли есть свои суперспособности в мире данных. Как выбрать? Хорошо, эти работы имеют много общего. Они все имеют дело с данными и цифрами. Но вы можете спросить, какую из них выбрать? Ну, друзья, выбор правильной роли зависит от ваших навыков и интересов. Если вы любите использовать данные для решения проблем и прогнозирования, выбирайте ученого по данным. Если вам нравится копаться в данных, чтобы помочь бизнесу принимать умные решения, выбирайте аналитика данных. Для тех, кто любит идею создания и поддержания систем данных, выбор – инженер данных. Тем не менее, не забывайте, друзья, что независимо от выбора, сильные аналитические и проблемные навыки играют важную роль. И, конечно, не забывайте о своих навыках коммуникации.</p><p>Потому что умение объяснять и представлять свои результаты руководству критично. Сегодня существует множество ресурсов онлайн для изучения науки о данных, анализа или инженерии. И существует множество курсов и программ сертификации, которые могут предложить ценные знания. Я рассмотрел многие из них на своем канале, так что не стесняйтесь заглянуть. Кроме того, я сделал три отдельных видеоролика о путях в науку о данных, аналитику данных и инженерию данных.</p><h2>Разница в зарплатах</h2><p>Вы также можете найти их на моем канале. Ладно, а теперь давайте поговорим о деньгах. Если мы посмотрим на данные, предоставленные Indeed, опытные внутренние аналитики данных в Соединенных Штатах могут зарабатывать более 120 000 долларов в год. Ученый по данным может зарабатывать до 190 000 долларов в год. И инженер данных зарабатывает примерно столько же, сколько ученый по данным, около 190 000 долларов.</p><p>Теперь, если речь идет о фрилансерах, аналитики данных могут зарабатывать от 36 до 45 долларов в час. Фрилансеры-ученые по данным зарабатывают от 25 до 50 долларов в час. И зарплата фрилансеров-инженеров данных составляет около 48-64 долларов в час.</p><p>Итак, как вы видите, друзья, ученые по данным и инженеры данных обычно зарабатывают больше, чем аналитики данных. Это потому, что им требуются более серьезные технические навыки. Ладно, люди, это завершает наше сравнение между аналитиком данных, ученым по данным и инженером данных. Не стесняйтесь делиться своими мыслями в комментариях. И если вы хотите улучшить свои навыки в области анализа данных, науки о данных или инженерии данных, я подготовил для вас лучшие ресурсы.</p><p>https://www.youtube.com/@Daniel-Dan.</p>]]></content:encoded>
    </item>
    <item>
      <title>МТС запустила приложение «Защитник» — антиспам-решение доступно абонентам любых российских операторов</title>
      <link>https://tproger.ru/articles/mts-zapustila-prilozhenie-zashhitnik-antispam-rewenie-dostupno-abonentam-lyubyh-rossijskih-operatorov-erid-ljn8kgaht</link>
      <comments>https://tproger.ru/articles/mts-zapustila-prilozhenie-zashhitnik-antispam-rewenie-dostupno-abonentam-lyubyh-rossijskih-operatorov-erid-ljn8kgaht?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[МТС]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/mts-zapustila-prilozhenie-zashhitnik-antispam-rewenie-dostupno-abonentam-lyubyh-rossijskih-operatorov-erid-ljn8kgaht</guid>
      <description><![CDATA[<p>«Защитник» определяет, кто звонит пользователю, даже если номера нет в телефонной книге. А также позволяет пожаловаться на спам в два клика.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/mts-zapustila-prilozhenie-zashhitnik-antispam-rewenie-dostupno-abonentam-lyubyh-rossijskih-operatorov-erid-ljn8kgaht">МТС запустила приложение «Защитник» — антиспам-решение доступно абонентам любых российских операторов</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Приложение]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 24 Jan 2024 09:39:15 GMT</pubDate>
      <content:encoded><![CDATA[<p>Чтобы пользоваться «Защитником», не нужно быть абонентом МТС. Приложение бесплатное, не содержит рекламы и доступно клиентам других операторов связи России.</p><p>В магазинах приложений оно заменит приложение «МТС Кто звонит». Скачать «Защитник» можно в <a href="https://play.google.com/store/apps/details?id=com.mts.who_calls">Google Play</a> и <a href="https://apps.apple.com/ru/app/id1449599084">AppStore</a>.</p><p>Рассмотрим подробнее функционал приложения.</p><h2>Обозначает «пользу» звонка цветом</h2><p>Система показывает пользователю и сохраняет в истории вызовов название компании, а также помечает вызовы цветом:</p><ul><li><b>зелёным</b> — надёжные;</li><li><b>жёлтым</b> — возможно, спам;</li><li><b>красным</b> — нежелательные.</li></ul><p>Название компании высвечивается, если её номер есть в справочниках и открытых источниках.</p><h2>Делит спам-звонки на категории</h2><p>Каждому звонку присваивается категория спама, например: «Юридические услуги», «Коллекторы», «Медицина и красота», «Страхование» и т. д. Анализ выполняется на основе технологий Big Data МТС.</p><p>В будущем в приложении можно будет выбрать категории спам-звонков, которые будет принимать голосовой бот. После этого сервис пришлёт полную расшифровку входящего вызова.</p><p>Это поможет пользователям оставить только нужные для себя категории, чтобы, к примеру, не пропустить доставку или звонок от таксиста.</p><h2>Разрешает жаловаться на спам</h2><p>Пожаловаться на нежелательный звонок можно в два клика. При этом не обязательно копировать номер и переносить его в «Защитник» (хотя такая опция тоже есть).</p><p>Достаточно смахнуть строку в журнале вызовов влево и нажать на кнопку с восклицательным знаком. Система проверит и заблокирует номер, если это правда спам.</p><p><i>Как часто вам звонят спамеры и как спасаетесь от нежелательных звонков? Делитесь опытом в комментариях!</i></p><p><i>Реклама ПАО «МТС», erid: LjN8KGAHt</i></p>]]></content:encoded>
    </item>
    <item>
      <title>Как работает обучение без учителя</title>
      <link>https://tproger.ru/articles/kak-rabotaet-obuchenie-bez-uchitelya</link>
      <comments>https://tproger.ru/articles/kak-rabotaet-obuchenie-bez-uchitelya?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Вика Овсянникова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-rabotaet-obuchenie-bez-uchitelya</guid>
      <description><![CDATA[<p>Метод обучения без учителя помогает работать с неразмеченными данными. Разбираемся, какие алгоритмы использовать для решения таких задач.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-rabotaet-obuchenie-bez-uchitelya">Как работает обучение без учителя</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Шпаргалки]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 26 Oct 2023 12:46:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>Что такое обучение без учителя и почему оно так называется? Какие задачи можно решить с помощью этих методов? А какими алгоритмами? Есть ли у него недостатки? Разбираемся как на банковских примерах, так и на более приземленных вещах — столах, стульях и шкафах.</p><h2>Какие типы машинного обучения бывают и чем они друг от друга отличаются</h2><p>Есть четыре типа машинного обучения:</p><ul><li>с учителем;</li><li>без учителя;</li><li>с подкреплением;</li><li>с частичным привлечением учителя.</li></ul><p>Они отличаются наборами данных, на которых модель обучается. Понять разницу между типами машинного обучения можно через аналогию. В комнате стоят стулья, столы, шкафы, мы ставим задачу определить, где что. При обучении с учителем мы показываем модели: это стул, а это — стол или шкаф. То есть датасет размеченный, информация о данных известна, мы точно знаем, какой результат хотим от них получить. За счет разметки модель понимает, как выглядят предметы, запоминает разные типы.</p><p>При обучении без учителя мы просто запускаем модель в большую комнату, и она самостоятельно изучает, какие объекты в ней есть. Спустя время она без наших подсказок понимает, какой объект перед ней находится. Данные не структурированы, о них практически ничего не известно, нет задачи получить конкретный результат. Мы хотим извлечь из данных новую информацию и увидеть в них закономерности.</p><p>При обучении с частичным привлечением учителя мы запускаем модель в комнату и выборочно называем ей некоторые предметы. Ей предстоит самостоятельно изучить большую часть объектов и понять, как они называются.</p><p>При обучении с подкреплением мы запускаем модель в темное помещение. Она взаимодействует со средой (environment), собирает сведения о ней. В роли «разметки» здесь выступает награда (reward). Это сигнал, насколько хорошо алгоритм справляется с поставленной ему задачей. Например, за каждый найденный стул вы получаете +1, а за каждый удар в стену вам прилетает -1. Она выдаётся после каждого шага взаимодействия со средой.</p><h2>Для каких задач используют обучение без учителя</h2><p>Выделяют четыре большие группы: кластеризацию, поиск аномалий, поиск ассоциаций и уменьшение размерности. Рассмотрим каждую подробнее и разберем, какие для них нужны алгоритмы.</p><h3>Кластеризация</h3><p>Это задача разделения данных на кластеры по общим признакам.</p><p>Классический пример — сегментация пользователей приложения банка. Например, пользователи часто покупают товары в спортивных магазинах. Можно выделить их в отдельную группу, используя транзакции как признак. А можно посмотреть, как часто пользователи заходят в приложение, сформировав из них «временные кластеры».</p><p>Другой пример — классификация клиентских обращений. По признакам, которые выделит модель, можно кластеризовать обращения клиентов на разные группы: жалобы, благодарности и просьбы о помощи.</p><p>Алгоритмов для этого класса задач много, рассмотрим четыре самых популярных.</p><h4>Алгоритм k-средних (k-means)</h4><p>Буква k в названии отвечает за количество выделенных центроидов — точек, которые формируют вокруг себя кластер. Удобнее, если они совпадают с точками выборки данных, но необязательно.</p><p>К примеру, возьмем значение k, равное 5. Дальше для каждой точки датасета посчитаем расстояние до каждого из пяти кластеров. Наименьшее расстояние от точки до центроида позволит модели предположить, что объект принадлежит к этому кластеру.</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-26/319249d2-e81e-4931-980f-b3dbc9b322e2.jpeg" alt="" /></figure><p>Это итеративный метод, так как после формирования кластеров координаты центроида должны быть пересчитаны, так как центральный элемент кластера может измениться после добавления элементов. Центроид может сместиться, поэтому в следующих итерациях алгоритма мы будем пересчитывать центры кластеров до тех пор, пока координаты центроида не перестанут меняться. Так, он будет представлять усредненное описание всех параметров кластера.</p><p>Чтобы оценить качество работы алгоритма, мы используем метрику WCSS (within-cluster sum of squares) — cумму квадратов внутрикластерных расстояний до центра кластера. Основная идея, лежащая в основе k-means, заключается как раз в определении таких кластеров, чтобы отклонения внутри минимальны.</p><p>У алгоритма есть ограничение: чаще всего мы не знаем, сколько кластеров предполагается. Можно последовательно брать разные k: 3, 5, 7, 9 и так далее — и строить график в координатах WCSS(k). По нему мы можем понять, какое k оптимальнее взять для задачи. До точки k = 3 наблюдается быстрое уменьшение отклонения, но потом скорость падения снижается, откуда мы делаем вывод, что k = 3 было точкой оптимума.</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-26/4d79114d-940e-437d-b90a-9bf847fdd6cb.jpeg" alt="" /></figure><h4>Иерархическая кластеризация</h4><p>Изначально количество кластеров совпадает с количеством объектов, то есть каждый объект данных представляет собой кластер. Похожие кластеры объединяются по повторяющимся признакам.</p><p>Алгоритм последовательно объединяет меньшие кластеры в большие — это агломеративная иерархия. Либо наоборот — дробит один большой кластер на меньшие — это разделяющая иерархия.</p><p>Определить похожесть можно с помощью метрик евклидова расстояния. Они бывают разные: манхэттенское расстояние; расстояние Чебышева; степенное расстояние.</p><h4>dbscan</h4><p>В алгоритме есть два гиперпараметра: максимальное расстояние между точками и минимальное количество точек в окрестности. Мы задаем количество соседей внутри определенного радиуса, чтобы выделить их в кластер.</p><p>dbscan также справляется с задачей детекции аномалий (о которой поговорим ниже). Так как у нас сохраняется количество соседей в радиусе, то могут оставаться «одинокие» точки, которые туда не попадают. Они являются либо выбросом, либо аномалией.</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-26/16b44b4f-a9f2-4121-a3ab-02302be3506b.png" alt="" /></figure><h4>Алгоритм гауссовой смеси</h4><p>В наборе данных выделяются гауссовы распределения, каждое из которых представляет собой единый кластер. Алгоритм используется в случае, когда наши данные имеют мультимодальное распределение, то есть имеют несколько «горбов».</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-26/9c256a62-e5c6-495e-bdcd-aa6185278351.jpeg" alt="" /></figure><h3>Поиск ассоциаций</h3><p>В этой задаче модель ищет взаимосвязи между существующими объектами.</p><p>Классический пример — взаимосвязь продуктов в корзине покупателя. Например, к молоку и яйцам рекомендательная система магазина может посоветовать взять муку. Чтобы получить такой «совет», нужно проанализировать, какие комбинации продуктов встречаются чаще всего.</p><h4>Алгоритм Apriori</h4><p>Он находит самые частые комбинации, и модель создает правила ассоциативности: когда встречаются два продукта, к ним присоединяется третий.</p><p>Для работы с алгоритмом нужно знать такие понятия.</p><ul><li>Support. Показывает минимальный порог встречаемости элемента, чтобы считаться частым.</li><li>Confidence. Как часто выделенные взаимосвязи встречаются во всех объектах во всем датасете.</li><li>Lift. Зависимость между объектами.</li><li>Conviction. Как часто утверждается, что товары связаны, хотя на самом деле взаимосвязи нет.</li></ul><h3>Уменьшение размерности</h3><p>Данные могут быть слишком взаимосвязаны между собой. В таком случае можно снизить размерность, заменив два признака на один. Особенно это актуально в больших данных, когда нужно сократить датасет и обработать меньшее количество данных.</p><p>Для этой задачи используется алгоритм PCA. Собственно, он как раз и «жертвует» каким-то некритичным количеством информации, подбирая новый признак, который будет включать в себя свойства обоих изначальных признаков.</p><h3>Поиск аномалий и выбросов данных</h3><p>Пример задачи — антифрод в банке. Модель должна определять мошеннические транзакции среди обычных и правильно на них реагировать.</p><p>При обучении с учителем не получится показать модели такую транзакцию сразу, потому что мы не знаем, как она выглядит. И, соответственно, у алгоритма этого знания тоже не будет. Поэтому когда модель встретится с фродом, то, скорее всего, либо не сможет его задетектировать, либо правильно интерпретировать.</p><p>При обучении без учителя модель может определять выбросы и аномалии. Аномалия — это принципиально новые данные, которых ещё не было в выборке, они возникают в реальном времени. Выброс — значение, редко встречающееся в наших данных.</p><h4>Изолированный лес</h4><p>В его основе лежит модель классического алгоритма ML — дерева. Случайным образом задаем предикат, если объект датасета под него подходит, он уходит по этой ветви дерева. Объекты, которые не прошли глубже по веткам, а остались на глубине первого или второго уровня можно считать выбросами. Они «изолировались».</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-26/f305f679-09d3-4507-a9fb-f45e6e4f4aa4.jpeg" alt="" /></figure><h2>Какие есть ограничения у обучения без учителя</h2><p>Во-первых, результаты не всегда интерпретируемы. Не каждому квалифицированному специалисту под силу объяснить выделившиеся закономерности.</p><p>Во-вторых, модель может ошибаться и выдавать не те корреляции, которые мы ожидали. В примере из начала статьи про комнату со стульями и столами модель может, например, выделить кластеры не по принадлежности к сущности (столы, стулья и т.д.), а по цвету: красные столы, стулья, шкафы. Да, это тоже может быть верно, у них действительно есть схожее свойство, но нам это было не нужно.</p><p>В таком случае, кстати, придется прибегнуть либо к обучению с подкреплением, либо к частичной разметке данных, чтобы хотя бы в какой-то степени показать модели, на что ей ориентироваться.</p><h2>Когда же лучше использовать обучение без учителя</h2><p>Метод обучения без учителя хорошо справляется с неразмеченными данными.</p><p>Разметка данных — это достаточно дорогой процесс. При большом количестве данных нужно нанимать асессоров, которые подготовят данные для обучения с учителем. Есть сервисы, где можно отдать данные специалистам на разметку, но за это нужно будет заплатить, подготовить тесты, по которым люди будут работать. И в конце оценить качество разметки. Если мы не хотим тратить на это ресурсы и время, то лучше использовать обучение без учителя.</p>]]></content:encoded>
    </item>
    <item>
      <title>МТС принимает заявки в бесплатную Школу аналитиков данных</title>
      <link>https://tproger.ru/articles/mts-prinimaet-zayavki-v-besplatnuyu-wkolu-analitikov-dannyh-erid-ljn8k98mi</link>
      <comments>https://tproger.ru/articles/mts-prinimaet-zayavki-v-besplatnuyu-wkolu-analitikov-dannyh-erid-ljn8k98mi?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[МТС]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/mts-prinimaet-zayavki-v-besplatnuyu-wkolu-analitikov-dannyh-erid-ljn8k98mi</guid>
      <description><![CDATA[<p>Учиться в Школе аналитиков данных можно из любой точки России, а лучшие выпускники получат работу в МТС. Успейте до 24 октября!</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/mts-prinimaet-zayavki-v-besplatnuyu-wkolu-analitikov-dannyh-erid-ljn8k98mi">МТС принимает заявки в бесплатную Школу аналитиков данных</a>»</p>]]></description>
      <category><![CDATA[Для начинающих]]></category>
      <category><![CDATA[Обучение программированию]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Карьера]]></category>
      <category><![CDATA[Обучающие курсы]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 18 Oct 2023 08:38:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>Подать заявку можно на сайте <a href="https://www.teta.mts.ru/analytics-school?utm_source=partner&amp;utm_medium=tproger&amp;utm_content=17_10&amp;utm_campaign=teta">школы</a>. Заполнение простой формы займёт меньше минуты.</p><p><b>✔ </b>Последний день приёма заявок — 24 октября.</p><p><b>✔ </b>С 25 по 29 октября нужно пройти тестирование и подготовить мотивационное письмо. Задание придёт на почту, указанную при регистрации.</p><p><b>✔ </b>Результаты отбора огласят до 2 ноября. Занятия начнутся 7 ноября.</p><p>Обучение в Школе аналитиков данных бесплатное, но все заявки проходят тщательный отбор. Отнеситесь к вступительным испытаниям серьёзно, если хотите попасть на курс.</p><h2>Как подготовиться к тестированию?</h2><p>Тестирование охватывает основы математической статистики и теории вероятностей, основы машинного обучения и программирования на Python. Подготовиться к нему можно самостоятельно по вузовским учебникам.</p><figure><img src="https://media.tproger.ru/user-uploads/73713/2023-10-17/de1946c2-8789-4276-be1d-779ee4b6b977.png" alt="" /></figure><h2>Как узнать, что я подхожу?</h2><p>Ограничений нет, ждём всех желающих. Учиться у нас могут школьники, студенты, действующие IT-специалисты и даже родители в декрете. Главное — иметь хорошую мотивацию и свободное время — от 10 часов в неделю.</p><h3>Вы подходите, если:</h3><p><b>✔ </b>знаете базовую математическую статистику и школьную математику;</p><p><b>✔ </b>имеете базовые представления о Linux;</p><p><b>✔ </b>умеете писать на любом языке программирования;</p><p><b>✔ </b>обладаете фантазией — сможете за 10 секунд придумать 10 мест, где можно применять математику в бизнесе;</p><p><b>✔ </b>искренне хотите развиваться в анализе данных, ML и IT одновременно;</p><p>✔ можете выделить 6 часов в неделю на лекции и от 4 часов — на домашние задания.</p><h2>Сколько длится обучение?</h2><p>Информации и практики много, обучение займёт 10 месяцев.</p><ul><li>Все занятия проходят в онлайне, понадобится только компьютер или ноутбук с интернетом.</li><li>Встречи с преподавателями — 2 раза в неделю. Теория и практика чередуются друг с другом.</li><li>Все полезные материалы хранятся на учебной платформе и всегда доступны.</li><li>Для работы с Big Data МТС предоставит собственный кластер.</li></ul><h3>Чему конкретно я научусь за это время?</h3><p>Получите необходимые знания и навыки для старта в профессии, даже если вы совсем новичок или пришли в аналитику больших данных из смежной области.</p><p>Самые сильные ML-разработчики смогут попасть на стажировку в МТС, пройти собеседования и присоединиться к команде МТС Диджитал.</p><figure><img src="https://media.tproger.ru/user-uploads/73713/2023-10-17/a8c10c9c-e0b7-47b3-8b24-8068af3c543f.png" alt="" /></figure><blockquote>Роль больших данных в бизнесе и других сферах жизни продолжает расти, поэтому специалисты Big Data становятся всё более востребованными на рынке. Наш курс даёт уникальную возможность получить самые актуальные теоретические знания и сразу же применять их в рамках обучения для решения реальных коммерческих кейсов. Рассчитываем, что после окончания курса все наши выпускники смогут открыть для себя новые карьерные возможности, которые позволят им заниматься одним из самых перспективных направлений в IT — анализом больших данных.</blockquote><h2>Кто будет преподавать?</h2><p>У Школы аналитиков данных выдающийся «педсовет»: разработчики, аналитики-разработчики, ML-инженеры. Эти действующие специалисты центра Big Data МТС — не только крутые теоретики, но и практики.</p><figure><img src="https://media.tproger.ru/user-uploads/73713/2023-10-17/c0734991-2f62-44c0-9084-e4c75dc0dd95.png" alt="" /></figure><p>Подать заявку на бесплатное обучение в Школе аналитиков данных можно до 24 октября. Если давно мечтали освоить востребованную профессию, но нужен был стимул — вот он!  </p><p>Будем рады, если поделитесь этим материалом с друзьями, однокурсниками, одноклассниками или коллегами — всеми, кто интересуется анализом данных и ML. Иногда случайные рекомендации решают.</p><p><i>Реклама ПАО «МТС» LjN8K98mi</i></p>]]></content:encoded>
    </item>
    <item>
      <title>Почему дата-сайентисту нужны ещё и графы</title>
      <link>https://tproger.ru/articles/pochemu-data-sajentistu-nuzhny-eshhyo-i-grafy</link>
      <comments>https://tproger.ru/articles/pochemu-data-sajentistu-nuzhny-eshhyo-i-grafy?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Вика Овсянникова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/pochemu-data-sajentistu-nuzhny-eshhyo-i-grafy</guid>
      <description><![CDATA[<p>Разбираемся, что это такое, в анализе каких данных они нужны. А также рассматриваем, в каких задачах найдётся применение теории графов.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/pochemu-data-sajentistu-nuzhny-eshhyo-i-grafy">Почему дата-сайентисту нужны ещё и графы</a>»</p>]]></description>
      <category><![CDATA[Для начинающих]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Анализ данных]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 13 Oct 2023 10:06:01 GMT</pubDate>
      <content:encoded><![CDATA[<p>На небе только и разговоров что о графах. Говорят, что их сложно и скучно учить, но зато используют в таких задачах, с которыми <a href="https://tproger.ru/articles/osnovnye-instrumenty-dlya-raboty-s-dannymi-ot-sbora-do-analiza-erid-ljn8ktdcg/">классические методы</a> <a href="https://tproger.ru/translations/top-10-python-bibliotek-dlja-data-science/">анализа данных</a> не справляются. Давайте разбираться, в каких именно и почему не стоит игнорировать графы, даже если вы новичок в Data Science.</p><h2>И что это такое — графы?</h2><p>Графы — это абстракция, которую используют для выявления связей между сущностями: множество вершин и множество рёбер, которые их соединяют. Впервые теорию графов применил Леонард Эйлер для решения задачи о Кёнигсбергских мостах. Нужно было найти такой маршрут, чтобы пройти по всем семи сооружениям только один раз и вернуться в исходную точку. С помощью теории графов Эйлер доказал, что это невозможно.</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-12/6e18f6f0-e0e3-444a-aa31-74ba4fd6a49d.png" alt="" /><figcaption>Нагляднее всего оказалось строить маршрут в виде точек (вершин), которые попарно связаны между собой путями (рёбрами). Источник: https://math.stackexchange.com/questions/1173328/eulers-solution-of-seven-bridges-of-königsberg-in-layman-terms</figcaption></figure><h2>А они вообще востребованы?</h2><p>Способов анализа структурированных данных становится недостаточно, чтобы делать глубокие предсказания. Если для расчёта спроса и предложения товаров хватит классических методов вроде статистических функций, то для рекомендаций этих товаров можно применять больше действенных методов, в том числе и графы. Поэтому их используют чаще, нежели лет пять назад.</p><p>Компании вроде Uber, Google, Pinterest <a href="https://www.assemblyai.com/blog/ai-trends-graph-neural-networks/">переходят</a> на графы, мотивируя это тем, что производительность таких методов выше, по сравнению с другими современными ИИ-архитектурами. А <a href="https://www.gartner.com/en/newsroom/press-releases/2021-03-16-gartner-identifies-top-10-data-and-analytics-technologies-trends-for-2021">по прогнозам Gartner</a> к 2025 году графы будут использоваться в 80% инноваций в области данных и аналитики по сравнению с 10% в 2021 году.</p><p>Стоит оговориться: графы всё ещё достаточно узкопрофильное направление и используют их не повсеместно. Но дополнительный скил точно не будет лишним — появится больше сфер, в которых можно работать.</p><h2>И какие задачи можно решать графами?</h2><p>Графы помогают работать с нелинейными данными, которые сложно структурировать в табличный формат и выгоднее представлять в виде связей между объектами — то есть между вершинами через рёбра. Тогда получается сетка, похожая на карту дорог.</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-12/37e1f883-7b1d-4cbe-95bd-9f0cb780a248.png" alt="" /><figcaption>Сравнение графовой и реляционной (табличной) баз данных. Источник: https://phoenixnap.com/kb/graph-database</figcaption></figure><p>Графы и нейронные сети на их основе используют, например, в биологии. С их помощью биологические сущности (белки, РНК, химические соединения) можно представить в виде «сетки», определить, как они связаны между собой, предсказать новые взаимодействия между ними или свойства.</p><p><a href="https://www.frontiersin.org/articles/10.3389/fgene.2021.690049/full">Здесь</a> можно почитать про графовые методы в биологии.</p><h3>Рекомендовать товар или друзей</h3><p>В Газпромбанке есть граф для выявления групп людей со схожими интересами. Он помогает идентифицировать паттерн поведения клиентов, исходя из которого мы предполагаем, какие приложения будут им наиболее полезны. Например, ведут они активный образ жизни, занимаются спортом — значит, порекомендуем похожие спортивные товары.</p><p>Схожая механика используется в социальных сетях и дейтинговых приложениях — для рекомендаций друзей и хранения данных, которые генерируют пользователи.</p><p>Можно обойтись и без графов: самостоятельно придумать критерии и прописать алгоритм, который будет высчитывать количество взаимодействий между людьми. Но это долго, дорого, ресурсозатратно и есть риск упустить что-то важное, но неочевидное. Графы же позволяют использовать данные сами по себе, любое взаимодействие уже даёт информацию, которую можно анализировать и потенциально применить для решения задач.</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-12/1615e071-f401-40e4-8549-b77344a23833.png" alt="" /><figcaption>С помощью графов можно быстрее сформировать и проанализировать рекомендации, а также легче их представить: два человека — узла — пообщались, то есть между ними выстроилась связь — ребро. В реляционных базах данных хранить такие сети взаимодействий неудобно.</figcaption></figure><h3>Выявлять мошенничество</h3><p>Можно построить цепочку транзакционной активности: человек А перевёл деньги человеку B, а тот — человеку C. Если в этой схеме появляется лицо, которое занесено в чёрный список, то мы идентифицируем её как фрод. То есть если в длинной цепочке переводов один из узлов замечен в мошенничестве, то стоит обратить на неё пристальное внимание.</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-12/a4412fa1-7342-4001-a67a-3281a6b69ca9.png" alt="" /></figure><p>Зачастую мошенники, когда берут кредиты и хотят оформить банкротство, чтобы их не платить, используют разные адреса, номера телефонов, паспортные данные. Или меняют их незначительно, чтобы исправления не были заметны сразу. И то, и то можно назвать подозрительной активностью.</p><p>Сложно самостоятельно просчитать наперёд и учесть в алгоритмах, что у человека сегодня одни паспортные данные, а завтра другие. Для графа это не нужно прописывать: он проскорит и зафиксирует людей с такой подозрительной активностью самостоятельно.</p><h3>Строить маршруты</h3><p>С помощью графа можно найти самый короткий и быстрый маршрут из точки А в точку B. Он будет учитывать не только длину дорог, но и поможет предсказать, где и когда трафик меньше.</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-12/2376e2e6-e0f2-4833-bbfa-38b84d17604a.png" alt="" /><figcaption>Рёбра в данном случае — это изменяющиеся величины, которые отражают и учитывают, где, например, ночью дороги пустые, а где в шесть утра пробки и аварии, которые надо объехать. Источник: http://www.geocenter-consulting.ru/news/item/259</figcaption></figure><h3>Ранжировать информацию по достоверности</h3><p>В Google графы использовали для ранжирования веб-страниц. Чтобы самый полезный сайт поставить на первое место, придумали алгоритм PageRank.</p><p>Каждый сайт был узлом, а ссылки на другие сайты внутри — связями. За счёт этого сайт, который ссылался на более достоверные источники, оказывался выше. Например, если одна из страниц ссылалась на сайт правительства Соединённых Штатов, а другая — на жёлтую прессу, вторая уходила вниз в поисковой выдаче.</p><p>Сейчас используют и другие алгоритмы, тот же GPT, но в начале 2000-х Google выстрелил благодаря графам, которые качественнее определяли «авторитетность».</p><h3>Хранить взаимосвязи между сущностями</h3><p>Ещё одна важная предметная область, где применяются графы — графы знаний. Это семантическая структура, в которой хранится информация о разных сущностях и взаимосвязях между ними. Вершиной‎ графа может быть как абстрактное понятие (например, концепция), так и материальный объект (например, предмет или человек).</p><p>На основе графов знаний работают, например, голосовые помощники — Alexa от Amazon.</p><p>Так могут <a href="https://towardsdatascience.com/a-guide-to-the-knowledge-graphs-bfb5c40272f1">выглядеть</a> взаимосвязи в графах знаний:</p><figure><img src="https://media.tproger.ru/user-uploads/75379/2023-10-12/f45a90f6-b25b-400d-ae0c-4e35acb91415.png" alt="" /></figure><h2>Звучит интересно. А сложно их учить?</h2><p>Действительно, графы — универсальный и многогранный инструмент, который используется для решения самых разных задач. Держать в голове весь их функционал довольно сложно. Для начала достаточно понимать, что из себя представляют графы и в каких предметных областях они применяются. А далее изучать конкретные алгоритмы и инструменты в зависимости от задачи.</p><h2>Где можно узнать о них подробнее?</h2><ul><li>ТГ-канал про графы: @sberlogawithgraphs</li><li><a href="https://web.stanford.edu/class/cs224w/">Курс Стэнфордского университета</a></li><li>Книга <a href="https://www.ozon.ru/product/vvedenie-v-teoriyu-grafov-uilson-robin-599251283/">«Введение в теорию графов»</a> Р. Уилсона</li><li>Книга про графовые нейронные сети: Graph Representation Learning. William L. Hamilton</li></ul>]]></content:encoded>
    </item>
    <item>
      <title>Настраиваем конфигурацию DAG в Apache Airflow так, чтобы меньше о ней думать</title>
      <link>https://tproger.ru/articles/nastraivaem-konfiguraciyu-dag-v-apache-airflow-tak-chtoby-menwe-o-nej-dumat</link>
      <comments>https://tproger.ru/articles/nastraivaem-konfiguraciyu-dag-v-apache-airflow-tak-chtoby-menwe-o-nej-dumat?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Ирина Тюльпакова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/nastraivaem-konfiguraciyu-dag-v-apache-airflow-tak-chtoby-menwe-o-nej-dumat</guid>
      <description><![CDATA[<p>В статье рассказали, как мы настроили и оптимизировали разработку загрузок для Apache Airflow и что для этого потребовалось.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/nastraivaem-konfiguraciyu-dag-v-apache-airflow-tak-chtoby-menwe-o-nej-dumat">Настраиваем конфигурацию DAG в Apache Airflow так, чтобы меньше о ней думать</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[DevOps]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Автоматизирование]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 04 Oct 2023 08:24:37 GMT</pubDate>
      <content:encoded><![CDATA[<p>Сбор и обработка данных для биг дата — достаточно трудоёмкая задача. Для этих целей используются загрузчики.</p><p>Но заранее спроектировать и настроить их «на века» невозможно. В процессе работы всегда появляются новые источники сбора данных или специфичные требования к ним, которые часто приходится обрабатывать вручную. Поэтому мы настроили и оптимизировали разработку загрузок.</p><h2>Мы пользуемся Airflow как единой системой запуска задач</h2><p>В нашем банке есть собственная платформа больших данных — DataFactory. Я уже больше года занимаюсь тем, что создаю загрузчики внешних данных для неё. До того, как я пришёл в Газпромбанк, этот процесс был неоптимизирован. Часть информации обрабатывалась Java-загрузчиками, часть — написанными на голом Python.</p><p>Сейчас мы используем Apache Airflow как оркестратор ETL-процессов, а сами процессы пишем на Python. Airflow оперирует DAG — направленным ациклическим графом, в котором описываются правила работы задач внутри одной загрузки данных. Такое решение, например, позволяет нам запускать задачи параллельно внутри кластера Kubernetes — в котором за выполнение каждой задачи отвечает отдельный k8s POD.</p><p>В основном, у загрузчиков схожие правила работы. Но для каждого требуется определенные настройки, которые в виде JSON описаны в наборе конфигурационных параметров и хранятся в Airflow Variables. Например, можно указать глубину сбора данных (в днях) и другие параметры, влияющие на выполнение DAG.</p><p>Иногда процесс нужно запускать с произвольной конфигурацией. Чаще всего на стадии финальной отладки и активного тестирования работы. Раньше в такой ситуации мы меняли значения в Airflow Variables, а затем возвращали их обратно, когда загрузчик завершал работу. Случалось, что мы забывали вернуть измененные параметры обратно, а потом искали причину некорректной работы DAG. В конце концов мы задумались, как можно легко менять значения важных переменных внутри существующего кода. И придумали!</p><h2>Способы изменить конфигурацию</h2><h3>Встроенный редактор</h3><p>В UI Apache Airflow есть свой редактор JSON. Можно залезть внутрь Airflow Variable и изменить значения там. Но такой подход не очень подойдёт, если вы хотите разово выполнить загрузку со специфическими параметрами. Airflow Variable содержит постоянные значения, которые, как правило, прописываются раз и навсегда. Когда вы что-то там меняете, то после завершения разового запуска DAG вам нужно не забыть вернуть измененные параметры обратно.</p><h3>Запуск с параметрами</h3><p>Apache Airflow может запустить DAG со специфическими параметрами.</p><figure><img src="https://media.tproger.ru/user-uploads/88534/2023-10-03/81eaf2a9-7d1d-4a52-8bd0-8708fecda23b.png" alt="" /></figure><p>Они прописываются вручную в виде нового JSON. В ходе работы загрузчика каждая задача получает доступ к этим значениям и корректирует своё поведение.</p><figure><img src="https://media.tproger.ru/user-uploads/88534/2023-10-03/5f00e5da-c251-4870-9f47-bd524a4169bb.png" alt="" /></figure><p>Такой способ позволяет оперативно вмешаться в работу процесса. Например, если внезапно окажется, что в DataFactory отсутствуют значения за неделю, мы можем разово повлиять на определенный параметр DAG и указать сбор данных глубиной в семь дней. Нюанс в том, что запуск с ручной конфигурацией нужно обработать в коде отдельно.</p><h3>Хардкод</h3><p>Этот способ самый радикальный, но рабочий. Можно отдельно прописать константы или переменные, которые необходимо использовать для специфического запуска DAG. Но это крайне неудобно: приходится вшивать много информации в код, а затем убирать.</p><h2>Наш способ оптимизации запуска DAG</h2><p>Итак, есть три способа передать DAG параметры: с помощью Airflow Variable, вручную через w/ config и напрямую, указав в коде значения. Наша цель — просто и удобно извне влиять на важные для загрузчика значения. При запуске очередной задачи DAG:</p><ul><li>сначала посмотреть, указан ли параметр при ручном запуске;</li><li>если нет — то попытаться найти его значение в Airflow Variable;</li><li>иначе присвоить значение из заданных в коде значений по умолчанию.</li></ul><p>При выполнении функции внутри работающей задачи DAG функция vars_from() сначала проверяет, был ли DAG запущен с помощью w/ config. После чего пытается найти, заданы ли ключи «count_on_page» и/или «date_from» внутри JSONа, переданного через w/ config. Если да — передаёт соответствующие значения переменным count_on_page и date_from в коде задачи.</p><p>Если в словаре w/ config искомых ключей нет, то производится попытка поиска значений ключей «count_on_page» и/или «date_from» внутри JSON из соответствующей DAG Airflow Variable.</p><p>На тот случай, если необходимых значений нигде нет, в аргументах функции vars_from() мы указали значения по умолчанию. В нашем примере это 50 и 1d, взятые из констант POLLS_COUNT_ON_PAGE и POLLS_DATE_FROM_DEFAULT.</p><h2>Как работает vars_from()</h2><p>Функция имеет одну внешнюю зависимость: для её реализации необходима библиотека sorcery. Она предоставляет объекту информацию, откуда его вызывают. В терминах библиотеки такой объект называется «заклинанием» (spell) и инициализируется следующим образом:</p><p>Кортеж *defaults — аналог *args, а декоратор spell помещает в нулевой элемент кортежа *defaults ссылку на frame-объект функции vars_from(). Так мы можем задать значения локальных переменных, стоящих слева от вызова функции.</p><h2>Обработка ключа</h2><p>На всякий случай проверка вхождения ключей реализована тремя способами: по строгому соответствию с названием переменной, по её интерпретации camel case и через псевдоним.</p><p>Здесь псевдоним маршрутизирует значение из ключа sql_injection_report_mail в переменную recipients:</p><p>Если ключ есть и в ручной конфигурации, и в базе Airflow Variable, приоритет будет отдаваться переменной, которая записана стилем snake case:</p><p>Несмотря на то что в ручном запуске есть сущность «sql injection report mail», её значение будет взято из Airflow Variable.</p><p>Ещё пример, чуть более сложный:</p><h2>Теперь настройка DAG для новых задач — не проблема</h2><p>Загрузчики извлекают много информации из разных мест. Мы берем данные из готовых CSV-файлов, архивов, вложений почтовых ящиков, файлы из SAMBA-папок. Проникаем в REST API за полезными JSON и XML — в общем, работаем со всей информацией, которая требуется бизнес-подразделениям банка и которую разрешает собирать наш Департамент информационной безопасности.</p><p>Решение, которое мы разработали, позволяет удобнее корректировать работу DAG, не внося изменений в код загрузчиков.</p>]]></content:encoded>
    </item>
    <item>
      <title>Как «Строки» подбирают контент, который понравится читателям</title>
      <link>https://tproger.ru/articles/kak-stroki-podbirayut-kontent-kotoryj-ponravitsya-chitatelyam</link>
      <comments>https://tproger.ru/articles/kak-stroki-podbirayut-kontent-kotoryj-ponravitsya-chitatelyam?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[МТС]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-stroki-podbirayut-kontent-kotoryj-ponravitsya-chitatelyam</guid>
      <description><![CDATA[<p>Рассказали, какие рекомендательные системы используют и как их улучшают в онлайн-сервисе для читающих людей от МТС.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-stroki-podbirayut-kontent-kotoryj-ponravitsya-chitatelyam">Как «Строки» подбирают контент, который понравится читателям</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 17 Jul 2023 14:30:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>«Строки» — стремительно развивающийся книжный онлайн-сервис от МТС. В каталоге «Строк» есть электронные и аудиокниги, газеты, журналы, подкасты, в том числе эксклюзивные. Важная часть сервиса — уникальные рекомендательные системы от Big Data МТС. Именно они помогают читателю выбрать в огромном массиве книжек, текстов, подкастов и аудио то, что ему наверняка будет интересно и необходимо. Как работают рекомендательные системы «Строк» и что мы для этого делаем, рассказывает</p><h2>Рекомендательные системы: какие бывают и какие мы используем в «Строках»</h2><p>Рекомендательные системы — алгоритмы, которые анализируют обобщённые обезличенные данные о предпочтениях пользователей и, опираясь на большой объём накопленной информации, предлагают им услуги, контент или другие элементы, которые могут заинтересовать.</p><p>Рассмотрим методы фильтрации, которые используются для построения рекомендаций внутри «Строк».</p><p><b>Фильтрация по контенту (content-based filtering). </b>Данный метод предлагает контент, который похож на те произведения, с которыми раньше взаимодействовал пользователь. Например, рекомендательная система видит, что уже прочёл пользователь, типизирует его предпочтения на основе контента и будет предлагать книги, которые похожи на то, что ему нравится.</p><p><b>Коллаборативная фильтрация (collaborative filtering). </b>Метод коллаборативной фильтрации анализирует предпочтения множества пользователей, типизирует их и на основе сходства между пользователями (users) и товарами (items) строит рекомендации. Пользователи — это клиенты сервиса, товары — объекты, которые предлагает сервис (книги, аудиокниги, подкасты и пресса).</p><p>В «Строках» применяются гибридные рекомендательные системы, которые сочетают в себе оба метода фильтрации. Гибридный подход позволяет использовать преимущества коллаборативной фильтрации и фильтрации по контенту, тем самым повышая качество и соответствие рекомендаций потребностям читателей.</p><p>Рассмотрим на примерах.</p><h3>User-to-item рекомендации</h3><p>Такой вид рекомендаций можно найти в «Строках» на главной странице, а также на странице книг и аудиокниг в разделе «Специально для вас». Там представлены персональные рекомендации текстового и аудиоконтента, которые сформированы с учётом предпочтений и интересов пользователя.</p><p>Для построения качественных user-to-item рекомендаций требуется пользовательская история взаимодействия с контентом: прочтения или прослушивания книг, добавления понравившихся в «отложенное», а также доступная мета-информация о пользователе, например, его пол и возраст.</p><p>Чем больше пользователи взаимодействуют с контентом и сервисом, тем больше полезной информации о поведении и интересах получают рекомендательные системы.</p><figure><img src="https://media.tproger.ru/uploads/2023/07/dda5abef-3790-466b-9b75-d5d479955b36.png" alt="" /><figcaption>Рекомендации user-to-item работают и для неавторизованных пользователей</figcaption></figure><h3>Item-to-item рекомендации</h3><p>На странице с описанием книги, подкаста или другого контента, в разделе «С этой книгой читают» пользователи получают рекомендации, которые основаны на фильтрации по контенту.</p><p>При построении item-to-item рекомендаций в «Строках» система формирует релевантные подборки, исходя из различных свойств самой книги, таких как жанры, авторы и название. Эта информация носит обобщённый характер, её сервис получает от партнёров-издателей, поэтому встречаются погрешности в данных, которые влияют на качество рекомендаций.</p><p>Кроме того, в «Строках» также используются системы кросс-рекомендаций с онлайн-кинотеатром KION. Пользователь получает item-to-item рекомендации фильмов, которые были сняты по книге, или похожие кино.</p><figure><img src="https://media.tproger.ru/uploads/2023/07/98a218ea-cc9a-4bc2-a7e1-e626f7deb4a0.png" alt="" /></figure><figure><img src="https://media.tproger.ru/uploads/2023/07/9bdf7514-20c5-4714-ae4c-077edf470371.png" alt="" /><figcaption>«Холодным» пользователям — клиентам, у которых нет истории взаимодействия с сервисом, — мы предлагаем заранее подготовленные подборки контента от редакторов «Строк». После того как пользователь повзаимодействует хотя бы с одной книгой, наши модели подберут для него персональные рекомендации</figcaption></figure><h2>Как в «Строках» улучшают системы рекомендаций</h2><p>Чтобы рекомендации в «Строках» были интересными и разнообразными, мы разработали алгоритм, с помощью которого пытаемся улучшить работу рекомендательных систем.</p><h3>Формирование гипотезы</h3><p><b></b>Сначала генерируется идея, которая поможет улучшить качество рекомендаций, — гипотеза. Например, чтобы сделать контент разнообразнее, добавим в систему правило: 75% подборки рекомендаций формируется из контента, который доступен для пользователя.</p><h3>Обучение модели</h3><p><b></b>Затем происходит обучение модели с внедрением необходимых изменений. Разработчик вносит правки в существующие алгоритмы и заново обучает модель на неизменном наборе данных.</p><p>В данном случае набор данных — это обезличенная информация о поведении пользователя внутри сервиса и о книгах. Если гипотеза касается изменения данных, сначала разработчики и дата-инженеры редактируют данные, а затем обучают модель.</p><h3>Формирование рекомендаций</h3><p>После обучения модели происходит прогнозирование рекомендаций для каждого пользователя, если мы говорим про user-to-item рекомендации. Если рекомендации вида item-to-item, то ожидаем подборки рекомендаций для книг.</p><h3>Оценка офлайн-метрик качества рекомендаций</h3><p><b></b>Внутри «Строк» мы ориентируемся на конверсию попадания рекомендаций из подборки в читалку или плеер пользователя. Этот показатель можно измерить только при запуске обновлённой рекомендательной системы на реальных пользователях.</p><p>Однако важным шагом перед запуском обновлённой рекомендательной системы в продуктивную среду является оценка офлайн-метрик качества, которые рассчитываются на исторических данных. Офлайн-метрики позволяют разработчику убедиться, что новые рекомендации корректны с точки зрения точности и полноты предсказаний. Но полностью доверять офлайн-метрикам не стоит, так как предугадать поведение и настроение пользователей в реальном времени рекомендательная система не может.</p><p>Чаще всего разработчики нашего сервиса ориентируются на следующие офлайн-метрики:</p><ul><li><b>Точность</b> предсказаний. Интерпретируется как доля релевантных рекомендаций.</li><li><b>Полнота</b> предсказаний. Интерпретируется как доля релевантных объектов, попавших в рекомендации.</li><li><b>Средняя точность по пользователям</b>. Считается как средняя точность предсказаний для пользователя по всем релевантным позициям, далее полученное значение усредняется по всем пользователям.</li><li><b>Новизна</b>. Под новизной понимается доля новых для пользователя товаров среди рекомендованных.</li><li><b>Разнообразие</b>. Под разнообразием понимается степень сходства товаров внутри подборки рекомендаций.</li></ul><p>Если значения офлайн-метрик качества новой рекомендательной системы выросли или не изменились, то можно переходить к следующему шагу тестирования рекомендаций. Но если разработчик замечает сильное ухудшение офлайн-метрик качества, то процесс внедрения рекомендательной системы в продуктивную среду останавливается. И разработчик разбирается, почему произошёл спад метрик. Затем вносит изменения в алгоритм, после чего снова проверяет офлайн-метрики качества.</p><h3>Визуальный анализ рекомендаций</h3><p>В отличие от классического машинного обучения, при разработке рекомендательных систем очень сложно заранее смоделировать поведение пользователя. Невозможно предугадать, будет ли пользователь взаимодействовать с релевантными товарами, у которых высокие оценки офлайн-метрик.</p><p>Поэтому, когда мы тестируем рекомендации от обновлённой модели, обязательно проводим визуальный анализ. Разработчик просматривает подборки, которые предлагает рекомендательная система, и оценивает, насколько качественно сделаны рекомендации.</p><p>При визуальном анализе выделяются яркие представители различных групп пользователей. Группы могут формироваться в зависимости от количества взаимодействий с книгами и собирательного образа типичного пользователя сервиса. Также могут формироваться кластеры в зависимости от жанров и авторов. Например, кластеры «любителей боевого фэнтези» и «ценителей классической литературы».</p><h3>Оценка онлайн-метрик качества рекомендаций</h3><p><b></b>Если метрики, которые посчитаны на исторических данных, остались неизменными или выросли, а визуальный анализ показал хорошие результаты, то можно запускать A/B-тестирование (так мы называем оценку онлайн-метрик качества рекомендаций). A/B-тестирование сможет честно оценить эффект от изменений, внедрённых в модель рекомендаций.</p><p>Сначала аналитик готовит А/B-тест к запуску на реальных пользователях. Первым шагом следует выбрать метрику, которую нужно оценить, и зафиксировать ожидаемый эффект для обеспечения достоверности и надёжности результатов теста. Внутри «Строк» целевая метрика — это конверсия попадания рекомендаций из подборки в читалку или плеер пользователя.</p><p>Затем аналитик подбирает  статистический критерий в зависимости от данных, на которых проводится тестирование. Это мера статистической значимости, которая помогает определить, являются ли результаты теста надёжными, а не случайными.</p><p>Следующим шагом нужно поделить пользователей на группы. Главная задача здесь — распределить их поровну, чтобы гарантировать, что любые различия в результатах могут быть связаны с тестируемой рекомендательной системой, а не с другими факторами.</p><p>Далее проводится А/А-тест, где предполагается, что полученные на предыдущем шаге группы не имеют значимых отличий между собой.</p><p>Затем проводится оценка мощности А/B-теста. К одной из групп искусственно добавляется эффект, который планируется получить после внедрения новой модели в сервис, и рассчитывается время проведения А/B-теста на исторических данных.</p><p>После этих этапов A/B-тест запускается в продуктовой среде и продолжается необходимое количество времени, которое было заранее рассчитано на исторических данных.</p><p>После истечения рассчитанного времени результаты тестирования проверяются на статистическую значимость.</p><figure><img src="https://media.tproger.ru/uploads/2023/07/31ec763a-c0f9-4702-938f-2594e5ea5e86.png" alt="" /><figcaption>Верхнеуровневый план проведения А/B-тестирования</figcaption></figure><h3>Внедрение обновлённой модели</h3><p><b></b>Если результаты тестирования оказались статистически значимыми (А/B-тест признан успешным), обновлённую рекомендательную систему можно внедрять на всех пользователей сервиса.</p><h2>Вместо заключения</h2><p>Мы рассказали о том, какие виды рекомендаций представлены в онлайн-сервисе «Строки», а также кратко описали подходы, которые используем для их улучшения.</p><p>Возможно, у вас есть вопросы, как у пользователя сервиса «Строки», или вы сами работаете с рекомендательными системами и готовы поделиться опытом?</p><p>Добро пожаловать в комментарии!</p>]]></content:encoded>
    </item>
    <item>
      <title>Дайджест Python #13: инструменты для Data Science и исполняемые файлы из скрипта</title>
      <link>https://tproger.ru/articles/dajdzhest-python-13-instrumenty-dlya-data-science-i-ispolnyaemye-fajly-iz-skripta</link>
      <comments>https://tproger.ru/articles/dajdzhest-python-13-instrumenty-dlya-data-science-i-ispolnyaemye-fajly-iz-skripta?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Рафаил Агазода]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/dajdzhest-python-13-instrumenty-dlya-data-science-i-ispolnyaemye-fajly-iz-skripta</guid>
      <description><![CDATA[<p>Собрали лучшие материалы по Python с 1 по 14 июля. Узнайте, как сделать из скрипта исполняемый файл и как настроить автопостинг в ВК.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/dajdzhest-python-13-instrumenty-dlya-data-science-i-ispolnyaemye-fajly-iz-skripta">Дайджест Python #13: инструменты для Data Science и исполняемые файлы из скрипта</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Django]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 14 Jul 2023 09:30:36 GMT</pubDate>
      <content:encoded><![CDATA[<p>Собрали дайджест из лучших материалов по Python с 1 по 14 июля, которые только смогли найти. Дайджест включает статьи и видео на русском и английском языках.</p><p>Узнайте, как сделать из Python-скрипта исполняемый файл, какие инструменты использовать в Data Science и как настроить автопостинг в ВК.</p><h2>Big Data / Data Science</h2><ul><li><a href="https://habr.com/ru/articles/747838/">Экстренное шифрование данных</a></li><li><a href="https://habr.com/ru/companies/jetinfosystems/articles/747338/">Инструменты Дата-сайнтиста. Универсальная база</a></li><li><a href="https://habr.com/ru/articles/747350/">Как из метрик Prometheus построить график Latency</a></li><li><a href="https://habr.com/ru/articles/746874/">Dagster и Great Expectations: Интеграция без боли</a></li><li><a href="https://habr.com/ru/companies/piter/articles/745860/">Книга «Python для data science»</a></li><li><a href="https://dev.to/aqsa81/what-is-the-minimum-system-requirements-for-data-science-5b9n">[ENG] What is the Minimum System Requirements for Data Science?</a></li><li><a href="https://dev.to/avinash201199/data-science-roadmap-with-free-material-o0c">[ENG] Data Science Roadmap with Free Study Material</a></li><li><a href="https://dev.to/grayhat/modern-data-stack-a-hands-on-guide-with-airbyte-snowflake-and-dbtdata-build-tool-3obi">[ENG] Modern Data Stack: A Hands-on Guide with Airbyte, Snowflake, and dbt(data build tool)</a></li></ul><h2>AI и ML</h2><ul><li><a href="https://habr.com/ru/articles/747380/">Тестируем на реальных кейсах Chatgpt Code Interpreter</a></li><li><a href="https://habr.com/ru/articles/746842/">Семантическая сегментация на основе архитектуры U-Net и определение расстояния между объектами</a></li><li><a href="https://habr.com/ru/articles/746762/">Первые шаги в импульсных нейронных сетях</a></li><li><a href="https://habr.com/ru/articles/746134/">See and Tell: Сервис просмотра сериалов для слабовидящих</a></li><li><a href="https://habr.com/ru/articles/745768/">Нейронные сети не могут обобщать периодические зависимости. Как это исправить?</a></li><li><a href="https://dev.to/apisix/building-a-chatgpt-custom-plugin-for-api-gateway-3176">[ENG] Building a ChatGPT custom plugin for API Gateway</a></li><li><a href="https://dev.to/mehrandvd/ai-team-collaboration-with-azure-ml-studio-3dio">[ENG] AI Team Collaboration with Azure ML Studio</a></li><li><a href="https://dev.to/polterguy/invoking-openais-chatgpt-from-6-different-programming-languages-191f">[ENG] Invoking OpenAI’s ChatGPT from 6 different programming languages</a></li><li><a href="https://dev.to/polterguy/creating-a-better-stackoverflow-with-chatgpt-52pd">[ENG] Creating a Better StackOverflow with ChatGPT</a></li></ul><h2>Веб / Django / Flask</h2><ul><li><a href="https://habr.com/ru/articles/741766/">FVWA (Flask Vulnerable Web Application)</a></li><li><a href="https://habr.com/ru/companies/yandex/articles/745534/">Lock записей и шквал «пятисоток»: какие шишки мы набили на миграциях в Django и как вам этого избежать</a></li><li><a href="https://habr.com/ru/companies/selectel/articles/747278/">Полезные материалы и инструменты для погружения в Flask: выбор сотрудников Selectel</a></li><li><a href="https://dev.to/forhadakhan/multi-role-user-authentication-in-django-rest-framework-3nip">[ENG] Multi-Role User Authentication in Django Rest Framework</a></li><li><a href="https://dev.to/behainguyen/python-flask-railwayapp-deployment-and-railways-nixpacks-docker-image-build-tool-3026">[ENG] Python, Flask: Railway.app deployment and Railway’s Nixpacks Docker image build tool.</a></li><li><a href="https://dev.to/scofieldidehen/road-map-for-python-developers-of2">[ENG] Road-Map for Python Developers </a></li><li><a href="https://dev.to/derlin/when-plans-go-astray-my-unsuccessful-journey-of-migrating-a-large-django-project-to-mypy-3l23">[ENG] When plans go astray: my unsuccessful journey of migrating a large Django project to Mypy</a></li><li><a href="https://dev.to/ifihan/exploring-djangos-third-party-packages-top-libraries-you-should-know-38km">[ENG] Exploring Django’s Third-Party Packages: Top Libraries You Should Know</a></li></ul><h2>Скрипты, приложения и боты</h2><ul><li><a href="https://habr.com/ru/articles/747644/">RabbitMQ Direct Reply-to. RPC поверх кролика без дополнительных очередей (пример на Python)</a></li><li><a href="https://habr.com/ru/articles/746838/">Автопостинг ВК (VK) на python</a></li><li><a href="https://habr.com/ru/companies/southbridge/articles/746622/">Как сделать из Python-скрипта исполняемый файл</a></li><li><a href="https://habr.com/ru/companies/tinkoff/articles/745994/">Встроенные фикстуры Pytest</a></li><li><a href="https://habr.com/ru/companies/wunderfund/articles/745476/">Развлечения с хеш-коллизиями</a></li><li><a href="https://dev.to/haszankauna/writing-a-transmission-control-protocol-stack-in-python-3p6">[ENG] Writing a Transmission Control Protocol stack in Python</a></li></ul><h2>Развлекательный контент</h2><ul><li><a href="https://www.youtube.com/watch?v=8QeZrDqAQXY&amp;ab_channel=MoscowPython">[Видео] опрос Stackoverflow / PEP 594 / PSF Board 2023 / релиз JupyterLab 4</a></li><li><a href="https://www.youtube.com/watch?v=gXB9Rolne9Y&amp;ab_channel=MoscowPython">[Видео] Moscow Python Meetup №82. Максим Безруков. Виртуальное окружение по хардкору. Жизнь без pip</a></li><li><a href="https://dev.to/soumyadeepdey/chatgpt-vs-bard-which-is-better-for-coding-355j">[ENG] ChatGPT Vs Bard: Which is better for coding?</a></li></ul><p>Нашли что-нибудь полезное и интересное для себя? Расскажите, какой раздел показался вам самым интересным, а каких статей не хватило, чтобы следующий дайджест получился ещё лучше.</p><p>Если дайджест вам понравился, посмотрите две предыдущие подборки:</p><p>А ещё присылайте в комментарии статьи и видео, которые ускользнули от нашего взгляда и не попали в дайджест. Поделитесь полезными материалами с другими читателями!</p>]]></content:encoded>
    </item>
    <item>
      <title>5 признаков, что вам пора в Data Science</title>
      <link>https://tproger.ru/articles/5-priznakov-chto-vam-pora-v-data-science</link>
      <comments>https://tproger.ru/articles/5-priznakov-chto-vam-pora-v-data-science?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Вика Овсянникова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/5-priznakov-chto-vam-pora-v-data-science</guid>
      <description><![CDATA[<p>Хотите в Data Science, но не знаете, какое направление выбрать? Собрали признаки, которые помогут определиться и выбрать профессию.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/5-priznakov-chto-vam-pora-v-data-science">5 признаков, что вам пора в Data Science</a>»</p>]]></description>
      <category><![CDATA[Для начинающих]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Карьера]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 10 Jul 2023 13:11:01 GMT</pubDate>
      <content:encoded><![CDATA[<p>Очевидные (и не очень) признаки, которые подскажут, нужно ли вам двигаться в науку о данных и какое направление Data Science выбрать.</p><h2>1. Вы скрупулёзно относитесь к мелочам</h2><p>И кайфуете, когда видите очищенные данные и настроенные графики. И если в данных беспорядок, у вас возникает негодование и желание всё исправить.</p><h2>2. Вы любите контроль и отчётность</h2><p>От специалистов, которые работают с данными, всегда ожидают понятных результатов, а значит их нужно уметь собирать и презентовать. А также быть готовым к тому, что в любой момент у вас могут попросить отчёт — от этого никуда не деться.</p><h2>3. Вам нравится научная деятельность</h2><p>Ведь Machine Learning можно применять в разных областях.</p><p>Когда я училась на кафедре астрономии, мы снимали объекты в космосе, чтобы определять их положение в пространстве. Делали три снимка, потом с помощью векторизации и логистической регрессии определяли объекты на изображении. При этом засекали время, когда снимки были сделаны, фиксировали координаты обсерватории. После вычисляли азимут и высоту, далее — склонение и прямое восхождение, плавно переходя к самим Кеплеровым элементам орбиты.</p><h2>4. Вы и швец, и жнец, и на дуде игрец</h2><p>В проектах я сама писала код, приходила к дата-инженерам с витринами для моделей. Процесс разработки проекта и его защита перед бизнесом полностью лежали на мне.</p><h3>Какие задачи может выполнять Data Scientist</h3><p>С помощью машинного обучения в направлениях Data Science можно выполнять не только научные, но и, естественно, более прикладные задачи.</p><p>Например, я строила модель, которая прогнозировала отток клиентов. Здесь есть хитрость: нужно предсказывать не сам отток, иначе будем констатировать факт, а «предотток» — месяц перед уходом человека. Это нужно, чтобы успеть что-то предложить клиенту и тем самым его удержать.</p><p>Сначала я проводила аналитику таргета совместно с бизнесом — определяла, какого клиента можно считать «отточным», так как у бизнеса много практики и знаний в их предметной области. Например, три месяца он не совершал никаких транзакций или не получал отчислений на карту.</p><p>После строила модель. На этом этапе дата-сайентисты пользуются готовыми пайплайнами. Если в компании уже есть похожие витрины данных, то можно взять их за образец, и сделать задачу достаточно быстро. Иногда бывают и нестандартные задачи, где готовые, разработанные командой пайплайны не подходят. Тогда нужно писать код с нуля и создавать для модели новые витрины данных.</p><p>Далее выводила модель в пром, и она прогнозировала вероятность оттока клиента в следующем месяце.</p><p>На основе этих данных бизнес отбирал тестовую и контрольную выборки и запускал кампанию. Результаты кампании тоже нужно было оценить, чтобы понять, какие метрики важны и отвечают за качество модели.</p><p>И, наконец, я представляла бизнесу все результаты кампании, метрики, аналитику, которую можно сделать на основе этих цифр. Например, подтвердилась альтернативная гипотеза или нет. На основе этих показателей бизнес корректирует свои стратегию и кампанию для улучшения дальнейших результатов.</p><h2>5. Вы умеете договариваться</h2><p>В Machine Learning недостаточно просто делать fit–predict. Ещё нужно отвечать на письма, проводить презентации, участвовать во встречах. На них не только обсуждают работу, договариваются о результатах, но и разруливают нештатные ситуации.</p><p>Иногда бывают ситуации, когда сделать что-то нужно срочно. Сказать: «Ну-ка быстро мне что-то сделайте», — можно, но, как показывает практика, не нужно, потому что вы только вызовете недовольство у коллег. Поэтому важно уметь находить компромиссы, так как спорные ситуации возникают очень часто.</p><p>Софт-скилы нужны всем в сфере: и дата-сайентистам, и аналитикам данных, и даже немного ML-инженерам. Их стоит развивать, если хотите расти выше до мидла и готовы брать на себя больше ответственности за людей и проекты.</p><p>Чем больше вы напрямую общаетесь с бизнесом, отвечаете на его запросы, тем чаще вас поощряют. К тому же вы не только развиваетесь, но и можете расти в зарплате.</p><p>Но главное, в любом деле должно оставаться желание в этом разбираться, пытаться докопаться до сути. Ответьте себе на вопросы, что вы любите делать, что вас радует. Если среди этих пунктов не найдутся программирование или математика, то стоит задуматься, действительно ли вам этого хочется, или это кто-то вам навязал, например, реклама.</p><p>А если всё-таки найдутся, то пробуйте. Развиться и стать специалистом можно в любом направлении Machine Learning, если не бояться учиться и совершать ошибки.</p>]]></content:encoded>
    </item>
    <item>
      <title>Дайджест Python #12: взлом ChatGPT и оптимизация Jupyter Notebook</title>
      <link>https://tproger.ru/articles/dajdzhest-python-ot-3-iyulya</link>
      <comments>https://tproger.ru/articles/dajdzhest-python-ot-3-iyulya?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Рафаил Агазода]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/dajdzhest-python-ot-3-iyulya</guid>
      <description><![CDATA[<p>Собрали лучшие материалы по Python с 15 по 30 июня. Узнайте, как взломать ChatGPT и как компилировать типизированный Python.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/dajdzhest-python-ot-3-iyulya">Дайджест Python #12: взлом ChatGPT и оптимизация Jupyter Notebook</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Django]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 03 Jul 2023 09:28:08 GMT</pubDate>
      <content:encoded><![CDATA[<p>Собрали дайджест из лучших материалов по Python с 15 по 30 июня, которые только смогли найти. Дайджест включает статьи и видео на русском и английском языках.</p><p>Узнайте, как взломать ChatGPT, как оптимизировать работу в Jupyter Notebook и как компилировать типизированный Python.</p><h2>Big Data / Data Science</h2><ul><li><a href="https://habr.com/ru/articles/744066/">Оптимизации работы Jupyter notebook при помощи параллельных вычислений (Библиотека Joblib)</a></li><li><a href="https://habr.com/ru/companies/it-guide/articles/741876/">Анализировать данные — это как варить пиво. Почему дата-анализ и пивоварение — одно и то же с техноизнанки</a></li><li><a href="https://habr.com/ru/articles/743438/">Как сэкономить свои нервы и деньги компании на перестроении структуры больших таблиц без простоя в PostgreSQL</a></li><li><a href="https://dev.to/cyber_holics/how-to-manage-environment-for-data-science-project-using-conda-3mmp">[ENG] How To Manage Environment For Data Science Project Using Conda</a></li><li><a href="https://dev.to/newbie_coder/unleashing-the-potential-of-random-forest-regression-a-python-implementation-guide-with-hyperparameter-tuning-167o">[ENG] Unleashing the Potential of Random Forest Regression : A Python Implementation Guide with Hyperparameter Tuning</a></li><li><a href="https://dev.to/phylis/mlops-101-a-beginners-guide-to-understanding-machine-learning-model-operations-2dko">[ENG] MLOps 101: A Beginner’s Guide to Understanding Machine Learning Model Operations</a></li><li><a href="https://dev.to/grayhat/demystifying-the-data-product-lifecycle-from-inception-to-retirement-2i19">[ENG] Demystifying the Data Product Lifecycle: From Inception to Retirement</a></li><li><a href="https://dev.to/ranggakd/polars-vs-pandas-a-brief-tale-of-two-dataframe-libraries-lli">[ENG] Polars vs Pandas: A Brief Tale of Two DataFrame Libraries</a></li></ul><h2>AI и ML</h2><ul><li><a href="https://habr.com/ru/articles/744972/">Фильтруй базар! Как мы параллельный русско-башкирский корпус чистили</a></li><li><a href="https://habr.com/ru/companies/kaspersky/articles/744544/">Кажется, вы больше не должны давать тестовые задания кандидатам на дом</a></li><li><a href="https://habr.com/ru/articles/744016/">Как определить причины достижений и неудач футбольного клуба с помощью цифр</a></li><li><a href="https://habr.com/ru/articles/742420/">Заметки про увеличение картинок нейронными сетями</a></li><li><a href="https://habr.com/ru/companies/kaspersky/articles/743412/">Взламывая ChatGPT: как мы участвовали в хакатоне по атакам на ИИ</a></li><li><a href="https://dev.to/akshayballal/experiment-tracking-and-hyperparameter-tuning-with-tensorboard-in-pytorch-402j">[ENG] Experiment Tracking and Hyperparameter Tuning with TensorBoard in PyTorch</a></li><li><a href="https://dev.to/akshayballal/building-a-vision-transformer-from-scratch-in-pytorch-1m1b">[ENG] Building a Vision Transformer from Scratch in PyTorch</a></li><li><a href="https://dev.to/aws/all-the-things-that-comprehend-rekognition-textract-polly-transcribe-and-others-do-3mb7">[ENG] All the things that Comprehend, Rekognition, Textract, Polly, Transcribe, and Others Do</a></li><li><a href="https://dev.to/shittu_olumide_/copydeepcopy-vs-clone-in-pytorch-455b">[ENG] Copy.deepcopy() vs clone() in Pytorch</a></li></ul><h2>Веб / Django / Flask</h2><ul><li><a href="https://habr.com/ru/articles/745402/">Fastapi 0.100.0-beta1: ещё быстрее</a></li><li><a href="https://dev.to/pragativerma18/unlocking-performance-a-guide-to-async-support-in-django-2jdj">[ENG] Unlocking Performance: A Guide to Async Support in Django</a></li><li><a href="https://dev.to/bangik/deploying-a-flask-application-on-aws-ec2-52k7">[ENG] Deploying a Flask Application on AWS EC2</a></li><li><a href="https://dev.to/thelime1/building-an-infinite-website-with-flask-and-openais-davinci-v3-23ja">[ENG] Building an Infinite Website with Flask and OpenAI’s davinci-v3</a></li><li><a href="https://dev.to/devvspaces/mastering-django-cicd-using-github-actions-2912">[ENG] Mastering Django CI/CD using GitHub Actions</a></li><li><a href="https://dev.to/developerbishwas/discovering-pysekt-your-next-favorite-tech-stack-575k">[ENG] Discovering PySeKT: Your Next Favorite Tech Stack</a></li></ul><h2>Скрипты, приложения и боты</h2><ul><li><a href="https://habr.com/ru/articles/744836/">Как сделать Telegram-бота для проверки аптайма своего сервиса на Python (ч.1 мгновенные метрики)</a></li><li><a href="https://habr.com/ru/articles/745280/">Как сделать Telegram-бота для проверки аптайма своего сервиса на Python (ч.2 алертинг)</a></li><li><a href="https://habr.com/ru/articles/744774/">Простейший бот «на движке» WEB WhatsApp</a></li><li><a href="https://habr.com/ru/companies/yandex/articles/743496/">Как я написал конвертер 3D-моделей из подручных средств</a></li><li><a href="https://habr.com/ru/articles/743192/">Messaging для чайников. Утилизируем все возможности RabbitMQ на Python</a></li><li><a href="https://habr.com/ru/companies/piter/articles/743538/">Как можно компилировать типизированный Python</a></li><li><a href="https://habr.com/ru/articles/743424/">Умный дом с голосовым ассистентом на минималках</a></li><li><a href="https://habr.com/ru/companies/selectel/articles/742774/">Типизация в Python. Работа с Mypy, PyCharm и SQLAlchemy 2.0</a></li><li><a href="https://dev.to/bytewax/reasoning-about-streaming-vs-batch-with-a-case-study-from-github-5g3l">[ENG] Reasoning about Streaming vs Batch with a Case Study from GitHub</a></li></ul><h2>Развлекательный контент</h2><ul><li><a href="https://www.youtube.com/watch?v=8VtDc25VshI&amp;list=PLv_zOGKKxVph51u_AIswuXCasZ7aZD8t3&amp;index=3">[Видео] Python meetup (Online)</a></li><li><a href="https://www.youtube.com/watch?v=QciiG079Bjk&amp;list=PLv_zOGKKxVph51u_AIswuXCasZ7aZD8t3&amp;index=2">[Видео] Обработка данных / Pandas 2.0</a></li></ul><p>Нашли что-нибудь полезное и интересное для себя? Расскажите, какой раздел показался вам самым интересным, а каких статей не хватило, чтобы следующий дайджест получился ещё лучше.</p><p>Если дайджест вам понравился, посмотрите две предыдущие подборки:</p><p>А ещё присылайте в комментарии статьи и видео, которые ускользнули от нашего взгляда и не попали в дайджест. Поделитесь полезными материалами с другими читателями!</p>]]></content:encoded>
    </item>
    <item>
      <title>Дайджест Python #11: шаурмичная на Python и AI-плагины для разработки</title>
      <link>https://tproger.ru/articles/dajdzhest-python</link>
      <comments>https://tproger.ru/articles/dajdzhest-python?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Рафаил Агазода]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/dajdzhest-python</guid>
      <description><![CDATA[<p>Лучшие статьи о Python с 1 по 15 июня: как готовить шаурму с Python, как создать чатбот на ruT5 и какие есть AI-плагины для разработки.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/dajdzhest-python">Дайджест Python #11: шаурмичная на Python и AI-плагины для разработки</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Django]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 19 Jun 2023 08:51:24 GMT</pubDate>
      <content:encoded><![CDATA[<p>Собрали дайджест из лучших материалов по Python с 1 по 15 июня, которые только смогли найти. Дайджест включает статьи и видео на русском и английском языках.</p><p>Узнайте, как готовить шаурму с помощью Python, как создать чатбот на основе ruT5, есть ли смысл в связке языков Python и C и какие есть AI-плагины для разработки на Python.</p><h2>Big Data / Data Science</h2><ul><li><a href="https://habr.com/ru/companies/avito/articles/740232/">PySpark для аналитика. Как выгружать данные с помощью toPandas и его альтернатив</a></li><li><a href="https://habr.com/ru/articles/739572/">Применение Python для сбора и предобработки данных цифрового следа</a></li><li><a href="https://habr.com/ru/companies/vk/articles/741702/">Форматы данных и файлов: руководство для архитекторов</a></li><li><a href="https://habr.com/ru/companies/vk/articles/735720/">Почему для MLOps лучше выбирать Open Source, а не проприетарное ПО</a></li><li><a href="https://habr.com/ru/companies/alfa/articles/739792/">Как ускорить вывод ML-моделей в 4 раза, или Как может выглядеть экосистема МLOps в банке</a></li><li><a href="https://dev.to/bobur/visualize-real-time-data-with-python-dash-and-risingwave-33g0">[ENG] Visualize Real-Time Data With Python, Dash, and RisingWave</a></li><li><a href="https://dev.to/johnrushx/20-databases-to-pick-in-2023-simplified-1n0n">[ENG] 20 databases to pick in 2023 – simplified</a></li><li><a href="https://dev.to/grayhat/transform-your-data-like-a-pro-with-dbt-data-build-tool-39kd">[ENG] Transform Your Data Like a Pro With dbt (Data Build Tool)</a></li><li><a href="https://dev.to/ranggakd/polars-vs-pandas-a-brief-tale-of-two-dataframe-libraries-lli">[ENG] Polars vs Pandas: A Brief Tale of Two DataFrame Libraries</a></li><li><a href="https://dev.to/ussdlover/data-visualization-using-matplotlib-and-seaborn-351a">[ENG] Data Visualization using Matplotlib and Seaborn</a></li></ul><h2>AI и ML</h2><ul><li><a href="https://habr.com/ru/articles/742460/">Поиск объектов на изображении. Часть 1</a></li><li><a href="https://habr.com/ru/articles/742420/">Заметки про увеличение картинок нейронными сетями</a></li><li><a href="https://habr.com/ru/articles/742386/">Что под капотом у нейронной сети. Нейросеть c точки зрения математики и программирования</a></li><li><a href="https://habr.com/ru/articles/741296/">cv3 — делаем OpenCV питоничным</a></li><li><a href="https://habr.com/ru/articles/741258/">Роли ChatGPT, которые первыми начинают диалог с клиентом и добивается поставленной бизнес задачи</a></li><li><a href="https://habr.com/ru/companies/kaspersky/articles/739208/">Хороший, плохой, злой и… свободный? Сравниваем глуповатые, но усердные AI-плагины для разработки</a></li><li><a href="https://habr.com/ru/articles/740426/">Сингулярность, в результате которой ИИ сам сделает себя умнее людей. GPT-4 играет в Minecraft и самообучается</a></li><li><a href="https://dev.to/abhaysinghr1/8-crucial-lessons-to-streamline-your-machine-learning-implementation-18il">[ENG] 8 Crucial Lessons to Streamline Your Machine Learning Implementation</a></li><li><a href="https://dev.to/twilio/build-a-sms-bot-that-answers-questions-over-docs-with-langchain-in-python-47fj">[ENG] Build a SMS Bot that Answers questions over Docs with LangChain in Python</a></li></ul><h2>Веб / Django / Flask</h2><ul><li><a href="https://habr.com/ru/articles/741258/">Роли ChatGPT, которые первыми начинают диалог с клиентом и добивается поставленной бизнес задачи</a></li><li><a href="https://habr.com/ru/articles/740882/">AIsaacChat: ИИ чатбот на основе ruT5</a></li><li><a href="https://habr.com/ru/articles/740288/">Парсинг, хранение и отображение логов 3-х разных агентов доставки электронной почты. MTA Log Parser</a></li><li><a href="https://dev.to/djangonews/django-news-django-bugfix-release-422-3058">[ENG] Django News – Django bugfix release 4.2.2</a></li><li><a href="https://dev.to/djangonews/django-news-python-37-to-312-updates-mg3">[ENG] Django News – Python 3.7 to 3.12 updates</a></li><li><a href="https://dev.to/ifihan/testing-in-django-26e5">[ENG] Testing in Django</a></li><li><a href="https://dev.to/scofieldidehen/10-django-packages-to-every-developer-must-install-1opj">[ENG] 10 Django Packages Every Developer Must Install</a></li></ul><h2>Скрипты, приложения и боты</h2><ul><li><a href="https://habr.com/ru/companies/ruvds/articles/741840/">Мой первый супероптимизатор</a></li><li><a href="https://habr.com/ru/articles/741724/">Python3 + C, есть ли смысл?</a></li><li><a href="https://habr.com/ru/companies/selectel/articles/741392/">Shawarma as a service: как создать бота для заказа шавермы и оставить голодными лишь 1,1% коллег</a></li><li><a href="https://habr.com/ru/companies/ozontech/articles/740540/">Сказ о том, как специалисты IT-поддержки скрипты писали…</a></li><li><a href="https://dev.to/yogeshwaran01/i-built-3-apps-using-spotify-api-and-python-49k8">[ENG] I built 3 Apps using Spotify API and Python</a></li><li><a href="https://dev.to/geeksvegeta/simple-friendlist-app-in-pyhton-tkinter-6k5">[ENG] Simple FriendList App In Pyhton Tkinter</a></li><li><a href="https://dev.to/ussdlover/regular-expressions-and-string-manipulation-in-python-45kd">[ENG] Regular expressions and string manipulation in Python</a></li><li><a href="https://dev.to/cicirello/pyaction-4210-released-59k">[ENG] pyaction 4.21.0 Released</a></li></ul><h2>Развлекательный контент</h2><ul><li><a href="https://www.youtube.com/watch?v=6f4FL5G9kMo&amp;list=PLv_zOGKKxVph51u_AIswuXCasZ7aZD8t3&amp;ab_channel=MoscowPython">[Видео] Типизация в Python</a></li><li><a href="https://youtu.be/YeA2a8UlRbw?list=PLv_zOGKKxVph51u_AIswuXCasZ7aZD8t3">[Видео] Python Language Summit 2023 / новости PyPI / Python 3.12 beta 1/ Diablo 4</a></li><li><a href="https://www.youtube.com/watch?v=SCOKZF5oImQ&amp;ab_channel=DIRTYPYTHON">[Видео] Python: Ботоводство на AIOgram</a></li></ul><p>Нашли что-нибудь полезное и интересное для себя? Расскажите, какой раздел показался вам самым интересным, а каких статей не хватило, чтобы следующий дайджест получился ещё лучше.</p><p>Если дайджест вам понравился, посмотрите две предыдущие подборки:</p><p>А ещё присылайте в комментарии статьи и видео, которые ускользнули от нашего взгляда и не попали в дайджест. Поделитесь полезными материалами с другими читателями!</p>]]></content:encoded>
    </item>
    <item>
      <title>Дайджест Python #10: генерация голоса и оценка скорости Mojo</title>
      <link>https://tproger.ru/articles/dajdzhest-python-10</link>
      <comments>https://tproger.ru/articles/dajdzhest-python-10?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Рафаил Агазода]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/dajdzhest-python-10</guid>
      <description><![CDATA[<p>Собрали новости Python с 15 по 31 мая. Узнайте, как сгенерировать голос человека на Python и во сколько раз Mojo быстрее Python на самом деле.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/dajdzhest-python-10">Дайджест Python #10: генерация голоса и оценка скорости Mojo</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Django]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 02 Jun 2023 09:22:36 GMT</pubDate>
      <content:encoded><![CDATA[<p>Собрали дайджест из лучших материалов по Python с 15 по 31 мая, которые только смогли найти. Дайджест включает статьи и видео на русском и английском языках.</p><p>Узнайте, как сгенерировать голос человека на Python, во сколько раз Mojo быстрее Python на самом деле и как обыгрывать противников в покер при помощи нейросетей.</p><h2>Big Data / Data Science</h2><ul><li><a href="https://habr.com/ru/articles/738906/">Кластеризация текста в PySpark</a></li><li><a href="https://habr.com/ru/articles/738720/">Определение свободного парковочного места с помощью Computer Vision</a></li><li><a href="https://habr.com/ru/companies/ru_mts/articles/738208/">Что нам стоит диаграмму в Python построить: 5 вариантов привлекающей внимание визуализации данных и кое-что ещё</a></li><li><a href="https://habr.com/ru/companies/sberbank/articles/736464/">Правильное подключение к БД: почему, зачем и как</a></li><li><a href="https://habr.com/ru/articles/736950/">Все DETRы мира. Часть 1</a></li><li><a href="https://habr.com/ru/articles/735606/">Что нового в SQLAlchemy 2.0?</a></li><li><a href="https://dev.to/grayhat/exploring-advanced-and-modern-concepts-in-sql-with-practical-examples-1md5">[ENG] Exploring Advanced and Modern Concepts in SQL with Practical Examples</a></li><li><a href="https://dev.to/javinpaul/my-favorite-free-courses-to-learn-data-science-in-depth-pmo">[ENG] My Favorite Free Courses to Learn Data Science in Depth</a></li></ul><h2>AI и ML</h2><ul><li><a href="https://habr.com/ru/companies/spectr/articles/738766/">Битва медведей: Pandas против Polars</a></li><li><a href="https://habr.com/ru/articles/736536/">Реализация функции потерь в Python</a></li><li><a href="https://habr.com/ru/articles/736190/">Использование компьютерного зрения для игры в покер</a></li><li><a href="https://habr.com/ru/companies/ntc-vulkan/articles/692818/">Восстановить удаленную фотографию с флешки? Искусственный интеллект в помощь</a></li><li><a href="https://dev.to/akshayballal/build-your-own-youtubegpt-using-langchain-and-openai-4lh5">[ENG] Build your own YouTubeGPT using LangChain and OpenAI</a></li><li><a href="https://dev.to/thenomadevel/facebook-open-sources-its-horizon-ai-platform-am5">[ENG] Facebook Open-Sources Its Horizon AI Platform</a></li><li><a href="https://dev.to/suede/how-i-built-a-midjourney-api-2j8h">[ENG] How I built a Midjourney API</a></li><li><a href="https://dev.to/praveenr2998/semantic-search-using-vectorsembeddings-for-noobs-2297">[ENG] Semantic Search Using Vectors/Embeddings For Noobs</a></li><li><a href="https://dev.to/edenai/how-to-generate-voices-with-python-3558">[ENG] How to generate voices with Python?</a></li></ul><h2>Веб / Django / Flask</h2><ul><li><a href="https://habr.com/ru/companies/selectel/articles/735556/">Создаем блог на Django с опросами и тестами. Краткая инструкция. Часть 1</a></li><li><a href="https://habr.com/ru/companies/selectel/articles/738942/">Создаем блог на Django с опросами и тестами. Краткая инструкция. Часть 2</a></li><li><a href="https://habr.com/ru/companies/rosbank/articles/736698/">Особенности асинхронности в Python</a></li><li><a href="https://habr.com/ru/articles/738238/">Werkzeuger: раскручиваем arbitrary file read до RCE в веб-приложении на flask</a></li><li><a href="https://dev.to/akashrchandran/how-to-create-rest-api-using-django-rest-framework-f4o">[ENG] How to create REST API using Django REST framework</a></li><li><a href="https://dev.to/foxy4096/websocket-in-django-55p1">[ENG] WebSocket in Django</a></li><li><a href="https://dev.to/ki3ani/deploying-your-first-dockerized-django-rest-api-on-aws-elastic-beanstalk-a-comprehensive-guide-2m77">[ENG] Deploying Your First Dockerized Django REST API on AWS Elastic Beanstalk: A Comprehensive Guide</a></li><li><a href="https://dev.to/chetanam/a-one-person-startup-tech-stack-nextjs-django-kubernetes-and-gcp-k62">[ENG] A One Person Startup Tech Stack for Ninja Developers – Next.js, Django, Kubernetes, and GCP</a></li></ul><h2>Скрипты, приложения и боты</h2><ul><li><a href="https://habr.com/ru/articles/739368/">Решаем задачу сетевого планирования с помощью Python</a></li><li><a href="https://habr.com/ru/articles/739314/">FastAPI без db: Session</a></li><li><a href="https://habr.com/ru/articles/738910/">Телеграм бот для CustDev’а на Aiogram</a></li><li><a href="https://habr.com/ru/articles/738432/">Пишем на Python, как будто это Rust</a></li><li><a href="https://habr.com/ru/articles/737536/">Propan — Python фреймворк для написания микросервисов с использованием брокеров сообщений</a></li><li><a href="https://habr.com/ru/companies/yandex/articles/736006/">Как заставить бэкендера писать фронтенд</a></li><li><a href="https://dev.to/chetanan/omkar-devtools-a-swiss-army-knife-for-ninja-developers-oli">[ENG] Meet Omkar DevTools: Your Swiss Army Knife as a Ninja Developer</a></li><li><a href="https://dev.to/cicirello/pyaction-4200-released-4p3k">[ENG] pyaction 4.20.0 Released</a></li><li><a href="https://dev.to/happer64bit/binary-search-in-python-3998">[ENG] Binary Search in Python</a></li><li><a href="https://dev.to/ken_mwaura1/getting-started-monitoring-a-fastapi-app-with-grafana-and-prometheus-a-step-by-step-guide-3fbn">[ENG] Getting Started: Monitoring a FastAPI App with Grafana and Prometheus – A Step-by-Step Guide</a></li></ul><h2>Развлекательный контент</h2><ul><li><a href="https://www.youtube.com/watch?v=25xUoLye53w&amp;ab_channel=RineiskyDev">[Видео] Собеседование Python 2023. Разбор базовых вопросов</a></li><li><a href="https://www.youtube.com/watch?v=Wgi4Al65l0A&amp;ab_channel=%D0%AF%D0%BD%D0%B4%D0%B5%D0%BA%D1%81%D0%9F%D1%80%D0%B0%D0%BA%D1%82%D0%B8%D0%BA%D1%83%D0%BC">[Видео] Блиц по бэкенду: сравниваем Python и Java</a></li><li><a href="https://www.youtube.com/watch?v=yovCqxZalJU&amp;ab_channel=Telusko">[Видео] [ENG] Mojo VS Python Speed Test</a></li><li><a href="https://www.youtube.com/watch?v=u6RV1lkHW8M&amp;ab_channel=LeMasterTech">[Видео] [ENG] How to Make Donkey Kong in Python!</a></li></ul><p>Нашли что-нибудь полезное и интересное для себя? Расскажите, какой раздел показался вам самым интересным, а каких статей не хватило, чтобы следующий дайджест получился ещё лучше.</p><p>Если дайджест вам понравился, посмотрите две предыдущие подборки:</p><p>А ещё присылайте в комментарии статьи и видео, которые ускользнули от нашего взгляда и не попали в дайджест. Поделитесь полезными материалами с другими читателями!</p>]]></content:encoded>
    </item>
    <item>
      <title>Дайджест Python #9: PandasAI, Телеграм-бот на Django и языковые модели на Python</title>
      <link>https://tproger.ru/articles/dajdzhest-python-9</link>
      <comments>https://tproger.ru/articles/dajdzhest-python-9?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Рафаил Агазода]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/dajdzhest-python-9</guid>
      <description><![CDATA[<p>Собрали лучшие материалы по Python с 1 по 15 мая. Узнайте, что такое PandasAI и как сделать языковую модель на Python.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/dajdzhest-python-9">Дайджест Python #9: PandasAI, Телеграм-бот на Django и языковые модели на Python</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Django]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 16 May 2023 09:21:31 GMT</pubDate>
      <content:encoded><![CDATA[<p>Собрали дайджест из лучших материалов по Python с 1 по 15 мая, которые только смогли найти. Дайджест включает статьи и видео на русском и английском языках.</p><p>Узнайте, что такое PandasAI и почему он изменит Data Science, как написать Telegram-бота на Django и как сделать языковую модель на Python.</p><h2>Big Data / Data Science</h2><ul><li><a href="https://habr.com/ru/articles/735098/">Координатный квест: как найти координаты и расстояния без регистраций и смс</a></li><li><a href="https://habr.com/ru/companies/glowbyte/articles/732024/">Байесовский подход к АБ тестированию</a></li><li><a href="https://habr.com/ru/articles/733672/">Data-driven рост с помощью науки о данных и машинного обучения</a><a href="https://habr.com/ru/articles/733954/"></a></li><li><a href="https://habr.com/ru/articles/733954/">Анализ таблиц сопряженности средствами Python. Часть 1. Визуализация</a><a href="https://habr.com/ru/companies/avito/articles/732870/"></a></li><li><a href="https://habr.com/ru/companies/avito/articles/732870/">PySpark для аналитика. Как правильно просить ресурсы и как понять, сколько нужно брать</a></li><li>[ENG] <a href="https://towardsdatascience.com/data-oriented-programming-with-python-ef478c43a874">Data-Oriented Programming in Python</a><a href="https://dev.to/andreaaline/using-pandascut-in-python-for-data-analysis-creating-number-and-date-intervals-708"></a></li><li>[ENG] <a href="https://dev.to/andreaaline/using-pandascut-in-python-for-data-analysis-creating-number-and-date-intervals-708">Using pandas.cut() in Python for Data Analysis: Creating Number and Date Intervals</a><a href="https://dev.to/abpanic/numpy-and-pandas-essential-tools-for-data-analysis-and-manipulation-1953"></a></li><li>[ENG] <a href="https://dev.to/abpanic/numpy-and-pandas-essential-tools-for-data-analysis-and-manipulation-1953">NumPy and Pandas: Essential Tools for Data Analysis and Manipulation</a><a href="https://dev.to/phylis/scikit-learn-code-snippets-for-common-machine-learning-tasks-a-comprehensive-guide-for-beginners-2358"></a></li><li>[ENG] <a href="https://dev.to/phylis/scikit-learn-code-snippets-for-common-machine-learning-tasks-a-comprehensive-guide-for-beginners-2358">Scikit-Learn Code Snippets for Common Machine Learning Tasks: A Comprehensive Guide for Beginners</a></li></ul><h2>AI и ML</h2><ul><li><a href="https://habr.com/ru/articles/734222/">Торговый робот с использованием нейросетей</a></li><li><a href="https://habr.com/ru/articles/733958/">Делаем анализатор ников на новой FRED-T5. Тотальный разнос</a></li><li><a href="https://habr.com/ru/articles/734154/">Бесплатные фронтенды к ChatGPT</a><a href="https://habr.com/ru/articles/733536/"></a></li><li><a href="https://habr.com/ru/articles/733536/">Обучение YOLOv5 на кастомном датасете</a></li><li>[ENG] <a href="https://dev.to/ferisjuan/open-ai-api-with-docker-4kad">Open AI API with Docker</a></li><li>[ENG] <a href="https://dev.to/aws/building-an-aws-well-architected-chatbot-with-langchain-13cd">Building an AWS Well-Architected Chatbot with LangChain</a></li><li>[ENG] <a href="https://dev.to/iampearceman/privategpt-chatgpt-but-private-and-compliant-21ee">ChatGPT, Made Private and Compliant!</a></li><li>[ENG] <a href="https://towardsdatascience.com/getting-started-with-langchain-a-beginners-guide-to-building-llm-powered-applications-95fc8898732c">Getting Started with LangChain: A Beginner’s Guide to Building LLM-Powered Applications</a></li><li>[ENG] <a href="https://medium.com/@fareedkhandev/pandas-ai-the-future-of-data-analysis-8f0be9b5ab6f">Pandas AI — The Future of Data Analysis</a></li><li>[ENG] <a href="https://artificialcorner.com/pandasai-super-simple-data-analysis-with-ai-powered-by-openai-128c47c57522">PandasAI: Super Simple Data Analysis with AI (Powered by OpenAI)</a></li></ul><h2>Веб / Django / Flask</h2><ul><li><a href="https://habr.com/ru/articles/734786/">Telegram Django Bot за пару строк</a></li><li><a href="https://habr.com/ru/articles/733996/">Как создать собственный кэшбэк-сервис</a><a href="https://dev.to/anurag629/setting-up-your-full-stack-development-environment-with-python-django-and-react-1457"></a></li><li>[ENG] <a href="https://dev.to/anurag629/setting-up-your-full-stack-development-environment-with-python-django-and-react-1457">Setting Up Your Full-Stack Development Environment with Python, Django, and React</a></li><li>[ENG] <a href="https://dev.to/sirneij/authentication-system-using-python-django-and-sveltekit-23e1">Authentication system using Python (Django) and SvelteKit</a></li><li>[ENG] <a href="https://medium.com/@nagendra.kumar1508/file-upload-using-django-and-html-5d43207bf67">File upload using Django and HTML</a></li><li>[ENG] <a href="https://medium.com/@mikahemminger.cc/htmx-within-django-intro-2023-6bf3bd77491e">HTMX within Django – Intro 2023</a></li><li>[ENG] <a href="https://medium.com/@mikahemminger.cc/django-4-tips-tricks-and-packages-list-eca5320ea5e5">Django – Tips, tricks and packages – 2023</a></li><li>[ENG] <a href="https://python.plainenglish.io/redis-as-a-powerful-caching-solution-for-django-web-applications-434907e7705f">Redis as a Powerful Caching Solution for Django Web Applications</a></li></ul><h2>Скрипты, приложения и боты</h2><ul><li><a href="https://habr.com/ru/companies/otus/articles/734528/">Python. Выражения в методах и индексаторах</a></li><li><a href="https://habr.com/ru/companies/selectel/articles/734194/">«Карманный синоптик за час». Пишем Telegram-бота для мониторинга погоды на Python</a></li><li><a href="https://habr.com/ru/articles/733686/">Макет автоматизированного создания пользователей (ботов) в социальных сетях и имитации их активности</a></li><li><a href="https://habr.com/ru/articles/733642/">Решаем криптарифмы с помощью алгебры и python</a></li><li>[ENG] <a href="https://dev.to/anvil/the-picast-connect-a-raspberry-pi-pico-w-to-an-anvil-app-453a">The PiCast: Connect a Raspberry Pi Pico W to an Anvil app</a></li><li>[ENG] <a href="https://dev.to/4yub1k/art-of-manually-crafting-packets-tcpip-1phc">Art of Manually Crafting Packets (TCP/IP).</a></li><li>[ENG] <a href="https://medium.com/@tony.infisical/the-death-of-the-env-file-6d65bfc6ac5e">Doing much better than your .env file</a></li></ul><h2>Развлекательный контент</h2><ul><li>[Видео] <a href="https://www.youtube.com/watch?v=_fqPDCnKffs&amp;ab_channel=MoscowPython">Изучаем иностранные языки с помощью Python и ChatGPT</a></li><li>[Видео] <a href="https://youtu.be/UWQ3_uB98-I">Притворяемся языковой моделью: учимся генерировать текст на Python с помощью цепи Маркова</a></li><li>[ENG] <a href="https://dev.to/hackertab_org/50-chat-gpt-prompts-every-software-developer-should-know-tested-9al">50 Chat GPT Prompts Every Software Developer Should Know (Tested)</a></li></ul><p>Нашли что-нибудь полезное и интересное для себя? Расскажите, какой раздел показался вам самым интересным, а каких статей не хватило, чтобы следующий дайджест получился ещё лучше.</p><p>Если дайджест вам понравился, посмотрите две предыдущие подборки:</p><p>А ещё присылайте в комментарии статьи и видео, которые ускользнули от нашего взгляда и не попали в дайджест. Поделитесь полезными материалами с другими читателями!</p>]]></content:encoded>
    </item>
    <item>
      <title>Как работали с данными с древних времён: краткая история Data Science</title>
      <link>https://tproger.ru/articles/kak-rabotali-s-dannymi-s-drevnih-vryomen-kratkaya-istoriya-datascience</link>
      <comments>https://tproger.ru/articles/kak-rabotali-s-dannymi-s-drevnih-vryomen-kratkaya-istoriya-datascience?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Василиса Белокопытова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-rabotali-s-dannymi-s-drevnih-vryomen-kratkaya-istoriya-datascience</guid>
      <description><![CDATA[<p>Наука о данных стала популярна лишь в 2010-е, но история Data Science началась чуть ли не 40 000 лет назад. Рассказываем, с чего именно.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-rabotali-s-dannymi-s-drevnih-vryomen-kratkaya-istoriya-datascience">Как работали с данными с древних времён: краткая история Data Science</a>»</p>]]></description>
      <category><![CDATA[История IT]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 11 May 2023 15:08:02 GMT</pubDate>
      <content:encoded><![CDATA[<p><i>Систематизировать данные стали в XVII веке, понятие Data Science ввели 50 лет назад, а популярность к дата-сайентистам пришла лишь в 2010-е. Но знания из данных извлекали на протяжении всей человеческой истории — рассказываем, как именно.</i></p><h2>Бирки из костей и приходские книги</h2><p>Люди собирали данные на протяжении всей истории. Так, в горах Лебомбо в Свазиленде была найдена кость бабуина, на которой имеется 29 зарубок. Возраст этого артефакта около 40 000 лет. Одна из версий, что эти насечки были чем-то вроде счётчика лунных фаз: то есть, по сути, одним из первых календарей. Были найдены и другие подобные предметы с зарубками, которые могли <a href="http://www.math.buffalo.edu/mad/Ancient-Africa/ishango.html">служить</a> для расчётов запасов еды.</p><p>Более осязаемые следы работы с данными <a href="https://www.ncbi.nlm.nih.gov/pmc/articles/PMC3640843/">тянутся</a> с середины XVII века. В 1640-х годах лондонский галантерейщик Джон Граунт, которого после стали называть «Колумбом статистики», собрал и изучил приходские книги рождений и смертей за несколько десятилетий и опубликовал наблюдения.</p><p>Так Граунт пытался предупредить вспышки бубонной чумы — а в итоге положил начало современной эпидемиологии. Он стал первым человеком, применившим анализ сводных данных для решения конкретной проблемы — собрал статистику смертности разных слоёв населения. И выяснил, что вспышки чумы, вопреки популярному тогда мнению, не связаны с движением планет или коронацией королей. А ещё он доказал, что женщины в среднем живут дольше мужчин и что большинство смертей приходится на первые годы жизни.</p><p>Ещё один учёный, немецкий физик Генрих Вильгельм Брандес, пытался решить проблему неурожая в Европе, который привёл к массовому голоду. Он предположил, что погодные изменения и последующий неурожай можно было предсказать. Чтобы доказать свою теорию, учёный собрал данные с метеостанций и к 1816 году нарисовал первую в истории карту погоды.</p><h2>Ткацкие станки и шифровальщики</h2><p>К началу XIX века набрала разгон индустриальная революция — ручной труд не успевал за прогрессом. Требовалось автоматизировать производство, а для этого закодировать станки.</p><p>Первая попытка такого программирования <a href="https://www.techinsider.ru/technologies/12195-tkatskiy-stanok-pradedushka-kompyuterov-programma/#:~:text=%D0%92%201834%20%D0%B3%D0%BE%D0%B4%D1%83%20%D0%91%D1%8D%D0%B1%D0%B1%D0%B8%D0%B4%D0%B6%2C%20%D0%BC%D0%B0%D1%82%D0%B5%D0%BC%D0%B0%D1%82%D0%B8%D0%BA,%D0%B2%D1%8B%D0%BF%D0%BE%D0%BB%D0%BD%D0%B5%D0%BD%D0%B8%D1%8F%20%D1%88%D0%B8%D1%80%D0%BE%D0%BA%D0%BE%D0%B3%D0%BE%20%D1%81%D0%BF%D0%B5%D0%BA%D1%82%D1%80%D0%B0%20%D0%BC%D0%B0%D1%82%D0%B5%D0%BC%D0%B0%D1%82%D0%B8%D1%87%D0%B5%D1%81%D0%BA%D0%B8%D1%85%20%D0%B7%D0%B0%D0%B4%D0%B0%D1%87.">пришлась</a> на 1725 год. Лионский ткач Базиль Бушон запустил ткацкий станок, которым управлял не человек, а зацикленная дырчатая бумажная лента: последовательность отверстий задавала последовательность движений челнока.</p><p>После Бушона над этой технологией трудились и другие исследователи. Постепенно бумажную ленту заменили жестяные и картонные таблички — их назвали перфокартами.</p><p>Популярность к ним пришла в 1805 году. Тогда Наполеон посетил ткацкую мастерскую Жозефа Жаккара, увидел, как станок сам ткёт узорчатое шёлковое полотно, — и распорядился сделать патент на изобретение общественным. Уже к 1812 году с помощью перфокарт во Франции работали 18 000 ткацких станков. После перфокарты стали использовать и в других отраслях промышленности.</p><p>В 1884 году американский инженер Герман Холлерит получил патент на табулятор — машину, способную считывать перфокарты и производить вычисления. С помощью этой техники в США <a href="http://www.columbia.edu/cu/computinghistory/census-tabulator.html">провели</a> перепись населения 1890 года. И новаторов ждал успех: предварительные результаты подсчитали в течение шести недель после переписи, а весь объём информации обработали в течение двух лет. Данные с формуляров набивали на перфокарты с помощью перфораторов. В табуляционную машину вводилась колода заранее подготовленных перфокарт, и далее всё происходило без вмешательства человека: считывание информации с перфокарт и проведение необходимых вычислительных операций.</p><p>В 1896 году Герман Холлерит открыл свою фирму по производству табуляторов. Через столетие весь мир узнал её как International Business Machines Corporation или IBM.</p><p>Вскоре появилась прародительница дискет и жёстких дисков — магнитная лента. В 1928 году немецкий инженер Фриц Пфлеймер <a href="https://history-computer.com/magnetic-tape/">запатентовал</a> это изобретение: с помощью магнитов он записал информацию на тонкую бумагу, покрытую порошком оксида железа. Именно с Пфлеймера началась эра хорошо знакомых нам плёночных кассет для записи звука и видео.</p><p>Они быстро вытеснили цилиндры и диски для фонографов, граммофонов и патефонов: магнитные ленты были дешевле, вместительнее и долговечнее. По некоторым показателям ленты превосходят и современные накопители — поэтому их до сих пор <a href="https://home.cern/news/news/computing/lhc-pushing-computing-limits">используют</a> в таких крупных дата-хранилищах как у Google и Европейского Центра ядерных исследований (CERN).</p><p>Во время Второй мировой войны военные остро нуждались в шифровке и дешифровке информации: с одной стороны, необходимо было координировать свои действия, скрывая это от врага, с другой — перехватывать секретные данные. Это <a href="https://www.kaspersky.ru/blog/ww2-enigma-hack/7715/">спровоцировало</a> разработку кардинально новых методов и инструментов для защиты данных.</p><p>Однако возможности обработки данных всё ещё были ограничены. Многие организации продолжали полагаться на ручной учёт и бумажные архивы до конца XX века.</p><h2>Наука о данных</h2><p>Следующий принципиально новый уровень работы с данными начался с появления ЭВМ в 40-е. А в 1948 году американский инженер и математик Клод Шеннон — позже его назвали «отцом информационного века» — <a href="https://www.themarginalian.org/2016/09/06/james-gleick-the-information-claude-shannon/">ввёл</a> понятия информации и бита как единицы измерения. Вскоре бит стал такой же базовой величиной, как дюйм или фунт.</p><p>Одним из первых инновациями воспользовалось то же Бюро переписи населения США — в итоге с ЭВМ обработка данных о переписи 1950 года <a href="https://time.com/4271506/census-bureau-computer-history/">заняла</a> несколько месяцев. Это был настоящий прорыв.</p><p>Через несколько лет появились глобальные организации по работе с данными. В 1960-м — Международная федерация по обработке информации (IFIP). Она <a href="https://arxiv.org/pdf/2301.13761.pdf">дала</a> определение данным, назвав их «формальным представлением фактов или идей, которые можно передавать и которыми можно управлять каким-либо способом». В 1966 году <a href="https://council.science/ru/about-us/">Международный совет по науке</a> открыл Комитет по данным для науки и техники (CODATA). С тех пор он разрабатывает стандарты для работы с информацией.</p><p>В 70-е британский учёный Эдгар Кодд <a href="https://www.ibm.com/ibm/history/ibm100/us/en/icons/reldb/">разработал</a> реляционную модель — она стала классикой структурирования данных и популярна до сих пор. Благодаря этой модели можно быстро находить связи в массивах данных: выполнять поиск по множествам таблиц с помощью одного запроса.</p><p>А американский математик Джон Тьюки <a href="https://coderlessons.com/tutorials/bolshie-dannye-i-analitika/izuchite-analitiku-bolshikh-dannykh/analitika-bolshikh-dannykh-issledovanie-dannykh">предсказал</a>, как будет эволюционировать работа с данными благодаря компьютерам — в 1977 году он опубликовал работу «Исследовательский анализ данных» и предложил одноимённую концепцию. Позже она легла в основу изучения больших данных.</p><p>И, наконец, появился официальный термин Data Science. Датский инноватор Петер Наур в своей книге «Краткий обзор компьютерных методов» 1974 года <a href="https://digitalcollection.zhaw.ch/bitstream/11475/24982/3/2022_Schilling-etal_Foundation-of-Data-Science_ISSDS2021-Summary.pdf">определил</a>, что наука о данных изучает жизненный цикл цифровой информации — от возникновения до преобразования и использования в других областях знаний.</p><h2>Соцсети, ИИ и Big Data</h2><p>В конце XX века распространяется Интернет, появляются социальные сети и данные растут в геометрической прогрессии.</p><p>В нулевых научные организации, СМИ и корпорации начинают провозглашать Data Science как новую дисциплину — и <a href="https://www.mckinsey.com/industries/technology-media-and-telecommunications/our-insights/hal-varian-on-how-the-web-challenges-managers">говорить</a> о необходимости её внедрения в бизнес-процессы. В 2006-м Томас Дэвенпорт, учёный, специализирующийся на аналитике и инновациях, <a href="https://www.researchgate.net/publication/7327312_Competing_on_Analytics">заявляет</a>, что теперь бизнес будет конкурировать за счёт умения собирать, анализировать данные — и прогнозировать на их основе.</p><p>В 2008 году Nature <a href="https://www.nature.com/nature/volumes/455/issues/7209">посвящает</a> спецвыпуск журнала взрывному росту объёма информации и впервые использует словосочетание «большие данные» — так начинается формироваться концепция Big Data. А в 2012-м Harvard Business Review <a href="https://hbr.org/2012/10/data-scientist-the-sexiest-job-of-the-21st-century">провозглашает</a>: «дата сайентист — самая сексуальная профессия 21 века».</p><p>Сейчас мы генерируем данные постоянно: пока делаем покупки, ходим на медицинские осмотры и листаем ленты социальных сетей. Прогнозируется, что к 2024-му человечество <a href="https://www.statista.com/statistics/1185888/worldwide-global-datasphere-unique-replicated-data/">нагенерирует</a> около 150 зеттабайт данных. Это в 2,5 раза больше, чем в 2020-м. А значит, современных вычислительных мощностей скоро будет недостаточно — человечеству нужны кардинально новые технологии для хранения и обработки данных, такие как искусственный интеллект и квантовые вычисления.</p><h2>Датацентричная организация</h2><p>Газпромбанк развивается как датацентричная организация — это одно из направлений нашей стратегии. В банке мы используем как классические подходы для работы с данными, так и алгоритмы и модели собственной разработки. Мы также создаем новую инфраструктуру для хранения и обработки данных. О том, как мы автоматизировали обработку данных, можно прочитать в этой <a href="https://habr.com/ru/companies/gazprombank/articles/712214/">статье.</a></p><p>Недавно мы запустили <a href="https://gpb.fut.ru/levelup">программу</a> cтажировок для старшекурсников, выпускников и начинающих специалистов по направлению Data Science и Machine Learning. О новых наборах объявим в нашем блоге, так что подписывайтесь и следите за новостями. А наши вакансии по всем направлениям можно посмотреть <a href="https://www.gpbspace.ru/vacancies/">здесь.</a></p>]]></content:encoded>
    </item>
    <item>
      <title>Построй ML-модель для Газпромбанка и выиграй миллион</title>
      <link>https://tproger.ru/articles/postroj-ml-model-dlya-gazprombanka-i-vyigraj-million-erid-ljn8kcpx9</link>
      <comments>https://tproger.ru/articles/postroj-ml-model-dlya-gazprombanka-i-vyigraj-million-erid-ljn8kcpx9?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Василиса Белокопытова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/postroj-ml-model-dlya-gazprombanka-i-vyigraj-million-erid-ljn8kcpx9</guid>
      <description><![CDATA[<p>Газпромбанк подготовил задачу для хакатона «Лидеры цифровой трансформации», за решение которой можно выиграть приз.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/postroj-ml-model-dlya-gazprombanka-i-vyigraj-million-erid-ljn8kcpx9">Построй ML-модель для Газпромбанка и выиграй миллион</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Соревнования]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 11 May 2023 11:59:02 GMT</pubDate>
      <content:encoded><![CDATA[<p><i>Газпромбанк выступает партнёром самого масштабного хакатона страны «Лидеры цифровой трансформации». Мы подготовили для конкурса свою задачу, решив которую можно выиграть ценный приз. Держите подробности.</i></p><figure><img src="https://media.tproger.ru/uploads/2023/05/2129e392-1aa3-495d-bd64-fa4294137f47.jpeg" alt="" /></figure><p>В Москве проходит конкурс «Лидеры цифровой трансформации». Это большой хакатон, участники которого придумывают решения актуальных для столицы задач. Подать заявку на участие может команда из любого города, не только из Москвы. Проект даëт возможность превратить свою идею в технологию, которая принесёт пользу Москве.</p><p>Общий призовой фонд — 42 млн рублей. Заявки на участие принимаются на <a href="https://leaders2023.innoagency.ru/?utm_source=partner&amp;utm_medium=aim&amp;utm_campaign=gazprombank">сайте конкурса</a> до 21 мая. И там же можно посмотреть задачи.</p><p>Вот какую задачу подготовили наши эксперты. Клиенты Газпромбанка пользуются платёжными терминалами для внесения наличных. У каждого из них разная скорость наполнения, зависящая от расположения и клиентопотока в локации. Участникам конкурса предлагается разработать <b>модель по построению оптимальных маршрутов инкассации платёжных терминалов.</b></p><h2>Что нужно сделать</h2><p>Разработать модель, которая будет на ежедневной основе выбирать для обслуживания платёжные терминалы и планировать маршруты их объезда, учитывая бизнес-ограничения по следующим показателям:</p><p>— максимальный период времени, в течение которого надо обслужить терминал;</p><p>— лимиты наполняемости терминала;</p><p>— затраты на обслуживание терминала и издержки на неутилизированный остаток.</p><p><b>Призовой фонд задачи:</b></p><p>1 место — 1 000 000 ₽</p><p>2 место — 600 000 ₽</p><p>3 место — 400 000 ₽</p><p>Решить задачу надо до 28 мая. Победителей объявят во время масштабного фестиваля, который состоится в Москве с 10 по 12 июня.</p><p>Авторам самых интересных решений предложим обсудить возможность получить работу в банке или пройти стажировку.</p><p><i>Реклама АО «Газпромбанк» LjN8KCPx9</i></p>]]></content:encoded>
    </item>
    <item>
      <title>Дайджест Python #8: обновления Django и обучение GPT-4</title>
      <link>https://tproger.ru/articles/python-digest-8</link>
      <comments>https://tproger.ru/articles/python-digest-8?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Рафаил Агазода]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/python-digest-8</guid>
      <description><![CDATA[<p>Собрали дайджест из материалов по Python с 15 по 30 апреля. Узнайте, как подключить AutoGPT проекту, как изменился Django и как обучить GPT-4.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/python-digest-8">Дайджест Python #8: обновления Django и обучение GPT-4</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Django]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 03 May 2023 11:58:50 GMT</pubDate>
      <content:encoded><![CDATA[<p>Собрали дайджест из лучших материалов по Python с 15 по 30 апреля, которые только смогли найти. Дайджест включает статьи и видео на русском и английском языках.</p><p>Узнайте, как подключить AutoGPT к своему проекту, какие обновления затронули Django и как обучить GPT-4 новым данным.</p><h2>Big Data / Data Science</h2><ul><li><a href="https://habr.com/ru/articles/731596/">Как мы делали скоринг на микросервисной архитектуре руками не-программистов</a></li><li><a href="https://habr.com/ru/articles/730860/">Сам себе Росстат</a></li><li><a href="https://habr.com/ru/companies/uchi_ru/articles/730330/">Real-time аналитика в Учи.ру: как смотреть сложные метрики</a></li><li><a href="https://habr.com/ru/companies/otkritie/articles/732216/">Новые горизонты в оценке рисков: как источники данных помогают создать точные модели</a></li><li>EN <a href="https://habr.com/ru/articles/731158/">DataHub: веб-песочница для тех, кто изучает SQL</a></li><li>EN <a href="https://pub.towardsai.net/all-statistical-tests-using-python-mastering-statistics-part-1-996346d5add5">All Statistical Tests using Python: Mastering Statistics | Part — 1</a></li><li>EN <a href="https://towardsdatascience.com/getting-started-with-langchain-a-beginners-guide-to-building-llm-powered-applications-95fc8898732c">Getting Started with LangChain: A Beginner’s Guide to Building LLM-Powered Applications</a></li><li>EN <a href="https://towardsdatascience.com/the-next-big-crisis-for-data-teams-58ac2bd856e8">The Next Big Crisis for Data Teams</a></li><li>EN <a href="https://towardsdatascience.com/the-best-learning-paths-for-ai-and-data-leadership-fabc3d4f8e36">The Best Learning Paths for AI and Data Leadership</a></li><li>EN <a href="https://towardsdatascience.com/is-pandas-easy-to-use-try-this-tool-to-make-it-easier-2071eeffe482">PandasGUI — The Ultimate Secret to Effortless Data Analysis</a></li><li>EN <a href="https://levelup.gitconnected.com/exploratory-data-analysis-the-ultimate-workflow-a82b1d21f747">Exploratory Data Analysis: The Ultimate Workflow</a></li></ul><h2>AI и ML</h2><ul><li><a href="https://habr.com/ru/articles/730300/">Об инициации весов при обучении нейронных сетей. Личный опыт и рассуждения</a></li><li><a href="https://habr.com/ru/articles/731056/">GPT-4 добавляем новые знания: Git репозиторий</a></li><li><a href="https://habr.com/ru/news/730814/">Google дала Bard возможность создавать код на 20 языках, включая C++, Go, Java, Javascript, Python, Typescript</a></li><li><a href="https://habr.com/ru/articles/729380/">Пишем простой ML веб-сервис на FastAPI</a></li><li><a href="https://habr.com/ru/companies/ods/articles/729662/">Создай своего ИИ-ассистента с помощью ChatGPT и Streamlit</a></li><li>EN <a href="https://betterprogramming.pub/gpt4all-running-an-open-source-chatgpt-clone-on-your-laptop-71ebe8600c71">GPT4All: Running an Open-source ChatGPT Clone on Your Laptop</a></li><li>EN <a href="https://artificialcorner.com/how-to-easily-install-auto-gpt-the-autonomous-gpt-4-everyone-is-talking-about-5a0ee4e1f39e">How to Easily Install Auto-GPT: The Autonomous GPT-4 Everyone is Talking About</a></li><li>EN <a href="https://medium.com/codingthesmartway-com-blog/discover-thinkgpt-the-cutting-edge-python-library-that-transforms-ai-into-a-powerful-thinking-c7e588bd28b4">Discover ThinkGPT: The Cutting-Edge Python Library that Transforms AI into a Powerful Thinking Machine</a></li></ul><h2>Веб / Django / Flask</h2><ul><li><a href="https://habr.com/ru/articles/732164/">PyCharm Docker Django Debug</a></li><li><a href="https://habr.com/ru/articles/730238/">Простая очередь задач в Django, подключение Kandinsky 2.1</a></li><li><a href="https://habr.com/ru/articles/729844/">403, 404 или 405. Разбираемся со статусами во ViewSet’ах DRF</a></li><li><a href="https://habr.com/ru/articles/729610/">Связь Django и PostgreSQL внутри Docker</a></li><li><a href="https://habr.com/ru/companies/yandex_praktikum/articles/727626/">Релиз Django LTS 4.2: обзор изменений и необходимости обновления</a></li><li>EN <a href="https://awstip.com/handling-a-million-tasks-in-django-efficient-prioritization-with-celery-redis-and-flower-b06fc8957d5">Handling a Million Tasks in Django: Efficient Prioritization with Celery, Redis, and Flower</a></li><li>EN <a href="https://mobileappcircular.com/the-road-less-traveled-exploring-the-advanced-features-of-django-%EF%B8%8F-9373716b8539">The Road Less Traveled: Exploring the Advanced Features of Django </a></li><li>EN <a href="https://medium.com/@amirayat20/recommended-stack-for-your-django-project-91f9a3016007">Recommended stack for your Django Project</a></li></ul><h2>Скрипты, приложения и боты</h2><ul><li><a href="https://tproger.ru/articles/kak-rabotaet-funkciya-print-v-python/">Как работает функция print в Python</a></li><li><a href="https://habr.com/ru/companies/ruvds/articles/732530/">Ускоряем Python в сто раз при помощи менее чем ста строк на Rust</a></li><li><a href="https://habr.com/ru/articles/732638/">Проверка GIL в python</a></li><li><a href="https://habr.com/ru/companies/otus/articles/732562/">Создание DSL на Python с библиотекой textx</a></li><li><a href="https://habr.com/ru/articles/732388/">7 подходов к проверке атрибутов классов в Python</a></li><li><a href="https://habr.com/ru/companies/piter/articles/732310/">Оптимизируем использование памяти в приложениях Python</a></li><li><a href="https://habr.com/ru/articles/731484/">Сколько Надо Строк Кода Для Того Чтобы Подписать Артефакты?</a></li><li><a href="https://habr.com/ru/news/731118/">В репозитории PyPI внедрили опцию публикации пакетов без привязки к паролям и токенам API</a></li><li><a href="https://habr.com/ru/companies/selectel/articles/729856/">Как подключить платежную систему с Payments к Telegram</a></li><li>EN <a href="https://levelup.gitconnected.com/20-python-concepts-i-wish-i-knew-way-earlier-573cd189c183">20 Python Concepts I Wish I Knew Way Earlier</a></li></ul><h2>Развлекательный контент</h2><ul><li><a href="https://habr.com/ru/companies/selectel/articles/729828/">Проверяем ветхозаветную историю происхождения человечества от Адама и Евы с помощью популяционной модели</a></li><li>Видео <a href="https://www.youtube.com/watch?v=2Qwte6Ka630&amp;ab_channel=MoscowPython">Обучение подростков и взрослых Python в 2023 году / Программирование — вторая грамотность</a></li><li>Видео  <a href="https://www.youtube.com/watch?v=kPWk2ufDuEk&amp;ab_channel=TalkPython">Live from PyCon 2023 – Talk Python #413</a></li><li>Видео  <a href="https://www.youtube.com/watch?v=ZNSsxb0NrI4&amp;ab_channel=Changelog">Unpopular opinion! Python 3.11 is going to kill Go</a></li></ul><p>Нашли что-нибудь полезное и интересное для себя? Расскажите, какой раздел показался вам самым интересным, а каких статей не хватило, чтобы следующий дайджест получился ещё лучше.</p><p>Если дайджест вам понравился, посмотрите две предыдущие подборки:</p><p>А ещё присылайте в комментарии статьи и видео, которые ускользнули от нашего взгляда и не попали в дайджест. Поделитесь полезными материалами с другими читателями! 😉</p>]]></content:encoded>
    </item>
    <item>
      <title>Дата-аналитик и ML-инженер: разбираем обязанности специалистов</title>
      <link>https://tproger.ru/articles/data-analitik-i-ml-inzhener-razbiraem-obyazannosti-specialistov</link>
      <comments>https://tproger.ru/articles/data-analitik-i-ml-inzhener-razbiraem-obyazannosti-specialistov?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Вика Овсянникова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/data-analitik-i-ml-inzhener-razbiraem-obyazannosti-specialistov</guid>
      <description><![CDATA[<p>Рассказываем, чем занимается ML-инженер на примере задач в Дзене и разбираемся, как с этим связан дата-аналитик.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/data-analitik-i-ml-inzhener-razbiraem-obyazannosti-specialistov">Дата-аналитик и ML-инженер: разбираем обязанности специалистов</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Карьера]]></category>
      <category><![CDATA[Анализ данных]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 21 Apr 2023 05:46:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>Продукт можно разделить на две глобальные части: продакт-менеджмент и разработку. Первая помогает принимать решения, которые основаны на рыночных или внутренних данных компании. Вторая воплощает эти решения в жизнь. Если в продукте пытаются предугадать, что понравится пользователям, и оперируют большим количеством данных, роли разработчика и продуктового аналитика трансформируются в ML-инженера и аналитика данных.</p><h2>Над какими задачами работает аналитик данных</h2><p>В построении ленты Дзена есть много аспектов, которые можно совершенствовать.</p><ul><li>Достаточно ли разнообразные документы отображаются?</li><li>Строится ли лента рекомендаций с учётом форматных предпочтений пользователя — текстов, постов или видео?</li><li>Достаточно ли контент увлекательный, чтобы пользователь вернулся в сервис?</li><li>Понимают ли авторы, что нужно делать, чтобы находить своего читателя, «залетать» в широкие рекомендации и набирать подписочную базу?</li></ul><p>Аналитик данных исследует все эти вопросы. Он эксперт по измерениям. Его задача не просто предлагать изменения в сервисе, основываясь на своём мнении, а по внутренним и внешним данным выводить метрики, которые растят ML-инженеры и продакт-менеджеры.</p><p>Особенность многих задач аналитики в Дзене в том, что нужно держать в голове интересы трёх сторон: пользовательского блока, авторского и бизнесового.</p><p>Например, мы хотим начать показывать в ленте больше контента от авторов, на которых пользователь подписался. Это кажется логичным, ведь подписка — это ценный и понятный сигнал. Но если начать разбираться, то могут получиться противоречивые результаты.</p><p>Больше подписного контента помогает авторам донести свои материалы до пользователей, а пользователям читать тех, кто им интересен. В то же время можно быстро попасть в «пузырь», когда читатель после нескольких подписок больше не видит материалов других авторов. Одновременно с этим авторы, которые не успели набрать свою аудиторию, не понимают, как им расти и набирать подписки. Это к тому же влияет на выручку компании. И аналитик должен разобраться, стоит ли выкатывать такое изменение, объяснить его влияние на метрики в моменте и спрогнозировать ситуацию в долгосрочной перспективе.</p><p>У аналитика много исследовательских задач, связанных с поиском проблем и точек роста сервиса. Например, пользователи, которым нравится гейминг, реже пользуются Дзеном и остаются в продукте. Значит, нужно изменить алгоритмы этой тематики. Для этого нужно сделать deep dive, чтобы понять, чего именно там не хватает. Может, нужно поменять контент или форматы материалов, или привлечь новых авторов, пишущих на эту тему.</p><p>Помимо поиска точек роста, аналитик вовлечён в широкий спектр процессов компании. Он оценивает перспективность идей и возможный эффект от них до начала реализации. Для этого он находит метрики, по которым будет приниматься решение о пользе изменения. Если таких метрик ещё нет, то создаёт их и валидирует. Дата-аналитик генерирует гипотезы, проверяет их, проводит A/B тесты, анализирует результаты и выносит свой вердикт.</p><p>Аналитик данных может и обучать модель, если она нужна для прогнозирования нужного показателя, но он не углубляется в инженерную специфику. Чтобы выкатить модель в прод, нужны ресурсы разработки. Тогда аналитик ставит разработчикам подробное ТЗ для модели: например, какие данные нужно поставлять, какие ограничения на скорость установить и к какому целевому показателю качества стремиться. Это будут реализовывать уже ML-инженеры.</p><h2>Какие знания нужны дата-аналитику</h2><ul><li>Обладать продуктовым мышлением. Нужно понимать потребности бизнеса и уметь прозрачно доносить свои мысли.</li><li>Делать простые запросы в базы данных, знать SQL.</li><li>Писать простой код на Python для анализа данных и визуализации.</li><li>Разбираться в статистических методах анализа данных.</li><li>Ориентироваться в основах ML: что такое таргет в модели, на основе каких данных она считается.</li></ul><p>Такая комбинация hard- и soft-скилов необходима, так как дата-аналитик, по сути, является связующим звеном между продуктом и разработкой. Он помогает ML-инженерам понять, как их изменения влияют на пользователей сервиса и бизнес в целом, а продакт-менеджерам предлагает варианты применения ML для решения задач.</p><p><i>Подробнее узнать требования к роли специалиста по анализу данных можно в вакансиях аналитика качества поиска и аналитика краудсорса.</i></p><h2>Над какими задачами работает ML-инженер</h2><p>ML-инженеры умеют не только обучать модели машинного обучения, но и доводить их до высоконагруженного прода, находя компромисс между сложностью и эффективностью моделей. Они знают, как правильно применять алгоритмы, как эффективно построить систему в проде, чтобы она быстро работала.</p><p>Вот как, например, выглядит работа с холодной лентой в Дзене.</p><p>Большинство пользователей уже давно присутствуют на платформе. Они лайкают статьи, подписываются на авторов, за это уже можно цепляться и что-то им рекомендовать. И есть пользователи, которые пришли в приложение в первый раз, или пассивные пользователи, которые заходят часто, но никуда не кликают. Для них сложно подобрать рекомендации, потому что информации об их интересах мало.</p><p>Для начала контент можно показывать максимально разнообразно по темам. Не будем показывать всем только борщи или машины, покажем микс — может, что-то зацепит. Если есть хотя бы один позитивный отклик на что-нибудь в этой ленте, то уже можно перестраивать рекомендации, используя сложные модели.</p><p>При этом также можно использовать внешние данные: какие характерные для своей категории сайты посещает пользователь, например, люди определённого возраста. По визитам в интернете и cookie в браузере можно предсказать пол, возраст и строить дальнейшие рекомендации.</p><p>Также ML-инженер умеет подбирать факторы — характеристики, помогающие предсказывать поведение пользователей. В холодной ленте кроме соцдема и быстрой адаптации под пользователя с технической стороны практически больше ничего не нужно. В ленте для горячих пользователей, у которых много кликов, всё интереснее. Нужно из миллионов публикаций выбрать несколько десятков, которые поместятся на экране для показа. Как это сделать?</p><p>Мы это делаем в два этапа. Первый — отбор кандидатов. Из миллионов мы находим тысячи грубым быстрым способом: кто что раньше лайкал, смотрел и читал, и подбираем связанные материалы. Они могут быть связаны тематически, или это может быть тот же автор. Второй этап — ранжирование тысяч отобранных кандидатов с использованием более сложных моделей, вроде нейросети и градиентного бустинга. Достаточно за раз отдать пользователю 20 рекомендаций и подгружать дополнительные по мере необходимости, пока пользователь крутит ленту.</p><figure><img src="https://media.tproger.ru/uploads/2023/04/c63b19ee-f21e-46b6-bb67-409b169ee727.png" alt="" /><figcaption>Схема процесса подбора рекомендаций</figcaption></figure><p>Пользователю может быть интересно много разных тем, он читает их с разной периодичностью. ML-инженер должен узнать, что прямо сейчас на этом устройстве в это время суток лучше показать, в каких пропорциях, в каком формате.</p><p>Можно проверить такой фактор: как часто пользователь смотрит посты в определённой теме. Допустим, в теме «Кино» он тратит в среднем минуту на показ, а в теме «Искусство» — две минуты. Модель учтёт, что пользователь смотрит чаще, и покажет скорее «Искусство», чем «Кино». Дальше этот фактор нужно внедрить во всю нашу инфраструктуру: добавить этот показатель в обучение модели и на бэкенд.</p><h2>Какие знания нужны ML-инженеру</h2><ul><li>Уметь писать алгоритмы. Важно, чтобы у кандидата было алгоритмическое мышление. Мы можем дать такую задачу: в строке с пробелами некоторые повторены несколько раз, нужно их соединить в один.</li><li>Знать основы машинного обучения. Мы даём проблему, просим поставить задачу машинного обучения, придумать, какие характеристики нужно использовать, чтобы её решить, как оценивать решение, и какие могут быть проблемы при внедрении.</li><li>Писать код на Python для построения моделей.</li><li>Знать SQL-подобный язык для запросов к данным. Например, Hive. Это нужно, чтобы провести первичную аналитику, собрать семпл или построить простые графики.</li><li>Развёртывать модели в продакшене. Мы используем Java, потому что Python медленный. При этом мы не требуем наличие Java на входе, языку мы готовы научить.</li></ul><p><i>Также можно посмотреть, какие ещё навыки нужны ML-разработчику и Java-разработчику в ML-команду.</i></p><p>Для нас ML-инженер — это специалист, который разбирается и в программировании, и в ML. В огромных компаниях с тысячами специалистов в штате бывает и более чёткое разделение обязанностей: кто-то делает прототипы, а кто-то потом их внедряет. Когда команда небольшая, то удобнее, чтобы у специалиста были обе компетенции. Так он сможет и понять задачу бизнеса, и сделать прототип, и довести её до конца — для компании это очень ценный профессионал.</p>]]></content:encoded>
    </item>
    <item>
      <title>Дайджест Python #7: аналоги ChatGPT и обновления фреймворков</title>
      <link>https://tproger.ru/articles/python-digest-7</link>
      <comments>https://tproger.ru/articles/python-digest-7?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Рафаил Агазода]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/python-digest-7</guid>
      <description><![CDATA[<p>Собрали лучшие новости о Python с 1 по 15 апреля. Узнайте, как написать свой Duolingo и как изменились фреймворки для работы с Big Data.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/python-digest-7">Дайджест Python #7: аналоги ChatGPT и обновления фреймворков</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Django]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 17 Apr 2023 07:30:39 GMT</pubDate>
      <content:encoded><![CDATA[<p>Собрали дайджест из лучших материалов по Python с 1 по 15 апреля, которые только смогли найти. Дайджест включает статьи и видео на русском и английском языках.</p><p>Узнайте, какие существуют альтернативы ChatGPT, как написать собственный Duolingo и как изменились фреймворки Python для работы с BigData.</p><h2>Big Data / Data Science</h2><ul><li><a href="https://habr.com/ru/articles/729268/">Как IT-специалисты-экологи спасут планету</a></li><li><a href="https://habr.com/ru/companies/magnit/articles/728676/">Лучшие практики при работе с мастер-данными</a></li><li><a href="https://habr.com/ru/companies/glowbyte/articles/728680/">FineBI 6.0: 9 полезных обновлений, о которых вы не знали</a></li><li><a href="https://habr.com/ru/articles/728204/">Производительность и стабильность Knime на слабых компьютерах</a></li><li><a href="https://habr.com/ru/companies/otus/articles/728118/">Полезные методы работы с данными в Pandas. Часть 2</a></li><li><a href="https://habr.com/ru/articles/727560/">Основные инструменты для работы в Data Engineering: введение для начинающих Data Engineer’ов</a></li><li><a href="https://habr.com/ru/articles/729292/">Экспресс-анализ данных на Python</a></li><li><a href="https://habr.com/ru/articles/728256/">Пишем приложение на Python для интерактивной визуализации графов с NetworkX, Plotly и Dash</a></li><li><a href="https://habr.com/ru/articles/726468/">Начинаем работу с PyTorch 2.0 и Hugging Face Transformers</a></li><li>%save-sc0% Data structures in Computer Science</li><li>%save-sc1% From Kafka to Amazon S3: Partitioning Outputs</li><li>%save-sc2% Data Reduction and Why It Is Important For Edge Computing</li><li>%save-sc3% Driving Business Success: Unleashing the Power of Data Integration</li></ul><h2>AI и ML</h2><ul><li><a href="https://habr.com/ru/companies/wunderfund/articles/728030/">Ускорение работы моделей Stable Diffusion на процессорах Intel</a></li><li><a href="https://habr.com/ru/articles/727986/">О чём все эти люди говорят, ChatGPT?</a></li><li><a href="https://habr.com/ru/articles/727804/">Savant: новый высокопроизводительный фреймворк Python для видеоаналитики на оборудовании Nvidia</a></li><li><a href="https://habr.com/ru/articles/726468/">Начинаем работу с PyTorch 2.0 и Hugging Face Transformers</a></li><li><a href="https://habr.com/ru/articles/727484/">Распознаем автомобильные номера на TorchServe</a></li><li><a href="https://habr.com/ru/articles/727348/">Как я решила попробовать себя в ML: анализ эмоциональной окраски отзывов с Кинопоиска 2.0</a></li><li><a href="https://habr.com/ru/companies/doubletapp/articles/726898/">Руки на руль: Bus Factor следит за тобой</a></li><li><a href="https://habr.com/ru/articles/729158/">OpenAssistant: Вышла бесплатная открытая альтернатива ChatGPT</a></li><li><a href="https://habr.com/ru/articles/728678/">Чем отличаются ChatGPT3 и ChatGPT4?</a></li><li><a href="https://habr.com/ru/articles/728298/">Запуск аналогов ChatGPT на домашнем ПК в пару кликов и с интерфейсом</a></li><li>%save-sc4% Generating Images from Text with C# and Open AI DALL-E</li><li>%save-sc5% Google and Stanford Creates a Matrix With Chat-GPT Instances</li><li>%save-sc6% Create a ChatGPT Plugin to retrieve NASA images</li></ul><h2>Веб / Django / Flask</h2><ul><li><a href="https://habr.com/ru/companies/yandex_praktikum/articles/727626/">Релиз Django LTS 4.2: обзор изменений и необходимости обновления</a></li><li><a href="https://habr.com/ru/articles/727936/">Интеграция и кастомизация OpenAPI в Django/Django Rest Framework</a></li><li><a href="https://habr.com/ru/articles/726504/">Обучаем с помощью LlamaIndex и OpenAI GPT-3 отвечать по вашей базе знаний</a></li><li>%save-sc7% Create a Modern Application with Django and Vue</li><li>%save-sc8% Mastering Django: Best Practices for Writing High-Quality Web Applications</li><li>%save-sc9% How To Revert Migration In Django?</li><li>%save-sc10% Understanding QuerySets in Django</li><li>%save-sc11% 10 Must-See Django Open-Source Projects to Inspire Your Next Web App</li><li>%save-sc12% 17 Django Tips and Tricks for Optimizing Your Application</li></ul><h2>Скрипты, приложения и боты</h2><ul><li><a href="https://habr.com/ru/articles/727400/">EasySteamPaybot или как я помогал людям пополнять Steam</a></li><li><a href="https://habr.com/ru/articles/729036/">Как сделать торгового робота для Binance</a></li><li><a href="https://habr.com/ru/articles/728846/">Как перестать беспокоиться и установить Python-проект другу под Windows</a></li><li><a href="https://habr.com/ru/articles/728194/">Восемь признаков недо-yield вашего проекта на Python</a></li><li><a href="https://habr.com/ru/companies/swd_es/articles/726196/">Методика портирования пакетов Python в операционную систему «Нейтрино»</a></li><li><a href="https://habr.com/ru/articles/727900/">Пишем свой личный Duolingo на минималках</a></li><li><a href="https://habr.com/ru/articles/727836/">DSL фреймворк для создания Telegram ботов</a></li><li><a href="https://habr.com/ru/articles/727718/">Project_2. Местоположение с помощью IP-адреса (Python)</a></li><li><a href="https://habr.com/ru/companies/kts/articles/727528/">Визуализация 5 алгоритмов сортировки на Python</a></li><li>%save-sc13% Linting Python in VS Code [Video]</li><li>%save-sc14% Building a Simple Web Scraper with Python and BeautifulSoup</li></ul><h2>Развлекательный контент</h2><ul><li>%save-sc15% LTS-релиз Django 4.2 / вышли PyTorch 2.0 и Pandas 2.0 / свежие PEP</li><li>%save-sc16% Python Channel</li><li>%save-sc17% The History of AI</li></ul><p>Нашли что-нибудь полезное и интересное для себя? Расскажите, какой раздел показался вам самым интересным, а каких статей не хватило, чтобы следующий дайджест получился ещё лучше.</p><p>Если дайджест вам понравился, посмотрите две предыдущие подборки:</p><p>А ещё присылайте в комментарии статьи и видео, которые ускользнули от нашего взгляда и не попали в дайджест. Поделитесь полезными материалами с другими читателями! ?</p>]]></content:encoded>
    </item>
    <item>
      <title>Дайджест Python #6: как заказать столик в ресторане через ChatGPT и почему лень — не порок</title>
      <link>https://tproger.ru/articles/dajdzhest-pitona-4-aprelya</link>
      <comments>https://tproger.ru/articles/dajdzhest-pitona-4-aprelya?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Рафаил Агазода]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/dajdzhest-pitona-4-aprelya</guid>
      <description><![CDATA[<p>Собрали дайджест из статей про Python с 16 по 31 марта. Узнайте, как инвестировать при помощи Big Data и как создать голосовой помощник.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/dajdzhest-pitona-4-aprelya">Дайджест Python #6: как заказать столик в ресторане через ChatGPT и почему лень — не порок</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Django]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 04 Apr 2023 08:14:46 GMT</pubDate>
      <content:encoded><![CDATA[<p>Собрали дайджест из лучших материалов по Python с 16 по 31 марта, которые только смогли найти. Дайджест включает статьи и видео на русском и английском языках.</p><p>Узнайте, как заказать столик в ресторане при помощи ChatGPT, как инвестировать эффективнее при помощи Big Data, как создать свой голосовой помощник и почему лень — это не порок.</p><h2>Big Data / Data Science</h2><ul><li><a href="https://habr.com/ru/company/skillfactory/blog/725972/">msgspec: быстрый и экономичный парсинг JSON на Python</a></li><li><a href="https://habr.com/ru/company/tochka/blog/725722/">Консистентность в конкуретной среде: как не захлебнуться в потоках данных</a></li><li><a href="https://habr.com/ru/post/723542/">Почему Data Science не для вас?</a></li><li><a href="https://habr.com/ru/company/otkritie/blog/722882/">Дублирующий скрипт: как с его помощью мы ускорили бизнес-процесс с двух рабочих дней до семи минут</a></li><li><a href="https://habr.com/ru/post/721170/">Синтетические данные для машинного обучения: их природа, типы и способы генерации</a></li><li>EN <a href="https://dev.to/documatic/graph-databases-vs-relational-databases-what-and-why-5d6g">Graph Databases vs Relational Databases: What and why?</a></li><li>EN <a href="https://itnext.io/the-ultimate-guide-to-pandas-read-csv-function-5377874e27d5">The ultimate guide to Pandas’ read_csv() function</a></li><li>EN <a href="https://www.reddit.com/r/Python/comments/11lyyzb/i_made_a_finance_database_with_over_300000/">I made a Finance Database with over 300.000 tickers to make Investment Decisions easier</a></li><li>EN <a href="https://medium.com/geekculture/so-you-recommended-a-python-time-series-package-now-what-94e7e3821ad5">So, You Recommended a Python Time-Series Package … Now What?</a></li><li>EN <a href="https://www.reddit.com/r/Python/comments/12b7w3y/everything_you_need_to_know_about_pandas_200/">Everything you need to know about pandas 2.0.0!</a></li></ul><h2>AI и ML</h2><ul><li><a href="https://habr.com/ru/post/726254/">Основы генеративно-состязательных сетей</a></li><li><a href="https://habr.com/ru/post/726244/">Учим английский с chatGPT</a></li><li><a href="https://habr.com/ru/company/otkritie/blog/725928/">ML-пайплайн классических банковских моделей классификации</a></li><li><a href="https://habr.com/ru/post/725704/">Как подружить Алису с ChatGPT</a></li><li><a href="https://habr.com/ru/post/725668/">Как создать свою собственную нейронную сеть с нуля на Python</a></li><li><a href="https://habr.com/ru/post/725066/">Ирина, голосовой помощник — теперь и со вкусом GPT-3</a></li><li><a href="https://habr.com/ru/post/723942/">Распознавание подачи в волейболе с помощью машинного обучения</a></li><li>EN <a href="https://dev.to/github/a-beginners-guide-to-prompt-engineering-with-github-copilot-3ibp">A Beginner’s Guide to Prompt Engineering with GitHub Copilot</a></li><li>EN <a href="https://dev.to/disukharev/opencommit-gpt-cli-to-auto-generate-impressive-commits-in-1-second-46dh">OpenCommit: GPT generates impressive commits in 1 second 🤯🔫 (open-source, 50k views)</a></li><li>EN <a href="https://dev.to/wesen/llms-will-fundamentally-change-software-engineering-3oj8">LLMs will fundamentally change software engineering</a></li><li>EN <a href="https://www.reddit.com/r/memes/comments/125qjqu/using_gpt4_and_dalle2_i_made_a_python_script_that/">Using GPT-4 and Dalle2, I made a Python script that auto-generates memes without any input…</a></li><li>EN <a href="https://www.reddit.com/r/Python/comments/123aiqk/introducing_gptty_v021_a_powerful_cli_wrapper_for/">Introducing gptty v0.2.1 – A Powerful CLI Wrapper for ChatGPT with Context Preservation &amp; Query Support, Now on PyPI!</a></li><li>EN <a href="https://www.reddit.com/r/Python/comments/11wb2vn/freetouse_gpt3_powered_commandline_shell_no/">Free-to-use GPT-3 powered command-line shell (no API-key required)</a></li></ul><h2>Веб / Django / Flask</h2><ul><li><a href="https://habr.com/ru/post/724852/">Декоратор cached_property</a></li><li><a href="https://habr.com/ru/post/723322/">Django DRF Sign-in with Apple</a></li><li><a href="https://habr.com/ru/post/723554/">Может ли chatGPT забронировать столик в ресторане через WhatsApp?</a></li><li>EN <a href="https://dev.to/onecuriousmindset/how-to-create-a-simple-web-app-with-python-and-flask-in-8-easy-steps-1kfo">How to Create a Simple Web App with Python and Flask in 8 Easy Steps</a></li><li>EN <a href="https://dev.to/pavanbelagatti/learn-how-to-test-flask-applications-with-pytest-o25">Learn How to Test Flask Applications with Pytest</a></li><li>EN <a href="https://dev.to/sridharcr/design-architecture-for-large-file-downloads-1ojn">Design architecture for large file downloads</a></li><li>EN <a href="https://dev.to/pavanbelagatti/learn-how-to-create-a-ci-pipeline-for-your-django-application-283d">Learn How to Create a CI Pipeline for Your Django Application</a></li><li>EN <a href="https://medium.com/@amaanabidi1234/implementing-multiple-user-types-in-django-afa7e637072e">Implementing Multiple User Types in Django</a></li><li>EN <a href="https://medium.com/@srinivasaravind5/turbocharge-your-django-application-mastering-database-partitioning-for-high-traffic-optimization-1c24031d34b8">Turbocharge Your Django Application: Mastering Database Partitioning for High Traffic Optimization</a></li></ul><h2>Скрипты, приложения и боты</h2><ul><li><a href="https://habr.com/ru/post/725930/">Ультимативный Roadmap для Python-разработчика в 2023 году + источники знаний</a></li><li><a href="https://habr.com/ru/post/725526/">Пишем простого бота-администратора для Telegram на Python. Тестируем на жене</a></li><li><a href="https://habr.com/ru/post/725406/">Как я чистила текст от ударений в словах при помощи Python</a></li><li><a href="https://habr.com/ru/post/725186/">7 уровней построения интерфейсов командной строки на Python</a></li><li><a href="https://habr.com/ru/post/673440/">Ломаем текстовую капчу на примере VK или брутфорсинг до сих пор актуален</a></li><li><a href="https://habr.com/ru/company/selectel/blog/724278/">Решаем задачу по взаимодействию микросервисов на Python тремя способами</a></li><li>EN <a href="https://dev.to/ringabout/contribute-to-the-python-like-nim-language-36b2">Contribute to the Python-like Nim language</a></li><li>EN <a href="https://www.reddit.com/r/Python/comments/11ts1qq/why_use_classes/">Why use classes?</a></li><li>EN <a href="https://www.reddit.com/r/Python/comments/126gnp4/nanobind_is_a_small_binding_library_that_exposes/">Nanobind is a small binding library that exposes C++ types in Python and vice versa</a></li><li>EN <a href="https://www.reddit.com/r/Python/comments/11zjjzy/arguments_against_separating_test_from_src_in_a/">Arguments against separating `test` from `src` in a python package?</a></li></ul><h2>Развлекательный контент</h2><ul><li><a href="https://habr.com/ru/company/otus/blog/723306/">История о том, как прочитать 120 тысяч анекдотов и не рассмеяться раньше времени</a></li><li><a href="https://habr.com/ru/company/timeweb/blog/723600/">Байки погромиста. Если кто-то скажет, что программирование — это скучно</a></li><li>EN <a href="https://dev.to/jmfayard/laziness-impatience-and-hubris-1ea9">I am a lazy developer</a></li><li>Видео <a href="https://www.youtube.com/watch?v=feg3DYywNys&amp;ab_channel=MoscowPython">Moscow Python Meetup №81. Вступление.</a></li><li>Видео <a href="https://www.youtube.com/watch?v=nApYYXYL9qA&amp;ab_channel=MoscowPython">Moscow Python Meetup №81. Николай Марков. Контейнерные змеи</a></li><li>Видео <a href="https://www.youtube.com/watch?v=cUGyMzWQcGM&amp;ab_channel=MoscowPython">Moscow Python Meetup №81. Евгений Соколов. Лучший язык — это… или Пайтон против Суслика</a></li><li>Видео <a href="https://www.youtube.com/watch?v=MtWXwMCAApY&amp;ab_channel=MoscowPython">Moscow Python Meetup №80. Максим Безруков. Кто такой syslog, зачем читать RFC-* и причём тут Django</a></li></ul><p>Нашли что-нибудь полезное и интересное для себя? Расскажите, какие материалы понравились вам больше всего, а каких статей не хватило, чтобы следующий дайджест получился ещё лучше.</p><p>Если дайджест вам понравился, посмотрите две предыдущие подборки:</p><p>А ещё присылайте в комментарии статьи и видео, которые ускользнули от нашего взгляда и не попали в дайджест. Поделитесь полезными материалами с другими читателями! 😉</p>]]></content:encoded>
    </item>
    <item>
      <title>Весенний бум: 6 востребованных IT-специальностей</title>
      <link>https://tproger.ru/articles/6-vostrebovannyh-it-specialnostej</link>
      <comments>https://tproger.ru/articles/6-vostrebovannyh-it-specialnostej?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Марина Александровна]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/6-vostrebovannyh-it-specialnostej</guid>
      <description><![CDATA[<p>Собрали для вас список из шести перспективных IT-профессий, где уже сейчас остро требуются толковые специалисты.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/6-vostrebovannyh-it-specialnostej">Весенний бум: 6 востребованных IT-специальностей</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Роботы]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Работа]]></category>
      <category><![CDATA[Карьера]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 28 Mar 2023 08:28:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>На волне развития искусственного интеллекта топ востребованных IT специальностей претерпел изменения. Собрали для вас список из шести IT-профессий, где остро требуются толковые специалисты.</p><h2>Computer Vision Engineer</h2><p>Computer Vision Engineer обучает ИИ распознавать объекты и реагировать на них без необходимости в «глазах». Эта отрасль инженерии привлекает не только технарей, но и гуманитариев, ведь чтобы ИИ научился распознавать, большое количество видео и фото обрабатывается вручную, описывая изображенные на них объекты.</p><p>Разумеется, опыт работы с кодом, способность быстро адаптироваться к новым технологиям и задействовать алгоритмы помогают в достижении успеха в этой отрасли.</p><h2>Инженер робототехники</h2><p>Инженер-робототехник — это специалист, который разрабатывает архитектуру и вводит в эксплуатацию роботов, приборы и сложные робототехнические системы.</p><p>Они используются для:</p><ul><li>производственных целей;</li><li>научно-исследовательских целей;</li><li>боевых действий;</li><li>развлечений;</li><li>бытового применения.</li></ul><p>Роботы позволяют выполнять рутинную работу и сложные задачи практически без участия человека.</p><p>Инженеры-робототехники могут работать в автоконцернах, авиационных и космических предприятиях, инженерных компаниях и стартапах, занимающихся созданием роботов.</p><h2>Работа с данными</h2><p>Компаниям, желающим обойти конкурентов и оптимизировать бизнес-процессы, чтобы получать большую прибыль, потребуются исследования данных. В связи с этим активно растёт спрос на профессионалов таких как аналитик BI, <a href="https://tproger.ru/video/data-science-dlja-nachinajushhih-12-proektov-na-python-za-3-chasa/">Data Scientist</a>, аналитик данных, специалист Machine Learning, etc.</p><h3>Data Analyst</h3><p>Data аналитик собирает данные, на основе которых принимается решение. Он оценивает широкий спектр данных, после чего выбирает и обрабатывает те, которые важны для принятия решений. Далее аналитик визуализирует полученные данные, разрабатывает рекомендации и предлагает концепции ведения бизнеса.</p><figure><img src="https://media.tproger.ru/uploads/2023/03/77032fff-a414-4110-97b4-723e99683215.jpg" alt="" /></figure><p>Чтобы стать аналитиком данных, необходимо:</p><ol><li>Обладать знаниями и навыками в области анализа данных.</li><li>Иметь опыт работы с основными инструментами анализа данных.</li><li>Уметь работать с большим объемом разнородной информации.</li></ol><h3>Data Engineer</h3><p>Data engineer — это специалист, отвечающий за сбор, хранение и преобразование данных. Данные используются для создания и обучения моделей искусственного интеллекта (ИИ). При построении пирамиды потребностей ИИ в первую очередь на повестку дня выходят три основных этапа, делающиеся дата-инженером: извлечение, перенос/хранение и анализ/предварительная обработка данных.</p><figure><img src="https://media.tproger.ru/uploads/2023/03/d8d4dc43-c698-4cc3-a782-16ff510c3f89.png" alt="" /></figure><p>ML-инженер — это специалист, который работает в сфере Data Science. Задачи специалиста сводятся к практическому обучению компьютера поиску взаимосвязей в данных и принятию на их основе тех или иных решений.</p><p>Вот лишь некоторые примеры результатов ML-инженерии:</p><ul><li>«умные ленты» в социальных сетях;</li><li>алгоритмы рекомендаций на музыкальных стримингах;</li><li>сервисы перевода типа Google Translate;</li><li>боты-помощники типа Олега банка «Тинькофф» и Алисы «Яндекса».</li></ul><h2>AI Ethicists (Этик ИИ)</h2><p>Для того, чтобы ИИ мог действительно принимать правильные решения, необходимо наличие эксперта по этике ИИ. Он должен понимать и учитывать человеческие чувства, политические взгляды и привязанности, чтобы программировать ИИ так, чтобы тот был нейтральным и при этом понимал, что является правильным или неправильным.</p><p>Этика ИИ даёт нейросети понимание таких сложных этических понятий, как любовь, война, те или иные слова вежливости, etc.</p><p>Да, ИИ всё ещё лишён чувств, поэтому для принятия правильных решений и нужен эксперт по этике ИИ, который понимает и учитывает нюансы, недоступные искусственному интеллекту.</p>]]></content:encoded>
    </item>
    <item>
      <title>Дайджест Python #5: как сделать свой Copilot и работать с данными в Pandas</title>
      <link>https://tproger.ru/articles/dajdzhest-pitona-15-marta</link>
      <comments>https://tproger.ru/articles/dajdzhest-pitona-15-marta?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Рафаил Агазода]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/dajdzhest-pitona-15-marta</guid>
      <description><![CDATA[<p>Собрали дайджест из лучших статей и новостей о Python с 1 по 15 марта. Дайджест включает статьи и видео на русском и английском языках.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/dajdzhest-pitona-15-marta">Дайджест Python #5: как сделать свой Copilot и работать с данными в Pandas</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Django]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 15 Mar 2023 07:34:51 GMT</pubDate>
      <content:encoded><![CDATA[<p>Собрали дайджест из лучших материалов по Python с 1 по 15 марта, которые только смогли найти. Дайджест включает статьи и видео на русском и английском языках.</p><p>Узнайте, как написать свой аналог GitHub Copilot без знаний об искусственном интеллекте, как работать с данными и памятью в Pandas и как написать нейросеть, которая сможет самостоятельно распознавать объекты.</p><h2>Big Data / Data Science</h2><ul><li><a href="https://habr.com/ru/company/vk/blog/720652/">Data Mesh: что это такое и для чего он нужен инженерам</a></li><li><a href="https://habr.com/ru/company/otus/blog/720218/">9 баз данных NoSQL, актуальных на 2023 год</a></li><li><a href="https://habr.com/ru/company/oleg-bunin/blog/720076/">Как и зачем оценивают индекс зрелости ИИ</a></li><li><a href="https://habr.com/ru/company/first/blog/720058/">Большие данные мертвы. Это нужно принять</a></li><li><a href="https://habr.com/ru/post/719594/">Процесс ELT: основные компоненты, преимущества и инструменты создания</a></li><li><a href="https://habr.com/ru/company/skillfactory/blog/721838/">Отображение графа на Python с networkx</a></li><li><a href="https://habr.com/ru/article/721338/">Откуда есть пошла аналитика и что отличает DS, DA, BA и SA</a></li><li><a href="https://habr.com/ru/post/721154/">HalvingSearch: ускорение поиска по сетке (grid search). Библиотека sklearn</a></li><li><a href="https://habr.com/ru/company/skillfactory/blog/720530/">Не пытайтесь измерить использование памяти в Pandas</a></li><li><a href="https://habr.com/ru/post/719230/">Перевод предобученной модели Keras на матричные вычисления</a></li><li><a href="https://habr.com/ru/post/721162/">CutTheLog – когда он слишком большой</a></li><li>EN <a href="https://dev.to/memgraph/using-on-disk-storage-with-an-in-memory-graph-database-b7n">Using on Disk Storage With an In-Memory Graph Database </a></li><li>EN <a href="https://dev.to/silasmugambi/data-preprocessing-using-python-13c6">Data Preprocessing Using Python </a></li><li>EN <a href="https://towardsdatascience.com/3-quick-and-easy-ways-to-visualize-your-data-using-pandas-4cac57fb4c82">3 Quick and Easy Ways to Visualize Your Data Using Pandas</a></li><li>EN <a href="https://levelup.gitconnected.com/pygwalker-a-python-library-for-visualizing-data-with-pandas-ff5fc6b59f33">PyGWalker: A Python Library for Visualizing Pandas Dataframes</a></li><li>EN <a href="https://odsc.medium.com/create-audience-segments-using-k-means-clustering-in-python-209fd351192e">Create Audience Segments Using K-Means Clustering in Python</a></li><li>EN <a href="https://medium.com/@cyberdud3/mastering-missing-data-in-python-tips-for-data-scientists-8662d93945a1">Mastering Missing Data in Python: Tips for Data Scientists</a></li><li>EN <a href="https://medium.com/@chiragpawar4321/reading-and-processing-data-with-pandas-a-guide-to-using-read-csv-with-csv-files-af94ccea3f84">Reading and Processing Data with Pandas: A Guide to Using read_csv() with CSV Files</a></li></ul><h2>AI и ML</h2><ul><li><a href="https://habr.com/ru/post/721956/">Генерация 2D мира с помощью клеточного автомата на Python</a></li><li><a href="https://habr.com/ru/post/722170/">Цепочка методов в pandas. Прокачиваем свой код. Минигайд для интересующихся</a></li><li><a href="https://habr.com/ru/post/719912/">Просим бота написать бота</a></li><li><a href="https://habr.com/ru/post/720228/">Как без денег и знаний в AI повторил Copilot’а</a></li><li><a href="https://habr.com/ru/company/doubletapp/blog/720798/">Прости нас, Джон Коннор, или Как мы научили нейросеть точечно распознавать звуки выстрелов</a></li><li><a href="https://habr.com/ru/post/721414/">Пишем нейросеть для сегментации снимков со спутника</a></li><li><a href="https://habr.com/ru/post/721436/">Как я делал ChatGPT бота в Salebot и ничего не вышло</a></li><li><a href="https://habr.com/ru/post/721810/">Как создание бинарного классификатора открыло ящик Пандоры в стандартах владения английским языком</a></li><li><a href="https://habr.com/ru/post/721840/">AIGod — распознавание объектов</a></li><li><a href="https://habr.com/ru/post/721818/">Учим нейросеть принимать решения на основе уже известного опыта (на примере Шахмат и загруженного датасета)</a></li><li><a href="https://habr.com/ru/post/721940/">Классификация изображений в облачной системе Google Colab</a></li><li><a href="https://habr.com/ru/post/722250/">Визуализация архитектуры модели PyTorch</a></li><li>EN <a href="https://seandearnaley.medium.com/building-a-reddit-thread-summarizer-with-chatgpt-api-5b0dcd50b88e">Building a Reddit Thread Summarizer with ChatGPT API</a></li><li>EN <a href="https://betterprogramming.pub/exploring-the-intersection-of-ai-and-physics-the-role-of-chatgpt-in-code-generation-dacb6fd6f96b">Exploring the Intersection of AI and Physics: The Role of ChatGPT in Code Generation</a></li><li>EN <a href="https://medium.com/geekculture/a-simple-guide-to-chatgpt-api-with-python-c147985ae28">A Simple Guide to The (New) ChatGPT API with Python</a></li><li>EN <a href="https://towardsdatascience.com/write-readable-tests-for-your-machine-learning-models-with-behave-ec4a27b91490">Write Readable Tests for Your Machine Learning Models with Behave</a></li><li>EN <a href="https://medium.com/@rodolfo.antonio.sep/streamline-your-chatgpt-experience-with-gpt-scraper-eabf30643b44">Harness the Power of ChatGPT Without API Credits: Introducing GPT_scraper</a></li><li>EN <a href="https://dev.to/picovoice/end-to-end-speech-recognition-with-python-1ide">End-to-End Speech Recognition with Python </a></li><li>EN <a href="https://dev.to/feranmiodugbemi/how-to-create-an-ai-powered-chatbot-with-gradio-and-openais-gpt-35-2c8l">How to Create an AI-Powered Chatbot with Gradio and OpenAI’s GPT-3.5 </a></li></ul><h2>Веб / Django / Flask</h2><ul><li><a href="https://habr.com/ru/post/721260/">Python, Django и немного защиты кода</a></li><li><a href="https://habr.com/ru/company/selectel/blog/721022/">Как разработать канбан-доску на Django, DRF и Alpine.js</a></li><li><a href="https://habr.com/ru/post/720480/">Основы PyCharm</a></li><li><a href="https://habr.com/ru/company/agima/blog/720896/">Как избежать проблем при запуске MVP</a></li><li>EN <a href="https://dev.to/ebram96/checking-whether-a-celery-task-is-already-running-59f4">Checking Whether a Celery Task is Already Running </a></li><li>EN <a href="https://hotcerts.medium.com/developing-strong-seo-tools-using-python-4be39b6b60cc">Developing Strong SEO Tools Using Python</a></li><li>EN <a href="https://medium.com/@neonforge/chatgpt-api-python-web-app-tutorial-personalised-ai-chatbot-assistant-with-a-twist-ded4da970c1d">Tutorial: How to Create ChatGPT API Python Web App — Personalised AI Chatbot Assistant with a Twist…</a></li><li>EN <a href="https://medium.com/@bikrambiswas/setting-up-pre-commit-in-a-django-project-a-step-by-step-guide-963e6a0daebd">Setting up Pre-Commit in a Django Project: A Step-by-Step Guide</a></li><li>EN <a href="https://medium.com/@rajputgajanan50/django-query-optimization-9259d55f5795">Django Query Optimization</a></li><li>EN <a href="https://python.plainenglish.io/flask-vs-django-vs-streamlit-40da8afccb92">Flask vs Django vs Streamlit</a></li><li>EN <a href="https://medium.com/@iwobedotcom/from-javascript-to-python-and-django-how-to-master-a-new-language-and-framework-be76d8bf4c81">From JavaScript to Python and Django: How to Master a New Language and Framework</a></li><li>EN <a href="https://towardsdev.com/logging-in-django-fdcdb44061c4">Logging in Django</a></li></ul><h2>Скрипты, приложения и боты</h2><ul><li><a href="https://tproger.ru/articles/python-roadmap-2023-ljn8jvxfj/">Python для начинающих: дорожная карта в 2023 году</a></li><li><a href="https://habr.com/ru/post/720034/">Как я написал Telegram-бота для учёта подписок</a></li><li><a href="https://habr.com/ru/post/720130/">Бот для телеграмма, использующий Яндекс.Диск (Python)</a></li><li><a href="https://habr.com/ru/post/720600/">Отслеживаем изменения в doc и docx при помощи Python</a></li><li><a href="https://habr.com/ru/post/720610/">SimpleUI — фреймворк для быстрого создания бизнес приложений на Android</a></li><li><a href="https://habr.com/ru/company/piter/blog/720724/">Книга «Внутри CPYTHON: гид по интерпретатору Python»</a></li><li><a href="https://habr.com/ru/post/720862/">Парсинг данных через api vk и google sheets api на python</a></li><li><a href="https://habr.com/ru/post/718862/">Создаем библиотеку теории игр на питоне: как вообще это будет работать?</a></li><li><a href="https://habr.com/ru/company/productivity_inside/blog/721508/">Как я проводил обратную разработку таинственного UDP-трафика в гостиничном номере</a></li><li><a href="https://habr.com/ru/post/721516/">Пагинация в telegram-боте для чайников</a></li><li><a href="https://habr.com/ru/post/721622/">API Честный знак как получить ключ сессии</a></li><li>EN <a href="https://towardsdatascience.com/effectively-use-timeit-lprun-and-mprun-to-write-efficient-python-code-f06fb8457049">Effectively Use %timeit, %lprun, and %mprun to Write Efficient Python Code</a></li><li>EN <a href="https://sharifsuliman.medium.com/distributing-python-main-and-submodules-on-pypi-49140a6c31f5">Distributing Python Main and Submodules on PyPi</a></li><li>EN <a href="https://medium.com/@taradwyer17/12-python-scripts-for-optimising-your-code-development-310d4a0915ca">12 Python Scripts for Optimising Your Code Development</a></li><li>EN <a href="https://dev.to/sunishsurendrank/memory-management-in-python-4n3a">Memory management in Python </a></li><li>EN <a href="https://dev.to/yash_makan/most-exciting-python-features-from-37-to-311-l09">Most Exciting Python Features from 3.7 to 3.11 </a></li><li>EN <a href="https://dev.to/temporalio/python-sdk-the-release-2ji9">Python SDK: The Release </a></li><li>EN <a href="https://dev.to/cicirello/pyaction-4170-released-4ef8"> pyaction 4.17.0 Released </a></li><li>EN <a href="https://dev.to/shittu_olumide_/understanding-python-metaclasses-2782">Understanding Python Metaclasses </a></li><li>EN <a href="https://dev.to/zitrocode/introducing-inkwell-a-lightweight-easy-to-use-terminal-based-text-editor-gkd">Introducing Inkwell: A lightweight, easy-to-use terminal-based text editor </a></li></ul><h2>Развлекательный контент</h2><ul><li><a href="https://tproger.ru/quiz/kakaja-ty-it-princessa/">Какая ты IT-принцесса?</a></li><li><a href="https://habr.com/ru/post/720350/">Диалог между JS и Python если бы они были людьми</a></li><li>Видео <a href="https://www.youtube.com/watch?v=5dUJNYtQB8E">ПОРА РАЗОБРАТЬСЯ С ООП В PYTHON 3 | BALABOL IT PYTHON PODCAST </a></li><li>Аудио <a href="https://music.yandex.ru/album/6892837/track/112010663?dir=desc&amp;activeTab=about">Новости Python за февраль 2023</a></li><li>EN <a href="https://www.reddit.com/r/Python/comments/11ria83/what_is_the_funnest_project_you_worked_on/">What is the funnest project you worked on?</a></li></ul><p>Нашли что-нибудь полезное и интересное для себя? Расскажите, какие материалы понравились вам больше всего, а каких статей не хватило, чтобы следующий дайджест получился ещё лучше.</p><p>Если дайджест вам понравился, посмотрите две предыдущие подборки:</p><p>А ещё присылайте в комментарии статьи и видео, которые ускользнули от нашего взгляда и не попали в дайджест. Поделитесь полезными материалами с другими читателями! 😉</p>]]></content:encoded>
    </item>
    <item>
      <title>Дайджест Python #4: версия 3.12 и свой GPT за 60 строк кода</title>
      <link>https://tproger.ru/articles/dajdzhest-python-4-versija-3-12-i-svoj-gpt-za-60-strok-koda</link>
      <comments>https://tproger.ru/articles/dajdzhest-python-4-versija-3-12-i-svoj-gpt-za-60-strok-koda?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Рафаил Агазода]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/dajdzhest-python-4-versija-3-12-i-svoj-gpt-za-60-strok-koda</guid>
      <description><![CDATA[<p>Собрали дайджест из лучших статей и новостей о Python с 14 по 28 февраля. Дайджест включает статьи и видео на русском и английском языках.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/dajdzhest-python-4-versija-3-12-i-svoj-gpt-za-60-strok-koda">Дайджест Python #4: версия 3.12 и свой GPT за 60 строк кода</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Django]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Приложение]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 28 Feb 2023 11:45:42 GMT</pubDate>
      <content:encoded><![CDATA[<p>Собрали дайджест из лучших материалов по Python с 14 по 28 февраля, которые только смогли найти. Дайджест включает статьи и видео на русском и английском языках.</p><p>Узнайте, как написать свою GPT-модель всего за 60 строк кода, какие обновления коснулись Python в версии 3.12 и как повлиять на работу коммунальных служб с помощью машинного обучения.</p><h2>Big Data / Data Science</h2><ul><li><a href="https://habr.com/ru/company/factory5/blog/719396/">Как ускорить пилотные проекты по анализу больших данных</a></li><li><a href="https://habr.com/ru/post/718846/">Викторианская история больших данных</a></li><li><a href="https://habr.com/ru/company/skillfactory/blog/719016/">Как мы чуть не взломали шифровальщик Phobos с помощью CUDA</a></li><li><a href="https://habr.com/ru/post/718108/">Неудачный опыт: выявление аномалий в данных методами кластеризации</a></li><li><a href="https://habr.com/ru/company/piter/blog/717082/">Книга «Основы Python для Data Science»</a></li><li>EN <a href="https://habr.com/ru/post/717272/">Roads and building density in North America. 100GB geodata processing OSM data in PostgreSQL</a></li><li>EN <a href="https://habr.com/ru/post/717408/">How to put the whole world into a regular laptop: PostgreSQL and OpenStreetMap</a></li><li>EN <a href="https://medium.com/@darshilp/pandas-2-0-is-here-427b026ab913">Pandas 2.0 is Here</a></li><li>EN <a href="https://jjdiamondreivich.medium.com/exploratory-data-analysis-in-python-using-just-9-functions-dca300be63e2">Exploratory Data Analysis in Python, Using Just 9 functions</a></li><li>EN <a href="https://medium.com/@mgulum98/a-gentle-guide-of-pandas-6de76cae5c44">A Gentle Guide Of Pandas</a></li><li>EN <a href="https://medium.com/@ctagard19/pandas-meets-pyarrow-a-data-scientists-dream-come-true-dff849d61db5">Pandas meets Pyarrow? A Data Scientists Dream Come True</a></li><li>EN <a href="https://medium.com/@ElizavetaGorelova/numpy-library-everything-a-newbie-needs-to-know-42ed1138f451">NumPy Library: Everything a Newbie Needs to Know</a></li><li>EN <a href="https://levelup.gitconnected.com/polynomials-in-numpy-bc720ca62dd0">Polynomials in NumPy</a></li><li>EN <a href="https://medium.com/@ezfintrader/pandas-vs-numpy-which-python-library-is-best-for-data-analysis-and-numerical-calculations-c2f83e227119">Pandas vs Numpy: Which Python Library is Best for Data Analysis and Numerical Calculations?</a></li></ul><h2>AI и ML</h2><ul><li><a href="https://habr.com/ru/post/719206/">Как улучшить точность ML-модели используя разведочный анализ</a></li><li><a href="https://habr.com/ru/post/718996/">О «раздутом пузыре» нейросетей</a></li><li><a href="https://habr.com/ru/post/718942/">10 первых ошибок в карьере ML-инженера</a></li><li><a href="https://habr.com/ru/company/ruvds/blog/718102/">Об экшн-трансформере как следующем этапе развития модели трансформер и не только</a></li><li><a href="https://habr.com/ru/company/piter/blog/717660/">Книга «Грокаем алгоритмы искусcтвенного интеллекта»</a></li><li><a href="https://habr.com/ru/post/716902/">Пишем GPT в 60 строк NumPy (часть 1 из 2)</a></li><li><a href="https://habr.com/ru/post/717644/">Пишем GPT в 60 строк NumPy (окончание, 2/2)</a></li><li><a href="https://habr.com/ru/post/718106/">Взгляд компьютерным зрением на работу коммунальных служб</a></li><li>EN <a href="https://ricardo-castellanos-herreros.medium.com/top-15-artificial-intelligence-tools-3c3d0986067">Top 15 Artificial Intelligence Tools</a></li><li>EN <a href="https://medium.com/@keeps.dyes_06/pytorch-vs-tensorflow-spotting-the-difference-1014f0838be1">PyTorch vs TensorFlow — spotting the difference</a></li><li>EN <a href="https://medium.com/@keeps.dyes_06/understanding-pytorch-with-an-example-a-step-by-step-tutorial-82fd7d7a8a5a">Understanding PyTorch with an example: a step-by-step tutorial</a></li><li>EN <a href="https://medium.com/@zhanwenchen/build-pytorch-from-source-with-cuda-11-8-565ab737bfc8">Build PyTorch from Source with CUDA 11.8 with Ubuntu 22.04</a></li><li>EN <a href="https://dev.to/vincenius/coding-your-own-ai-in-2023-with-fastai-2pbk"> Coding your own AI in 2023 with fastai</a></li></ul><h2>Веб / Django / Flask</h2><ul><li><a href="https://habr.com/ru/post/718800/">Пишем сервис для сокращения ссылок на Django, DRF</a></li><li><a href="https://habr.com/ru/company/aitalenthub/blog/718064/">Отгадай слово: как мы создали игру с элементами машинного обучения и вышли в ноль за 2 месяца</a></li><li><a href="https://habr.com/ru/post/717142/">Как мы сделали образовательную игру для разработчиков в телеграмме?</a></li><li><a href="https://habr.com/ru/post/718376/">Как изучать язык Python для веб-разработки в 2023 году. Общие ориентиры</a></li><li><a href="https://habr.com/ru/post/717424/">Личный путь и опыт в становлении Python разработчиком</a></li><li>EN <a href="https://ericnarro.medium.com/how-to-change-django-ckeditor-image-properties-dialog-text-colors-when-using-black-theme-79c56aff619f">How to change django-ckeditor image properties dialog text colors when using dark theme</a></li><li>EN <a href="https://medium.com/@bobbykboseoffice/securing-your-django-rest-api-with-authentication-and-authorization-cf5b1c231cde">Securing Your Django REST API with Authentication and Authorization</a></li><li>EN <a href="https://nishanthmurugananth.medium.com/best-practices-for-django-development-5c51308fed75">Best Practices for Django Development</a></li><li>EN <a href="https://medium.com/@reachadeon/django-mvt-vs-laravel-mvc-a-technical-comparison-ac85cee7c13d">Django MVT vs Laravel MVC: A Technical Comparison</a></li><li>EN <a href="https://medium.com/@musowir_u/encrypto-the-ultimate-guide-to-building-a-secure-file-encryption-web-app-with-flask-and-python-f496ae9a58f6">Encrypto: The Ultimate Guide to Building a Secure File Encryption Web App with Flask and Python</a></li><li>EN <a href="https://medium.com/@keeps.dyes_06/python-webserver-with-flask-and-raspberry-pi-53494ebb2121">Python WebServer With Flask and Raspberry Pi</a></li><li>EN <a href="https://medium.com/@talhamsajid048/building-a-social-network-with-flask-and-neo4j-762f0b727aa8">Building a Social Network with Flask and Neo4j</a></li><li>EN <a href="https://medium.com/@s.sadathosseini/building-a-real-time-twitter-sentiment-analysis-web-app-with-python-and-flask-c8d5f6293888">Building a Real-Time Twitter Sentiment Analysis Web App with Python and Flask</a></li><li>EN <a href="https://towardsdev.com/building-a-voice-assistant-using-openai-api-and-flask-by-chatgpt-9f90a430b242">Building a Voice Assistant using OpenAI API and Flask — by ChatGPT</a></li><li>EN <a href="https://python.plainenglish.io/how-to-create-a-youtube-transcript-generator-web-app-with-python-flask-with-chatgpt-57b5ce859db4">How to Create a YouTube Transcript Generator Web App with Python Flask with ChatGPT</a></li><li>EN <a href="https://dev.to/vulcanwm/a-similarity-between-css-and-python-4lee"> A Similarity between CSS and Python</a></li><li>EN <a href="https://dev.to/thenomadevel/10-game-changing-no-codelow-code-tools-every-developer-should-know-about-2a4l"> 10 Game-Changing No Code/Low Code Tools Every Developer Should Know About</a></li></ul><h2>Скрипты, приложения и боты</h2><ul><li><a href="https://habr.com/ru/company/ruvds/blog/717110/">VS Code, python, контейнеры — как обуздать эту триаду и разрабатывать внутри контейнера</a></li><li><a href="https://habr.com/ru/company/skillfactory/blog/718894/">Как при помощи Rust в 150 раз ускорить код на Python</a></li><li><a href="https://habr.com/ru/post/718874/">Создание модуля WebAssembly с помощью Emscripten, AssemblyScript и Rust</a></li><li><a href="https://habr.com/ru/company/selectel/blog/717690/">Как разработать Telegram-бота для генерации сложных паролей</a></li><li><a href="https://habr.com/ru/company/selectel/blog/718134/">Сколько стоит содержать виртуальную девушку? Создаем подругу, записывающую кружочки в Telegram, с помощью 4 нейросетей</a></li><li><a href="https://habr.com/ru/post/717420/">Что нам несет Python 3.12</a></li><li><a href="https://habr.com/ru/post/717838/">История одного соседа ч.2</a></li><li>EN <a href="https://iamholumeedey007.medium.com/extract-tables-from-images-in-python-ae26a76ba29c">Extract Tables From Images in Python</a></li><li>EN <a href="https://medium.com/@amber.m1678/how-to-code-a-caesar-cipher-in-python-4fce724432f5">How to Code a Caesar Cipher in Python</a></li><li>EN <a href="https://medium.com/higherpattern/stock-news-sentiment-analysis-with-python-with-50-lines-of-code-e2a1519578a1">Stock News Sentiment Analysis with Python with 50 lines of code</a></li><li>EN <a href="https://python.plainenglish.io/python-converting-non-square-images-to-square-images-ed4ed266c7f6">Python — Converting Non-Square Images To Square Images</a></li></ul><h2>Развлекательный контент</h2><ul><li><a href="https://habr.com/ru/post/717898/">Я только спросить: разводим ChatGPT на откровенность по методу Илона Маска</a></li><li><a href="https://habr.com/ru/company/jugru/blog/717438/">Bing: «Я не причиню вам вред, если только вы не причините мне его первым»</a></li><li>Видео <a href="https://www.youtube.com/watch?v=0-czTUWRReI"> Почему в Python реализована глобальная функция len() и что об этом говорит Гвидо ван Россум?</a></li><li>Видео <a href="https://www.youtube.com/watch?v=YtYBbVZ2PYg"> Собеседование python разработчик Игорь Шкода. Ведет Олег Кожанов </a></li><li>Видео <a href="https://www.youtube.com/watch?v=vSnqZN5I8sc"> Новинки в Python 3.12 / Опять переписали виртуальную машину / Большая чистка stdlib </a></li><li>Видео  <a href="https://www.youtube.com/watch?v=54XyRw9y8oE"> 14 Ideas for Fun Python Free Time Projects </a></li></ul><p>Нашли что-нибудь полезное и интересное для себя? Расскажите, какие материалы понравились вам больше всего, а каких статей не хватило, чтобы следующий дайджест получился ещё лучше.</p><p>Если дайджест вам понравился, посмотрите предыдущие подборки:</p><p>А ещё присылайте в комментарии статьи и видео, которые ускользнули от нашего взгляда и не попали в дайджест. Поделитесь полезными материалами с другими читателями! 😉</p>]]></content:encoded>
    </item>
    <item>
      <title>Чего компании ждут от специалистов по Data Science в 2023 году</title>
      <link>https://tproger.ru/articles/chego-zhdut-ot-specialistov-po-data-science-v-2023-godu-2</link>
      <comments>https://tproger.ru/articles/chego-zhdut-ot-specialistov-po-data-science-v-2023-godu-2?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Oleg Sabitov]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/chego-zhdut-ot-specialistov-po-data-science-v-2023-godu-2</guid>
      <description><![CDATA[<p>Проанализировали несколько десятков вакансий и выяснили, что должен знать и уметь специалист по Data Science в 2023 году.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/chego-zhdut-ot-specialistov-po-data-science-v-2023-godu-2">Чего компании ждут от специалистов по Data Science в 2023 году</a>»</p>]]></description>
      <category><![CDATA[Для начинающих]]></category>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Data Science]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 28 Feb 2023 09:19:39 GMT</pubDate>
      <content:encoded><![CDATA[<p>IT-рынок очень подвижен, а требования к джунам меняются регулярно. Карьерный коуч Elbrus Bootcamp Саша Куликова проанализировала несколько десятков актуальных вакансий по Data Science и на их примере показывает, как к 2023 году изменились ожидания от начинающих дата-сайентистов. А выпускница Elbrus Bootcamp Саша Оберемок рассказывает о тенденциях исходя из личного опыта прохождения собеседований в последние месяцы.</p><h2>Стек</h2><p>Набор технологий, которые чаще всего встречаются в вакансиях, не изменился. Как и год назад, от джунов требуется знание SQL, Python, ML и DS/ML-библиотек (CatBoost, GLM, Statsmodels, Pandas), плюс Hadoop, Spark, Hive.</p><p>В качестве преимуществ упоминаются высшее образование, опыт маркетинговых исследований, участие в олимпиадах, Kaggle и других соревнованиях.</p><p>Среди новых требований стоит выделить опыт работы с облачными платформами, который упоминается в вакансиях всё чаще, а также понимание принципов DevOps. А некоторые компании просят показать опыт в построении CI/CD для ML-моделей.</p><figure><img src="https://media.tproger.ru/uploads/2023/04/3a49b6fa-1bd6-4cc1-ab55-fb5609b32993.jpg" alt="" /></figure><p>Больше задач и историй студентов — в нашем Telegram-канале @Elbrus Bootcamp</p><p>«Ещё одна тенденция — работодателей все больше интересуют общие IT-компетенции кандидата. Например, умение работать с Git, опыт работы с контейнеризацией и понимание, что данные не берутся просто из файла, а хранятся в кластере» — добавляет Саша Оболонок.</p><h2>Реальный опыт</h2><p>Рекрутеры всё чаще обращают внимание на практический опыт работы кандидата. Это означает, что, по крайней мере, часть собеседования будет проходить в формате кейс-интервью.</p><p>В тексте вакансии эти требования могут выглядеть так:</p><figure><img src="https://media.tproger.ru/uploads/2023/02/897732bd-80c3-48bd-a9f9-cd25c30b1533.png" alt="" /></figure><p><i>Реклама ООО “Эльбрус Буткемп”</i></p>]]></content:encoded>
    </item>
    <item>
      <title>YouTube-видео превратили в бесконечное хранилище данных</title>
      <link>https://tproger.ru/news/youtube-video-prevratili-v-beskonechnoe-hranilishhe-dannyh</link>
      <comments>https://tproger.ru/news/youtube-video-prevratili-v-beskonechnoe-hranilishhe-dannyh?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Павел Федоренко]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/youtube-video-prevratili-v-beskonechnoe-hranilishhe-dannyh</guid>
      <description><![CDATA[<p>Энтузиасты написали алгоритм AKA ISG, который превращает видео на YouTube в бесплатное бесконечное хранилище данных.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/youtube-video-prevratili-v-beskonechnoe-hranilishhe-dannyh">YouTube-видео превратили в бесконечное хранилище данных</a>»</p>]]></description>
      <category><![CDATA[Big Data]]></category>
      <category><![CDATA[Базы данных]]></category>
      <category><![CDATA[Rust]]></category>
      <category><![CDATA[YouTube]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 22 Feb 2023 07:47:21 GMT</pubDate>
      <content:encoded><![CDATA[<p>Энтузиасты написали алгоритм AKA ISG, который превращает видео на YouTube в бесплатное бесконечное хранилище данных.</p><p>Суть алгоритма в том, что он позволяет вставлять файлы в видео и загружать их на YouTube в качестве хранилища. Все файлы состоят из байтов, а байты можно интерпретировать как числа. Каждый пиксель либо белый — 1, либо чёрный — 0.</p><p><b>В итоге получается вот такое видео, каждый кадр которого содержит в себе информацию:</b></p><p>«YouTube не имеет ограничений на количество видео, которые вы можете загрузить. Это означает, что это фактически бесконечное облачное хранилище», — говорит разработчик в описании проекта.</p><p>А что, прогресс хранения данных налицо: от магнитофонных кассет до видео на ютубе.</p><p>Исходники написаны на Rust и лежат на гитхабе.</p>]]></content:encoded>
    </item>
  </channel>
</rss>