<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:wfw="http://wellformedweb.org/CommentAPI/" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:sy="http://purl.org/rss/1.0/modules/syndication/" xmlns:slash="http://purl.org/rss/1.0/modules/slash/">
  <channel>
    <language>ru</language>
    <title>Компьютерное зрение</title>
    <description/>
    <link>https://tproger.ru/tag/computer-vision</link>
    <atom:link href="https://tproger.ru/tag/computer-vision/feed" rel="self" type="application/rss+xml"/>
    <lastBuildDate>Mon, 28 Sep 2026 09:28:29 GMT</lastBuildDate>
    <sy:updatePeriod>hourly</sy:updatePeriod>
    <sy:updateFrequency>12</sy:updateFrequency>
    <image>
      <title>Компьютерное зрение</title>
      <link>https://tproger.ru</link>
      <url>https://tproger.ru/apple-touch-icon.png</url>
    </image>
    <item>
      <title>Как мы детектили фрод, а получили Джонни и Джулию: история одной браузерной разминки</title>
      <link>https://tproger.ru/articles/kak-my-detektili-frod-a-poluchili-dzhonni-i-dzhuliyu-istoriya-odnoj</link>
      <comments>https://tproger.ru/articles/kak-my-detektili-frod-a-poluchili-dzhonni-i-dzhuliyu-istoriya-odnoj?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Альберт]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-my-detektili-frod-a-poluchili-dzhonni-i-dzhuliyu-istoriya-odnoj</guid>
      <description><![CDATA[<p>Как мы боролись с фродом, а получили браузерную разминку для шеи. История о том, как система видеоидентификации превратилась в разминку с Джонни и Джулией, и почему побочные эффекты иногда лучше запланированных фич.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-my-detektili-frod-a-poluchili-dzhonni-i-dzhuliyu-istoriya-odnoj">Как мы детектили фрод, а получили Джонни и Джулию: история одной браузерной разминки</a>»</p>]]></description>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Игра]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 17 Aug 2026 08:52:36 GMT</pubDate>
      <content:encoded><![CDATA[<p>Привет, Тпрогер. Меня зовут Степанян
Альберт (<a>albert.stepanyan@beorg.ru</a>), и я
всё ещё бегун по граблям и разработчик отдела R&amp;D в компании «Биорг».</p><p>В Древнем Риме говорили: «Mens sana in corpore sano» - в
здоровом теле здоровый дух. Два тысячелетия спустя мы, айтишники, превратили
эту мудрость в её полную противоположность: здоровый дух, сидящий в нездоровом
теле перед монитором. Наш позвоночник принимает форму вопросительного знака, а
шея начинает напоминать ржавый механизм - повернуть голову можно только всем
корпусом, издавая при этом характерный хруст.</p><p>Мы в «Биорг» знаем об этой проблеме не понаслышке. Но, в отличие
от большинства офисных работников, у нас под рукой оказалась система
видеоидентификации, способная видеть каждое микродвижение человеческого лица. И
как-то раз, тестируя систему видеоидентификации, мы поймали себя на мысли:</p><p><i>- То, что мы создавали для идентификации личности, по сути
готовый трекер движений. Дай ему только интерфейс и он превратится в игру.
Осталось только придумать, во что играть…</i></p><p><a href="https://neck-warmup.beorg.ru/">Попробовать разминку с
Джонни и Джулией</a></p><p>Бесплатно, без смс, без регистрации и без подвоха. Под музыку
или без! Нам не жалко. Мы вообще-то хотим просто шею размять, а не бизнес на
этом строить.</p><h3>Обычный антифрод и его необычная судьба</h3><p>Одна из основных наших задач в R&amp;D - борьба с фродом. Мы
разработали систему видеоидентификации, которая определяет живость человека по
движениям головы, согласно командам. Корректность их выполнения подтверждает,
что перед нами живой пользователь.</p><p>О том, как мы пришли к этому решению и почему оно эффективно,
уже рассказано в статье <a href="https://habr.com/ru/articles/1016592/">Развенчан
маскарад подделок: прорыв в проверке документов</a></p><p>В процессе работы мы научились детектировать ключевые точки лица
с высокой точностью. Алгоритм в реальном времени вычисляет углы поворота
головы, наклоны, моргания. И однажды мы заметили, что эти движения похожи на
те, которые человек выполняет во время зарядки.</p><p>Тогда и родилась идея: а что, если мы сделаем не просто
идентификацию, а полезную разминку для шеи, встроенную прямо в браузер?</p><h3>Рождение Джонни и Джулии</h3><p>Испытать искреннее удивление от собственных возможностей и
окружающего мира - это прекрасные и глубокие ощущения. Получить их может
человек, который вырвался из привычной рутины и столкнулся с тем, что выходит
за рамки его повседневного опыта. Так на свет появились два персонажа: Джонни и
Джулия.</p><p>Их история похожа на красивый роман. За плечами дипломы одного
из лучших университетов мира и блестящие перспективы за рубежом. Они приехали в
Россию как гости, желая увидеть страну. Россия встретила их искренним
гостеприимством, новой культурой, непередаваемой атмосферой. Наша страна
покорила их сердца навсегда. Очарованные увиденным, они приняли главное решение
в своей жизни - остаться здесь, с нами.</p><figure><img src="https://media.tproger.ru/user-uploads/139720/2026-08-07/6037b387-c648-433f-aa2b-9b7cc95882e8.webp" alt="" /></figure><p>Почему двое? Мы добавили в виджет определение пола пользователя
на старте - система определяет, кто перед камерой, и предлагает тренера того же
пола. Это мелочь, но она делает взаимодействие чуть более персонализированным.
Для определения пола используется открытая библиотека face-api.js с лицензией
MIT. По желанию, пол инструктора можно сменить. Для этого есть специальная
кнопка на экране - справа вверху.</p><p>Персонажей мы нарисовали в мультяшном стиле - яркие, добрые, с
улыбкой. Потому что разминка должна вызывать радость, а не напряжение. К тому
же, мы подумали: если пользователь сейчас будет делать серьёзное лицо, разминая
шею, это выглядит глупо. А если рядом весёлый инструктор - процесс идёт легче.</p><p>Есть один нехитрый приём, который делает картинку цельной. Мы
убираем фон у окна с пользователем и заменяем его на белый. То же самое делаем
с фоном инструктора. В результате их фоны сливаются с общим белым фоном
страницы, и визуально окна перестают быть «окнами» - они превращаются в единую
композицию. Пользователь видит себя и тренера в одном пространстве, а не в двух
отдельных квадратах.</p><figure><img src="https://media.tproger.ru/user-uploads/139720/2026-08-07/05d1c05f-df3f-4c64-bf50-a882519e624b.webp" alt="" /></figure><h3>Как мы считаем синхронизацию</h3><p>Разминка состоит из 30 движений, и они каждый раз генерируются
случайным образом. Никаких заучиваний - каждый новый подход будет отличаться от
предыдущего. Это не даёт скучать и не позволяет мозгу «засыпать» на
автоматических движениях.</p><p>Разминка состоит из нескольких упражнений. У каждого есть
ожидаемая длительность - t.time. Пока пользователь выполняет движение, мы
замеряем его фактическую скорость и фиксируем задержку (тот самый delay) - насколько пользователь отстаёт от тренера.</p><p>Когда все упражнения завершены, мы суммируем две величины:</p><p>totalExp - общее ожидаемое время всех движений;</p><p>totalDelay  - суммарное отставание пользователя.</p><p>Дальше простая формула:</p><p>То есть, если вы выполнили разминку идеально синхронно - твой
скор стремится к 100. Но мы оставили люфт, потому что в реальном мире есть
погрешности: камера может чуть дрожать, браузер - подвисать, а твоя шея - иметь
свою точку зрения на то, как быстро надо поворачиваться.</p><p>И ещё один важный нюанс по геймплею. Мы заметили в тестах, что
некоторые пользователи не могли с первого раза повторить то или иное движение.
Может шея затекла, может не поняли траекторию. Зависать на одном движении
бесконечно - плохая идея. Это раздражает и убивает смысл разминки.</p><p>Поэтому мы сделали так: после двух неудачных повторов инструктор
переходит к следующему движению. Пользователь не чувствует себя неудачником, а
просто продолжает разминку. А если он вообще не понял, что делать, - система не
наказывает, а мягко ведёт дальше. В конце его ждёт честный результат, а не
строгий экзамен.</p><p>Итоговый результат мы очеловечиваем:</p><p>98%, а не 100% специально обозначено как идеал. Потому что
перфекционизм это хорошо в коде, но вредно для здоровья. Если ты получил 98%, то считай, что ты чемпион. А вот 30% это повод не расстраиваться, а
попробовать ещё раз, просто поймав ритм.</p><h3>Как мы подружили разминку с телефонами</h3><p>Мы изначально проектировали разминку для больших мониторов
лэптов и рабочих станций - удобно: сидишь перед камерой ноутбука, поворачиваешь
голову, и Джонни с Джулией тебя понимают. Но когда мы решили затестить у
коллег, то первым их вопросом было:</p><p><i>- А на телефоне это работать будет?</i></p><p>Первая мысль была определять устройство по размеру экрана. Но
это оказалось ловушкой. Современные телефоны имеют диагональ почти как у
небольших ноутбуков, а планшеты и вовсе размывают границы.</p><p>Я лично столкнулся с этой проблемой на своём Redmi Note 9. Экран
у него, конечно, не как у ноутбука, но по ширине в пикселях он вполне
сопоставим с некоторыми дешёвыми ноутбуками. Система считала, что раз экран
достаточно широкий значит, это компьютер, и отказывалась переключаться в
мобильный режим. Кнопки оставались мелкими, интерфейс не адаптировался, а
инструктор с пользователем пытались уместиться в той же раскладке, что и на
большом экране. Работать было невозможно.</p><p>Стало понятно, размер экрана  это ненадёжный признак, и
нужно искать что-то другое.</p><p>Тогда я пошёл другим путём: проверять наличие датчика
ориентации, но не одним, а двумя признаками:</p><p>Первое условие - поддержка события ориентации (есть у телефонов
и планшетов). Второе - поддержка касаний (отсекает компьютеры, даже если у них
случайно затесался акселерометр). Вместе 2 условия дают почти 100% точность.</p><p>Если проверка проходит, то добавляем на страницу класс <i>mobile</i>:</p><p>И дальше уже через CSS управляем всем, что должно отличаться. Но
самое главное это размер и положение окна с пользователем и инструктором.</p><p>На компьютере, как и на телефоне, в горизонтальном режиме, мы
используем классическую раскладку: пользователь слева, инструктор справа. Это
естественно для широкого экрана - взгляд скользит слева направо, и ты видишь
одновременно и себя, и тренера.</p><p>На телефоне в вертикальном режиме всё иначе. Экран узкий, и
раскладка «слева-направо» не работает. Поэтому пользователь занимает верхнюю
половину экрана, а окно с инструктором нижнюю. Так пользователь видит и
тренера, и себя одновременно.</p><p>И это не просто визуальная прихоть. Если окно с пользователем
слишком маленькое - он не видит, правильно ли выполняет движения. Если слишком
большое - перекрывает инструктора: теряется смысл «повторяй за мной». Поэтому
мы потратили несколько итераций, чтобы найти идеальные пропорции для каждого
типа устройства и каждой ориентации.</p><p>Сам полноэкранный режим мы, кстати, реализовали и для компа, и
для телефона:</p><p>Справедливости ради: подсказка про выход из полноэкранного
режима появляется и на компьютере, и на телефоне. Просто она разная. На
компьютере - «Нажмите Esc для выхода из полноэкранного режима». На телефоне - «Проведите снизу вверх для выхода из полноэкранного режима». В обоих случаях
она исчезает через 3 секунды, чтобы не мешать пользователю разминаться.</p><h3>Трекинг лица: локальная сборка без сюрпризов</h3><p>Для трекинга лица в разминке мы используем MediaPipe Face Mesh.
Это открытая библиотека от Google, распространяемая под лицензией Apache 2.0.
Мы взяли её в локальную сборку, поэтому всё работает стабильно и без внешних
запросов к CDN. Никаких сюрпризов с недоступными серверами или обновлёнными
API. Только предсказуемая логика в твоём браузере.</p><p>Инициализируем трекер так:</p><p>Обратите внимание на refineLandmarks: false - мы выключили его
специально. Нам не нужна микро-детализация губ и глаз, только общий контур
головы. Экономия ресурсов браузера это наше всё. И, кстати, именно благодаря
локальной сборке мы можем настраивать параметры под свои задачи, не оглядываясь
на внешние зависимости.</p><p>И ещё один бонус локального подхода: библиотека лежит в нашем
проекте, а браузер кеширует её при первом запросе, так что при повторных
запусках она не скачивается заново.</p><p>И главное, что MediaPipe работает независимо от того, как ты
держишь телефон: вертикально или горизонтально. Главное, чтобы лицо было в
кадре!</p><h3>Какой режим выбрать?</h3><p>В итоге оказалось, что в вертикальном режиме пользователь
интуитивно держит телефон на уровне лица и это идеально для детекции. Плюс,
интерфейс с Джонни и Джулией выглядит как видеозвонок с личным тренером.</p><p>А в горизонтальном режиме телефон можно поставить на подставку
или положить на стол и выполнять упражнения, глядя на экран как на маленькое
зеркало. Такой формат больше похож на классический фитнес-гаджет.</p><p>Так что теперь мы рекомендуем вертикальный режим для атмосферы,
а горизонтальный для техничного прохождения с максимальным комфортом.</p><h3>Музыка - двигатель прогресса (и шеи)</h3><p>Когда прототип с Джонни и Джулией заработал, мы дали его
потестить коллегам. Офис разделился на два лагеря.</p><p>Первые, хмуро глядя в монитор, синхронно поворачивали головы и
напоминали роботов на конвейере. Вторые незаметно покачивались в такт и слегка
пританцовывали, даже когда никто не смотрел. Разница была в одном: у вторых на
фоне тихо играла музыка.</p><p>Мы решили, что пусть пользователь сам решает, хочет ли он
разминаться в тишине или под ритмичный трек. Так появились две кнопки: «Под
музыку» и «Без музыки».</p><p>И если с «тихим» режимом всё просто, то с музыкой пришлось
повозиться. Мы перебрали десяток треков разного темпа, пока не нашли тот самый,
который совпадает с комфортной скоростью поворота головы при разминке. Слишком
быстро - пользователь не успевает, слишком медленно - скучно. Идеальный темп
нашёлся где-то около 140 BPM, как у хорошего транс-хауса.</p><p>И вот теперь представь: ты сидишь после пяти часов дебаггинга,
запускаешь разминку, выбираешь «Под музыку», и на экране появляется симпатичная
Джулия, которая под ритмичный бит начинает поворачивать голову. Ты повторяешь и
незаметно для себя перестаёшь думать о багах и просто двигаешься. Это работает
как медитация.</p><h3>Тайна, которую мы не раскроем (но вы всё равно узнаете)</h3><p>Когда разминка заканчивается и на экране появляется твой
результат что-то происходит.</p><p>Не будем раскрывать, что именно. Пусть это останется сюрпризом
для тех, кто дойдёт до финала. Скажем одно: мы вложили туда частичку нашей
души, и, судя по первым тестам, это вызывает чистую, детскую радость даже у
самых суровых бэкенд-разработчиков.</p><p>Так что когда дойдёте до конца, поделитесь в комментариях, какой
бонус увидели и понравилось ли вам.</p><h3>Заключение</h3><p>История этой разминки это отличное напоминание о том, что лучшие
идеи рождаются не из строгих ТЗ. Мы не планировали делать разминку. Мы
планировали делать антифрод. А заодно получили продукт, который одинаково
полезен и для безопасности системы, и для шеи разработчика.</p><p>А вообще, Джонни и Джулии у нас нравится. Они уже члены нашей команды - с удовольствием ходят на парады и даже поздравляют нас с праздниками.</p><figure><img src="https://media.tproger.ru/user-uploads/139720/2026-08-07/e69a36d3-32d0-4e00-9f25-6e0d81b59476.webp" alt="" /></figure>]]></content:encoded>
    </item>
    <item>
      <title>ИИ для автоматизации РКО. Как финансовые организации сокращают расходы и убирают ручной ввод документов</title>
      <link>https://tproger.ru/articles/ii-dlya-avtomatizacii-rko-kak-finansovye-organizacii-sokrashhayut-r</link>
      <comments>https://tproger.ru/articles/ii-dlya-avtomatizacii-rko-kak-finansovye-organizacii-sokrashhayut-r?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Неопознанный программист]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/ii-dlya-avtomatizacii-rko-kak-finansovye-organizacii-sokrashhayut-r</guid>
      <description><![CDATA[<p>ИИ для РКО: как автоматизация ввода данных сокращает расходы и ускоряет открытие счетов в 2 раза. Решение для банков, которые хотят сэкономить на операционных расходах.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/ii-dlya-avtomatizacii-rko-kak-finansovye-organizacii-sokrashhayut-r">ИИ для автоматизации РКО. Как финансовые организации сокращают расходы и убирают ручной ввод документов</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Распознавание]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 01 Jul 2026 09:44:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>В сфере расчетно-кассового обслуживания (РКО) банки давно перестали конкурировать только тарифами и набором услуг. Сегодня клиент оценивает финансовую организацию по тому, насколько быстро он может открыть счет, обменять валюту, провести платеж или совершить другую операцию в отделении или офисе. И именно здесь проявляется одно из наиболее уязвимых мест РКО – ручной ввод данных из документов. В этой статье разбираемся, как искусственный интеллект позволяет <a href="https://smartengines.ru/smart-passportreader/">автоматизировать РКО</a> и сократить расходы в одном из наиболее чувствительных мест расчетно-кассового обслуживания.</p><h2>Почему ручной ввод паспорта – скрытая статья расходов</h2><p>Паспорт требуется практически для каждой операции РКО: открытие счета, подтверждение личности клиента, обмен валют, оформление услуг. На первый взгляд несколько минут, потраченных сотрудником на перенос данных из паспорта, кажутся незначительными. Но в масштабах банка именно эти минуты становятся одним из главных факторов оттока клиентов и финансовых убытков.</p><p>Пока оператор вручную перепечатывает реквизиты документа, банк теряет не только время клиента. Он снижает пропускную способность отделений, увеличивает стоимость каждой операции, повышает нагрузку на персонал и создает дополнительные риски ошибок. Кроме того, от задержек растут очереди и падает лояльность – видя толпу в отделении, новые клиенты с большой вероятностью будут просто разворачиваться и уходить.</p><p>Если обобщить все издержки от ручного ввода паспорта в РКО, можно выделить следующие направления:</p><ul><li>Снижается производительность отделений. Пока сотрудник перепечатывает паспортные данные, он не обслуживает следующего клиента. В часы пиковых посещений это приводит к очередям в отделении и оттоку клиентов.</li><li>Растут расходы на персонал. Чем больше документов обрабатывается вручную, тем больше сотрудников требуется банку. Зарплата, налоговые отчисление и техническое обеспечение рабочих мест для новых операторов увеличивают соответствующие статьи расходов банка.</li><li>Увеличивается количество ошибок. Даже опытный оператор может пропустить символ, неверно указать дату или допустить опечатку. Такие ошибки приводят к повторным проверкам, необходимости переоформлять документы, задержкам обслуживания и дополнительной нагрузке на сотрудников. Кроме того, человеческий фактор сказывается и на уровне сервиса – к вечеру рабочего дня риски ошибок из-за усталости оператора значительно возрастают.</li><li>Страдает клиентский опыт. Современному клиенту не важно, по какой причине оформление занимает двадцать минут вместо пяти. Если обслуживание затягивается, вероятность ухода клиентов к организации-конкуренту существенно возрастает.</li></ul><p>В результате ручной ввод документов становится не просто неудобством, а фактором, который <a href="https://smartengines.ru/blog/rko-bez-ocheredej-kak-banki-uskoryayut-obsluzhivanie-s-pomoshhyu-ii-dlya-raspoznavaniya-pasporta/">напрямую влияет</a> на всю экономику банковского бизнеса.</p><h2>Как автоматизация помогает в обслуживании клиентов и управлении рисками</h2><p>При расчетно-кассовом обслуживании банк обязан не только совершить операцию, но и корректно подтвердить личность клиента. Требования законодательства – прежде всего 115-ФЗ и 152-ФЗ – делают качество обработки документов критически важным параметром.</p><p>В рамках процедур KYC и AML банк обрабатывает данные из паспорта, проверяет их корректность и принимает решение о возможности обслуживания клиента. Любая ошибка при ручном вводе увеличивает риск повторных проверок, задержек или некорректной верификации личности. Если банк пропустил мошенника с поддельными документам, ему придется не только терпеть финансовые потери от оформленных кредитов, но и отвечать перед регулятором.</p><p>Не менее важен вопрос обработки персональных данных. Передавая изображения документов на ручную обработку оператором или внешнему подрядчику – за пределы собственной инфраструктуры – финансовая организация расширяет зону ответственности за безопасность данных клиентов. Утечка или неправомерное раскрытие персональных данных, даже если они произошли по вине подрядчика, не снимают ответственности с банка.</p><p>По этим причинам для большинства банков принципиально важно, чтобы обработка документов была не только максимально качественной, но и происходила внутри защищенного контура организации. Автоматическое распознавание паспорта для РКО позволяет решить обе задачи одновременно: ускорить подтверждение личности клиента и минимизировать влияние человеческого фактора.</p><h2>Какие технологии позволяют автоматизировать РКО</h2><p><a href="https://smartengines.ru/raspoznavanie-dokumentov-v-dbo/">Автоматизировать ввод документов</a> для расчетно-кассового обслуживания сегодня позволяют технологии OCR, однако далеко не каждое ПО соответствует требованиям банковской отрасли. Простые технологии OCR с низким качеством распознавания и невозможностью работы в реальных сценариях не решают главной проблемы – убрать ручной труд в части проверки и корректировки неверно распознанных данных.</p><p>Если заниматься этим по-прежнему приходится сотрудникам банка – экономического эффекта от такой “автоматизации” РКО не будет. Если эта задача перекладывается на сторонних операторов – как часто происходит при использовании облачных сервисов OCR – банк разрывает свой контур безопасности и вынужден брать на себя риски, связанные с передачей персональных данных своих клиентов третьим лицам. Сегодня штрафы за утечку ПДн достигают 500 млн руб.</p><p>Поэтому финансовые организации выбирают промышленные платформы для высокоточного распознавания, работающие по модели on-premise. Такой подход позволяет автоматизировать обработку документов внутри собственной инфраструктуры, обеспечивая одновременно высокую скорость, качество распознавания и соответствие требованиям информационной безопасности.</p><p>Именно по такому принципу построена система распознавания <a href="https://smartengines.ru/">Smart Engines</a>, которая позволяет автоматически извлекать данные из документов как в отделениях, так и во всех цифровых каналах обслуживания.</p><h2>Как устроена технология распознавания документов от Smart Engines</h2><p>Промышленная платформа Smart Engines убирает ручной ввод данных из документов на всех ключевых этапах РКО – от первого визита клиента в отделение банка до последующих взаимодействий в физических и цифровых каналах.</p><p>При обслуживании в офисе сотруднику достаточно отсканировать паспорт или навести на документ камеру рабочего устройства. Система Smart Engines менее чем за секунду автоматически извлекает реквизиты документа и заполняет необходимые поля без ручной перепечатки. Алгоритмы искусственного интеллекта обеспечивают высокую точность даже при бликах, тенях, расфокусе и съемке под углом. Платформа распознает не только печатные данные, но и рукописные поля, включая штампы о регистрации.</p><figure><img src="https://media.tproger.ru/user-uploads/134985/2026-06-29/c60b1c30-2242-4e45-99ae-863118a569c5.webp" alt="" /><figcaption>Распознавание паспорта РФ</figcaption></figure><p>Система Smart Engines поддерживает распознавание паспортов РФ, документов граждан стран СНГ, водительских удостоверений и других документов, удостоверяющих личность. Поддержка 103 языков позволяет банкам одинаково эффективно обслуживать иностранных клиентов, предъявляющих национальные паспорта и другие удостоверения личности.</p><p>При этом задача банка не ограничивается извлечением данных. Не менее важно убедиться в подлинности документа. Для этого в платформу Smart Engines интегрирована <a href="https://smartengines.ru/smart-document-forensics/">антифрод-система «Шерлок»</a>, которая анализирует более 600 признаков подделки. Она сверяет данные визуальной и машиночитаемой зон документа, сравнивает их с информацией на NFC-чипе (если он есть в документе), выявляет признаки переклейки фотографии, цифровой обработки изображения и дипфейки. В результате банк за одно действие одновременно получает корректные реквизиты документа и проводит KYC.</p><h2>On-premise и распознавание в браузере, Telegram и MAX</h2><p>Особое значение для финансовых организаций в 2026 году имеет возможность использовать единую технологию во всех каналах обслуживания. Решение Smart Engines подходит для распознавания документов не только в отделениях, но и в цифровых сервисах банков.</p><p>Благодаря технологии WebAssembly <a href="https://smartengines.ru/raspoznavanie-dlya-kreditnogo-konvejera/">распознавание документов</a> выполняется непосредственно в браузере без установки мобильного приложения. Решение легко интегрируется в интернет-банк, сайты, а также мини-приложения Telegram и MAX, позволяя банку выстроить единый сценарий обслуживания независимо от точки взаимодействия с клиентом.</p><p>Еще одно принципиальное преимущество платформы – архитектура on-premise. Все документы обрабатываются внутри защищенного контура банка и не передаются на внешние серверы. Это позволяет не только соблюдать требования информационной безопасности и законодательства о персональных данных, но и исключить зависимость от внешней инфраструктуры. Производительность системы достигает 125 разворотов паспорта в секунду на одном сервере без использования GPU, а качество распознавания достигает 99,9%.</p><h2>Практика внедрения: как банки получают измеримый эффект в РКО</h2><p>Преимущества промышленного распознавания хорошо видны на реальных проектах.</p><p>Например, Банк «Санкт-Петербург» благодаря системе Smart Engines <a href="https://smartengines.ru/news/bspb-i-smart-engines-uskorili-dostup-k-bankovskim-uslugam-v-ofisah-banka/">выстроил единый стандарт обслуживания</a> для всей сети офисов. До внедрения Smart Engines время оформления документов во многом зависело от загруженности конкретного офиса и опыта сотрудника. Сегодня технология автоматического распознавания используется во всех отделениях банка для быстро открытия счета и других операций. Достаточно навести камеру на основной разворот паспорта и страницу с регистрацией перед камерой – ИИ автоматически извлекает необходимые данные менее чем за секунду.</p><p>Главный результат проекта – не просто ускорение отдельных операций. Банк получил единый высокий стандарт клиентского сервиса сразу во всей сети. Скорость оформления перестала зависеть от операциониста, выросла пропускная способность отделений, а качество клиентского сервиса стало одинаково высоким даже в часы максимальной нагрузки.</p><p>Другой кейс – <a href="https://smartengines.ru/news/rnko-metallurg-obsluzhil-sotni-tysyach-klientov-v-otdeleniyah-s-pomoshhyu-ii-smart-engines/">внедрение в РНКО «Металлург»</a> – показывает, что автоматизация обработки документов дает ощутимый экономический эффект. Рост клиентского потока привел к тому, что сотрудники физически перестали успевать вручную обрабатывать паспорта клиентов. После внедрения системы Smart Engines объем ручного ввода <a href="https://www.tadviser.ru/index.php/%D0%A1%D1%82%D0%B0%D1%82%D1%8C%D1%8F:%D0%95%D0%B3%D0%BE%D1%80_%D0%9A%D0%B0%D1%80%D0%B0%D1%81%D0%B5%D0%B2%2C_%D0%A0%D0%9D%D0%9A%D0%9E_%D0%9C%D0%B5%D1%82%D0%B0%D0%BB%D0%BB%D1%83%D1%80%D0%B3:_%D0%9D%D0%B0_%D1%80%D0%B0%D1%81%D0%BF%D0%BE%D0%B7%D0%BD%D0%B0%D0%B2%D0%B0%D0%BD%D0%B8%D0%B8_%D0%BF%D0%B0%D1%81%D0%BF%D0%BE%D1%80%D1%82%D0%B0_%D0%B2_%D0%BE%D1%82%D0%B4%D0%B5%D0%BB%D0%B5%D0%BD%D0%B8%D1%8F%D1%85_%D0%BC%D1%8B_%D0%B7%D0%B0%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%B0%D0%BB%D0%B8_%D0%B2_%D1%82%D1%8B%D1%81%D1%8F%D1%87%D0%B8_%D1%80%D0%B0%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B5%2C_%D1%87%D0%B5%D0%BC_%D0%BF%D0%BE%D1%82%D1%80%D0%B0%D1%82%D0%B8%D0%BB%D0%B8">сократился как минимум в четыре раза</a>, а среднее время обслуживания клиента – от входа в отделение до завершения операции – стабильно составляет около восьми минут.</p><p>Важным показателем стала не только скорость распознавания, но и финансовый результат. По оценке руководства РНКО «Металлург», экономический эффект от внедрения оказался настолько высоким, что банк заработал на использовании технологии распознавания паспорта в тысячи раз больше, чем потратил на ее внедрение.</p><h2>Итоги: зачем внедрять ИИ для распознавания документов в РКО</h2><p>Сегодня ручной ввод документов становится одним из последних факторов, ограничивающих скорость РКО. Он увеличивает стоимость операций, снижает пропускную способность отделений, создает дополнительную нагрузку на сотрудников и повышает риск ошибок. По этим причинами банки активно переводят обработку документов на ИИ. Кто делает это раньше, тот быстрее открывает счета и удерживает клиентов.</p><p>Решения Smart Engines автоматизируют обработку документов во всех каналах обслуживания, объединяя высокоточное распознавание, проверку подлинности и безопасную обработку данных внутри контура банка. В результате финансовые организации не просто ускоряют открытие счетов и оформление услуг, а получают масштабируемую инфраструктуру, которая снижает операционные расходы, повышает качество клиентского сервиса и обеспечивает единый стандарт обслуживания независимо от канала взаимодействия с клиентом.</p><p>По совокупности всех этих факторов внедрение промышленных технологий <a href="https://smartengines.ru/avtomatizacziya-kyb/">распознавания документов</a> в 2026 году рассматривается уже не как ИТ-инициатива, а как инвестиция в повышение производительности и снижение расходов.</p><p><i>Реклама. Рекламодатель: ООО «Смарт Энджинс Сервис» ИНН 7728328449, erid: 2W5zFJLbM1K</i></p>]]></content:encoded>
    </item>
    <item>
      <title>Вышла Reka Edge — 7B vision-модель, которая видит почти как Gemini 3 Pro</title>
      <link>https://tproger.ru/news/reka-edge--multimodalnaya-model-na-7b--kotoraya-vidit-kak-gemin</link>
      <comments>https://tproger.ru/news/reka-edge--multimodalnaya-model-na-7b--kotoraya-vidit-kak-gemin?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Картофельный Повелитель]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/reka-edge--multimodalnaya-model-na-7b--kotoraya-vidit-kak-gemin</guid>
      <description><![CDATA[<p>Reka AI выпустила Reka Edge — мультимодальную модель на 7B параметров для распознавания изображений и видео. 331 токен на картинку, запуск на RTX 3090 и Mac. Разбираем бенчмарки.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/reka-edge--multimodalnaya-model-na-7b--kotoraya-vidit-kak-gemin">Вышла Reka Edge — 7B vision-модель, которая видит почти как Gemini 3 Pro</a>»</p>]]></description>
      <category><![CDATA[Open Source]]></category>
      <category><![CDATA[Инструменты]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Новости]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 27 Mar 2026 15:31:36 GMT</pubDate>
      <content:encoded><![CDATA[<p>Компания Reka AI выпустила <b>Reka Edge</b> — легковесную мультимодальную модель на 7B параметров для распознавания изображений, анализа видео и детекции объектов. Модель специально оптимизирована для работы на edge-устройствах: смартфонах, дронах, роботах и камерах наблюдения.</p><p>При своём размере Reka Edge в ряде бенчмарков приближается к <b>Gemini 3 Pro</b>, а в видеопонимании и tool-use обходит все open-weight модели сопоставимого размера — <b>Qwen 3.5 9B</b> и <b>Cosmos Reason2 8B</b>.</p><p><b>Главное:</b> Reka Edge — vision-language модель на 7B параметров: 6,4B языковая база + 660M ConvNeXt V2 vision-энкодер. Тратит всего 331 токен на изображение 1024×1024 (Qwen 3.5 9B — 1041). На RTX 3090 выдаёт 500+ токенов/с. Бесплатна для коммерческого использования при выручке до $1 млн/год.</p><h2>Что под капотом</h2><p>Архитектура Reka Edge состоит из двух компонентов:</p><ul><li><b>ConvNeXt V2 vision-энкодер</b> (657M параметров) — свёрточная сеть для обработки изображений и потокового видео</li><li><b>Transformer backbone</b> (6,4B параметров) — обучен с нуля для рассуждений и генерации текста</li></ul><p>Ключевая особенность — <b>жёсткая экономия контекста</b>. Модель генерирует всего 64 токена на один тайл изображения. Это значит, что на картинку 1024×1024 уходит <b>331 токен</b> — втрое меньше, чем у конкурентов:</p><ul><li>Reka Edge — <b>331 токен</b></li><li>Cosmos Reason2 8B — 1 063 токена</li><li>Qwen 3.5 9B — 1 041 токен</li><li>Gemini 3 Pro — 1 094 токена</li></ul><p>Меньше токенов = быстрее инференс и ниже стоимость. Reka Edge обрабатывает <b>5,46 изображений в секунду</b> — это в 2 раза быстрее, чем Qwen 3.5 9B и Cosmos Reason2 8B. Time to First Token — всего <b>0,52 секунды</b>.</p><h2>Бенчмарки: 7B против флагманов</h2><figure><img src="https://media.tproger.ru/user-uploads/133946/2026-03-27/dbd2b2eb-bc4e-42c4-bcc3-e55ca69f45c1.webp" alt="Таблица бенчмарков Reka Edge: сравнение с Cosmos Reason2 8B, Qwen 3.5 9B и Gemini 3 Pro по VQA-v2, MLVU, MMVU, RefCOCO, VideoHallucer и Mobile Actions" /><figcaption>Результаты бенчмарков Reka Edge в сравнении с конкурентами. Источник: <a href="https://reka.ai/news/reka-edge-frontier-level-edge-intelligence-for-physical-ai">reka.ai</a></figcaption></figure><p>Основные результаты:</p><ul><li><b>MLVU (видеопонимание): 74,3</b> — значительно опережает Qwen 3.5 9B (52,4) и Cosmos Reason2 8B (37,9). Для сравнения, у Gemini 3 Pro — 80,7</li><li><b>VQA-v2: 88,4</b> — почти на уровне Gemini 3 Pro (89,8)</li><li><b>RefCOCO (детекция объектов): 93,1 / 86,7</b> — на уровне Qwen 3.5 9B (93,6 / 88,8)</li><li><b>Mobile Actions (tool-use): 88,4</b> — сопоставимо с Gemini 3 Pro (89,4)</li><li><b>VideoHallucer (галлюцинации): 59,6</b> — лучший среди open-weight моделей своего размера</li></ul><h2>Где запускать</h2><p>Модель запускается на удивительно скромном железе:</p><ul><li><b>Mac на Apple Silicon</b> — от 24 ГБ памяти (рекомендуется 32 ГБ+)</li><li><b>NVIDIA GPU</b> — от RTX 3090 (24 ГБ VRAM), префил ~500 токенов/с</li><li><b>NVIDIA Jetson</b> — AGX Orin и Thor для edge-деплоя</li><li><b>С 4-bit квантизацией</b> — потребление памяти падает с 13 ГБ до 5 ГБ при сохранении 98% качества</li></ul><p>Для серверного деплоя есть <a href="https://github.com/reka-ai/vllm-reka">плагин для vLLM</a>. Установка — три команды:</p><h2>Лицензия и доступ</h2><p>Reka Edge выпущена с <b>открытыми весами</b>. Модель можно использовать в коммерческих проектах <b>бесплатно</b>, если годовая выручка не превышает <b>$1 млн</b>. Для крупных компаний — корпоративная лицензия.</p><ul><li><a href="https://huggingface.co/RekaAI/reka-edge-2603">Веса на Hugging Face</a></li><li><a href="https://github.com/reka-ai/vllm-reka/blob/main/README.md">Инструкция по деплою через vLLM</a></li><li><a href="https://app.reka.ai/reka-edge">Демо в Reka Playground</a></li></ul><h2>FAQ</h2><h3>Что умеет Reka Edge?</h3><p>Распознавание изображений (VQA), анализ видео, детекция и локализация объектов по текстовому описанию, а также tool-use для автономных агентов. Модель принимает изображения, видео и текст на вход, генерирует текст на выходе.</p><h3>Можно ли запустить на ноутбуке?</h3><p>Да, если это Mac с Apple Silicon и минимум 24 ГБ RAM. На Windows/Linux нужна видеокарта с 24 ГБ VRAM. С 4-bit квантизацией модель занимает всего 5 ГБ — что открывает запуск на ещё более скромных конфигурациях, включая смартфоны.</p><h3>Чем Reka Edge лучше Qwen 3.5 9B?</h3><p>Reka Edge значительно быстрее (в 2 раза по throughput), экономнее по токенам (331 vs 1041 на изображение) и существенно превосходит Qwen в видеопонимании (MLVU 74,3 vs 52,4). При этом модель меньше — 7B против 9B параметров.</p><p>Источники: <a href="https://reka.ai/news/reka-edge-frontier-level-edge-intelligence-for-physical-ai">Reka AI Blog</a>, <a href="https://huggingface.co/RekaAI/reka-edge-2603">Hugging Face</a>, <a href="https://github.com/reka-ai/vllm-reka">GitHub</a></p>]]></content:encoded>
    </item>
    <item>
      <title>Антифрод против мошенников: как технологии ИИ защищают бизнес от поддельных документов</title>
      <link>https://tproger.ru/articles/antifrod-protiv-mowennikov--kak-tehnologii-ii-zashhishhayut-biznes-ot</link>
      <comments>https://tproger.ru/articles/antifrod-protiv-mowennikov--kak-tehnologii-ii-zashhishhayut-biznes-ot?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Дима Дмитриев]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/antifrod-protiv-mowennikov--kak-tehnologii-ii-zashhishhayut-biznes-ot</guid>
      <description><![CDATA[<p>Как ИИ-системы антифрода выявляют поддельные паспорта и дипфейки: технологии проверки документов, тренды 2026 и чеклист для разработчиков.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/antifrod-protiv-mowennikov--kak-tehnologii-ii-zashhishhayut-biznes-ot">Антифрод против мошенников: как технологии ИИ защищают бизнес от поддельных документов</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Распознавание]]></category>
      <category><![CDATA[Кибербезопасность]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 03 Mar 2026 13:00:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>Что еще страшнее, сегодня мошенники активно применяют фотошоп и генеративный ИИ, — это позволяет им создавать фальшивые паспорта, которые человек уже не способен отличить от оригинала “на глаз”. В России проблема растёт каждый год, причем около трети подделок в общей массе приходится на паспорта РФ и стран СНГ.</p><p>Что спасает нас сегодня от мошенников с поддельными документами? В этой статье мы разобрались, как работают промышленные системы проверки подлинности и как правильно выбирать технологию антифрода.</p><h2>Как изменились подделки</h2><p><b>Раньше мошенники делали физическую подделку</b> — кривые шрифты, неправильное ламинирование оператор в банке почти всегда замечал. <a href="https://ieeexplore.ieee.org/abstract/document/9540787">Сейчас схема другая</a>: мошенники создают цифровые подделки на базе утекших данных из реальных паспортов и предъявляют их как в онлайн-каналах обслуживания, так и в  физических.</p><p><b>Мошенники активно применяют генеративный ИИ.</b> Распространение популярных ИИ-сервисов для генерации изображений <a href="https://www.forbes.ru/tekhnologii/548592-ne-k-licu-razvitie-ii-podstegivaet-rost-ob-ema-poddel-nyh-dokumentov">сделало</a> фальсификацию документов намного доступнее для мошенников. Без специализированных инструментов сгенерированный паспорт почти нельзя отличить от настоящего. Это позволяет злоумышленникам проходить проверки и получать услуги от лица жертв.</p><p><b>Часть мошенников теперь не тратит время на качество.</b> <a href="https://www.biometricupdate.com/202602/the-ai-fraud-scheme-scammers-use-to-bypass-verification-systems">Они генерируют тысячи подделок</a> и заваливают ими системы банков. Если система недостаточно качественная и пропускает хотя бы 0,1% из них — при тысячах попыток это уже несколько успешных атак. Дальше — кредиты, обнал, SIM-swap для мошенников, для банков — многомиллионные убытки и минус репутация.</p><h2>Почему разработчикам стало сложнее</h2><ol><li>Всё ушло в онлайн. К концу 2025 года 88,5% финансовых услуг в России оформлялись в цифровом виде. Это означает, что чаще всего клиент предъявляет не физический документ, а его изображение.  Система антифрода должна уметь надежно проверять паспорт по одной фотографии, сделанной на телефон.</li><li>Фото приходят плохие. В отделении паспорт клали на сканер, а при удалённом обслуживании пользователь снимает телефоном: блик от лампы, тень, наклон, смазанность. Если система не справляется с распознаванием и выдает ошибку — пользователь уходит к конкуренту, а бизнес теряет клиента.</li><li><a href="https://www.computerra.ru/336949/potok-migrantov-v-rossiyu-rastet-kak-zashhititsya-ot-riskov-pri-trudoustrojstve-i-obsluzhivanii-inostrantsev/">Добавьте сюда рост трудовой миграции</a>. Рабочие приезжают не только из СНГ, но и из Индии, Китая, Бангладеш и стран Африки. У иностранных паспортов часто другая структура полей и может отсутствовать MRZ. Современная система должна поддерживать более 100 языков и понимать логику документов любого государства.</li></ol><h2>Какие тренды антифрода в 2026</h2><p><b>Тренд 1 — точное сканирование при любых условиях</b></p><p>Мошенники специально загружают снимки низкого качества — чтобы замаскировать следы правки, поэтому система должна правильно обрабатывать документ при любом ракурсе. Антифрод должен проверять документ по 600+ параметрам: искать вставки полей из других документов, склейки фрагментов, проверять голограммы, выявлять следы графических редакторов, признаки дипфейков.</p><p><b>Тренд 2 — работать с разными типами входных данных</b></p><p>Мультимодальные модели, которые одновременно анализируют несколько источников информации, сейчас считаются одним из самых прогрессивных классов нейросетевых моделей, а их рынок в 2025 году оценивали примерно<a href="https://www.researchnester.com/ru/reports/multimodal-ai-market/6472"> в 2,35 млрд долларов</a>. В прошлом году российские учёные совершили <a href="https://www.techinsider.ru/technologies/1696073-sherlok-na-straje-poryadka-pervyi-multimodalnyi-ii-sposoben-proveryat-dokumenty-po-600-parametram/">прорыв</a> в мультимодальной форензике. Они представили систему, обученную параллельно работать с изображениями документов в оптическом, ультрафиолетовом и инфракрасном диапазонах, с видеопотоком, текстовыми полями, штрих‑кодами, метаданными, подписями и данными с бесконтактной RFID‑метки, которая есть в загранпаспортах нового образца.</p><p><b>Тренд 3 — защищать от спуфинг-атак</b></p><p>В удалённых каналах антифрод-системы должны защищать от спуфинг-атак — попыток пройти проверку от лица жертвы. Для этого применяются технологии сверки лиц – на селфи пользователя и на фото в документе. Некоторые решения обходятся без сбора и сохранения биометрических дескрипторов и внешних баз — данные клиента остаются защищёнными.</p><h2>Чеклист для разработчика в 2026 году</h2><p>Вы интегрируете антифрод в код или настраиваете пайплайн верификации? Смотрите на обработку персональных данных — фото и сканов паспортов. OCR уже запускается локально <a href="https://www.computeroptics.ru/KO/Annot/KO45-5/450509.html">на устройстве пользователя</a> или вашем сервере. Вам не нужны вендоры, которые тянут трафик в свои облака, внешние серверы или краудсорсинг — будут дыры в безопасности данных.</p><p>Проверяйте совместимость с отечественным стеком ОС. Если проект идёт под госкомпании или критическую инфраструктуру, вам понадобятся Astra Linux, ALT Linux, РЕД ОС, Эльбрус или ОС Аврора. Требуйте сертификаты совместимости и результаты реальных тестов.</p><p>Соберите все критерии — точность распознавания в любых условиях, 600+ проверок, мультимодальность, локальную обработку, совместимость со стеком — и ваш бизнес выдержит реальность 2026 года, а мошенники останутся не у дел.</p>]]></content:encoded>
    </item>
    <item>
      <title>3 месяца, 7 человек и 95% точность: как мы научили нейросеть следить за самокатами</title>
      <link>https://tproger.ru/articles/3-mesyaca--7-chelovek-i-95--tochnost--kak-my-nauchili-nejroset-sle</link>
      <comments>https://tproger.ru/articles/3-mesyaca--7-chelovek-i-95--tochnost--kak-my-nauchili-nejroset-sle?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Соколова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/3-mesyaca--7-chelovek-i-95--tochnost--kak-my-nauchili-nejroset-sle</guid>
      <description><![CDATA[<p>Самокатчики под присмотром: как собрали платформу интеллектуального мониторинга с компьютерным зрением.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/3-mesyaca--7-chelovek-i-95--tochnost--kak-my-nauchili-nejroset-sle">3 месяца, 7 человек и 95% точность: как мы научили нейросеть следить за самокатами</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 27 Jan 2026 04:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>⭐ <b>Участник Продуктовой Премии Tproger 2025 — проголосовать за кейс <a href="https://tprg.ru/6kng">можно по ссылке</a></b></p><p>Городские администрации вынуждены верить операторам кикшеринга на слово — данные о нарушениях контролирует только бизнес, и проверить их невозможно.</p><p><a href="https://tprg.ru/zPTh" rel="nofollow">NetVision</a> за 3-4 месяца создал платформу интеллектуального мониторинга, которая через компьютерное зрение фиксирует реальные нарушения: езду вдвоем, проезд переходов без спешивания, парковку в неположенных местах.</p><p>Команда из 7 человек собрала уникальный датасет, достигла точности распознавания 95% и дала городу инструмент для регулирования микромобильности на основе фактов.</p><figure><img src="https://media.tproger.ru/user-uploads/113485/2026-01-26/a6593a4b-54b9-4124-b86a-a114cb7b2fcd.webp" alt="" /><figcaption><br /></figcaption></figure><h2>Задача: дать городу объективный контроль над самокатами</h2><p><b>Бизнес-задача</b> — решить проблему «слепой зоны» в управлении городом, где операторы кикшеринга обладают монополией на данные о поездках. Городская администрация не имеет инструментов объективного контроля и вынуждена либо запрещать самокаты полностью, либо мириться с хаосом и нарушениями. Конфликт между городом и бизнесом строится на эмоциях, а не на фактах.</p><p><b>Техническая задача </b>— создать систему мониторинга, которая через компьютерное зрение анализирует видеопоток с городских камер и фиксирует реальные нарушения правил использования средств индивидуальной мобильности. Система не должна полагаться на GPS-трекинг или датчики операторов, которые можно подкрутить. Только независимая детекция через видео. Результат — не просто штрафы, а аналитические дашборды для принятия управленческих решений в реальном времени.</p><h2>Параметры проекта</h2><p><b>Срок разработки:</b> 3-4 месяца от идеи до работающего MVP с дашбордом в контуре потенциального клиента.</p><p><b>Команда:</b> 7 человек (R&amp;D-лид, ML-инженеры, стажёры, Backend-разработчики, Frontend-разработчик).</p><p><b>Точность детекции:</b> 95% и выше на распознавании паттернов поведения.</p><p><b>Подход:</b> гибридная разработка с разделением R&amp;D для проверки гипотез с математиками и продакшн-доработки платформы Netvision.</p><p><b>Результат:</b> собран огромный уникальный датасет городских инцидентов с СИМ.</p><h2>Архитектура: компьютерное зрение вместо GPS</h2><p>Платформа Netvision Micromobility Control построена на микросервисной архитектуре для гибкости и быстрого масштабирования:</p><p>→ Видеопоток с городских камер</p><p>→ Нейросетевые сервисы компьютерного зрения (кастомные модели + собственная топология)</p><p>→ Детекция паттернов нарушений (езда вдвоем, проезд перехода, парковка)</p><p>→ Backend на Rust, C#, Python для обработки данных</p><p>→ Аналитические модули на C++ для высокопроизводительных вычислений</p><p>→ Frontend с интерактивными дашбордами и геоаналитикой (карты, тепловые зоны)</p><p>Ключевое отличие — система не использует GPS и датчики операторов, которые можно манипулировать. Только независимый анализ видео через компьютерное зрение. Модели обучены на уникальном датасете реальных городских инцидентов, собранном командой.</p><h2>Пять технических прорывов проекта</h2><p><b>1. Детекция сложных паттернов в плотном потоке</b></p><p>Научить нейросеть распознавать «два человека на одном самокате» или «движение по переходу без спешивания» в плотном потоке людей — нетривиальная задача. Стандартные модели детекции объектов не справляются с перекрытиями, быстрыми движениями и специфическими углами камер.</p><p>Команда разработала кастомные модели компьютерного зрения, часть из которых имеют нестандартные реализации, а часть — полностью собственную топологию под конкретные городские сценарии.</p><figure><img src="https://media.tproger.ru/user-uploads/113485/2026-01-26/6350f708-62cb-475e-a528-b2cd756ffdfa.webp" alt="" /><figcaption>Нейросеть распознаёт нарушение в плотном потоке людей</figcaption></figure><p><b>2. Сбор датасета в условиях закрытого контура</b></p><p>В защищенном контуре городской безопасности практически невозможно получить данные с дорожных камер, перекрестков и других источников видео. На первом этапе команда собирала данные в открытых источниках. Когда их стало не хватать, использовали обзорные камеры с общим доступом через интернет. Для первичной обработки применяли тяжелые vision-модели, которые составляли сырой датасет для последующей разметки под узкоспециализированные модели.</p><p>Когда данных с реальными нарушителями не хватало, команда оборудовала полигон большим количеством камер и, поднимая командный дух, устроила заезд на самокатах по безопасному участку. Так собрали edge cases и редкие паттерны поведения, которые критичны для высокой точности модели.</p><p><b>3. Computer Vision вместо трекинга операторов</b></p><p>Принципиальное решение — не полагаться на GPS-трекинг или данные с IoT-датчиков самокатов, которые контролируют операторы. Такие данные можно подкрутить или не передавать. Система анализирует только видеопоток — независимый источник правды. Это делает мониторинг объективным и дает городу реальный инструмент контроля, не зависящий от воли бизнеса.</p><p><b>4. Data-Driven регулирование через аналитику</b></p><p>Система превращает видео не просто в штрафы, а в аналитические дашборды для принятия управленческих решений. Администрация видит тепловые карты трафика самокатов, зоны концентрации нарушений, динамику по времени суток и дням недели. На основе этих данных можно аргументированно вводить «медленные зоны», выделять парковки, регулировать правила — не вслепую, а evidence-based.</p><figure><img src="https://media.tproger.ru/user-uploads/113485/2026-01-26/62860c2a-ee87-44d7-90bc-a46efc834661.webp" alt="" /><figcaption>Аналитический дашборд Netvision Micromobility Control</figcaption></figure><p><b>5. Гибридный подход к разработке</b></p><p>Команда применила гибридный подход, разделив R&amp;D для проверки гипотез с математиками и продакшн-доработку платформы для умных городов Netvision. Это ускорило Time-to-Market: пока математики тестировали новые модели на экспериментальных данных, продакшн-команда интегрировала проверенные решения в платформу. Параллельная работа двух треков позволила выйти на MVP за 3-4 месяца вместо полугода.</p><h2>Главная трудность: доступы и сбор данных</h2><p><b>🔴 Проблема: Закрытый контур городской безопасности</b></p><p>Получить доступ к данным с дорожных камер, перекрестков и других источников видео в защищенном контуре городской безопасности практически невозможно. Без реальных данных обучить модель на городских сценариях нельзя. Открытые датасеты не покрывают специфику российских городов, плотность трафика, углы установки камер.</p><p><b>✅ Решение: Многоступенчатый сбор от открытых источников до собственного полигона</b></p><ul><li>Первый этап — сбор данных из открытых источников и обзорных камер с доступом через интернет.</li><li>Второй этап — использование тяжелых vision-моделей для первичной обработки и составления сырого датасета, который затем размечался под узкоспециализированные модели.</li><li>Третий этап — команда оборудовала полигон большим количеством камер и устроила заезд на самокатах, фиксируя различные паттерны поведения и нарушения. Это дало редкие edge cases и повысило точность модели до 95%. Такой подход превратил ограничение в преимущество — датасет получился уникальным и идеально заточенным под российские городские условия.</li></ul><h2>Результаты: от споров к фактам</h2><p>Точность определения паттернов поведения на уровне 95% и выше позволяет использовать систему для реального контроля, а не только экспериментов. Собран огромный уникальный датасет реальных городских инцидентов с участием средств индивидуальной мобильности.</p><p>Выявлено значительное преобладание проезда переходов на самокате без спешивания — конкретные цифры дали администрации аргументы для регулирования правил. Инициирован многосторонний диалог между городом и операторами кикшеринга на основе объективных данных, а не эмоций.</p><p>Продукт меняет парадигму взаимодействия «Город — Кикшеринг». Вместо эмоциональных споров и взаимных обвинений появляются факты. Администрация получает аргументы для введения «медленных зон» или выделения парковок, основанные на реальной статистике нарушений и трафика. Для рынка это шаг к цивилизованной микромобильности: безопасность повышается без тотальных запретов отрасли, которые убивают бизнес и лишают горожан удобного транспорта.</p><blockquote>Это «Умный Город» с человеческим лицом — технологии берегут жизни и здоровье пешеходов и самокатчиков, сохраняя при этом удобство передвижения по городу. Баланс между безопасностью и свободой передвижения достигается через данные, а не через запреты.</blockquote><h2>Планы развития</h2><p><a href="https://tprg.ru/zPTh" rel="nofollow">NetVision</a> развивает платформу по трем направлениям: интеграция в умные камеры для вычислений непосредственно на борту через edge computing, что снизит нагрузку на серверы и ускорит реакцию системы; расширение набора распознаваемых паттернов поведения — детекция парковки в неположенных местах, движения против потока, использования самокатов детьми без сопровождения; возможная интеграция с внешними системами, включая операторов кикшеринга, для автоматического информирования о нарушениях и создания единой экосистемы управления микромобильностью.</p><p><i>Реклама. ООО «Нетвижн», ИНН 7716951948, erid: 2W5zFGaC713</i></p>]]></content:encoded>
    </item>
    <item>
      <title>Как довести компьютерное зрение от прототипа до продакшена</title>
      <link>https://tproger.ru/articles/kak-dovesti-kompyuternoe-zrenie-ot-prototipa-do-prodakwena</link>
      <comments>https://tproger.ru/articles/kak-dovesti-kompyuternoe-zrenie-ot-prototipa-do-prodakwena?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Denis Prodan]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kak-dovesti-kompyuternoe-zrenie-ot-prototipa-do-prodakwena</guid>
      <description><![CDATA[<p>Что происходит с компьютерным зрением после демо. Грязные данные, разные камеры, форматы, FPS, мониторинг качества и обновления без боли.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kak-dovesti-kompyuternoe-zrenie-ot-prototipa-do-prodakwena">Как довести компьютерное зрение от прототипа до продакшена</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Hardware]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 12 Jan 2026 14:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Прототип с компьютерным зрением обычно рождается красиво. Есть ноутбук, Jupyter, пара картинок, модель ловит объекты с 0.9 confidence, все в чате довольны.</p><p>Продакшен начинается в тот момент, когда к этой модели подключают реальные камеры, реальное железо, реальную сеть и реальных людей. Там внезапно выясняется, что:</p><ul><li>данные живут своей жизнью</li><li>модель не такая уж «устойчивая»</li><li>пайплайн никто толком не спроектировал</li><li>обновлять все это больно и страшно</li></ul><p>Ниже разберем, что обычно ломается по дороге от демки до боевого контура, и что лучше заложить сразу.</p><h2>1. Прототип обманывает</h2><p>В прототипе все под контролем:</p><ul><li>вы сами выбрали фотки</li><li>вы сами обрезали кадр</li><li>вы сами решили, в каком формате будет вход</li></ul><p>В проде:</p><ul><li>камера дает муть, шум и грязь</li><li>половину времени у девайса кривая экспозиция</li><li>иногда кадр вообще не доезжает</li></ul><p>Поэтому первая честная мысль: прототип почти всегда переоценивает качество данных.</p><p>Если вы тестировали только на статичных картинках, добавьте себе в задачу: «прогнать модель на реальном видеопотоке хотя бы пару часов» и тупо посмотреть глазами, что приходит. Это сильно остудит оптимизм.</p><h2>2. Видео против картинок: разные миры</h2><p>Классическая ошибка: модель обучалась на картинках, а в проде работает с видеопотоком.</p><p>С картинками все просто, у вас есть независимые сэмплы. В видео:</p><ul><li>кадры коррелируют</li><li>объекты двигаются</li><li>объекты пропадают и появляются</li><li>часть кадров размазана или с артефактами</li></ul><p>Отсюда вылезают вопросы:</p><ul><li>как часто вообще дергать модель</li><li>обрабатывать каждый кадр или через N</li><li>как трекать объекты между кадрами</li><li>что считать «исчезновением» объекта, а что временной потерей</li></ul><p>Если этого не прописать в архитектуре, вы получите дергающиеся боксы, прыгающие ID объектов и логику, которая ведет себя рандомно в зависимости от FPS и нагрузки.</p><h2>3. Пайплайн, а не «одна модель»</h2><p>В продакшене у вас никогда не «одна модель». У вас цепочка, которая примерно выглядит так:</p><ol><li>Ингест: вытащить кадр из камеры, очереди, файла, потока</li><li>Предобработка: ресайз, кроп, нормализация, поправить ориентацию, вытянуть яркость</li><li>Инференс: прогон через модель (или несколько моделей)</li><li>Постобработка: NMS, фильтры по классам и порогам, подправить координаты</li><li>Аггрегация по времени: трекинг, сглаживание, логика «объект появился/исчез»</li><li>Выгрузка: записать события в базу, отправить дальше, дернуть вебхук, обновить UI</li></ol><p>И вот в каждом шаге:</p><ul><li>может быть баг</li><li>может быть деградация качества</li><li>может быть узкое место по скорости</li></ul><p>Если в голове по-прежнему живет картинка «я просто вызову model.predict()», то прод упадет в тот момент, когда вам нужно будет, например, поменять формат входа или добавить вторую модель в цепочку.</p><h2>4. Форматы и протоколы: боль тихая, но убийственная</h2><p>Еще один классический грабель: форматы данных.</p><p>То, что в ноутбуке было «просто numpy array», в проде превращается в:</p><ul><li>RTSP, RTMP, HLS</li><li>JPEG с разными профилями</li><li>видео с разным FPS и битрейтом</li><li>разные цветовые пространства</li><li>разные разрешения и соотношения сторон</li></ul><p>А дальше начинается веселое:</p><ul><li>где-то перепутали порядок каналов</li><li>где-то поменяли RGB на BGR</li><li>где-то ресайзнули с искажением пропорций</li><li>где-то забыли нормализовать вход</li></ul><p>На демке это почти не видно. В проде это может дать стабильный минус к метрикам, и команда месяц будет думать, что «модель устарела».</p><p>Минимум, который стоит сделать:</p><ul><li>явно задокументировать формат кадра на каждом шаге</li><li>держать маленький скрипт, который берет кадр «с продакшена» и прогоняет его через пайплайн локально, чтобы снять подозрения</li><li>иметь тесты, которые проверяют, что формат не поехал после очередного «рефакторинга»</li></ul><h2>5. Время и синхронизация</h2><p>Еще одна вещь, про которую обычно вспоминают в последнюю очередь: время.</p><p>Если у вас:</p><ul><li>несколько камер</li><li>несколько источников данных</li><li>асинхронные очереди</li></ul><p>то рано или поздно выяснится:</p><ul><li>у камеры неправильное время</li><li>у сервера своя временная зона</li><li>сеть добавляет задержку</li><li>сообщения приходят не по порядку</li></ul><p>В результате:</p><ul><li>объект в одном потоке «появился» позже, чем в другом, хотя в реальности было наоборот</li><li>события сложно связать</li><li>агрегация по времени превращается в кошмар</li></ul><p>Поэтому лучше сразу решить, как у вас будет устроен time:</p><ul><li>откуда берете «истину»</li><li>как нормализуете timestamps</li><li>что делаете с событиями, которые слишком отстают или опережают</li></ul><p>Без нормальной временной модели CV система в проде превращается в шизофреника.</p><h2>6. Версионирование моделей и данных</h2><p>В прототипе живет одна единственная best_model.pth. В реальном проекте:</p><ul><li>есть старая версия модели, которая «точно работает»</li><li>есть новая, которую все хотят выкатить</li><li>есть эксперименты, которые кто-то успел где-то обучить</li><li>есть разные конфиги порогов и постобработки</li></ul><p>Если это не систематизировать, вас ждет:</p><ul><li>«а какой моделью сейчас вообще все крутится»</li><li>«а этот баг был и в прошлой версии или новый»</li><li>«а мы точно не переехали на кривый чекпоинт»</li></ul><p>Что нужно минимум:</p><ul><li>хранить модели с понятными версиями</li><li>хранить вместе с моделью: конфиг, пороги, схему постобработки</li><li>иметь хотя бы примитивный model registry, неважно, на чем</li><li>писать в логи, какая версия модели обработала конкретный запрос или кадр</li></ul><p>Идеально, когда можно взять конкретный кейс из продакшена, поднять его локально и прогнать через нужную версию модели и пайплайна.</p><h2>7. Качество: как понять, что все пошло не так</h2><p>В офлайне вы смотрите на mAP, F1, ROC, красивые таблички. В проде метрики живут другой жизнью.</p><p>Что реально надо мониторить:</p><ul><li>распределение confidence по классам</li><li>количество срабатываний по источникам и по времени суток</li><li>долю «пустых» кадров</li><li>кол-во ошибок пайплайна по шагам</li><li>latency на каждый этап</li></ul><p>И главное: вам нужно хотя бы какое-то количество вручную размеченных продакшен-примеров, чтобы периодически пересчитывать качество на реальных данных.</p><p>Без этого проект живет в режиме «пока никто не жалуется, значит, все ок». Это не стратегия.</p><h2>8. Перформанс и железо</h2><p>Еще одна история: модель, которая работает за 40 мс на вашей 3090, внезапно превращается в тыкву на реальном железе.</p><p>Там может быть:</p><ul><li>слабый GPU</li><li>CPU-only</li><li>ограниченная память</li><li>ограниченный сетевой канал</li></ul><p>При этом вам нужно:</p><ul><li>держать стабильный FPS</li><li>не вываливаться по latency</li><li>не убивать соседние сервисы</li></ul><p>Тут начинаются компромиссы: квантование, обрезание входа, уменьшение частоты инференса, батчинг, перенос части логики на edge.</p><p>Если вы не считали перформансную бюджетку заранее, то неприятно окажется, что «эта крутая модель невозможна на том железе, которое уже купили».</p><h2>9. Обновления без инфаркта</h2><p>Прототип никто не обновляет, его просто перезапускают. Продакшен обновлять придется часто:</p><ul><li>поменялась модель</li><li>поменялась постобработка</li><li>поправили баг в трекинге</li><li>добавили новый класс</li></ul><p>Если у вас нет стратегии обновления, то каждый релиз превращается в лотерею:</p><ul><li>отвалится ли половина инстансов</li><li>совпадут ли версии клиента и сервера</li><li>не разъедутся ли схемы событий</li></ul><p>Нужен минимальный набор:</p><ul><li>staged rollout (канареечные деплои или хотя бы один тестовый источник)</li><li>возможность отката на предыдущую версию без танцев</li><li>проверка схем и форматов до выката</li><li>простой чеклист «что проверяем после деплоя»</li></ul><h2>10. Что из этого всего важно прямо сейчас</h2><p>Если коротко, чтобы CV система дожила до продакшена и не умерла через неделю, ей нужны не только веса модели. Ей нужны:</p><ul><li>честное понимание качества реальных данных</li><li>четко описанный пайплайн от кадра до события</li><li>контроль форматов и времени</li><li>версионирование моделей и конфигов</li><li>мониторинг качества и перформанса</li><li>стратегия обновлений</li></ul><p>Если об этом думать с самого начала, код в ноутбуке перестает быть разовой демкой и получает шанс стать нормальным продуктом.</p><p>Если нет, вы получите очередной «красивый кейс для презентации», который так никогда и не выйдет за пределы пилота.</p>]]></content:encoded>
    </item>
    <item>
      <title>Курсы по робототехнике: онлайн-обучение роботостроению</title>
      <link>https://tproger.ru/articles/kursy-po-robototehnike--onlajn-obuchenie-robotostroeniyu</link>
      <comments>https://tproger.ru/articles/kursy-po-robototehnike--onlajn-obuchenie-robotostroeniyu?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Анастасия Шишкина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kursy-po-robototehnike--onlajn-obuchenie-robotostroeniyu</guid>
      <description><![CDATA[<p>Курсы робототехники. Рейтинг вариантов дистанционного обучения, обзор программы и стоимости курсов роботостроения.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kursy-po-robototehnike--onlajn-obuchenie-robotostroeniyu">Курсы по робототехнике: онлайн-обучение роботостроению</a>»</p>]]></description>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Быстрый старт]]></category>
      <category><![CDATA[Практика]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Arduino]]></category>
      <category><![CDATA[Raspberry Pi]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[Навыки]]></category>
      <category><![CDATA[Для продвинутых]]></category>
      <category><![CDATA[3D-принтер]]></category>
      <category><![CDATA[Образование]]></category>
      <category><![CDATA[Программирование для детей]]></category>
      <category><![CDATA[Разработка]]></category>
      <category><![CDATA[Lego]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 02 Oct 2025 12:43:59 GMT</pubDate>
      <content:encoded><![CDATA[<p>Сегодня курсы по робототехнике открывают двери в профессию, которая сочетает в себе технические навыки и творческое мышление. Это уже не просто сборка механизмов — это дизайн, программирование искусственного интеллекта и даже создание систем управления для беспилотных и космических аппаратов. Онлайн-обучение позволяет освоить эту профессию не только инженерам, но и всем, кто готов учиться, экспериментировать с собственными проектами — независимо от возраста и уровня подготовки.</p><p>Я изучила десятки обучающих программ и подобрала платформы для удаленного обучения. В этой подборке вы найдете ТОП-10 курсов, далее — 6 обучающих программ, которые могут пригодиться как вспомогательные, и, наконец, 6 бесплатных вариантов.</p><h2>ТОП-10 курсов по робототехнике</h2><p>Данные курсы робототехники подойдут для тех, кто желает освоить профессию с нуля, а также опытных специалистов, которые стремятся улучшить свои компетенции. В этом списке я собрала обучающие программы для взрослых людей, которые хотят углубиться в C++, Linux или математику, а также преподавать программирование и роботостроение. Отдельно я выделила платформы для детей – ведь начинать никогда не рано.</p><p><b>Для взрослых: </b></p><p>1. <a href="https://experts1.ru/bEnriA?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=1"><b>C++ для
робототехников</b></a> от платформы <b>Skillbox</b>
— это обучение профессиональному программированию на C++.</p><p>2. <a href="https://experts1.ru/qhoWfG?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=2"><b>Педагог
дополнительного образования (робототехника)</b></a> от <b>НАДПО</b> — для будущих преподавателей
робототехнического направления.</p><p>3. <a href="https://experts1.ru/btsfEH?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=3"><b>Linux для
робототехников</b></a> от платформы <b>Skillbox</b>
— для освоения системного ПО.</p><p>4. <a href="https://experts1.ru/FvVeft?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=4"><b>Технология
использования робототехники в дошкольном образовании</b></a> от центра
дистанционного образования <b>НИИДПО</b> —
подойдет педагогическим работникам, которые планируют применять создание
роботов в качестве инструмента для детского развития.</p><p>5. <a href="https://experts1.ru/sOxJfq?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=5"><b>Робототехника
как инструмент формирования SOFT SKILLS компетенций</b></a><a href="https://experts1.ru/sOxJfq?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=5"> </a>от <b>Знанио
</b>— разработан для наставников и преподавателей, которые хотят развивать у
учащихся компетенции Soft Skills с помощью роботостроения.</p><p>6. <a href="https://experts1.ru/bVQkhg?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=6"><b>Математика для
робототехников</b></a><b> </b>от
платформы <b>Skillbox </b>—<b> </b>обучающая программа для тех, кто хочет
изучить математические основы роботостроения и с помощью них освоить навык
решения инженерных задач.</p><p><b>Для детей: </b></p><p>7. <a href="https://experts1.ru/qorOHm?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=7"><b>Робототехника
для школьников на базе Lego WeDo 2.0</b></a> — это старт в обучении робототехнике для учеников младших классов от<b> Школы программирования Pixel</b>. Эта
программа позволяет в игровой форме научиться конструированию и блочному
программированию на популярной платформе Lego.</p><p>8. <a href="https://experts1.ru/mejgMI?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=8"><b>Робототехника и
программирование для детей</b></a><b>
от Educationrobots </b>— здесь создают собственных роботов, постигают основы
программирования, физики и математики в игровой и непринужденной форме.</p><p>9. <a href="https://experts1.ru/beVdgZ?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=9"><b>Робототехника
для дошкольников на базе Lego</b></a> от<b> Школы программирования Pixel </b>— программа разработана специально
для детей младшего возраста, которые любят конструировать.</p><p>10. <a href="https://experts1.ru/vxtyWJ?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=10"><b>Робототехника
для школьников на платформе Arduino</b></a> от <b>Знанио </b>— позволяет перейти к серьезным проектам на Arduino.</p><h2>Курсы по робототехнике для взрослых</h2><p><b>1. <a href="https://experts1.ru/bEnriA?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=1">C++ для робототехников</a> | Skillbox   </b></p><p>Разработан для тех, кто желает научиться профессионально программировать роботов. За три месяца вы освоите язык C++, научитесь работать с популярными фреймворками Arduino и Qt, а также сможете создавать софт для управления роботами. Автор программы — опытный инженер-разработчик, который поможет разобраться даже в самых сложных темах. В конце обучения вы разработаете собственную программу управления роботом на Qt5.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-10-02/f98705d9-f1f7-47d6-a0a6-1acb045dff54.jpg" alt="" /></figure><ul><li><b>Стоимость:</b> 74 893 руб. или 41 191 руб. со скидкой (при использовании промокода), возможна рассрочка 6865 руб./мес.</li><li><b>Длительность:</b> 3 месяца</li><li><b>Формат обучения: </b>Практические занятия и лекции в формате онлайн</li><li><b>Сертификат:</b> Сертификат Skillbox</li></ul><p><b>Кому подойдет:</b></p><p>Начинающим программистам и инженерам, у которых уже есть базовые знания алгоритмов и математики на школьном уровне. Он станет ступенью для тех, кто стремится получить прикладные навыки для работы в сфере роботостроения.</p><p><b>Преимущества: </b></p><ul><li>не требует покупки оборудования — все практические задания выполняются в симуляторе, поэтому не придется тратиться на робота;</li><li>можно возвращаться к материалам и обновлениям даже после завершения учебы;</li><li>полностью ориентирован на практику — при обучении программированию на C++ роботостроение используется как основной контекст для всех задач.</li></ul><p><b> Недостатки: </b></p><ul><li>курс робототехники для взрослых не подходит для абсолютных новичков, для старта необходимо знать основы программирования и математики.</li></ul><p><b> Программа обучения: </b></p><ul><li>базовое изучение и программирование на языке C++;</li><li>работа с библиотеками и фреймворками;</li><li>создание графического интерфейса; управление роботами;</li><li>создание собственного приложения.</li></ul><p>Используйте промокод kursfinder, чтобы получить скидку 60% на профессии и 50% на курсы.</p><p><b>2. <a href="https://experts1.ru/qhoWfG?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=2">Педагог дополнительного образования (робототехника)</a> | НАДПО </b></p><p>Онлайн-курс профпереподготовки предназначен для педагогов, желающих получить официальную квалификацию в сфере роботостроения. Программа поможет освоить принципы и методики преподавания роботостроения, научиться составлять учебные планы и организовывать проектную деятельность для учеников. Преподают эксперты-практики НАДПО.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-10-02/b5399113-8014-4f76-8e7d-da29de0f7ef2.jpg" alt="" /></figure><ul><li><b>Стоимость:</b> 45 000 руб. — со скидкой 34 600 (возможна рассрочка от 2 883 руб./мес.), 31 140 руб. — если оплатить на сайте (действует дополнительная скидка 10%).</li><li><b>Длительность:</b> 4 мес. (540 ч)</li><li><b>Формат обучения:</b> Дистанционный</li><li><b>Сертификат:</b> Диплом о профпереподготовке</li></ul><p><b>Кому подойдет:</b></p><p>Образовательный модуль рассчитан на педагогов, желающих освоить новую востребованную профессию. Программа соответствует государственным стандартам и дает право вести педагогическую деятельность.</p><p><b>Преимущества: </b></p><ul><li>по окончании выдается диплом, который дает право на ведение педагогической деятельности;</li><li>обучение проходит в дистанционной форме, что дает возможность совмещать его с основной деятельностью;</li><li>образовательный модуль учит не только техническим навыкам, но и тому, как эффективно передавать их ученикам;</li><li>НАДПО помогает выпускникам в трудоустройстве, наставник оказывает поддержку на начальном этапе частной практики.</li></ul><p><b>Недостатки: </b></p><ul><li>длительность — обучение занимает 4 месяца, что может не подойти тем, кто ищет экспресс-программу обучения по робототехнике;</li><li>модуль ориентирован на педагогику и не дает углубленных технических знаний для инженеров-разработчиков.</li></ul><p><b>Программа обучения: </b></p><ul><li>нормативно-правовые основы в образовании;</li><li>основы робототехники и программирования;</li><li>методика преподавания;</li><li>разработка учебных планов;</li><li>организация проектной деятельности.</li></ul><p><b>3. <a href="https://experts1.ru/btsfEH?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=3">Linux для робототехников</a> | Skillbox  </b></p><p>Используйте промокод kursfinder, чтобы получить скидку 60% на профессии и 50% на курсы.</p><p>Этот курс разработан для тех, кто стремится освоить операционную систему Linux – одну из основных платформ для разработки роботов. Вы освоите навык работы с командной строкой, фреймворками ROS и ROS2, а также с такими инструментами, как Git и Docker. Ведет Роман Федоренко, который основал компанию «Зилант роботикс». Он поможет изучить базовые основы для старта в карьере.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-10-02/85b5bdba-7793-4490-a614-7569fbea187d.jpg" alt="" /></figure><ul><li><b>Стоимость:</b> действует рассрочка на 6 мес. — 9760 руб. в мес. / со скидкой 45% — 5 368 руб. / мес.</li><li><b>Длительность:</b> 3 месяца</li><li><b>Формат обучения:</b> лекции в онлайн-режиме, практика</li><li><b>Сертификат:</b> Сертификат Skillbox</li></ul><p><b> Кому подойдет:</b></p><p>Лекции и практические уроки рассчитаны на начинающих инженеров-разработчиков, которые стремятся освоить одну из самых популярных операционных систем в роботостроении и научиться работать с фреймворками ROS, ROS2.</p><p><b> Преимущества: </b></p><ul><li>программа фокусируется на прикладных знаниях, необходимых именно для работы в сфере создания роботов;</li><li>обучает эксперт-практик с большим опытом в индустрии;</li><li>работа с современными инструментами — в программе есть Git, Docker и Bash-скрипты, что делает этот образовательный модуль актуальным.</li></ul><p><b> Недостатки: </b></p><ul><li>не дает комплексных знаний в обучении роботостроению, а фокусируется только на Linux;</li><li>не подходит для новичков — для прохождения требуются базовые знания.</li></ul><p><b>Программа обучения: </b></p><ul><li>введение в работу с ОС Linux;</li><li>методы создания изолированных сред для запуска приложений;</li><li>базовая работа с ROS;</li><li>собственный проект создания робота.</li></ul><p><b>4. <a href="https://experts1.ru/FvVeft?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=4">Технология использования робототехники в дошкольном образовании</a> | НИИДПО </b></p><p>Данный курс фокусируется на игровых методиках и простых конструкторах, которые помогут детям в освоении базовых навыков, развитии логики, мелкой моторики и пространственного мышления. Программа научит создавать уроки, которые помогут подготовить детей к школе. Преподают практикующие эксперты-практики — кандидаты наук.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-10-02/0fa5ebd2-43e1-4f8b-9adf-a140aa461ab8.jpg" alt="" /></figure><ul><li><b>Стоимость:</b> 7900 руб. / со скидкой — 5200 руб. (возможна рассрочка 1300 руб. каждые 2 недели)</li><li><b>Длительность:</b> 1,5 месяца (108 часов), возможен экспресс-курс — 1 мес.</li><li><b>Формат обучения: </b>Дистанционный</li><li><b>Сертификат: </b>Сертификат компетенций, удостоверение о повышении квалификации</li></ul><p><b>Кому подойдет:</b></p><p>Образовательный модуль разработан для воспитателей и учителей младших классов, планирующих внедрение основ роботостроения в развивающие занятия с детьми 3-7 лет.</p><p><b>Преимущества: </b></p><ul><li>доступ к лекциям — после окончания обучения материалы лекций остаются доступными;</li><li>гибкий график — обучение проходит дистанционно, что позволяет совмещать его с работой.</li></ul><p><b> Недостатки: </b></p><ul><li>не дает технических знаний — ориентирован на педагогику и не учит созданию сложных роботов.</li></ul><p><b>Программа обучения: </b></p><ul><li>виды конструкторов нового поколения для малышей;</li><li>особенности развития дошкольников;</li><li>игровые методики обучения конструированию;</li><li>практические задания с Lego WeDo.</li></ul><p><b>5. <a href="https://experts1.ru/sOxJfq?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=5">Робототехника как инструмент формирования SOFT SKILLS компетенций</a> | Знанио  </b></p><p>Экспресс-курс, направленный на повышение квалификации педагогов. Программа поможет научиться формировать у детей Soft Skills: критическое мышление, навыки командной работы, творческий подход.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-10-02/831f03d0-eb9a-438d-b4a4-d7e17c986130.jpg" alt="" /></figure><ul><li><b>Стоимость:</b> 3990 руб. / со скидкой — 1990 руб.</li><li><b>Длительность:</b> 72 часа</li><li><b>Формат обучения:</b> Дистанционный (заочный — самостоятельное изучение материалов)</li><li><b>Сертификат:</b> Удостоверение о повышении квалификации</li></ul><p><b>Кому подойдет: </b></p><p>Онлайн-курс по робототехнике предназначен для педагогических работников и методистов, которые хотят использовать роботостроение в качестве инструмента для развития Soft Skills у своих учеников.</p><p><b>Преимущества: </b></p><ul><li>обучиться можно всего за 10 дней;</li><li>вы можете вернуть деньги, если программа не подойдет, до ее завершения;</li><li>стоимость низкая по сравнению с аналогами.</li></ul><p><b>Недостатки: </b></p><ul><li>этот обучающий модуль не дает технических знаний по сборке и программированию роботов;</li><li>самостоятельный формат может быть минусом для тех, кто нуждается в постоянной поддержке наставника;</li><li>в описании не указан конкретный автор-практик.</li></ul><p><b>Программа обучения: </b></p><ul><li>применение роботов в системе образования;</li><li>методики обучения и межпредметные связи;</li><li>контроль знаний.</li></ul><p><b>6. <a href="https://experts1.ru/bVQkhg?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=6">Математика для робототехников</a> | Skillbox </b></p><p>Программа создана для тех, кто стремится получить фундаментальные знания в области математики, необходимые для решения прикладных задач в роботостроении. Курс обучения робототехнике онлайн ведет Олег Буличев, инженер-исследователь, который поможет увидеть взаимосвязь математики и программного кода.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-10-02/2ed65922-7c17-4bb8-86d1-441df43d1ecf.jpg" alt="" /></figure><ul><li><b>Стоимость: </b>рассрочка на 6 мес. — 9495 руб. в месяц / со скидкой — 5 222 руб.</li><li><b>Длительность:</b> 2,5 месяца</li><li><b>Формат обучения:</b> Практика и лекции в режиме онлайн</li><li><b>Сертификат:</b> Сертификат Skillbox</li></ul><p><b>Кому подойдет:</b></p><p>Курс рассчитан на инженеров и программистов, стремящихся систематизировать свои знания по высшей математике и научиться применять их для разработки роботов и беспилотников.</p><p><b> Преимущества: </b></p><ul><li>курс ведет практикующий инженер с опытом работы 11 лет;</li><li>программа сфокусирована на прикладных навыках и не содержит лишней теории;</li><li>обучение проходит на платформе, имеющей государственную лицензию.</li></ul><p><b>Недостатки: </b></p><ul><li>высокий порог входа — курс требует предварительных знаний по математике и основам программирования;</li><li>основное внимание уделяется математике, а не практической сборке роботов или разработке программ для них.</li></ul><p><b>Программа обучения: </b></p><ul><li>математика многомерных пространств;</li><li>принципы дифференциальных и интегральных исчислений;</li><li>изучение законов движения и равновесия;</li><li>анализ случайных событий и данных.</li></ul><h2>Курсы робототехники для детей</h2><p><b>7. <a href="https://experts1.ru/qorOHm?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=7">Робототехника для школьников на базе Lego WeDo 2.0</a> | Школа программирования Pixel </b></p><p>Этот обучающий курс от школы Pixel — один из курсов по робототехнике для детей, который подойдет для знакомства с программированием. Он основан на популярном конструкторе Lego WeDo 2.0. Дети научатся собирать роботов, работать в команде и освоят основы блочного программирования.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-10-02/dac03ce8-f55a-4240-9d07-715428e58166.jpg" alt="" /></figure><ul><li><b>Стоимость:</b> 800 руб. за 1 занятие</li><li><b>Длительность:</b> 9 месяцев</li><li><b>Формат обучения: </b>Очно в группах, занятия 1 раз в неделю</li><li><b>Сертификат:</b> Сертификат о прохождении курса</li></ul><p><b>Кому подойдет:</b></p><p>Образовательный модуль подходит для детей от 7 до 10 лет, делающих свои первые шаги в программировании и конструировании. Он рассчитан на новичков и на тех, кто уже знаком с робототехникой.</p><p><b> Преимущества: </b></p><ul><li>геймификация и практические задания;</li><li>работа с Lego WeDo 2.0;</li><li>дети учатся работать в команде и находить общие решения;</li><li>конструирование роботов из мелких деталей улучшает моторику и пространственное мышление.</li></ul><p><b> Недостатки: </b></p><ul><li>очный формат занятий делает программу недоступной для тех, кто не может посещать уроки лично.</li></ul><p><b>Программа обучения: </b></p><ul><li>знакомство с робототехникой и Lego Education WeDo 2.0;</li><li>изучение основ блочного программирования;</li><li>управление моторами и датчиками;</li><li>понятия «цикл» и «ожидание»;</li><li>закрепление материала;</li><li>разработка собственного проекта.</li></ul><p><b>8. <a href="https://experts1.ru/mejgMI?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=8">Робототехника и программирование для детей</a> | Educationrobots </b></p><p>Курс предлагает комплексное изучение множества дисциплин, поскольку основан на STEM-подходе, который объединяет науку, технологии, инженерию и математику. Этот подход позволяет детям увидеть, как знания из разных областей работают вместе. Преподают опытные педагоги. Дети учатся программировать, решать сложные задачи, создавать роботов.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-10-02/6668a922-06c7-4dc7-bb1e-07d3cc79e54e.jpg" alt="" /></figure><ul><li><b>Стоимость:</b> 7 500 руб. в месяц. Доступны скидки при оплате за полгода или год.</li><li><b>Длительность: </b>3 года</li><li><b>Формат обучения:</b> групповые занятия в офлайн-формате 1 раз в неделю (2ч)</li><li><b>Сертификат: </b>сертификат о прохождении курса</li></ul><p><b>Кому подойдет:</b></p><p>Курс создан для детей и подростков, которые интересуются, как устроена техника, любят что-то создавать своими руками. Также модуль подходит для всех, кто стремится развить логическое мышление, навыки решения проблем и умение работать в команде.</p><p><b>Преимущества:</b></p><ul><li>комплексное развитие (STEM-подход);</li><li>практический опыт с современным оборудованием — 3D-принтеры, лазерные резаки, контроллеры Arduino и т.д.;</li><li>дополнительные возможности — участие в грантах, конкурсах, выставках и программах для талантливой молодежи.</li></ul><p><b>Недостатки: </b></p><ul><li>продолжительность обучения, что требует долгосрочных обязательств.</li></ul><p><b>Программа обучения:</b></p><ul><li>сборка и программирование собственных роботизированных устройств;</li><li>изучение физики, математики, основ электроники и программирования, а также других 11 дисциплин в связке;</li><li>проектная работа.</li></ul><p><b>9. <a href="https://experts1.ru/beVdgZ?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=9">Робототехника для дошкольников на базе Lego</a> | Школа программирования Pixel </b></p><p>Этот обучающий курс разработан специально для дошкольников, которые хотят познакомиться с миром робототехники и механики в игровой форме. Основная задача программы — развитие логического и пространственного мышления. Дети собирают конструкции из Lego, а затем учатся управлять ими, что помогает им лучше понимать, как устроены окружающие предметы.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-10-02/d75b581a-e4b7-4363-973a-a5653775a8b8.jpg" alt="" /></figure><ul><li><b>Стоимость:</b> от 800 руб. за 1 занятие</li><li><b>Длительность:</b> 9 месяцев (полный курс)</li><li><b>Формат обучения:</b> очные занятия в группах</li><li><b>Сертификат:</b> о прохождении курса</li></ul><p><b>Кому подойдет:</b></p><p>Курсы рассчитаны на детей от 5 до 7 лет, которые делают свои первые шаги в конструировании и творчестве. Программа подойдет для любознательных дошкольников, которые любят работать с конструкторами и хотят узнать, как оживить свои поделки.</p><p><b> Преимущества: </b></p><ul><li>занятия построены в виде игр;</li><li>использование популярного конструктора Lego;</li><li>конструирование из мелких деталей;</li><li>фокус на базовых механизмах, что дает фундаментальные знания о работе устройств.</li></ul><p><b> Недостатки: </b></p><ul><li>ограниченная доступность — занятия проходят очно, что делает их недоступными для жителей других городов.</li></ul><p><b> Программа обучения: </b></p><ul><li>изучение базовых механических устройств (рычаги, передачи);</li><li>основы конструирования из Lego;</li><li>знакомство с флорой и фауной (моделирование животных);</li><li>проект по изучению космоса (создание планет и спутников).</li></ul><p><b>10. <a href="https://experts1.ru/vxtyWJ?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=10">Робототехника для школьников на платформе Arduino</a> | Знанио </b></p><p>Этот онлайн-курс от инженера-преподавателя Наума Розенталя — способ познакомиться с платформой Arduino. Он поможет школьникам освоить азы программирования на языке C++ и основы электроники. За короткий срок ребенок научится создавать и программировать простые робототехнические устройства, чтобы в дальнейшем реализовывать свои проекты в этой сфере.</p><figure><img src="https://media.tproger.ru/user-uploads/108137/2025-10-02/f0a5a7ea-1132-4104-be8e-bef2d1507896.jpg" alt="" /></figure><ul><li><b>Стоимость:</b> 400 руб.</li><li><b>Длительность:</b> от 1 дня</li><li><b>Формат обучения:</b> онлайн, самостоятельное изучение</li><li><b>Сертификат:</b> о прохождении курса</li></ul><p><b> Кому подойдет:</b></p><p>Обучение рассчитано на школьников, помогает в быстром и недорогом старте в мир более серьезной робототехники, чем Lego. Будет полезно тем, кто уже имеет базовое представление о программировании и хочет перейти к работе с настоящими электронными устройствами.</p><p><b> Преимущества: </b></p><ul><li>низкая стоимость;</li><li>быстрый старт;</li><li>практическая направленность — программа включает создание простых, но реальных проектов, таких как «Светофор», «Мини-пианино», «Мигалка» и др.</li><li>гарантия возврата денег, если обучение не оправдает ожиданий.</li></ul><p><b>Недостатки: </b></p><ul><li>из-за короткой длительности учеба дает только базовые знания и не предполагает создания сложных проектов;</li><li>формат самостоятельного обучения без прямого общения с преподавателем может быть минусом для тех, кому нужна помощь наставника.</li></ul><p><b> Программа обучения: </b></p><ul><li>введение в платформу Arduino;</li><li>изучение основ электроники;</li><li>основы программирования на С++;</li><li>разработка собственных простых проектов.</li></ul><h2>Еще 6 курсов по робототехнике</h2><p>Обучение робототехнике дистанционно открывает двери в одну из самых востребованных сфер. Это комплексный навык, который объединяет знания из области программирования, инженерии и логического мышления.  Я собрала еще 6 курсов для тех, кто желает обучиться новой профессии:</p><ul><li><b><a href="https://experts1.ru/zsdEaU?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Курс робототехники и электроники для взрослых</a> от Kod-robota</b> — это комплексный онлайн-курс для взрослых, который позволяет с нуля освоить основы электроники и программирования. Вы научитесь работать с платформами Arduino и Raspberry Pi, создавая реальные проекты на языке Python. Этот обучающий модуль помогает сформировать и развить набор навыков, необходимых для работы с электроникой и робототехникой.</li><li><b><a href="https://experts1.ru/akwjUI?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Мехатроника и робототехника</a> от МАКПП</b> — программа профессиональной переподготовки, которая подойдет педагогам, желающим официально преподавать роботостроение. Дает теоретические знания по механике, электронике и методике преподавания.</li><li><b><a href="https://experts1.ru/bVxTys?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Робототехника и искусственный интеллект</a> от MITM</b> — онлайн-курс, объединяющий роботостроение с передовыми технологиями искусственного интеллекта. Он предназначен для студентов, которые хотят научиться применять машинное обучение и компьютерное зрение для создания «умных» роботов. Комплексная программа объединяет знания из компьютерных наук, электротехники, механики и искусственного интеллекта.</li><li><b><a href="https://experts1.ru/VjbEat?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Педагог по робототехнике</a> от Международной академии бизнеса IAB</b> — программа профессиональной переподготовки создана для подготовки будущих преподавателей роботостроения. Вы получите официальный диплом и научитесь совмещать технические навыки с педагогикой. В программе обучения — основы педагогической деятельности и воспитания детей в игровой форме, основы и методы преподавания роботостроения.</li><li><b><a href="https://experts1.ru/elmvQW?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Педагогическое образование: педагог по робототехнике</a> от Профессионального стандарта</b> — онлайн-курс, позволяющий официально получить квалификацию педагога по робототехнике. Программа соответствует государственным образовательным стандартам и дает знания для работы в образовательных учреждениях. Обучение проходит полностью дистанционно.</li><li><b><a href="https://experts1.ru/AWlvbk?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Основы робототехники и LEGO-конструирования для детей дошкольного и младшего школьного возраста</a> от Экстерна</b> — онлайн-курс разработан для педагогов, которые работают с детьми дошкольного и младшего школьного возраста. Эта программа повышения квалификации по робототехнике и LEGO-конструированию ориентирована на специалистов, которые занимаются обучением и развитием дошкольников и школьников через конструирование. Курс направлен на развитие или получение новых компетенций в области технического конструирования.</li></ul><h2>Бесплатные курсы по робототехнике</h2><p>Бесплатные курсы по робототехнике — возможность сделать первый шаг к новой профессии, не вкладывая денег. Они помогут понять, насколько вам интересна эта область, и определиться с дальнейшим направлением развития.</p><p><b><a href="https://experts1.ru/veHphZ?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Tertiarm. Arduino и манипуляционная робототехника</a> — Stepik </b></p><p>Программа предназначена для новичков, которые хотят получить практические навыки в роботостроении. В ее рамках вы научитесь собирать и программировать небольшой робот-манипулятор на базе платформы Arduino.</p><p><b>Главное о курсе: </b></p><ul><li>ориентирован на практику;</li><li>фокусируется на популярной платформе Arduino;</li><li>подходит для самостоятельного изучения.</li></ul><p><b><a href="https://experts1.ru/xPbouO?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Основы робототехники</a> — Лекториум </b></p><p>Это бесплатные курсы, которые дают фундаментальные знания о роботостроении. Программа предназначена для преподавателей, которые хотят улучшить качество обучения. Слушателям предоставляются готовые решения для построения учебных планов, создания системы оценивания успеваемости и налаживания партнерских связей между школой и вузами.</p><p><b>Главное о курсе: </b></p><ul><li>дает теоретическую базу;</li><li>разработан ведущим техническим вузом;</li><li>подходит для школьников.</li></ul><p><b><a href="https://experts1.ru/SqhxnR?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Первый шаг в робототехнику (демо-курс)</a> — Stepik </b></p><p>Краткий вводный курс, который поможет вам разобраться в базовых понятиях роботостроения. Вы познакомитесь с основными принципами и узнаете, как начать заниматься этой дисциплиной.</p><p><b>Главное о курсе: </b></p><ul><li>идеален для абсолютных новичков;</li><li>очень короткий и простой;</li><li>дает общее представление о сфере роботехники.</li></ul><p><b><a href="https://experts1.ru/cGiUex?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Робототехника LEGO SPIKE PRIME</a> — Лекториум </b></p><p>Данный курс предназначен для школьников, их родителей, учителей и просто энтузиастов. После прохождения обучения вы сможете запрограммировать робота на базе популярной платформы LEGO Education SPIKE PRIME для выполнения серии непростых заданий. Он будет двигаться по линии, избегать препятствий, подниматься на горку и находить выход из лабиринта.</p><p><b>Главное о курсе: </b></p><ul><li>фокусируется на конструкторах LEGO;</li><li>развивает логику и навыки программирования;</li><li>подходит для детей и взрослых.</li></ul><p><b><a href="https://www.youtube.com/live/vopMyDF3Ld0?si=hCoIgMbt26AQBVjE">Робототехника онлайн</a> — Цифровая школа </b></p><p>Курс дает общее представление о робототехнике и ее основных компонентах. Он подходит для детей и взрослых, которые хотят познакомиться с миром роботов и узнать, как они устроены.</p><p><b>Главное о курсе: </b></p><ul><li>вводный курс для широкой аудитории;</li><li>объясняет основные принципы роботостроения;</li><li>подойдет для знакомства с темой.</li></ul><p><b><a href="https://experts1.ru/wCyrvH?sub1=tproger-kf&amp;sub2=kursy-po-robototekhnike&amp;sub4=netop">Хардкорная математика для робототехников</a> — Лекториум </b></p><p>Этот курс для тех, кто уже серьезно занимается созданием роботов и хочет углубиться в математические основы. Он посвящен сложным темам, таким как линейная алгебра и дифференциальные уравнения.</p><p><b>Главное о курсе: </b></p><ul><li>предназначен для продвинутых пользователей;</li><li>необходимы глубокие знания математики;</li><li>помогает освоить теоретическую базу.</li></ul><h2>Зачем обучаться робототехнике?</h2><p>Изучение роботостроения развивает системное мышление, учит детей и взрослых решать сложные задачи. Эта дисциплина объединяет в себе программирование, физику, математику и инженерию, формирует системное и логическое мышление. Обучение роботостроению помогает понять, как устроены современные технологии, и превращает пользователя в разработчика.</p><p>Занятия по роботостроению учат видеть задачу целиком, разбивать ее на мелкие части и находить эффективные решения. Обучение помогает развить усидчивость, креативность и навыки работы в команде, что востребовано в любой современной профессии.</p><h2>Преимущества и недостатки курсов по робототехнике</h2><p>Обучающие программы по роботостроению предлагают структурированный подход к обучению, который значительно ускоряет прогресс. Вы получаете готовый план занятий, опытных преподавателей-наставников. Это позволяет избежать типичных ошибок новичков и сразу сосредоточиться на главном. Слушатели зачастую получают доступ к профессиональному оборудованию, платформам, что не всегда доступно для самостоятельного изучения.</p><p>Еще одно важное преимущество — экспертная поддержка. Преподаватели помогают освоить теорию и применять ее на практике, разобраться в сложных темах, дают обратную связь по проектам и исправляют ошибки.</p><p>Кроме того, учащиеся могут создать сообщество единомышленников, где можно делиться опытом, находить вдохновение и даже работать над совместными проектами.</p><p>Однако есть и свои минусы. Главный из них — стоимость, которая может быть довольно высокой, особенно для программ, требующих дорогостоящих инструментов и оборудования. Также некоторые курсы могут иметь слишком жесткое расписание или не оставлять места для личного творчества, пространства для экспериментов. В случае онлайн-занятий может не хватать живого общения и возможности быстро получить помощь от преподавателя.</p><p><i> А какие курсы заинтересовали вас? Поделитесь своими впечатлениями в комментариях или расскажите о программах, которые не вошли в наш список.</i></p>]]></content:encoded>
    </item>
    <item>
      <title>Интеграция модулей искусственного интеллекта: как компьютерное зрение входит в бизнес-процессы</title>
      <link>https://tproger.ru/articles/integraciya-modulej-iskusstvennogo-intellekta--kak-kompyuternoe-zrenie-vhodit-v-biznes-processy</link>
      <comments>https://tproger.ru/articles/integraciya-modulej-iskusstvennogo-intellekta--kak-kompyuternoe-zrenie-vhodit-v-biznes-processy?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[АИС СОКОЛ]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/integraciya-modulej-iskusstvennogo-intellekta--kak-kompyuternoe-zrenie-vhodit-v-biznes-processy</guid>
      <description><![CDATA[<p>Компьютерное зрение выходит за рамки экспериментов и становится частью инфраструктуры компаний. Как AI-модули внедряются в ERP, MES и складские системы, какие технологии используют и какой бизнес-эффект они дают — от снижения брака до оптимизации логистики.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/integraciya-modulej-iskusstvennogo-intellekta--kak-kompyuternoe-zrenie-vhodit-v-biznes-processy">Интеграция модулей искусственного интеллекта: как компьютерное зрение входит в бизнес-процессы</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sat, 30 Aug 2025 12:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Компании всё активнее внедряют инструменты искусственного интеллекта не как эксперимент, а как часть операционной инфраструктуры. Одно из направлений — интеграция модулей компьютерного зрения и аналитики в существующие системы учёта и управления — от ERP и MES до складских и производственных платформ. Речь уже не о демонстрационных проектах, а о создании рабочих конвейеров, которые обрабатывают видеопотоки в реальном времени, формируют метрики и подсказывают, где вмешаться человеку.</p><h2>Что это за решения и зачем они нужны</h2><p>Под «модулем» обычно понимают набор программных компонентов: предобработка изображений, последовательное применение моделей детекции и классификации, сбор и визуализация результатов. На практике это выглядит как автоматическая обработка видеопотока — очистка от шумов, приведение кадров к единому формату, запуск нейросети для обнаружения объектов или дефектов и передача результатов в систему мониторинга. Задача — уменьшить долю ручной проверки, быстрее выявлять инциденты и собирать статистику для принятия решений.</p><h2>Технологический каркас</h2><p>За такими решениями <a href="https://aissokol.ru/service/service-single-6.html">стоит</a> распространённый стек: библиотеки для обработки изображений (например, OpenCV), фреймворки для нейросетей (TensorFlow, PyTorch), подходы для быстрой детекции (архитектуры в духе YOLO), форматы переносимости моделей (ONNX) и инструменты для развёртывания — контейнеры и оркестраторы (Docker, Kubernetes). Интерфейсы интеграции обычно реализуют через REST/gRPC и SDK для часто используемых языков программирования, что позволяет связать новые модули с корпоративными системами.</p><h2>Где это применяют</h2><p>Практические сценарии распространяются по нескольким отраслям:</p><ul><li><b>Производство.</b> Контроль качества на линии: камеры фиксируют дефектные единицы, система маркирует событие и уведомляет операторов.</li><li><b>Логистика.</b> Трекинг грузов и распознавание этикеток помогают ускорить сортировку и снизить потери.</li><li><b>Сельское хозяйство.</b> Анализ состояния посевов по визуальным признакам позволяет точечно применять агротехнологии.</li><li><b>Медицина (на этапах скрининга).</b> Обработка и предварительная фильтрация изображений для последующего анализа специалистами.</li></ul><p>Во всех этих случаях ключевой эффект — перевод рутинной визуальной работы с людей на алгоритмы, при условии что точность моделей достаточна для эксплуатационного применения.</p><h2>Архитектура развёртывания: edge, облако, гибрид</h2><p>Реальные внедрения стремятся сочетать вычисления на границе сети (edge) и в облаке. Выполнение части аналитики на локальных устройствах сокращает задержки и уменьшает объём передаваемых данных; облачная часть удобна для обучения, версионирования моделей и агрегации метрик. Важной частью решения является MLOps-инфраструктура: репозиторий моделей, автоматическое тестирование и инструменты «горячей» замены версий без простоя производства.</p><h2>Ограничения и вызовы</h2><p>Независимо от технологической привлекательности, интеграция сопровождается набором практических проблем:</p><ul><li><b>Качество данных.</b> Камеры, освещение и ракурсы влияют на стабильность работы моделей. Часто требуется длительная доработка предобработки и сбор «реальных» меток.</li><li><b>Инфраструктурные требования.</b> Сеть, вычислительные узлы и вопросы безопасности — важные элементы, без которых масштабирование проблематично.</li><li><b>Валидация и риски.</b> Неправильные срабатывания или пропуски дефектов в статичных сценариях могут привести к экономическим потерям; необходима тщательная оценка точности и процедуры ручной проверки на переходных этапах.</li><li><b>Экономика внедрения.</b> Оценка окупаемости требует измерения текущих затрат на ручной труд, потерь от брака и эффектов от сокращения простоев.</li></ul><h2>Пошаговый подход к внедрению</h2><p>Практикующие инженеры и консультанты рекомендуют следующий упорядоченный план: сначала провести аудит существующей инфраструктуры (камеры, сеть, источники данных), затем реализовать PoC на одном-двух сценариях с явной метрикой успеха. После подтверждения — развёртывание пайплайнов обработки, интеграция с системами мониторинга и алертинга, и лишь затем — масштабирование с учётом edge/облака и организации процесса дообучения моделей на вновь собранных данных.</p><h2>Как измерять эффект</h2><p>Для оценки результата предлагают отслеживать операционные KPI: снижение доли брака и объёма ручной проверки, уменьшение времени простоев, скорость обнаружения инцидентов и основные метрики качества моделей (precision, recall). Экономическая модель окупаемости строится на снижении OPEX и потенциальном увеличении выхода годной продукции.</p><h2>Вывод</h2><p>Интеграция модулей компьютерного зрения перестаёт быть «навороченным экспериментом» — она становится инструментом оптимизации процессов. Однако переход от прототипа к надёжному промышленному решению требует внимания к данным, инфраструктуре и процедурам валидации. Успех зависит не только от выбранной нейросети, но и от дисциплины внедрения: корректной предобработки, стабильного конвейера развёртывания и системы метрик, которые позволяют понять, когда автоматизация действительно приносит бизнес-результат.</p>]]></content:encoded>
    </item>
    <item>
      <title>«Камера вместо прогулки»: как компьютерное зрение меняет инспекции в сельском хозяйстве и строительстве</title>
      <link>https://tproger.ru/articles/-kamera-vmesto-progulki---kak-kompyuternoe-zrenie-menyaet-inspekcii-v-selskom-hozyajstve-i-stroitelstve</link>
      <comments>https://tproger.ru/articles/-kamera-vmesto-progulki---kak-kompyuternoe-zrenie-menyaet-inspekcii-v-selskom-hozyajstve-i-stroitelstve?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[АИС СОКОЛ]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/-kamera-vmesto-progulki---kak-kompyuternoe-zrenie-menyaet-inspekcii-v-selskom-hozyajstve-i-stroitelstve</guid>
      <description><![CDATA[<p>Как компьютерное зрение сокращает инспекции в сельском хозяйстве и строительстве: дроны, карты, edge-аналитика и снижение рисков.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/-kamera-vmesto-progulki---kak-kompyuternoe-zrenie-menyaet-inspekcii-v-selskom-hozyajstve-i-stroitelstve">«Камера вместо прогулки»: как компьютерное зрение меняет инспекции в сельском хозяйстве и строительстве</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 28 Aug 2025 14:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Коротко: в последние годы технологии компьютерного зрения вышли из лабораторий и нашли практическое применение в агроинспекции и обследовании сооружений. Вместо десятков часов пеших обходов — дроны, стационарные сенсоры и нейросети, которые превращают тысячи снимков в понятные карты, тревоги и рекомендации для инженеров и агрономов. Это не сценка из научной фантастики, а повседневный инструмент, который уже помогает экономить время и ресурсы — при условии правильной подготовки и интеграции.</p><h2>Что происходит на поле и на стройплощадке</h2><p>Суть проста: на объекте <a href="https://aissokol.ru/service/service-single-8.html">собирают</a> визуальные данные — с дронов, тепловизоров, LiDAR-сканеров или мульти/гиперспектральных камер — затем эти кадры обрабатывают и анализируют. В агросекторе такие данные используют для построения вегетационных карт (например, NDVI), которые показывают участки стресса растений, дефицит влаги или очаги болезней. В строительной инспекции те же инструменты выявляют трещины, коррозию, деформации и тепловые аномалии, указывая, где требуется внимание специалистов.</p><h2>Как это работает — шаг за шагом</h2><ol><li><b>Сбор данных.</b> Дроны покрывают большие площади быстро; стационарные камеры мониторят критичные участки постоянно. Часто применяют съемку в разных спектрах — инфракрасном, мульти- или гиперспектральном — чтобы увидеть то, что не заметно глазу.</li><li><b>Предобработка.</b> Снимки геокалибруют, сшивают в ортофотопланы, корректируют цвет и позицию — иначе «карты» разных замеров нельзя сопоставлять.</li><li><b>Анализ.</b> Нейросети (модели детекции и сегментации) и алгоритмы преобразуют пиксели в метки: «трещина», «зона стресса», «аномалия температуры». Итог — точки на карте, статистика и приоритеты для выезда.</li><li><b>Доставка результата.</b> Вывод — через GIS-слои, дашборды или интеграцию в корпоративные системы: ERP, CRM, BI; иногда — уведомления в мессенджеры для срочного реагирования.</li></ol><h2>Почему edge-вычисления важны</h2><p>Не всё отправляют в облако. Для срочных сценариев часть аналитики выносят на периферию — на борт дрона или на локальные edge-устройства (платформы типа NVIDIA Jetson или Google Coral). Это уменьшает задержки, сокращает объём передаваемых данных и позволяет мгновенно срабатывать на критичные события — полезно там, где связь нестабильна или время реакции критично.</p><h2>Где это даёт наибольший эффект</h2><ul><li><b>Крупные поля</b> — экономия времени и моторесурсов при обследовании сотен гектаров; более точное внесение удобрений и экономия средств.</li><li><b>Карьерные и мостовые инспекции</b> — безопасности за счёт раннего обнаружения дефектов.</li><li><b>Высотные фасады и крыши</b> — доступ туда, куда безопасно и быстро не добраться обычными способами.</li></ul><h2>Ограничения и риски</h2><p>Технологии не всесильны. Погодные условия (туман, сильный ветер, дождь) и качество геопозиционирования снижают точность. Нужны качественные тренировочные данные: модель, обученная на одних условиях, может промахиваться в иных. Регуляторика по использованию беспилотников тоже ограничивает применение в ряде регионов. Наконец, важно не просто «получить карту», а встроить её в рабочие процессы — без этого ценность данных падает.</p><h2>Практические рекомендации для старта</h2><ol><li><b>Пилот на ограниченном участке.</b> Начните с небольшой территории, где можно отладить съёмку, обработку и интеграцию.</li><li><b>Контроль качества данных.</b> Убедитесь в геопривязке и единообразии съёмки по времени и метаданным.</li><li><b>Баланс облако/edge.</b> Решите, какие алгоритмы должны работать в реальном времени, а что можно отправлять на облачный анализ.</li><li><b>Интеграция с системами заказчика.</b> Планируйте экспорт в GIS/BI/ERP — иначе отчёты рискуют остаться «на полке».</li><li><b>План дообучения моделей.</b> Собирайте локальные примеры ошибок и регулярно обновляйте модели на данных заказчика.</li></ol><h2>Итог</h2><p>Компьютерное зрение в агро и технадзоре превращает визуальную информацию в управленческие решения. Это инструмент, который экономит время и снижает риски, но только если подход к внедрению продуман: от выбора сенсоров и протоколов съёмки до инфраструктуры анализа и интеграции с бизнес-процессами. Простого «подключил камеру — и всё само заработало» не бывает — зато при грамотной реализации выгода бывает ощутимой и быстрой.</p>]]></content:encoded>
    </item>
    <item>
      <title>Блогер сделал аимбот в реальной жизни: с электрошоком и ИИ. Рука сама наводится на врага за 100 мс</title>
      <link>https://tproger.ru/news/--bloger-sdelal-aimbot-v-realnoj-zhizni--s-elektrowokom-i-ii--ruka-sama-navoditsya-na-vraga-za-100-ms</link>
      <comments>https://tproger.ru/news/--bloger-sdelal-aimbot-v-realnoj-zhizni--s-elektrowokom-i-ii--ruka-sama-navoditsya-na-vraga-za-100-ms?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Булат Яббаров]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/--bloger-sdelal-aimbot-v-realnoj-zhizni--s-elektrowokom-i-ii--ruka-sama-navoditsya-na-vraga-za-100-ms</guid>
      <description><![CDATA[<p>Блогер создал «Neuromuscular Aim Assist» — ИИ с электростимуляцией, который наводит руку на врага в CS2 за 100 мс, быстрее киберспортсменов</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/--bloger-sdelal-aimbot-v-realnoj-zhizni--s-elektrowokom-i-ii--ruka-sama-navoditsya-na-vraga-za-100-ms">Блогер сделал аимбот в реальной жизни: с электрошоком и ИИ. Рука сама наводится на врага за 100 мс</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Raspberry Pi]]></category>
      <category><![CDATA[Боты]]></category>
      <category><![CDATA[YouTube]]></category>
      <category><![CDATA[Игра]]></category>
      <category><![CDATA[Киберспорт]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 13 Aug 2025 11:45:59 GMT</pubDate>
      <content:encoded><![CDATA[<p>Американский YouTube-блогер Basically Homeless <a href="https://www.youtube.com/watch?v=9alJwQG-Wbk">собрал</a> уникальный <i>«Neuromuscular Aim Assist»</i> — систему автоприцеливания, которая управляет не игрой, а мышцами игрока.</p><p>Вместо софта или модифицированного железа, блогер использовал компьютерное зрение и электрическую стимуляцию, чтобы рука буквально дергалась к цели за доли секунды.</p><p>В основе устройства — EMS/TENS-аппарат, способный подавать электрические импульсы, сокращающие определенные мышцы.</p><p>Система подключена к Raspberry Pi, который получает команды от модели YOLO, обученной на матчах в Counter-Strike 2. Модель в реальном времени анализирует видеопоток игры, определяет противника и через реле подает сигнал на стимулятор.</p><h2>Быстрее, чем киберспортсмены</h2><p>В тестах блогеру удалось сократить время реакции до <b>менее 100 мс</b> — примерно вдвое быстрее его обычного показателя и быстрее, чем у многих профессиональных игроков. При этом устройство может не только наводить руку, но и автоматически нажимать на спуск.</p><p>Проект сопровождался трудностями: от задержек сигнала до болезненных судорог. Но автор все же сумел добиться стабильной работы в отдельных тестах, хотя признает, что надежность пока далека от идеала.</p><figure><img src="https://media.tproger.ru/user-uploads/111041/2025-08-13/8ed7b772-dccb-45cc-a0e4-46bb6f45666c.jpeg" alt="" /></figure><h2>Это чит или нет?</h2><p>На вопрос о честности метода, Basically Homeless отвечает: «это мои мышцы — значит, не чит». По его словам, устройство не вмешивается в код игры, а лишь стимулирует тело игрока.</p><p>В комментариях зрители шутили о «дистопическом будущем киберспорта», играли словами (<i>«результаты были шокирующими»</i>, <i>«очень стимулирующее видео»</i>) и предлагали продолжить эксперименты в других играх.</p><h2>Зачем это все</h2><p>Помимо развлекательной ценности, проект показал, как можно объединить технологии компьютерного зрения, электроники и нейромышечной стимуляции для управления человеком в реальном времени.</p><p>В реальном спорте или медицине такие системы могли бы помочь в тренировках и реабилитации, но в гейминге — это пока что забавный и немного пугающий эксперимент.</p>]]></content:encoded>
    </item>
    <item>
      <title>Эволюция компьютерного зрения в автоматизации тестирования</title>
      <link>https://tproger.ru/articles/evolyuciya-kompyuternogo-zreniya-v-avtomatizacii-testirovaniya</link>
      <comments>https://tproger.ru/articles/evolyuciya-kompyuternogo-zreniya-v-avtomatizacii-testirovaniya?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Марианна Юдина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/evolyuciya-kompyuternogo-zreniya-v-avtomatizacii-testirovaniya</guid>
      <description><![CDATA[<p>Как технологии компьютерного зрения и нейросети меняют подход к UI-тестированию? Рассказываем, почему Vision-Language модели вытесняют классические автотесты, и как они помогают автоматизировать тестирование на естественном языке.

</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/evolyuciya-kompyuternogo-zreniya-v-avtomatizacii-testirovaniya">Эволюция компьютерного зрения в автоматизации тестирования</a>»</p>]]></description>
      <category><![CDATA[Тестирование]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Дизайн интерфейсов и UX]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sun, 27 Jul 2025 10:00:02 GMT</pubDate>
      <content:encoded><![CDATA[<p>Автоматизация тестирования пользовательских интерфейсов прошла долгий путь — от простых скриптов с локаторами до современных методов на базе искусственного интеллекта. Изначально тесты писались вручную с помощью инструментов вроде Selenium: тестировщики указывали, какие элементы на странице найти (например, кнопки или поля ввода) с помощью <b>локаторов </b>— уникальных идентификаторов, XPath или CSS-селекторов. Позднее, чтобы упростить проверку интерфейсов, в дело стало вступать <b>компьютерное зрение</b> — анализ скриншотов с помощью OpenCV и подобных библиотек. Сегодня же на передний план выходят <b>Vision-Language модели (VLM)</b> — нейросети, которые умеют одновременно «видеть» содержимое экранов и понимать текстовые описания.</p><p>В этой статье рассмотрим технические детали каждого этапа эволюции: как работают классические локаторы, как применяются алгоритмы компьютерного зрения и как современные VLM и AI-агенты позволяют автоматизировать тестирование на естественном языке. Также обсудим плюсы и минусы этих подходов на практике и объясним, почему традиционная автоматизация уже не так эффективна по сравнению с новыми методами.</p><h2>Классическая автоматизация: локаторы и код</h2><p><b>Что такое локаторы</b>. Традиционная автоматизация UI опирается на поиск элементов в DOM-дереве страницы с помощью локаторов. Локатор — это указание браузеру, как найти нужный HTML-элемент. Существуют различные стратегии локаторов: по ID, имени, классу, XPath, тексту, а в случае мобильных приложений даже свои собственные механизмы, как UiSelector в Android, например.</p><p>В зависимости от платформы и инструмента, эти стратегии могут использовать различные способы поиска: от простого сопоставления атрибутов до навигации по иерархии элементов. Но все они опираются на представление интерфейса в виде структурированных данных — DOM в вебе или XML-дерево в мобильных приложениях.</p><p>Например, кнопку сабмита формы можно найти по уникальному атрибуту id="submit" или по CSS-классу .btn. Инструменты вроде Selenium WebDriver или современные фреймворки (Playwright, Cypress) позволяют записывать шаги теста, обращаясь к элементам через такие локаторы. Ни один GUI-тест не обходится без этой механики. <i>Какой бы инструмент вы ни выбрали для автоматизации, все они будут искать элементы с помощью локаторов</i>.</p><p><b>Как это работает</b>. Автоматизированный тест-приложение (скрипт на Java, Python, JavaScript и т.д.) взаимодействует с браузером через специальный драйвер. На каждом шаге скрипт отправляет команду: найти элемент по указанному селектору и выполнить действие (клик, ввод текста, чтение свойства). Например, Selenium, получив команду findElement(By.id("login")), просматривает DOM-структуру страницы, находит элемент с <i>id="login"</i> и затем может выполнить <i>click()</i>.</p><p>Локаторы привязаны к HTML-разметке, поэтому их надежность зависит от того, насколько стабильно разработчики поддерживают идентификаторы. Практика выработала некоторые правила: желательно использовать уникальные статические атрибуты (например, data-test), избегать сложных XPath, проверять, что локатор не изменится при перезагрузке или смене языка страницы.</p><p>Тем не менее, Web-интерфейсы со временем эволюционируют — меняются классы и ID элементов, верстка усложняется динамическими компонентами. <i>Автоматизация тестирования веб требует учитывать динамическую природу UI, скорость тестов и устойчивость локаторов</i>. Иначе говоря, традиционные автотесты хрупки: малейшее изменение в коде фронтенда (например, переименовали кнопку или перестроили раздел HTML) может сломать множество тестовых сценариев.</p><p><b>Проблемы и поддержка</b>. Главный недостаток локаторного подхода — дорогая поддержка тестов. При активной разработке приложения авто-тесты требуют постоянного обновления: исправлять селекторы, ждать загрузки динамических элементов, добавлять задержки. По опыту индустрии, на сопровождение тестовых скриптов уходит едва ли не больше усилий, чем на их изначальную разработку. Как признавался Кит Поуи, вице-президент по инжинирингу IDT: <i>«Мы тратили столько времени на поддержку тестов на Selenium, ... а теперь тратим почти ноль времени, используя testRigor»</i> [<a href="https://testrigor.com/case-study-idt/">testrigor.com</a>].</p><p>Иными словами, классические UI-тесты грозят превратиться в постоянную гонку за изменяющимся интерфейсом. Появлялись частичные решения, например, <b>Self-healing</b> («самоисцеление» локаторов) с помощью ИИ. Такие механизмы пытаются автоматически подобрать альтернативный селектор, если старый перестал работать. Но как отмечают разработчики CodeceptJS: <i>«AI-healing решает ровно одну проблему: если локатор элемента изменился, и действие не удалось, он подбирает новый локатор, повторяет команду и продолжает тест»</i> [<a href="https://codecept.io/ai/">codecept.io</a>]. Это снимает часть боли, но не меняет принципа: тест все так же опирается на предопределенные селекторы.</p><p>Кроме того, написание самих тестовых сценариев требует навыков программирования и знаний фреймворка, что создает высокий порог входа для неспециалистов.</p><p><b>Вывод</b>: Классическая автоматизация через локаторы была революционна для своего времени и до сих пор остается основой для многих команд. Она хорошо работает при стабильном UI и правильной стратегии локаторов (уникальные ID, атрибуты для тестов и т.п.). Плюсы такого подхода: высокая скорость выполнения (обращение к DOM напрямую), интеграция с CI/CD, детерминизм сценариев. Однако минусы перевешивают в быстро меняющихся продуктах: хрупкость, большие затраты на поддержку и необходимость вовлечения опытных автоматизаторов. Это подтолкнуло индустрию к поиску более гибких и «умных» решений.</p><h2>Компьютерное зрение: поиск элементов по изображению</h2><p>Следующим шагом стало привлечение технологий компьютерного зрения для распознавания элементов интерфейса так, как это делает человек. Вместо того чтобы полагаться на скрытые в коде страницы идентификаторы, тест можно проводить по <b>скриншотам</b>: видеть интерфейс и находить нужные кнопки/иконки по их графическому виду.</p><p>Один из первых популярных инструментов такого рода — <b>Sikuli </b>(MIT, ~2010 год). Sikuli позволил <a href="https://roborabbit-labs.com/2015/02/09/ui-testing-with-sikuli-and-opencv-computer-vision-api/#:~:text=This%20week%20I%E2%80%99ll%20be%20zooming,currently%20maintained%20by%20Raimund%20Hocke">автоматизировать </a>действия, <i>используя скриншоты GUI для поиска и кликов</i>. Внутри он <a href="https://roborabbit-labs.com/2015/02/09/ui-testing-with-sikuli-and-opencv-computer-vision-api/#:~:text=An%20interesting%20characteristic%20of%20Sikuli,page%20for%20a%20nice%20overview">задействовал </a>OpenCV — мощную библиотеку компьютерного зрения с сотнями алгоритмов для обработки изображений и распознавания объектов.</p><p>Принцип работы прост: тестировщик делает снимок элемента (например, кнопки «Поиск»), а Sikuli затем находит на экране участок, совпадающий с этим образцом, и симулирует нажатие. <i>«SikuliX </i><a href="https://wilsonmar.github.io/opencv-sikulix-robot/#:~:text=coordinates%20of%20objects%20it%20recognizes,in%20pictures">использует OpenCV</a><i>, чтобы найти местоположение указанного изображения... и выполняет клик мыши или ввод с клавиатуры по найденной координате»</i>. Таким образом, можно автоматизировать почти всё, что видит пользователь — хоть веб-страницу, хоть настольное приложение или игру — не обращаясь к внутреннему устройству программы.</p><p><b>Как это выглядит на практике</b>. Вместо текстовых селекторов тестер оперирует картинками. Сценарий на Sikuli или похожих фреймворках состоит из последовательности команд: «найти изображение X», «кликнуть по нему», «ввести текст Y», «убедиться, что изображение Z появилось на экране» и т.д.</p><p>По сути, тест <b>имитирует ручную проверку</b>: мы проверяем интерфейс глазами (через алгоритм сравнения изображений) и совершаем действия как пользователь. Этот подход приближает автотест к мануальному тестированию. Как <a href="https://roborabbit-labs.com/2015/02/09/ui-testing-with-sikuli-and-opencv-computer-vision-api/#:~:text=This%20week%20I%E2%80%99ll%20be%20zooming,currently%20maintained%20by%20Raimund%20Hocke">отметила</a> тестировщик Thosha Moodley: <i>«Sikuli... максимально близок к роли ручного тестировщика, который визуально проверяет интерфейс и позволяет автоматизировать тесты без серьёзных навыков разработки»</i>. Другими словами, порог входа снижается: не нужен глубокий кодинг, достаточно понимать, как выглядит нужный элемент.</p><p>Компьютерное зрение также открывает возможность ловить <i>чисто визуальные баги</i>, которые трудны для классических скриптов. Например, традиционный тест может проверить текст сообщения, но не заметит, что он вылез за границы кнопки или обрезан. А визуальный тест легко сравнит скриншот с эталоном и обнаружит искажения в рендеринге. Недаром появилось направление <b>visual testing</b> — сравнение скриншотов для выявления неожиданных изменений.</p><p>Инструменты вроде Applitools Eyes стали лидерами рынка в этой нише: их ИИ-алгоритмы анализируют два изображения (ожидаемый дизайн и фактический) и подсвечивают отличия, игнорируя незначительные артефакты. Такой пассивный подход <a href="https://software-testing.ru/library/testing/testing-automation/4318-how-to-write-visual-ui-automation-tests-using-graphics-instead-of-complex-locator-strings#:~:text=Applitools%20%E2%80%93%20%D0%BB%D0%B8%D0%B4%D0%B5%D1%80%20%D1%80%D1%8B%D0%BD%D0%BA%D0%B0%20%D0%B8%D0%BD%D1%81%D1%82%D1%80%D1%83%D0%BC%D0%B5%D0%BD%D1%82%D0%BE%D0%B2,%D0%BF%D0%B5%D1%80%D0%B5%D0%BC%D0%B5%D0%BD%20%D0%B2%20%D1%83%D0%B6%D0%B5%20%D0%B8%D0%BC%D0%B5%D1%8E%D1%89%D0%B8%D1%85%D1%81%D1%8F%20%D0%BF%D1%80%D0%BE%D1%86%D0%B5%D0%B4%D1%83%D1%80%D0%B0%D1%85">полезен </a>для регрессионного тестирования UI — он фокусируется на том, <i>как страница выглядит</i>, а не только на её коде.</p><p><b>Проблемы визуального подхода</b>. Несмотря на перспективность, у визуального тестирования нашлось немало минусов. Прямое сравнение скриншотов чувствительно к любым пиксельным изменениям — сменился оттенок или шрифт, и тест «падает».</p><p>Нужно настраивать допуски, писать сложные алгоритмы сравнения, иначе будут ложные срабатывания. Бесплатные инструменты часто <a href="https://software-testing.ru/library/testing/testing-automation/4318-how-to-write-visual-ui-automation-tests-using-graphics-instead-of-complex-locator-strings#:~:text=%D0%92%20%D1%81%D1%82%D0%B0%D1%82%D1%8C%D0%B5%20%D0%BE%D0%B1%D1%81%D1%83%D0%B6%D0%B4%D0%B0%D0%BB%D0%BE%D1%81%D1%8C%20%D0%BF%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BD%D0%BE%D0%B5%20%D0%B8,%D0%B0%20%D1%80%D0%B5%D1%81%D1%83%D1%80%D1%81%D0%B0%D0%BC%D0%B8%20%D1%82%D0%B5%D1%81%D1%82%D0%BE%D0%B2%20%D0%BC%D0%BE%D0%B6%D0%BD%D0%BE%20%D0%B1%D1%83%D0%B4%D0%B5%D1%82">грешат </a>излишней чувствительностью или требуют ручной настройки сравнения изображений.</p><p>С другой стороны, слишком грубая настройка может пропустить реальный баг. Балансировать на грани довольно трудно. Кроме того, сами операции с изображениями <a href="https://software-testing.ru/library/testing/testing-automation/4318-how-to-write-visual-ui-automation-tests-using-graphics-instead-of-complex-locator-strings#:~:text=%D0%92%20%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%BD%D1%81%D1%82%D0%B2%D0%B5%20%D0%BA%D0%BE%D0%BC%D0%BC%D0%B5%D1%80%D1%87%D0%B5%D1%81%D0%BA%D0%B8%D1%85%20%D0%B1%D0%B5%D1%81%D0%BA%D0%BE%D0%B4%D0%BE%D0%B2%D1%8B%D1%85%20%D0%B8%D0%BD%D1%81%D1%82%D1%80%D1%83%D0%BC%D0%B5%D0%BD%D1%82%D0%B0%D1%85,Tricentis%20Tosca">ресурсозатратны</a>: <i>«манипуляции с картинками требовательны к вычислениям... сложные алгоритмы могут сильно замедлить тесты, поэтому их стараются применять только в исключительных случаях»</i>. Поэтому на практике визуальные проверки либо пускают отдельным шагом (например, финальный скриншот страницы сравнить с эталоном), либо используют маленькие шаблоны для критичных элементов.</p><p>Второй крупный недостаток — <b>обслуживание тестов на картинках</b>. Нужно хранить библиотеку образов для каждого элемента, обновлять их при малейшем редизайне. Представьте, дизайнер поменял иконку корзины — теперь все тесты, которые искали старую иконку, упадут, и QA-инженеру придется записывать новый образ и заменять в сценариях.</p><p>Наконец, <b>масштабируемость</b>: для разных разрешений, устройств, темной/светлой темы возможно потребуются разные эталонные скриншоты или шаблоны. В веб-тестировании это частично решается за счет унифицированности браузеров, но все же добавляет сложностей.</p><p><b>Современные решения и переходный этап</b>. Несмотря на перечисленные сложности, визуальные подходы не исчезли — наоборот, они эволюционировали. Коммерческие инструменты стараются абстрагировать хранение образов и минимизировать ложные срабатывания за счет ML. Например, Applitools <a href="https://software-testing.ru/library/testing/testing-automation/4318-how-to-write-visual-ui-automation-tests-using-graphics-instead-of-complex-locator-strings#:~:text=Applitools%20%E2%80%93%20%D0%BB%D0%B8%D0%B4%D0%B5%D1%80%20%D1%80%D1%8B%D0%BD%D0%BA%D0%B0%20%D0%B8%D0%BD%D1%81%D1%82%D1%80%D1%83%D0%BC%D0%B5%D0%BD%D1%82%D0%BE%D0%B2,%D0%BF%D0%B5%D1%80%D0%B5%D0%BC%D0%B5%D0%BD%20%D0%B2%20%D1%83%D0%B6%D0%B5%20%D0%B8%D0%BC%D0%B5%D1%8E%D1%89%D0%B8%D1%85%D1%81%D1%8F%20%D0%BF%D1%80%D0%BE%D1%86%D0%B5%D0%B4%D1%83%D1%80%D0%B0%D1%85">применяет</a> ИИ для сравнения скриншотов, чтобы отличать существенные изменения от незначительных.</p><p>Многие codeless-платформы (Katalon, Tricentis Tosca, TestComplete и др.) включили в свой функционал поиск элементов по изображениям, но чаще как вспомогательную опцию. Нередко это реализовано через визуальный рекордер: пользователь сам кликает по интерфейсу, инструмент делает снимки элементов и генерирует тестовые шаги. Так, показательный пример —<a href="http://testup.io/"> testup.io</a>, где вся концепция построена вокруг изображений: точки взаимодействия задаются относительно визуальных маркеров, а на скриншоте шагов видно миниатюры элементов.</p><p>В итоге, хотя классическое компьютерное зрение приблизило автотесты к пользовательскому восприятию, ему не хватало «интеллекта». В 2020-х стало ясно, что нужен качественно новый уровень: использовать достижения современных нейросетей, чтобы научить машину понимать интерфейс не хуже человека.</p><h2>Vision-Language модели: тестирование на естественном языке</h2><p><b>От компьютерного зрения к мультимодальным моделям</b>. Vision-Language Models (VLM) — это класс нейросетей, который объединяет распознавание изображений и обработку естественного языка. Идея состоит в том, чтобы обучить модель, способную <b>видеть картинку и описывать её словами</b>, а также <b>понимать слова и искать соответствие на картинке</b>.</p><p>Большинство VLM устроены как две части: <i>визуальный энкодер</i> (обычно нейросеть на основе ResNet или Vision Transformer), который преобразует изображение в семантическое представление, и <i>языковой декодер/энкодер</i> (крупная языковая модель GPT или BERT), который <a href="https://dev.to/aairom/what-are-vision-language-models-vlms-and-how-do-they-work-4hl5#:~:text=linguistic%20information,descriptive%20image%20captions%20and%20answering">понимает текст</a>. Обучая эти модули на огромных наборах пар «картинка–описание», они добиваются того, что сеть начинает устанавливать связь между визуальными объектами, их названиями и свойствами.</p><p><b>Пример</b>: модель видит изображение с котом на кресле и подпись «кошка лежит на кресле», и со временем учится понимать, что на картинке кот, что «лежит» — это определенное положение, что диван — это что-то мягкое на чем можно лежать и т.д. В результате такие модели способны решать задачи <i>мульти-модального понимания</i>: генерировать текст по изображению (описание, подписи), отвечать на вопросы по картинке, находить по текстовому запросу нужный объект на изображении и пр.</p><p>Другими словами, VLM обладает зрением и речью одновременно, что открывает совершенно новые возможности для тестирования.</p><p><b>Применение VLM для тестирования UI</b>. Как VLM помогает автоматизировать тестирование? Проще всего это понять на примере: допустим, у нас есть скриншот веб-страницы или мобильного приложения. Ранее, чтобы проверить его содержимое, нам нужен был или человек-тестировщик, или набор проверок конкретных элементов (по DOM или по эталонным изображениям). Теперь же мы можем задать вопрос модели на естественном языке о содержимом UI, и она постарается ответить на основании картинки.</p><p>В блоге Smartesting <a href="https://www.smartesting.com/en/the-future-of-software-testing-harnessing-vision-language-models/#:~:text=%E2%80%9CHere%20is%20a%20screenshot%20of,a%20shirt%3F%20At%20what%20price%3F%E2%80%9C">показан кейс</a>: модели Claude 3.5 дали скриншот интернет-магазина и запрос на английском: <i>«Что изображено на странице? Найди, есть ли рубашка, и какая у нее цена»</i>. Модель проанализировала скриншот и выдала структурированный ответ - перечислила несколько товаров (платье, куртка, брюки, Checked Slim Fit Shirt - $48.99 и т.д.), а затем прямо ответила: мол, да, на картинке есть рубашка (Checked Slim Fit Shirt) по цене $48.99. Ранее такой сценарий потребовал бы либо проверки текста в DOM (искать слово Shirt и парсить цену), либо ручного взгляда. Vision-Language модель выполнила его <i>«с нуля»</i>, просто получив изображение и вопрос.</p><h2>Заключение</h2><p>Развитие методов автоматизации UI-тестирования — наглядный пример того, как технологии ИИ трансформируют привычные практики. Классический подход с локаторами и кодом, хотя и служил десятилетиями, начинает буксовать на требованиях гибкости и скорости.</p><p>Использование компьютерного зрения добавило тестам человеческого восприятия, позволило ловить визуальные дефекты и упростить взаимодействие с нестандартными интерфейсами — но полностью заменить код не смогло из-за ограничений старых алгоритмов.</p><p><b>Vision-Language модели в связке с AI-агентами</b> сделали следующий шаг: они фактически научили компьютер «думать» о том, что он видит на экране, и понимать наши инструкции почти как опытный тестировщик. Это позволило создать системы, где <i>шаги тест-кейса становятся его же автоматизацией.</i></p><p><i></i> Тестировщики и менеджеры могут описывать проверки простыми шагами на естественном языке, а умная платформа сама найдет нужные элементы по описанию, выполнит действия и сравнит ожидаемое с действительным. Такой подход сокращает время на подготовку автотестов, резко снижает расходы на поддержку (ИИ адаптируется к изменениям UI) и расширяет охват проверок за счет контекстных интеллектуальных ассертов.</p><p><b>Будущее автоматизации тестирования принадлежит умным, обучаемым системам</b>, которые совмещают зрение и интеллект. Тестировщики постепенно превращаются в наставников таких систем — формулируют проверки в человеческом формате, а ИИ берет на себя рутинное исполнение. Это повышает эффективность QA-процессов и позволяет сфокусироваться на действительно сложных, творческих задачах тестирования.</p>]]></content:encoded>
    </item>
    <item>
      <title>Edge AI: как работают нейросети на устройствах с ограниченными ресурсами</title>
      <link>https://tproger.ru/articles/edge-ai--kak-rabotayut-nejroseti-na-ustrojstvah-s-ogranichennymi-resursami</link>
      <comments>https://tproger.ru/articles/edge-ai--kak-rabotayut-nejroseti-na-ustrojstvah-s-ogranichennymi-resursami?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Денис Кудерин]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/edge-ai--kak-rabotayut-nejroseti-na-ustrojstvah-s-ogranichennymi-resursami</guid>
      <description><![CDATA[<p>Что такое Edge AI. Показываем основные принципы и инструменты для работы с Edge AI. Рассматриваем пошаговую инструкцию и основные нюансы ✔ Tproger</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/edge-ai--kak-rabotayut-nejroseti-na-ustrojstvah-s-ogranichennymi-resursami">Edge AI: как работают нейросети на устройствах с ограниченными ресурсами</a>»</p>]]></description>
      <category><![CDATA[Интернет]]></category>
      <category><![CDATA[Оптимизация]]></category>
      <category><![CDATA[Инструменты]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Распознавание]]></category>
      <category><![CDATA[NVIDIA]]></category>
      <category><![CDATA[Автопилот]]></category>
      <category><![CDATA[Хакеры]]></category>
      <category><![CDATA[Сервер]]></category>
      <category><![CDATA[Дроны]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 17 Apr 2025 10:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Edge AI — одно из наиболее актуальных направлений развития нейросетей. Эту технологию справедливо называют революционной — благодаря ей обработка данных и запуск моделей ИИ происходят непосредственно на устройствах, а не на серверах. Пользователи могут не беспокоиться об утечке в сеть конфиденциальных данных и использовать ИИ более эффективно.</p><p>Узнаем, на каких принципах работает Edge AI, каковы преимущества работы ИИ на устройствах с ограниченными ресурсами, как Edge AI используются прямо сейчас и что будет с этой технологией в будущем.</p><h2>Основные принципы работы Edge AI</h2><p>Технология Edge AI — это развертывание моделей ИИ на основе нейросетей непосредственно на устройствах: смартфонах, камерах, датчиках и другом оборудовании. Для вычислений и анализа данных не не нужно обращаться к удаленным или облачным серверам. Устройства принимают решения на месте получения сигнала, что упрощает процесс.</p><p>Почему технология считается революционной? Вместо того чтобы гонять данные в облако и обратно, алгоритмы работают прямо на устройстве — будь то смартфон, камера наблюдения или беспилотный автомобиль. Процессор принимает решения мгновенно, не спрашивая разрешения у главного сервера.</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-04-09/7e4cba87-7070-4d75-a844-c43bcc3857dd.png" alt="" /></figure><p>Традиционные системы ИИ работают через сеть — данные уходят в дата-центр, там обрабатываются, а результат возвращается обратно. Проблема в том, что даже при быстром интернете такая схема создает задержки. Устройства с Edge AI реагируют на сигнал мгновенно.</p><p>Поэтому основное преимущество такого способа работы с данными — скорость. Беспилотному автомобилю нужно распознать пешехода за миллисекунды — ждать ответа из облака смертельно опасно. Другой аспект — автономность. Промышленные датчики и устройства, к которым они подключены, в удаленных локациях могут работать без стабильного интернета.</p><p>Есть и экономическая выгода. Зачем отправлять терабайты сырых данных, если можно обработать их на месте и передать только результат?</p><p>Наглядный пример: современные смартфоны используют Edge AI для обработки фото. Когда вы делаете портрет в размытом режиме «боке», нейросеть на устройстве сразу отделяет фон от объекта — без загрузки снимка в облако.</p><figure><img src="https://media.tproger.ru/user-uploads/113565/2025-04-09/9f891624-fc49-4a44-8f21-5d3e58e4a32d.png" alt="" /></figure><p>Обычные нейросети требуют огромных вычислительных ресурсов — например, чат GPT-4 вряд ли получится запустить на умных часах. Но Edge AI-модели — это «лайт-версии» своих облачных собратьев: они компактные, быстрые и энергоэффективные.</p><p>При этом данные никуда не отправляются, что обеспечивает их конфиденциальность: если нет постоянной передачи данных, хакерам сложнее перехватить информацию.</p><p>Пример: Apple использует Edge AI в Siri — голосовые команды распознаются прямо на iPhone, а не в облаке. Так компания гарантирует, что ваши разговоры с ассистентом не прослушает даже она сама.</p><p>Периферийный ИИ можно установить на любые устройства, работа которых требует быстродействия и определенной степени автономности. Это промышленные станки с умным зрением, беспилотные дроны для доставки товаров, камеры наблюдения. Такие системы не имеют ограничений в виде пропускной способности при передаче данных и задержек, связанных с серверами. Обработка происходит в режиме реального времени.</p><h2>Технологии и инструменты для Edge AI</h2><p>Для реализации Edge AI используются специальные инструменты и технологии. Их условно можно разделить на две категории: компактные модели нейросетей и аппаратные ускорители для мобильных устройств. Кроме того, созданы специальные фреймворки, значительно ускоряющие разработку ПО для Edge AI.</p><h3>Компактные нейросети</h3><p>Представьте, что вам нужно упаковать суперкомпьютер в бокс размером со спичечный коробок. Именно такую задачу решают разработчики компактных моделей для Edge AI.</p><p>Так,  MobileNet использует хитрый трюк с разделяемыми свертками, что позволяет уменьшить модель в 10 раз без катастрофической потери точности. Ваш смартфон распознает лица на фото именно благодаря таким оптимизациям.</p><p>TinyML — это вообще магия микроуровня. Методика машинного обучения разработана специально для компактных нейросетей. Такие модели могут работать на устройствах с памятью меньше, чем занимает одна фотография в соцсетях. Датчик вибрации на заводском оборудовании с TinyML способен предсказывать поломки, потребляя энергии меньше, чем светодиодная лампочка.</p><h3>Аппаратные ускорители</h3><p>Даже самая оптимизированная модель нейросети будет тормозить без специализированного «железа». Так называемые нейроморфные процессоры обладают специальной архитектурой, имитирующей принцип работы человеческого мозга. Такие компоненты повышают производительность устройств и снижают стоимость внедрения Edge AI технологий.</p><p>Эти продукты делают автономные сети быстрыми и энергоэффективными:</p><ul><li>NPU (Neural Processing Unit) — процессоры, заточенные под нейросети. В iPhone и флагманских смартфонах Android стоят NPU от Apple и Qualcomm, которые ускоряют распознавание лиц и обработку фото в 5–10 раз быстрее CPU. Специализированные чипы запускают миниатюрные копии нейросетей на устройствах.</li><li>TPU (Tensor Processing Unit) — разработка Google, созданная для ускорения TensorFlow-моделей. Edge TPU на компьютерах с одной платой Coral Dev Board позволяют запускать до 4 трлн (!!!) операций в секунду при потреблении всего 2 Вт.</li><li>VPU (Vision Processing Unit) — чипы, оптимизированные под компьютерное зрение. Так, Intel Movidius используется в дронах и камерах видеонаблюдения анализа видео в реальном времени без облака. Они потребляют в 10 раз меньше энергии, чем обычные GPU, выполняя те же задачи. Камера ноутбука, которая размывает фон во время видеозвонков, использует именно такие процессоры.</li></ul><h2>Фреймворки для Edge AI</h2><p>В числе самых популярных инструментов:</p><ul><li>TensorFlow Lite — идеален для Android и встраиваемых систем. Он поддерживает квантизацию (преобразование и сжатие) и аппаратное ускорение через NPU. Например, с его помощью можно развернуть модель распознавания жестов на одноплатном мини-компьютере Raspberry Pi за пару часов.</li><li>PyTorch Mobile — выбор тех, кто любит гибкость. Фреймворк позволяет динамически изменять архитектуру модели прямо во время работы, что полезно для задач вроде адаптивного компьютерного зрения.</li><li>Edge Impulse — самый дружелюбный инструмент для новичков. Он предлагает готовые шаблоны для TinyML и даже автоматически оптимизирует модели под конкретное железо. Например, с его помощью можно собрать систему мониторинга вибрации промышленного оборудования без написания кода.</li></ul><p>Это лишь несколько наиболее популярных примеров. Есть и другие инструменты для работы с локальными нейросетями в зависимости от назначения устройств и степени их сложности.</p><h2>Оптимизация нейросетей для Edge AI</h2><p>В периферийном AI используются оптимизированные нейросети. Рассмотрим подробнее</p><h3>Квантизация</h3><p>Это «сжатие» модели за счет снижения точности вычислений. Например, переход с 32-битных чисел на 8-битные уменьшает размер нейросети в 4 раза, а скорость работы повышает вдвое или втрое. Точность слегка падает, но для многих задач (распознавание объектов, голоса) это незаметно. TensorFlow Lite и PyTorch поддерживают квантизацию «из коробки» — достаточно пары строк кода.</p><h3>Distillation (дистилляция данных)</h3><p>Действенный способ ускорения нейросетей. Большая, точная модель («учитель») передает знания компактной модели («ученику»). В итоге маленькая нейросеть сохраняет до 90% эффективности оригинала, но требует в 10 раз меньше ресурсов.</p><h3>Специальные свертки</h3><p>Стандартные свертки потребляют слишком много ресурсов — они перемножают все входные данные. Depthwise (глубинные) свертки работают точечно: обрабатывают каждый канал изображения отдельно, сокращая вычисления в 5–10 раз. Sparse (разреженные) методы еще радикальнее — они просто «выключают» лишние нейроны. Вместе эти подходы позволяют запускать ИИ даже на устройствах с 1 МБ памяти.</p><h2>Преимущества Edge AI</h2><p>Модели Edge AI обеспечивают быстродействие и эффективную работу устройств, используемых в самых разных сферах. Вместо централизованных систем, где вся инфа стекается для анализа в облако, каждое устройство работает автономно.</p><p>Подробно разберем основные преимущества моделей Edge AI.</p><h3>Скорость</h3><p>Главное преимущество Edge AI — это сверхнизкая задержка. В традиционных облачных системах данные сначала отправляются на сервер, обрабатываются и только потом возвращаются обратно — на это уходят драгоценные секунды. В Edge AI все происходит на самом устройстве, без потерь времени на передачу.</p><p>Пример. Беспилотный автомобиль видит пешехода, выскакивающего на дорогу. Если он начнет отправлять данные в облако и ждать ответа — столкновения не избежать. Edge AI решает эту проблему радикально: реакция происходит быстрее, чем моргание глаза (буквально — за 10-50 мс).</p><p>Устройства реагируют в реальном времени независимо от скорости интернета или загруженности облачных серверов. При этом вычисления происходят непрерывно, даже в условиях нестабильного соединения, а нагрузка на сеть снижается — данные не нужно постоянно пересылать туда-обратно.</p><p>Именно поэтому Edge AI становится стандартом для задач, где время реакции — ключевой фактор. Будь то интерактивные приложения, промышленная автоматизация или системы безопасности — локальная обработка обеспечивает тот самый мгновенный отклик, который раньше был невозможен.</p><h3>Конфиденциальность</h3><p>Облачные сервисы — всегда риск: утечки через взломанные серверы, слежка, случайные потери данных.</p><p>Edge AI действует иначе:</p><ul><li>лица для разблокировки телефона обрабатываются в защищенном контуре процессора;</li><li>медицинские показатели анализируются непосредственно в умных часах;</li><li>распознавание лиц камерами наблюдения происходит локально — в облако уходит только метка «подозрительный объект».</li></ul><p>Потеря данных — серьезная проблема интернета. <a href="https://www.ibm.com/reports/data-breach#reports">По данным IBM</a>, утечки через облачные сервисы обходятся бизнесу в 1-5 миллионов долларов в среднем за инцидент. Edge AI сокращает эти риски в разы.</p><h3>Снижение затрат</h3><p>Передача данных в облако — это затраты. Если информацию отправляют тысячи устройств, суммы наберутся внушительные.</p><p>Автономные нейросети обеспечивают радикальную экономию средства:</p><ul><li>В системах видеонаблюдения вместо потокового видео на сервер отправляются только события («человек в запрещенной зоне»).</li><li>IoT-устройства передают не сырые биометрические данные, а готовые метки (например: «пульс 120 ударов в мин.»).</li><li>В промышленности модели на Edge работают годами без апгрейда железа.</li></ul><h3>Надежность</h3><p>Завод в глубинке, шахта, обсерватория в горах, морское судно — во многих местах стабильный интернет затруднителен или невозможен .</p><p>Но с Edge AI проблема легко решается:</p><ul><li>датчики прогнозируют поломки оборудования без облачной аналитики;</li><li>дроны обследуют трубы нефтепроводов в офлайн-режиме;</li><li>умные счетчики годами работают от батареек, экономя до 90% энергии на передаче данных.</li></ul><p>Раньше при обрывах данных производство просто останавливалось. Но станки с Edge AI сами применяют до 80% решений. Они ведут себя как надежные сотрудники, которым можно доверять.</p><h2>Примеры Edge AI в действии</h2><p>Edge AI — не абстрактная концепция, а конкретная технология, которая уже меняют нашу повседневную жизнь. Изучим несколько показательных примеров использования периферийного ИИ в реальном мире.</p><h3>Распознавание лиц</h3><p>Технологии вроде Apple Face ID и Android Face Unlock — это не просто селфи для разблокировки. Под капотом работает сложная система: инфракрасные камеры сканируют 30 000 точек на лице, строят 3D-карту и превращают вашу внешность в математический вектор, который невозможно подделать даже фотографией. Edge AI делает это мгновенно — прямо на устройстве, без отправки данных в облако.</p><p>Современные Android-смартфоны (например, Huawei и Xiaomi) догоняют Apple, используя нейропроцессоры (NPU) для ускорения распознавания. Но если iPhone работает даже в полной темноте, то многим Android-устройствам нужно хотя бы тусклое освещение — их камеры не видят в инфракрасном спектре</p><h3>Безопасность</h3><p>Камеры в аэропортах и офисах теперь могут искать подозрительных персон, не отправляя ваше фото в облако. Все обрабатывается локально: система сравнивает изображение с базой и только при совпадении передает сигнал. Это не только быстрее, но и этичнее — ваши данные никуда не утекают.</p><h3>Беспилотники и автомобили</h3><p>Представьте дрон, который доставляет лекарства в отдаленные районы. Если он будет ждать ответа из облака, чтобы облететь дерево, посылка разобьется вместе с ним. Edge AI позволяет таким устройствам мгновенно анализировать окружение и принимать решения прямо на борту. То же самое с беспилотными автомобилями: их камеры и лидары обрабатывают данные в 100 раз быстрее, чем если бы они отправляли их на сервер.</p><h3>Цифровые помощники</h3><p>Современные голосовые ассистенты на Edge AI понимают команды без интернета, будь то разблокировка двери или поиск рецепта. Никакой слежки — только мгновенный результат.</p><h3>Производственное оборудование</h3><p>Раньше станки ломались неожиданно, останавливая производство на дни. Теперь датчики с Edge AI замечают аномалии в вибрации или температуре за часы до аварии.</p><h3>Медицина</h3><p>Портативные ЭКГ с Edge AI не просто записывают кардиограмму — они мгновенно обнаруживают предынфарктное состояние и сразу сигнализируют врачу. В реанимациях такие системы сокращают время реакции с минут до секунд. А умные инсулиновые помпы сами корректируют дозу, анализируя уровень сахара в крови 24/7.</p><h3>Городская инфраструктура</h3><p>Светофоры, которые адаптируются к потоку машин, камеры, отслеживающие аварии, датчики протечки воды в трубах — все это работает на Edge AI. Городская инфраструктура становится умнее, но без тотальной слежки и уязвимых облачных серверов.</p><h2>Ограничения Edge AI</h2><p>Edge AI — это не волшебная таблетка. Да, он быстр, автономен и бережет ваши данные, но у этой медали есть обратная сторона.</p><h3>Ограниченные ресурсы</h3><p>Главное ограничение Edge AI — железо. Современные смартфоны в сотни раз слабее облачных серверов, а микроконтроллеры в датчиках — в тысячи.</p><p>Пример: Нейросеть для распознавания лиц на iPhone занимает всего 5 МБ, но это потребовало нескольких лет оптимизаций. GPT-4 с ее 1 трлн параметров в таком формате — пока фантастика.</p><h3>Потребление энергии</h3><p>Локальная обработка данных экономит интернет-трафик, но сжирает заряд. NPU в современных чипах оптимизируют этот показатель (например, Qualcomm Hexagon снижает энергопотребление в 10 раз), но физику не обманешь — Face ID на iPhone тратит в 3 раза больше энергии, чем Touch ID. Датчики IoT с TinyML работают годами на батарейке, но только если спят 99% времени.</p><h3>Защита данных</h3><p>Безопасность Edge AI — это обоюдоострое орудие:</p><ul><li>Плюс: Ваше лицо для разблокировки телефона не уходит в облако (в отличие от Google Photos).</li><li>Минус: Взломать один умный замок с уязвимым Bluetooth проще, чем серверы Apple.</li></ul><p>Хакеры могут взломать камеры наблюдения с Edge AI и другие инструменты непосредственно на месте. И при этом неважно, отправляют ли они данные в сеть и работают ли с ними локально.</p><h3>Обновления</h3><p>В облаке обновить нейросеть — пара кликов. На миллионе разрозненных устройств — квест и головная боль. Поэтому значительная часть медицинских и промышленных датчиков с Edge AI никогда не получает обновлений.</p><h3>Машинное обучение</h3><p>Чтобы обучить сложное устройство с Edge AI хотя бы базовым вещам, нужны терабайты данных. Например, роботизированным автомобилям, в том числе такси, нужно проехать тысячи километров, чтобы собрать нужные данные. Аналогично обстоят дела с другими устройствами.</p><p>Когда данных нет, их генерируют. Но ИИ, обученный на «муляжах», часто путается в реальном мире (вспомните Tesla, которая принимала луну за желтый светофор или видела призраков).</p><h2>Будущее Edge AI</h2><p>Сферы применения нейросетей Edge AI со временем расширяются — этот  процесс неизбежен. Они активно внедряются в промышленность, городскую дорожную инфраструктуру, даже в сельское хозяйство (в виде беспилотников и датчиков для отслеживания состояния урожая).</p><p>Ближайшее направление эволюции периферийного ИИ — создание специализированных процессоров. Современные нейропроцессоры эффективные, но чрезвычайно затратные.</p><p>Ведущие ИТ-корпорации уже экспериментируют с архитектурой, в которой ИИ-блоки встроены прямо в ячейки памяти. Qualcomm, Apple и NVIDIA тестируют процессоры, которые смогут запускать генеративные нейросети на вашем телефоне, не превращая его в раскаленную сковородку.</p><p>Методы оптимизации нейросетей будут совершенствоваться. Уже сейчас прунинг (удаление лишних связей без потери точности) и адаптивное квантование (разная точность для разных слоев модели), позволяют ужимать ИИ до микроскопических размеров. Сейчас TinyML-модели работают на устройствах с памятью меньше 1 МБ — и это только начало.</p><p>Кстати! Забрать все самые топовые нейронки для айтишников можно в нашем <a href="https://tprg.ru/LN8a">большом гайде с 70+ ИИ-инструментами</a></p>]]></content:encoded>
    </item>
    <item>
      <title>От пикселей к прогрессу: как компьютерное зрение используют в промышленности</title>
      <link>https://tproger.ru/articles/ot-pikselej-k-progressu--kak-kompyuternoe-zrenie-ispolzuyut-v-promywlennosti</link>
      <comments>https://tproger.ru/articles/ot-pikselej-k-progressu--kak-kompyuternoe-zrenie-ispolzuyut-v-promywlennosti?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Владимир Валеев]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/ot-pikselej-k-progressu--kak-kompyuternoe-zrenie-ispolzuyut-v-promywlennosti</guid>
      <description><![CDATA[<p>Вместе с Владимиром Валеевым, ведущим CV-инженером Softline Digital (ГК Softline), разбираем, для каких задач эффективно компьютерное зрение, в чем преимущества и как внедрить.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/ot-pikselej-k-progressu--kak-kompyuternoe-zrenie-ispolzuyut-v-promywlennosti">От пикселей к прогрессу: как компьютерное зрение используют в промышленности</a>»</p>]]></description>
      <category><![CDATA[Оптимизация]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Бизнес]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 08 Apr 2025 14:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>В эпоху активной роботизации производств технология компьютерного зрения (CV) привлекает все больше внимания промышленности. <a href="https://issek.hse.ru/news/542527560.html">По данным </a>Института статистических исследований и экономики знаний НИУ ВШЭ, как минимум 78,7% компаний, использующих в работе искусственный интеллект, применяют для автоматизации процессов эту технологию. Вместе с Владимиром Валеевым, ведущим CV-инженером Softline Digital (ГК Softline), разберем, для каких задач эффективно компьютерное зрение, в чем преимущества и как внедрить.</p><h2>Коротко о технологии компьютерного зрения</h2><p>Компьютерное зрение — область искусственного интеллекта на стыке машинного обучения (ML) и обработки изображений, связанная с анализом фото и видео. Цифровое изображение представляет собой неструктурированные однородные данные, поэтому обучение моделей компьютерного зрения проводится на размеченных данных: к изображению добавляют семантику (смысл) —  задают метки классов, контуры объектов, координаты и т.д.</p><p>Если CV-модели хорошо обучены, то способны адекватно извлекать семантику из изображения. Как это работает: нейросети преобразуют входное изображение в его векторное представление в многомерном векторном пространстве, и уже потом, с помощью математических операций, сопоставляют его с заданной ранее семантикой.</p><h3>Где применяют компьютерное зрение</h3><p>Компьютерное зрение активно применяется в здравоохранении, логистике, ритейле, но наибольшая доля использования<a href="https://www.statista.com/outlook/tmo/artificial-intelligence/computer-vision/worldwide#analyst-opinion"> приходится</a> на производство —  25,98%. Как правило, это отрасли, где много рутинной, опасной или требующей высокой точности работы. Например, горнодобывающая промышленность, где системами CV оснащают шахты для мониторинга состояния техники и агрегатов, металлургия и пищевая промышленность (отслеживание техпроцессов, дефектоскопия и т.п.).</p><h3>Решаемые компьютерным зрением задачи</h3><p>Автоматизированный контроль качества продукции —  вопрос, наиболее часто решаемый с помощью компьютерного зрения. Большинство CV-моделей успешно справляются с подобной задачей независимо от отрасли и вида продукции.</p><p><b>Обычно это:</b></p><ul><li>определение дефектов продукции на конвейерной ленте (крупный и мелкий брак на металлопрокате, различные дефекты упаковки и др.);</li><li>контроль качества деталей и сборочных узлов (дефекты покраски, брак двигателя и др.);</li><li>автоматический анализ поверхностей и геометрии (дефекты инженерных конструкций), выявление дефектов сварки (рентгенографическая дефектоскопия сварных швов).</li></ul><p>Преимущество использования технологии CV для решения таких задач в том, что система работает 24/7, полностью устраняет человеческий фактор и при этом не уступает в экспертизе высококвалифицированным специалистам, которые сейчас в дефиците.</p><p><b>Оптимизация производственных процессов </b>—  еще один вопрос, который можно закрыть с помощью компьютерного зрения. Как правило, под оптимизацией производственных процессов в контексте применения CV подразумевается отслеживание объемов готовой продукции и простоев оборудования. Например, когда система видеоаналитики фиксирует объемы сырья на входе в технологическую линию, прослеживает цепочку техопераций на разных этапах его обработки и контролирует объем готовой продукции на выходе — в штуках, массе, площади и т.п.</p><p>Одновременно с этим система считает коэффициент выхода готовой продукции и время простоев. Подсчет продукции идет в реальном времени, и на каждой единице продукта, как правило, есть отметка со временем выхода. Это позволяет выявить промежутки, когда продукции не было или было меньше обычного, —  так и определяется время простоя.</p><p>Также CV решает вопрос<b> мониторинга состояния оборудования </b>— комплекса задач по выявлению аномалий в работе оборудования и предупреждению возможных аварий. Например, система видеоаналитики может проконтролировать состояние конвейерных лент на горно-обогатительном комбинате или токарном станке с ЧПУ на машиностроительном заводе.</p><p>По оценке экспертов, использование CV для мониторинга состояния оборудования позволяет предприятиям сократить убытки в среднем на 30%. При этом компьютерное зрение внедряется на производствах и как самостоятельное решение, и как часть системы автоматической диагностики. Интегрируясь с информационными системами, CV обеспечивает:</p><ul><li>непрерывность наблюдения;</li><li>объективные показатели степени износа;</li><li>предсказание частичного и полного выхода из строя;</li><li>мгновенное оповещение об аномалиях.</li></ul><h3>Предел возможностей CV</h3><figure><img src="https://media.tproger.ru/user-uploads/114211/2025-04-07/59d1a19b-9a43-4d50-9be1-bf13b51f7c9a.jpg" alt="" /></figure><p>Несмотря на то, что компьютерное зрение широко применяется в производстве, его нельзя назвать универсальным решением. Как и у любой другой технологии, у компьютерного зрения есть свои ограничения, и это необходимо учитывать перед внедрением.</p><p>Во-первых, CV-модели —  статистические. Это значит, что, как и все модели машинного обучения, работают с какой-то вероятностью и не выдают 100%-ный результат. Во-вторых, при обучении нельзя предусмотреть все возможные варианты данных (изображений). В реальности система может столкнуться с чем угодно на фото или видео —  это называют проблемой out-of-distribution (OOD).</p><p>Например, модель обучена определять дефекты металлопроката. Но так случилось, что на лист металла попал посторонний предмет (допустим, карандаш), который не дефект. Модель в любом случае отнесет его к одному из классов дефектов, потому что не видела этот предмет во время обучения, а значит, может идентифицировать его только как дефект.</p><p><b>Еще один важный момент: </b>если CV-модель что-то не видит, значит, для нее этого не существует. В этом смысле компьютерное зрение сильно уступает человеку. Люди, увидев, что один объект наполовину закрыт другим, понимают, что есть продолжение этого объекта, и могут дорисовать его в своем воображении. CV-модель на такое почти не способна: она не обучена рассуждению, не умеет экстраполировать. Весь ее опыт — статистика визуальных признаков и не более того.</p><h3>Трудности внедрения</h3><p>Итак, чувствительность к данным, неспособность рассуждать, специализация на одной конкретной задаче (домене данных) —  все эти свойства компьютерного зрения —  вызовы при внедрении технологии и для заказчика, и для разработчика. Как подготовиться к проекту, чтобы избежать или минимизировать возможные трудности?</p><p><b>1.    Определиться с бизнес-задачей.</b> Без понимания целей и задач невозможно реализовать успешный проект. Если не будет четких метрик оценки эффективности CV-решения, технология вызовет только вопросы и сомнения. Кроме того, стоит определиться с целесообразностью такого внедрения, потому что есть задачи, которые решаются более простыми способами.</p><p>Например, надо реализовать остановку конвейера, когда на нем нет объектов, —  с этим справятся и датчики. Компьютерное зрение в таком случае не нужно. А вот если требуется, чтобы конвейер останавливался каждый раз, когда на нем находится объект, не соответствующий форме, цвету, маркировке или другим визуальным характеристикам, —  это задача для CV.</p><p><b>2.    Собрать качественные данные.</b> От качества входных данных и профессионализма/опыта инженеров предприятия зависит 90% успеха. Собирать данные можно вручную или автоматически, но, главное, делать это с пониманием того, как будет решаться задача. Независимо от сложности, данные должны быть точно размечены семантически: проставлены метки классов изображений и координат, выделены контуры объектов, там, где это имеет смысл. Чем лучше размечены данные, тем точнее будет результат работы CV-модели.</p><p><b>3.    Ознакомиться с опытом решения похожих задач</b>. Перед тем как приступить к внедрению, важно в целом иметь представление о технологии. Почитать о кейсах других компаний, объективно оценить трудности, с которыми они столкнулись, попробовать перенести чужой опыт на свою ситуацию и заранее обсудить все возможные «подводные камни» с разработчиками CV-решения.</p><p>Часто заказчики недооценивают сложность задач, рассчитывают на быстрые сроки и функционал моделей на грани фантастики. Поэтому важно обсуждать метрики эффективности CV в начале проекта, чтобы не попасть в ловушку иллюзорной простоты решения.</p><h3>Вывод</h3><p>Сегодня внедрение компьютерного зрения в промышленность демонстрирует большой потенциал. В 2025 году объем рынка CV оценивается в 20,31 млрд долларов, а к 2030-му, согласно прогнозам<a href="https://www.mordorintelligence.com/industry-reports/computer-vision-market"> Mordor Intelligence</a>, этот показатель достигнет 45,91 млрд долларов при среднегодовом темпе роста 17,72%.</p><p>Несмотря на существующие ограничения, компьютерное зрение продолжает совершенствоваться и открывает новые горизонты для промышленности. Компании, которые подходят к внедрению осознанно, четко формулируют бизнес-задачи и собирают качественные данные. Для них CV-решения становятся не просто инструментом для повышения эффективности техпроцессов и снижения издержек, но и реальным конкурентным преимуществом.</p>]]></content:encoded>
    </item>
    <item>
      <title>Топ 11 трендов, которые нужны айтишнику в 2025 году</title>
      <link>https://tproger.ru/articles/top-11-trendov--kotorye-nuzhny-ajtiwniku-v-2025-godu</link>
      <comments>https://tproger.ru/articles/top-11-trendov--kotorye-nuzhny-ajtiwniku-v-2025-godu?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Валерия Турчак]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/top-11-trendov--kotorye-nuzhny-ajtiwniku-v-2025-godu</guid>
      <description><![CDATA[<p>ИИ, кибербезопасность, облако, DevOps, блокчейн и AR/VR — 11 ключевых IT-трендов 2025. Узнайте, какие навыки прокачать, чтобы оставаться востребованным!</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/top-11-trendov--kotorye-nuzhny-ajtiwniku-v-2025-godu">Топ 11 трендов, которые нужны айтишнику в 2025 году</a>»</p>]]></description>
      <category><![CDATA[Тестирование]]></category>
      <category><![CDATA[Безопасность]]></category>
      <category><![CDATA[Unity]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[DevOps]]></category>
      <category><![CDATA[Agile]]></category>
      <category><![CDATA[Docker]]></category>
      <category><![CDATA[Блокчейн]]></category>
      <category><![CDATA[Библиотеки]]></category>
      <category><![CDATA[Разработка]]></category>
      <category><![CDATA[Кибербезопасность]]></category>
      <category><![CDATA[DevSecOps]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 26 Dec 2024 14:00:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Только вы выучили очередной стэк, как появляются новые фреймворки, инструменты и подходы. IT — одно из немногих направлений, где кризисы могут приходить и уходить, а спрос на классных специалистов остается стабильно высоким.</p><p>Все чаще мы сталкиваемся с автоматизацией процессов, анализом огромных массивов данных и вопросами кибербезопасности. Именно эти потребности бизнеса превращаются в тренды: если не хватает специалистов по защите данных или нет экспертов по облаку, значит спрос на них будет только расти.</p><p>Следить за трендами — не просто «быть в курсе». Это умение смотреть в будущее, вовремя прокачивать навыки и браться за новые проекты. В этой статье мы собрали 11 ключевых трендов на 2025 год — рассмотрим их подробнее, а помогут в этом — <a href="https://solvery.io/ru/mentor/sergey_menshov?utm_source=article&amp;utm_medium=partner&amp;utm_campaign=sergey_menshov&amp;utm_content=trends&amp;utm_term=tproger">Сергей Меньшов</a>, ведущий специалист по Computer Vision (Nexign.com), ментор <a href="https://solvery.io/?utm_source=article&amp;utm_medium=partner&amp;utm_campaign=main_page&amp;utm_content=trends&amp;utm_term=tproger">Solvery</a>, и <a href="https://solvery.io/ru/mentor/anthony_shirshakov?utm_source=article&amp;utm_medium=partner&amp;utm_term=tproger&amp;utm_content=trends&amp;utm_campaign=anthony_shirshakov">Антон Ширшаков</a>, Product owner (Райффайзенбанк), ментор Solvery.</p><h2>Глобальные тренды и направления</h2><h3>Взрывной рост данных и их обработка</h3><p>К 2025 году объем данных, которые мы будем генерировать, обещает безумные масштабы. <a href="https://www.statista.com/statistics/471264/iot-number-of-connected-devices-worldwide/">По прогнозам</a>, в интернете окажется более 75 ммлрд IoT-устройств.</p><ul><li><b>Основы аналитики данных</b>: SQL и Python с библиотеками Pandas, NumPy, Scikit-learn;</li><li><b>Инструменты больших данных</b>: Apache Spark, Hadoop, Google BigQuery;</li><li><b>Базы данных</b>: PostgreSQL, MongoDB, Cassandra;</li><li><b>Визуализация</b>: Tableau, Power BI, Matplotlib, Seaborn;</li><li><b>Обработка потоковых данных</b>: Kafka и облачные платформы для real-time обработки.</li></ul><h3>Автоматизация и ИИ</h3><p>ИИ меняет все подряд: от производства автомобилей до обслуживания клиентов в чат-ботах. <a href="https://www.itsec.ru/news/k-2025godu-rinok-it-budet-ozenivatsia-v-190-mlrd">По прогнозам</a>, к 2025 году объем рынка ИИ вырастет до 190 млрд долларов.</p><ul><li><b>Алгоритмы ML</b>: от линейной регрессии до нейронных сетей;</li><li><b>TensorFlow, PyTorch</b>: библиотеки для быстрого обучения моделей;</li><li><b>MLOps</b>: интеграция и поддержка моделей в продакшне.</li><li><b>OpenCV</b>: компьютерное зрение и анализ видео;</li><li><b>Hugging Face</b>: NLP-модели для текста и чат-ботов.</li></ul><blockquote>Сейчас активно развивается технология OpenVINO от Интела. Она позволяет запускать нейросети на процессоре с высоким FPS — например, YOLOv8 дает 200 кадров в секунду.</blockquote><h2>Топовые технологии и навыки в 2025 году</h2><h3>Кибербезопасность</h3><p>По данным <a href="https://cybersecurityventures.com/cybercrime-damage-costs-10-trillion-by-2025/">исследования</a> Cybersecurity Ventures, к 2025 году глобальный ущерб от киберпреступлений может превысить 10,5 трлн долларов в год.</p><ol><li><b>Этичное хакерство</b> (Penetration Testing): Kali Linux, Metasploit, Burp Suite, Nmap. Сертификат CEH.</li><li><b>Криптография</b>: AES, RSA, SHA, OpenSSL, PGP.</li><li><b>Администрирование сетей</b>: Wireshark, Snort, Splunk.</li><li><b>SIEM</b>: Splunk, IBM QRadar, ArcSight.</li><li><b>Incident Response</b> и Compliance (ISO 27001, GDPR, PCI DSS).</li></ol><h3>Облачные вычисления и архитектура</h3><p>По данным <a href="https://www.gartner.com/en/newsroom/press-releases/2021-11-10-gartner-says-cloud-will-be-the-centerpiece-of-new-digital-experiences">Gartner</a>, к 2025 году 95% новых цифровых рабочих нагрузок будут развернуты в облаках.</p><ul><li><b>Terraform</b>: Infrastructure as Code;</li><li><b>Ansible</b>: автоматизация развертывания;</li><li><b>Docker и Kubernetes</b>: контейнеризация и оркестрация.</li></ul><h3>Full-Stack разработка</h3><p>В 2025 году от Full-Stack разработчиков ожидается еще более широкий спектр навыков: от интеграции с блокчейн до девелопмента микросервисной архитектуры.</p><h3>DevOps</h3><p>В 2025 году DevOps продолжает расширять инструментарий, интегрируясь с AI/ML, облачными технологиями и DevSecOps.</p><h3>Работа с блокчейн</h3><p>Блокчейн выйдет далеко за пределы криптовалют и станет элементом в управлении цепочками поставок, здравоохранении и безопасных транзакциях.</p><ul><li><b>Solidity</b>: язык для смарт-контрактов Ethereum;</li><li><b>dApps</b>: децентрализованные приложения;</li><li><b>Основы криптографии</b>: цифровые подписи, хеш-функции.</li><li><b>Распределенные вычисления</b>: системы без единой точки отказа.</li></ul><h2>Продвинутое управление продуктом</h2><blockquote>На самом деле большинство компаний уже освоили и внедрили Agile-практики. Сейчас гораздо важнее инвестировать в непрерывное обучение и формирование насмотренности.</blockquote><ol><li><b>Непрерывное обучение и насмотренность</b>: конференции, кейсы, смежные области.</li><li><b>Customer-centric</b>: CJM, Jobs to Be Done.</li><li><b>Петли обратной связи</b>: ретроспективы, 1-на-1, обзоры спринтов.</li><li><b>User story mapping, SPIDR, INVEST</b>: декомпозиция задач.</li><li><b>Работа с данными</b>: метрики, A/B-тестирование.</li></ol><h2>Работа с AR/VR технологиями</h2><p>В 2025 году AR/VR продолжат находить применение в образовании, здравоохранении, маркетинге и игровой индустрии.</p><ul><li><b>Unity</b> (C#) и <b>Unreal Engine</b> (C++) — основные движки;</li><li><b>Blender, Maya</b> — 3D-моделирование;</li><li><b>ARKit (iOS), ARCore (Android)</b> — AR для мобильных приложений;</li><li><b>VR-гарнитуры</b>: Oculus Quest, HTC Vive, PlayStation VR.</li></ul><p>2025 год станет временем быстрых перемен в IT. Главные тренды: ИИ, облака, кибербезопасность, аналитика данных, блокчейн. Участвуйте в проектах, создавайте что-то свое и постоянно учитесь новому.</p><p>Читайте также: <a href="https://tproger.ru/articles/kak-stat-programmistom">Как стать программистом с нуля — полный гайд</a>, <a href="https://tproger.ru/articles/kak-stat-ai-inzhenerom-v-2024-godu---powagovyj-gajd">Как стать AI-инженером в 2024 году</a>.</p>]]></content:encoded>
    </item>
    <item>
      <title>Кейс: Хабиб vs МакГрегор или Распознавание лиц на Python</title>
      <link>https://tproger.ru/articles/kejs-habib-vs-makgregor-ili-raspoznavanie-lic-na-python</link>
      <comments>https://tproger.ru/articles/kejs-habib-vs-makgregor-ili-raspoznavanie-lic-na-python?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Типичный программист]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/kejs-habib-vs-makgregor-ili-raspoznavanie-lic-na-python</guid>
      <description><![CDATA[<p>Гайд команды IT Resume: как представить фотографии в виде матриц, обработать их, найти лица на снимках и передать их нейронной сети.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/kejs-habib-vs-makgregor-ili-raspoznavanie-lic-na-python">Кейс: Хабиб vs МакГрегор или Распознавание лиц на Python</a>»</p>]]></description>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 24 Mar 2021 05:04:40 GMT</pubDate>
      <content:encoded><![CDATA[<p>Рассказывает команда IT Resume</p><p>Детекция (т.е. нахождение) и распознавание лиц — очень популярная задача в современном мире: в метро уже давно следят за нашими передвижениями, а в загородных домах все чаще ставят «умные дверные глазки».</p><p>Так уж сложилось, что сейчас уже нельзя просто написать программу для распознавания лиц и присвоить себе должность Senior Data Scientist — таких знаний требуют даже от начинающих специалистов.</p><p>Если Вы еще не игрались с распознаванием лиц, но хотите развиваться в области нейронных сетей (ну или просто Вам интересна эта область), то эксперты <a href="https://vk.com/itresume?utm_source=tproger&amp;utm_medium=article&amp;utm_term=habib">IT Resume</a> подготовили для вас этот гайд — давайте вместе пройдем все шаги:</p><ul><li>научимся загружать и представлять фотографии в виде матриц;</li><li>проведем обработку исходных фотографий;</li><li>задетектим лица на фотографии;</li><li>обработаем изображения нейронной сетью;</li><li>посмотрим — сможет ли сеть понять, что мы ей дали два фото одного и того же человека.</li></ul><p>Для работы нам потребуется:</p><ol><li><a href="https://colab.research.google.com/">Google Colab</a> — среда для работы с Python в браузере. Они еще доступ к GPU дают (а для нейронных сетей это очень нужно).</li><li>И все ?</li></ol><p>Итак, начнем.</p><h2>Этап 1. Подключение модулей</h2><p>Перед тем, как начать работу, давайте сменим среду выполнения на «Ускорение GPU». В будущем нам это понадобится для работы нейронной сети. Для этого в Google Colab нажимаем «Среда выполнения» → «Сменить среду выполнения» → «Аппаратный ускоритель GPU».</p><p>Теперь подключим необходимые библиотеки. В Colab большинство библиотек уже установлено, поэтому нам осталось их только импортировать:</p><ul><li>cv2 — для загрузки и обработки изображений;</li><li>dlib — для детекции лиц;</li><li>numpy — для работы с матрицами.</li></ul><p>Помимо этого, с помощью команды pip install face_recognition мы устанавливаем библиотеку face_recognition — с ее помощью мы будем обрабатывать лицо нейронной сетью.</p><p>Примечание Вообще сделать полную обработку можно всего за несколько строчек кода, потому что в библиотеке face_recognition многие процессы (например, детекция лиц) уже завернуты в функции. Но мы намеренно некоторые вещи будем делать «с нуля», чтобы вы лучше во всем разобрались.</p><h2>Этап 2. Первичная настройка</h2><p>Теперь нам нужно произвести небольшую настройку, чтобы потом полноценно использовать все инструменты и кодовую базу.</p><p>Начнем с настройки детектора лиц. Сначала скачиваем файл с готовой моделью с помощью команды wget (да, именно этой командой Цукерберг запустил Фэйсбук в фильме Социальная сеть) и распаковываем файл в формат .dat.</p><p>Далее создаем детектор лиц и передаем скачанную модель в shape_predictor, который будет предсказывать ключевые точки человеческого лица — контур головы, глаза, нос и рот.</p><p>Отлично, теперь мы готовы переходить к содержательной части — обработке фотографий.</p><h2>Этап 3. Загрузка и обработка фотографий</h2><p>Перед тем, как загружать фотографию в переменную Python, ее надо загрузить в файловое хранилище Google Colab. Для этого достаточно нажать на иконку Папки на левом сайдбаре и выбрать Upload.</p><figure><img src="https://media.tproger.ru/uploads/2021/03/Ris-1.png" alt="" /></figure><p>Мы, например, загрузим фотографию Конора МакГрегора.</p><figure><img src="https://media.tproger.ru/uploads/2021/03/conor.jpg" alt="" /></figure><p>Отлично, теперь надо «прочитать» изображение в переменную Python. Это можно сделать несколькими способами, но нам удобнее представить изображение сразу в виде матрицы. Это можно сделать с помощью функции imread из модуля cv2.</p><p>Если вы загружаете цветную картинку, то «матрица» будет иметь размерность 3*height*width, где 3 — количество цветовых каналов (RGB), а width и height — размерность картинки в пикселях. Проверить это можно с помощью метода shape. Каждое число в матрице — значение пикселя по конкретному цветовому каналу.</p><p>Кстати говоря, если вы хотите посмотреть на загруженную картинку, то вам нужно:</p><ol><li>Импортировать команду cv2_imshow: from google.colab.patches import cv2_imshow.</li><li>Передать в функцию cv2_imshow нужную картинку: cv2_imshow(img).</li></ol><figure><img src="https://media.tproger.ru/uploads/2021/03/ris-2-autoconverted.jpeg" alt="" /></figure><p>В некоторых задачах имеет смысл обрабатывать не цветное изображение, а черно-белое. Например, на детекцию лиц наличие цвета мало влияет — контуры лица и так хорошо видны. А вот для нейронной сети это может быть принципиальный момент — мало ли, люди выглядят одинаково, а цвет кожи разный.</p><p>Поэтому давайте переведем нашу цветную картинку в черно-белую:</p><figure><img src="https://media.tproger.ru/uploads/2021/03/Ris-3-autoconverted.jpeg" alt="" /></figure><p>Теперь переходим к следующему этапу — детекция лица.</p><h2>Этап 4. Детекция лица</h2><p>Детектор лиц у нас уже настроен, поэтому можем переходить непосредственно к детекции. Делать это будем в 2 этапа:</p><ol><li>Ищем прямоугольники, в которых находятся лица.</li><li>По этим прямоугольникам предсказываем контуры и ключевые точки лица.</li></ol><p>С помощью detector мы получим координаты нужного прямоугольника. Если лиц несколько, то и наборов точек будет несколько. Чтобы выбрать конкретное лицо, нужно указать индекс (в нашем случае — ноль).</p><p>Чтобы посмотреть на результат, можно нарисовать рамку вокруг лица с помощью метода rectangle и посмотреть фото с помощью cv2_imshow. Только будьте осторожны — рамка останется на фото навсегда, так что лучше потом загрузить изображение заново.</p><figure><img src="https://media.tproger.ru/uploads/2021/03/Ris-4-autoconverted.jpeg" alt="" /></figure><p>Теперь по найденным квадратам нужно «предсказать» ключевые точки лица. Для этого используем predictor, а потом извлекаем координаты точек.</p><p>Здесь, чтобы получить координаты точек, мы использовали сразу несколько полезных — операций Python:<br />— лямбда-функции;<br />— функцию map;<br />— распаковку.<br />Если вы планируете связать свою работу с Python, то обязательно освойте все эти приемы — они сильно упростят вам жизнь.</p><p>На выходе у нас получилось 68 точек. Не будем сильно в этом гайде заморачиваться с тем, как нанести это на фото, но получится что-то в таком духе:</p><figure><img src="https://media.tproger.ru/uploads/2021/03/Ris-5.png" alt="" /></figure><p>Теперь у нас есть вся необходимая информация, чтобы обработать изображение нейронной сетью — и изображение, и ключевые точки лица. Переходим к следующему этапу.</p><h2>Этап 5. Обработка нейронной сетью</h2><p>Основная идея обработки сетью заключается в том, что из исходного «большого» изображения выделяются только ключевые признаки, которые впоследствии и помогут нам отличить одного человека от другого. Другими словами, многомерная матрица-картинки преобразуется в относительно небольшой числовой вектор, который характеризует лицо с картинки.</p><p>Итак, получить итоговый вектор очень просто — достаточно вызвать функцию face_encodings.</p><p>Примечание Обратите внимание, что в качестве аргументов мы передали только изображение, а полученные ранее ключевые точки мы не использовали. Причина очень проста — функция face_encodings делает все те же самые действия, которые мы с вами проделали вручную ранее для понимания процесса «изнутри».</p><p>На выходе мы получаем вектор размерности 128, т.е. 128 чисел, которые описывают лицо на фотографии. Что значит каждое из этих чисел — неизвестно: это некоторая абстракция, восстановить и осмыслить которую невозможно — слишком уж много математических преобразований лежит внутри этого процесса.</p><p>Однако, от этого вектора нам толку мало — чтобы оценить эффективность «нейросетевых технологий», нужно сравнить два вектора для двух разных фотографий. Давайте немного поэксперементируем — будем подавать разные фото на вход и сравнивать с нашим изначальным фото МакГрегора.</p><h2>Этап 6. Сравнение векторов</h2><p>Чтобы сравнивать лица между собой, мы будем действовать следующим образом:</p><ol><li>Загружаем новое фото и производим обработку, которую уже разобрали на предыдущих этапах. На выходе получаем вектор.</li><li>Сравниваем вектора между собой.</li><li>На основании расстояния принимаем решение — один и тот же человек на фото или разные.</li></ol><p>Встает вопрос — что значит «сравнить вектора»? Самый простой способ — посчитать расстояние в некоторой метрике. Мы выберем обычную евклидову метрику. Вычислять ее без лишнего кода нам позволит функция pdist из scipy.spatial.distance.</p><p>Итак, сначала загрузим еще одну фотографию Конора.</p><figure><img src="https://media.tproger.ru/uploads/2021/03/conor2-scaled.jpeg" alt="" /></figure><p>Сохраняем полученный вектор для первой фотографии в vector1, для второй — в vector2 и вычисляем расстояние:</p><p>Получаем ответ — 0,48. Это достаточно близкое расстояние, из чего делаем вывод, что это один и тот же человек. Сеть справилась отлично!</p><p>Ну хорошо, еще пару экспериментов — давайте возьмем снова Конора, но усложним задачу — пусть он будет в очках.</p><figure><img src="https://media.tproger.ru/uploads/2021/03/conor3.jpg" alt="" /></figure><p>Результат — 0,56. Снова в яблочко (разработчик библиотеки face_recognition рекомендует придерживаться порога 0,6 — если больше 0,6, то это другой человек).</p><p>Ну что ж, а может сеть просто всех определяет как Конора? Давайте подсунем ей другого бойца — Хабиба Нурмагомедова. Что наша сеть на это скажет?</p><figure><img src="https://media.tproger.ru/uploads/2021/03/habib.jpg" alt="" /></figure><p>Снова проводим уже известную процедуру и ответ… — 0.72. По утвержденному ранее порогу, делаем вывод: Хабиб — не Конор. Сеть снова нас не подвела, и мы со спокойной душой можем переходить к более сложным проектам.</p><h2>Эпилог</h2><p>Мы с вами разобрали основной инструментарий, который вам понадобится для старта в области face recognition (да и в нейронных сетях, в целом). Однако это далеко не предел — мы затронули лишь верхушку айсберга, опустив очень много моментов как программных, так и математических.</p><p>Вот несколько вещей, которые мы рекомендуем вам сделать, чтобы прокачаться в области Computer Vision (компьютерное зрение):</p><ul><li>Научитесь выстраивать процесс распознавания с нуля, без использования оберток (чем является библиотека face_recognition). Начните хотя бы с изучения исходников этой библиотеки на GitHub — там ничего сверхсложного нет.</li><li>Попробуйте разные нейронные сети. Погуглите state-of-the-art решения и посмотрите — чем будет различаться результат.</li><li>Изучите структуру нейронных сетей (например, сверточных) с математической точки зрения. Это можно сделать с помощью многочисленных туториалов и официальной документации библиотек (например, PyTorch).</li></ul><p>Есть много и других точек роста, но начните с этих — остальные мысли придут в процессе ?</p><p>Желаем удачи и будем рады помочь в комментариях!</p><p>P.S. Наш ноутбук с кодом в Google Colab Вы можете найти <a href="https://bit.ly/3eQP9Xr">здесь</a>.</p>]]></content:encoded>
    </item>
    <item>
      <title>Разработчик за 10 минут создал приложение для поиска одинаковых носков с помощью OpenCV</title>
      <link>https://tproger.ru/news/razrabotchik-za-10-minut-sozdal-prilozhenie-dlja-poiska-odinakovyh-noskov-s-pomoshhju-opencv</link>
      <comments>https://tproger.ru/news/razrabotchik-za-10-minut-sozdal-prilozhenie-dlja-poiska-odinakovyh-noskov-s-pomoshhju-opencv?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Булат Яббаров]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/razrabotchik-za-10-minut-sozdal-prilozhenie-dlja-poiska-odinakovyh-noskov-s-pomoshhju-opencv</guid>
      <description><![CDATA[<p>Пользователь QuanticDev показал на YouTube, как с помощью библиотеки компьютерного зрения OpenCV собрал программу, находящую пару носков в куче.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/razrabotchik-za-10-minut-sozdal-prilozhenie-dlja-poiska-odinakovyh-noskov-s-pomoshhju-opencv">Разработчик за 10 минут создал приложение для поиска одинаковых носков с помощью OpenCV</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 03 Feb 2021 07:16:10 GMT</pubDate>
      <content:encoded><![CDATA[<p>Пользователь под ником QuanticDev <a href="https://youtu.be/nE_VbgEPogs">опубликовал</a> видео на своём YouTube-канале. В нём он рассказал о создании приложения с ИИ, с помощью которого можно сопоставить два одинаковых носка, находящихся в куче с другими. Причём на всё про всё у него ушло около 10 минут.</p><p>В основу проекта легла библиотека OpenCV. Разработчик использовал её для быстрой реализации компьютерного зрения. И чтобы сопоставление работало как было задумано, QuanticDev воспользовался соответствующим <a href="https://docs.opencv.org/master/d5/d6f/tutorial_feature_flann_matcher.html">туториалом</a> на сайте библиотеки.</p><p>В конечном итоге разработчик получил то, что хотел — его приложение понимало, где находятся два одинаковых носка, тем самым помогая разбирать кучу постиранных носков.</p><h3>Как повторить проект?</h3><ol><li>Открыть туториал на сайте OpenCV и скопировать оттуда кусок кода (доступен на C++, Java и Python).</li><li>Используя пакетный менеджер, установить следующие пакеты: <i>opencv</i>, <i>opencv-contrib</i>, <i>cmake</i>, <i>make</i>.</li><li>Создать директорию <i>./Matcher</i>.</li><li>Создать в ней файл <i>Matcher.cpp</i>.</li><li>Вставить скопированный с сайта OpenCV C++ код в файл <i>Matcher.cpp</i>.</li><li>Выполнить команду cmake . &amp;&amp; make &amp;&amp; ./Matcher , находясь в директории <i>./Matcher</i>.</li><li>???</li><li>Profit!</li></ol><p>Источник: <a href="https://youtu.be/nE_VbgEPogs">YouTube / QuanticDev</a></p>]]></content:encoded>
    </item>
    <item>
      <title>Инженеры изобрели устройство для обнаружения в автобусах детей и животных, оставленных без присмотра</title>
      <link>https://tproger.ru/news/bus-sensor-for-children</link>
      <comments>https://tproger.ru/news/bus-sensor-for-children?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[karpov]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/bus-sensor-for-children</guid>
      <description><![CDATA[<p>Сенсор на зеркале заднего вида ловит отражённые радиоволны, а алгоритм компьютерного зрения распознаёт ребёнка или животное даже сквозь сиденья.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/bus-sensor-for-children">Инженеры изобрели устройство для обнаружения в автобусах детей и животных, оставленных без присмотра</a>»</p>]]></description>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Распознавание]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 13 Nov 2019 14:31:48 GMT</pubDate>
      <content:encoded><![CDATA[<p>Инженеры изобрели устройство, которое обнаруживает оставленных без присмотра детей и домашних животных в общественном транспорте. Оно представляет собой сенсор, который крепится на зеркало заднего вида. Данные с него обрабатывает алгоритм компьютерного зрения.</p><p>Сенсор работает за счёт радиолокационных волн: они отражаются от предметов и живых существ. Если ИИ замечает, что в отражённой картинке есть ребёнок или животное, а рядом с ним нет взрослого, система бьёт тревогу.</p><p>У такого сенсора есть одно важное преимущество перед камерами: он умеет «видеть» сквозь сиденья.</p><p>Изобретение придумали в Университете Ватерлоо, работу частично профинансировал производитель автомобильных деталей. Он рассчитывает вывести датчик на рынок к концу 2020 года. Эту же технологию можно в будущем применять для распознавания усталости водителя.</p>]]></content:encoded>
    </item>
    <item>
      <title>Microsoft и власти Индии автоматизировали тесты на вождение при помощи устройств на базе смартфонов</title>
      <link>https://tproger.ru/news/hams-msr-india</link>
      <comments>https://tproger.ru/news/hams-msr-india?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/hams-msr-india</guid>
      <description><![CDATA[<p>Устройство HAMS на базе бюджетного смартфона снимает водителя и дорогу, а по данным датчиков и видео оценивает, насколько хорошо человек водит.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/hams-msr-india">Microsoft и власти Индии автоматизировали тесты на вождение при помощи устройств на базе смартфонов</a>»</p>]]></description>
      <category><![CDATA[Microsoft]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 04 Nov 2019 14:00:35 GMT</pubDate>
      <content:encoded><![CDATA[<p>Специалисты из Microsoft Research AI вместе с органами власти Индии автоматизировали тесты на вождение для получения прав. Инженеры создали устройство HAMS на базе бюджетного смартфона. Оно с помощью анализа данных с датчиков и видео с камер делает вывод о том, насколько хорошо человек водит машину.</p><p>Смартфон нужно закрепить на ветровом стекле так, чтобы фронтальная камера «видела» водителя, а основная — дорогу перед автомобилем. Алгоритмы получают два потока видео и данные с датчиков смартфона. Они анализируются в связке. Например, получив с акселерометра данные о резком торможении, система сразу обращает внимание на человека за рулём — видны ли на его лице признаки усталости или сна, а также на дорогу — не наехал ли автомобиль на какое-нибудь препятствие.</p><p>Устройства сейчас тестируют вместе с региональным транспортным управлением Дехрадуна — города на севере Индии. По словам чиновников, ежедневно больше 50 человек пытаются пройти тест на вождение вместе с устройствами HAMS. Только половина сдаёт его успешно.</p>]]></content:encoded>
    </item>
    <item>
      <title>Adobe научила Photoshop выделять контур объектов в выделенной области</title>
      <link>https://tproger.ru/news/photoshop-new-outline-feature</link>
      <comments>https://tproger.ru/news/photoshop-new-outline-feature?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[karpov]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/photoshop-new-outline-feature</guid>
      <description><![CDATA[<p>Adobe добавит в редактор выделение предметов внутри произвольной области снимка: алгоритм сам изолирует их от фона и обведёт контур.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/photoshop-new-outline-feature">Adobe научила Photoshop выделять контур объектов в выделенной области</a>»</p>]]></description>
      <category><![CDATA[Adobe]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 30 Oct 2019 13:40:44 GMT</pubDate>
      <content:encoded><![CDATA[<p>Photoshop научился автоматически выделять объекты в определённой части фото. Функция скоро появится в новых версиях редактора.</p><p>В Photoshop помимо стандартных инструментов выделения есть и автоматические. Ещё в 2017 году выделить объект на снимке стало возможно одним кликом. Но у такой функции есть существенный недостаток: доминирующий предмет в кадре алгоритм выбирает сам, то есть указать ему на определённую область не получится.</p><p>В новой версии пользователю будет достаточно указать произвольную и неограниченную область на изображении. Алгоритм изолирует предметы в этой области от фона и выделит их контур. Самое крутое, что функция работает, даже если какие-то части объекта не попали в область.</p>]]></content:encoded>
    </item>
    <item>
      <title>Чем разработчику заняться в промышленности: компьютерное зрение, машинное обучение, IoT</title>
      <link>https://tproger.ru/articles/industrial-developer-croc</link>
      <comments>https://tproger.ru/articles/industrial-developer-croc?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Типичный программист]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/industrial-developer-croc</guid>
      <description><![CDATA[<p>IT-решения в промышленности помогают контролировать безопасность, переводить рабочие процессы в цифровую форму и распределять задачи с помощью ИИ.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/industrial-developer-croc">Чем разработчику заняться в промышленности: компьютерное зрение, машинное обучение, IoT</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Интернет вещей]]></category>
      <category><![CDATA[Карьера]]></category>
      <category><![CDATA[Партнёрский материал]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 17 Oct 2019 13:15:01 GMT</pubDate>
      <content:encoded><![CDATA[<p>Иногда от новостей складывается впечатление, что большинство технологических усилий человечества направлены на новые смартфоны и приложения внутри них. К счастью, я много общаюсь с командами из крупнейших предприятий России и потому знаю: для серьёзного и полезного дела новые технологии тоже применяются, и весьма активно. Хочу рассказать, какие IT-решения сейчас востребованы в промышленности и как можно своими руками их протестировать (спойлер: нет, в КРОК для этого устраиваться необязательно).</p><h2>Безопасность</h2><p>Офисные сотрудники могут только позавидовать тому, как на предприятиях заботятся о здоровье. Без несчастных случаев и аварий на производстве завод работает как часы, вот промышленники и стремятся к нулевым показателям по простоям, задержкам и, конечно, избегают травматизма и смертности.</p><p>Как этого добиться? Только тотальным и бескомпромиссным контролем. Чтобы не просто пьяных не пускали — даже с похмельным «выхлопом» на объекте никого не было. И чтобы без допуска никто не лез на высоту, а все операции чётко соответствовали регламентам.</p><p>Для этих целей у главного инженера и других руководителей устанавливается специальный интерфейс, где, как в компьютерной игре, визуализируется общая обстановка и события, на которые нужно обратить внимание. Плюс показатели самочувствия сотрудников вплоть до определения уровня стресса. Чуть что не так — пожалуйте в медпункт, проверьте сердце и давление. И везде алкотестеры: на входе, у станков, у электрощитов. Потому что, увы, некоторые герои любят «взбодриться» в обеденный перерыв.</p><p>Одна из самых важных задач — перенесение аналоговых рабочих процессов в цифровую логику программ. А потом ИИ сможет оптимизировать распределение задач: раздавать наряды для оптимальной загрузки станков, учитывая навыки сотрудников, правильно выстраивать процедуры и так далее. А в случае аварии он направит людей к нужным выходам, чтобы избежать жертв из-за паники. Параллельно он будет собирать информацию с умных датчиков, устанавливая по горячим следам причины проблем.</p><h2>Эффективность производства</h2><p>Про оптимизацию станков силами ИИ мы уже сказали. Ещё есть умная мониторинговая система, которая по звуку определяет, что мотору скоро понадобится ремонт. В отличие от Васильича из автосервиса, эта система реально может диагностировать электродвигатель или другую сложную машину по её шумам. В результате предприятие переходит к модели обслуживания по потребности, что, во-первых, дешевле, а во-вторых, страхует от неожиданностей. Уже сейчас РЖД таким образом ремонтирует вагонные колесные пары.</p><p>Немало усилий направлено и на расширение способностей каждого рабочего. Человек надевает очки дополненной реальности и видит перед собой инструкцию по обращению с техникой. Или может взять в руки сошедшую с ленты деталь, а компьютер оценит, не отправить ли продукт в брак. Это пока в будущем, а из того, что уже вошло в практику — обучение персонала в виртуальной среде, когда они могут в тех же VR-очках побегать по заводу, запомнить, где находится каждый вентиль и что делать в разных ситуациях. Когда завод запустят, сотрудникам нужно будет гораздо меньше времени, чтобы освоиться.</p><figure><img src="https://media.tproger.ru/user-uploads/23823/2023-12-25/c150e4aa-d0fb-431a-a660-f7c64c3be426.jpg" alt="" /></figure><h2>Роботы</h2><p>Эти технологии по сути объединяют в себе два предыдущих раздела. Когда человеку не стоит или не хочется лезть в какую-то зону, он берёт в руки пульт и отправляет вместо себя дрона. Не обязательно летающего: беспилотники устанавливаются на колёсную или гусеничную базу, есть плавающие, лазающие, катающиеся образцы.</p><p>Лично мы самими роботами не занимаемся, но зато разработали софт, чтобы один оператор мог контролировать целые группировки дронов. Можно создавать маршруты, программировать сценарии, всячески автоматизировать работу. Как это используется в реальной жизни?</p><p>Одни компании мониторят состояние растянутых на километры объектов (если мы говорим, например, о трубопроводе). Тепловизоры и прочие специальные штуковины позволяют, например, увидеть утечку и отправить сигнал обслуживающей бригаде.</p><p>Другие предприятия отправляют дроны в карьеры, где они обследуют стенки и сообщают о проблемах. Во время взрывных работ беспилотники позволяют вовсе убрать людей из опасной зоны, не жертвуя при этом эффективностью операций.</p><p>В агропромышленном комплексе дроны летают над полями: ищут больные растения, обезвоженные участки и всё такое прочее. Есть даже системы для автоматического сбора урожая.</p><p>И, разумеется, задачи в части аварий и чрезвычайных ситуаций — это актуально всегда и везде. Здесь у нас целая серия пилотных проектов для нескольких производств. До боевого внедрения технологий остаётся 3–5 лет.</p><figure><img src="https://media.tproger.ru/user-uploads/23823/2023-12-25/0c58fb31-98b1-46ab-a2cd-d79405021db5.jpeg" alt="" /></figure><h2>Машинное зрение и всё, что придет в голову</h2><p>Умные камеры работают на множестве участков. Причём многие проекты начинаются, когда заказчик делится своей «болью», а наши инженеры ему говорят: «А почему бы не…». Вот примеры.</p><p>Как контролировать усталость водителей большегрузов и защищать их от бандитов в пути? Ставим в кабину умную камеру, чтобы следила за состоянием человека. Комплекс датчиков собирает данные о движении машины и сигнализирует о внезапных событиях вроде открытия дверей фургона, появления попутчиков (или попутчиц).</p><p>Как следить за поведением персонала и доступом в закрытые зоны? Система машинного зрения на ходу снимает людей и ведёт их по объекту. Тут работает не только распознавание лица, но и анализ дополнительных параметров вроде походки.</p><figure><img src="https://media.tproger.ru/user-uploads/23823/2023-12-25/11b66e60-e063-4302-85e2-ffb8c3ae6e65.jpg" alt="" /></figure><p>Как обеспечить проверку грузов на крупном объекте вроде порта или промышленного склада? Дрон облетает контейнер, проверяет его на повреждения (трещины, коррозию и так далее). В некоторых портах уже есть краны, которые не берут груз, пока дрон не составит и не проанализирует его модель.</p><p>Как проконтролировать стройку на удалённом объекте? Ставим систему, которая в режиме 24/7 считает, сколько привезли материалов, сколько человек реально было на стройплощадке и сколько времени они работали, а сколько — играли в домино. Всё это можно наложить на BIM-модель и соотнести с экономическими показателями.</p><h2>Хотите попробовать эти решения в деле? Участвуйте в хакатоне КРОК</h2><p>Теперь о том, что я анонсировал в начале — как это всё можно пощупать. 16–17 ноября в Москве у нас в КРОК пройдет финал промышленного хакатона ProHack 4.0. Это хакатон с реальными задачами от таких промышленных компаний, как Сибур, ФосАгро, УралХим, Газпром Нефть, Норникель и другие. Задачи такого же плана, что и описанные выше. Например, оптимизировать работу системы вентиляции на предприятии, чтобы она работала не 100% времени, а только если в помещении есть люди. Все задачи хакатона можно посмотреть <a href="https://tprg.ru/Etlu">здесь</a>.</p><p>А на днях пришла <a href="https://tprg.ru/MFwj">бомбическая задача</a> от крупного агрохолдинга: детектирование/устранение случаев придавливания поросят свиноматкой. Из описания задачи:</p><p>В свинокомплексе на небольшой площади (в станке) находится свиноматка, которая недавно опоросилась и кормит родившихся поросят. Свиноматка кормит поросят с момента опороса до 26–дневного возраста. Станок исключает повороты свиноматки, позволяя ей лишь лежать или стоять. Проблема в том, что бывают ситуации, преимущественно на первой неделе после опороса (когда поросята еще недостаточно осторожны), когда свиноматка ложится на пол и случайно придавливает поросёнка. Часть поросят при этом получают несовместимые с жизнью повреждения, а часть можно спасти, если в течение короткого промежутка времени освободить их из-под тела свиноматки.</p><p>Эту и другие задачи участники хакатона попробуют решить с помощью настоящих рабочих инструментов от ведущих мировых вендоров. Мы предложим им высокоскоростной фреймворк Exonum (Bitfury), российскую платформу Мастерчейн, набор промышленных решений от Cisco: инструменты для индустриального Wi-Fi, построения сети LoRaWAN, IoT-платформу Cisco Kinetic, видеонаблюдение Cisco VSM. Пергам поделится своими наработками в области детектирования газов на промышленных объектах.</p><p>Проверить свои гипотезы и апробировать разработанные прототипы вы сможете с помощью гибкой и масштабируемой «песочницы» на основе платформы КРОК Облачные сервисы.</p>]]></content:encoded>
    </item>
    <item>
      <title>В Chrome появилась функция описания иллюстраций для слабовидящих пользователей</title>
      <link>https://tproger.ru/news/chrome-image-annotation</link>
      <comments>https://tproger.ru/news/chrome-image-annotation?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/chrome-image-annotation</guid>
      <description><![CDATA[<p>Chrome автоматически создаёт описание изображений для слабовидящих. Функция работает как поиск картинок по тексту и включается в настройках доступности.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/chrome-image-annotation">В Chrome появилась функция описания иллюстраций для слабовидящих пользователей</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Google Chrome]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 11 Oct 2019 11:20:46 GMT</pubDate>
      <content:encoded><![CDATA[<p>Chrome получил новую функцию доступности — автоматически генерируемое описание изображения. Функция работает только для тех, у кого подключён дисплей Брайля или экранный диктор.</p><p>Как говорит один из членов команды Chrome, раньше на месте иллюстрации человек мог услышать разве что слово «изображение» или имя файла, что тоже мало чем полезно. Теперь при браузер должен давать более-менее подробное описание иллюстрациям. Например, «похоже на фрукты и овощи в магазине» для фото витрины овощной лавки.</p><p>Система работает аналогично той, что позволяет искать картинки по текстовым запросам.</p><p>Включить функцию можно в продвинутых настройках браузера, в секции Accessibility.</p>]]></content:encoded>
    </item>
    <item>
      <title>Bloomberg: работники Amazon просматривают записи с камер видеонаблюдения Cloud Cam</title>
      <link>https://tproger.ru/news/cloud-cam-video-review</link>
      <comments>https://tproger.ru/news/cloud-cam-video-review?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/cloud-cam-video-review</guid>
      <description><![CDATA[<p>Сотрудники Amazon смотрят отрывки Cloud Cam длиной 20–30 секунд, снятые при включённом распознавании опасности, и отмечают ошибки алгоритма.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/cloud-cam-video-review">Bloomberg: работники Amazon просматривают записи с камер видеонаблюдения Cloud Cam</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Amazon]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 11 Oct 2019 11:17:24 GMT</pubDate>
      <content:encoded><![CDATA[<p>Bloomberg узнал, что специалисты Amazon просматривают и вручную размечают видео с камер видеонаблюдения Cloud Cam. Но только те, при записи которых был включён режим распознавания опасности. Наёмные сотрудники просматривают отрывки длиной в 20−30 секунд и отмечают, где алгоритм ошибся, а где нет.</p><p>Согласно источникам Bloomberg, Amazon серьёзно относится к вопросам безопасности в отношении этого проекта. К примеру, сотрудники в Индии работают с такими видео на отдельном этаже, куда нельзя проходить со своими смартфонами. Но проблема, говорят журналисты, в том, что Amazon нигде не говорит напрямую, что видео с камер будут просматривать другие люди.</p>]]></content:encoded>
    </item>
    <item>
      <title>«Яндекс» научила «Алису» узнавать страны по фото из Яндекс.Карт</title>
      <link>https://tproger.ru/news/yandex-country-game</link>
      <comments>https://tproger.ru/news/yandex-country-game?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/yandex-country-game</guid>
      <description><![CDATA[<p>Яндекс обучил нейросеть SE-ResNeXt-50 распознавать страны по снимкам из Карт. На основе технологии создана игра с голосовым помощником Алисой.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/yandex-country-game">«Яндекс» научила «Алису» узнавать страны по фото из Яндекс.Карт</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Распознавание]]></category>
      <category><![CDATA[Яндекс]]></category>
      <category><![CDATA[Алиса]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 25 Sep 2019 11:25:17 GMT</pubDate>
      <content:encoded><![CDATA[<p>Автор: Андрей Карпов</p><p>Нейросеть «Яндекса» узнаёт страны по фотографиям. Алгоритм работает так же, как <a href="https://yandex.ru/blog/company/cities-game">предыдущая версия с российскими городами</a>.</p><p>Разработчики использовали свёрточную нейросеть SE-ResNeXt-50. Ей показали подборку фотографий из Яндекс.Карт с указанием стран. ИИ самостоятельно выделил признаки, по которым можно узнать ту или иную страну. Например, Нидерланды алгоритм узнаёт по сочетанию тёмных кирпичных стен и белых контуров на окнах.</p><p>Из нейросети сделали <a href="https://yandex.ru/lab/countries">игру с «Алисой»</a>. Она профи, но и у человека есть преимущества. Во-первых, алгоритм не распознаёт номера машины, флаги, тексты вывесок и дорожных знаков. Во-вторых, подглядывать в Яндекс.Картинки ему нельзя. В-третьих, в игре участвуют только те картинки, которых алгоритм раньше не видел.</p>]]></content:encoded>
    </item>
    <item>
      <title>Нейросеть научилась распознавать зеркало на снимке</title>
      <link>https://tproger.ru/news/mirrors-problem-ai-solution</link>
      <comments>https://tproger.ru/news/mirrors-problem-ai-solution?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/mirrors-problem-ai-solution</guid>
      <description><![CDATA[<p>Китайские разработчики научили нейросеть распознавать зеркала на снимках по текстуре, цвету и семантическим признакам, решая проблему компьютерного зрения.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/mirrors-problem-ai-solution">Нейросеть научилась распознавать зеркало на снимке</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sat, 07 Sep 2019 10:22:01 GMT</pubDate>
      <content:encoded><![CDATA[<p>Автор: Андрей Карпов</p><p>Нейросеть научили видеть зеркала в кадре. Алгоритм справляется с обнаружением отражения на фото лучше, чем аналоги, — так говорят авторы.</p><p>Зеркальная поверхность — серьёзная проблема для компьютерного зрения. Нейросети воспринимают их как часть кадра и думают, что объекты в отражении присутствуют на снимке, просто находятся очень далеко. Китайские разработчики научили нейросеть различать отражение по текстуре, цвету и семантическим признакам.</p><p>Сначала фотографию отправляют свёрточной нейросети для выделения признаков — программа оставляет только ключевые данные, например, линии. Так изображение проще анализировать, а информация об объектах сохраняется. Обработанное фото принимает вторая нейросеть, которая анализирует контрастность разных параметров на снимке. Алгоритм определяет, где эти параметры сильно различаются, и понимает: тут зеркало.</p><p>Для обучения разработчики собрали датасет из 4018 пар снимков помещений с зеркалами: исходный кадр и кадр с выделенным зеркалом. На таких же данных алгоритм сравнили с аналогами и выяснили, что новая нейросеть точнее выделяет зеркальную гладь.</p>]]></content:encoded>
    </item>
    <item>
      <title>«Раздевавшее» женщин приложение DeepNude закрыли из-за того, что оно стало вирусным</title>
      <link>https://tproger.ru/news/deepnude-closed</link>
      <comments>https://tproger.ru/news/deepnude-closed?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/deepnude-closed</guid>
      <description><![CDATA[<p>Создатели платного приложения DeepNude, «раздевавшего» женщин на фотографиях, свернули сервис через несколько дней работы из-за страха злоупотреблений.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/deepnude-closed">«Раздевавшее» женщин приложение DeepNude закрыли из-за того, что оно стало вирусным</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 28 Jun 2019 11:58:58 GMT</pubDate>
      <content:encoded><![CDATA[<p>26−27 июня многие СМИ, и <a href="https://www.vice.com/en_us/article/kzm59x/deepnude-app-creates-fake-nudes-of-any-woman">англоязычные</a>, и русскоязычные, рассказывали о приложении <a href="https://www.deepnude.com/">DeepNude</a>. Оно «раздевает» женщин на фотографиях. Работает лучше всего с фото, где человек и так почти обнажён (в нижнем белье или купальнике), а что делать с мужчинами — не знает вовсе.</p><p>Приложение это было платное. На обработанные фото, сделанные в бесплатной версии, оно накладывало огромные водяные знаки, закрывающие «самое интересное». Если получить премиум-доступ, на фото не останется лишних пометок, кроме большой надписи «Fake» сверху.</p><h2>Внезапный конец</h2><p>Вчера создатели DeepNude объявили, что закрывают сервис, хотя тот проработал всего несколько дней:</p><blockquote>Мы думали, что у нас будет несколько продаж каждый месяц, которые мы будем контролировать вручную. &lt;…&gt; Мы сильно недооценили запрос. Несмотря на принятые меры безопасности (водяные знаки), если его используют 500 тысяч человек, вероятность того, что люди будут злоупотреблять им, слишком высока. Мы не хотим зарабатывать деньги таким образом. &lt;…&gt; Мир ещё не готов к DeepNude.</blockquote><h2>Взлом</h2><p>Но и это ещё не всё. 27 июня пользователь Reddit <a href="https://www.reddit.com/r/DeepNudes/comments/c6at83/i_made_a_premium_crack/">опубликовал</a> «кряк» для премиум-версии программы. Он позволяет скачать изображение безо всяких водяных знаков, даже без подписи «Fake».</p><p>По словам пользователя, разработчики предусмотрели механизм отслеживания авторов платных фото. В метаданные изображения включался email-адрес подписчика на платный сервис, который скачал обработанное фото. На то, чтобы создать «кряк», у него ушло четыре часа.</p>]]></content:encoded>
    </item>
    <item>
      <title>Шпаргалка по OpenCV — Python</title>
      <link>https://tproger.ru/translations/opencv-python-guide</link>
      <comments>https://tproger.ru/translations/opencv-python-guide?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Александр Ланский]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/translations/opencv-python-guide</guid>
      <description><![CDATA[<p>Краткая шпаргалка по OpenCV на Python с примерами кода: чтение и вывод изображений, обрезка, поворот, изменение размера, размытие, рисование, наложение текста, распознавание лиц и контуров.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/translations/opencv-python-guide">Шпаргалка по OpenCV — Python</a>»</p>]]></description>
      <category><![CDATA[Для начинающих]]></category>
      <category><![CDATA[Python]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Шпаргалки]]></category>
      <category><![CDATA[Переводы]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 03 May 2019 08:06:01 GMT</pubDate>
      <content:encoded><![CDATA[<h2>Что такое OpenCV?</h2><p>Библиотека компьютерного зрения и машинного обучения с открытым исходным кодом. В неё входят более 2500 алгоритмов, в которых есть как классические, так и современные алгоритмы для компьютерного зрения и машинного обучения. Эта библиотека имеет интерфейсы на различных языках, среди которых есть Python (в этой статье используем его), Java, C++ и Matlab.</p><p>В этой шпаргалке собраны основные операции OpenCV на Python с готовыми примерами кода: от чтения и вывода изображений до распознавания лиц и контуров объектов. Каждый блок можно скопировать и сразу использовать в своём проекте.</p><h2>Содержание</h2><ol><li><a href="https://tproger.ru/#install">Установка</a>.</li><li><a href="https://tproger.ru/#import">Импорт и просмотр изображения</a>.</li><li><a href="https://tproger.ru/#crop">Обрезка</a>.</li><li><a href="https://tproger.ru/#size">Изменение размера</a>.</li><li><a href="https://tproger.ru/#rotate">Поворот</a>.</li><li><a href="https://tproger.ru/#grey">Градация серого и порог</a>.</li><li><a href="https://tproger.ru/#antialiasing">Размытие/сглаживание</a>.</li><li><a href="https://tproger.ru/#rectangle">Рисование прямоугольников</a>.</li><li><a href="https://tproger.ru/#lines">Рисование линий</a>.</li><li><a href="https://tproger.ru/#text">Текст на изображении</a>.</li><li><a href="https://tproger.ru/#faces">Распознавание лиц</a>.</li><li><a href="https://tproger.ru/#contours">Contours — распознавание объектов</a>.</li><li><a href="https://tproger.ru/#save">Сохранение изображения</a>.</li></ol><h2>Импорт и просмотр изображения</h2><p>Примечание При чтении способом выше изображение находится в цветовом пространстве не RGB (как все привыкли), а BGR. Возможно, в начале это не так важно, но как только вы начнёте работать с цветом — стоит знать об этой особенности. Есть 2 пути решения:</p><ol><li>Поменять местами 1-й канал (R — красный) с 3-м каналом (B — синий), и тогда красный цвет будет (0,0,255), а не (255,0,0).</li><li>Поменять цветовое пространство на RGB:rgb_image = cv2.cvtColor(image, cv2.COLOR_BGR2RGB)И тогда в коде работать уже не с image, а с rgb_image.</li></ol><p>Примечание Чтобы закрыть окно, в котором отображается изображение, нажмите любую клавишу. Если использовать кнопку закрытия окна, можно наткнуться на подвисания.</p><p>На протяжении статьи для вывода изображений будет использоваться следующий код:</p><h2>Кадрирование</h2><figure><img src="https://media.tproger.ru/uploads/2019/04/1_JOqAtM92uNHBxJ9uRAyKtg.jpeg" alt="Исходное изображение для кадрирования" /></figure><figure><img src="https://media.tproger.ru/uploads/2019/04/1_UuTiqdGQFfvA78djIPwVYA.jpeg" alt="Результат кадрирования изображения" /></figure><p>Где image[10:500, 500:2000] — это image[y:y + высота, x:x + ширина].</p><h2>Изменение размера</h2><figure><img src="https://media.tproger.ru/uploads/2019/04/1_AJjT80DpN93YUWTUkOBOJQ.jpeg" alt="Исходное изображение до изменения размера" /></figure><figure><img src="https://media.tproger.ru/uploads/2019/04/1_YJzoBwWOtJhkksl3Mpv61w.jpeg" alt="Результат уменьшения изображения" /></figure><p>Эта функция учитывает соотношение сторон оригинального изображения. Другие функции изменения размера изображений можно увидеть <a href="https://www.tutorialkart.com/opencv/python/opencv-python-resize-image/">здесь</a>.</p><h2>Поворот</h2><figure><img src="https://media.tproger.ru/uploads/2019/04/1_SVkI8I5XHs18gfS3jrL4Cw.jpeg" alt="Исходное изображение до поворота" /></figure><figure><img src="https://media.tproger.ru/uploads/2019/04/1_j2pCsTfv_bF1ZAys8IQTLA.jpeg" alt="Результат поворота изображения на 180 градусов" /></figure><p>image.shape возвращает высоту, ширину и каналы. M — матрица поворота — поворачивает изображение на 180 градусов вокруг центра. -ve — это угол поворота изображения по часовой стрелке, а +ve, соответственно, против часовой.</p><h2>Перевод в градации серого и в чёрно-белое изображение по порогу</h2><figure><img src="https://media.tproger.ru/uploads/2019/04/1_TRn-JK8tlKBCUSgkooKVpg.jpeg" alt="Исходное цветное изображение" /></figure><figure><img src="https://media.tproger.ru/uploads/2019/04/1_lVHmCqfGqT0Fx5DIJnaRzQ.jpeg" alt="Изображение в градациях серого" /></figure><figure><img src="https://media.tproger.ru/uploads/2019/04/1_4p1SghdBZucSg5R2dZvn1Q.jpeg" alt="Чёрно-белое изображение по порогу" /></figure><p>gray_image — это одноканальная версия изображения.</p><p>Функция threshold возвращает изображение, в котором все пиксели, которые темнее (меньше) 127 заменены на 0, а все, которые ярче (больше) 127, — на 255.</p><p>Для ясности другой пример:</p><p>Здесь всё, что темнее, чем 150, заменяется на 10, а всё, что ярче, — на 200.</p><p>Остальные threshold-функции описаны <a href="https://docs.opencv.org/3.4/d7/d4d/tutorial_py_thresholding.html">здесь</a>.</p><h2>Размытие/сглаживание</h2><figure><img src="https://media.tproger.ru/uploads/2019/04/1_Rny9ak-Taj58otF4ao9uFA.jpeg" alt="Исходное изображение до размытия" /></figure><figure><img src="https://media.tproger.ru/uploads/2019/04/1_WhEeegXBhcAllIRDN4TTvA.jpeg" alt="Результат размытия по Гауссу" /></figure><p>Функция GaussianBlur (размытие по Гауссу) принимает 3 параметра:</p><ol><li>Исходное изображение.</li><li>Кортеж из 2 положительных нечётных чисел. Чем больше числа, тем больше сила сглаживания.</li><li>sigmaX и sigmaY. Если эти параметры оставить равными 0, то их значение будет рассчитано автоматически.</li></ol><p>Больше про размытие <a href="https://docs.opencv.org/3.1.0/d4/d13/tutorial_py_filtering.html">здесь</a>.</p><h2>Рисование прямоугольников</h2><figure><img src="https://media.tproger.ru/uploads/2019/04/1_rr0RN5b8cxseYUwABRdlKw.jpeg" alt="Исходное изображение для рисования прямоугольника" /></figure><figure><img src="https://media.tproger.ru/uploads/2019/04/1_uMd8BQyqdDhpH-gR8F3tbg.jpeg" alt="Изображение с нарисованным прямоугольником" /></figure><p>Эта функция принимает 5 параметров:</p><ol><li>Само изображение.</li><li>Координата верхнего левого угла (x1, y1).</li><li>Координата нижнего правого угла (x2, y2).</li><li>Цвет прямоугольника (GBR/RGB в зависимости от выбранной цветовой модели).</li><li>Толщина линии прямоугольника.</li></ol><h2>Рисование линий</h2><figure><img src="https://media.tproger.ru/uploads/2019/04/1_NdAq3JTqU8nLZWjbaGfjPg.jpeg" alt="Исходное изображение для рисования линии" /></figure><figure><img src="https://media.tproger.ru/uploads/2019/04/1_H1r2tUmUN3V15ps5ynwJHQ.jpeg" alt="Изображение с нарисованной линией" /></figure><p>Функция line принимает 5 параметров:</p><ol><li>Само изображение, на котором рисуется линия.</li><li>Координата первой точки (x1, y1).</li><li>Координата второй точки (x2, y2).</li><li>Цвет линии (GBR/RGB в зависимости от выбранной цветовой модели).</li><li>Толщина линии.</li></ol><h2>Текст на изображении</h2><figure><img src="https://media.tproger.ru/uploads/2019/04/1_crsVfLMtv1SNBMlqXyFfYg.jpeg" alt="Исходное изображение для добавления текста" /></figure><figure><img src="https://media.tproger.ru/uploads/2019/04/1_lTizoTFVbhkx2PdDVEi9WQ.jpeg" alt="Изображение с наложенным текстом" /></figure><p>Функция putText принимает 7 параметров:</p><ol><li>Непосредственно изображение.</li><li>Текст для изображения.</li><li>Координата нижнего левого угла начала текста (x, y).</li><li>Используемый шрифт.</li><li>Размер шрифта.</li><li>Цвет текста (GBR/RGB в зависимости от выбранной цветовой модели).</li><li>Толщина линий букв.</li></ol><h2>Распознавание лиц</h2><p>На этот раз без пёсиков.</p><figure><img src="https://media.tproger.ru/uploads/2019/04/1_nevvkOrzz97jJ3cB8PiQiQ.jpeg" alt="Фотография с людьми для распознавания лиц" /></figure><figure><img src="https://media.tproger.ru/uploads/2019/04/1_IUvY3sxQ_j7qErv8Wr1xtg.jpeg" alt="Результат распознавания лиц на фотографии" /></figure><p>detectMultiScale — общая функция для распознавания как лиц, так и объектов. Чтобы функция искала именно лица, мы передаём ей соответствующий каскад.</p><p>Функция detectMultiScale принимает 4 параметра:</p><ol><li>Обрабатываемое изображение в градации серого.</li><li>Параметр scaleFactor. Некоторые лица могут быть больше других, поскольку находятся ближе, чем остальные. Этот параметр компенсирует перспективу.</li><li>Алгоритм распознавания использует скользящее окно во время распознавания объектов. Параметр minNeighbors определяет количество объектов вокруг лица. То есть чем больше значение этого параметра, тем больше аналогичных объектов необходимо алгоритму, чтобы он определил текущий объект, как лицо. Слишком маленькое значение увеличит количество ложных срабатываний, а слишком большое сделает алгоритм более требовательным.</li><li>minSize — непосредственно размер этих областей.</li></ol><h2>Contours — распознавание объектов</h2><p>Распознавание объектов производится с помощью цветовой <a href="https://www.fritz.ai/features/image-segmentation.html">сегментации изображения</a>. Для этого есть две функции: cv2.findContours и cv2.drawContours.</p><p>В <a href="https://towardsdatascience.com/object-detection-via-color-based-image-segmentation-using-python-e9b7c72f0e11">этой статье</a> детально описано обнаружение объектов с помощью цветовой сегментации. Всё, что вам нужно для неё, находится там.</p><h2>Сохранение изображения</h2><h2>Заключение</h2><p>OpenCV — отличная библиотека с лёгкими алгоритмами, которые могут использоваться в 3D-рендере, продвинутом редактировании изображений и видео, отслеживании и идентификации объектов и людей на видео, поиске идентичных изображений из набора и для много-много чего ещё.</p><p>Эта библиотека очень важна для тех, кто разрабатывает проекты, связанные с машинным обучением в области изображений.</p><h2>Часто задаваемые вопросы</h2><p><b>Что такое OpenCV и для чего она используется?</b></p><p>OpenCV (Open Source Computer Vision Library) — это библиотека компьютерного зрения с открытым исходным кодом, содержащая более 2500 алгоритмов. Она используется для обработки изображений, распознавания лиц и объектов, работы с видеопотоком, 3D-рендеринга и задач машинного обучения.</p><p><b>Как установить OpenCV для Python?</b></p><p>Установить OpenCV можно через pip командой pip install opencv-python. Для расширенной версии с дополнительными модулями используйте pip install opencv-contrib-python.</p><p><b>Почему OpenCV читает изображения в BGR, а не в RGB?</b></p><p>Это связано с историческими причинами: формат BGR был популярен на ранних этапах развития библиотеки. Для преобразования в привычный RGB используйте функцию cv2.cvtColor(image, cv2.COLOR_BGR2RGB).</p><p><b>Какие основные операции с изображениями поддерживает OpenCV?</b></p><p>OpenCV поддерживает чтение, запись, кадрирование, изменение размера, поворот, перевод в градации серого, размытие, рисование графических примитивов (прямоугольники, линии), наложение текста, распознавание лиц и контуров объектов.</p>]]></content:encoded>
    </item>
    <item>
      <title>В Яндекс.Облаке появился сервис Yandex Vision с моделями компьютерного зрения</title>
      <link>https://tproger.ru/news/yandex-cloud-vision</link>
      <comments>https://tproger.ru/news/yandex-cloud-vision?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/yandex-cloud-vision</guid>
      <description><![CDATA[<p>Yandex Vision распознаёт текст на изображениях на 40 языках, обнаруживает лица без идентификации и классифицирует пользовательский контент.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/yandex-cloud-vision">В Яндекс.Облаке появился сервис Yandex Vision с моделями компьютерного зрения</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Яндекс]]></category>
      <category><![CDATA[Облачные технологии]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 22 Apr 2019 11:49:05 GMT</pubDate>
      <content:encoded><![CDATA[<p>В Яндекс.Облаке пополнение: компания запустила <a href="https://cloud.yandex.ru/services/vision">сервис Yandex Vision</a> с технологиями компьютерного зрения. Сервис умеет распознавать текст (40 языков), обнаруживать лица на фото (но не идентифицировать) и классифицировать пользовательский контент.</p><p>Для классификации есть две модели. Одна распределяет изображения по группам в зависимости от его разрешения, а вторая помогает их модерировать. К примеру, может помечать фото с водяными знаками, шокирующим контентом или контентом 18+.</p><p>По словам разработчиков, для работы с Yandex Vision можно использовать REST API или gRPC API.</p><p>Компания указала цену только за услугу распознавания текста, потому что функции обнаружения лиц и классификации пока находятся на стадии preview. Тысяча успешных анализов изображений в месяц стоит 120 рублей.</p>]]></content:encoded>
    </item>
    <item>
      <title>Подборка JS-фреймворков для работы с компьютерным зрением</title>
      <link>https://tproger.ru/translations/computer-vision-js-frameworks</link>
      <comments>https://tproger.ru/translations/computer-vision-js-frameworks?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Klara Oswald]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/translations/computer-vision-js-frameworks</guid>
      <description><![CDATA[<p>TensorFlow.js и другие JavaScript-фреймворки на базе машинного обучения, с помощью которых решают задачи компьютерного зрения в вебе и Node.js.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/translations/computer-vision-js-frameworks">Подборка JS-фреймворков для работы с компьютерным зрением</a>»</p>]]></description>
      <category><![CDATA[JavaScript]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Переводы]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sat, 30 Mar 2019 08:21:08 GMT</pubDate>
      <content:encoded><![CDATA[<p>Компьютерное зрение стало широко распространённой темой, позволяющей создавать множество великолепных сервисов. В этой статье вы познакомитесь с некоторыми JS-фреймворками для работы с компьютерным зрением.</p><h2>TensorFlow.js</h2><p>Будучи одним из крупнейших фреймворков машинного обучения, <a href="https://www.tensorflow.org/js">TensorFlow</a> также позволяет создавать Node.js- и frontend-приложения. Ниже приведена одна из демонстраций, где показано сопоставление позы с коллекцией изображений. TensorFlow также имеет <a href="https://playground.tensorflow.org/#activation=tanh&amp;batchSize=10&amp;dataset=circle&amp;regDataset=reg-plane&amp;learningRate=0.03&amp;regularizationRate=0&amp;noise=0&amp;networkShape=4,2&amp;seed=0.27185&amp;showTestData=false&amp;discretize=false&amp;percTrainData=50&amp;x=true&amp;y=true&amp;xTimesY=false&amp;xSquared=false&amp;ySquared=false&amp;cosX=false&amp;sinX=false&amp;cosY=false&amp;sinY=false&amp;collectStats=false&amp;problem=classification&amp;initZero=false&amp;hideText=false">песочницу</a>, позволяющую лучше визуализировать искусственные нейронные сети, которые могут быть полезны в образовательных целях.</p><figure><img src="https://media.tproger.ru/uploads/2019/03/1_OxCzsFsG0Ih92fAgUgXOkA.gif" alt="" /></figure><h2>Amazon Rekognition</h2><p><a href="https://aws.amazon.com/ru/rekognition/?sc_channel=PS&amp;sc_campaign=acquisition_US&amp;sc_publisher=google&amp;sc_medium=ACQ-P%7CPS-GO%7CBrand%7CDesktop%7CSU%7CMachine%20Learning%7CRekognition%7CUS%7CEN%7CText&amp;sc_content=aws_recognition_software_e&amp;sc_detail=amazon%20rekognition&amp;sc_category=Machine%20Learning&amp;sc_segment=293645376368&amp;sc_matchtype=e&amp;sc_country=US&amp;s_kwcid=AL!4422!3!293645376368!e!!g!!amazon%20rekognition&amp;ef_id=EAIaIQobChMIwLzV1obx4AIVEK6WCh3MZAPREAAYASAAEgJlv_D_BwE:G:s">Amazon Rekognition</a> — это мощный облачный инструмент. Кроме того, Amazon также предоставляет различные SDK для JavaScript в браузерах. SDK можно найти <a href="https://aws.amazon.com/ru/sdk-for-browser/">здесь</a>. Изображение ниже иллюстрирует, насколько детальным может быть распознавание лиц.</p><figure><img src="https://media.tproger.ru/uploads/2019/03/0_uXRPu25xSI_86KUw.jpg" alt="" /></figure><h2>OpenCV.js</h2><p><a href="https://opencv.org/">OpenCV</a> является одним из старейших фреймворков компьютерного зрения и уже давно служит разработчикам в этой области. У них также есть <a href="https://docs.opencv.org/3.4/d5/d10/tutorial_js_root.html">JavaScript-версия</a>, позволяющая разработчикам реализовать эти функции на веб-сайте.</p><figure><img src="https://media.tproger.ru/uploads/2019/03/0_yO3YblHAL2Lfse4c.png" alt="" /></figure><h2>tracking.js</h2><p>Если вы собираетесь создать приложение исключительно для быстрого обнаружения лиц, например как в веб-версии фильтров Snapchat, вам стоит взглянуть на <a href="https://trackingjs.com/">tracking.js</a>. Этот фреймворк позволяет интегрировать распознавание лиц на JavaScript с довольно простой настройкой. На основе этого фреймворка даже есть <a href="https://medium.freecodecamp.org/how-to-drop-leprechaun-hats-into-your-website-with-computer-vision-b0d115a0f1ad">руководство</a> для написания приложения ко Дню Всех Святых, которое распознаёт людей на изображениях и надевает им на голову шляпу лепрекона.</p><figure><img src="https://media.tproger.ru/uploads/2019/03/1_8LiniTo6QWkgKmZ2TXARyg.jpg" alt="" /></figure><h2>WebGazer.js</h2><p>Пытаетесь ли вы проводить испытания качества UX-дизайна или создать новые интерактивные системы для игры или веб-сайта, <a href="https://webgazer.cs.brown.edu/">WebGazer.js</a> станет хорошим инструментом для любых начинаний. Этот фреймворк позволяет приложениям узнавать, куда смотрит человек, с помощью входных данных с камеры.</p><figure><img src="https://media.tproger.ru/uploads/2019/03/0_oTFAajskNxKCU3JG.jpg" alt="" /></figure><h2>three.ar.js</h2><p>Ещё один фреймворк от Google, <a href="https://github.com/google-ar/three.ar.js?files=1">three.ar.js</a>, расширяет функциональные возможности <a href="https://developers.google.com/ar/">ARCore</a> для frontend JavaScript. Это позволяет интегрировать обнаружение поверхностей и объектов в браузеры, что является идеальным инструментом для AR-игр.</p><figure><img src="https://media.tproger.ru/uploads/2019/03/1_z9Iv2W7CjWXCj2fkY0V6QA-1.gif" alt="" /></figure><h2>В заключение</h2><p>Рассмотренные фреймворки — это отличная платформа для дальнейшего развития компьютерного зрения. Создавайте с их помощью свои проекты и получайте удовольствие от разработки.</p><p>Если вы только начинаете интересоваться темой компьютерного зрения вам может быть полезен следующий курс.</p>]]></content:encoded>
    </item>
    <item>
      <title>Нейросеть научилась анимировать людей на изображениях</title>
      <link>https://tproger.ru/news/3d-character-animation</link>
      <comments>https://tproger.ru/news/3d-character-animation?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/3d-character-animation</guid>
      <description><![CDATA[<p>Алгоритм исследователей Вашингтонского университета и Facebook по одному снимку строит трёхмерную модель, которая садится, прыгает и бегает.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/3d-character-animation">Нейросеть научилась анимировать людей на изображениях</a>»</p>]]></description>
      <category><![CDATA[Алгоритмы и структуры данных]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 11 Dec 2018 13:04:33 GMT</pubDate>
      <content:encoded><![CDATA[<p>Исследователи из Вашингтонского университета совместно с разработчиками из Facebook <a href="https://arxiv.org/abs/1812.02246">создали</a> алгоритм, который «оживляет» людей на фотографиях. По единственному снимку он генерирует трёхмерную движущуюся модель фигуры, которая может садиться, прыгать, бегать и даже «выходить» за пределы изображения. Алгоритм работает также для рисунков и персонажей аниме.</p><h2>Работа алгоритма</h2><p>Для создания такой технологии исследователи воспользовались наработками коллег.</p><ul><li>Нейросеть <a href="https://github.com/matterport/Mask_RCNN">Mask R-CNN</a> распознаёт на изображении фигуру человека и выделяет её из фона.</li><li><a href="https://www.cv-foundation.org/openaccess/content_cvpr_2016/html/Wei_Convolutional_Pose_Machines_CVPR_2016_paper.html">Другой алгоритм</a> накладывает на фигуру упрощённую разметку скелета, определяя то, как она будет двигаться.</li><li><a href="https://dl.acm.org/citation.cfm?id=1531330">Третий алгоритм</a> «заполняет» пространство фона, ранее скрытое фигурой.</li></ul><p>Далее собственный алгоритм исследователей на основе размеченной двумерной фигуры создаёт трёхмерную модель и по исходному изображению генерирует уровень текстуры.</p><p>Разработчики добавили пользовательский интерфейс, который позволяет менять позу фигуры, чтобы отредактировать саму фотографию или определить, с чего начнётся анимация. Кроме того, можно «оживить» рисунок или фотографию в дополненной реальности и увидеть объёмную фигуру в VR- или AR-очках.</p><p>Похожую технологию <a href="https://tproger.ru/news/generative-query-network-release/">представили</a> исследователи из DeepMind. Их алгоритм способен построить трёхмерную модель объекта по нескольким изображениям, что позволяет по фотографиям воссоздавать в виртуальной реальности объёмные сцены.</p>]]></content:encoded>
    </item>
    <item>
      <title>Google научила нейросеть VON создавать реалистичные 3D-модели</title>
      <link>https://tproger.ru/news/google-von-introducing</link>
      <comments>https://tproger.ru/news/google-von-introducing?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Никита Нельсон]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/google-von-introducing</guid>
      <description><![CDATA[<p>Система VON разбивает модель на форму, ракурс и текстуру и строит трёхмерные объекты с реалистичным освещением и отражениями.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/google-von-introducing">Google научила нейросеть VON создавать реалистичные 3D-модели</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 05 Dec 2018 07:44:25 GMT</pubDate>
      <content:encoded><![CDATA[<p>Исследователи из Google и MIT CSAIL (Лаборатории Компьютерных Наук и Искусственного Интеллекта) <a href="http://papers.nips.cc/paper/7297-visual-object-networks-image-generation-with-disentangled-3d-representations.pdf">представили</a> на конференции NeurIPS 2018 в Монреале нейронную сеть, способную создавать 3D-модели с реалистичным освещением и отражениями. Система VON (Visual Object Networks) позволяет редактировать форму и текстуру объекта, менять ракурс и выполнять другие действия, доступные в работе с 3D-моделями.</p><h3>Принцип работы VON</h3><p>Нейросеть разбивает генерируемую модель на три фактора: форму, ракурс и текстуру. Затем она тренируется создавать трёхмерные объекты и вычисляет эскизы «2.5D» — совокупность силуэта объекта моделирования и карты его глубины.</p><p>Поскольку эти факторы условно независимы, модель не требует дублирования данных между двумерными изображениями и трёхмерными формами. Это позволило обучать VON на коллекциях Pix3D, изображениях Google и ShapeNet.</p><figure><img src="https://media.tproger.ru/uploads/2018/12/Snimok.jpg" alt="" /></figure><p>Чтобы научить VON создавать форму объекта самостоятельно, исследователи задействовали генеративно-состязательную сеть (GAN), обученную на ShapeNet. За создание текстур отвечает другая сеть на базе GAN.</p><h3>Оценка нейросети</h3><p>Для оценки модели генерации изображения разработчики определили <a href="https://ru.wikipedia.org/wiki/%D0%A0%D0%B0%D1%81%D1%81%D1%82%D0%BE%D1%8F%D0%BD%D0%B8%D0%B5_%D0%A4%D1%80%D0%B5%D1%88%D0%B5">расстояние Фреше</a> для сгенерированных объектов. Они представили около 200 пар изображений и моделей, созданных нейросетью, на сервисе <a href="https://www.mturk.com/">Mechanical Turk</a> от Amazon. Пятеро опрашиваемых должны были выбрать наиболее реалистичную модель. VON имела самое низкое начальное расстояние Фреше из всех моделей ИИ, и опрашиваемые выбрали её изображения в 74–85 % случаев.</p><p>В июне 2018 года команда разработчиков <a href="https://tproger.ru/news/headon-human-imitation/">рассказала</a> о проекте HeadOn — технологии, которая «считывает» выражение лица, движение глаз, позу человека в реальном времени и на основе этой информации воссоздаёт его реалистичную объёмную модель.</p>]]></content:encoded>
    </item>
    <item>
      <title>Вышла новая версия библиотеки компьютерного зрения OpenCV 4.0.0 для языка C++</title>
      <link>https://tproger.ru/news/opencv-4-0-0-for-c-plusplus</link>
      <comments>https://tproger.ru/news/opencv-4-0-0-for-c-plusplus?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Артем Гаврилов]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/opencv-4-0-0-for-c-plusplus</guid>
      <description><![CDATA[<p>Версия 4.0.0 библиотеки компьютерного зрения OpenCV реализована на C++, требует компилятора C++11, получила Graph API и лишилась части старого C-API.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/opencv-4-0-0-for-c-plusplus">Вышла новая версия библиотеки компьютерного зрения OpenCV 4.0.0 для языка C++</a>»</p>]]></description>
      <category><![CDATA[C++]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 19 Nov 2018 19:49:07 GMT</pubDate>
      <content:encoded><![CDATA[<p>Разработчики библиотеки компьютерного зрения OpenCV <a href="https://github.com/opencv/opencv/wiki/ChangeLog#version400">сообщили</a> о выходе новой версии и реализации на языке C++. Обновление подразумевает использование компилятора для C++11. Также в этой версии добавлена поддержка <a href="https://github.com/opencv/opencv/wiki/Graph-API">Graph API</a>.</p><h3>Изменения в версии OpenCV 4.0.0</h3><p>Разработчики рассказали об удалении части API для языка C, присутствовавших с версии OpenCV 1.x. Среди них модули определения объектов, фото- и видеомодуль, модуль кодировщиков изображений, модуль чтения видео с камеры и записи его в файл, а также модуль калибровки камеры. Другие изменения коснулись:</p><ul><li>Хранения данных. Хранение и загрузка данных в файлы XML, YAML и JSON в основном модуле реализованы на C++ и несовместимы с API языка C. Поддержка кодирования файлов стандарта base64 реализована только для файлов XML и YAML.</li><li>Модуля для работы с нейросетями DNN. После обновления он поддерживает архитектуру <a href="https://arxiv.org/abs/1703.06870">Mask-RCNN</a>, частично нейросеть <a href="https://pjreddie.com/darknet/yolo/">YOLO</a>. Также добавлен экспериментальный бекэнд <a href="https://github.com/opencv/opencv/pull/12703">Vulkan</a>, который необходим для вычислений, не работающих с <a href="https://ru.wikipedia.org/wiki/OpenCL">OpenCL</a>.</li><li>Производительности. Оптимизированы алгоритмы обработки изображений на языке C++. По словам разработчиков, прирост скорости может составить от 15 до 30 %.</li><li>Детектора и декодера QR-кодов. Их добавили в модуль opencv/objdetect вместе с <a href="https://github.com/opencv/opencv/blob/master/samples/cpp/qrcode.cpp">примером</a>.</li></ul><p>Несмотря на обновления библиотек компьютерного зрения, эта область сталкивается с рутинными проблемами. Чтобы решить одну из них, команда Google AI <a href="https://tproger.ru/news/fluid-annotation-interface/">разработала</a> основанный на машинном обучении интерфейс, который сокращает время разметки объектов на фотографиях в три раза. Разработчики представили его в конце октября 2018 года и уверены, что он поможет быстрее создавать большие корпуса изображений для систем компьютерного зрения.</p>]]></content:encoded>
    </item>
    <item>
      <title>Google AI представила Fluid Annotation, «умный» интерфейс для разметки изображений</title>
      <link>https://tproger.ru/news/fluid-annotation-interface</link>
      <comments>https://tproger.ru/news/fluid-annotation-interface?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/fluid-annotation-interface</guid>
      <description><![CDATA[<p>Интерфейс Google AI сокращает время разметки объектов на фотографиях втрое и помогает быстрее создавать наборы данных для компьютерного зрения.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/fluid-annotation-interface">Google AI представила Fluid Annotation, «умный» интерфейс для разметки изображений</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 23 Oct 2018 11:56:06 GMT</pubDate>
      <content:encoded><![CDATA[<p>Команда Google AI <a href="https://ai.googleblog.com/2018/10/fluid-annotation-exploratory-machine.html">разработала</a> основанный на машинном обучении интерфейс, который сокращает время разметки объектов на фотографиях в три раза. Это позволит быстрее создавать большие корпуса изображений для систем компьютерного зрения. Разработчики создали демонстрационную веб-версию интерфейса, где каждый пользователь может попробовать очертить границы объектов на нескольких фотографиях.</p><h3>Проблема ручной разметки</h3><p>Системы компьютерного зрения учатся распознавать объекты на изображениях, где эти объекты уже очерчены и подписаны. Разметка одной фотографии для набора <a href="http://cocodataset.org/#home">COCO</a>+<a href="https://github.com/nightrome/cocostuff">Stuff</a> занимает у человека около 19 минут, а всего датасета — 53 тысячи часов. Это налагает серьёзные ограничения на развитие распознающих моделей.</p><h3>Подробнее о Fluid Annotation</h3><p>В первую очередь нейросеть с архитектурой <a href="https://arxiv.org/abs/1703.06870">Mask-RCNN</a> разбивает изображение на сегменты по грубым контурам объектов. Их получается больше тысячи, и каждому присваивается название и оценка доверия. Человек начинает работать с сегментами, получившими наиболее высокую оценку, после чего может:</p><ul><li>изменять подписи сегментов с помощью выпадающего меню;</li><li>добавлять сегменты для объектов, которые модель не смогла распознать;</li><li>удалять существующие сегменты;</li><li>изменять карту глубины для сегментов, перекрывающих друг друга.</li></ul><figure><img src="https://media.tproger.ru/uploads/2018/10/image3-2.jpg" alt="" /></figure><p>Команда Google AI представит посвящённую Fluid Annotation <a href="https://arxiv.org/abs/1806.07527">статью</a> 25 октября 2018 года на ACM Multimedia Conference 2018 в секции <a href="http://www.acmmm.org/2018/brave-new-ideas-2/">Brave New Ideas</a>.</p><p>Помимо проблемы аннотации изображений, исследователи в области машинного обучения решают вопрос наполнения датасетов. Качество распознавания объекта зависит от того, насколько часто интеллектуальная система «встречала» его во время обучения. Летом 2018 года команда Google AI <a href="https://tproger.ru/news/autoaugment-algorithm/">представила</a> алгоритм, который генерирует уникальные изображения на основе существующих: с помощью обрезки, изменения цвета или отражения. Это позволяет увеличить размер датасета, не затрачивая время и силы на поиск новых изображений.</p>]]></content:encoded>
    </item>
    <item>
      <title>Исследователи обнаружили, что нейронные сети не могут распознавать оптические иллюзии</title>
      <link>https://tproger.ru/news/neural-networks-illusions</link>
      <comments>https://tproger.ru/news/neural-networks-illusions?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Никита Нельсон]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/neural-networks-illusions</guid>
      <description><![CDATA[<p>Учёные Луисвиллского университета Роберт Уильямс и Роман Ямпольский выяснили, что машинам трудно уловить принципы воздействия иллюзий на сознание человека.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/neural-networks-illusions">Исследователи обнаружили, что нейронные сети не могут распознавать оптические иллюзии</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 12 Oct 2018 20:38:31 GMT</pubDate>
      <content:encoded><![CDATA[<p>В последнее время машинное обучение зашло далеко вперёд: нейронные сети научились понимать содержание картинок, определять человеческие лица, даже создавать подобные изображения. Поэтому, казалось бы, заставить машины идентифицировать и создавать оптические иллюзии может быть так же просто.</p><p>С этим вопросом <a href="https://www.technologyreview.com/s/612261/neural-networks-dont-understand-what-optical-illusions-are/">столкнулись</a> учёные из Луисвиллского университета Роберт Уильямс и Роман Ямпольский. Они <a href="https://arxiv.org/abs/1810.00415">попытались научить</a> нейронные сети распознавать и генерировать иллюзии, но это оказалось гораздо сложнее, чем предполагалось.</p><h3>Почему это сложно?</h3><p>Глубокое обучение нейронных сетей базируется на двух основных факторах: мощные машины с надлежащим программным обеспечением и огромные базы данных, на которых учатся нейронные сети. Чтобы научить компьютер распознавать на картинке лицо, потребуется база данных, содержащая более десяти тысяч изображений с чётко обозначенными лицами. По ним нейронная сеть определит наиболее характерные черты, к примеру, два глаза, нос и рот. Картинок же со статическими иллюзиями несколько тысяч, а уникальных иллюзий, вероятно, всего лишь несколько десятков.</p><h3>Первые попытки</h3><p>Уильямс и Ямпольский попробовали научить нейронную сеть распознавать оптические иллюзии по тому же принципу. Первостепенной проблемой стало отсутствие баз данных с оптическими иллюзиями для обучения. Тем не менее, учёным удалось собрать базу данных из более чем 6000 таких изображений, а затем создать <a href="https://ru.wikipedia.org/wiki/%D0%93%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%82%D0%B8%D0%B2%D0%BD%D0%BE-%D1%81%D0%BE%D1%81%D1%82%D1%8F%D0%B7%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D0%B5%D1%82%D1%8C">генеративно-состязательную сеть</a> для формирования иллюзий.</p><p>Но эксперимент провалился: после 7 часов обучения на видеокарте NVIDIA Tesla K80 учёные так и не получили желаемого результата. Они считают, что основная проблема кроется в коренном различии человеческого и компьютерного зрения. Нейронные сети пока не способны понять принципы, по которым составляются оптические иллюзии.</p><p>В сентябре 2018 года команда учёных из Брауновского университета (США) тоже <a href="https://tproger.ru/news/optical-illusions-neural-network/">провела</a> свой эксперимент с оптическими иллюзиями и нейросетью. Исследователи представили нейронную сеть, чьё восприятие изображения ограничено физиологией зрительной коры головного мозга приматов.</p>]]></content:encoded>
    </item>
    <item>
      <title>Athena Security научила камеры видеонаблюдения распознавать оружие</title>
      <link>https://tproger.ru/news/athena-security-camera-system</link>
      <comments>https://tproger.ru/news/athena-security-camera-system?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Никита Нельсон]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/athena-security-camera-system</guid>
      <description><![CDATA[<p>Система определяет оружие в кадре с точностью 99 % и автоматически вызывает полицию; её уже используют в школе в штате Пенсильвания.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/athena-security-camera-system">Athena Security научила камеры видеонаблюдения распознавать оружие</a>»</p>]]></description>
      <category><![CDATA[Безопасность]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sat, 29 Sep 2018 07:35:14 GMT</pubDate>
      <content:encoded><![CDATA[<p>Американская компания Athena Security <a href="https://www.digitaltrends.com/cool-tech/ai-camera-spots-guns-in-video/">разработала</a> систему видеонаблюдения, способную с точностью в 99 % идентифицировать оружие. Технологию будут использовать для автоматического оповещения правоохранительных органов, что должно снизить количество жертв в криминогенных ситуациях. Разработку уже используют в католической высшей школе архиепископа Вуд в Варминстере, штат Пенсильвания.</p><h3>Принцип действия системы Athena Security Camera</h3><p>Технология использует алгоритмы компьютерного зрения и методы измерения скорости объекта, а также ядро <a href="https://ru.wikipedia.org/wiki/CUDA">CUDA</a> и суперкомпьютер <a href="https://www.nvidia.ru/object/nvidia-dgx-1-20160405-ru.html">DGX-1</a> от NVIDIA.</p><p>При реальном нападении система вызовет полицию уже через несколько минут после того, как оружие окажется в кадре. Преступник получит оповещение, что его личность установлена. В лучшем случае это «спугнет» нападающего ещё до того, как он откроет огонь. В худшем — система оперативно вызовет полицию и скорую помощь.</p><p>Технология устанавливается на уже используемые камеры видеонаблюдения подключением их IP-адресов к облачной системе Athena. Если камеры ещё не установлены, компания может предоставить их как часть своего пакета.</p><p>Разработчики планируют научить систему выявлять на изображении с камеры такие опасные инциденты, как драки или нападения. Также разработка может быть подключена к другим технологиям безопасности. Например, для контроля автоматической остановки лифта или блокировки дверей безопасности в критических ситуациях.</p><p>Тем не менее, Athena Security Camera System — не первая разработка в этой сфере. К примеру, в июне 2018 года учёные из Индии и Великобритании <a href="https://tproger.ru/news/eye-in-the-sky-release/">разработали</a> технологию распознавания дронами драк и поножовщины.</p>]]></content:encoded>
    </item>
    <item>
      <title>Создана нейросеть, которая поддается оптическим иллюзиям подобно человеку</title>
      <link>https://tproger.ru/news/optical-illusions-neural-network</link>
      <comments>https://tproger.ru/news/optical-illusions-neural-network?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/optical-illusions-neural-network</guid>
      <description><![CDATA[<p>Учёные Брауновского университета построили рекуррентную сеть, ограниченную физиологией зрительной коры приматов, чтобы лучше понять человеческое зрение.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/optical-illusions-neural-network">Создана нейросеть, которая поддается оптическим иллюзиям подобно человеку</a>»</p>]]></description>
      <category><![CDATA[Алгоритмы и структуры данных]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 24 Sep 2018 16:44:48 GMT</pubDate>
      <content:encoded><![CDATA[<p>Команда ученых из Брауновского университета (США) <a href="https://news.brown.edu/articles/2018/09/illusions">представила</a> рекуррентную нейронную сеть, чье «восприятие» изображений ограничено физиологией зрительной коры головного мозга приматов. Наблюдая за тем, как эта модель принимает решения, исследователи рассчитывают лучше понять человеческое зрение и улучшить компьютерное.</p><h2>Горизонтальная обратная связь</h2><p>Ученые сосредоточились на контекстно-зависимых иллюзиях, связанных с изменением восприятия одних цветов вблизи других. Яркий пример тому — <a href="https://ru.wikipedia.org/wiki/%D0%98%D0%BB%D0%BB%D1%8E%D0%B7%D0%B8%D1%8F_%D1%81_%D1%82%D0%B5%D0%BD%D1%8C%D1%8E_%D0%BD%D0%B0_%D1%88%D0%B0%D1%85%D0%BC%D0%B0%D1%82%D0%BD%D0%BE%D0%B9_%D0%B4%D0%BE%D1%81%D0%BA%D0%B5">иллюзия с тенью на шахматной доске</a>, представленная в 1995 году:</p><figure><img src="https://media.tproger.ru/uploads/2018/09/2018-09-24.-opticheskie-illjuzii.png" alt="" /></figure><p>По замыслу, нейросеть должна выявить, как в таком случае соседние нейроны в зрительной коре взаимодействуют между собой и совмещают полученные данные.</p><p>В модель ученые добавили соединения обратной связи между нейронами, которых в большинстве алгоритмов глубокого обучения нет — только обратная связь между слоями. Эти соединения могут повышать или понижать значимость ответов, полученных от соседних нейронов одного слоя.</p><p>«Настроив» горизонтальные соединения, ученые получили нейросеть, которая реагирует на контекстно-зависимые оптические иллюзии подобно человеку.</p><p>Исследователи отметили, что современные системы компьютерного зрения зачастую не способны распознавать контекст изображения. Поэтому их удается обмануть разными трюками: <a href="https://tproger.ru/news/uoft-against-facial-recognition/">коррекцией отдельных пикселей</a>, <a href="https://tproger.ru/news/network-fooled-by-color/">изменением цвета</a> фотографии, игрой с <a href="https://tproger.ru/news/mit-fooled-google-ai/">текстурой и искажениями</a>. Команда Брауновского университета полагает, что добавление соединений обратной связи между нейронами поможет это исправить.</p>]]></content:encoded>
    </item>
    <item>
      <title>DeepMind создала алгоритм на нейросетях для диагностики глазных болезней</title>
      <link>https://tproger.ru/news/deepmind-eye-hospital</link>
      <comments>https://tproger.ru/news/deepmind-eye-hospital?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Наташа Маркова]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/deepmind-eye-hospital</guid>
      <description><![CDATA[<p>Система DeepMind по снимку оптической когерентной томографии сетчатки определяет до 50 заболеваний глаз, разработка велась с Moorfields Eye Hospital.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/deepmind-eye-hospital">DeepMind создала алгоритм на нейросетях для диагностики глазных болезней</a>»</p>]]></description>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Tue, 14 Aug 2018 10:59:43 GMT</pubDate>
      <content:encoded><![CDATA[<p>Британская компания DeepMind <a href="https://deepmind.com/blog/moorfields-major-milestone/">представила</a> систему, которая по снимку оптической когерентной томографии (ОКТ) сетчатки определяет до 50 заболеваний глаз.</p><h3>Принцип работы</h3><p>Система была разработана совместно с медицинским центром Moorfields Eye Hospital — его врачи ежедневно делают более тысячи снимков ОКТ. У специалистов уходит много времени на обработку даже одного — иногда это приводит к тому, что болезнь прогрессирует и вызывает необратимые изменения в зрительных органах.</p><figure><img src="https://media.tproger.ru/uploads/2018/08/OCTscan.jpg" alt="" /></figure><p>Алгоритм <a href="https://www.theverge.com/2018/8/13/17670156/deepmind-ai-eye-disease-doctor-moorfields">обучали</a> на наборе из 15 тысяч снимков от 7,5 тысяч пациентов, сопровождаемых диагнозами врачей. Главное отличие разработки DeepMind от аналогичных состоит в том, что система отражает, каким образом пришла к тем или иным выводам. Кроме того, она работает с любым типом снимков — это позволит использовать ее в любом медицинском центре.</p><h3>Развитие</h3><p>Сейчас алгоритм проходит клинические испытания в Moorfields Eye Hospital. По мнению его создателей, они могут занять 3−5 лет. В случае успешных результатов систему будут использовать еще 30 медицинских центров и клиник по всей стране.</p><p>В феврале 2018 года ученые из Google и дочерней медицинской компании Verily <a href="https://tproger.ru/news/google-ai-eye-scan/">открыли</a> новый метод, который предсказывает болезни сердца с помощью машинного обучения. На основании сканирования сетчатки система выдает точные данные пациента: возраст, кровяное давление, пагубные привычки.</p>]]></content:encoded>
    </item>
    <item>
      <title>Эксперты разработали приложение для тестирования ИИ на Android-смартфонах</title>
      <link>https://tproger.ru/news/ai-benchmark-android</link>
      <comments>https://tproger.ru/news/ai-benchmark-android?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Юлия Губкина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/ai-benchmark-android</guid>
      <description><![CDATA[<p>Специалисты из Швейцарской высшей технической школы Цюриха выпустили приложение, оценивающее производительность смартфонов в задачах ИИ.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/ai-benchmark-android">Эксперты разработали приложение для тестирования ИИ на Android-смартфонах</a>»</p>]]></description>
      <category><![CDATA[Android]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 26 Jul 2018 19:34:46 GMT</pubDate>
      <content:encoded><![CDATA[<p>Специалисты в области компьютерного зрения из Швейцарской высшей технической школы Цюриха <a href="http://ai-benchmark.com">создали</a> приложение, оценивающее производительность смартфонов для работы с искусственным интеллектом.</p><p>Результаты проверки пригодятся исследователям ИИ, производителям комплектующих и разработчикам Android. Благодаря полученной информации они смогут узнать и исправить недостатки устройств, чтобы улучшить эффективность их работы с ИИ.</p><p>AI Benchmark можно <a href="https://play.google.com/store/apps/details?id=org.benchmark.demo">скачать</a> в Google Play и запустить на любом смартфоне с Android 4.1 и выше. Приложение тестирует материнскую плату, процессор и оперативную память, после чего выдает число, означающее эффективность ИИ на данном устройстве.</p><h3>Текущие результаты</h3><p>При тестировании AI Benchmark оценивает способность смартфона редактировать изображения в высоком разрешении, распознавать объекты на фотографиях и классифицировать их. Кроме того, система тестирует алгоритмы, используемые в автопилоте для автомобилей.</p><p>Резюмируя результаты, представленные на сайте проекта, исследователи <a href="https://techcrunch.com/2018/07/25/computer-vision-researchers-build-an-ai-benchmark-app-for-android-phones/">пришли</a> к следующим выводам:</p><ul><li>Qualcomm — теоретически может дать хорошие результаты, но не хватает драйверов;</li><li>Huawei — довольно выдающиеся результаты;</li><li>Samsung — нет поддержки ускорения, но мощные процессоры;</li><li>Mediatek — хорошие результаты для устройств среднего класса.</li></ul><p>Итоговый рейтинг смартфонов и их аппаратных платформ представлен ниже:</p><figure><img src="https://media.tproger.ru/uploads/2018/07/1-3-1.jpg" alt="" /></figure><h3>Причины создания</h3><p>Один из создателей AI Benchmark Андрей Игнатов рассказал, что приложение разрабатывалось около трех месяцев. Идея его создания возникла из-за отсутствия информации об ограничениях использования современных ИИ на смартфонах. Это связано с тем, что в настоящее время все алгоритмы работают удаленно на серверах, а не на устройстве, кроме некоторых предустановленных приложений.</p><p>Специалисты уверены, что в будущем технологии ИИ будут не менее важны, чем хорошая камера в смартфоне, поэтому хотят активно поучаствовать в развитии данной сферы.</p><p>В июне 2018 года Google <a href="https://tproger.ru/news/google-ai-principles/">опубликовала</a> семь принципов использования искусственного интеллекта. Компания запретила использовать его для создания оружия, слежения за людьми и нарушения их прав.</p>]]></content:encoded>
    </item>
    <item>
      <title>Google представила хранилище Open Images V4 с размеченными объектами для систем компьютерного зрения</title>
      <link>https://tproger.ru/news/open-images-v4-release</link>
      <comments>https://tproger.ru/news/open-images-v4-release?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Екатерина Никитина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/open-images-v4-release</guid>
      <description><![CDATA[<p>Открытая библиотека Google содержит 9 млн изображений и 14,6 миллиона контуров объектов в 600 категориях, в среднем по 8,4 объекта на картинку.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/open-images-v4-release">Google представила хранилище Open Images V4 с размеченными объектами для систем компьютерного зрения</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sun, 06 May 2018 09:34:40 GMT</pubDate>
      <content:encoded><![CDATA[<p>В своем блоге Google <a href="https://research.googleblog.com/2018/04/announcing-open-images-v4-and-eccv-2018.html">рассказала</a> о большой открытой библиотеке <a href="https://storage.googleapis.com/openimages/web/index.html">Open Images V4</a>, содержащей 9 млн изображений с очерченными границами объектов и метками к ним. 14,6 миллионов контуров предметов разделены на 600 категорий. В среднем на каждом изображении находится 8,4 объектов.</p><h3>Структура Open Images V4</h3><p>Хранилище <a href="https://storage.googleapis.com/openimages/web/factsfigures.html">содержит</a> обучающий набор из 9 млн изображений, а также валидационный (41,6 тыс.) и тестовый (125,4 тыс.). На всех картинках проставлены метки и прямоугольные границы объектов. Метки из последних двух наборов (и часть из обучающего) прошли верификацию. В основном, проверку проводили специалисты из команды Google, но небольшую долю работы выполнили краудсорсеры из Image Labeler.</p><h3>Open Images Challenge</h3><p>Компания также объявила об <a href="https://storage.googleapis.com/openimages/web/challenge.html">Open Images Challenge</a> — новом конкурсе среди моделей распознавания, который пройдет на конференции <a href="https://eccv2018.org/">ECCV 2018</a> в сентябре. Системы распознавания должны брать за основу Open Images V4 и выполнять одну из двух задач:</p><ol><li>Определение класса объекта — предсказание жесткого прямоугольного контура для всех экземпляров из 500 классов.</li><li>Определение визуальных связей — обнаружение связанных пар объектов, к примеру, «женщина, играющая на гитаре».</li></ol><p>Для тех, кто хочет самостоятельно опробовать на практике возможности систем распознавания, Google разработала DIY-наборы (Do It Yourself). В апреле 2018 года компания <a href="https://tproger.ru/news/google-updated-aiy-projects/">выпустила</a> усовершенствованные «коробки» Vision Kit и Voice Kit с упрощенной настройкой и новым «железом».</p>]]></content:encoded>
    </item>
    <item>
      <title>Google запустила инициативу по улучшению технологий компьютерного зрения на мобильных устройствах</title>
      <link>https://tproger.ru/news/google-announces-ovic</link>
      <comments>https://tproger.ru/news/google-announces-ovic?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Тимур Кондратьев]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/google-announces-ovic</guid>
      <description><![CDATA[<p>Конкурс OVIC от Google предлагает единую оценку задержки для распознавания объектов в реальном времени и открыт мобильным разработчикам.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/google-announces-ovic">Google запустила инициативу по улучшению технологий компьютерного зрения на мобильных устройствах</a>»</p>]]></description>
      <category><![CDATA[Мобильная разработка]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sun, 22 Apr 2018 06:42:24 GMT</pubDate>
      <content:encoded><![CDATA[<p>В рамках конференции <a href="http://cvpr2018.thecvf.com/">CVPR2018</a> Google анонсировала конкурс разработок в области технологий <a href="https://tproger.ru/translations/neural-network-zoo-2/">глубинных сетей</a> и <a href="https://tproger.ru/articles/introduction-into-machine-vision-technology/">компьютерного зрения</a> на смартфонах (OVIC). Созданная в сотрудничестве с университетом Северной Каролины и университетом Пердью, данная инициатива призвана сделать передовые технологии компании по распознаванию изображений в реальном времени открытыми для всех мобильных разработчиков. Исследования в рамках конкурса нацелены на уменьшение задержки при работе приложений и повышение пользовательского опыта.</p><h3>Стандартизированная метрика</h3><p>OVIC ориентируется на создание единой системы измерений задержек для точных и эффективных операций на устройствах. Она определяется как количество правильных классификаций изображения за среднее время задержки в 33 мс. До OVIC было сложно реализовать такую метрику, так как исследователи полагались на такие приблизительные показатели, как количество операций <a href="https://ru.wikipedia.org/wiki/Умножение-сложение">умножение-сложение</a> (MAC). Загвоздка заключалась как раз в том, что накопление данных параметров является ресурсоемкой задачей для нейросети, а они сами по себе не показывают полной картины задержек из-за существования различных конфигураций моделей. На графике ниже видно, что устройства с одинаковыми показателями MAC могут иметь большую разницу в задержке, и наоборот:</p><p>Поэтому OVIC предлагает прямое снижение задержки вместо ограничения числа операций умножение-сложение как главного параметра.</p><h3>Доступная всем вычислительная платформа</h3><p>Ранее точное и корректное вычисление параметров задержки предполагало использование оборудования, доступного только крупным университетам и компаниям. В связи с этим OVIC предлагает платформу для вычислений, включающую компоненты, которые созданы специально для широкого применения исследовательским сообществом:</p><ul><li>TOCO-компилятор, оптимизирующий модели TensorFlow для эффективного вывода;</li><li>движок вывода TensorFlow Lite для развертки на мобильных устройствах;</li><li>SDK, оценивающий производительность на любом Android-устройстве;</li><li>инструмент для оценки задержек на некоторых телефонах Pixel от Google (доступен зарегистрированным участникам).</li></ul><p>С использованием этих инструментов у разработчиков пропадает необходимость оптимизировать ядра, докупать специальное измерительное оборудование или создавать фреймворки под заданные условия. Нужно только владеть опытом обучения систем компьютерного зрения с помощью TensorFlow.</p><p>Прием заявок на конкурс осуществляется до 15 июня 2018 года.</p><p>Развитию технологий машинного обучения и компьютерного зрения уделяется много внимания со стороны гигантов индустрии. Например, в середине апреля 2018 года Google <a href="https://tproger.ru/news/google-updated-aiy-projects/">обновила</a> свои DIY-наборы с камерами, оснащенными технологиями компьютерного зрения, которые призваны популяризировать развивающиеся технологии среди учащихся и разработчиков.</p>]]></content:encoded>
    </item>
    <item>
      <title>PornHub запустил алгоритм на базе ИИ для проставления тематических тегов порнофильмам</title>
      <link>https://tproger.ru/news/pornhub-ai-algorithm</link>
      <comments>https://tproger.ru/news/pornhub-ai-algorithm?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Максим Леонов]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/pornhub-ai-algorithm</guid>
      <description><![CDATA[<p>PornHub запустил ИИ для классфикации роликов. Он научился распознавать актеров и актрис, а также определять, к какой категории относится видео.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/pornhub-ai-algorithm">PornHub запустил алгоритм на базе ИИ для проставления тематических тегов порнофильмам</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 12 Oct 2017 16:41:04 GMT</pubDate>
      <content:encoded><![CDATA[<p>Pornhub <a href="https://www.pornhub.com/press/show?id=1362">объявила</a> о запуске нового алгоритма на базе ИИ, который использует компьютерное зрение для автономного обнаружения и идентификации участников видео. Сейчас этим занимается команда модераторов.</p><p>Алгоритм был обучен опознавать больше 10 000 порнозвезд путем простого сканирования и распознавания кадров. PornHub сообщает, что ИИ-алгоритм обучали на тысячах видеороликов и официальных фотографий исполнителей.</p><figure><img src="https://media.tproger.ru/uploads/2017/10/AI-2.png" alt="" /></figure><p>Чтобы ограничить допустимую погрешность, сайт для взрослых просит пользователей проверить, верны ли теги и метки, проставленные ИИ. Для этого пользователи могут либо выставлять положительную или отрицательную оценку описанию видео в зависимости от его точности.</p><p>Вице-президент PornHub Кори Прайс отметил:</p><blockquote>Теперь пользователи смогут искать ролики с участием любимых актрис с большей точностью. Наш алгоритм сыграет большую роль и в будущем, учитывая, что ежедневно на ресурс загружают более 10 тысяч роликов. В течение лишь прошлого месяца, в процессе бета-тестирования алгоритма, он просканировал и разметил более 50 тысяч порнороликов.</blockquote><p>Кроме того, ИИ сможет определять не только участников ролика, но и его категорию. Например, если действие видео происходит в общественном месте, то ИИ добавит его в категорию «Public», а ролики с участием блондинок — в категорию «Blonde».</p><p>Компания планирует обработать весь свой пятимиллионный каталог видео при помощи своего алгоритма в течение следующего года, чтобы облегчить пользователям поиск роликов, которые наиболее точно соответствуют их желаниям.</p><p>По словам представителя PornHub, на сайте уже используется алгоритм ContentID, аналогичный тому, что работает на YouTube. Он автоматически блокирует видео, нарушающие авторские права. Новый ИИ в будущем могут использовать для удаления дубликатов роликов.</p><p>У изобретательных исследователей и ранее возникала мысль об использовании компьютерного зрения для описания порнороликов. Весной один разработчик использовал сервисы Microsoft для создания бота, который днями напролёт смотрел и классифицировал фильмы для взрослых.</p>]]></content:encoded>
    </item>
    <item>
      <title>Курс «Введение в компьютерное зрение»</title>
      <link>https://tproger.ru/video/computer-vision</link>
      <comments>https://tproger.ru/video/computer-vision?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Дмитрий Баранчук]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/video/computer-vision</guid>
      <description><![CDATA[<p>Курс при поддержке Microsoft Research знакомит с основами компьютерного зрения, практическими алгоритмами и связью с обработкой зрительной информации в мозге.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/video/computer-vision">Курс «Введение в компьютерное зрение»</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Обучающие курсы]]></category>
      <category><![CDATA[Видео]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sun, 08 Oct 2017 00:13:22 GMT</pubDate>
      <content:encoded><![CDATA[<p>Русскоязычный курс, рассматривающий как базовые понятия компьютерного зрения, так и ряд современных алгоритмов, позволяющих решать практические задачи. Отдельно отмечается связь методов компьютерного зрения с обработкой зрительной информации в мозгу человека. Курс подготовлен при поддержке Microsoft Research.</p><p>Программа курса:</p><ol><li>Понятия и история компьютерного зрения. Свет и цвет.</li><li>Простые методы распознавания изображений.</li><li>Основы обработки изображений.</li><li>Классификация изображений и введение в машинное обучение.</li><li>Выделение объектов на изображении.</li><li>Сверточные нейросети и «глубинное обучение».</li><li>Поиск изображений по содержанию и большие коллекции.</li><li>Распознавание лиц людей.</li></ol><p>Смотрите еще больше новостей и обучающих материалов по компьютерному зрению.</p>]]></content:encoded>
    </item>
    <item>
      <title>Астрономы стали активно использовать нейронные сети для сокращения времени обработки данных</title>
      <link>https://tproger.ru/news/ai-for-astronomy</link>
      <comments>https://tproger.ru/news/ai-for-astronomy?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Вячеслав Шарунов]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/ai-for-astronomy</guid>
      <description><![CDATA[<p>Нейросеть SLAC обучили на более чем 500 тысячах смоделированных изображений, чтобы анализировать гравитационные линзы за доли секунды.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/ai-for-astronomy">Астрономы стали активно использовать нейронные сети для сокращения времени обработки данных</a>»</p>]]></description>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 01 Sep 2017 13:41:13 GMT</pubDate>
      <content:encoded><![CDATA[<p>Гравитационная линза — массивное космическое тело (планета, звезда, галактика, тёмная материя), способное своим гравитационным полем менять направление распространения электромагнитного излучения фонового объекта. Подобный феномен помог учёным открыть экзопланеты, понять эволюцию вселенной, увидеть сверхъяркие галактики и достичь других успехов.</p><figure><img src="https://media.tproger.ru/uploads/2017/09/Einstein_Ring_gravity_lens.jpg" alt="" /></figure><p>Однако анализ полученных при помощи гравитационных линз изображений занимает большой объём времени, заставляя исследователей сравнивать полученные результаты с смоделированными в лабораториях. Данный процесс может длиться недели и месяцы.</p><p>Сотрудники <a href="https://ru.wikipedia.org/wiki/Национальная_ускорительная_лаборатория_SLAC">национальной ускорительной лаборатории SLAC</a> <a href="https://www6.slac.stanford.edu/news/2017-08-30-artificial-intelligence-analyzes-gravitational-lenses-10-million-times-faster.aspx">нашли</a> выход из сложившейся ситуации. Они обучили нейронную сеть более чем на 500 тысячах смоделированных изображений. После этого она смогла за доли секунды сопоставить информацию с изображений с точностью, близкой к традиционным методам.</p><p>Сотрудники проекта SLAC Фил Маршал и Яшар Хезавех поражаются мощности нейронных сетей:</p><blockquote>Удивительно, как нейронные сети самостоятельно понимают, какие вещи им нужно искать. Это как обучение ребёнка. Ты не говоришь ему, что такое собака, ты лишь показываешь ему её изображения. Но нейронные сети не только выбирают изображения собак из кучи фотографий, они ещё и сообщают всю информацию о них — возраст, вес, породу.</blockquote><p>С появлением новых телескопов, способных обнаружить еще больше примеров гравитационного линзирования, необходимость в быстрых методах классификации будет только расти. Самое важное для учёных — то, что машинное обучение работает достаточно быстро даже на мобильном телефоне.</p>]]></content:encoded>
    </item>
    <item>
      <title>Google опубликовала результаты своего игрового эксперимента Quick, Draw!</title>
      <link>https://tproger.ru/news/google-quick-draw-data-released</link>
      <comments>https://tproger.ru/news/google-quick-draw-data-released?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Дмитрий Юрченко]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/google-quick-draw-data-released</guid>
      <description><![CDATA[<p>Эксперимент Google Quick, Draw! собрал рисунки 15 миллионов человек: лягушки у них похожи, а драконы и автопортреты заметно различаются.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/google-quick-draw-data-released">Google опубликовала результаты своего игрового эксперимента Quick, Draw!</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sat, 20 May 2017 15:14:25 GMT</pubDate>
      <content:encoded><![CDATA[<p>Еще в ноябре Google <a href="https://tproger.ru/news/test-google-ai-tech-online/">запустила</a> сайт, позволяющий «поиграться» с разработками компании в области искусственного интеллекта с помощью веб-приложений. Одним из них была <a href="https://quickdraw.withgoogle.com">Quick, Draw!</a> — игра, которая угадывает, что вы рисуете. В конечном итоге она <a href="https://tproger.ru/news/google-auto-draw/">превратилась</a> в инструмент, который на замену вашим наброскам предлагает варианты в виде аккуратного клип-арта.</p><p>На этой неделе Google <a href="https://quickdraw.withgoogle.com/data">опубликовала</a> данные, полученные от Quick, Draw!, чтобы показать вам, как 15 миллионов человек рисуют одни и те же объекты. Очень интересно посмотреть на то, как люди интерпретируют случайный предмет, от обезьян до парашютов и телефонов.</p><p>Посмотрите, например, на лягушку.</p><figure><img src="https://media.tproger.ru/uploads/2017/05/1-2.gif" alt="" /></figure><p>Более абстрактные рисунки, такие как йога, оказались очень интересными.</p><figure><img src="https://media.tproger.ru/uploads/2017/05/2-1.gif" alt="" /></figure><p>Большинство следующих рисунков были интерпретированы как автопортреты. У некоторых лиц были длинные волосы, у некоторых были большие глаза, у некоторых были очки, а у других просто смайлики.</p><figure><img src="https://media.tproger.ru/uploads/2017/05/3-1.gif" alt="" /></figure><p>Драконы — один из самых интересных наборов. Если большинство людей видят лягушку одинаково, то дракона — по-разному: от огнедышащего до рогатого.</p><figure><img src="https://media.tproger.ru/uploads/2017/05/4-1.gif" alt="" /></figure><p>Все полученные в ходе эксперимента данные теперь могут быть использованы сторонними разработчиками при создании собственных систем компьютерного зрения — Google <a href="https://github.com/googlecreativelab/quickdraw-dataset">выложила</a> их в открытый доступ.</p>]]></content:encoded>
    </item>
    <item>
      <title>Пишем веб-приложение для распознавания лиц за час</title>
      <link>https://tproger.ru/translations/face-recognition-app-in-an-hour</link>
      <comments>https://tproger.ru/translations/face-recognition-app-in-an-hour?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Дмитрий Юрченко]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/translations/face-recognition-app-in-an-hour</guid>
      <description><![CDATA[<p>Amazon Rekognition распознаёт лица и объекты на фотографиях; пример получает снимки с веб-камеры iMac и выполняет распознавание через AWS API.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/translations/face-recognition-app-in-an-hour">Пишем веб-приложение для распознавания лиц за час</a>»</p>]]></description>
      <category><![CDATA[JavaScript]]></category>
      <category><![CDATA[Веб-разработка]]></category>
      <category><![CDATA[Ruby]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Распознавание]]></category>
      <category><![CDATA[DIY]]></category>
      <category><![CDATA[Переводы]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Thu, 04 May 2017 13:33:03 GMT</pubDate>
      <content:encoded><![CDATA[<p>Рассказывает Деван Сабаратнам, разработчик с 30-летним стажем</p><p>В минувшие выходные, пролистывая Amazon Web Services, я заметил новый сервис под названием <a href="https://aws.amazon.com/ru/rekognition/">«Rekognition»</a>. Я предположил, что это опечатка (recognition — англ. распознавание), но она привлекла мое внимание. Я заинтересовался: что это за сервис? Amazon привык добавлять новые сервисы в свою платформу с пугающей регулярностью, и этот я пропустил.</p><p>Я узнал, что в конце 2016 года Amazon выпустила свой собственный сервис для распознавания изображений на базе глубокого обучения на их платформе. Он может распознавать не только лица, но и объекты на фото. Так как сервис довольно новый, подробностей о нём было немного, но мне захотелось немедленно попробовать его. В общем, в течение часа я написал пример веб-страницы, которая может получать фотографии с моей веб-камеры и выполнять элементарное распознавания лица на нем.</p><p>Прим. перев.  Чтобы не теряться в многочисленных сервисах Amazon, советуем вам прочитать <a href="https://tproger.ru/translations/aws-in-plain-russian/">нашу шпаргалку</a> по AWS.</p><p>Раньше я занимался технологией распознавания лиц, используя сторонние библиотеки, а также <a href="https://www.microsoft.com/cognitive-services/en-us/face-api">Microsoft Face API</a>, но все попытки создания подобного приложения не увенчались успехом. Но, просматривая документацию «Rekognition», я понял, что AWS API на самом деле очень прост в использовании. Я немедленно принялся за работу.</p><h2>Цель</h2><p>Мне была нужна простая веб-страница, которая позволила бы делать фотографию с помощью камеры моего iMac и выполнять распознавание на фотографии. В частности, я хотел бы определять пользователя, сидящего перед компьютером.</p><p>Сервис Amazon Rekognition позволяет создавать одну или несколько коллекций. Коллекция — это набор лицевых векторов для фотографий, которые вы хотите сохранить.</p><blockquote>Примечание: Сервис сохраняет не фотографии, а их JSON-представление.</blockquote><p>После создания коллекции вы можете сфотографировать предмет, сравнить его свойства c сохранёнными и вернуть ближайшее соответствие. Звучит просто, не так ли? По правде говоря, разработка фронтенда веб-страницы для получения данных с камеры заняла больше времени, чем написание бэкенда для распознавания.</p><p>В общем, веб-страница позволяет создавать или удалять коллекцию лицевых данных на Amazon, загружать новые данные, полученные из фотографии, в свою коллекцию и сравнивать новые фотографии с существующей коллекцией, чтобы найти совпадение. А в качестве дополнительной фичи я также добавил в эту демку службу <a href="https://aws.amazon.com/ru/polly/">Amazon Polly</a>, чтобы после распознавания фотографии страница приветствовала пользователя.</p><figure><img src="https://media.tproger.ru/uploads/2017/04/1.png" alt="" /></figure><h3>Фронтенд</h3><p>Я не знал, какую библиотеку использовать для захвата изображения с помощью камеры iMac. В итоге я нашел на GitHub библиотеку <a href="https://github.com/amw/jpeg_camera">JPEG Camera</a>, которая позволяет использовать HTML5 Canvas или Flash для съёмки фото. Я решил использовать её и настроил под себя написанный на JavaScript образец.</p><h3>Бэкенд</h3><p>Для бэкенда я использовал Ruby-библиотеку <a href="http://www.sinatrarb.com">Sinatra</a>, которая может выполнять всю тяжёлую работу с помощью AWS. Я часто использовал Sinatra (на самом деле <a href="http://padrinorb.com">Padrino</a>) в своих проектах и настоятельно рекомендую эту платформу.</p><blockquote>Примечание: Amazon Rekognition предлагает сначала загружать исходные фотографии, которые использует его API, в Amazon S3, а затем обрабатывать их. Я хотел избежать этого ненужного шага и вместо этого отправлять изображения непосредственно в API, что мне в итоге удалось сделать.</blockquote><p>Я сумел сделать то же самое с их приветствием Polly . Вместо того, чтобы сохранять аудио в MP3-файл и проигрывать его, у меня получилось закодировать данные MP3 непосредственно в тег &lt;audio&gt; на странице и воспроизвести их оттуда.</p><h3>Код</h3><p>Я разместил весь код этого проекта на <a href="https://github.com/CyberFerret/FaceRekognition-Demo">моей странице</a> на GitHub. Не стесняйтесь использовать и изменять его. Ниже я постараюсь объяснить код более подробно.</p><h2>Пишем приложение</h2><p>Прежде всего, вам понадобится учетная запись <a href="https://aws.amazon.com/ru/">Amazon AWS</a>. Я не буду вдаваться в подробности, поскольку это несложно, а в случае затруднений можно легко найти информацию в Интернете.</p><h3>Создание пользователя AWS IAM</h3><p>Как только вы создали учетную запись AWS, первое, что нам нужно сделать, — создать пользователя Amazon IAM (Identity &amp; Access Management), который имеет права на использование службы Rekognition. Мы также зададим права для Amazon Polly.</p><p>В консоли Amazon нажмите на кнопку «Сервисы» в верхнем левом углу, затем выберите «IAM». В меню слева выберите «Пользователи». Вы должны увидеть список существующих пользователей IAM, которых вы создали в консоли, если вы делали это в прошлом.</p><figure><img src="https://media.tproger.ru/uploads/2017/04/2.png" alt="" /></figure><p>Нажмите кнопку «Добавить пользователя», расположенную в верхней части списка, чтобы добавить нового пользователя IAM.</p><figure><img src="https://media.tproger.ru/uploads/2017/04/3.png" alt="" /></figure><p>Дайте пользователю имя и убедитесь, что вы отметили пункт «Programmatic Access», так как вы будете использовать этот IAM в вызове API.</p><figure><img src="https://media.tproger.ru/uploads/2017/04/4.png" alt="" /></figure><p>Далее приведены настройки разрешений. Убедитесь, что вы щелкаете по третьему квадратику на экране с надписью «Attach existing policies directly». Затем в поле поиска «Filter: Policy Type» введите «rekognition». Выберите «AmazonRekognitionFullAccess» из списка, поставив рядом с ним галочку.</p><p>Затем измените фильтр поиска на «polly» и поместите галочку рядом с «AmazonPollyFullAccess».</p><p>Теперь у этого IAM есть права, достаточные для Amazon Rekognition и Amazon Polly. Нажмите «Next: Review» в правом нижнем углу.</p><figure><img src="https://media.tproger.ru/uploads/2017/04/5.png" alt="" /></figure><p>На странице просмотра вы должны увидеть 2 политики использования, дающие вам полный доступ к Rekognition и Polly. Если вы их не видите, вернитесь и повторите предыдущий шаг. Затем нажмите кнопку «Создать пользователя» в правом нижнем углу.</p><figure><img src="https://media.tproger.ru/uploads/2017/04/6.png" alt="" /></figure><p>Эта страница важна. Запишите ключи AWS Key и AWS Secret, которые вы указали на этой странице, поскольку нам необходимо включить их в наше приложение ниже.</p><p>Это единственный раз, когда вам будут показаны эти ключи, поэтому сохраните их и файл CSV с этой страницы в надёжном месте.</p><h3>Загрузка кода</h3><p>Теперь загрузите пример кода с <a href="https://github.com/CyberFerret/FaceRekognition-Demo">моей страницы GitHub</a>, чтобы вы могли изменить его по мере необходимости. Загрузите код в виде ZIP-файла, либо склонируйте его в вашу рабочую папку.</p><p>Первое, что вам нужно сделать, — это создать файл с именем .env в рабочей папке и ввести эти две строки, заменив в них ключи Amazon IAM на свои:</p><p>Теперь, если у вас установлен Ruby (не Ruby on Rails), то для установки зависимостей запустите команду:</p><p>Для запуска приложения введите эту команду:</p><p>Она должна запустить веб-браузер на порте 4567, чтобы вы могли увидеть веб-страницу и начать тестирование:</p><h3>Использование приложения</h3><p>Сама веб-страница довольно проста. Вы должны увидеть потоковое изображение в верхней части экрана, которое представляет собой канал с вашей веб-камеры.</p><p>Сперва создайте коллекцию, щелкнув по ссылке в самом нижнем левом углу страницы. Это создаст пустую коллекцию на серверах Amazon для хранения ваших изображений. Обратите внимание: имя по умолчанию для этой коллекции — faceapp_test, но вы можете изменить его в коде faceapp.rb (строка 17).</p><p>Затем, чтобы начать добавление лиц в свою коллекцию, попросите нескольких людей сесть перед вашим компьютером или телефоном и убедиться, что их лицо находится только в рамке для фотографий (несколько лиц сделают сканирование неудачным). Когда всё будет готово, введите их имя в текстовое поле и нажмите кнопку «Добавить в коллекцию». Должно появиться сообщение о том, что данные о лице были добавлены в базу данных.</p><p>После того, как вы создали несколько лиц в своей базе данных, вы можете попросить случайного человека сесть перед камерой и нажать «Сравнить изображение». Если этот человек уже добавлен в коллекцию, на экране должно появиться его имя.</p><p>Обратите внимание, что обычный способ работы Amazon Rekognition заключается в том, чтобы загружать фотографию в Amazon S3 Bucket, а затем обрабатывать его оттуда, но я хотел обойти этот шаг и фактически отправить данные фотографии непосредственно в Rekognition как поток байтов, закодированный в Base64. К счастью, aws-sdk для Ruby позволяет использовать оба метода.</p><h3>Разбор кода</h3><p>Прежде всего, давайте взглянем на HTML-страницу:</p><p>Структура страницы проста: всего несколько блоков, кнопок и ссылок. Обратите внимание, что мы используем jQuery, а также Moment.js для настраиваемого приветствия. Следует обратить внимание на код faceapp.js, который выполняет все сложные задачи и ссылки на библиотеку камер JPEG.</p><p>Вы также можете заметить теги &lt;audio&gt; в нижней части файла — это аудио-приветствие, которое мы отправляем пользователю.</p><p>Теперь разберем JS-файл приложения:</p><p>Это настраивает библиотеку JPEG Camera, чтобы отображать канал на экране и обрабатывать загрузку изображений.</p><p>Функция add_to_collection() захватывает изображение с камеры, а затем выполняет запись в конечную точку /upload вместе с именем пользователя в качестве параметра. Функция проверяет, действительно ли вы ввели имя, которое нужно в качестве уникального идентификатора этих данных.</p><p>Функция загрузки проверяет вызов и выводит сообщение об успешном завершении или ошибке.</p><p>Функция compare_image() вызывается, когда вы нажимаете кнопку «Сравнить изображение». Она захватывает кадр из камеры и передает POST-данные в /compare. Эта конечная точка вернет либо ошибку, либо структуру JSON, содержащую id (имя) найденного лица, а также процент схожести.</p><p>Если лицо совпадёт с данными из коллекции, функция отправит имя найденного лица в /speech. Эта конечная точка вызывает службу Amazon Polly, чтобы преобразовать приветствие в файл MP3, который можно воспроизвести пользователю.</p><p>Служба Amazon Polly возвращает приветствие в виде бинарного потока MP3, поэтому мы берем этот поток ввода-вывода, шифруем его в формате Base64 и помещаем в качестве закодированной исходной ссылки в теги &lt;audio&gt; на нашей веб-странице. Затем мы можем вызвать .play() для воспроизведения MP3 через динамики пользователя с помощью HTML5 Web Audio API.</p><p>Прим. перев.  Вы можете узнать о Web Audio побольше, прочитав <a href="https://tproger.ru/translations/web-audio-intro/">нашу серию статей</a> по этой теме.</p><p>Наконец, в JS-файле приложения есть функция greetingTime(). Она решает, стоит ли говорить «доброе утро / день / вечер» в зависимости от времени суток пользователя.</p><p>Теперь взглянем на код Ruby:</p><p>Здесь задан блок настройки конфигурации аутентификации AWS и имени коллекции по умолчанию, которое мы будем использовать (вы можете его свободно менять).</p><p>Остальная часть кода — это конечные точки, которые Sinatra будет слушать. Он прослушивает GET в /, чтобы отобразить фактическую веб-страницу конечному пользователю, а также слушает вызовы POST к /upload, /compare и /speech, которым JS-файл отправляет данные. Только 3–4 строки кода для каждой из этих конечных точек фактически выполняют задачи распознавания лиц и речи. Подробнее о них можно узнать из <a href="https://docs.aws.amazon.com/sdkforruby/api/Aws/Rekognition/Client.html">документации AWS SDK</a>.</p>]]></content:encoded>
    </item>
    <item>
      <title>Cloud Vision API, инструмент для распознавания изображений от Google, оказалось легко обмануть</title>
      <link>https://tproger.ru/news/cloud-vision-api-deceived</link>
      <comments>https://tproger.ru/news/cloud-vision-api-deceived?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Иван Бирюков]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/cloud-vision-api-deceived</guid>
      <description><![CDATA[<p>Эксперты Вашингтонского университета добавляли к картинкам от 10 до 30 процентов шума и заставляли Cloud Vision API ошибаться в классификации.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/cloud-vision-api-deceived">Cloud Vision API, инструмент для распознавания изображений от Google, оказалось легко обмануть</a>»</p>]]></description>
      <category><![CDATA[API]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Распознавание]]></category>
      <category><![CDATA[Облачные технологии]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Fri, 21 Apr 2017 09:11:53 GMT</pubDate>
      <content:encoded><![CDATA[<p>Команда экспертов из Вашингтонского университета <a href="https://arxiv.org/pdf/1704.05051.pdf">обнаружила</a> способ обмануть Google Cloud Vision API, заставив его ошибочно классифицировать изображения.</p><h3>Что за Cloud Vision API?</h3><p>Google <a href="https://tproger.ru/news/google-cloud-vision-api/">выпустила</a> бета-версию этого инструмента год назад. Теперь можно отправить свои изображения в этот облачный сервис и получить информацию о том, что на них изображено. Доступны такие возможности, как распознавание объектов на изображении, обнаружение неприемлемого контента, анализ эмоциональной окраски изображений и извлечение текстовой информации.</p><h3>Так, а что с обманом?</h3><p>Исследователи выяснили, что «зашумление» изображений сбивает алгоритмы с толку. Уровень шума варьировался с 10 до 30 процентов, но этого оказалось достаточно.</p><figure><img src="https://media.tproger.ru/uploads/2017/04/Google-AI-Attack-1.jpg" alt="" /></figure><p>Процедура добавления шумов очень проста. При этом стоит отметить, что система поиска изображений Google также использует Vision API, поэтому она может выдавать неприемлемый контент, считая, что он удовлетворяет запросу пользователя.</p><h3>И можно ли это исправить?</h3><p>Да, инженерам Google не стоит паниковать из-за этого. Патч так же прост, как и сама атака. Достаточно всего лишь пропускать изображение через фильтр шумов перед началом классификации.</p><figure><img src="https://media.tproger.ru/uploads/2017/04/Google-AI-Attack-2.jpg" alt="" /></figure><p>Стоит отметить тот факт, что эта же команда совсем недавно <a href="https://tproger.ru/news/google-video-api-deceived/">смогла обмануть</a> и другой инструмент для распознавания от Google, <a href="https://tproger.ru/news/google-video-intelligence-api/">Video Intelligence API</a>. В видео они вставили изображение автомобиля Audi таким образом, чтобы оно появлялось каждые две секунды. Изменение не слишком заметно невооружённым глазом, так как картинка добавляется через каждые 50 кадров при частоте смены кадров, равной 25. Зато API думает, что видео не про животных, а про машины.</p><p>Кроме того, на этой неделе Google <a href="https://tproger.ru/news/google-cloud-speech-api/">выпустила</a> ещё один API для распознавания, на этот раз — речи.</p>]]></content:encoded>
    </item>
    <item>
      <title>Создан принципиально новый инструмент для блокировки рекламы на основе компьютерного зрения</title>
      <link>https://tproger.ru/news/new-ad-blocking-software</link>
      <comments>https://tproger.ru/news/new-ad-blocking-software?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Юлия Черкашина]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/new-ad-blocking-software</guid>
      <description><![CDATA[<p>Исследователи Принстонского и Стэнфордского университетов протестировали инструмент на 50 сайтах и смогли заблокировать даже объявления Facebook.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/new-ad-blocking-software">Создан принципиально новый инструмент для блокировки рекламы на основе компьютерного зрения</a>»</p>]]></description>
      <category><![CDATA[Интернет]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Sun, 16 Apr 2017 20:08:25 GMT</pubDate>
      <content:encoded><![CDATA[<p>Команда исследователей из Принстонского и Стэнфордского университетов <a href="http://randomwalker.info/publications/ad-blocking-framework-techniques.pdf">заново открыла</a> понятие блокировки рекламы. Она пытается положить конец гонке противостояний блокировщиков рекламы и самой рекламы. Они создали принципиально новый инструмент, используя компьютерное зрение. Он прошел тесты на 50 сайтах, и везде успешно. Данный инструмент может блокировать даже объявления Facebook, что ранее было невозможным.</p><figure><img src="https://media.tproger.ru/uploads/2017/04/1492202351411-12.jpeg" alt="" /></figure><p>Положения Федеральной торговой комиссии <a href="https://www.bloomberg.com/news/articles/2016-08-05/ftc-to-crack-down-on-paid-celebrity-posts-that-aren-t-clear-ads">требуют</a> четкой маркировки рекламных объявлений, чтобы человек мог их увидеть, что дало преимущество как для потребителей, так и для блокировщиков. Команда использовала несколько методов компьютерного зрения для обнаружения рекламы.</p><p>Хотя команда не придерживается этической позиции о том, следует ли вам использовать блокировщик рекламы или нет, она считает, что отношения рекламодателя, издателя и читателя должны коренным образом измениться. Она выпустила proof-of-concept инструмента для Chrome, но он не обладает полным функционалом:</p><blockquote>Чтобы не принимать сторону этики блокировки рекламы, мы намеренно остановились на инструменте обнаружения рекламы, но не её блокировки.</blockquote><h3>Как устроены блокировщики?</h3><p>Популярные инструменты блокировки рекламы, такие как Adblock Plus и uBlock Origin, обнаруживают код, используемый стандартными объявлениями, URL-адреса и код разметки, обычно используемые в объявлениях. Это означает, что рекламодатели и издатели могут просто изменить код, который они используют для показа рекламы, чтобы обойти их. Этот тип блокировки рекламы часто легко обнаруживается анти-блокировщиками рекламы, которые <a href="https://motherboard.vice.com/en_us/article/ad-blocker-blocking-websites-might-be-violating-european-privacy-laws">установлены</a> на сайтах более 50 популярных издателей. Наконец, традиционные блокировщики рекламы не могут блокировать адаптивные объявления, которые выглядят как обычный контент, поэтому ваши приложения не будут обнаруживать и блокировать рекламные сообщения в Facebook.</p><p>Новый блокировщик использует визуальное распознавание символов, методы проектирования и поиск контейнеров (блоков объявлений, которые обычно помещаются на странице), чтобы распознавать такие слова, как «Спонсорское» или «Закрыть объявление», которые должны появляться на каждом объявлении. Это позволяет обнаруживать и блокировать рекламные объявления Facebook.</p><p>Итак, у нас есть исследование, которое предвещает потенциальный конец гонки противостояний.</p>]]></content:encoded>
    </item>
    <item>
      <title>Выпущено Chrome-расширение для Facebook, отображающее список распознанных на фото объектов и активностей</title>
      <link>https://tproger.ru/news/chrome-extension-facebook</link>
      <comments>https://tproger.ru/news/chrome-extension-facebook?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Иван Бирюков]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/chrome-extension-facebook</guid>
      <description><![CDATA[<p>Facebook подставляет к загруженным фотографиям теги alt с ключевыми словами, а расширение для Chrome выводит список распознанных объектов и активностей.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/chrome-extension-facebook">Выпущено Chrome-расширение для Facebook, отображающее список распознанных на фото объектов и активностей</a>»</p>]]></description>
      <category><![CDATA[Интернет]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Распознавание]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 02 Jan 2017 10:47:04 GMT</pubDate>
      <content:encoded><![CDATA[<p>В апреле 2016 Facebook начала <a href="https://tproger.ru/news/facebook-takes-a-guess-at-whats-in-pictures/">автоматически добавлять</a> теги alt к загруженным изображениям, записывая туда ключевые слова на основе содержимого фотографии. Выглядит это так:</p><p>Распознавание изображений производится при помощи <a href="https://medium.com/@ageitgey/machine-learning-is-fun-part-3-deep-learning-and-convolutional-neural-networks-f40359318721#.luqjma59e">Deep ConvNet</a>, созданной <a href="https://research.fb.com/category/facebook-ai-research-fair/">командой FAIR</a>.</p><p>Это, конечно, повышает доступность для слепых пользователей, но также и предоставляет компании огромное количество вашей личной информации. Пользуясь полученными из фотографий данными, можно узнать о ваших интересах и предпочтениях. Разумеется, вся эта информация используется для выдачи таргетированной рекламы.</p><p>Чтобы вы могли чётко понять, какие метки ставит на ваших изображениях Facebook, вы можете установить это небольшое <a href="https://github.com/ageitgey/show-facebook-computer-vision-tags#show-facebook-computer-vision-tags-chrome-extension">расширение</a> для Chrome.</p><p>Вот инструкция по установке:</p><ol><li>Склонируйте этот репозиторий в локальную папку.</li><li>Откройте chrome://extensions в той папке или перейдите в Tools &gt; Extensions.</li><li>Включите Developer mode в правом верхнем углу.</li><li>Нажмите на кнопку Load unpacked extension....</li><li>Выберите нужную папку.</li><li>Зайдите на Facebook!</li></ol><p>Подробную информацию о расширении, а также инструкцию по его установке в Firefox можно найти в <a href="https://github.com/ageitgey/show-facebook-computer-vision-tags#show-facebook-computer-vision-tags-chrome-extension">репозитории</a>.</p>]]></content:encoded>
    </item>
    <item>
      <title>Точность распознавания объектов на фото искусственным интеллектом от Google достигла 94%</title>
      <link>https://tproger.ru/news/google-photo-recognition-ai</link>
      <comments>https://tproger.ru/news/google-photo-recognition-ai?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Иван Бирюков]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/google-photo-recognition-ai</guid>
      <description><![CDATA[<p>Система команды Google Brain распознаёт объекты на фото точнее прежнего: в 2014 году модель Inception V1 показывала результат 89,6%.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/google-photo-recognition-ai">Точность распознавания объектов на фото искусственным интеллектом от Google достигла 94%</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Google]]></category>
      <category><![CDATA[Искусственный интеллект]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Mon, 26 Sep 2016 20:25:56 GMT</pubDate>
      <content:encoded><![CDATA[<p>Многие из нас уже знакомы с ИИ от Google, задачей которого является распознавание объектов на фото. <a href="http://www.androidauthority.com/google-photos-sharing-improvements-717150/">Google Photos</a> использует его упрощённую версию, которая определяет на фотографиях кошек, собак, еду или конкретных людей. Однако поисковый гигант работает над кое-чем более серьёзным, и совсем недавно представил разработчикам свои наработки.</p><p><a href="https://research.googleblog.com/2016/09/show-and-tell-image-captioning-open.html">Google Research Blog</a> сообщает, что система распознавания изображений, над которой работает команда Google Brain, достигла точности 93,9%. В 2014 году был получен результат 89,6%, достигнутый с использованием модели Inception V1. Может показаться, что скачок невелик, но на самом деле он весьма существенен.</p><p>Изображение на миниатюре новости демонстрирует разницу между алгоритмами 2014 и 2016 годов. Система стала не только лучше распознавать объекты, но и описывать их. Ещё одним аспектом является то, что текущая модель, Inception V3, не только распознаёт объекты на фото, но и сопоставляет их.</p><figure><img src="https://media.tproger.ru/uploads/2016/09/2-1.jpg" alt="" /></figure><p>Эти результаты были получены путём ручного маркирования сотен тысяч фото и передачи полученных данных в TensorFlow. Алгоритм использует созданные людьми описания в подходящих ситуациях, но также самостоятельно генерирует новые.</p><p>Последняя модель TensorFlow была выложена совсем недавно, и скачать её можно <a href="https://web.archive.org/web/20170601115738/https://github.com/tensorflow/models/tree/master/im2txt">здесь</a>. Также можно ознакомиться и со <a href="http://arxiv.org/abs/1609.06647">статьёй от Google</a>, посвящённой техническим аспектам этого вопроса.</p>]]></content:encoded>
    </item>
    <item>
      <title>SegNet — «глаза» для автомобиля</title>
      <link>https://tproger.ru/news/segnet</link>
      <comments>https://tproger.ru/news/segnet?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Артём Артемьев]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/news/segnet</guid>
      <description><![CDATA[<p>Система Кембриджского университета различает 12 категорий объектов в реальном времени и работает без GPS, используя машинное обучение и трёхмерное зрение.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/news/segnet">SegNet — «глаза» для автомобиля</a>»</p>]]></description>
      <category><![CDATA[Машинное обучение]]></category>
      <category><![CDATA[Нейронные сети]]></category>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Новости]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 23 Dec 2015 10:13:11 GMT</pubDate>
      <content:encoded><![CDATA[<p>В Кембриджском университете создали систему SegNet, которая может «просматривать» дорогу и определять и отличать типы объектов на ней — дорожное покрытие, знаки, кусты, деревья, автомобили.</p><p>SegNet работает любое время суток, может учитывать различия в освещении и погоде и классифицировать 12 категорий объектов в реальном времени. Кроме того, она позволяет позиционировать себя с точностью до нескольких метров и градусов.</p><p>Основное преимущесто новой системы состоит в том, что она не использует GPS — только машинное обучение и трехмерное зрение. Пока что она работает не идеально, так что использования ее в автомобилях придется подождать. Зато в ближайшем будущем эта технология может найти применение в домашних роботах — например, роботах-пылесосах.</p>]]></content:encoded>
    </item>
    <item>
      <title>Машинное зрение. Введение</title>
      <link>https://tproger.ru/articles/introduction-into-machine-vision-technology</link>
      <comments>https://tproger.ru/articles/introduction-into-machine-vision-technology?scrollTo=tproger-comments</comments>
      <dc:creator><![CDATA[Типичный программист]]></dc:creator>
      <guid isPermaLink="true">https://tproger.ru/articles/introduction-into-machine-vision-technology</guid>
      <description><![CDATA[<p>Общая информация о машинном зрении с примером на видео: веб-камера находит лицо человека и определяет его положение в пространстве.</p><p>— Читать дальше «<a rel="follow" href="https://tproger.ru/articles/introduction-into-machine-vision-technology">Машинное зрение. Введение</a>»</p>]]></description>
      <category><![CDATA[Компьютерное зрение]]></category>
      <category><![CDATA[Статьи]]></category>
      <slash:comments>0</slash:comments>
      <pubDate>Wed, 01 Jul 2015 16:00:34 GMT</pubDate>
      <content:encoded><![CDATA[<p>Данный пост нашей рубрики будет посвящен общей информации по машинному зрению и его применению. В качестве интересного примера хочу вам продемонстрировать это видео:</p><p>Здесь используется замечательный пример обнаружения веб-камерой лица человека и определения его положения в пространстве. Человек буквально может посмотреть на изображение с другой стороны. Давайте разберемся, каким образом это происходит.</p><p>Для начала нам надо понять, как машина различает объекты и фон. К примеру, для нахождения веб-камерой каких-то геометрических фигур надо, что бы камера отличала следующие атрибуты объекта:</p><ol><li>Форму объекта (круг, квадрат, треугольник…);</li><li>Цвет определяемого объекта;</li><li>Размер объекта и положение его относительно других объектов.</li></ol><p>Для нахождения формы объекта используется эффект размытия контуров заданной формы. Это делается для того, чтобы устройство точно могло определить, где закончился контур нашего объекта и начался фон. Более подробно, со всевозможными объяснениями и примерами, можно узнать из лекции Александра Бакулина о робототехнике:</p><p>Что связано с цветом объекта, думаю, всем понятно, и особо сложных вопросов возникать не должно. Все просто: устройству надо определить по цвету объекта его положение, а также отсечь фон и другие объекты. Глубина цвета, как и возможные погрешности, зависит от качества записи устройства, освещения, вашего алгоритма определения и ряда менее значимых нюансов.</p><p>Говоря о положении определяемого объекта в зоне видимости, мы переходим к главному принципу работы, который демонстрируется на видео выше. Устройство находит объект, фиксирует его положение в реальном времени и, следуя алгоритму, выполняет нужные нам действия. Одной из ключевых позиций является размер нашего объекта. Мы приближаем объект, изменяя его координаты по осям, и видим изображение уже под другим углом. В случае с человеческим лицом, а не простой геометрической фигурой, есть ряд нюансов:</p><p>— Форма лица у всех людей разная, хотя есть определенные типы этой формы.</p><p>— Цвет кожи человека, личные особенности, такие как прическа, украшения, и тому подобное.</p><p>— Лицо человека, хоть и симметрично, имеет различия, если смотреть под разными углами.</p><p>Поэтому, в отличие от простых фигур, для определения лица требуется использовать немного другой подход.</p><p>Оптимальный вариант – это xml файлы, содержащие необходимые нам сведения по всем пунктам, которые были описаны выше. Это множество изображений лиц разных размеров и форм, сделанных заранее под разными углами. В сети уже есть готовые xml файлы, которые можно использовать в работе.</p><p>Работать с такой технологией легко и просто. Открывается множество интересных решений для работы с изображением, которые можно использовать как в повседневной жизни, так и в больших проектах.</p>]]></content:encoded>
    </item>
  </channel>
</rss>