Написать пост

Нейросеть научилась воссоздавать трехмерные сцены по фотографиям

Аватар Наташа Маркова

Алгоритм из генеративной и репрезентативной сетей наблюдает сцену с нескольких ракурсов, а затем создает ее трехмерную модель с произвольного угла обзора.

Разработчики из DeepMind представили алгоритм Generative Query Network (GQN) на нейросетях, который исследует двумерную сцену и определяет, как она будет выглядеть в трехмерном пространстве.

Превью видео oSZkDuDoFAI

Обучение

GQN состоит из генеративной и репрезентативной сетей. Репрезентативная нейросеть кодирует информацию о полученных двумерных изображениях и представляет ее в виде вектора. Затем генеративная сеть предсказывает, как будет выглядеть окружение с новой точки наблюдения, и создает трехмерный рендер.

Если нейросеть видит один и тот же объект много раз, то запоминает его характеристики и использует при последующих взаимодействиях. По словам разработчиков, ИИ способен воспроизвести лабиринт, просканировав несколько сделанных изнутри фотографий.

Эксперименты

Тесты в виртуальном трехмерном мире показали, что GQN создает качественные изображения без знаний о законах перспективы или освещения. Также система классифицирует частично скрытые объекты и считает их количество.

Разработчики обучали нейросети только на искусственно созданных данных, однако в перспективе они намерены использовать реальные сцены.

В мае 2018 года исследователи из Google представили алгоритм Stereo Magnification, который из двух снятых с близких ракурсов кадров воссоздает новые снимки с других ракурсов. В отличие от GQN, он не создает изображения с принципиально другого угла обзора, но работает с реальными фотографиями.

Следите за новыми постами
Следите за новыми постами по любимым темам
2К открытий2К показов