Система Deep Voice от Baidu научилась быстро синтезировать человеческую речь

Китайская компания представила систему, позволяющую преобразовывать написанный текст в человеческую речь, и делает она это лучше и быстрее, чем WaveNet от Google.

По словам компании, Deep Voice может научиться говорить всего за несколько часов, причем говорить достаточно естественно и реалистично.

Как работает эта система?

Инструмент WaveNet от Google тоже умеет синтезировать реалистичную человеческую речь, но для его использования требуется достаточно мощное железо, что затрудняет его использование в реальной жизни. Baidu решила данную проблему благодаря глубинному обучению. Deep Voice конвертирует текст в фонемы, самые маленькие единицы речи. После этого система преобразует фонемы в звуки, используя сеть для синтеза речи. Например, слово «Hello» система преобразует в «(тишина, HH), (HH, EH), (EH, L), (L, OW), (OW, тишина)», после чего Deep Voice произносит слово.

Оба шага работают благодаря машинному обучению и не требуют вмешательства человека. Однако система не может определять, какие звуки находятся под ударением и как долго их произносить. Этим занимаются люди, переставляя звуки и фонемы, тем самым передавая выразительность речи.

Хотя Deep Voice и решила проблему WaveNet, ей по-прежнему требуется очень много вычислительной мощности. Для того, чтобы говорить как человек, компьютер должен генерировать слова за 20 микросекунд. В компании объяснили, что они стараются не синтезировать одни и те же слова по несколько раз. Вместо этого синтезированные слова хранятся в кэше процессора, что позволяет оптимально использовать вычислительные модули.

Машинное обучениеПодписаться

2К открытий2К показов

Также рекомендуем

Танцуют все — и даже рисунки!

Рассказываем, как в Газпромбанке научились оживлять нарисованных человечков с помощью Data Science и трёх групп ML-моделей.

Почему нейросети не заменят программистов

Пока что бояться не стоит. Разбираемся, почему программисты в безопасности и почему их всё ещё сложно заменить нейросетями.

Построй ML-модель для Газпромбанка и выиграй миллион

Газпромбанк подготовил задачу для хакатона «Лидеры цифровой трансформации», за решение которой можно выиграть приз.

MLup: как создавать веб-приложение с машинными обучением за один взмах волшебной палочки - конкурс пет-проектов

Написал библиотеку на Python , которая позволяет создавать и запускать приложения с любой моделью машинного обучения.