Перевод видео с сохранением голоса и говорящие аватары

Распознавание речи, перевод, синтез голоса, близкого к исходному, приведение артикуляции к новому звуку; аватары с эмоциями на собственных моделях.

ИИ · Медиа
Аватар: набор эмоций, выразительность и очередь рендера
Аватар: набор эмоций, выразительность и очередь рендера

Задача

Ролик нужно перенести в другой язык так, чтобы остался узнаваемый голос, а губы совпадали со звуком. Внешние сервисы это умеют, но забирают исходники к себе — для корпоративного контента это запрет.

Что сделано

  • Распознавание речи и перевод
  • Синтез голоса, близкого к исходному
  • Приведение артикуляции в соответствие новому звуку
  • Говорящие аватары с эмоциями и живой мимикой
  • Закрытый программный интерфейс под клиента

Внутри системы

  • Узкое место — не перевод, а совпадение: голос должен остаться узнаваемым, а артикуляция попасть в новый звук, который короче или длиннее исходного. Поэтому реплика подгоняется по длительности, а не переводится дословно.
  • Модели развёрнуты в своём контуре не из принципа: исходное видео часто не подлежит передаче наружу — внутренние материалы, интервью, лица сотрудников. Внешний сервис здесь исключён условиями, а не ценой.
  • Качество проверяется на границах реплик: именно там расходятся звук и губы, и именно это зритель замечает раньше, чем ошибку перевода.

Как устроено

Модели развёрнуты на собственных мощностях с выводом на графических ускорителях. Исходное видео и голос не покидают контур заказчика — это и есть причина, по которой такой сервис заказывают отдельно, а не берут готовый.

Результат

Рабочий сервис с закрытым программным интерфейсом: перевод роликов с сохранением голоса и говорящие аватары внутри контура заказчика.

Следующая работа
Каталог новостроек как продукт для агентств