Говорящий аватар нейросетью: как сделать и сколько это стоит

Говорящий аватар — это видео, где человек с фотографии произносит ваш текст: губы двигаются синхронно со звуком, лицо оживает. Раньше для этого снимали человека на камеру, теперь хватает одного снимка и аудиодорожки.

Что нужно на входе

  • Портрет — анфас, лицо занимает заметную часть кадра, глаза и рот не перекрыты. JPEG или PNG до 10 МБ.
  • Аудио с речью — своё или синтезированное. MP3, WAV, M4A.

Всё остальное делает сервис говорящего аватара: он анализирует звук, раскладывает его на фонемы и подставляет соответствующие положения губ.

Где взять голос

Три рабочих варианта:

  1. Записать себя на телефон — самый живой результат, но нужна тихая комната.
  2. Сгенерировать через озвучку текста — удобно, когда нужно много одинаковых роликов с разным текстом.
  3. Взять готовую запись — интервью, подкаст, голосовое сообщение.

Если запись шумная, сначала прогоните её через очистку звука: липсинк опирается на разборчивость речи, и на грязной дорожке губы двигаются неточно.

Сколько стоит и сколько ждать

Длина ролика Цена Время
10 секунд 120 ₽ 1–2 минуты
30 секунд 360 ₽ 2–4 минуты
60 секунд 720 ₽ до 5 минут

Оплата поминутная — 12 ₽ за секунду готового видео, минимум 120 ₽. Абонентской платы нет, деньги списываются с баланса аккаунта только за выполненную работу.

Где это применяют

  • приветствие на сайте от лица основателя;
  • обучающие ролики без съёмочного дня;
  • аватар ведущего для канала;
  • персональные поздравления.

Частые вопросы

Нужен ли навык монтажа? Нет: на выходе готовый MP4, его сразу можно публиковать.

Можно ли использовать чужое фото? Только с согласия человека на снимке. Это требование закона, а не наше ограничение.

Почему видео дороже картинки? Потому что модель обсчитывает каждый кадр: минута видео — это полторы тысячи кадров с синхронизацией по звуку.

Читать  Цифровой аватар для видео онлайн: зачем он бизнесу и блогеру

Сделать говорящего аватара — загрузите фото и аудио, получите MP4.