Говорящий аватар — это видео, где человек с фотографии произносит ваш текст: губы двигаются синхронно со звуком, лицо оживает. Раньше для этого снимали человека на камеру, теперь хватает одного снимка и аудиодорожки.
Что нужно на входе
- Портрет — анфас, лицо занимает заметную часть кадра, глаза и рот не перекрыты. JPEG или PNG до 10 МБ.
- Аудио с речью — своё или синтезированное. MP3, WAV, M4A.
Всё остальное делает сервис говорящего аватара: он анализирует звук, раскладывает его на фонемы и подставляет соответствующие положения губ.
Где взять голос
Три рабочих варианта:
- Записать себя на телефон — самый живой результат, но нужна тихая комната.
- Сгенерировать через озвучку текста — удобно, когда нужно много одинаковых роликов с разным текстом.
- Взять готовую запись — интервью, подкаст, голосовое сообщение.
Если запись шумная, сначала прогоните её через очистку звука: липсинк опирается на разборчивость речи, и на грязной дорожке губы двигаются неточно.
Сколько стоит и сколько ждать
| Длина ролика | Цена | Время |
|---|---|---|
| 10 секунд | 120 ₽ | 1–2 минуты |
| 30 секунд | 360 ₽ | 2–4 минуты |
| 60 секунд | 720 ₽ | до 5 минут |
Оплата поминутная — 12 ₽ за секунду готового видео, минимум 120 ₽. Абонентской платы нет, деньги списываются с баланса аккаунта только за выполненную работу.
Где это применяют
- приветствие на сайте от лица основателя;
- обучающие ролики без съёмочного дня;
- аватар ведущего для канала;
- персональные поздравления.
Частые вопросы
Нужен ли навык монтажа? Нет: на выходе готовый MP4, его сразу можно публиковать.
Можно ли использовать чужое фото? Только с согласия человека на снимке. Это требование закона, а не наше ограничение.
Почему видео дороже картинки? Потому что модель обсчитывает каждый кадр: минута видео — это полторы тысячи кадров с синхронизацией по звуку.
Сделать говорящего аватара — загрузите фото и аудио, получите MP4.
