Задача звучит просто: есть фотография и текст, нужно видео, где человек со снимка этот текст произносит. Разберём весь путь по шагам, с конкретными требованиями на каждом.
Шаг 1. Подготовить фото
Требования короткие, но их несоблюдение — причина большинства неудачных роликов:
- лицо анфас, поворот головы не больше 15–20 градусов;
- рот виден полностью, без маски, микрофона и руки у подбородка;
- ровный свет, без жёсткой тени поперёк лица;
- разрешение от 512 пикселей по короткой стороне.
Если снимок старый или мелкий, сначала увеличьте качество в разделе «Нейросети» — апскейл заметно улучшает итог.
Шаг 2. Получить звук
Запишите голос на телефон в тихой комнате или соберите дорожку в озвучке текста. Практический ориентир: 60 секунд речи — это примерно 800–900 знаков текста.
Шаг 3. Собрать ролик
Загрузите оба файла в сервис говорящего аватара и при желании опишите манеру: «спокойно рассказывает, смотрит в камеру». Ролик собирается за одну–пять минут в зависимости от длины аудио.
Типичные ошибки
| Ошибка | Что получится |
|---|---|
| Фото в профиль | губы двигаются неестественно |
| Музыка поверх речи в исходнике | модель путает такты с речью, синхронизация плывёт |
| Очень длинное аудио одним куском | дороже и дольше; лучше резать на смысловые блоки |
| Тёмное фото | мимика читается слабо |
Сколько стоит
12 ₽ за секунду готового видео, минимум 120 ₽. Ролик на 15 секунд — 180 ₽, на полминуты — 360 ₽.
Частые вопросы
Можно ли оживить старую семейную фотографию? Да, если лицо различимо. Порядок: улучшить качество, потом делать видео.
Останется ли фон? Да, фон сохраняется, меняется только лицо и лёгкое движение головы.
Где сохраняется результат? В истории аккаунта, скачать можно в любой момент.
