Рассинхрон замечают даже те, кто не может объяснить, что не так: мозг очень чувствителен к несовпадению губ и звука. Расхождение в 40–50 миллисекунд уже читается как «что-то странное». Разберём, что влияет на точность.
Главное — чистота дорожки
Модель определяет положение губ по звуку, поэтому всё лишнее на дорожке работает против неё: музыка, второй голос, гул кондиционера. Порядок действий простой — сначала очистить запись, потом собирать видео. На чистой речи точность заметно выше.
Темп и дикция
| Параметр | Как лучше |
|---|---|
| Темп | средний, 120–150 слов в минуту |
| Паузы | 0,3–0,5 с между фразами |
| Дикция | чёткие согласные, без «проглатывания» окончаний |
| Громкость | ровная, без резких скачков |
Скороговорка и шёпот — два режима, в которых ошибается и человек, читающий по губам, и модель.
Фотография тоже влияет
Чем крупнее и чётче губы в кадре, тем точнее артикуляция. На мелком лице модели просто не хватает пикселей, чтобы показать разницу между «о» и «у».
Если рассинхрон всё же есть
- Проверьте, нет ли в дорожке музыки — это причина номер один.
- Обрежьте тишину в начале файла: иногда расхождение равно именно ей.
- Пересоберите ролик с более крупным фото.
- Разбейте длинную дорожку на блоки по 30 секунд.
Частые вопросы
Какие языки поддерживаются? Практически любые: модель работает со звуком, а не с текстом.
Можно ли синхронизировать пение? Технически да, но результат хуже речи: в пении гласные тянутся дольше, и артикуляция выглядит вялой.
Сколько стоит? 12 ₽ за секунду готового видео, минимум 120 ₽.
