Озвучка карточек товаров становится особенно полезной, когда позиций не пять и не десять, а сотня или тысяча. Текстовое описание уже содержит характеристики, но голос позволяет вынести часть информации в отдельный аудиослой: покупатель слышит название, ключевые свойства и сценарий использования, не разбирая длинный абзац.
Для каталога из 100 позиций здесь важна не отдельная удачная запись, а повторяемый процесс. Один шаблон текста, одинаковая логика подстановки характеристик, один выбранный голос и понятный расчёт по знакам позволяют превратить разовые действия в конвейер. В кабинете озвучки текста достаточно вставить текст или загрузить файл, выбрать голос и получить аудиофайл.
Зачем карточке голос, если есть текст описания
У карточки товара уже есть название, характеристики, комплектация и описание. Но эти элементы отвечают прежде всего на задачу чтения глазами. Аудиоверсия позволяет вынести в отдельную дорожку короткий сценарий: что это за товар, для чего он нужен, какие у него основные параметры и что входит в комплект.
Особенно удобно начинать не с полного описания, а с версии на 300–600 знаков. Например, для термокружки можно оставить название, объём 450 мл, материал корпуса, наличие крышки и назначение. Для покупателя это будет цельная реплика, а не перечень полей из каталога.
Пример структуры может выглядеть так:
«Термокружка [название]. Объём — [объём]. Корпус выполнен из [материал]. Крышка [тип крышки]. Подходит для [сценарий использования]. В комплекте — [комплектация]».
В такой схеме постоянной остаётся сама реплика, а значения в квадратных скобках меняются. Поэтому озвучка перестаёт быть отдельной редакторской задачей для каждой позиции. Вы сначала определяете формат подачи, а затем заполняете его данными конкретного товара.
Это особенно важно, если видео для карточки товара делается серией. Покупатель должен узнавать структуру роликов: сначала название, затем два-три главных преимущества, после этого характеристики и комплектация. Разные форматы в каждом ролике быстро превращают каталог в набор несвязанных материалов.
Есть и практическая причина держать реплику короткой. Чем больше характеристик вы пытаетесь проговорить, тем выше расход знаков и тем дольше аудиодорожка. Если из описания на 2500 знаков оставить 500 знаков, то вы экономите не только время прослушивания, но и бюджет на озвучку.
При этом не стоит автоматически превращать каждое поле каталога в предложение. Артикул, внутренний код или техническая характеристика, которая ничего не меняет для покупателя, может остаться в текстовой части карточки. Голос лучше использовать для информации, которую действительно имеет смысл услышать.

Шаблон реплики: что в нём меняется от товара к товару
Для сотни товаров удобнее иметь один основной шаблон и несколько вариантов отдельных фраз. Например, для одежды постоянной может быть последовательность «название — материал — посадка — размерный ряд — детали». Для бытовой техники — «название — назначение — мощность — основные режимы — комплект». Меняется набор характеристик, но порядок подачи остаётся одинаковым.
Представим каталог из 100 кухонных приборов. В шаблоне можно оставить четыре переменных блока: название модели, мощность, количество режимов и комплектацию. Тогда текст каждой карточки собирается по одной схеме:
«[Название] — [тип прибора] мощностью [мощность]. Предусмотрено [количество] режима. В комплект входят [комплектация]. Подходит для [основное применение]».
Для одной позиции получится: «Миксер MX-200 — ручной миксер мощностью 500 Вт. Предусмотрено 5 режимов. В комплект входят два венчика и два крюка для теста. Подходит для взбивания и замешивания теста».
Для другой структура не меняется: «Миксер MX-300 — ручной миксер мощностью 600 Вт. Предусмотрено 7 режимов. В комплект входят два венчика, два крюка и насадка для смешивания. Подходит для взбивания, смешивания и замешивания теста».
Перед массовой генерацией полезно определить правила для чисел. Например, вместо записи «0,45 л» в озвучке использовать «450 миллилитров», если так фраза звучит естественнее. «5 режимов» лучше проверить отдельно: нейросетевой голос может произносить числа не так, как ожидает редактор, поэтому спорные места корректируют в исходном тексте.
То же касается названий моделей, аббревиатур и редких слов. Сервис не гарантирует правильное ударение в таких случаях, поэтому исправление делается не настройкой голоса, а непосредственно в тексте. Если одна модель произносится нестандартно, это правило стоит перенести на весь каталог до запуска сотни записей.
Отдельно проверьте границы между карточками. Одна и та же фраза в начале и конце разных файлов должна звучать естественно. В кабинете есть поля «предыдущий текст» и «следующий текст»: соседние куски можно использовать как контекст, чтобы интонация на стыке не ломалась.
Если нужно озвучить описание товара, не обязательно вручную вставлять весь каталог целиком. Текст можно вставлять руками или загружать файлом, а готовые результаты остаются в списке генераций в кабинете. Там их можно позже отфильтровать по голосу и состоянию.
Один голос на весь каталог: почему это не мелочь
Для серии из 100 карточек голос — часть визуальной и аудиальной идентичности каталога. Если первая карточка звучит спокойным низким голосом, вторая — быстрым и высоким, а третья — ещё одним вариантом, покупатель получает ощущение трёх разных серий. При одинаковом голосе сами товары остаются главным отличием роликов.
Поэтому голос лучше выбирать до массового запуска, а не после первых 30 файлов. В кабинете доступны готовые голоса, в том числе бесплатные мужской и женский голоса и бесплатная библиотека. За бесплатные варианты списывается 0 ₽, но это именно отдельные голоса и режимы, а не бесплатная версия платного голоса.
Выбранный голос стоит закрепить как правило каталога. Если для одной категории используется один голос, то при добавлении ещё 50 позиций не возникает вопроса, какой вариант брать для новой записи. Это особенно удобно, когда каталог выпускается партиями: сегодня 100 карточек, через неделю ещё 40.
Единый голос важен и для пересборки. Допустим, в 12-й карточке нашли ошибку в характеристике и решили перезаписать только этот файл. Если настройки не менялись, новая версия остаётся частью той же серии. Не приходится подбирать тембр заново или решать, насколько новый голос отличается от старого.
При выборе стоит прослушать не одну короткую фразу, а несколько типов текста. Возьмите название модели, предложение с числом, предложение с единицей измерения и длинную фразу из описания. Один голос может хорошо звучать на коротком названии и заметно иначе восприниматься на длинной технической характеристике.
Язык тоже выбирается до запуска серии. Доступно автоопределение и явный выбор русского, английского, немецкого, французского, испанского, итальянского, португальского, польского, японского, корейского и китайского языков. При этом язык влияет на произношение, а не переводит исходный текст: какой текст передан, такой он и будет прочитан.

Как озвучить сто карточек, не повторяя работу сто раз
Конвейер удобно разбить на шесть операций. Сначала выбирается категория товаров. Затем создаётся шаблон реплики, после чего в него подставляются характеристики. Четвёртый шаг — проверка текста, пятый — массовая озвучка, шестой — контроль готовых файлов.
На первом этапе не нужно пытаться охватить весь каталог. Возьмите пять товаров, которые отличаются друг от друга сильнее всего. Для миксеров это могут быть модели с разной мощностью и комплектацией; для одежды — товары из разных материалов и с разными вариантами посадки.
После этого собирается единый текстовый шаблон. Хороший признак рабочего шаблона — редактор может заполнить карточку, не придумывая новую структуру для каждого товара. Если на 20-й позиции приходится менять порядок предложений, значит, шаблон ещё слишком узкий.
Следом идёт текстовая проверка. Сверьте название, числа, единицы измерения, комплектацию и все характеристики, которые попадут в аудио. Именно здесь проще всего исправить «12 кг» на форму, которую голос произносит естественно, чем пересобирать готовую серию.
После проверки пяти примеров можно переходить к остальным позициям. Если тексты готовятся в таблице или другой внутренней системе учёта, удобно держать отдельные поля для названия, характеристик, готовой реплики и статуса озвучки. Так видно, какие карточки уже проверены, какие отправлены на генерацию, а какие требуют правки.
Саму генерацию не стоит воспринимать как публикацию. Готовый аудиофайл сначала проверяется, затем получает имя по понятному правилу, после чего его можно связать с соответствующей карточкой. В кабинете остаётся список генераций, поэтому готовые файлы можно скачать позже, а результаты — отфильтровать по голосу и состоянию.
Для массовой работы полезно учитывать и ограничение частоты: на один ключ допускается не более 60 запросов в минуту. Для ручного сценария это редко становится главным ограничением, но при организации потока из большого числа операций его нужно учитывать в расписании запуска.
Если каталог вырастает до тысячи позиций, логика остаётся той же. Не создаётся тысяча разных сценариев, а поддерживается один шаблон и контролируется набор переменных. Чем стабильнее шаблон, тем проще проверить десяток выборочных файлов вместо попытки вручную перечитать и прослушать весь массив перед каждой публикацией.
Для видео здесь важно разделять аудио и сам ролик. Озвучка текста выдаёт аудиофайл, а не готовую смонтированную видеодорожку. Если аудио нужно наложить на изображения или видео карточки, это делается отдельно в редакторе, поэтому в расчёт процесса стоит включать ещё один этап.
Для результата доступны MP3 44,1 кГц с битрейтом 128 или 192 кбит/с, WAV/PCM 16, 22,05 и 24 кГц, а также Opus 48 кГц с битрейтом 32, 64 или 96 кбит/с. Для каталога лучше заранее выбрать один формат и не смешивать его между партиями без причины.
Бюджет: считаем по знакам, а не по числу карточек
Главная ошибка при планировании бюджета — умножать цену одной карточки на количество карточек. У озвучки текста цена считается по объёму: 18 ₽ за каждые 1000 знаков, при минимальной стоимости 18 ₽ за запуск. Поэтому две карточки одинакового количества товаров могут стоить по-разному, если тексты имеют разную длину.
| Объём текста | Стоимость озвучки |
|---|---|
| 1 000 знаков | 18 ₽ |
| 10 000 знаков | 180 ₽ |
| 50 000 знаков | 900 ₽ |
Минимум в 18 ₽ означает стоимость самого короткого запуска, а не фиксированную цену любой карточки. Например, текст на 10 000 знаков обойдётся в 180 ₽, а 50 000 знаков — в 900 ₽. Поэтому для каталога правильнее сначала посчитать общий объём символов, а уже затем умножать его на тариф.
Допустим, в каталоге 100 товаров и на каждый приходится в среднем 600 знаков озвучиваемого текста. Общий объём составит 60 000 знаков. При ставке 18 ₽ за 1000 знаков расчёт будет таким: 60 000 / 1000 × 18 ₽ = 1 080 ₽.
Для 1000 товаров при том же среднем объёме получится 600 000 знаков. Расчёт: 600 000 / 1000 × 18 ₽ = 10 800 ₽. Это уже показывает, почему длина шаблона важнее самого количества карточек: увеличение среднего текста с 600 до 900 знаков при тысяче позиций увеличит объём с 600 000 до 900 000 знаков.
При использовании диалогового режима стоимость выше на 30%. Такой режим имеет смысл закладывать в бюджет отдельно, если в одной записи нужны реплики разными голосами. Для обычного последовательного рассказа одним голосом расчёт остаётся по стандартной цене озвучки текста.
Для удобства можно считать бюджет сразу в трёх сценариях:
| Каталог | Средний объём на карточку | Общий объём | Стоимость |
|---|---|---|---|
| 100 товаров | 300 знаков | 30 000 знаков | 540 ₽ |
| 100 товаров | 600 знаков | 60 000 знаков | 1 080 ₽ |
| 1 000 товаров | 600 знаков | 600 000 знаков | 10 800 ₽ |
Такой расчёт полезнее условной цены «за карточку». Если после первых пяти образцов средняя реплика оказалась 750 знаков, именно это значение нужно использовать для оценки всей партии. А если часть карточек требует 300 знаков, а часть 1200, лучше посчитать каждую группу отдельно.
Для небольшого теста есть ещё одна деталь: при выпуске первого ключа на баланс начисляется 50 ₽ на пробу. Оплата в сервисе идёт за запуск, без абонентской платы и без минимального платежа. Поэтому при планировании большой партии расходы можно связывать именно с фактическим объёмом обработки.
Если задача состоит не только в озвучке, а ещё в подготовке видео, эти расходы нельзя автоматически включать в цену TTS. Например, операция «Видео по описанию» тарифицируется отдельно — 119 ₽ за запуск, а «Оживить фото» — 25 ₽ за запуск. Для конвейера карточек это разные операции, поэтому бюджет на аудио и бюджет на визуальную часть лучше считать раздельно.

Что проверить на первых пяти карточках до массового запуска
Первые пять карточек — это не просто тест качества голоса. Это контроль всей схемы. На них проверяется, насколько шаблон подходит разным товарам, как произносятся числа и названия, не слишком ли длинные реплики и одинаково ли воспринимается серия.
Первая проверка — фактическая точность. Откройте исходное описание рядом с текстом для озвучки и пройдите по каждому числу, единице измерения и характеристике. Если в каталоге написано «мощность 850 Вт», в аудио не должно появиться случайное сокращение или другая цифра.
Вторая — произношение. Особое внимание уделите названиям моделей, аббревиатурам, редким словам и числам. Если конкретное слово звучит неправильно, сначала исправьте исходную формулировку и только после этого запускайте новую версию.
Третья — темп и длина. Прослушайте пять записей подряд, а не по отдельности. Так заметнее, если одна карточка неожиданно получается вдвое длиннее остальных или в каждой записи слишком много одинаковых вводных слов.
Четвёртая — единый голос. Убедитесь, что все пять образцов сделаны одним выбранным голосом. Если одна позиция случайно записана другим вариантом, это проще заметить до запуска оставшихся 95 карточек.
Пятая — стыки текста. Если запись собирается из соседних частей, используйте поля «предыдущий текст» и «следующий текст» там, где переход получается резким. Это позволяет дать голосу дополнительный контекст для интонации на границе кусков.
После пяти проверенных файлов зафиксируйте правила. Например: название произносится первым, затем идут две ключевые характеристики, потом назначение и комплектация; все размеры записываются словами; модели с аббревиатурами проходят отдельную проверку. Такие правила превращают редактуру из субъективного прослушивания в короткий чек-лист.
Дальше массовый запуск становится механической частью процесса. Если шаблон, голос, формат файла и правила проверки уже определены, сотня карточек отличается главным образом входными данными. Именно здесь озвучка карточек товаров перестаёт быть задачей «записать ещё один ролик» и превращается в управляемый каталог.
Для хранения результатов удобно использовать список генераций в кабинете. Файлы остаются там после создания, их можно скачать позже, а список можно фильтровать по голосу и состоянию. Это особенно полезно при партиях, где несколько десятков файлов создаются не за один подход.
Если в результате нужен именно аудиофайл для маркетплейса, заранее выберите единый формат и качество. Если аудио станет частью видео для карточки товара, сначала проверьте несколько файлов вместе с изображением, чтобы длина реплики соответствовала сценарию ролика. Само наложение звука на видео в процесс озвучки не входит.
Частые вопросы
Сколько стоит озвучить 100 карточек товаров?
Цена зависит не от количества карточек, а от числа знаков. Например, 100 карточек по 600 знаков дают 60 000 знаков, что при тарифе 18 ₽ за 1000 знаков составляет 1 080 ₽.
Можно ли использовать один голос для всего каталога?
Да, выбранный голос можно использовать как единый вариант для серии. В кабинете доступны готовые голоса, включая бесплатные варианты, за которые списывается 0 ₽. Бесплатный голос при этом является отдельным голосом, а не бесплатной версией платного.
Можно ли загрузить тексты из файла, а не вставлять их вручную?
Да. Текст можно вставить руками или загрузить файлом. После генерации готовые аудиофайлы остаются в кабинете со списком созданных результатов.
Сервис сам переведёт описание на выбранный язык?
Нет. Выбранный язык влияет на произношение, но не переводит исходный текст. Если передать описание на русском и выбрать другой язык, содержание текста от этого не изменится.
Можно ли сразу получить видео с озвучкой?
Озвучка текста выдаёт аудиофайл. Наложение аудиодорожки на видео и монтаж ролика выполняются отдельно, поэтому в конвейере нужно предусмотреть дополнительный этап.
Где забрать готовые записи после генерации?
Файлы остаются в кабинете со списком генераций. Их можно скачать позже, а результаты — отфильтровать по голосу и состоянию. Для работы с каталогом это позволяет возвращаться к уже созданным записям без повторной генерации.
Если процесс уже понятен, начать его можно с пяти самых разных товаров: собрать короткий шаблон, выбрать один голос, проверить произношение и посчитать среднее число знаков. После этого кабинет озвучки можно использовать как рабочую точку для последовательного выпуска остальных карточек.
