Озвучка текста нейросетью на русском: что решает качество звука на самом деле
Почему синтез речи звучит дёшево даже на хорошем движке, как чинить ударения и паузы, до какой громкости нормализовать дорожку и когда синтез брать нельзя.
Почему синтез речи вдруг стал пригоден для видео
Ещё пару лет назад закадровый голос из текста выдавал себя за три секунды: ровная интонация, механические паузы, слипшиеся окончания. Сейчас разница другая. Хорошая синтезированная дорожка проходит незамеченной у большинства зрителей, а плохая всё так же вызывает желание закрыть ролик.
Важно понимать, откуда берётся эта разница. Она почти никогда не в движке. Люди перебирают сервисы, ищут «тот самый голос», платят за подписку подороже и получают ту же самую дешёвую дорожку, потому что проблема лежит в тексте и в обработке, а не в модели.
Разберу по порядку, что именно портит звук и что с этим делать.
Текст под чтение и текст под глаза устроены по-разному
Сценарий, написанный для чтения глазами, синтезируется плохо. Причина простая: письменная речь опирается на знаки препинания и абзацы, а голосовой движок опирается на длину фразы и на то, где стоит точка.
Что помогает:
- Короткие предложения. Всё, что длиннее пятнадцати слов, синтез читает на одном дыхании и превращает в кашу.
- Точка вместо запятой там, где нужна пауза. Движок трактует точку как остановку, запятую почти игнорирует.
- Никаких скобок и вводных конструкций внутри фразы. Их проще вынести отдельным предложением.
- Цифры и сокращения прописью. «2026» читается по-разному в разных движках, «две тысячи двадцать шестой» читается одинаково.
- Латиница прописью на русском, если это не общеизвестный бренд. Иначе получите английское произношение посреди русской фразы.
Правило, которое экономит больше всего времени: прочитайте сценарий вслух сами. Там, где вы сбились или задохнулись, собьётся и синтез.
Ударения и омографы: главная боль русского языка
Это то, чего нет в английском и что ломает русскую озвучку чаще всего. Слова, которые пишутся одинаково, но читаются по-разному: замок и замок, дорога и дорога, уже и уже, стоит и стоит, характерный и характерный.
Движок выбирает вариант по статистике, и в половине случаев ошибается. Одно неверное ударение в первых десяти секундах делает ролик дешёвым в глазах зрителя, даже если дальше всё идеально.
Что с этим делать:
- Завести файл со списком слов, которые у вас регулярно читаются неправильно. У каждой ниши он свой: у истории одни слова, у техники другие.
- Подставлять ударение принудительно там, где движок это поддерживает, или подменять слово синонимом, где не поддерживает.
- Слушать первые пятнадцать секунд каждой дорожки перед сборкой. Не весь ролик, а именно начало: там ошибка стоит дороже всего.
Список растёт сам собой и через месяц закрывает почти все повторяющиеся случаи. Это дешевле, чем каждый раз переслушивать дорожку целиком.
Темп, паузы и дыхание
Синтез по умолчанию говорит быстрее, чем комфортно слушать под видеоряд. Ориентир для закадрового текста на русском лежит в районе ста семидесяти слов в минуту. Быстрее получается скороговорка, медленнее зритель начинает скучать.
Паузы важнее темпа. Живой диктор останавливается перед важной мыслью и после неё, синтез этого не делает сам. Паузу нужно закладывать в текст: отдельным коротким предложением, точкой в нужном месте, разбивкой длинного куска на несколько блоков.
Здесь же частая техническая ошибка. Если вы генерируете озвучку кусками и потом склеиваете файлы, паузы между блоками должны быть внутри самих блоков, а не в месте склейки. Иначе при монтаже дорожка поедет относительно картинки, и к концу ролика расхождение станет заметным.
Громкость: почему ваш ролик звучит тише всех
Свежая дорожка из синтеза обычно выходит тихой. Зритель переключается с чужого ролика на ваш и лезет крутить громкость. Это прямой удар по удержанию в первые секунды.
Лечится нормализацией. Дорожку приводят к принятому для платформ уровню громкости, примерно минус четырнадцать единиц по шкале LUFS, и только после этого подмешивают музыку. Музыку при этом сажают заметно ниже голоса, иначе на телефоне речь тонет.
Порядок действий такой: сначала нормализуете голос, потом подкладываете музыку, потом проверяете итог на телефонном динамике. Не на наушниках. Большинство зрителей слушают именно так.
Когда синтез брать не стоит
Синтез хорош для закадрового текста. Он плох там, где нужен человек в кадре и эмоция.
- Говорящая голова. Совмещение синтеза с видео говорящего человека почти всегда читается как подделка.
- Личные истории от первого лица, где важна интонация, а не информация.
- Реклама и продающие тексты. Там слышно фальшь быстрее всего.
- Смешанный формат, где в одном ролике живая речь и синтез. Два разных голоса на один ролик воспринимаются как брак, даже если оба хороши по отдельности.
Если ролик держится на подаче, а не на фактах, дешевле записать себя телефоном, чем гнаться за идеальным синтезом.
Как это встраивается в конвейер
Озвучка это один из шести шагов производства ролика, и ровно тот, который автоматизируется полностью. Подробнее весь процесс разобран в статье про канал без лица и голоса, а про то, что нейросети уже умеют и где позорятся, есть отдельный разбор о видео нейросетью на русском.
Смысл автоматизации в том, чтобы не принимать решения заново на каждом ролике. Один раз настроили темп, список ударений, уровень громкости и схему нарезки на блоки. Дальше это просто работает, а внимание уходит на сценарий и упаковку, где оно действительно нужно.
Что сделать
- Возьмите свой последний сценарий и перепишите его под чтение: предложения короче пятнадцати слов, цифры прописью, точка вместо запятой в местах пауз.
- Создайте файл со списком проблемных ударений вашей ниши. Начните с десяти слов, которые точно встречаются у вас регулярно.
- Замерьте темп готовой дорожки: разделите количество слов на длительность в минутах. Если вышло больше ста восьмидесяти, замедляйте.
- Прогоните голос через нормализацию к минус четырнадцати LUFS до того, как подмешаете музыку.
- Послушайте первые пятнадцать секунд на динамике телефона. Если там есть неверное ударение или голос тише обычного, правьте до публикации.
- Не меняйте движок, пока не пройдёте эти пять пунктов. В девяти случаях из десяти дело не в нём.
Гость показывает свою цифру дохода со скрином и отдаёт инструмент, которым пользуется сам. Бот напишет вам, когда выйдет первый выпуск и когда откроются места в курсе.
Записаться в предзапись
snimi.ai