Озвучка, музыка и субтитры собираются в том же проекте, что и сцены: голос создаётся в «Генерации», а дорожки сводятся на таймлайне «Монтажа».
Озвучка из текста
В режиме «Озвучка» раздела «Генерация» напиши текст, выбери модель и «Голос» из базовых или своих.
Готовая озвучка ложится на дорожку «Озвучка» в «Монтаже»: её можно привязать к сцене или поставить в любое место ролика, а «Громкость» задаётся в децибелах отдельно от звука видео и музыки.
| Модель | Символов за запрос | Управление подачей |
|---|---|---|
| Eleven v4, Eleven v4 Turbo | До 2000 | Теги эмоций в квадратных скобках, например [whispers] или [laughs], и настройки «Эмоциональность» и «Сходство» |
| Eleven v3 | До 4000 | Те же теги и «Подача»: «Натурально», «Спокойно», «Выразительно» или «Реклама» |
Замена голоса, свой голос и словарь
Если запись уже есть, модель Eleven v2 меняет в ней голос и сохраняет речь, темп и интонацию. Источник выбирается в «Источник озвучки»: «Из аудио/видео проекта», «Из аудио или видео» или «Микрофон», длительностью до 5 минут.
- Свой голос создаётся в «Медиатеке», раздел «Голоса» → «Мои голоса» → «Новый голос»: добавь 1–2 минуты чистой речи — аудио, видео или запись с микрофона. Обучение голоса доступно с активным тарифом; готовый голос появляется в выборе «Голос» рядом с базовыми.
- Слова, которые голос читает неправильно, исправляются в «Голоса» → «Словарь»: заполни «Слово или фраза» и «Как произносить» и проверь кнопкой «Прослушать». Правило действует во всех озвучках из текста.
Субтитры
Субтитры собираются на панели «Субтитры». Для озвучки текст и тайминги слов уже готовы. Для видео со звуком нажми «Расшифровать», стоимость распознавания видна на кнопке до запуска.
Каждую фразу можно исправить, разделить, закрепить или удалить, а для всей дорожки выбрать стиль («Эфирный», «Акцент», «Караоке») и одно из девяти положений в кадре. Субтитры держат оффер и ключевые фразы на экране, когда звук выключен, а голос задаёт смысл и темп.
Дубляж готового видео
- sync-lipsync-v3Синхронизирует губы спикера на готовом видео или фото с выбранной озвучкой (модель sync-3). Подходит и для замены речи в снятом ролике, и для нового говорящего видео.
- minimax-h3-max-lip-syncОживляет одно фото под готовую озвучку: говорящий ролик длиной с аудио, до 14,8 секунды, от 480P до 2K. Снятое видео не дублирует — работает от фото.
- kling-lip-syncПерекладывает движение губ в готовом видео под новую дорожку — для дубляжа, локализации и замены речи. Видео не генерирует.
Когда это особенно полезно
Объясняющие ролики
Голос ведёт зрителя по смыслу, а субтитры закрепляют главные тезисы — вся связка собирается в одном месте.
Ролики для соцсетей
Доведи черновик до версии, которую уже можно публиковать: вертикальный формат, читаемый текст, выверенный ритм.
Реклама с оффером
Проверь, что ключевая фраза, кадр и финальный призыв не конфликтуют по времени.


