Визуальный ряд собран, но без голоса и текста ролик ещё не готов к публикации. Озвучка и субтитры добавляются в том же проекте, без перехода в отдельные сервисы.
Озвучка создаётся в режиме «Озвучка» раздела «Генерация»: из текста или из готовой записи с заменой голоса. Готовый клип ложится на дорожку «Озвучка» в «Монтаже», а субтитры собираются из текста озвучки или расшифровки видео.
Добавляй голос, когда базовый визуальный ритм уже понятен, но ролик ещё легко поправить: озвучка часто меняет длину сцен и место для текста в кадре.
Что понадобится
- Несколько готовых сцен или минимальный визуальный каркас ролика.
Пошагово
- 1
Собери базовый визуальный ритм
Голос и субтитры легче добавлять, когда уже понятна длина и логика сцен. Идеальная полировка картинки на этом шаге не нужна.
- 2
Проверь текст в Eleven v4 Turbo
Напиши текст с тегами и послушай черновик: темп, паузы и эмоции. Turbo вдвое дешевле v4.
- 3
Озвучь финал в Eleven v4
Перегенерируй утверждённый текст в v4 с теми же тегами. Готовая озвучка ляжет на дорожку «Озвучка» в «Монтаже».
- 4
Собери субтитры
Выбери стиль и положение. Проверь, что текст читается и не перекрывает важные детали кадра.
- 5
Посмотри ролик целиком перед экспортом
Посмотри дважды: со звуком и без. Сцены, голос, текст и темп должны работать вместе.
Откуда взять голос
Озвучка из текста
Напиши текст, выбери модель и «Голос» из базовых или своих. Каждый голос можно прослушать до генерации.
Замена голоса в записи
Eleven v2 меняет голос в готовой записи и сохраняет речь, темп и интонацию. Источник выбирается в «Источник озвучки»: «Из аудио/видео проекта», «Из аудио или видео» или «Микрофон», до 5 минут.
Свой голос
«Медиатека» → «Голоса» → «Мои голоса» → «Новый голос»: добавь 1–2 минуты чистой речи. Обучение голоса доступно с активным тарифом, готовый голос появляется в выборе «Голос».
Какую модель выбрать
- elevenlabs-tts-v4Основная модель для финальной озвучки: точнее следует тегам и учитывает контекст всего текста. До 2000 символов за запрос, 8–44 токена в зависимости от длины.
- elevenlabs-tts-v4-turboТе же теги и настройки вдвое дешевле: 4–22 токена. Удобна для черновиков, чтобы проверить текст, темп и расстановку тегов.
- elevenlabs-ttsДо 4000 символов за запрос и готовые пресеты «Подачи»: «Натурально», «Спокойно», «Выразительно», «Реклама».
Как задать подачу тегами
Интонацию задают теги в квадратных скобках прямо в тексте: [whispers], [excited], [laughs], [sighs], [pause]. Напечатай «[» в поле озвучки, и Givon предложит 12 тегов; свой тег до 40 символов тоже работает. Теги входят в число символов запроса.
Как выбрать голос, расставить теги и паузы, писать числа и какие шаблоны брать под рекламу, обучение и персонажей — в гайде по тексту для озвучки.
[sighs] Опять ты за своё... [sarcastic] Конечно, это была ОЧЕНЬ хорошая идея. [exhales] Ладно. [curious] Рассказывай, что на этот раз?
Голос Marina, «Эмоциональность» 75%, «Сходство» 75%.
Настройки голоса
У Eleven v4 и v4 Turbo вместо «Подачи» две настройки в процентах. Кроме готовых значений, у каждой есть пункт «Своё значение».
- «Эмоциональность»
- По умолчанию 50%. Выше — выразительнее, но больше разница между дублями; ниже — ровнее и предсказуемее.
- «Сходство»
- По умолчанию 75%. Насколько озвучка похожа на выбранный голос; высокое значение передаёт и дефекты исходной записи.
Произношение
Слова, которые голос читает неправильно, исправляются в «Медиатека» → «Голоса» → «Словарь»: заполни «Слово или фраза» и «Как произносить» и проверь кнопкой «Прослушать». Правило действует во всех озвучках из текста.
Как собрать субтитры
Субтитры собираются на панели «Субтитры». Для озвучки из текста текст и тайминги слов уже готовы. Для видео со звуком нажми «Расшифровать», стоимость распознавания видна на кнопке до запуска.
Каждую фразу можно исправить, разделить, закрепить или удалить, а для всей дорожки выбрать стиль «Эфирный», «Акцент» или «Караоке» и одно из девяти положений в кадре.
Если нужен говорящий персонаж
Когда голос должен звучать не за кадром, а из уст героя, используй модели с липсинком — они синхронизируют губы персонажа с озвучкой. А если персонаж нужен постоянный, начни с гайда по AI-инфлюенсеру.
- sync-lipsync-v3Модель sync-3: синхронизирует губы на фото или готовом видео персонажа с озвучкой — до 5 минут. Подходит и для нового говорящего ролика, и для замены речи в снятом видео.
- minimax-h3-max-lip-syncНовая модель в «Генерации» проекта: одно фото и готовая озвучка превращаются в говорящий ролик до 14,8 секунды, от 480P до 2K. Для коротких реплик.
- kling-digital-humanФото персонажа плюс дорожка с речью: синхронизирует речь, мимику и жесты. Ролики до 5 минут — хватит и на Reels, и на полноценное объяснение.
- heygen-photo-avatarСама подбирает мимику и жесты по тону голоса, до 60 секунд. Другой характер подачи — сравни на своём персонаже.
- kling-lip-syncТолько перекладка губ в готовом видео под новую дорожку, до 60 секунд — узкий инструмент для дубляжа и замены слов.


