Как добавить озвучку и субтитры

Озвучка из текста в Eleven v4, v4 Turbo или v3, замена голоса в готовой записи, подача через теги и субтитры из озвучки или расшифровки видео.

Визуальный ряд собран, но без голоса и текста ролик ещё не готов к публикации. Озвучка и субтитры добавляются в том же проекте, без перехода в отдельные сервисы.

Озвучка создаётся в режиме «Озвучка» раздела «Генерация»: из текста или из готовой записи с заменой голоса. Готовый клип ложится на дорожку «Озвучка» в «Монтаже», а субтитры собираются из текста озвучки или расшифровки видео.

Добавляй голос, когда базовый визуальный ритм уже понятен, но ролик ещё легко поправить: озвучка часто меняет длину сцен и место для текста в кадре.

Что понадобится

  • Несколько готовых сцен или минимальный визуальный каркас ролика.

Пошагово

  1. 1

    Собери базовый визуальный ритм

    Голос и субтитры легче добавлять, когда уже понятна длина и логика сцен. Идеальная полировка картинки на этом шаге не нужна.

  2. 2

    Проверь текст в Eleven v4 Turbo

    Напиши текст с тегами и послушай черновик: темп, паузы и эмоции. Turbo вдвое дешевле v4.

  3. 3

    Озвучь финал в Eleven v4

    Перегенерируй утверждённый текст в v4 с теми же тегами. Готовая озвучка ляжет на дорожку «Озвучка» в «Монтаже».

  4. 4

    Собери субтитры

    Выбери стиль и положение. Проверь, что текст читается и не перекрывает важные детали кадра.

  5. 5

    Посмотри ролик целиком перед экспортом

    Посмотри дважды: со звуком и без. Сцены, голос, текст и темп должны работать вместе.

Откуда взять голос

  • Озвучка из текста

    Напиши текст, выбери модель и «Голос» из базовых или своих. Каждый голос можно прослушать до генерации.

  • Замена голоса в записи

    Eleven v2 меняет голос в готовой записи и сохраняет речь, темп и интонацию. Источник выбирается в «Источник озвучки»: «Из аудио/видео проекта», «Из аудио или видео» или «Микрофон», до 5 минут.

  • Свой голос

    «Медиатека» → «Голоса» → «Мои голоса» → «Новый голос»: добавь 1–2 минуты чистой речи. Обучение голоса доступно с активным тарифом, готовый голос появляется в выборе «Голос».

Какую модель выбрать

  • elevenlabs-tts-v4Основная модель для финальной озвучки: точнее следует тегам и учитывает контекст всего текста. До 2000 символов за запрос, 8–44 токена в зависимости от длины.
  • elevenlabs-tts-v4-turboТе же теги и настройки вдвое дешевле: 4–22 токена. Удобна для черновиков, чтобы проверить текст, темп и расстановку тегов.
  • elevenlabs-ttsДо 4000 символов за запрос и готовые пресеты «Подачи»: «Натурально», «Спокойно», «Выразительно», «Реклама».

Как задать подачу тегами

Интонацию задают теги в квадратных скобках прямо в тексте: [whispers], [excited], [laughs], [sighs], [pause]. Напечатай «[» в поле озвучки, и Givon предложит 12 тегов; свой тег до 40 символов тоже работает. Теги входят в число символов запроса.

Как выбрать голос, расставить теги и паузы, писать числа и какие шаблоны брать под рекламу, обучение и персонажей — в гайде по тексту для озвучки.

Пример в Eleven v4

[sighs] Опять ты за своё... [sarcastic] Конечно, это была ОЧЕНЬ хорошая идея. [exhales] Ладно. [curious] Рассказывай, что на этот раз?

Голос Marina, «Эмоциональность» 75%, «Сходство» 75%.

Настройки голоса

У Eleven v4 и v4 Turbo вместо «Подачи» две настройки в процентах. Кроме готовых значений, у каждой есть пункт «Своё значение».

«Эмоциональность»
По умолчанию 50%. Выше — выразительнее, но больше разница между дублями; ниже — ровнее и предсказуемее.
«Сходство»
По умолчанию 75%. Насколько озвучка похожа на выбранный голос; высокое значение передаёт и дефекты исходной записи.

Произношение

Слова, которые голос читает неправильно, исправляются в «Медиатека» → «Голоса» → «Словарь»: заполни «Слово или фраза» и «Как произносить» и проверь кнопкой «Прослушать». Правило действует во всех озвучках из текста.

Как собрать субтитры

Субтитры собираются на панели «Субтитры». Для озвучки из текста текст и тайминги слов уже готовы. Для видео со звуком нажми «Расшифровать», стоимость распознавания видна на кнопке до запуска.

Каждую фразу можно исправить, разделить, закрепить или удалить, а для всей дорожки выбрать стиль «Эфирный», «Акцент» или «Караоке» и одно из девяти положений в кадре.

Панель «Субтитры»: стиль и положение для всей дорожки

Если нужен говорящий персонаж

Когда голос должен звучать не за кадром, а из уст героя, используй модели с липсинком — они синхронизируют губы персонажа с озвучкой. А если персонаж нужен постоянный, начни с гайда по AI-инфлюенсеру.

  • sync-lipsync-v3Модель sync-3: синхронизирует губы на фото или готовом видео персонажа с озвучкой — до 5 минут. Подходит и для нового говорящего ролика, и для замены речи в снятом видео.
  • minimax-h3-max-lip-syncНовая модель в «Генерации» проекта: одно фото и готовая озвучка превращаются в говорящий ролик до 14,8 секунды, от 480P до 2K. Для коротких реплик.
  • kling-digital-humanФото персонажа плюс дорожка с речью: синхронизирует речь, мимику и жесты. Ролики до 5 минут — хватит и на Reels, и на полноценное объяснение.
  • heygen-photo-avatarСама подбирает мимику и жесты по тону голоса, до 60 секунд. Другой характер подачи — сравни на своём персонаже.
  • kling-lip-syncТолько перекладка губ в готовом видео под новую дорожку, до 60 секунд — узкий инструмент для дубляжа и замены слов.

Частые вопросы

Читай также