TubeSum

ElevenLabs Full Guide — Step-by-Step Guide & Transcript

How to Use ElevenLabs - Best Text to Speech AI Voices (FULL GUIDE)

0h 16m video Published Dec 28, 2023 Transcribed Aug 30, 2026 Alec Wilcock Alec Wilcock
Beginner 8 min read For: Content creators, marketers, and anyone interested in using AI voice generation for videos, podcasts, or other projects.
AI Trust Score 75/100
⚠️ Average / Some Fluff

"The title promises a full guide and delivers exactly that—a comprehensive walkthrough of ElevenLabs' features, though it could be trimmed of some filler."

AI Summary

This video is a comprehensive guide to ElevenLabs, a leading AI text-to-speech and voice synthesis tool. The creator demonstrates how to use the platform's features, including text-to-speech, speech-to-speech, voice cloning, and dubbing, while offering practical tips for achieving the best results.

[00:01]
Introduction to ElevenLabs

ElevenLabs is presented as one of the most realistic AI voice generators in 2024, capable of converting text to speech and processing audio recordings. The tool is described as affordable, with a free tier and a starter plan that includes 10 custom voices and 30,000 characters (about 30 minutes of audio) for $5/month after a $1 first month.

[01:11]
Context-Aware AI

ElevenLabs AI understands context, meaning it can interpret how to deliver a passage based on the text itself, making it more like a narrator than a simple text-to-speech tool. Users can guide the AI with settings to achieve a wide range of emotions.

[02:04]
Text-to-Speech Interface

The default tool is text-to-speech. Users can choose from a variety of pre-made male and female voices, each with tags indicating accent, tone, and recommended use cases (e.g., meditation, ASMR, news anchor).

[03:45]
Voice Settings: Stability

The stability slider controls consistency. Higher stability yields a more consistent but potentially monotonous voice; lower stability increases expressiveness but can lead to instability. The creator recommends keeping stability at 30% or higher for long text, but suggests experimenting with lower settings for short clips.

[04:55]
Voice Settings: Similarity & Style

The similarity slider determines how closely the AI matches the original voice; high similarity with poor audio can cause artifacts. Style exaggeration is an experimental feature that can increase instability and is best left at zero, as recommended by ElevenLabs.

[06:33]
Language Models

Four models are available: English V1 (oldest, fastest), Multilingual V1 (supports multiple languages), Multilingual V2 (supports 28 languages, more stable, better pronunciation), and Turbo V2 (optimized for real-time). The creator recommends Multilingual V2 for best quality.

[07:58]
Text Input Tips: Pauses

To create natural pauses, use the syntax 'time pause x seconds' (e.g., 'time pause 2 seconds'). This creates a natural speech pause rather than just silence. Alternatives like dashes or ellipses are less reliable.

[09:23]
Text Input Tips: Emotions & Tempo

Emotions can be conveyed by writing descriptive cues like 'She exclaimed joyfully: What a beautiful day!' or 'Stop!' he shouted angrily. Similarly, tempo can be indicated with phrases like 'he said slowly.'

[10:35]
Speech-to-Speech

This feature converts an audio input into a different voice while preserving the original's rhythm and manner of speaking. It's useful for re-recording without needing to re-record, and it can also improve poor audio quality.

[11:56]
Voice Lab & Voice Cloning

Users can create new synthetic voices from scratch (Voice Lab) or clone their own voice (Instant Voice Cloning). For cloning, high-quality audio is crucial; a 1-2 minute recording without background noise is optimal. The AI mimics accent, tone, breathing, and lip smacks.

[15:36]
Dubbing

ElevenLabs can dub audio into another language, translating the audio itself (not just subtitles) using your voice or another selected voice.

ElevenLabs is a versatile and powerful tool for generating realistic AI voices, with features ranging from text-to-speech to voice cloning and dubbing. By understanding and adjusting the settings, users can achieve professional-quality results for various applications.

Mentioned in this Video

Tutorial Checklist

1 02:04 Log in to ElevenLabs and navigate to the text-to-speech tool.
2 02:18 Select a pre-made voice from the dropdown menu, using tags to filter by accent, tone, and use case.
3 03:45 Adjust the stability slider: keep at 30% or higher for long text; lower for short clips to increase expressiveness.
4 04:55 Set the similarity slider based on audio quality; high for good audio, lower for poor audio. Keep style exaggeration at zero.
5 06:33 Choose the language model: Multilingual V2 is recommended for best quality.
6 07:58 Enter your text, using 'time pause x seconds' for natural pauses and descriptive cues for emotions and tempo.
7 10:35 For speech-to-speech, upload an audio file and select a different voice to convert it.
8 11:56 To clone a voice, go to Voice Lab, upload a high-quality 1-2 minute recording, and generate the clone.
9 15:36 Use the dubbing feature to translate audio into another language.

Study Flashcards (7)

What is the recommended stability setting for long text generation in ElevenLabs?

easy Click to reveal answer

Keep it at 30% or higher to avoid instability.

04:13

What syntax is used to create a natural pause in ElevenLabs text-to-speech?

easy Click to reveal answer

Use 'time pause x seconds' (e.g., 'time pause 2 seconds').

08:12

Which language model in ElevenLabs supports 28 languages and is recommended for best quality?

medium Click to reveal answer

Multilingual V2.

07:17

What is the optimal audio length for voice cloning in ElevenLabs?

medium Click to reveal answer

1-2 minutes of audio without reverb or background noise.

14:21

What does the 'similarity' slider control in ElevenLabs?

medium Click to reveal answer

It determines how closely the AI matches the original voice; high similarity with poor audio can cause artifacts.

04:55

What is the difference between text-to-speech and speech-to-speech in ElevenLabs?

medium Click to reveal answer

Text-to-speech converts text to speech, while speech-to-speech converts an audio input into a different voice while preserving the original's rhythm and manner.

10:35

How can you convey emotions in ElevenLabs text-to-speech?

hard Click to reveal answer

By using descriptive cues like 'She exclaimed joyfully: What a beautiful day!' or 'Stop!' he shouted angrily.

09:23

💡 Key Takeaways

💡

Context-Aware AI

This is a key differentiator from simple text-to-speech tools, as it allows for more natural and expressive narration.

01:11
🔧

Stability vs. Expressiveness Trade-off

Understanding this trade-off is crucial for achieving the desired voice quality, whether for consistency or emotional range.

04:13
📊

Multilingual V2 Model

This model's support for 28 languages and improved stability makes it the go-to choice for most users.

07:17
🔧

Optimal Voice Cloning Audio

The advice to use a 1-2 minute clean recording is a practical, actionable tip that significantly impacts clone quality.

14:21

[00:01] использовать 11 Labs, как преобразовывать текст в речь, создавать голоса для озвучивания, вам все, что я делаю, чтобы получить наилучшие результаты от этого удивительного инструмента синтеза речи [Музыка]. Если вы не знаете, 11 Labs — это

[00:17] генерировать речь из текста и обрабатывать аудиозаписи голосов, чтобы получить реалистичный голос ИИ. Я думаю, что 11 Labs — это действительно один из самых реалистичных генераторов голоса ИИ на рынке в 2024 году, и, честно говоря, он

[00:32] очень дешевый. Вы можете попробовать его бесплатно, но быстро получите ограничения по использованию. Если вы создадите бесплатный аккаунт, ваши лимиты будут немного больше, но, рекомендую начать со стартового плана, который включает 10 пользовательских голосов,

[00:45] 30 000 символов, что составляет около 30 минут озвучивания, согласно их оценке. Кроме того, стартовый план также включает коммерческую В платных проектах, и к тому же, первый месяц стоит всего доллар, а потом 5 долларов,

[00:58] цена чашки кофе. Честно говоря, я думаю, что больше компаний должны делать свои инструменты доступными таким образом, а позже, если вы начнете сталкиваться с ограничениями (хотя просто перейдете на план для создателей контента. И теперь большинство людей, с которыми я говорю

[01:11] о 11 Labs, на самом деле не до конца понимают, что это такое. Большинство людей думают, что это просто инструмент преобразования текста в речь, генератор речи, но это гораздо больше, чем просто это. Искусственный интеллект 11 Labs понимает контекст, а это значит, что если

[01:23] книги, ИИ попытается интерпретировать, как исполнить вступительный отрывок, исходя из контекста самого текста. Вы можете направлять его в процессе написания, него есть множество настроек, которые можно использовать для достижения

[01:38] широкого спектра эмоций. Это больше похоже на диктора, чем просто на обычный вы поймете почему чуть позже в этом видео. Позвольте мне показать вам на компьютере. Привет, YouTube! В описании есть ссылка для регистрации в 11 Labs.

[01:51] Это партнерская ссылка, но она ничего вам не будет стоить дополнительно, и это поможет Алеку создавать больше высококачественных видео, подобных этому. Итак, как только вы войдете в свою учетную запись, инструментом по умолчанию будет инструмент синтеза речи. Здесь

[02:04] текста. По сути, это инструмент преобразования текста в речь. Вверху вы заметите, вас есть два варианта: «Преобразование текста в речь» и «Преобразование речи в речь». Мы рассмотрим преобразование речи чуть позже. А теперь внизу у нас есть три

[02:18] разделе настроек, и эти три, вероятно, самые важные, на которые стоит первом выпадающем меню вы можете выбрать из множества различных готовых мужских и женских голосов. Как видите,

[02:33] слева у меня множество разных вариантов. Здесь мы можем нажать, чтобы просмотреть предварительный просмотр. Никогда не путайте движение с действием. И вы заметите, что у него есть название. А затем несколько тегов. Первый тег, фиолетовый, обозначает акценты, как вы видите, американский (у нас

[02:48] ирландский, британский, итальянский). Второй тег — это тон или шепот, спокойный, мягкий. Третий тег — рекомендуемый вариант использования ( красный, как вы видите): медитация,

[03:03] ASMR, озвучка, ведущий новостей. Если вы много времени проводите в социальных сетях, я уверен, вы слышали вот этот голос: « Позвольте миру жить так, как он хочет, и позвольте себе жить так, как вы хотите». Это, вероятно, один

[03:17] из самых известных голосов 11 Labs. Но есть и голоса Арнольда, которые, как мне кажется, звучат так, будто вас беспокоят Мастера. А если мы Где он?». Вы узнаете этот голос. Может быть, жизнь — это не поиск себя,

[03:31] только мне так кажется. И, очевидно, 11 Labs сделали это не специально, но интересно. Дальше У вас есть настройки голоса, и на первый взгляд это выглядит не волнуйтесь, я объясню и дам несколько рекомендаций.

[03:45] Итак, у вас есть три ползунка. Первый — стабильность. Чем дальше вы его сдвинете вправо, тем стабильнее станет голос, то есть он будет звучать более согласованно при

[03:59] генерации реплик, но может стать немного монотонным. Чем дальше вы его сдвинете влево, тем более нестабильным и изменчивым он станет. Увеличение изменчивости может сделать речь более выразительной, а результаты могут сильно

[04:13] различаться между генерациями, но это также может привести к нестабильности. Как видите, у нас есть эта красная зона, поэтому мы всегда должны стараться держать её на уровне 30% или выше, если вы генерируете длинные фрагменты текста. Я

[04:26] рекомендую оставаться на более стабильном уровне, так ваши рендеры будут более согласованными. Но если вы делаете короткие текстовые фрагменты или короткие видеоролики, возможно, стоит невероятных результатов вы сможете добиться. Нестабильные настройки. Привет, ребята! Если вы

[04:40] ещё не зарегистрировались в 11 Labs, я буду очень признателен, если вы воспользуетесь ссылкой в признателен, если вы воспользуетесь ссылкой в

[04:55] улучшение чёткости и сходства. Это определяет, насколько точно ИИ должен соответствовать его воспроизведения. Если оригинальный звук плохого качества, а ползунок сходства установлен на высокое значение, ИИ может воспроизводить

[05:10] попытке имитировать голос из записи. Что касается преобразования текста в речь, это на самом деле нормально, поскольку мы выбираем из готовых голосов, поэтому их почти оставляю это значение по умолчанию, но в основном, если ваш записанный звук хорош, установите его на

[05:24] высокое значение, а если он не так хорош, попробуйте рекомендую поэкспериментировать со всеми этими настройками, чтобы увидеть, какие забавные голоса вы можете получить. Затем у нас есть преувеличение стиля. Стиль

[05:38] доступен только в многоязычной версии. Модель V2, и я чуть позже перейду к языковым моделям, но эта настройка просто пытается усилить стиль оригинального говорящего. Это новая и более экспериментальная функция.

[05:50] Чем больше вы её увеличиваете, тем больше нестабильности вы получите. поэкспериментировать, хотя результаты получаются довольно странными, чем выше ползунок, как вы видите, красная зона здесь составляет от 50 до 100%, поэтому я всегда оставляю

[06:04] это значение равным нулю, и даже сама компания 11 Labs рекомендует всегда держать это значение на нуле. экспериментальная функция, если хотите здесь у нас есть переключатель усиления голоса, который включен по умолчанию.

[06:19] введена в более новых языковых моделях, довольно простая. Она просто увеличивает я обнаружил, что разница здесь очень-очень незначительная, поэтому это не стоит того, я просто оставляю его как есть, по умолчанию он включен. А

[06:33] здесь, в третьем выпадающем списке, у нас есть Различные языковые модели, и я переключимся на многоязычную версию V1, вы увидите, что мы потеряем последние две функции. Но если мы посмотрим ниже, то увидим, что они рекомендуют переключиться на

[06:48] многоязычную модель V2 (11 языков) для достижения наилучшего качества озвучивания. Поэтому я просто вернусь к этому. Но чтобы объяснить, что это такое, у нас есть четыре различные модели, и каждая из них имеет уникальные особенности. Итак, у нас есть

[07:00] английская V1 — самая старая и быстрая, разработанная для задач на английском языке, но с ограниченной точностью. У нас есть многоязычная V1, которая множество языков, включая различные диалекты английского языка, немецкий, польский и, как

[07:17] вы видите, еще несколько. Затем у нас есть многоязычная V2 (11 языков), которая является гораздо более продвинутой версией, поддерживающей 28 языков: японский, китайский, корейский и многие европейские языки. Эта версия более стабильна, имеет

[07:30] большее разнообразие языков, а также лучшую точность произношения. И наконец, здесь у нас есть Turbo V2 (11 языков), которая оптимизирована для работы в реальном времени. Для обработки английских диалектов с учетом задержки я всегда оставляю

[07:44] многоязычную версию V2. У каждой модели есть свои сильные стороны, но если вы, я бы всегда оставлял именно эту — она лучшая, одна больше свободы творчества и гибкости. А после того, как вы настроите

[07:58] вот текстовое поле, куда вы можете ввести все, что хотите, напечатать текст, вставить текст — все, что угодно, чтобы ИИ произнес. Правил нет, но есть несколько советов, как получить лучший

[08:12] результат. Первый — это паузы. Вы можете использовать синтаксис «время паузы x секунд», и это просто добавляет паузу, где X обозначает количество секунд, в течение которых голос должен делать паузу. Например, « время паузы 2 секунды» означает паузу в 2 секунды, а «

[08:27] время паузы 2 секунды» означает паузу в 2 секунды, а « паузу в 1,5 секунды. Преимущество этого в том, что это создает естественную паузу в речи, а не просто добавляет тишину. Пробел делает это естественным.

[08:40] Подождите, дайте мне секунду подумать. Хорошо, я нажму кнопку «Нравится». Я также пробовал и читал в интернете, что простой тире или три точки тоже подойдут, надежны и иногда звучат не так естественно, как использование синтаксиса. Подождите, дайте мне

[08:56] секунду подумать. Хорошо, я нажму кнопку «Нравится». Далее у нас произношение. Для английской модели V1 (которую я сейчас не использую) модели V1 (которую я сейчас не использую) вы можете настроить произношение,

[09:09] алфавит (IPA), но я недостаточно о нем знаю, поэтому не буду об этом говорить. Я просто поделюсь ссылкой на документацию от 11 Labs ниже. Затем у нас эмоции. С помощью 11 Labs вы можете заставить ИИ читать

[09:23] ваш текст с определенным эмоциональным тоном, используя диалоговые теги или контекст. 11 Labs даже утверждает, что лучший способ писать и подсказывать своему ИИ — это делать это так же, как написано в книгах. И это, кстати,

[09:36] касается эмоций. Например, для создания радостного тона можно написать: «Она радостно воскликнула: какой прекрасный день!» или «Ты уверен в этом?» — спросил он растерянным тоном, или даже « Прекрати!» — сердито крикнул он. Для более

[09:50] сердитого тона можно просто прочитать что-нибудь в книге. Попробуйте сделать так: «Почему ты еще не подписался?» — сердито крикнул он. создаст контекст, но вам просто придется удалить его в

[10:05] видеоредакторе, например, Premiere Pro. Что касается темпа, это то же самое, что и эмоция. Вы можете передать более медленный темп с помощью описательных выражений, например: «Мне очень нравятся долгие прогулки ночью», — медленно произнес он. «Мне очень

[10:21] от вас советы в комментариях ниже. Так что, если я что-то упустил или если есть считаете очень полезным, дайте мне знать. Но теперь, когда мы рассмотрели преобразование текста в речь, давайте посмотрим на преобразование речи в речь. Преобразование речи в речь по сути то же самое, что и преобразование

[10:35] Настройки те же, у вас есть три выпадающих меню, за исключением того, что здесь вы можете использовать только английскую вариантов нет. А если мы посмотрим вниз, то увидим, что

[10:47] это не текстовый ввод, а аудиовход. Нам нужно ввести аудиофайл или напрямую записать аудио, и тогда программа воспроизведет тот же самый звук другим голосом. Например, если я скажу: «Привет, меня зовут

[11:00] другим голосом. Например, если я скажу: «Привет, меня зовут Джеймс», пропустите это другим голосом, и получится: « Привет, меня зовут Джеймс». Возможно, речи в речь». Вы преобразуете один тон голоса в другой, что очень

[11:13] круто и быстро. Это значит, что вам не нужно тратить время на запись. Я мог бы просто взять микрофон, сказать именно то, что хотел, и чтобы это было сказано также будет учитывать ритм и манеру речи моей

[11:26] другим голосом. Доброе утро, дамы и господа! Сегодня мы поговорим об одном из моих любимых блюд: блинах с лимоном и сахаром. Доброе утро, дамы и господа! Сегодня мы поговорим об одном из моих

[11:41] любимых лакомств — вкусе пирога с лимоном и сахаром. Это действительно здорово! с плохим синтаксисом и темпом речи. Допустим, меня устраивает мой ввод, но меня не устраивает ни один из готовых голосов. Всё, что мне нужно сделать, это

[11:56] нажать «Добавить голос» прямо здесь, и я попаду в голосовую лабораторию. Здесь вы можете создать совершенно новый синтетический голос с нуля. Если у не будет доступа к клонированию голоса, но для этого вам нужно подписаться

[12:08] Думаю, это того стоит. Но на бесплатном аккаунте вы также можете получить доступ к голосам из библиотеки голосов. Это голоса, которыми люди решили поделиться с сообществом. Созданные вами голоса будут доступны только вам,

[12:21] если вы не решите поступить иначе. И вот, это действительно здорово! Всё, что мне нужно вы видите, Видите, я могу создать свой голос. Здесь я могу выбрать пол: мужской или женский, а также возраст: молодой, средний, пожилой. Кроме того,

[12:35] создании голоса доступны только акценты для английского языка, ниже вы можете регулировать их силу. Допустим, я хочу женский голос, я выберу

[12:47] британский, а затем установлю очень сильный акцент. Сначала мы думали, что компьютер — это калькулятор, потом выяснили, как превращать цифры в пишущая машинка. Как видите, генерация прошла довольно быстро и получилась очень

[13:01] генерации вы будете использовать некоторые символы. Здесь я использовал 128 символов, а текст по умолчанию — минимум 100. Если меня всё устраивает, я могу просто нажать «Использовать голос». Я

[13:14] могу дать ему имя, например, « Староанглийская леди». Я оставлю эти теги, но вы можете их изменить. Затем вы можете добавить Это очень уникально, и если вы создаёте много голосов, просто чтобы

[13:26] запомнить, вы нажимаете «Создать голос», и этот голос добавляется в вашу библиотеку. Вы можете найти их позже, как видите, я создал один раньше, это я с простудой, потому что я сейчас очень болен, но я всё ещё делаю этот урок.

[13:38] голос, я просто нажимаю на «плюс» и перехожу к мгновенному клонированию голоса. нажимаю «Алек 2», а затем просто перетаскиваем файл, чтобы я мог Ой, он должен быть меньше 10 мегабайт, я забыл это, но у меня есть один

[13:54] прямо здесь, я могу просто перетащить его. Что касается вашей аудиозаписи, есть несколько вещей, которые нужно знать, чтобы получить наилучший клон вашего голоса: качество записи очень важно, и это на самом деле важнее, чем

[14:07] всё, что больше 5 минут, не имеет большого значения). Вам нужно избегать как можно больше отвлекающих шумов. По возможности избегайте фонового шума и отвлекающих факторов. Старайтесь записывать звук на микрофон с хорошим качеством, это

[14:21] 11 Labs, кажется, сами говорили, что оптимальным вариантом является 1-2-минутная аудиозапись без реверберации и фонового шума. Искусственный интеллект пытается имитировать всё, что слышит в записи:

[14:35] акцент, тон, дыхание, звуки и щелчки губ. Вы можете чтобы получить ещё более уникальный голос. Но поскольку ИИ если в ней есть что-то ещё, например, фоновый шум, он также

[14:50] Честно говоря, чем выше качество аудиозаписи, тем Но после этого вы можете добавить больше сэмплов, если хотите. Я не думаю, что добавление большего количества сэмплов обязательно лучше. Думаю, одна запись

[15:05] же акцентом даёт наилучший клон голоса. Мне кажется, записи мое субъективное мнение, и я еще не клонировал голос с 25 сэмплами. Может, комментариях. А ниже вы можете добавить метки, описание и подтвердить,

[15:21] клонировать, очевидно, не чей-то голос, который вы клонируете незаконно. Затем вы просто добавляете голос, и ИИ за несколько секунд или минут генерирует ваш голос, и вуаля! Теперь я могу нажать « Использовать». Меня перенаправляет в

[15:36] инструмент синтеза речи, где мой голос предварительно выбран, и я могу изменить эти параметры, настроить их и напечатать все, что захочу. И наконец, последнее, что может делать 11 Labs, это дубляж. Здесь вы можете

[15:49] другой, и это не перевод в виде субтитров, а перевод вашего аудио на другой язык на другой язык вашим

[16:05] полезным и вы хотите поддержать меня бесплатно, вот ссылка. Если вы партнерская ссылка. Я получу небольшую комиссию, и для вас это не повлечет дополнительных затрат. Но уже зарегистрированы, я буду очень признателен за подписку и лайк.

[16:21] appreciate a subscribe and a like button thanks for watching peace out

More from Alec Wilcock

View all

⚡ Saved you 0h 16m reading this? Transcribe any YouTube video for free — no signup needed.