Что сервис умеет
Не только читать текст вслух. За последние два года ElevenLabs вырос в набор инструментов
вокруг звука.
Синтез речи
Основная функция: текст на входе, аудио на выходе. В библиотеке больше тридцати готовых
голосов, плюс общая база, куда голоса выкладывают сами пользователи, — там их тысячи.
У каждого голоса настраиваются устойчивость (насколько он держит один и тот же тон),
схожесть с оригиналом и выразительность.
Отдельная возможность старшей модели — метки эмоций прямо в тексте. Пишете в квадратных
скобках «шёпотом» или «со смехом», и модель отыграет это ровно в нужном месте, вместо того чтобы тянуть один тон
через всю фразу.
Дизайн голоса
Голос описывается словами вместо выбора из списка: «мужской, низкий, спокойный, слегка
усталый, лет пятидесяти». Сервис соберёт такой и сохранит в вашу библиотеку. Полезно, когда
у бренда должен быть узнаваемый голос, которого нет у конкурентов, — из общей библиотеки
тот же голос может взять кто угодно.
Клонирование голоса
Два уровня, и разница между ними принципиальная.
Мгновенное клонирование работает по короткой записи — минута-две чистой речи. Доступно
с самого дешёвого платного тарифа. Похоже, но слышно, что копия: интонации беднее оригинала.
Профессиональное клонирование требует длинной записи — от получаса — и обучается дольше.
Результат заметно ближе к оригиналу. Доступно с тарифа Creator, а на старших тарифах даётся
несколько таких клонов.
🔴 Юридическая сторона важнее технической: голос человека — часть его личности, и клонировать
чужой голос без письменного разрешения нельзя. Сервис требует подтверждения прав при
профессиональном клонировании, но ответственность за использование остаётся на вас.
Распознавание речи
Обратная задача: аудио на входе, текст на выходе. Модель Scribe различает говорящих —
до тридцати двух человек в одной записи — и расставляет, кто что сказал. Это то, что нужно
для расшифровки созвонов и интервью.
Дубляж видео
Загружаете ролик на одном языке — получаете на другом, причём голосом исходного спикера.
Липсинк (совпадение с движением губ) сервис не делает, но голос и интонация сохраняются,
и для говорящей головы в кадре этого достаточно. Доступно с тарифа Starter.
Генерация музыки
Отдельный продукт Eleven Music: описываете словами настроение и жанр, получаете трек.
Коммерческое использование — с платных тарифов. Для фоновой музыки под ролик рабочий
вариант, для полноценного релиза — пока нет.
Голосовые агенты
Собеседник, который слушает и отвечает голосом в реальном времени. На этом строят
автоответчики, голосовых помощников и обзвоны. Здесь всё решает задержка: паузу дольше секунды
человек воспринимает как «связь оборвалась».
Модели: какая для чего
Внутри сервиса несколько моделей, и выбор между ними — это выбор между качеством
и скоростью.
Eleven v3 — для качества
Флагман. Больше семидесяти языков, самая живая интонация, умеет расставлять
эмоции по специальным меткам прямо в тексте: смех, шёпот, вздох. Подходит для роликов,
аудиокниг, всего, что слушают внимательно.
Multilingual v2 — для длинных текстов
Предыдущее поколение, 29 языков. Держит длинные тексты стабильнее,
поэтому для больших материалов её иногда выбирают до сих пор.
Flash v2.5 — для реального времени
Быстрая. Задержка около 75 миллисекунд против нескольких сотен у старших
моделей, 32 языка, и она дешевле. Нужна там, где важнее всего мгновенность: голосовые помощники,
живые диалоги.
Scribe v2 — для расшифровки
Распознавание речи, больше девяноста языков. Есть версия для реального
времени с задержкой около 150 миллисекунд.
Модели Turbo v2 и v2.5 объявлены устаревшими — вместо них рекомендуют Flash.
Как звучит русский язык
Русский поддерживается во всех основных моделях. По качеству — заметно лучше классических
синтезаторов, но с двумя оговорками, о которых стоит знать заранее.
Ударения
Модель училась в основном на английском, и в русских словах с подвижным
ударением ошибается: «зАмок» вместо «замОк», «дорогА» вместо «дОрога». В большинстве случаев
контекст спасает, но проверять текст перед выпуском приходится.
Иностранные слова и аббревиатуры
«SMM», «CRM», «UTM» читаются то по-английски,
то по буквам, непредсказуемо. Лечится тем, что в тексте их пишут кириллицей так, как надо
произнести: «эс-эм-эм», «си-эр-эм».
Практический вывод: для рекламного ролика на 30 секунд качество избыточно хорошее,
для часовой аудиокниги на русском — потребуется вычитка и правка текста под произношение.
Сколько стоит: тарифы и что в них входит
Цены официальные, со страницы тарифов на 25 августа 2026 года. Рубли — пересчёт по курсу
Центробанка на ту же дату (83,29 ₽ за доллар), без учёта комиссий за перевод.
Единица счёта — кредит. Грубо: один кредит ≈ один символ текста, тысяча кредитов ≈ минута
звучания.
Первый месяц на Creator стоит $11 вместо $22.
При годовой оплате два месяца бесплатно — платите за десять. Превышение лимита оплачивается
отдельно: около $0,36 за минуту на бесплатном плане и около $0,17 на старших.
Отдельно есть грант для стартапов: 12 месяцев бесплатно и 33 млн символов на разработку
голосовых агентов.
Сколько это в реальных задачах
Тарифы в кредитах мало о чём говорят, пока не переведёшь их в работу.
Рекламный ролик на 30 секунд — около 500 кредитов. На бесплатном тарифе таких получится
двадцать в месяц, но использовать их в рекламе нельзя: нужна коммерческая лицензия.
Десять рилсов по минуте — около 10 000 кредитов. В Starter с его 30 000 влезает с запасом,
даже если параллельно озвучивать что-то ещё.
Час аудиокниги — около 60 000 кредитов, то есть половина тарифа Creator за $22.
Автоответчик на 200 коротких реплик — около 20 000 кредитов, и здесь важнее не объём,
а модель: нужна быстрая Flash, иначе собеседник будет ждать ответа дольше, чем терпит.
Озвучка курса на 10 часов — около 600 000 кредитов, ровно тариф Pro за $99. Для сравнения:
живой диктор за десять часов чистой озвучки на русском возьмёт, по ценам бирж, от 30 тысяч
рублей — и это без правок, которые в озвучке курса неизбежны.
Где считать легко ошибиться
Кредиты списываются за каждую генерацию, включая черновые. Если вы переозвучили фразу
пять раз, подбирая интонацию, спишется пять раз. На коротких роликах это незаметно,
на большом проекте разница между «текст на 60 000 знаков» и реальным расходом легко
оказывается двукратной.
Отсюда рабочая привычка: сначала вычитать текст целиком и прогнать пробный кусок на минуту,
и только потом запускать весь материал.
Как оплатить из России
Карты российских банков сервис не принимает — ни МИР, ни выпущенные в России Visa
и Mastercard. Плюс к этому платёж не пройдёт с российского адреса даже с иностранной картой:
страна определяется по адресу подключения.
Рабочих путей три, и все со своими рисками:
Иностранная карта
Карта банка другой страны плюс подключение через сервер за пределами России. Самый прямой
путь и самый устойчивый: оплата идёт напрямую, без посредников, и подписка продлевается сама.
Минус один — такую карту надо где-то получить.
Виртуальные карты финтех-сервисов
Реквизиты, выпущенные под конкретный платёж или под конкретную подписку. Пополняются рублями,
платят долларами. Работает, пока работает сам провайдер: за последние годы часть таких
сервисов закрывалась вместе с деньгами клиентов, поэтому крупные суммы на балансе держать
не стоит.
Посредники, принимающие рубли
Оплачиваете рублями, они оплачивают подписку. Дороже на комиссию — обычно 10–20% — и требует
доверия: посредник либо получает доступ к вашему аккаунту, либо оплачивает по вашим данным.
Для разовой покупки терпимо, для рабочего инструмента на год — риск.
🪤 Отдельно про риск, о котором обычно не пишут: правила сервиса допускают ограничение
доступа для отдельных стран. Оплаченная подписка не даёт гарантии, что аккаунт не потеряет
доступ. Для рабочего процесса, от которого зависят деньги, это стоит закладывать заранее —
и держать запасной вариант.
Российские альтернативы и их цены
Если задача — озвучка на русском, а не английский с эмоциями, российские сервисы решают её
без танцев с оплатой и в разы дешевле.
SaluteSpeech (Сбер)
Синтез — 1 000 ₽ за миллион символов, распознавание — 1 200 ₽
за тысячу минут. Это примерно 1 ₽ за тысячу символов. Работает без ухищрений, оплата
рублями. ⚠️ С 15 июля 2026 года прекращены продажа новых пакетов и продление бесплатного
тарифа для физических лиц — для компаний всё осталось.
Yandex SpeechKit
Тот же класс задач, цены сопоставимого порядка, считаются за символы
и за запросы; актуальные цифры смотрите в документации Yandex AI Studio — они менялись
за последний год.
Сравнение в лоб
Тысяча символов озвучки:
- ElevenLabs на тарифе Creator — около $0,18, это ≈15 ₽;
- SaluteSpeech — 1 ₽.
Разница примерно в пятнадцать раз. За неё вы получаете более живую интонацию, клонирование
голоса и семьдесят языков. Если нужен русский диктор для рекламы или обучающего видео —
переплата спорная. Если нужен свой голос, эмоции или озвучка на нескольких языках —
альтернатив немного.
Мы разбирали, чем озвучивают видео и что выбрать под задачу, отдельно:
нейросеть для озвучки видео. А общий обзор того, какие
модели за что отвечают в 2026 году — нейросети 2026: какую выбрать.
Как это встроить в работу, а не просто попробовать
Первые полчаса в сервисе выглядят волшебно, а через неделю оказывается, что озвучка занимает
столько же времени, сколько раньше. Разница между «поиграл» и «работает» — в трёх привычках.
Один голос на весь канал
Соблазн менять голоса под настроение ролика велик, но зритель узнаёт канал по голосу так же,
как по обложке. Выберите один и зафиксируйте его настройки: устойчивость, схожесть,
выразительность. Записанные цифры — это ваш стандарт, к нему возвращаются после каждого
эксперимента.
Текст пишется под произношение
Это главное, что экономит время. Синтезатор читает ровно то, что написано, поэтому текст под
озвучку правится заранее:
- аббревиатуры латиницей заменяются на кириллицу так, как их произносят;
- числа пишутся словами там, где важно, как их прочтут: «две тысячи двадцать шестой»
вместо «2026»;
- длинные предложения режутся на короткие — модель не всегда угадывает, где сделать паузу;
- на месте нужной паузы ставится точка или тире, а не запятая.
Пять минут правки текста экономят полчаса переозвучки.
Проверка на минуте, а не на всём материале
Прогоняйте первую минуту, слушайте её целиком и только потом запускайте остальное.
Так вы ловите неверные ударения и слишком быстрый темп до того, как потратите кредиты
на весь материал.
Если собираетесь клонировать свой голос
Качество клона на девять десятых зависит от исходной записи, а не от тарифа.
Что нужно: тихая комната без эха, один и тот же микрофон на всю запись, ровный темп речи.
Полчаса чистого текста дают заметно лучший результат, чем два часа записи с паузами,
покашливанием и сменой громкости.
Чего избегать: записи с созвонов (сжатие убивает высокие частоты), нескольких сессий
в разной акустике, эмоциональных перепадов. Модель усредняет всё, что услышала, — и если
половина записи бодрая, а половина усталая, клон получится никакой.
Проверить результат стоит на тексте, который в обучающую запись не входил: на знакомых
фразах любая копия звучит убедительно.
Как выбрать голос под задачу
Библиотека большая, и это скорее мешает: люди слушают двадцать голосов, теряют час и берут
первый попавшийся. Работает более узкий подход.
Сначала определитесь с ролью говорящего. Диктор рекламного ролика, рассказчик аудиокниги,
собеседник в приложении и голос обучающего курса — четыре разные манеры, и голос под них
нужен разный. Реклама требует плотного, уверенного тона; обучение — спокойного и ровного,
который не утомит за сорок минут.
Дальше слушайте не демо-фразу из библиотеки, а свой текст. Демо подобрано так, чтобы голос
звучал выигрышно; ваш абзац с числами, названиями и специфической лексикой покажет
настоящую картину.
И проверяйте на длине, которая вам реально нужна. Голос, приятный на десяти секундах,
на пятнадцатой минуте может начать раздражать — это слышно только на длинном фрагменте.
Частые ошибки новичков
Озвучивают текст, написанный для чтения глазами. Статья и сценарий ролика — разные жанры.
Написанное для глаз в озвучке звучит канцелярски: длинные предложения, причастные обороты,
вводные конструкции. Сценарий пишут короткими фразами, как говорят вслух.
Ставят максимальную выразительность. Кажется, что чем живее, тем лучше. На практике
высокая выразительность делает интонацию непредсказуемой: в одном предложении модель
шепчет, в другом почти кричит. Для ровного повествования выразительность держат в средних
значениях, а эмоции добавляют точечно.
Забывают про коммерческую лицензию. Бесплатный тариф не даёт права использовать
озвучку в рекламе и в монетизируемых роликах. Ограничение здесь юридическое, а технически файл спокойно скачается. Претензия придёт со стороны площадки, когда правами заинтересуются.
Клонируют голос коллеги «для теста». Даже без злого умысла это использование чужих
персональных данных. Разрешение берут письменно до записи.
Считают бюджет по финальному хронометражу. Списываются все генерации, включая неудачные
дубли. Реальный расход на большом проекте обычно в полтора-два раза выше расчётного.
Кому подходит, а кому не стоит
Подходит:
- монтажёрам и авторам роликов, которым нужен один узнаваемый голос во всех видео;
- тем, кто делает контент на нескольких языках: дубляж голосом того же спикера экономит
недели;
- разработчикам голосовых помощников — из-за быстрой модели Flash. Если голосовой обзвон
нужен не как эксперимент, а как рабочий канал с записями разговоров и передачей заявок
в CRM, такие сценарии проще собирать на платформе, где телефония и сценарий уже связаны, —
у нас это
голосовые кампании в Ноя;
- всем, кому нужно клонировать конкретный голос (с разрешения владельца).
Не стоит:
- если задача — только русская озвучка обычных роликов: дороже в разы без выигрыша,
который вы услышите;
- если процесс критичен для бизнеса и остановка недопустима: доступ зависит от страны
и может измениться;
- если нет способа стабильно платить: подписка обрывается вместе с работой.
Для тех, кто делает ролики целиком нейросетями, связка обычно другая: генератор видео плюс
озвучка. Как это устроено на практике, разбирали в обзоре
Doitong — генератора ИИ-видео и в материале про
говорящего ИИ-аватара.
Что изменилось за последний год
Тем, кто пробовал сервис в 2024–2025 годах, стоит знать, что изменилось.
Появилась модель Eleven v3
Главное отличие от прежних — управление эмоциями прямо
из текста и заметно более естественная интонация в диалогах. Число языков выросло
до семидесяти с лишним.
Старые быстрые модели ушли
Turbo v2 и v2.5 объявлены устаревшими: вместо них Flash v2.5,
которая и быстрее, и дешевле.
Распознавание стало отдельным продуктом
Scribe v2 работает с девятью десятками
языков и различает до тридцати двух говорящих, а версия для реального времени сама определяет
язык на лету.
Музыка стала отдельным направлением
Eleven Music вышла из экспериментов, коммерческое
использование разрешено с платных тарифов.
Доступ из России ужесточился
Раньше сайт открывался, и ограничение касалось в основном
оплаты. Сейчас, по нашей проверке от 25 августа 2026 года, перенаправление на страницу
ограничений отдаёт и сайт, и программный интерфейс.
Частые вопросы
Можно ли пользоваться бесплатно?
Да, 10 000 кредитов в месяц — около десяти минут озвучки. Но коммерческой лицензии на этом
тарифе нет: для рекламы, продажи и монетизируемых роликов нужен минимум Starter за $6.
Заблокируют ли аккаунт за российский IP?
Про блокировку самих аккаунтов правила сервиса прямо не говорят, но право ограничивать
доступ по странам в них закреплено. На практике вы просто не попадёте внутрь без VPN.
Разумная предосторожность — не завязывать на сервис процесс, остановка которого дорого
обойдётся.
Насколько хорошо звучит русский?
Заметно лучше классических синтезаторов, но с ошибками в ударениях и в чтении латинских
аббревиатур. Для короткого ролика — отлично, для длинного текста нужна вычитка.
Можно ли клонировать чужой голос?
Технически да, юридически — нет без согласия владельца. Голос человека относится к его
персональным данным и охраняемым признакам; использование чужого голоса в рекламе без
разрешения — прямой путь к иску.
Что дешевле для русской озвучки?
Российские сервисы: около 1 ₽ за тысячу символов против примерно 15 ₽ у ElevenLabs
на тарифе Creator. Разница в интонации есть, но не в пятнадцать раз.
Нужен ли VPN, если я плачу иностранной картой?
Да. Страна определяется по адресу подключения: без VPN не откроется даже страница оплаты.
Что будет с уже оплаченной подпиской, если доступ закроют жёстче?
Гарантий нет. Поэтому для рабочих процессов стоит держать запасной сервис и не переносить
в один инструмент всё, от чего зависят сроки.