Что такое расшифровка речи и из чего складывается её качество
Технология, о которой идёт речь, называется распознаванием речи: на вход подаётся аудио, на выходе получается текст. Звучит просто, но качество здесь измеряют несколькими разными вещами, и от них зависит, пригодится вам результат или отправится в корзину.
Доля ошибок в словах: в англоязычных материалах WER, word error rate. Показывает, сколько слов распознано неверно. Чем ниже, тем лучше. FLEURS — открытый набор записей на многих языках, на котором эту долю принято измерять, чтобы сравнение было честным.
Разметка говорящих: она же диаризация. Модель не просто пишет текст, а помечает, где реплика одного человека, а где другого. Без этого расшифровка планёрки превращается в сплошное полотно, из которого непонятно, кто что обещал.
Временные метки: привязка слов к секундам записи. Это то, что позволяет искать по расшифровке и прыгать сразу к нужному месту в аудио вместо того, чтобы переслушивать всё.
Ключевые слова: в анонсе biasing. Список терминов, которые модель должна писать правильно: названия препаратов, артикулы, фамилии, имена брендов. Именно на них обычно и рассыпается автоматическая расшифровка.
Что произошло
Microsoft AI выпустила MAI-Transcribe-2 и утверждает, что она работает быстрее, точнее и дешевле аналогов от OpenAI, Google и ElevenLabs. Стоимость расшифровки часа аудиозаписи составляет 10 центов.
Что нового по сравнению с прошлыми версиями:
- языки: 60 против 43 у июньской версии и 25 у первой, апрельской. Русский в списке есть;
- плохой звук: модель оптимизировали под реальные записи: с фоновым шумом, низким качеством и наложением реплик;
- разметка и метки: модель помечает говорящих и ставит временные метки на уровне отдельных слов, что позволяет искать по расшифровке и синхронизировать её с видео;
- термины: можно передать список ключевых слов: названия препаратов, коды продуктов, имена собственные;
- два варианта текста: дословный, со словами-паразитами, и очищенный;
- смешанная речь: поддерживается переключение между языками даже в середине фразы.
Доступна модель на платформах Microsoft Foundry для разработчиков и MAI Playground для тестирования.
Что показали замеры
| Показатель | Значение | Комментарий |
|---|---|---|
| Доля ошибок в словах (FLEURS, 60 языков) | 5,2% | первое место в рейтинге |
| Тот же показатель у версии 1.5 (июнь) | 3,7% | но охват был 43 языка вместо 60 |
| Рейтинг Artificial Analysis | второе место | было третье; обошла ElevenLabs Scribe v2, уступила Alibaba Fun-Realtime-ASR-preview |
| Скорость | в 10 раз быстрее OpenAI GPT-Transcribe | по данным Microsoft; в 7 раз быстрее ElevenLabs Scribe v2, в 5 раз — Google Gemini 3.5 Transcribe |
| Цена | $0,10 за час аудио | у первой версии было $0,36 |
Одна цифра здесь требует пояснения, иначе её легко прочитать как ухудшение. Доля ошибок выросла с 3,7% до 5,2%, но вместе с ней вырос и охват: с 43 языков до 60. В набор попали языки, которые распознаются хуже, и средний показатель по всему набору сдвинулся. Это не то же самое, что «модель стала хуже работать» на конкретном языке.
Вторая оговорка: сравнение по скорости приводит сама Microsoft. Независимый рейтинг Artificial Analysis подтверждает движение вверх, но первое место в нём занимает другая модель.
Зачем это бизнесу
Расшифровка — редкий случай, когда польза от нейросети считается напрямую, без рассуждений про будущее.
Звонки отдела продаж: час разговоров стоит центы, а на выходе получается текст, по которому видно, какие возражения звучат чаще всего и на каком шаге разговор ломается. Разбор пяти звонков в неделю руками не делает почти никто, а по расшифровке это работа на полчаса.
Планёрки и встречи: с разметкой говорящих из расшифровки собирается список решений и договорённостей. Без разметки не собирается, поэтому она здесь и важна.
Интервью и исследования. Если вы опрашиваете клиентов, расшифровка нужна не ради красоты, а чтобы цитировать точно.
Озвучка наоборот. Обратная задача: превратить готовый текст в голос: сервисы для этого мы сравнивали в обзоре нейросетей для озвучки видео.
Контент. Записанный вебинар или подкаст превращается в текст, из которого дальше собираются статьи и посты. Как выстроить эту цепочку, мы разбирали в материале про нейросети для текста.
Чего расшифровка не делает: она не заменяет решение о том, что с этим текстом делать. Стенограмма планёрки без вытащенных из неё задач остаётся просто длинным файлом.
Как быть тем, кто работает из России
Скажем прямо: платформы Microsoft для разработчиков не оплачиваются российской картой, и доступ к ним из России требует ухищрений. Поэтому 10 центов за час стоит читать как ориентир цены на рынке; тарифом для российского пользователя это не станет, который вы завтра включите.
Практический путь такой:
- у российских облачных сервисов есть свои модели распознавания речи с оплатой в рублях, и начинать стоит с них, сравнивая на своих записях: чужие рейтинги здесь мало что дают;
- для разовых задач часто хватает бесплатных инструментов: диктофон с расшифровкой в мессенджере или встроенные субтитры видеоплатформ;
- если записи содержат персональные данные клиентов, вопрос выбора сервиса перестаёт быть вопросом цены: он превращается в вопрос о том, где эти записи хранятся.
Проверять качество нужно на своём звуке. Модель, отличная на чистой студийной записи, может рассыпаться на телефонном разговоре с шумом склада на фоне, а именно такие записи и есть у бизнеса.
Что сделать на этой неделе
- Возьмите три типовые записи: звонок клиенту, планёрку, интервью.
- Прогоните каждую через два доступных вам сервиса расшифровки.
- Посчитайте не «нравится или нет», а число правок: сколько раз пришлось лезть в аудио, чтобы понять, что имелось в виду.
- Проверьте отдельно имена, названия товаров и цифры: здесь ошибаются чаще всего.
- Решите, кто и когда читает расшифровки: без этого шага любая экономия остаётся на бумаге.
Частые вопросы
Русский язык поддерживается?
Да, он входит в список из 60 языков.
Почему доля ошибок стала выше, чем у прошлой версии?
Потому что расширился охват языков: с 43 до 60. Средний показатель по большему набору вырос, но это не значит, что качество на отдельном языке упало.
10 центов за час — это окончательная цена?
Microsoft называет её начальной и не говорит, изменится ли она в будущем.
Модель понимает, кто из говорящих кто?
Она размечает реплики по говорящим и ставит временные метки к словам. Имена участников она, разумеется, не знает: их подставляет человек.
Можно ли расшифровать запись с плохим звуком?
Модель специально оптимизировали под шумные записи и наложение реплик. Проверять всё равно нужно на своём материале: у каждого «плохой звук» свой.
