Мой замер: как я проверял качество
Обзоры обычно пишут «точность 99%», не объясняя, откуда цифра. Я сделал проверку, которую можно повторить.
Что я сделал. Собрал сценарий типичной планёрки: 9 реплик, два голоса, 141 слово. Внутри намеренно оставил то, на чём машины ошибаются чаще всего: цифры (18 процентов, 112 диалогов, 450 тысяч, 940 против 610), даты (26 августа), фамилии (Иванов, Смирнова), названия площадок (Авито, Директ) и аббревиатуру ИИ.
Текст я озвучил синтезом речи двумя русскими голосами, мужским и женским, и склеил в одну запись длительностью 68,8 секунды. Это дало главное преимущество замера: я точно знаю эталон, с которым сравнивать.
Три условия записи: одну и ту же запись я испортил двумя способами, чтобы проверить устойчивость.
Чем расшифровывал: движком Voxtral Small через OpenRouter: это та модель, которая расшифровывает голосовые в нашей платформе. Замер шёл 7 сентября 2026 года.
Как считал ошибки: побуквенно сравнивать бессмысленно, поэтому я взял стандартную метрику: доля слов, которые пришлось бы исправить, чтобы получить эталон. Числа перед сравнением привёл к одному виду, потому что «восемнадцать процентов» и «18%» это одно и то же для читателя.
Результат: сколько ошибок и на чём
Первое, что видно: условия записи почти не влияют. Разница между студийной записью и телефонным каналом составила одно слово. Расхожее «сначала купите хороший микрофон» для этой задачи не работает.
Второе важнее: ни одна цифра не потерялась. Все числа расшифрованы верно: 18%, 26 августа, 40 секунд, 112 диалогов, 19, 17%, 450 тысяч, 200 тысяч, 120 и 80, 940 против 610. Фамилии Иванов и Смирнова, города и названия площадок тоже на месте.
Тогда откуда 11 ошибок? Разберу их, потому что это и есть настоящий ответ на вопрос «можно ли доверять».
Грамматические мелочи: «дальше» вместо «далее», «на каких вопросах» вместо «на какие вопросы», «просил» вместо «попросил». Смысл не меняется, читателю всё понятно.
Род говорящего: реплику женского голоса «согласна» модель записала как «согласен». Машина не знает, кто говорит, а разделения на спикеров у этого движка нет вовсе.
Единственная смысловая потеря: аббревиатура «ИИ-сотрудник» превратилась в «И сотрудник». Это ровно та ошибка, которая опасна: термин исчез, и по тексту непонятно, о чём речь.
🪤 Вывод для практики: доверять машинной расшифровке цифр и фамилий можно, а термины и аббревиатуры своей отрасли надо проверять глазами. Особенно если в разговоре звучат названия продуктов, сокращения и профессиональный сленг.
Что этот замер меняет на практике
Из трёх наблюдений выше следует несколько решений, которые экономят время и деньги.
Не тратьтесь на технику ради расшифровки: телефонная запись с узкой полосой дала точность 91,5% против 92,2% у студийной. Если вы собирались покупать петличный микрофон только ради конспектов, это лишний расход.
Расшифровку читать не нужно: готовый текст всё равно приводится в человеческий вид отдельно, этим занимается нейросеть для текста. 68 секунд разговора превратились в 877 знаков сплошного текста без абзацев и без указания, кто говорит. Час встречи даст примерно 45 000 знаков такого полотна. Ценность появляется только после второго шага, когда из этого текста собирается структура.
Термины проверяйте списком: соберите 10–15 слов своей отрасли, которые звучат на каждой встрече, и просто прочитайте по ним готовый конспект. Это займёт минуту и снимет главный риск.
Скорость больше не аргумент: минута аудио расшифровывается за 4–5 секунд. Час записи это примерно 4 минуты ожидания, а у специализированных сервисов и того меньше.
Сколько стоит расшифровка: сравнение цен
Цены собраны 7 сентября 2026 года из официальных источников, курс доллара ЦБ на дату замера 86,59 ₽.
К цене расшифровки добавляется цена второго шага. В моём прогоне сборка протокола из расшифровки заняла 9,3 секунды и 1492 токена, это около 0,79 ₽. Для часовой встречи второй шаг обойдётся примерно в 4–5 ₽.
Итог по деньгам: полная обработка часовой встречи своим сотрудником стоит около 35 ₽. Готовый сервис с подпиской выходит примерно в те же деньги, но без единой строчки настройки.
Буквица: телеграм-бот, который я рекомендую
Если задача звучит как «есть запись, нужен текст, и я не хочу ничего настраивать», проще всего взять готовый бот. Мы пользуемся Буквицей и рекомендуем её осознанно: она делает транскрипты быстро и качественно, а начать можно прямо из Telegram, без регистрации на сайте и без карты.
Что она умеет по данным разработчика:
- превращает в текст аудио, видео и голосовые сообщения;
- принимает ссылки на YouTube, Rutube, Instagram, а также файлы с Яндекс и Google Дисков;
- заявленная точность 99,5%, поддержка 22 языков;
- час записи обрабатывается примерно за 2 минуты;
- кроме дословного текста собирает структурированный конспект с ключевыми мыслями и цитатами;
- результат выгружается в документ для правки.
По странице бота в Telegram им пользуются 54 783 человека в месяц, то есть это живой сервис с постоянной аудиторией.
Почему именно бот: голосовые сообщения и записи созвонов и так лежат в мессенджере. Переслать их в бот это два касания, а результат приходит туда же. Никакой пересылки файлов на почту и загрузки на сторонние сайты.
Как начать: откройте бот по ссылке t.me/bykvitsa, перешлите ему голосовое или файл и посмотрите на результат. Новым пользователям дают несколько бесплатных расшифровок, этого хватает, чтобы понять, подходит вам такой формат работы или нет.
🪤 Расхождение в источниках, о котором честно предупреждаю. Публичные обзоры называют разные цены: где-то «час транскрибации за 8 ₽», где-то «8 ₽ за минуту», где-то тарифы 490, 649 и 1449 ₽ в месяц с разным числом часов. Разделение на спикеров тоже описано по-разному: в интервью основателя сказано, что этой опцией пожертвовали ради скорости, а в свежих обзорах она упоминается в старших тарифах. Причина расхождений простая: сервис живой и тарифы менялись. Актуальные условия смотрите в самом боте, а не в обзорах, включая мой.
Встроенная расшифровка в видеовстречах
Если встречи проходят в одном сервисе, проще включить то, что уже оплачено.
Zoom AI Companion: умеет сам собрать конспект встречи и «умную запись». Русский язык в списке поддерживаемых есть: официальная справка Zoom перечисляет его и для Meeting Summary, и для Smart Recording. Здесь важно предупредить: в русскоязычных обзорах встречается утверждение, что русского у AI Companion нет. Я проверил первоисточник, и это не так.
Яндекс Телемост и Алиса Про: по справке Яндекс 360 конспект доступен организациям с подпиской от тарифа «Минимальный», аккаунты должны быть на домене компании. Запускает конспект организатор или соорганизатор, результат приходит им на почту, остальным участникам только если организатор включил такую опцию. Приходят два документа: краткий пересказ с разделом договорённостей и полная расшифровка речи. Запись встречи хранится 24 часа, пока готовится конспект, потом удаляется. Обучение моделей на разговорах сотрудников Яндекс отдельно исключает.
Контур.Толк. На странице сервиса заявлены автоматическая расшифровка с тайм-кодами и ИИ-конспект, в котором фиксируются решения и задачи с ответственными и сроками. Это ближе всего к тому, что обычно нужно бизнесу: сразу протокол.
МТС Линк. На главной странице перечислены резюме встречи, текстовая расшифровка и ИИ-помощник, отдельно указано, что на пользовательских данных модели не обучаются.
Ограничение у всех четырёх одно: работает только внутри своей платформы. Голосовое от клиента в WhatsApp, запись с диктофона на телефоне, разговор в машине через мессенджер эти инструменты не увидят. Для бизнеса, где половина общения идёт в мессенджерах, встроенный конспект закрывает лишь часть задачи.
Движки и API: для тех, у кого есть разработчик
Этот раздел пригодится, если расшифровка нужна внутри вашего продукта или в большом объёме.
Yandex SpeechKit: три режима с разной ценой: синхронный для коротких фрагментов в реальном времени, асинхронный для файлов и отложенный, самый дешёвый. Отложенный режим стоит 0,0381 ₽ за 15 секунд, то есть час аудио обходится примерно в 9 ₽. Минимальная единица тарификации 15 секунд, короткие файлы округляются вверх.
OpenAI. Whisper и gpt-4o-transcribe стоят $0,006 за минуту, облегчённая gpt-4o-mini-transcribe вдвое дешевле. Оплата в валюте, что для российской компании отдельная задача.
Voxtral Small. Мультиязычная модель, которая принимает аудио напрямую. Именно её я гонял в замере: 69 секунд записи обошлись в $0,0069, это примерно 0,60 ₽.
Когда расшифровка встраивается в рабочий процесс целиком, начинаются агентные сборки: как это выглядит на практике, показано в разборе скиллов Claude Code.
Локальный Whisper: модель можно поставить на свой компьютер или сервер и не платить за минуты вовсе. Плата другая: время на установку, требования к железу и скорость ниже облачной. Разумно, если записей много и они конфиденциальные.
🪤 Общее для всех API: они отдают только текст. Конспект, решения и задачи из него всё равно собирает языковая модель на втором шаге, и это отдельный запрос и отдельные деньги.
Свой ИИ-сотрудник в мессенджере
Теперь про третий путь, ради которого затевалась статья. Идея простая: не сервис с кнопками, а сотрудник в переписке, который принимает голосовое и возвращает результат в вашем формате.
Как это работает: у сотрудника есть системный промпт: кто он, что делает с полученной записью, в каком виде отвечает. Вы пересылаете ему голосовое или файл, он расшифровывает и сразу собирает протокол по вашему шаблону. Никаких «скачать текст, открыть, скопировать, попросить нейросеть сделать выжимку».
Чем это отличается от бота-транскрибатора:
- формат ответа задаёте вы, а не разработчик сервиса;
- сотрудник помнит контекст: ваши проекты, имена коллег, названия продуктов;
- его можно попросить сразу занести задачи в таблицу или прислать напоминание;
- он живёт в том же чате, куда клиенты и коллеги и так шлют голосовые.
Где это ставится: такой сотрудник поднимается на любой платформе с агентами и подключением мессенджеров. Дальше показываю сборку на нашей — Ноя, потому что в ней голосовые в диалогах расшифровываются сами, без отдельных настроек и без стороннего сервиса.
Сотрудник-протоколист: сборка за вечер по шагам
Разбираю по шагам, чтобы было видно объём работы. Ни одного из них не требуется разработчик.
Шаг 1. Заведите агента и опишите его роль. В настройках агента вставляется промпт протоколиста из следующего раздела. Роль опишите одной фразой: принимает записи и голосовые, возвращает протокол в заданном виде.
Шаг 2. Подключите канал, куда прилетают записи. Telegram для внутренней работы, WhatsApp, если голосовые шлют клиенты, Авито, если переписка идёт там. Каналы вы подключаете в одном кабинете, агент работает один на все.
Шаг 3. Задайте формат ответа. Тут решает не технология, а ваша дисциплина: какие блоки нужны, в каком порядке, что делать с непонятными местами. Формат из промпта ниже я проверил на реальном разговоре, начните с него.
Шаг 4. Добавьте словарь своих терминов. Названия продуктов, фамилии, сокращения, имена площадок. Это лечит единственную ошибку из моего замера, когда «ИИ-сотрудник» превратился в «И сотрудник».
Шаг 5. Решите, куда уходит результат. Протокол вы оставляете в чате или отправляете в задачи и в карточку сделки. Правило простое: если задачи никуда не переносятся, через неделю их никто не найдёт.
Шаг 6. Прогоните три реальные записи. Планёрку, голосовое от клиента и созвон с подрядчиком. По ним видно, что править в формулировках промпта.
Что получится на выходе. Один чат, куда пересылается любая запись, и ответ в единообразном виде: о чём говорили, что решили, кто и к какому сроку делает, какие цифры прозвучали и что осталось непонятным. Часовую встречу такой сотрудник обрабатывает за минуты, а стоит это примерно столько же, сколько я насчитал в разделе про цены выше.
Сколько это стоит: оплата рублями с обычной карты, данные остаются в российском контуре. Тариф начинается с 990 ₽ в месяц, пробный период 7 дней, а при регистрации по нашей ссылке на ответы агента начисляется 1 000 ₽ вместо 500. Собрать сотрудника вы можете в Ное: описываете задачу словами, вставляете промпт в настройки агента и подключаете каналы там же.
Честная граница: если вам нужно один раз расшифровать двухчасовую лекцию, сотрудник не нужен: возьмите бот из раздела выше. Сотрудник окупается, когда голосовые и созвоны идут потоком каждый день и нужен один и тот же формат итога.
Промпт сотрудника-протоколиста
Готовый промпт, который я использовал в прогоне. Копируйте целиком и правьте под себя.
Ты — ассистент-протоколист. Тебе присылают расшифровку рабочей встречи
или голосового сообщения. Ты возвращаешь ответ строго в таком виде:
**О чём говорили** — 2–3 предложения своими словами.
**Решения** — маркированный список принятых решений.
Только то, что прозвучало, без домысливания.
**Задачи** — таблица: задача | кто делает | срок.
Если исполнитель или срок не названы, ставь прочерк, а не выдумывай.
**Цифры** — все числа из разговора с расшифровкой, что они означают.
**Что осталось непонятным** — вопросы, которые встреча не закрыла.
Если всё ясно, напиши «нет».
Пиши по-русски, коротко, без вступлений и без похвалы.
Не добавляй ничего, чего не было в расшифровке.
Три правила, без которых промпт работает хуже: первое: запрет на домысливание и прочерк вместо выдуманного исполнителя. Второе: отдельный блок с цифрами, потому что именно за ними обычно и возвращаются к записи. Третье: раздел «что осталось непонятным», который превращает конспект в инструмент.
Как устроен сам промпт и почему формулировки в нём решают больше, чем выбор модели, разобрано в статье что такое промпт для нейросети.
Как расширить под себя: добавьте в промпт список своих терминов и названий продуктов, попросите помечать риски и обещания клиенту, укажите, кому какие задачи обычно достаются.
Что промпт вернул на самом деле
Я отправил расшифровку своей тестовой планёрки в этот промпт. Ответ пришёл за 9,3 секунды. Показываю фактический результат, сокращённо.
О чём говорили: обсудили снижение заявок с Авито из-за снятых объявлений, качество обработки диалогов, счёт клиенту из Казани и распределение бюджета на сентябрь.
Решения: вернуть снятые объявления сегодня · доработать базу знаний до пятницы · выставить счёт завтра · распределить бюджет 120 тысяч на Авито и 80 тысяч на Директ.
Задачи:
Цифры: 18% падение заявок · 26 августа дата снятия объявлений · 40 секунд средний ответ · 112 диалогов всего · 19 передано человеку · 17% доля передач · 450 000 ₽ сумма счёта · 200 000 ₽ бюджет месяца · 120 000 и 80 000 ₽ распределение · 940 ₽ и 610 ₽ цена лида по каналам.
Что осталось непонятным: кто именно отвечает за возврат объявлений, за доработку базы знаний и за выставление счёта.
Что тут важно. Прочерки в колонке исполнителей появились честно: в разговоре имена не звучали. Последний блок вытащил ровно ту дыру, которая на планёрках и теряется: решение приняли, ответственного не назначили. Один этот раздел окупает всю затею.
Чего он не сделал: не разделил реплики по говорящим, потому что этого не умеет движок расшифровки. Если вам критично знать, кто что сказал, нужен сервис с разделением на спикеров.
Отдельный случай: контроль качества звонков
Расшифровка звонков отдела продаж стоит особняком, потому что там нужен не протокол, а оценка. Это целый класс решений, который называется речевой аналитикой, и работает он в связке с CRM.
Как устроено. Запись разговора из телефонии попадает в систему, та переводит её в текст, размечает тегами (какой продукт обсуждали, какое возражение прозвучало) и проверяет разговор по чек-листу: поздоровался, выяснил задачу, назвал следующий шаг. Оценку и расшифровку система кладёт в карточку сделки, и руководитель видит их рядом с суммой и этапом.
Что это даёт. Отдел контроля качества обычно успевает прослушать 3–5% записей. Машина проверяет все, по одинаковым критериям и в день разговора. В моём прогоне полная проверка одного звонка заняла 24 секунды и обошлась примерно в 2 ₽.
Какие решения есть на рынке: речевая аналитика встроена в телефонию (Манго Офис), в коллтрекинг (Calltouch, Roistat), в CRM (Битрикс24), а для контакт-центров существуют отдельные платформы. Цены начинаются от рубля за минуту разговора, у части сервисов аналитика входит в старшие тарифы.
Полный разбор с моим прогоном звонка, оценкой по чек-листу с цитатами, ценами сервисов и готовым промптом контролёра вынесен в отдельную статью: речевая аналитика и контроль качества звонков.
Как выбрать решение под свою ситуацию
Что в этих данных не видно
Границы моего замера, чтобы вы не приняли его за истину в последней инстанции.
Речь синтезированная, а не живая: голоса ровные, без перебиваний, без смеха и без слов-паразитов. На живой планёрке, где говорят одновременно, ошибок будет больше. Мой замер показывает потолок качества, то есть лучший возможный случай.
Одна запись и одна модель: 69 секунд, 141 слово, один движок. Это проверка порядка величин, а не рейтинг движков: точность около 92% и устойчивость к качеству записи.
Шум я добавлял искусственно: ровный фоновый шум мягче, чем настоящее кафе с чужими разговорами: человеческая речь на фоне сбивает распознавание сильнее.
Цены на чужие сервисы взяты из документации, а не из счёта: я проверил официальные страницы, но реальный счёт зависит от объёма, тарифа и способа оплаты.
Буквицу я не тестировал на своём эталоне: рекомендация опирается на наш рабочий опыт с ботом и на заявленные разработчиком характеристики, а не на мой замер с подсчётом ошибок. Проверить её на своём файле вы можете сами: бесплатные расшифровки для этого и даются.
Ошибки, из-за которых расшифровка не приживается
Расшифровку читают вместо записи: сплошной текст без структуры экономит ноль времени. Всегда нужен второй шаг с конспектом.
Формат протокола каждый раз разный: если конспект приходит то списком, то абзацами, его перестают читать. Формат надо зафиксировать в промпте и не менять.
Задачи остаются в конспекте: протокол, который никуда не переносится, живёт до следующего письма. Задачи должны уезжать туда, где команда их видит.
Никто не проверяет термины: одна подмена аббревиатуры, и смысл абзаца меняется. Проверка по списку своих слов занимает минуту.
Расшифровывают всё подряд: часовой созвон ни о чём после расшифровки останется часовым созвоном ни о чём, только в текстовом виде. Инструмент не заменяет повестку встречи.
Забывают про согласие: запись разговора это персональные данные собеседника. Предупреждать о записи нужно всегда, и это правило не зависит от того, кто расшифровывает, человек или машина.
Частые вопросы
Насколько точна машинная расшифровка русской речи?
В моём замере 92% слов совпали с эталоном, все цифры и фамилии распознались верно. Ошибки пришлись на грамматические мелочи и одну аббревиатуру.
Нужен ли хороший микрофон?
Для расшифровки нет. Телефонная запись 8 кГц дала точность 91,5% против 92,2% у студийной.
Сколько времени занимает расшифровка часа записи?
От двух до пяти минут в зависимости от сервиса. Минута аудио в моём прогоне заняла 4–5 секунд.
Можно ли расшифровать голосовое прямо в мессенджере?
Да, это самый удобный путь: пересылаете сообщение боту или своему ИИ-сотруднику и получаете текст в том же чате.
Кто говорил, определяется?
Не везде. Движок из моего замера этого не умеет. Разделение на спикеров есть у части сервисов и обычно в платных тарифах.
Что дешевле: подписка или свой сотрудник?
При редких задачах дешевле подписка. При потоке голосовых каждый день свой сотрудник выигрывает форматом и памятью о ваших проектах, а по деньгам выходит сопоставимо: около 35 ₽ за обработку часовой записи.
Безопасно ли отдавать записи наружу?
Смотрите на условия конкретного сервиса. Яндекс, например, хранит запись 24 часа на время подготовки конспекта и заявляет, что не обучает модели на разговорах. Если данные чувствительные, разумнее локальная модель.
Расшифровка заменит секретаря?
Она снимает механическую часть: набор текста и составление протокола. Модерация встречи, повестка и контроль исполнения остаются людям.
С чего начать прямо сейчас
Порядок на ближайшие полчаса, без бюджета и без разработчика.
- Возьмите любое голосовое сообщение из рабочей переписки, желательно длинное и путаное.
- Перешлите его в бот Буквица и посмотрите на текст.
- Скопируйте промпт протоколиста из этой статьи в любую нейросеть и вставьте расшифровку.
- Сравните результат с тем, что вы помните из разговора: сошлись ли цифры и решения.
- Проверьте термины своей отрасли по списку из 10 слов.
- Если задача повторяется каждый день, поднимайте своего сотрудника в мессенджере и вставьте промпт в его настройки.
Вывод
Машинная расшифровка русской речи стала рабочим инструментом: 92% точности, все цифры и фамилии на месте, минута аудио за 4–5 секунд и около 31 ₽ за час записи. Качество микрофона на результат почти не влияет, а вот термины и аббревиатуры проверять придётся.
Главное, что показал замер: расшифровка сама по себе бесполезна. Ценность даёт второй шаг: когда из текста собирается протокол с решениями, задачами и незакрытыми вопросами. Стоит этот шаг копейки, а находит то, что теряется на каждой планёрке.
Если запись разовая, возьмите готовый бот. Если встречи живут в одном сервисе, включите то, что уже оплачено. А если голосовые идут потоком каждый день, поднимайте своего сотрудника в мессенджере: формат ответа будет вашим.