Расшифровка аудио в текст: мой замер точности, цены сервисов и промпт протоколиста

Расшифровка перестала быть проблемой: минута аудио превращается в текст за 4–5 секунд и стоит меньше рубля. Проблема в другом — сплошное полотно текста читать никто не станет, и ценность появляется только на втором шаге.

Внутри мой замер на эталонном тексте в трёх условиях записи с подсчётом ошибок, разбор того, на чём машина спотыкается, сравнение цен семи решений с официальными источниками, обзор телеграм-ботов и встроенных конспектов Zoom, Телемоста, Контур.Толка и МТС Линка, готовый промпт сотрудника-протоколиста с его фактическим выходом и таблица выбора решения под ситуацию.

Расшифровка аудио в текст: мой замер точности, цены сервисов и промпт протоколиста
Дмитрий Борейчук
Автор
Дмитрий Борейчук
• 13 лет опыта в маркетинге и продажах • Более 1000 проектов • Основатель портала Wake up Marketing • Практикует маркетинг и внедрение ИИ в бизнес клиентов
Страница автора
💡 Хотите прокачаться в ИИ и маркетинге?
Подпишитесь на Telegram-канал Дмитрия: дневник развития портала Wake up Marketing, билдера сайтов и приложений в Ноя и маркетплейса шаблонов. Плюс выжимка 13 лет опыта в суровом маркетинге и плоды 2 лет работы с ИИ 24/7
Перейти в Telegram-канал

Кому и зачем нужна расшифровка

Расшифровка аудио в текст перестала быть задачей журналистов. Сегодня это ежедневная рутина обычного бизнеса, и выглядит она так.

Клиент присылает голосовое на полторы минуты вместо трёх строк текста. Планёрку на сорок минут закрывают фразой «ну мы же договорились», а через неделю выясняется, что договорились все по-разному. Созвон с подрядчиком записан, но пересматривать час записи ради одной цифры никто не станет. Интервью с кандидатом, разговор с поставщиком, обучающий вебинар: везде голос, из которого нужно достать текст, решения и задачи.

Расшифровать несложно: технику этот вопрос перестал волновать давно, минуты работы. Проблема в том, что расшифровка сама по себе бесполезна: получить 40 000 знаков сплошного текста и читать их вместо прослушивания записи это обмен шила на мыло.

Ценность даёт следующий шаг: когда из текста собирается короткий итог: о чём говорили, что решили, кто и к какому сроку делает. Дальше в статье я показываю оба шага и то, сколько каждый стоит.

Три пути: бот, встроенный ИИ и свой сотрудник

Все решения на рынке делятся на три группы, и путать их не стоит: они закрывают разные ситуации.

Первый путь: телеграм-бот или сервис. Вы отправляете файл или ссылку, получаете текст. Подходит, когда запись уже есть: голосовое от клиента, диктофон, видео с YouTube.

Второй путь: встроенный ИИ в сервисе видеовстреч. Zoom, Яндекс Телемост, Контур.Толк, МТС Линк умеют сами записать встречу и прислать конспект. Подходит, если встречи проходят внутри одной платформы.

Третий путь: свой ИИ-сотрудник в мессенджере. Что это за класс решений вообще, разобрано в гайде про ИИ-сотрудников. Вы кидаете ему голосовое или запись прямо в переписку, он отвечает готовым протоколом в вашем формате. Подходит, когда нужен не текст, а результат в понятном виде, и когда источники записей разные.

Дальше разбираю все три, но сначала честный замер: насколько вообще точна машинная расшифровка русской речи.

Российский сервис, без VPN
Сделайте сайт и ИИ-агента в одном окне — за вечер, а не за месяц
  • Сайт собирается диалогом: описали идею — смотрите, как он рождается
  • ИИ-сотрудник отвечает клиентам в Telegram, WhatsApp, Avito и на сайте
  • Без VPN и иностранных карт — оплата в рублях
Попробовать Ною
7 дней бесплатного пробного периода — платить не обязательно

Мой замер: как я проверял качество

Обзоры обычно пишут «точность 99%», не объясняя, откуда цифра. Я сделал проверку, которую можно повторить.

Что я сделал. Собрал сценарий типичной планёрки: 9 реплик, два голоса, 141 слово. Внутри намеренно оставил то, на чём машины ошибаются чаще всего: цифры (18 процентов, 112 диалогов, 450 тысяч, 940 против 610), даты (26 августа), фамилии (Иванов, Смирнова), названия площадок (Авито, Директ) и аббревиатуру ИИ.

Текст я озвучил синтезом речи двумя русскими голосами, мужским и женским, и склеил в одну запись длительностью 68,8 секунды. Это дало главное преимущество замера: я точно знаю эталон, с которым сравнивать.

Три условия записи: одну и ту же запись я испортил двумя способами, чтобы проверить устойчивость.

УсловиеЧто это имитирует
студийная записьдиктофон рядом с говорящим, тихая комната
телефонный канал 8 кГцзапись разговора по телефону, узкая полоса частот
фоновый шумкафе, улица, работающий кондиционер

Чем расшифровывал: движком Voxtral Small через OpenRouter: это та модель, которая расшифровывает голосовые в нашей платформе. Замер шёл 7 сентября 2026 года.

Как считал ошибки: побуквенно сравнивать бессмысленно, поэтому я взял стандартную метрику: доля слов, которые пришлось бы исправить, чтобы получить эталон. Числа перед сравнением привёл к одному виду, потому что «восемнадцать процентов» и «18%» это одно и то же для читателя.

Результат: сколько ошибок и на чём

УсловиеВремя расшифровкиРазмер файлаОшибокТочность
студийная запись5,5 с1075 КБ11 из 141 слова92,2%
телефонный канал 8 кГц4,2 с202 КБ12 из 141 слова91,5%
фоновый шум4,4 с1075 КБ11 из 141 слова92,2%

Первое, что видно: условия записи почти не влияют. Разница между студийной записью и телефонным каналом составила одно слово. Расхожее «сначала купите хороший микрофон» для этой задачи не работает.

Второе важнее: ни одна цифра не потерялась. Все числа расшифрованы верно: 18%, 26 августа, 40 секунд, 112 диалогов, 19, 17%, 450 тысяч, 200 тысяч, 120 и 80, 940 против 610. Фамилии Иванов и Смирнова, города и названия площадок тоже на месте.

Тогда откуда 11 ошибок? Разберу их, потому что это и есть настоящий ответ на вопрос «можно ли доверять».

Грамматические мелочи: «дальше» вместо «далее», «на каких вопросах» вместо «на какие вопросы», «просил» вместо «попросил». Смысл не меняется, читателю всё понятно.

Род говорящего: реплику женского голоса «согласна» модель записала как «согласен». Машина не знает, кто говорит, а разделения на спикеров у этого движка нет вовсе.

Единственная смысловая потеря: аббревиатура «ИИ-сотрудник» превратилась в «И сотрудник». Это ровно та ошибка, которая опасна: термин исчез, и по тексту непонятно, о чём речь.

🪤 Вывод для практики: доверять машинной расшифровке цифр и фамилий можно, а термины и аббревиатуры своей отрасли надо проверять глазами. Особенно если в разговоре звучат названия продуктов, сокращения и профессиональный сленг.

Что этот замер меняет на практике

Из трёх наблюдений выше следует несколько решений, которые экономят время и деньги.

Не тратьтесь на технику ради расшифровки: телефонная запись с узкой полосой дала точность 91,5% против 92,2% у студийной. Если вы собирались покупать петличный микрофон только ради конспектов, это лишний расход.

Расшифровку читать не нужно: готовый текст всё равно приводится в человеческий вид отдельно, этим занимается нейросеть для текста. 68 секунд разговора превратились в 877 знаков сплошного текста без абзацев и без указания, кто говорит. Час встречи даст примерно 45 000 знаков такого полотна. Ценность появляется только после второго шага, когда из этого текста собирается структура.

Термины проверяйте списком: соберите 10–15 слов своей отрасли, которые звучат на каждой встрече, и просто прочитайте по ним готовый конспект. Это займёт минуту и снимет главный риск.

Скорость больше не аргумент: минута аудио расшифровывается за 4–5 секунд. Час записи это примерно 4 минуты ожидания, а у специализированных сервисов и того меньше.

Сколько стоит расшифровка: сравнение цен

Цены собраны 7 сентября 2026 года из официальных источников, курс доллара ЦБ на дату замера 86,59 ₽.

РешениеЦенаЧто входит
Мой прогон через Voxtral Small на OpenRouter0,60 ₽ за 69 секунд, то есть около 31 ₽ за час аудиотолько текст, без конспекта
Yandex SpeechKit, отложенный режим0,0381 ₽ за 15 секунд, около 9 ₽ за частолько текст, нужен разработчик
Yandex SpeechKit, синхронный режим0,1626 ₽ за 15 секунд, около 39 ₽ за частекст в реальном времени
OpenAI gpt-4o-transcribe и Whisper$0,006 за минуту, около 31 ₽ за частолько текст, оплата в валюте
OpenAI gpt-4o-mini-transcribe$0,003 за минуту, около 15,6 ₽ за частолько текст, качество ниже
Телеграм-бот Буквицаот 490–649 ₽ в месяц за 30 часов, около 16–22 ₽ за частекст плюс конспект, ничего настраивать не надо
Встроенный ИИ видеовстречвходит в подписку сервисаработает только внутри своей платформы

К цене расшифровки добавляется цена второго шага. В моём прогоне сборка протокола из расшифровки заняла 9,3 секунды и 1492 токена, это около 0,79 ₽. Для часовой встречи второй шаг обойдётся примерно в 4–5 ₽.

Итог по деньгам: полная обработка часовой встречи своим сотрудником стоит около 35 ₽. Готовый сервис с подпиской выходит примерно в те же деньги, но без единой строчки настройки.

Буквица: телеграм-бот, который я рекомендую

Если задача звучит как «есть запись, нужен текст, и я не хочу ничего настраивать», проще всего взять готовый бот. Мы пользуемся Буквицей и рекомендуем её осознанно: она делает транскрипты быстро и качественно, а начать можно прямо из Telegram, без регистрации на сайте и без карты.

Что она умеет по данным разработчика:

  • превращает в текст аудио, видео и голосовые сообщения;
  • принимает ссылки на YouTube, Rutube, Instagram, а также файлы с Яндекс и Google Дисков;
  • заявленная точность 99,5%, поддержка 22 языков;
  • час записи обрабатывается примерно за 2 минуты;
  • кроме дословного текста собирает структурированный конспект с ключевыми мыслями и цитатами;
  • результат выгружается в документ для правки.

По странице бота в Telegram им пользуются 54 783 человека в месяц, то есть это живой сервис с постоянной аудиторией.

Почему именно бот: голосовые сообщения и записи созвонов и так лежат в мессенджере. Переслать их в бот это два касания, а результат приходит туда же. Никакой пересылки файлов на почту и загрузки на сторонние сайты.

Как начать: откройте бот по ссылке t.me/bykvitsa, перешлите ему голосовое или файл и посмотрите на результат. Новым пользователям дают несколько бесплатных расшифровок, этого хватает, чтобы понять, подходит вам такой формат работы или нет.

🪤 Расхождение в источниках, о котором честно предупреждаю. Публичные обзоры называют разные цены: где-то «час транскрибации за 8 ₽», где-то «8 ₽ за минуту», где-то тарифы 490, 649 и 1449 ₽ в месяц с разным числом часов. Разделение на спикеров тоже описано по-разному: в интервью основателя сказано, что этой опцией пожертвовали ради скорости, а в свежих обзорах она упоминается в старших тарифах. Причина расхождений простая: сервис живой и тарифы менялись. Актуальные условия смотрите в самом боте, а не в обзорах, включая мой.

Встроенная расшифровка в видеовстречах

Если встречи проходят в одном сервисе, проще включить то, что уже оплачено.

Zoom AI Companion: умеет сам собрать конспект встречи и «умную запись». Русский язык в списке поддерживаемых есть: официальная справка Zoom перечисляет его и для Meeting Summary, и для Smart Recording. Здесь важно предупредить: в русскоязычных обзорах встречается утверждение, что русского у AI Companion нет. Я проверил первоисточник, и это не так.

Яндекс Телемост и Алиса Про: по справке Яндекс 360 конспект доступен организациям с подпиской от тарифа «Минимальный», аккаунты должны быть на домене компании. Запускает конспект организатор или соорганизатор, результат приходит им на почту, остальным участникам только если организатор включил такую опцию. Приходят два документа: краткий пересказ с разделом договорённостей и полная расшифровка речи. Запись встречи хранится 24 часа, пока готовится конспект, потом удаляется. Обучение моделей на разговорах сотрудников Яндекс отдельно исключает.

Контур.Толк. На странице сервиса заявлены автоматическая расшифровка с тайм-кодами и ИИ-конспект, в котором фиксируются решения и задачи с ответственными и сроками. Это ближе всего к тому, что обычно нужно бизнесу: сразу протокол.

МТС Линк. На главной странице перечислены резюме встречи, текстовая расшифровка и ИИ-помощник, отдельно указано, что на пользовательских данных модели не обучаются.

Ограничение у всех четырёх одно: работает только внутри своей платформы. Голосовое от клиента в WhatsApp, запись с диктофона на телефоне, разговор в машине через мессенджер эти инструменты не увидят. Для бизнеса, где половина общения идёт в мессенджерах, встроенный конспект закрывает лишь часть задачи.

Движки и API: для тех, у кого есть разработчик

Этот раздел пригодится, если расшифровка нужна внутри вашего продукта или в большом объёме.

Yandex SpeechKit: три режима с разной ценой: синхронный для коротких фрагментов в реальном времени, асинхронный для файлов и отложенный, самый дешёвый. Отложенный режим стоит 0,0381 ₽ за 15 секунд, то есть час аудио обходится примерно в 9 ₽. Минимальная единица тарификации 15 секунд, короткие файлы округляются вверх.

OpenAI. Whisper и gpt-4o-transcribe стоят $0,006 за минуту, облегчённая gpt-4o-mini-transcribe вдвое дешевле. Оплата в валюте, что для российской компании отдельная задача.

Voxtral Small. Мультиязычная модель, которая принимает аудио напрямую. Именно её я гонял в замере: 69 секунд записи обошлись в $0,0069, это примерно 0,60 ₽.

Когда расшифровка встраивается в рабочий процесс целиком, начинаются агентные сборки: как это выглядит на практике, показано в разборе скиллов Claude Code.

Локальный Whisper: модель можно поставить на свой компьютер или сервер и не платить за минуты вовсе. Плата другая: время на установку, требования к железу и скорость ниже облачной. Разумно, если записей много и они конфиденциальные.

🪤 Общее для всех API: они отдают только текст. Конспект, решения и задачи из него всё равно собирает языковая модель на втором шаге, и это отдельный запрос и отдельные деньги.

Свой ИИ-сотрудник в мессенджере

Теперь про третий путь, ради которого затевалась статья. Идея простая: не сервис с кнопками, а сотрудник в переписке, который принимает голосовое и возвращает результат в вашем формате.

Как это работает: у сотрудника есть системный промпт: кто он, что делает с полученной записью, в каком виде отвечает. Вы пересылаете ему голосовое или файл, он расшифровывает и сразу собирает протокол по вашему шаблону. Никаких «скачать текст, открыть, скопировать, попросить нейросеть сделать выжимку».

Чем это отличается от бота-транскрибатора:

  • формат ответа задаёте вы, а не разработчик сервиса;
  • сотрудник помнит контекст: ваши проекты, имена коллег, названия продуктов;
  • его можно попросить сразу занести задачи в таблицу или прислать напоминание;
  • он живёт в том же чате, куда клиенты и коллеги и так шлют голосовые.

Где это ставится: такой сотрудник поднимается на любой платформе с агентами и подключением мессенджеров. Дальше показываю сборку на нашей — Ноя, потому что в ней голосовые в диалогах расшифровываются сами, без отдельных настроек и без стороннего сервиса.

Сотрудник-протоколист: сборка за вечер по шагам

Разбираю по шагам, чтобы было видно объём работы. Ни одного из них не требуется разработчик.

Шаг 1. Заведите агента и опишите его роль. В настройках агента вставляется промпт протоколиста из следующего раздела. Роль опишите одной фразой: принимает записи и голосовые, возвращает протокол в заданном виде.

Шаг 2. Подключите канал, куда прилетают записи. Telegram для внутренней работы, WhatsApp, если голосовые шлют клиенты, Авито, если переписка идёт там. Каналы вы подключаете в одном кабинете, агент работает один на все.

Шаг 3. Задайте формат ответа. Тут решает не технология, а ваша дисциплина: какие блоки нужны, в каком порядке, что делать с непонятными местами. Формат из промпта ниже я проверил на реальном разговоре, начните с него.

Шаг 4. Добавьте словарь своих терминов. Названия продуктов, фамилии, сокращения, имена площадок. Это лечит единственную ошибку из моего замера, когда «ИИ-сотрудник» превратился в «И сотрудник».

Шаг 5. Решите, куда уходит результат. Протокол вы оставляете в чате или отправляете в задачи и в карточку сделки. Правило простое: если задачи никуда не переносятся, через неделю их никто не найдёт.

Шаг 6. Прогоните три реальные записи. Планёрку, голосовое от клиента и созвон с подрядчиком. По ним видно, что править в формулировках промпта.

Что получится на выходе. Один чат, куда пересылается любая запись, и ответ в единообразном виде: о чём говорили, что решили, кто и к какому сроку делает, какие цифры прозвучали и что осталось непонятным. Часовую встречу такой сотрудник обрабатывает за минуты, а стоит это примерно столько же, сколько я насчитал в разделе про цены выше.

Сколько это стоит: оплата рублями с обычной карты, данные остаются в российском контуре. Тариф начинается с 990 ₽ в месяц, пробный период 7 дней, а при регистрации по нашей ссылке на ответы агента начисляется 1 000 ₽ вместо 500. Собрать сотрудника вы можете в Ное: описываете задачу словами, вставляете промпт в настройки агента и подключаете каналы там же.

Честная граница: если вам нужно один раз расшифровать двухчасовую лекцию, сотрудник не нужен: возьмите бот из раздела выше. Сотрудник окупается, когда голосовые и созвоны идут потоком каждый день и нужен один и тот же формат итога.

Промпт сотрудника-протоколиста

Готовый промпт, который я использовал в прогоне. Копируйте целиком и правьте под себя.

Промпт
Ты — ассистент-протоколист. Тебе присылают расшифровку рабочей встречи
или голосового сообщения. Ты возвращаешь ответ строго в таком виде:

**О чём говорили** — 2–3 предложения своими словами.

**Решения** — маркированный список принятых решений.
Только то, что прозвучало, без домысливания.

**Задачи** — таблица: задача | кто делает | срок.
Если исполнитель или срок не названы, ставь прочерк, а не выдумывай.

**Цифры** — все числа из разговора с расшифровкой, что они означают.

**Что осталось непонятным** — вопросы, которые встреча не закрыла.
Если всё ясно, напиши «нет».

Пиши по-русски, коротко, без вступлений и без похвалы.
Не добавляй ничего, чего не было в расшифровке.

Три правила, без которых промпт работает хуже: первое: запрет на домысливание и прочерк вместо выдуманного исполнителя. Второе: отдельный блок с цифрами, потому что именно за ними обычно и возвращаются к записи. Третье: раздел «что осталось непонятным», который превращает конспект в инструмент.

Как устроен сам промпт и почему формулировки в нём решают больше, чем выбор модели, разобрано в статье что такое промпт для нейросети.

Как расширить под себя: добавьте в промпт список своих терминов и названий продуктов, попросите помечать риски и обещания клиенту, укажите, кому какие задачи обычно достаются.

Что промпт вернул на самом деле

Я отправил расшифровку своей тестовой планёрки в этот промпт. Ответ пришёл за 9,3 секунды. Показываю фактический результат, сокращённо.

О чём говорили: обсудили снижение заявок с Авито из-за снятых объявлений, качество обработки диалогов, счёт клиенту из Казани и распределение бюджета на сентябрь.

Решения: вернуть снятые объявления сегодня · доработать базу знаний до пятницы · выставить счёт завтра · распределить бюджет 120 тысяч на Авито и 80 тысяч на Директ.

Задачи:

ЗадачаКто делаетСрок
Вернуть объявления по фасадным работамсегодня к вечеру
Разобраться, на какие вопросы передаётся человеку, и дополнить базу знанийдо пятницы
Прислать реквизиты для счётаСмирновасегодня
Выставить счёт Иванову на 450 тысячзавтра

Цифры: 18% падение заявок · 26 августа дата снятия объявлений · 40 секунд средний ответ · 112 диалогов всего · 19 передано человеку · 17% доля передач · 450 000 ₽ сумма счёта · 200 000 ₽ бюджет месяца · 120 000 и 80 000 ₽ распределение · 940 ₽ и 610 ₽ цена лида по каналам.

Что осталось непонятным: кто именно отвечает за возврат объявлений, за доработку базы знаний и за выставление счёта.

Что тут важно. Прочерки в колонке исполнителей появились честно: в разговоре имена не звучали. Последний блок вытащил ровно ту дыру, которая на планёрках и теряется: решение приняли, ответственного не назначили. Один этот раздел окупает всю затею.

Чего он не сделал: не разделил реплики по говорящим, потому что этого не умеет движок расшифровки. Если вам критично знать, кто что сказал, нужен сервис с разделением на спикеров.

Отдельный случай: контроль качества звонков

Расшифровка звонков отдела продаж стоит особняком, потому что там нужен не протокол, а оценка. Это целый класс решений, который называется речевой аналитикой, и работает он в связке с CRM.

Как устроено. Запись разговора из телефонии попадает в систему, та переводит её в текст, размечает тегами (какой продукт обсуждали, какое возражение прозвучало) и проверяет разговор по чек-листу: поздоровался, выяснил задачу, назвал следующий шаг. Оценку и расшифровку система кладёт в карточку сделки, и руководитель видит их рядом с суммой и этапом.

Что это даёт. Отдел контроля качества обычно успевает прослушать 3–5% записей. Машина проверяет все, по одинаковым критериям и в день разговора. В моём прогоне полная проверка одного звонка заняла 24 секунды и обошлась примерно в 2 ₽.

Какие решения есть на рынке: речевая аналитика встроена в телефонию (Манго Офис), в коллтрекинг (Calltouch, Roistat), в CRM (Битрикс24), а для контакт-центров существуют отдельные платформы. Цены начинаются от рубля за минуту разговора, у части сервисов аналитика входит в старшие тарифы.

Полный разбор с моим прогоном звонка, оценкой по чек-листу с цитатами, ценами сервисов и готовым промптом контролёра вынесен в отдельную статью: речевая аналитика и контроль качества звонков.

Как выбрать решение под свою ситуацию

СитуацияЧто брать
Разовая запись: лекция, интервью, один созвонтелеграм-бот, Буквица
Все встречи в одном сервисе видеосвязивстроенный конспект: Zoom, Телемост, Толк, МТС Линк
Голосовые от клиентов идут потоком каждый деньсвой ИИ-сотрудник в мессенджере
Нужен свой формат протокола и память о проектахсвой ИИ-сотрудник с промптом
Расшифровка встраивается в ваш продуктAPI: SpeechKit или OpenAI
Записи конфиденциальные, наружу отдавать нельзялокальный Whisper на своём сервере
Критично, кто именно что сказалсервис с разделением на спикеров
Нужно проверять звонки менеджеровречевая аналитика с чек-листом и связкой с CRM

Что в этих данных не видно

Границы моего замера, чтобы вы не приняли его за истину в последней инстанции.

Речь синтезированная, а не живая: голоса ровные, без перебиваний, без смеха и без слов-паразитов. На живой планёрке, где говорят одновременно, ошибок будет больше. Мой замер показывает потолок качества, то есть лучший возможный случай.

Одна запись и одна модель: 69 секунд, 141 слово, один движок. Это проверка порядка величин, а не рейтинг движков: точность около 92% и устойчивость к качеству записи.

Шум я добавлял искусственно: ровный фоновый шум мягче, чем настоящее кафе с чужими разговорами: человеческая речь на фоне сбивает распознавание сильнее.

Цены на чужие сервисы взяты из документации, а не из счёта: я проверил официальные страницы, но реальный счёт зависит от объёма, тарифа и способа оплаты.

Буквицу я не тестировал на своём эталоне: рекомендация опирается на наш рабочий опыт с ботом и на заявленные разработчиком характеристики, а не на мой замер с подсчётом ошибок. Проверить её на своём файле вы можете сами: бесплатные расшифровки для этого и даются.

Ошибки, из-за которых расшифровка не приживается

Расшифровку читают вместо записи: сплошной текст без структуры экономит ноль времени. Всегда нужен второй шаг с конспектом.

Формат протокола каждый раз разный: если конспект приходит то списком, то абзацами, его перестают читать. Формат надо зафиксировать в промпте и не менять.

Задачи остаются в конспекте: протокол, который никуда не переносится, живёт до следующего письма. Задачи должны уезжать туда, где команда их видит.

Никто не проверяет термины: одна подмена аббревиатуры, и смысл абзаца меняется. Проверка по списку своих слов занимает минуту.

Расшифровывают всё подряд: часовой созвон ни о чём после расшифровки останется часовым созвоном ни о чём, только в текстовом виде. Инструмент не заменяет повестку встречи.

Забывают про согласие: запись разговора это персональные данные собеседника. Предупреждать о записи нужно всегда, и это правило не зависит от того, кто расшифровывает, человек или машина.

Частые вопросы

Насколько точна машинная расшифровка русской речи?
В моём замере 92% слов совпали с эталоном, все цифры и фамилии распознались верно. Ошибки пришлись на грамматические мелочи и одну аббревиатуру.

Нужен ли хороший микрофон?
Для расшифровки нет. Телефонная запись 8 кГц дала точность 91,5% против 92,2% у студийной.

Сколько времени занимает расшифровка часа записи?
От двух до пяти минут в зависимости от сервиса. Минута аудио в моём прогоне заняла 4–5 секунд.

Можно ли расшифровать голосовое прямо в мессенджере?
Да, это самый удобный путь: пересылаете сообщение боту или своему ИИ-сотруднику и получаете текст в том же чате.

Кто говорил, определяется?
Не везде. Движок из моего замера этого не умеет. Разделение на спикеров есть у части сервисов и обычно в платных тарифах.

Что дешевле: подписка или свой сотрудник?
При редких задачах дешевле подписка. При потоке голосовых каждый день свой сотрудник выигрывает форматом и памятью о ваших проектах, а по деньгам выходит сопоставимо: около 35 ₽ за обработку часовой записи.

Безопасно ли отдавать записи наружу?
Смотрите на условия конкретного сервиса. Яндекс, например, хранит запись 24 часа на время подготовки конспекта и заявляет, что не обучает модели на разговорах. Если данные чувствительные, разумнее локальная модель.

Расшифровка заменит секретаря?
Она снимает механическую часть: набор текста и составление протокола. Модерация встречи, повестка и контроль исполнения остаются людям.

С чего начать прямо сейчас

Порядок на ближайшие полчаса, без бюджета и без разработчика.

  1. Возьмите любое голосовое сообщение из рабочей переписки, желательно длинное и путаное.
  2. Перешлите его в бот Буквица и посмотрите на текст.
  3. Скопируйте промпт протоколиста из этой статьи в любую нейросеть и вставьте расшифровку.
  4. Сравните результат с тем, что вы помните из разговора: сошлись ли цифры и решения.
  5. Проверьте термины своей отрасли по списку из 10 слов.
  6. Если задача повторяется каждый день, поднимайте своего сотрудника в мессенджере и вставьте промпт в его настройки.

Вывод

Машинная расшифровка русской речи стала рабочим инструментом: 92% точности, все цифры и фамилии на месте, минута аудио за 4–5 секунд и около 31 ₽ за час записи. Качество микрофона на результат почти не влияет, а вот термины и аббревиатуры проверять придётся.

Главное, что показал замер: расшифровка сама по себе бесполезна. Ценность даёт второй шаг: когда из текста собирается протокол с решениями, задачами и незакрытыми вопросами. Стоит этот шаг копейки, а находит то, что теряется на каждой планёрке.

Если запись разовая, возьмите готовый бот. Если встречи живут в одном сервисе, включите то, что уже оплачено. А если голосовые идут потоком каждый день, поднимайте своего сотрудника в мессенджере: формат ответа будет вашим.

Способ зарабатывать на ИИ
Зарабатывайте на создании сайтов и ИИ-агентов
  • Собираете клиенту сайт и ИИ-продавца за вечер вместо недель разработки
  • Конструктор сайтов и ИИ-сотрудники — в одном российском сервисе
  • Бонус 1 000 ₽ при регистрации по этой ссылке вместо обычных 500 ₽
Начать бесплатно
Регистрация занимает минуту, без VPN и иностранных карт

💬 Комментарии

Пока никто не написал. Будьте первым: расскажите, что оказалось полезным, а чего не хватило.
Ссылки в комментариях не публикуются.

🍋Ещё статьи в категории «ИИ-сотрудники для бизнеса»

В категорию
ИИ-продавец для частного детского сада: готовый промпт
02.09.2026#ИИ-сотрудники для бизнеса
ИИ-продавец для частного детского сада: готовый промпт
Родитель пишет в 22:40, когда уложил ребёнка, и в это же время — ещё в три сада. Визит получает тот, кто ответил первым, а не тот, у кого лучше группа.
Дмитрий Борейчук
Автор
Дмитрий Борейчук
Скиллы для Claude Code: как маркетинг начинает выпускать в разы больше
21.08.2026#ИИ-сотрудники для бизнеса
Скиллы для Claude Code: как маркетинг начинает выпускать в разы больше
Скилл для Claude — это папка с инструкцией, которую ИИ подхватывает сам, когда задача ей соответствует. Описали способ работы один раз — дальше он применяется каждый раз.
Дмитрий Борейчук
Автор
Дмитрий Борейчук
Онлайн-запись для клиентов: сервисы, цены, конверсия
21.08.2026#ИИ-сотрудники для бизнеса
Онлайн-запись для клиентов: сервисы, цены, конверсия
Онлайн-запись ставят, чтобы не терять клиентов. Через месяц записи через форму идут, а общее число клиентов то же. Форма обслуживает тех, кто уже решил прийти.
Дмитрий Борейчук
Автор
Дмитрий Борейчук
ИИ-продавец для турагентства: готовый промпт
06.07.2026#ИИ-сотрудники для бизнеса
ИИ-продавец для турагентства: готовый промпт
Турист пишет в WhatsApp в воскресенье в 22:00: «Хочу в Турцию на двоих, середина июля». Ваш менеджер ответит завтра утром. За это время человек уже получит подборку от трёх других агентств и оплатит один из вариантов.
Дмитрий Борейчук
Автор
Дмитрий Борейчук
ИИ-сотрудники для бизнеса: полный гайд 2026 — что умеют, чем отличаются от автономных ИИ-агентов и как внедрить с нуля
29.05.2026#ИИ-сотрудники для бизнеса
ИИ-сотрудники для бизнеса: полный гайд 2026 — что умеют, чем отличаются от автономных ИИ-агентов и как внедрить с нуля
Рынок ИИ-инструментов для бизнеса в 2026 году взорвался. И вместе с возможностями пришла путаница: одни говорят «ИИ-сотрудник», другие — «ИИ-агент», третьи — «автономный агент».
Дмитрий Борейчук
Автор
Дмитрий Борейчук
ИИ-продавец для продажи кухонь: готовый промпт, который закрывает лидов на замер 24/7
27.04.2026#ИИ-сотрудники для бизнеса
ИИ-продавец для продажи кухонь: готовый промпт, который закрывает лидов на замер 24/7
Менеджер уходит домой в 19:00, а клиент пишет в 22:30: «Хочу кухню, подскажите цену». Ответ придёт завтра утром — и клиент уже у конкурента. Это не единичный случай: большинство кухонных компаний теряют от 30 до 50% лидов именно на этапе первого касания — из-за скорости ответа, слабого выявления потребностей и неотработанных возражений в переписке.
Дмитрий Борейчук
Автор
Дмитрий Борейчук

🏆Другие категории

Все категории