Чем расшифровка отличается от распознавания речи
Распознавание речи — задача старая: программа слышит звук и пишет то, что услышала. Дословно, со всеми «эээ», повторами и оговорками. Дальше человек садится и вычищает этот текст руками — и часто это дольше, чем набрать заново.
Новое поколение таких моделей делает второй шаг. Оно приводит результат к виду, в котором текстом можно пользоваться. Убирает заминки, расставляет запятые, разбивает на абзацы, понимает, что говорящий передумал в середине фразы.
Для оценки таких моделей есть общая мера — доля ошибочных слов. По-английски её называют WER, word error rate: сколько слов из ста модель услышала неправильно, пропустила или добавила от себя. Чем цифра меньше, тем лучше, и 5% ошибок означает, что примерно каждое двадцатое слово придётся поправить.
Важная оговорка: цифры разных замеров сравнивать между собой нельзя. Модель, показавшая 2,6% на чистой студийной записи, на планёрке с шумом и перебиваниями покажет заметно хуже.
Что произошло
Google представила Gemini 3.5 Transcribe — свою новую модель перевода речи в текст. Она пришла на смену прежней модели компании, Chirp 3.
Модель работает в двух режимах, и различие между ними практическое. Первый — потоковый: текст появляется по ходу речи, задержка меньше секунды. Это режим для голосового ввода и для голосовых помощников, которым надо отвечать сразу. Второй — обработка готовых записей: сюда отдают файл с планёркой, интервью или записью звонка, а на выходе получают текст с разделением реплик и меткой времени к каждому слову.
Два режима, и выбирать придётся
Здесь главное, что теряется во всех пересказах. У модели не один способ работы, а два, и они дают разный результат.
Дословный режим (в документации он называется verbatim и стоит по умолчанию) возвращает слово в слово всё, что прозвучало: «эм», «ну», повторы, паузы, оборванные фразы. Это режим для случаев, где важно, что человек сказал буквально.
Причёсанный режим (smart) обрабатывает текст после распознавания: убирает заминки и фальстарты, разрешает самокоррекции — «давай встретимся во вторник, хотя нет, в среду в два» превращается в «давай встретимся в среду в 14:00», — сам разбивает речь на абзацы и списки, приводит в порядок даты, суммы и числа, расставляет знаки препинания.
Ещё одна возможность в обоих режимах — свой словарь: список терминов, названий и фамилий, которые модель не должна коверкать. По документации в него можно положить до 1000 слов, но лучший результат обычно даёт сотня.
В официальном списке 83 языка, русский среди них. Модель определяет язык сама и справляется с переключением внутри одной записи — обычная ситуация для наших планёрок, где половина терминов английские.
Чего нельзя совместить
А вот это в новостях не пишут вовсе, хотя для работы важнее всего остального.
Причёсанный режим не сочетается с метками времени и разделением говорящих. Так прямо сказано в документации Google. То есть либо вы получаете гладкий читаемый текст, либо разбор записи по спикерам с таймкодами — но не одновременно.
Для расшифровки планёрки это означает выбор: аккуратный текст без пометок, кто что сказал, — или дословная стенограмма, где видно говорящих, но со всеми «эээ».
Есть и другие ограничения, которые стоит знать до того, как строить на этом процесс:
- Обычный запрос принимает файл длиной до часа. Но если включено разделение говорящих или пословные метки времени, предел падает до 30 минут. Двухчасовую встречу придётся резать на куски.
- Разделение говорящих поддерживает до 8 человек, однако Google отдельно предупреждает: для трёх и более говорящих эта функция экспериментальная. Планёрка на пятерых — это не гарантированный результат, а проба.
- Пословные метки времени, по той же документации, могут ухудшить общую точность расшифровки. За удобство поиска по записи платят качеством текста.
Сколько это стоит
Цены есть в открытом прайсе Google, и они пересчитаны в минуты — считать в токенах не придётся.
Обработка готовой записи: $0,003 за минуту входящего аудио и $0,002 за минуту текста на выходе. Час записи — примерно 30 центов.
Потоковый режим дороже: около $0,009 за минуту, то есть порядка полудоллара за час непрерывного распознавания.
🔎 Важная оговорка про бесплатный доступ. У модели есть бесплатный уровень. В том же прайсе рядом с ним стоит строка: данные используются для улучшения продуктов Google. У платного уровня в этой строке — «нет». Если через модель проходят записи разговоров с клиентами, разница между «бесплатно» и «три десятых цента за минуту» перестаёт быть про деньги.
Насколько она точнее прежней
Здесь стоит быть аккуратным с цифрами, потому что Google приводит два разных замера.
На многоязычном наборе тестов доля ошибок в живой речи — 5,5%, тогда как у прежней модели Chirp 3 компания намеряла 7,32%. То есть прибавка в точности есть, но небольшая: одно исправленное слово из тех же примерно двадцати.
В другом замере, который проводила сторонняя компания Artificial Analysis, у модели вышло 4,0% ошибок в потоковом режиме и 2,6% при обработке готовых записей. Цифры ниже, но это другой набор данных, и с предыдущей моделью в этом замере не сравнивали.
Заметнее всего изменилась скорость: путь от звука до финального текста стал быстрее на 70%.
Где это уже работает
Обычным пользователям модель досталась в приложении Gemini на macOS — пока на английском языке. Там она не только расшифровывает речь, но и выполняет голосовые команды: может пересказать локальный файл или сгенерировать картинку прямо в месте, где стоит курсор.
Вторая точка — функция Rambler в клавиатуре Gboard на Android. Здесь важное уточнение, которое теряется в пересказах: пока она доступна только на телефонах Pixel 11, а расширить её на другие устройства Google обещает до конца года.
Разработчикам модель открыта через Gemini API в предварительной версии, компаниям — через корпоративную платформу Google. Отдельно обещан браузер Chrome: там появится голосовой ввод в любое текстовое поле.
🔎 Что вышло не так, как объявили. Первоначально Google сообщила журналистам, что вместе с Transcribe выходят ещё две модели для голосового общения. После публикации материалов компания уточнила: сейчас выпускается только Transcribe, а сроки остальных не определены.
Что это значит для бизнеса
Спрос на такие инструменты растёт с обеих сторон: «перевод аудио в текст» ищут около 6 тысяч раз в месяц, «расшифровка аудио в текст» — ещё около 7 тысяч. За этими запросами стоит рабочая задача: планёрки, интервью, звонки отдела продаж.
Первое следствие — про экономию времени. Час записи планёрки живой человек расшифровывает примерно за три-четыре часа. Модель отдаёт готовый текст за минуты, и работа сводится к вычитке. Считать выгоду надо именно так: не «сколько стоит сервис», а «сколько часов сотрудника он освобождает».
Второе — про разбор звонков, и тут придётся принять решение заранее. Метки времени и разделение говорящих превращают запись в материал, по которому видно, где менеджер перебил клиента и на какой минуте прозвучало возражение. Но включив их, вы получаете дословную стенограмму, а не гладкий текст: причёсанный режим с ними не совмещается. Для разбора продаж это скорее плюс — важно, что человек сказал буквально. Дальше текст можно передать другой модели для анализа: как это устроено технически, разбирали в материале про API.
Третье — про длину записи. Тридцатиминутный предел при включённом разделении говорящих — не мелочь, а то, обо что спотыкается процесс. Часовая планёрка или полуторачасовые переговоры не пройдут одним куском: их надо резать, а потом склеивать расшифровки, следя за нумерацией говорящих.
Четвёртое — про выбор между дословностью и читаемостью. Для протокола, который станет частью договора, для записи претензии клиента, для интервью, где важна формулировка, — нужен дословный режим, и он как раз стоит по умолчанию. Для внутренних планёрок удобнее причёсанный. Ошибка здесь стоит дорого: причёсанный текст меняет слова говорящего, и в споре на него не сошлёшься.
Пятое — про свой словарь. Он закрывает главную боль отраслевых компаний: любая модель спотыкается на профессиональных терминах, названиях товаров и фамилиях. По документации в словарь можно положить до тысячи слов, но Google сам советует держаться в пределах сотни — дальше качество не растёт.
Шестое — про цену и про то, что за ней стоит. Тридцать центов за час записи означают, что деньги в этой задаче перестали быть аргументом: месяц ежедневных планёрок стоит меньше обеда. Но бесплатный уровень — это другой договор: там данные идут на улучшение продуктов Google. Для записей с клиентами разница принципиальная.
Что это значит для специалиста
- Руководителю отдела продаж. Для разбора звонков берите дословный режим с разделением говорящих: он покажет, кто что сказал. Помните про предел в 30 минут — длинные переговоры придётся резать.
- Владельцу бизнеса. Посчитайте, сколько часов в месяц уходит на протоколы совещаний. При цене около 30 центов за час записи вопрос упирается не в бюджет, а в то, кто будет вычитывать результат.
- Юристу и HR. Дословный режим стоит по умолчанию — это правильный выбор для ваших задач. Причёсанный текст меняет формулировки говорящего, и для документа он не годится.
- Маркетологу. Интервью с клиентами — источник живого языка для текстов. Расшифровка превращает эти записи в материал, с которым можно работать: как это делать дальше, разбирали в статье про нейросети для текста.
- Тем, кто внедряет ИИ-сотрудников. Потоковый режим с задержкой меньше секунды — это про голосовых помощников, которые отвечают в реальном времени; что для этого ещё нужно, собрано в гайде про ИИ-сотрудников.
Что делать уже сейчас
- Возьмите одну реальную запись. Планёрку или звонок клиенту — не идеальный тестовый файл, а рабочий, с шумом и перебиваниями.
- Прогоните её через два-три сервиса. Сравнивайте не рекламные цифры, а свой результат: сколько правок пришлось внести.
- Соберите свой словарь. Названия товаров, фамилии, отраслевые термины — двести слов снимают большую часть ошибок.
- Разделите задачи на «причесать» и «дословно». Для планёрок подойдёт причёсанный режим, для юридически значимых записей и разбора звонков — дословный. Совместить с метками времени можно только второй.
- Проверьте длину своих записей. Если встречи идут дольше получаса, а нужны говорящие, закладывайте нарезку в процесс сразу.
- Не гоняйте рабочие записи через бесплатный уровень. На нём данные используются для улучшения продуктов Google; платный этого не делает и стоит копейки.
- Проверьте, что вы имеете право записывать. Запись разговора с клиентом требует его согласия — это отдельный вопрос к юристу, а не к сервису.
- Посчитайте экономию в часах. Сколько времени уходит на расшифровку сейчас и сколько останется на вычитку.
Чего ждать дальше
Ближайшее — голосовой ввод в браузере. Обещанная поддержка в Chrome означает, что диктовать можно будет в любое поле на любом сайте, и это меняет привычку сильнее, чем отдельное приложение.
Второе — конкуренция на этом участке обострится. Расшифровка речи давно перестала быть отдельным продуктом и превращается в функцию внутри больших моделей: то же самое делают OpenAI и открытые модели вроде Whisper. Для покупателя это означает падение цены.
Третье — вопрос дословности станет заметнее. Чем лучше модели «причёсывают» речь, тем чаще будет всплывать разница между «что человек сказал» и «что модель записала». Для рабочих задач это мелочь, для юридических — нет.
Частые вопросы
Что такое Gemini 3.5 Transcribe?
Модель Google для перевода речи в текст. Работает в двух режимах: дословном (по умолчанию) и причёсанном — во втором убирает заминки, разрешает оговорки и сам форматирует текст.
Русский язык поддерживается?
Да. В официальном списке 83 языка, русский среди них. Модель также определяет язык сама и переключается между языками внутри одной записи.
Насколько она точная?
В живой речи — 5,5% ошибочных слов против 7,32% у предыдущей модели Google. В отдельном замере компании Artificial Analysis — 4,0% в потоке и 2,6% на готовых записях; это другой набор данных, и сравнения с прежней моделью там нет.
Скольких говорящих она различает?
До восьми. Но Google предупреждает: для трёх и более говорящих эта функция экспериментальная, то есть результат не гарантирован.
Есть ли ограничение по длине записи?
Да. Обычный запрос принимает файл до часа, а при включённом разделении говорящих или пословных метках времени — до 30 минут.
Сколько это стоит?
По прайсу Google обработка записи — $0,003 за минуту аудио плюс $0,002 за минуту готового текста, то есть около 30 центов за час. Потоковый режим — примерно $0,009 за минуту. Есть и бесплатный уровень, но на нём данные используются для улучшения продуктов Google.
Где ей можно пользоваться прямо сейчас?
В приложении Gemini на macOS (на английском), в функции Rambler клавиатуры Gboard на телефонах Pixel 11 и через Gemini API для разработчиков. Поддержка в Chrome обещана позже.
Работает ли это из России?
Сайты Google AI Studio и Gemini с российского адреса открываются, обращения к программному интерфейсу доходят до сервиса — мы это проверили. Дальше всё упирается в ключ доступа и аккаунт Google, поэтому проверять нужно на своём.
Можно ли получить дословную расшифровку?
Да, это режим по умолчанию: модель вернёт всё слово в слово, включая «эм», повторы и оборванные фразы. Причёсывание — отдельный режим, который включают намеренно.
Можно ли получить и причёсанный текст, и разделение говорящих?
Нет. По документации Google причёсанный режим не совмещается ни с метками времени, ни с разделением говорящих. Придётся выбрать одно.
