Чем расшифровка отличается от распознавания речи
Распознавание речи — задача старая: программа слышит звук и пишет то, что услышала. Дословно, со всеми «эээ», повторами и оговорками. Дальше человек садится и вычищает этот текст руками — и часто это дольше, чем набрать заново.
Новое поколение таких моделей делает второй шаг. Оно приводит результат к виду, в котором текстом можно пользоваться. Убирает заминки, расставляет запятые, разбивает на абзацы, понимает, что говорящий передумал в середине фразы.
Для оценки таких моделей есть общая мера — доля ошибочных слов. По-английски её называют WER, word error rate: сколько слов из ста модель услышала неправильно, пропустила или добавила от себя. Чем цифра меньше, тем лучше, и 5% ошибок означает, что примерно каждое двадцатое слово придётся поправить.
Важная оговорка: цифры разных замеров сравнивать между собой нельзя. Модель, показавшая 2,6% на чистой студийной записи, на планёрке с шумом и перебиваниями покажет заметно хуже.
Что произошло
Google представила Gemini 3.5 Transcribe — свою новую модель перевода речи в текст. Она пришла на смену прежней модели компании, Chirp 3.
Модель работает в двух режимах, и различие между ними практическое. Первый — потоковый: текст появляется по ходу речи, задержка меньше секунды. Это режим для голосового ввода и для голосовых помощников, которым надо отвечать сразу. Второй — обработка готовых записей: сюда отдают файл с планёркой, интервью или записью звонка, а на выходе получают текст с разделением реплик и меткой времени к каждому слову.
Что модель делает с текстом
Ключевое отличие от привычного голосового ввода: модель сразу приводит сказанное к читаемому виду.
Она убирает слова-паразиты. Она понимает самокоррекцию: если человек сказал «давай встретимся во вторник — нет, в среду», в тексте останется среда. Она сама расставляет форматирование. И к ней можно подключить собственный словарь: список терминов, названий компаний, фамилий и нестандартных написаний, чтобы модель не коверкала то, что для вас важно.
Поддерживается больше 85 языков, среди них русский. Модель определяет язык сама и справляется с переключением между языками внутри одной записи — обычная ситуация для наших планёрок, где половина терминов английские.
Насколько она точнее прежней
Здесь стоит быть аккуратным с цифрами, потому что Google приводит два разных замера.
На многоязычном наборе тестов доля ошибок в живой речи — 5,5%, тогда как у прежней модели Chirp 3 компания намеряла 7,32%. То есть прибавка в точности есть, но небольшая: одно исправленное слово из тех же примерно двадцати.
В другом замере, который проводила сторонняя компания Artificial Analysis, у модели вышло 4,0% ошибок в потоковом режиме и 2,6% при обработке готовых записей. Цифры ниже, но это другой набор данных, и с предыдущей моделью в этом замере не сравнивали.
Заметнее всего изменилась скорость: путь от звука до финального текста стал быстрее на 70%.
Где это уже работает
Обычным пользователям модель досталась в приложении Gemini на macOS — пока на английском языке. Там она не только расшифровывает речь, но и выполняет голосовые команды: может пересказать локальный файл или сгенерировать картинку прямо в месте, где стоит курсор.
Вторая точка — функция Rambler в клавиатуре Gboard на Android. Здесь важное уточнение, которое теряется в пересказах: пока она доступна только на телефонах Pixel 11, а расширить её на другие устройства Google обещает до конца года.
Разработчикам модель открыта через Gemini API в предварительной версии, компаниям — через корпоративную платформу Google. Отдельно обещан браузер Chrome: там появится голосовой ввод в любое текстовое поле.
🔎 Что вышло не так, как объявили. Первоначально Google сообщила журналистам, что вместе с Transcribe выходят ещё две модели для голосового общения. После публикации материалов компания уточнила: сейчас выпускается только Transcribe, а сроки остальных не определены.
Что это значит для бизнеса
Спрос на такие инструменты растёт с обеих сторон: «перевод аудио в текст» ищут около 6 тысяч раз в месяц, «расшифровка аудио в текст» — ещё около 7 тысяч. За этими запросами стоит рабочая задача: планёрки, интервью, звонки отдела продаж.
Первое следствие — про экономию времени. Час записи планёрки живой человек расшифровывает примерно за три-четыре часа. Модель отдаёт готовый текст за минуты, и работа сводится к вычитке. Считать выгоду надо именно так: не «сколько стоит сервис», а «сколько часов сотрудника он освобождает».
Второе — про разбор звонков. Метки времени к каждому слову и разделение говорящих превращают запись разговора в материал, по которому можно работать: где менеджер перебил клиента, на какой минуте прозвучало возражение, сколько говорил каждый. Дальше текст можно передать другой модели для разбора — как это устроено технически, разбирали в материале про API.
Третье — и это главное ограничение. Модель не записывает дословно, а переписывает сказанное: убирает лишнее, правит оговорки. Для планёрки это плюс. Для протокола, который потом станет частью договора, для записи претензии клиента или для интервью, где важна точная формулировка, — риск. В таких случаях нужен дословный вариант, а «причёсанный» текст годится только как черновик.
Четвёртое — про свой словарь. Он закрывает главную боль отраслевых компаний: любая модель спотыкается на профессиональных терминах, названиях товаров и фамилиях. Список из пары сотен своих слов снимает большую часть правок.
Что это значит для специалиста
- Руководителю отдела продаж. Расшифровка звонков перестаёт быть отдельным проектом: разбор разговоров можно поставить на поток и смотреть не «как получилось», а что именно говорилось.
- Владельцу бизнеса. Посчитайте, сколько часов в месяц уходит на протоколы совещаний. Обычно это первая задача, которая окупает такой инструмент.
- Юристу и HR. Помните про переписывание: для документов, где важна точность формулировки, нужен дословный вариант, а не приведённый в порядок.
- Маркетологу. Интервью с клиентами — источник живого языка для текстов. Расшифровка превращает эти записи в материал, с которым можно работать: как это делать дальше, разбирали в статье про нейросети для текста.
- Тем, кто внедряет ИИ-сотрудников. Потоковый режим с задержкой меньше секунды — это про голосовых помощников, которые отвечают в реальном времени; что для этого ещё нужно, собрано в гайде про ИИ-сотрудников.
Что делать уже сейчас
- Возьмите одну реальную запись. Планёрку или звонок клиенту — не идеальный тестовый файл, а рабочий, с шумом и перебиваниями.
- Прогоните её через два-три сервиса. Сравнивайте не рекламные цифры, а свой результат: сколько правок пришлось внести.
- Соберите свой словарь. Названия товаров, фамилии, отраслевые термины — двести слов снимают большую часть ошибок.
- Разделите задачи на «причесать» и «дословно». Для планёрок подойдёт умная расшифровка, для юридически значимых записей — только дословная.
- Проверьте, что вы имеете право записывать. Запись разговора с клиентом требует его согласия — это отдельный вопрос к юристу, а не к сервису.
- Посчитайте экономию в часах. Сколько времени уходит на расшифровку сейчас и сколько останется на вычитку.
Чего ждать дальше
Ближайшее — голосовой ввод в браузере. Обещанная поддержка в Chrome означает, что диктовать можно будет в любое поле на любом сайте, и это меняет привычку сильнее, чем отдельное приложение.
Второе — конкуренция на этом участке обострится. Расшифровка речи давно перестала быть отдельным продуктом и превращается в функцию внутри больших моделей: то же самое делают OpenAI и открытые модели вроде Whisper. Для покупателя это означает падение цены.
Третье — вопрос дословности станет заметнее. Чем лучше модели «причёсывают» речь, тем чаще будет всплывать разница между «что человек сказал» и «что модель записала». Для рабочих задач это мелочь, для юридических — нет.
Частые вопросы
Что такое Gemini 3.5 Transcribe?
Модель Google, которая переводит речь в текст и сразу приводит его в порядок: убирает слова-паразиты, учитывает оговорки, расставляет форматирование.
Русский язык поддерживается?
Да, он входит в число более чем 85 поддерживаемых языков. Модель также умеет определять язык сама и переключаться между языками внутри одной записи.
Насколько она точная?
В живой речи — 5,5% ошибочных слов против 7,32% у предыдущей модели Google. В отдельном замере компании Artificial Analysis — 4,0% в потоке и 2,6% на готовых записях; это другой набор данных, и сравнения с прежней моделью там нет.
Она различает говорящих?
При обработке готовых записей — да, до трёх человек, плюс ставит метку времени к каждому слову.
Где ей можно пользоваться прямо сейчас?
В приложении Gemini на macOS (на английском), в функции Rambler клавиатуры Gboard на телефонах Pixel 11 и через Gemini API для разработчиков. Поддержка в Chrome обещана позже.
Работает ли это из России?
Сайты Google AI Studio и Gemini с российского адреса открываются, обращения к программному интерфейсу доходят до сервиса — мы это проверили. Дальше всё упирается в ключ доступа и аккаунт Google, поэтому проверять нужно на своём.
Можно ли получить дословную расшифровку?
Смысл этой модели в обратном — она специально приводит речь в порядок. Если нужна дословность, берите инструмент, который её обещает, и проверяйте результат на своей записи.
