#ИИ и нейросети7 мин

Google выпустила Gemini 3.5 Transcribe: расшифровка речи с правкой на лету

Google выпустила Gemini 3.5 Transcribe — модель перевода речи в текст с двумя режимами работы. По умолчанию она пишет дословно, со всеми «эээ» и оговорками; во втором режиме приводит текст в порядок: убирает заминки, разрешает самокоррекции вроде «давай во вторник — нет, в среду», сама расставляет абзацы и списки. В официальном списке 83 языка, русский среди них. Час записи обходится примерно в 30 центов, но у модели есть ограничения, о которых в пересказах не пишут.

Google выпустила Gemini 3.5 Transcribe: расшифровка речи с правкой на лету
Коротко
  • У модели два режима расшифровки: verbatim — дословно, со всеми заминками (он стоит по умолчанию), и smart — с чисткой, автоформатированием и разрешением оговорок.
  • 🔎 Режимы взаимоисключающие: причёсанный текст нельзя совместить с метками времени и разделением говорящих. Нужен разбор по спикерам — получите дословную расшифровку.
  • Разделение говорящих — до 8 человек; для трёх и более, по документации Google, эта функция экспериментальная.
  • Ограничение по длине: обычный запрос — файл до часа, но при включённых метках времени или разделении говорящих — до 30 минут.
  • Пословные метки времени, предупреждает Google, могут ухудшить общую точность расшифровки.
  • Свой словарь — до 1000 терминов, но лучший результат обычно достигается на сотне.
  • В официальном списке 83 языка, включая русский; модель определяет язык сама и переключается между языками внутри записи.
  • Цена по прайсу Google: запись — $0,003 за минуту аудио плюс $0,002 за минуту текста на выходе, то есть около 30 центов за час. Потоковый режим — примерно $0,009 за минуту.
  • Есть бесплатный уровень, но на нём, как указано в том же прайсе, данные используются для улучшения продуктов Google; на платном — нет.
  • Скорость: путь до финальной расшифровки быстрее на 70%, чем у прежней модели Chirp 3.
  • Точность в живой речи — 5,5% ошибок против 7,32% у Chirp 3: прибавка есть, но небольшая.

Чем расшифровка отличается от распознавания речи

Распознавание речи — задача старая: программа слышит звук и пишет то, что услышала. Дословно, со всеми «эээ», повторами и оговорками. Дальше человек садится и вычищает этот текст руками — и часто это дольше, чем набрать заново.

Новое поколение таких моделей делает второй шаг. Оно приводит результат к виду, в котором текстом можно пользоваться. Убирает заминки, расставляет запятые, разбивает на абзацы, понимает, что говорящий передумал в середине фразы.

Для оценки таких моделей есть общая мера — доля ошибочных слов. По-английски её называют WER, word error rate: сколько слов из ста модель услышала неправильно, пропустила или добавила от себя. Чем цифра меньше, тем лучше, и 5% ошибок означает, что примерно каждое двадцатое слово придётся поправить.

Важная оговорка: цифры разных замеров сравнивать между собой нельзя. Модель, показавшая 2,6% на чистой студийной записи, на планёрке с шумом и перебиваниями покажет заметно хуже.

Что произошло

Google представила Gemini 3.5 Transcribe — свою новую модель перевода речи в текст. Она пришла на смену прежней модели компании, Chirp 3.

Модель работает в двух режимах, и различие между ними практическое. Первый — потоковый: текст появляется по ходу речи, задержка меньше секунды. Это режим для голосового ввода и для голосовых помощников, которым надо отвечать сразу. Второй — обработка готовых записей: сюда отдают файл с планёркой, интервью или записью звонка, а на выходе получают текст с разделением реплик и меткой времени к каждому слову.

Два режима, и выбирать придётся

Здесь главное, что теряется во всех пересказах. У модели не один способ работы, а два, и они дают разный результат.

Дословный режим (в документации он называется verbatim и стоит по умолчанию) возвращает слово в слово всё, что прозвучало: «эм», «ну», повторы, паузы, оборванные фразы. Это режим для случаев, где важно, что человек сказал буквально.

Причёсанный режим (smart) обрабатывает текст после распознавания: убирает заминки и фальстарты, разрешает самокоррекции — «давай встретимся во вторник, хотя нет, в среду в два» превращается в «давай встретимся в среду в 14:00», — сам разбивает речь на абзацы и списки, приводит в порядок даты, суммы и числа, расставляет знаки препинания.

Ещё одна возможность в обоих режимах — свой словарь: список терминов, названий и фамилий, которые модель не должна коверкать. По документации в него можно положить до 1000 слов, но лучший результат обычно даёт сотня.

В официальном списке 83 языка, русский среди них. Модель определяет язык сама и справляется с переключением внутри одной записи — обычная ситуация для наших планёрок, где половина терминов английские.

Чего нельзя совместить

А вот это в новостях не пишут вовсе, хотя для работы важнее всего остального.

Причёсанный режим не сочетается с метками времени и разделением говорящих. Так прямо сказано в документации Google. То есть либо вы получаете гладкий читаемый текст, либо разбор записи по спикерам с таймкодами — но не одновременно.

Для расшифровки планёрки это означает выбор: аккуратный текст без пометок, кто что сказал, — или дословная стенограмма, где видно говорящих, но со всеми «эээ».

Есть и другие ограничения, которые стоит знать до того, как строить на этом процесс:

  • Обычный запрос принимает файл длиной до часа. Но если включено разделение говорящих или пословные метки времени, предел падает до 30 минут. Двухчасовую встречу придётся резать на куски.
  • Разделение говорящих поддерживает до 8 человек, однако Google отдельно предупреждает: для трёх и более говорящих эта функция экспериментальная. Планёрка на пятерых — это не гарантированный результат, а проба.
  • Пословные метки времени, по той же документации, могут ухудшить общую точность расшифровки. За удобство поиска по записи платят качеством текста.

Сколько это стоит

Цены есть в открытом прайсе Google, и они пересчитаны в минуты — считать в токенах не придётся.

Обработка готовой записи: $0,003 за минуту входящего аудио и $0,002 за минуту текста на выходе. Час записи — примерно 30 центов.

Потоковый режим дороже: около $0,009 за минуту, то есть порядка полудоллара за час непрерывного распознавания.

🔎 Важная оговорка про бесплатный доступ. У модели есть бесплатный уровень. В том же прайсе рядом с ним стоит строка: данные используются для улучшения продуктов Google. У платного уровня в этой строке — «нет». Если через модель проходят записи разговоров с клиентами, разница между «бесплатно» и «три десятых цента за минуту» перестаёт быть про деньги.

Насколько она точнее прежней

Здесь стоит быть аккуратным с цифрами, потому что Google приводит два разных замера.

На многоязычном наборе тестов доля ошибок в живой речи — 5,5%, тогда как у прежней модели Chirp 3 компания намеряла 7,32%. То есть прибавка в точности есть, но небольшая: одно исправленное слово из тех же примерно двадцати.

В другом замере, который проводила сторонняя компания Artificial Analysis, у модели вышло 4,0% ошибок в потоковом режиме и 2,6% при обработке готовых записей. Цифры ниже, но это другой набор данных, и с предыдущей моделью в этом замере не сравнивали.

Заметнее всего изменилась скорость: путь от звука до финального текста стал быстрее на 70%.

Где это уже работает

Обычным пользователям модель досталась в приложении Gemini на macOS — пока на английском языке. Там она не только расшифровывает речь, но и выполняет голосовые команды: может пересказать локальный файл или сгенерировать картинку прямо в месте, где стоит курсор.

Вторая точка — функция Rambler в клавиатуре Gboard на Android. Здесь важное уточнение, которое теряется в пересказах: пока она доступна только на телефонах Pixel 11, а расширить её на другие устройства Google обещает до конца года.

Разработчикам модель открыта через Gemini API в предварительной версии, компаниям — через корпоративную платформу Google. Отдельно обещан браузер Chrome: там появится голосовой ввод в любое текстовое поле.

🔎 Что вышло не так, как объявили. Первоначально Google сообщила журналистам, что вместе с Transcribe выходят ещё две модели для голосового общения. После публикации материалов компания уточнила: сейчас выпускается только Transcribe, а сроки остальных не определены.

Что это значит для бизнеса

Спрос на такие инструменты растёт с обеих сторон: «перевод аудио в текст» ищут около 6 тысяч раз в месяц, «расшифровка аудио в текст» — ещё около 7 тысяч. За этими запросами стоит рабочая задача: планёрки, интервью, звонки отдела продаж.

Первое следствие — про экономию времени. Час записи планёрки живой человек расшифровывает примерно за три-четыре часа. Модель отдаёт готовый текст за минуты, и работа сводится к вычитке. Считать выгоду надо именно так: не «сколько стоит сервис», а «сколько часов сотрудника он освобождает».

Второе — про разбор звонков, и тут придётся принять решение заранее. Метки времени и разделение говорящих превращают запись в материал, по которому видно, где менеджер перебил клиента и на какой минуте прозвучало возражение. Но включив их, вы получаете дословную стенограмму, а не гладкий текст: причёсанный режим с ними не совмещается. Для разбора продаж это скорее плюс — важно, что человек сказал буквально. Дальше текст можно передать другой модели для анализа: как это устроено технически, разбирали в материале про API.

Третье — про длину записи. Тридцатиминутный предел при включённом разделении говорящих — не мелочь, а то, обо что спотыкается процесс. Часовая планёрка или полуторачасовые переговоры не пройдут одним куском: их надо резать, а потом склеивать расшифровки, следя за нумерацией говорящих.

Четвёртое — про выбор между дословностью и читаемостью. Для протокола, который станет частью договора, для записи претензии клиента, для интервью, где важна формулировка, — нужен дословный режим, и он как раз стоит по умолчанию. Для внутренних планёрок удобнее причёсанный. Ошибка здесь стоит дорого: причёсанный текст меняет слова говорящего, и в споре на него не сошлёшься.

Пятое — про свой словарь. Он закрывает главную боль отраслевых компаний: любая модель спотыкается на профессиональных терминах, названиях товаров и фамилиях. По документации в словарь можно положить до тысячи слов, но Google сам советует держаться в пределах сотни — дальше качество не растёт.

Шестое — про цену и про то, что за ней стоит. Тридцать центов за час записи означают, что деньги в этой задаче перестали быть аргументом: месяц ежедневных планёрок стоит меньше обеда. Но бесплатный уровень — это другой договор: там данные идут на улучшение продуктов Google. Для записей с клиентами разница принципиальная.

Что это значит для специалиста

  • Руководителю отдела продаж. Для разбора звонков берите дословный режим с разделением говорящих: он покажет, кто что сказал. Помните про предел в 30 минут — длинные переговоры придётся резать.
  • Владельцу бизнеса. Посчитайте, сколько часов в месяц уходит на протоколы совещаний. При цене около 30 центов за час записи вопрос упирается не в бюджет, а в то, кто будет вычитывать результат.
  • Юристу и HR. Дословный режим стоит по умолчанию — это правильный выбор для ваших задач. Причёсанный текст меняет формулировки говорящего, и для документа он не годится.
  • Маркетологу. Интервью с клиентами — источник живого языка для текстов. Расшифровка превращает эти записи в материал, с которым можно работать: как это делать дальше, разбирали в статье про нейросети для текста.
  • Тем, кто внедряет ИИ-сотрудников. Потоковый режим с задержкой меньше секунды — это про голосовых помощников, которые отвечают в реальном времени; что для этого ещё нужно, собрано в гайде про ИИ-сотрудников.

Что делать уже сейчас

  1. Возьмите одну реальную запись. Планёрку или звонок клиенту — не идеальный тестовый файл, а рабочий, с шумом и перебиваниями.
  2. Прогоните её через два-три сервиса. Сравнивайте не рекламные цифры, а свой результат: сколько правок пришлось внести.
  3. Соберите свой словарь. Названия товаров, фамилии, отраслевые термины — двести слов снимают большую часть ошибок.
  4. Разделите задачи на «причесать» и «дословно». Для планёрок подойдёт причёсанный режим, для юридически значимых записей и разбора звонков — дословный. Совместить с метками времени можно только второй.
  5. Проверьте длину своих записей. Если встречи идут дольше получаса, а нужны говорящие, закладывайте нарезку в процесс сразу.
  6. Не гоняйте рабочие записи через бесплатный уровень. На нём данные используются для улучшения продуктов Google; платный этого не делает и стоит копейки.
  7. Проверьте, что вы имеете право записывать. Запись разговора с клиентом требует его согласия — это отдельный вопрос к юристу, а не к сервису.
  8. Посчитайте экономию в часах. Сколько времени уходит на расшифровку сейчас и сколько останется на вычитку.

Чего ждать дальше

Ближайшее — голосовой ввод в браузере. Обещанная поддержка в Chrome означает, что диктовать можно будет в любое поле на любом сайте, и это меняет привычку сильнее, чем отдельное приложение.

Второе — конкуренция на этом участке обострится. Расшифровка речи давно перестала быть отдельным продуктом и превращается в функцию внутри больших моделей: то же самое делают OpenAI и открытые модели вроде Whisper. Для покупателя это означает падение цены.

Третье — вопрос дословности станет заметнее. Чем лучше модели «причёсывают» речь, тем чаще будет всплывать разница между «что человек сказал» и «что модель записала». Для рабочих задач это мелочь, для юридических — нет.

Частые вопросы

Что такое Gemini 3.5 Transcribe?
Модель Google для перевода речи в текст. Работает в двух режимах: дословном (по умолчанию) и причёсанном — во втором убирает заминки, разрешает оговорки и сам форматирует текст.

Русский язык поддерживается?
Да. В официальном списке 83 языка, русский среди них. Модель также определяет язык сама и переключается между языками внутри одной записи.

Насколько она точная?
В живой речи — 5,5% ошибочных слов против 7,32% у предыдущей модели Google. В отдельном замере компании Artificial Analysis — 4,0% в потоке и 2,6% на готовых записях; это другой набор данных, и сравнения с прежней моделью там нет.

Скольких говорящих она различает?
До восьми. Но Google предупреждает: для трёх и более говорящих эта функция экспериментальная, то есть результат не гарантирован.

Есть ли ограничение по длине записи?
Да. Обычный запрос принимает файл до часа, а при включённом разделении говорящих или пословных метках времени — до 30 минут.

Сколько это стоит?
По прайсу Google обработка записи — $0,003 за минуту аудио плюс $0,002 за минуту готового текста, то есть около 30 центов за час. Потоковый режим — примерно $0,009 за минуту. Есть и бесплатный уровень, но на нём данные используются для улучшения продуктов Google.

Где ей можно пользоваться прямо сейчас?
В приложении Gemini на macOS (на английском), в функции Rambler клавиатуры Gboard на телефонах Pixel 11 и через Gemini API для разработчиков. Поддержка в Chrome обещана позже.

Работает ли это из России?
Сайты Google AI Studio и Gemini с российского адреса открываются, обращения к программному интерфейсу доходят до сервиса — мы это проверили. Дальше всё упирается в ключ доступа и аккаунт Google, поэтому проверять нужно на своём.

Можно ли получить дословную расшифровку?
Да, это режим по умолчанию: модель вернёт всё слово в слово, включая «эм», повторы и оборванные фразы. Причёсывание — отдельный режим, который включают намеренно.

Можно ли получить и причёсанный текст, и разделение говорящих?
Нет. По документации Google причёсанный режим не совмещается ни с метками времени, ни с разделением говорящих. Придётся выбрать одно.

Промпт: превратить расшифровку созвона в рабочие выводы

Работает в любой нейросети. На вход — текст расшифровки, на выходе — протокол, задачи с ответственными и разбор разговора по существу.

Промпт
Ты — руководитель, который умеет вытаскивать из длинных разговоров суть и превращать её в задачи. Отвечаешь за то, чтобы после встречи осталась не стена текста, а понятный список решений и действий.

ЗАДАЧА
Разобрать расшифровку разговора и собрать из неё три вещи: краткий протокол, список задач с ответственными и сроками, разбор того, что осталось нерешённым.

ЧТО Я ДАЮ
— тип разговора: [планёрка / звонок клиенту / интервью / переговоры]
— участники и роли: [кто есть кто; если в тексте «Говорящий 1» — распиши, кто это]
— цель встречи: [зачем собирались]
— текст расшифровки: [вставьте сюда]

С ЧЕГО НАЧИНАЕШЬ
Если чего-то не хватает — спрашивай ПО ОДНОМУ ВОПРОСУ ЗА РАЗ, не вываливай список. Если в расшифровке не разобрать, кто говорит, скажи об этом прямо и попроси разметить реплики.

ПРОТОКОЛ
1. Прочитай расшифровку целиком и напиши, о чём был разговор, в трёх предложениях. Без деталей — только суть.
2. Собери принятые решения. Каждое — одной строкой, формулировкой из разговора, а не своим пересказом. Если решение прозвучало нечётко, помечай: «сформулировано неточно».
3. Выпиши задачи: что сделать, кто делает, к какому сроку. Если ответственный или срок в разговоре не назван — так и пиши «ответственный не назван», не додумывай.
4. Отдельно собери вопросы, которые подняли и не закрыли. Это самая полезная часть протокола и самая часто теряемая.
5. Найди места, где участники поняли друг друга по-разному: один говорит про одно, второй отвечает про другое. Процитируй обе реплики.
6. Если это разговор с клиентом — выпиши все возражения и сомнения дословно, с указанием, чем на них ответили и убедил ли ответ.
7. Оцени разговор по делу: сколько времени ушло на предмет встречи, а сколько на всё остальное. Без морали, просто наблюдение.
8. В конце дай три вопроса, которые стоит задать на следующей встрече, чтобы закрыть повисшее.

ФОРМАТ ОТВЕТА
Сначала три строки: тема, главное решение, главный риск. Затем блоки: «Решения», «Задачи» таблицей (задача — кто — срок), «Осталось нерешённым», «Разное понимание», «Возражения» (если был клиент). В конце — три вопроса на следующую встречу.

ПРАВИЛА
— цитируешь дословно, когда речь про решения, суммы, сроки и возражения: пересказ здесь искажает смысл;
— ничего не добавляешь от себя: если в тексте нет срока, его нет и в протоколе;
— расшифровка бывает с ошибками распознавания — если слово выглядит искажённым, помечай его знаком вопроса, а не угадывай;
— не сглаживаешь острые места: если в разговоре был спор, он должен быть виден и в протоколе.

Следующий шаг: превратите расшифровку любого созвона в протокол с задачами

Промпт вставляется в Ною как инструкция ИИ-сотрудника без правок. После звонка вы присылаете ему в Телеграм текст расшифровки — он возвращает протокол, таблицу задач с ответственными и список того, что осталось нерешённым. Перед следующей встречей достаточно спросить, что из прошлого протокола ещё не закрыто.

  • Участники и их роли, включая расшифровку «Говорящий 1» и «Говорящий 2», вписываются в инструкцию один раз — не нужно объяснять их заново перед каждым созвоном.
  • Протоколы прошлых встреч можно хранить в базе знаний сотрудника и перед следующим созвоном спросить, что из открытых вопросов ещё не закрыто.
  • Российский сервис, оплата в рублях, 7 дней бесплатно и без карты. По ссылке из новости на ответы начисляется 1 000 ₽ вместо 500 ₽.

Собрать протокол в Ное →

Источники

💬 Комментарии

Пока никто не написал. Будьте первым: расскажите, что оказалось полезным, а чего не хватило.
Ссылки в комментариях не публикуются.

📚Разбираем тему подробно

Все статьи
Что такое API: полный гайд 2026 с примерами для бизнеса
05.03.2026#Термины ИИ и маркетинга
Что такое API: полный гайд 2026 с примерами для бизнеса
API (Application Programming Interface) — это набор правил, по которым программы обмениваются данными и функциями без прямого доступа к исходному коду друг друга.
Нейросети 2026: какую выбрать под задачу и что работает в России
09.08.2026#Нейросети: обзоры и сравнения
Нейросети 2026: какую выбрать под задачу и что работает в России
Большинство зарубежных нейросетей из России без VPN не работают — но список того, что работает напрямую, длиннее, чем принято думать. Мы проверили 50 сервисов и разобрали их по задачам: тексты, картинки, видео, код, сайты и ответы клиентам.
Нейросеть для текста: какую выбрать и как ставить задание
25.08.2026#Промпты для нейросетей
Нейросеть для текста: какую выбрать и как ставить задание
Пост выходит гладким и пустым, статья — набором общих слов, письмо клиенту — вежливым спамом. Причина не в модели: ей дали задачу в одну строку и не сказали, для кого текст и что должно произойти с читателем.
ИИ-сотрудники для бизнеса в 2026: цены, тест на 6 моделях и данные 151 тысячи диалогов
29.05.2026#ИИ-сотрудники для бизнеса
ИИ-сотрудники для бизнеса в 2026: цены, тест на 6 моделях и данные 151 тысячи диалогов
ИИ-сотрудник это программа на языковой модели, которая отвечает клиентам по вашей базе знаний. За 30 дней до 7 октября 2026 года на платформе Ноя у 437 компаний начались 151 666 диалогов, диалог в среднем стоил 8,60 ₽. Мы сверили цены сервисов и проверили 6 моделей на диалоге из 8 реплик с ловушками: без правил 17 диалогов из 18 дали категоричный отказ, которого нет в базе знаний.

🗞Другие новости

Все новости
Claude Haiku 5.5 вышла: на русском дешевле на 87%, наш тест
8 октября, 13:07#ИИ и нейросети
Claude Haiku 5.5 вышла: на русском дешевле на 87%, наш тест
7 октября Anthropic выпустила Claude Haiku 5.5: самую маленькую и быструю модель семейства по цене $0,10 за миллион токенов на входе и $0,50 на выходе. Это в 10 раз дешевле Haiku 4.5 и в 20 раз дешевле Sonnet 5.5. Токен — кусочек текста, на которые нейросеть режет всё, что читает и пишет. Мы проверили, что из этого достанется русскоязычному бизнесу. Токенов на русский текст стало столько же, на английский на 38% больше. В тесте на 60 обращениях клиентов разметка 1 000 обращений обошлась в 19,85 ₽ против 149,96 ₽ у Haiku 4.5, а с кэшем в 9,04 ₽. Точность тоже выше: 117 запусков из 120 против 106. Главная ловушка: по умолчанию модель рассуждает про себя и пишет длиннее, а на уровне low даёт ту же точность за 5,55 ₽ с кэшем.
Реклама на Ozon с 20 октября: «Оплата за заказ» до 28%, расчёт
7 октября, 06:50#Маркетплейсы
Реклама на Ozon с 20 октября: «Оплата за заказ» до 28%, расчёт
Telegram-канал Marketplace_biz сообщил, что с 20 октября Ozon повысит ставки в нескольких рекламных инструментах. «Оплата за заказ» для отдельных товаров вырастет с 23% до 28% от стоимости заказа, продвижение всего ассортимента подорожает с 5%, 7% и 9% до 6%, 8% и 10%, а минимальный CPC (цена клика) в поиске поднимется в среднем на 19%. Новость 6 октября пересказал «Оборот». Официальных условий Ozon на 7 октября мы в открытых источниках не нашли, поэтому изменения даны по сообщению канала. Текущие ставки 23% и 5–9% подтверждаются отдельным разбором Selsup. Ниже наш расчёт: что это значит на заказе в 1 000 ₽ и как проверить свой товар промптом.
Poizon для продавцов из России: комиссия до 29% и два сайта-двойника
7 октября, 06:42#Маркетплейсы
Poizon для продавцов из России: комиссия до 29% и два сайта-двойника
Китайский маркетплейс Poizon рассказал «Коммерсанту», какие условия предлагает российским продавцам: комиссия не выше 29%, а у «премиум»-продавцов от 19%. По данным Союза продавцов маркетплейсов, на российских площадках ставки доходят до 55%. Выплаты через 7 дней после продажи, а склад может быть и у площадки, и у продавца. В России работают два сайта с названием Poizon, и компании судятся из-за бренда. Мы посчитали, сколько остаётся с куртки за 15 000 ₽ при ставках 45%, 29% и 19%: 728, 3 128 и 4 628 ₽ с единицы до налогов. Ниже условия, как отличить настоящий сайт, и промпт для расчёта по вашему товару.