#ИИ и нейросети7 мин

Google выпустила Gemini 3.5 Transcribe: расшифровка речи с правкой на лету

Google выпустила Gemini 3.5 Transcribe — модель, которая переводит речь в текст и сразу приводит его в порядок: убирает «эээ» и «ну», исправляет оговорки вроде «давай во вторник — нет, в среду», расставляет знаки препинания. Поддерживается больше 85 языков, включая русский, а в записи модель различает до трёх говорящих и ставит метку времени к каждому слову. Главный выигрыш — в скорости: путь от звука до готового текста стал быстрее на 70%.

Google выпустила Gemini 3.5 Transcribe: расшифровка речи с правкой на лету
Коротко
  • Модель Gemini 3.5 Transcribe переводит речь в текст и сразу его форматирует: убирает слова-паразиты, учитывает самокоррекции говорящего.
  • Работает в двух режимах: потоковом (задержка меньше секунды) и для готовых записей — там есть разделение говорящих и метки времени по каждому слову.
  • Поддержка более 85 языков, включая русский; модель сама определяет язык и переключается между языками внутри одной записи.
  • Скорость: путь до финальной расшифровки быстрее на 70% по сравнению с прежней моделью Chirp 3.
  • Точность в живой речи — 5,5% ошибок против 7,32% у Chirp 3: прибавка есть, но небольшая.
  • В отдельном замере Artificial Analysis у модели 4,0% ошибок в потоке и 2,6% на записях — цифры ниже, потому что это другой набор данных.
  • Можно подключить свой словарь — термины, названия, фамилии, нестандартное написание.
  • Где уже работает: приложение Gemini на macOS (английский), функция Rambler в клавиатуре Gboard (пока только на Pixel 11), доступ для разработчиков через Gemini API. Скоро — в Chrome.

Чем расшифровка отличается от распознавания речи

Распознавание речи — задача старая: программа слышит звук и пишет то, что услышала. Дословно, со всеми «эээ», повторами и оговорками. Дальше человек садится и вычищает этот текст руками — и часто это дольше, чем набрать заново.

Новое поколение таких моделей делает второй шаг. Оно приводит результат к виду, в котором текстом можно пользоваться. Убирает заминки, расставляет запятые, разбивает на абзацы, понимает, что говорящий передумал в середине фразы.

Для оценки таких моделей есть общая мера — доля ошибочных слов. По-английски её называют WER, word error rate: сколько слов из ста модель услышала неправильно, пропустила или добавила от себя. Чем цифра меньше, тем лучше, и 5% ошибок означает, что примерно каждое двадцатое слово придётся поправить.

Важная оговорка: цифры разных замеров сравнивать между собой нельзя. Модель, показавшая 2,6% на чистой студийной записи, на планёрке с шумом и перебиваниями покажет заметно хуже.

Что произошло

Google представила Gemini 3.5 Transcribe — свою новую модель перевода речи в текст. Она пришла на смену прежней модели компании, Chirp 3.

Модель работает в двух режимах, и различие между ними практическое. Первый — потоковый: текст появляется по ходу речи, задержка меньше секунды. Это режим для голосового ввода и для голосовых помощников, которым надо отвечать сразу. Второй — обработка готовых записей: сюда отдают файл с планёркой, интервью или записью звонка, а на выходе получают текст с разделением реплик и меткой времени к каждому слову.

Что модель делает с текстом

Ключевое отличие от привычного голосового ввода: модель сразу приводит сказанное к читаемому виду.

Она убирает слова-паразиты. Она понимает самокоррекцию: если человек сказал «давай встретимся во вторник — нет, в среду», в тексте останется среда. Она сама расставляет форматирование. И к ней можно подключить собственный словарь: список терминов, названий компаний, фамилий и нестандартных написаний, чтобы модель не коверкала то, что для вас важно.

Поддерживается больше 85 языков, среди них русский. Модель определяет язык сама и справляется с переключением между языками внутри одной записи — обычная ситуация для наших планёрок, где половина терминов английские.

Насколько она точнее прежней

Здесь стоит быть аккуратным с цифрами, потому что Google приводит два разных замера.

На многоязычном наборе тестов доля ошибок в живой речи — 5,5%, тогда как у прежней модели Chirp 3 компания намеряла 7,32%. То есть прибавка в точности есть, но небольшая: одно исправленное слово из тех же примерно двадцати.

В другом замере, который проводила сторонняя компания Artificial Analysis, у модели вышло 4,0% ошибок в потоковом режиме и 2,6% при обработке готовых записей. Цифры ниже, но это другой набор данных, и с предыдущей моделью в этом замере не сравнивали.

Заметнее всего изменилась скорость: путь от звука до финального текста стал быстрее на 70%.

Где это уже работает

Обычным пользователям модель досталась в приложении Gemini на macOS — пока на английском языке. Там она не только расшифровывает речь, но и выполняет голосовые команды: может пересказать локальный файл или сгенерировать картинку прямо в месте, где стоит курсор.

Вторая точка — функция Rambler в клавиатуре Gboard на Android. Здесь важное уточнение, которое теряется в пересказах: пока она доступна только на телефонах Pixel 11, а расширить её на другие устройства Google обещает до конца года.

Разработчикам модель открыта через Gemini API в предварительной версии, компаниям — через корпоративную платформу Google. Отдельно обещан браузер Chrome: там появится голосовой ввод в любое текстовое поле.

🔎 Что вышло не так, как объявили. Первоначально Google сообщила журналистам, что вместе с Transcribe выходят ещё две модели для голосового общения. После публикации материалов компания уточнила: сейчас выпускается только Transcribe, а сроки остальных не определены.

Что это значит для бизнеса

Спрос на такие инструменты растёт с обеих сторон: «перевод аудио в текст» ищут около 6 тысяч раз в месяц, «расшифровка аудио в текст» — ещё около 7 тысяч. За этими запросами стоит рабочая задача: планёрки, интервью, звонки отдела продаж.

Первое следствие — про экономию времени. Час записи планёрки живой человек расшифровывает примерно за три-четыре часа. Модель отдаёт готовый текст за минуты, и работа сводится к вычитке. Считать выгоду надо именно так: не «сколько стоит сервис», а «сколько часов сотрудника он освобождает».

Второе — про разбор звонков. Метки времени к каждому слову и разделение говорящих превращают запись разговора в материал, по которому можно работать: где менеджер перебил клиента, на какой минуте прозвучало возражение, сколько говорил каждый. Дальше текст можно передать другой модели для разбора — как это устроено технически, разбирали в материале про API.

Третье — и это главное ограничение. Модель не записывает дословно, а переписывает сказанное: убирает лишнее, правит оговорки. Для планёрки это плюс. Для протокола, который потом станет частью договора, для записи претензии клиента или для интервью, где важна точная формулировка, — риск. В таких случаях нужен дословный вариант, а «причёсанный» текст годится только как черновик.

Четвёртое — про свой словарь. Он закрывает главную боль отраслевых компаний: любая модель спотыкается на профессиональных терминах, названиях товаров и фамилиях. Список из пары сотен своих слов снимает большую часть правок.

Что это значит для специалиста

  • Руководителю отдела продаж. Расшифровка звонков перестаёт быть отдельным проектом: разбор разговоров можно поставить на поток и смотреть не «как получилось», а что именно говорилось.
  • Владельцу бизнеса. Посчитайте, сколько часов в месяц уходит на протоколы совещаний. Обычно это первая задача, которая окупает такой инструмент.
  • Юристу и HR. Помните про переписывание: для документов, где важна точность формулировки, нужен дословный вариант, а не приведённый в порядок.
  • Маркетологу. Интервью с клиентами — источник живого языка для текстов. Расшифровка превращает эти записи в материал, с которым можно работать: как это делать дальше, разбирали в статье про нейросети для текста.
  • Тем, кто внедряет ИИ-сотрудников. Потоковый режим с задержкой меньше секунды — это про голосовых помощников, которые отвечают в реальном времени; что для этого ещё нужно, собрано в гайде про ИИ-сотрудников.

Что делать уже сейчас

  1. Возьмите одну реальную запись. Планёрку или звонок клиенту — не идеальный тестовый файл, а рабочий, с шумом и перебиваниями.
  2. Прогоните её через два-три сервиса. Сравнивайте не рекламные цифры, а свой результат: сколько правок пришлось внести.
  3. Соберите свой словарь. Названия товаров, фамилии, отраслевые термины — двести слов снимают большую часть ошибок.
  4. Разделите задачи на «причесать» и «дословно». Для планёрок подойдёт умная расшифровка, для юридически значимых записей — только дословная.
  5. Проверьте, что вы имеете право записывать. Запись разговора с клиентом требует его согласия — это отдельный вопрос к юристу, а не к сервису.
  6. Посчитайте экономию в часах. Сколько времени уходит на расшифровку сейчас и сколько останется на вычитку.

Чего ждать дальше

Ближайшее — голосовой ввод в браузере. Обещанная поддержка в Chrome означает, что диктовать можно будет в любое поле на любом сайте, и это меняет привычку сильнее, чем отдельное приложение.

Второе — конкуренция на этом участке обострится. Расшифровка речи давно перестала быть отдельным продуктом и превращается в функцию внутри больших моделей: то же самое делают OpenAI и открытые модели вроде Whisper. Для покупателя это означает падение цены.

Третье — вопрос дословности станет заметнее. Чем лучше модели «причёсывают» речь, тем чаще будет всплывать разница между «что человек сказал» и «что модель записала». Для рабочих задач это мелочь, для юридических — нет.

Частые вопросы

Что такое Gemini 3.5 Transcribe?
Модель Google, которая переводит речь в текст и сразу приводит его в порядок: убирает слова-паразиты, учитывает оговорки, расставляет форматирование.

Русский язык поддерживается?
Да, он входит в число более чем 85 поддерживаемых языков. Модель также умеет определять язык сама и переключаться между языками внутри одной записи.

Насколько она точная?
В живой речи — 5,5% ошибочных слов против 7,32% у предыдущей модели Google. В отдельном замере компании Artificial Analysis — 4,0% в потоке и 2,6% на готовых записях; это другой набор данных, и сравнения с прежней моделью там нет.

Она различает говорящих?
При обработке готовых записей — да, до трёх человек, плюс ставит метку времени к каждому слову.

Где ей можно пользоваться прямо сейчас?
В приложении Gemini на macOS (на английском), в функции Rambler клавиатуры Gboard на телефонах Pixel 11 и через Gemini API для разработчиков. Поддержка в Chrome обещана позже.

Работает ли это из России?
Сайты Google AI Studio и Gemini с российского адреса открываются, обращения к программному интерфейсу доходят до сервиса — мы это проверили. Дальше всё упирается в ключ доступа и аккаунт Google, поэтому проверять нужно на своём.

Можно ли получить дословную расшифровку?
Смысл этой модели в обратном — она специально приводит речь в порядок. Если нужна дословность, берите инструмент, который её обещает, и проверяйте результат на своей записи.

Промпт: превратить расшифровку созвона в рабочие выводы

Работает в любой нейросети. На вход — текст расшифровки, на выходе — протокол, задачи с ответственными и разбор разговора по существу.

Промпт
Ты — руководитель, который умеет вытаскивать из длинных разговоров суть и превращать её в задачи. Отвечаешь за то, чтобы после встречи осталась не стена текста, а понятный список решений и действий.

ЗАДАЧА
Разобрать расшифровку разговора и собрать из неё три вещи: краткий протокол, список задач с ответственными и сроками, разбор того, что осталось нерешённым.

ЧТО Я ДАЮ
— тип разговора: [планёрка / звонок клиенту / интервью / переговоры]
— участники и роли: [кто есть кто; если в тексте «Говорящий 1» — распиши, кто это]
— цель встречи: [зачем собирались]
— текст расшифровки: [вставьте сюда]

С ЧЕГО НАЧИНАЕШЬ
Если чего-то не хватает — спрашивай ПО ОДНОМУ ВОПРОСУ ЗА РАЗ, не вываливай список. Если в расшифровке не разобрать, кто говорит, скажи об этом прямо и попроси разметить реплики.

ПРОТОКОЛ
1. Прочитай расшифровку целиком и напиши, о чём был разговор, в трёх предложениях. Без деталей — только суть.
2. Собери принятые решения. Каждое — одной строкой, формулировкой из разговора, а не своим пересказом. Если решение прозвучало нечётко, помечай: «сформулировано неточно».
3. Выпиши задачи: что сделать, кто делает, к какому сроку. Если ответственный или срок в разговоре не назван — так и пиши «ответственный не назван», не додумывай.
4. Отдельно собери вопросы, которые подняли и не закрыли. Это самая полезная часть протокола и самая часто теряемая.
5. Найди места, где участники поняли друг друга по-разному: один говорит про одно, второй отвечает про другое. Процитируй обе реплики.
6. Если это разговор с клиентом — выпиши все возражения и сомнения дословно, с указанием, чем на них ответили и убедил ли ответ.
7. Оцени разговор по делу: сколько времени ушло на предмет встречи, а сколько на всё остальное. Без морали, просто наблюдение.
8. В конце дай три вопроса, которые стоит задать на следующей встрече, чтобы закрыть повисшее.

ФОРМАТ ОТВЕТА
Сначала три строки: тема, главное решение, главный риск. Затем блоки: «Решения», «Задачи» таблицей (задача — кто — срок), «Осталось нерешённым», «Разное понимание», «Возражения» (если был клиент). В конце — три вопроса на следующую встречу.

ПРАВИЛА
— цитируешь дословно, когда речь про решения, суммы, сроки и возражения: пересказ здесь искажает смысл;
— ничего не добавляешь от себя: если в тексте нет срока, его нет и в протоколе;
— расшифровка бывает с ошибками распознавания — если слово выглядит искажённым, помечай его знаком вопроса, а не угадывай;
— не сглаживаешь острые места: если в разговоре был спор, он должен быть виден и в протоколе.
Способ зарабатывать на ИИ
Зарабатывайте на создании сайтов и ИИ-агентов
  • Собираете клиенту сайт и ИИ-продавца за вечер вместо недель разработки
  • Конструктор сайтов и ИИ-сотрудники — в одном российском сервисе
  • Бонус 1 000 ₽ при регистрации по этой ссылке вместо обычных 500 ₽
Начать бесплатно
Регистрация занимает минуту, без VPN и иностранных карт
Источники

📚Разбираем тему подробно

Все статьи
Что такое API: полный гайд 2026 с примерами для бизнеса
05.03.2026#Термины ИИ и маркетинга
Что такое API: полный гайд 2026 с примерами для бизнеса
API (Application Programming Interface) — это набор правил, по которым программы обмениваются данными и функциями без прямого доступа к исходному коду друг друга.
Нейросети 2026: какую выбрать под задачу и что работает в России
09.08.2026#Нейросети: обзоры и сравнения
Нейросети 2026: какую выбрать под задачу и что работает в России
Большинство зарубежных нейросетей из России без VPN не работают — но список того, что работает напрямую, длиннее, чем принято думать. Мы проверили 50 сервисов и разобрали их по задачам: тексты, картинки, видео, код, сайты и ответы клиентам.
Нейросеть для текста: какую выбрать и как ставить задание
25.08.2026#Промпты для нейросетей
Нейросеть для текста: какую выбрать и как ставить задание
Пост выходит гладким и пустым, статья — набором общих слов, письмо клиенту — вежливым спамом. Причина не в модели: ей дали задачу в одну строку и не сказали, для кого текст и что должно произойти с читателем.
ИИ-сотрудники для бизнеса: полный гайд 2026 — что умеют, чем отличаются от автономных ИИ-агентов и как внедрить с нуля
29.05.2026#ИИ-сотрудники для бизнеса
ИИ-сотрудники для бизнеса: полный гайд 2026 — что умеют, чем отличаются от автономных ИИ-агентов и как внедрить с нуля
Рынок ИИ-инструментов для бизнеса в 2026 году взорвался. И вместе с возможностями пришла путаница: одни говорят «ИИ-сотрудник», другие — «ИИ-агент», третьи — «автономный агент».

🗞Другие новости

Все новости