Как вообще устроен голосовой бот
Классический голосовой агент собран из 3 частей: распознавание переводит речь в текст (STT), языковая модель читает текст и придумывает ответ, синтез превращает ответ обратно в речь (TTS).
Системы передают друг другу эстафету, и на каждой передаче теряется время.
Отсюда знакомая всем картина: сказали фразу, тишина на секунду-две, потом бот начинает говорить. Если в это время человек добавил «а, и ещё», бот либо не услышал, либо оборвал себя и начал заново. Разработчик вынужден вручную программировать, что делать при перебивании, при паузе, при шуме за спиной у звонящего.
Резонный вопрос: Алису или Siri тоже можно перебить, в чём новость? В том, как устроено перебивание. У ботов, собранных цепочкой из распознавания, модели и синтеза (так устроено большинство голосовых помощников), во время речи бота работает только детектор звука: услышал голос, оборвал реплику, включил распознавание. Модель в этот момент ничего не понимает, поэтому бот одинаково замолкает от «стоп», от «угу» и от того, что вы попросили коллегу закрыть дверь. Разработчик потом вручную решает, что с этим делать: продолжать с места обрыва или начинать заново.
Полнодуплексный режим это работа одной модели с входящим и исходящим звуком одновременно, как у человека в разговоре. Она не ждёт конца реплики, чтобы начать понимать, и не замолкает целиком, чтобы услышать. OpenAI прямо пишет, что GPT-Live-1 не пошаговая модель, и сравнивает её с собственной GPT-Realtime-2.1, которая работала по очереди.
Что произошло
Десятого сентября OpenAI открыла GPT-Live-1 через API. Модель появилась в ChatGPT раньше, теперь её можно встраивать в свои продукты.
Ключевая идея архитектуры состоит в разделении труда. GPT-Live-1 отвечает только за голосовой слой: слушать, говорить, держать ритм разговора, реагировать на перебивания.
Рассуждения, работу с базами данных, вызов инструментов она делегирует текстовой модели, которую выбирает разработчик. OpenAI прямо называет пары: Luna для массовых простых задач вроде записи и статуса заказа, Astra для сложных обращений, где нужно думать.
Что заявлено в анонсе:
- модель обрабатывает перебивания и подтверждения («ага», «да-да») по ходу речи, не прерывая работу;
- отличает фоновый шум и разговор с третьим лицом от обращения к себе;
- держит контекст в длинных сессиях без потери качества;
- поддерживает телефонию: живые звонки, не только чат в приложении;
- отдаёт расшифровку речи и текст ответа, понимает буквенно-цифровые коды (номера заказов, коды подтверждения), поддерживает подсказку ключевых слов;
- тон, темп и стиль задаются системным промптом.
Цифры, которые называет OpenAI
| Показатель | Значение |
|---|---|
| Цена голосового слоя | $0,05 за минуту |
| Бэкенд-модель | оплачивается отдельно по своим тарифам |
| Full Duplex Bench (перебивания, паузы, поддакивания) | +30 п. п. к GPT-Realtime-2.1 |
| Tau3 (задачи голосового агента до результата) | первое место в паре с GPT-6 Astra |
| Новых голосов | 12 |
Отдельно OpenAI приводит опыт ранних клиентов. Сервис изучения языков Speak сообщил, что модель даёт ученику больше времени подумать до ответа репетитора, и число перебиваний сократилось почти на 80% по сравнению с прежней пошаговой системой.
Yelp встроил модель в приём звонков на бронирование и заказ еды и отмечает рост доли обработанных звонков. Один из клиентов пишет, что замена связки из 3 систем на одну модель сократила его кодовую базу на 80%.
Важно помнить, откуда взяты все эти цифры: из материалов самой OpenAI и её клиентов. Независимых замеров на момент публикации нет, и до их появления к процентам стоит относиться как к заявке производителя.
Что это значит бизнесу
Главная причина, по которой люди бросают трубку на голосового робота, это ритм разговора. Голос и словарный запас стоят на втором месте. Робот не даёт вставить слово, переспрашивает то, что уже сказано, замолкает не там. Полнодуплексная модель бьёт именно в эту точку.
Для малого бизнеса это означает, что типовые звонки (запись, перенос, статус заказа, ответ на «вы работаете в субботу?») становится реально отдать машине без потери клиентов. Причём цена ясна заранее: минута разговора стоит $0,05 за голос плюс расход бэкенд-модели, и при коротких звонках второй слагаемое обычно меньше первого.
Второе следствие касается тех, кто уже строил голосовых ботов из трёх частей. Их архитектура резко устарела: 3 подписки, 3 точки отказа и ручная логика перебиваний против одной модели. Переход не бесплатный, но, судя по отзывам клиентов OpenAI, окупается сокращением кода и поддержки.
Третье следствие касается данных. Разговор клиента уходит на серверы OpenAI, и для компаний с требованиями к хранению персональных данных внутри страны это стоп-фактор. Здесь выбор простой: либо российская платформа с собственной голосовой связкой, либо обезличивание перед отправкой.
У Нои голосовые кампании работают через российскую телефонию, и клиентские данные не покидают контур. Для многих ниш это важнее плавности перебивания.
Что делать уже сейчас
Если у вас есть входящие звонки, которые принимает человек, порядок такой.
- Посчитать, сколько минут в месяц уходит на типовые звонки: запись, перенос, статус, часы работы. Обычно это 40–60% всего потока.
- Умножить на $0,05 и добавить примерную стоимость бэкенда: получится верхняя граница цены за автоматизацию.
- Сравнить с тем, во сколько эти же минуты обходятся в зарплате оператора.
- Прежде чем строить своего агента, включить речевую аналитику на текущие звонки: она покажет, какие сценарии повторяются и что именно должен уметь бот.
- Для сценариев, где важно хранить данные в России, посмотреть готовых ИИ-сотрудников на российских платформах вместо прямой интеграции с API.
Доступ к API OpenAI из России ограничен: платформа не принимает российские карты и блокирует запросы с российских адресов. Работать с моделью напрямую можно через посредников или зарубежное юрлицо, и это отдельная статья расходов, которую стоит заложить в расчёт.
Чего ждать
OpenAI обещает расширять список голосов и языков в ближайшие месяцы; про русский язык в анонсе ничего не сказано, и в первой дюжине голосов русского нет. Ждать стоит и ответа конкурентов: полнодуплексные модели показывали Google и китайские лаборатории, и цена в $0,05 за минуту теперь становится ориентиром для всего рынка.
Второе, за чем стоит следить: интеграции с телефонией у российских провайдеров. Сама по себе модель в API ничего не звонит: между ней и номером телефона должна стоять телефонная платформа, и от того, кто первым подключит новый голосовой слой, зависит, когда такие боты появятся у российского малого бизнеса без самостоятельной разработки.
