Голосовой ИИ последние годы переживает бум инвестиций — деньги текут в стартапы, работающие над моделями, сервисами для клиентских центров, диктовкой и ассистентами для встреч. Почти еженедельно на рынок выходит новый инструмент, позиционирующий себя как революционный. Но действительно ли это перемена игры, или здесь побеждает маркетинг?

Шон Вэнь, технический директор платформы PolyAI для голосовых сервисов, во время конференции HumanX высказал скептическую позицию: голосовой ИИ ещё не прошёл свой "ChatGPT момент". Да, инженеры уже научились создавать full-duplex модели, которые способны говорить и одновременно слушать собеседника. Но это только полусырой результат. Главная проблема — скорость рассуждений: модели медленно обрабатывают запросы, и диалог получается неестественным, рваным.

В попытке создать действительно убедительного голосового ассистента эксперты выделяют несколько узких мест. Вэнь подчеркивает: ассистент должен звучать естественно, а не как робот. Клиент в сервисе, прежде чем доверять такой системе, проходит первые два-три взаимодействия, словно тестирует её. И только если система справляется хорошо, человек начинает верить, что ему вообще не нужен живой человек. Алекс Гей, маркетолог приложения Otter (заметки с встреч на базе ИИ), добавляет ещё одно измерение: при замене человека на цифрового двойника на встречах критична не только точность, но и способность передать эмоциональный контекст разговора. "Если у вас нет возможности обсуждать, спорить и чувствовать отношение, то это просто чатбот для вопросов-ответов", — прямо говорит Гей.

Второе узкое место — точность распознавания речи (ASR). Звучит странно, но это остаётся критической проблемой, даже на фоне всеобщего восхищения LLM. Если ASR пропускает ключевые слова из-за фонового шума или акцента, то весь дальнейший анализ встречи или заказа становится ошибочным. Гей честно говорит: для Otter транскрипция — это не цель, а основа. Если основу заложить неправильно, все следующие действия (резюме, автоматизация) развалятся. И в момент, когда система даст неверный результат, пользователь теряет доверие к платформе. Отсюда вывод: улучшение ASR — это не маркетинговое "улучшение", а инженерная необходимость.

Третий блок проблем — прозрачность и этика. Когда голосовой ИИ звонит клиенту или участвует в совещании, все должны знать, что перед ними машина, а не человек. Это не только правовой вопрос, но и вопрос доверия. Otter работает над тем, чтобы заранее уведомлять участников о записи встречи. PolyAI подчёркивает необходимость явно говорить клиентам, что они разговаривают с ИИ-агентом.

В контексте российского бизнеса голосовой ИИ уже находит применение в двух направлениях. Первое — автоматизация customer service: компании используют системы для первичной обработки звонков, которые перенаправляют сложные случаи человеку. Второе — запись и анализ встреч для больших отделов продаж или поддержки. На практике здесь возникают те же проблемы: русский язык с региональными акцентами требует более точных моделей, чем англоязычные инструменты, а транскрибирование встреч часто показывает ошибки, которые приходится редактировать вручную. Платформы типа AI Studio в части автоматизации документооборота работают с текстом и структурированными данными, но собственно голосовой интерфейс — это отдельная технология, где прогресс медленнее, чем кажется.

Вывод простой: да, инвестиции в голосовой ИИ имеют смысл, потому что интерфейс голос-потом-действие — это естественно для людей. Но до опорного момента вроде "ChatGPT для голоса" ещё далеко. Нужны не фичи, а качество: скорость обработки, абсолютно надёжное распознавание, эмоциональный интеллект и прозрачность в общении. Компании, которые вложат ресурсы именно в эти качества, а не в маркетинговые обещания, получат реальное преимущество.