АлекСо

«Сбер» разрабатывает голосовой ИИ нового типа: сможет слушать и говорить одновременно

Сбербанк объявил о разработке голосового искусственного интеллекта

«Сбер» разрабатывает голосовой ИИ нового типа: сможет слушать и говорить одновременно

В чём отличие от нынешних голосовых помощников

Сегодня голосовые ассистенты работают по очереди: человек произнёс реплику — ИИ её обработал — ответил. Принципиальная разница новой технологии в том, что вместо каскада из нескольких нейросетей задействуется одна модель. Сейчас это выглядит так:

  • первая нейросеть переводит голос в текст;

  • вторая придумывает ответ;

  • третья озвучивает его обратно.

Фулл-дуплекс убирает эту цепочку: одна модель способна слушать непрерывно, даже пока говорит сама. А с видеомодальностью она же может видеть собеседника и управлять движениями аватара.

Главный практический эффект — скорость. Задержка ответа сокращается с нескольких секунд до 160–320 миллисекунд, то есть до уровня реакции живого человека.

Кто уже сделал такое в мире

В мировом масштабе технология не нова. Первой в 2024 году стала модель Moshi французского стартапа Kyutai, затем свои решения выпустили крупные игроки:

Компания

Продукт

Kyutai

Moshi (2024)

Google

Gemini Live

OpenAI

GPT-Live

В России публично о близкой разработке до сих пор не заявлял никто. У «Яндекса» есть Realtime API с быстрым ответом и возможностью перебить ассистента, но, по словам Маркова, это не полный дуплекс: модель «Яндекса» ждёт смены реплики, тогда как фулл-дуплекс слушает постоянно.

Что это значит для пользователей и рынка

Для обычного человека выгода очевидна: диалог с ассистентом перестанет напоминать переписку с паузами. Пока нет деталей о сценариях запуска и сроках первых наработок — подробности компания держит в материале РБК за закрытой частью текста. Но потенциальные применения широки: от поддержки клиентов и сервисов банка до синхронных ассистентов с видеоаватарами.

Для отрасли это ещё и маркер гонки за «естественностью» ИИ: если раньше конкуренция шла вокруг качества ответов, то теперь — вокруг скорости и манеры их подачи.

Вывод

«Сбер» первым из российских игроков публично заявил о движении в сторону полноценного дуплексного голосового ИИ. До продуктовой стадии ещё далеко, но само появление такой разработки показывает, что отечественные компании включаются в тот же технологический трек, что Google и OpenAI. Чем закончится гонка — покажет время, но ставки очевидны: победитель получит ассистента, которого невозможно отличить от живого собеседника.

Источники