J-pop теряет зарубежные роялти J-pop теряет зарубежные роялти Apple могла отказаться от складного iPad Apple могла отказаться от складного iPad Интернет обзаводится армией подводных дронов Интернет обзаводится армией подводных дронов Гибриды оказались не такими уж и экологичными Гибриды оказались не такими уж и экологичными

Стартап научил голосовой ИИ молчать и слушать

🇺🇸 1 мин
Sparrow-2 / Tavus

Американский стартап Tavus, который делает разговорных ИИ-аватаров и технологии для них, выпустил Sparrow-2 – модель, которая в реальном времени следит за разговором и решает, когда голосовому ИИ стоит говорить, молчать или дать человеку закончить мысль. Она анализирует не только слова, но и интонацию, паузы, угуканье, перебивания, посторонние голоса и шум вокруг, обновляя состояние разговора. Поэтому несколько секунд тишины она может принять за раздумье и не обязательно будет реагировать на случайный разговор людей рядом (ни на кого не намекаем).

Похожее решение в июле показала OpenAI с моделью GPT-Live. Её голосовая модель тоже умеет слушать и говорить одновременно, выдерживать паузы и понимать перебивания. Но есть существенное отличие – OpenAI встроила эти умения непосредственно в голосовую модель. Тогда как Sparrow-2 отличается тем, что это отдельный слой управления разговором. Поэтому в Tavus можно подключить собственную LLM и голосовой движок, а Sparrow оставить отвечать только за то, когда агенту слушать и когда говорить. Можно добиться похожего на GPT-Live результата, но со своим (и, возможно, более бюджетным) ИИ.

Sparrow-2 закрытая, скачать и запустить её локально нельзя. Модель доступна через API и платформу Tavus. Число параметров компания не раскрывает. Сама Sparrow-2 заявлена как мультиязычная, у платформы Tavus заявлена поддержка 42 языков, включая русский.

// Илья Власов