Kandinsky научился делать видео со звуком Kandinsky научился делать видео со звуком Дан старт крупнейшей оптоволоконной магистрали России Дан старт крупнейшей оптоволоконной магистрали России Рассвет обзавелся спутниковыми терминалами Рассвет обзавелся спутниковыми терминалами ИИ научили сомневаться в себе ИИ научили сомневаться в себе

Kandinsky научился делать видео со звуком

🇷🇺 1 мин
Сбер / GigaChat

Сбер выпустил Kandinsky 6.0 Video, новую версию модели для генерации видео. Теперь она умеет одновременно генерировать не только картинку, но и звук – речь, музыку и другие звуки сцены. При этом звук не накладывается на готовый ролик, но создаётся одновременно с видео отдельной частью модели. По заявлению компании, особое внимание уделили говорящим людям и совпадению речи с движением губ.

Генерировать можно как из текстового описания, так и используя в качестве референса изображение. Продолжительность, правда, сейчас ограничена пятью секундами, а максимальное разрешение – Full HD, и то после апскейла. На данный момент для обычных пользователей модель доступна в ГигаЧате с ограничением 10 генераций в день (против примерно 2 на Veo Fast и 1 на Seedance на бесплатном тарифе). На наш взгляд, по качеству с Veo или Seedance модель не сравнилась, но и денег за неё пока не просят.

Всего Сбер выпустил две версии модели – Lite на 3 миллиарда параметров и Pro примерно на 29 миллиардов. Обе версии разработчики могут скачать и использовать в своих продуктах.

// Илья Власов