Американский бизнес устал от торговой войны США Американский бизнес устал от торговой войны США Умные кольца и фитнес-браслеты рвут танцпол носимых устройств Умные кольца и фитнес-браслеты рвут танцпол носимых устройств Японские машины становятся китайскими Японские машины становятся китайскими Бен Аффлек заработал 587 миллионов долларов на ИИ Бен Аффлек заработал 587 миллионов долларов на ИИ

3i Technologies разработал облачный сервис для профессиональной обработки ТВ и радио-контента

🇷🇺 1 мин

Консорциум 3i Technologies разработал облачный сервис для профессиональной обработки речевых данных из медийного контента – 3i Speech Recognition API. Сервис позволяет с точностью более 90% переводить теле- и радио-эфиры и медиа-архивы ТВ-каналов и радиостанций в текстовый формат.

3i Speech Recognition API работает с аудио и видео любой длительности. Сервис обрабатывает загруженные в облако файлы в несколько раз быстрее реального времени звучания и выдает на выходе «стройный» текст, разбитый на предложения с расставленными знаками препинания. Бета-версия 3i Speech Recognition API открыта для публичного тестирования.

«Это специализированный сервис, ориентированный на обработку именно телевизионного или радио-контента. Мы разработали уникальные модели, которые позволили добиться очень высокой точности распознавания. Надеемся, что сервис будет полезен профессионалам, которые работают с медиа-контентом. В дальнейшем он может стать частью высокотехнологичных решений для массового потребителя, например, основой для перевода иностранных каналов и субтитрирования в режиме реального времени. Все технологии для создания такого продукта у компаний, входящих в консорциум, уже есть», — говорит председатель совета директоров консорциума 3i Technologies Алексей Любимов.

В сервисе используются языковые и акустические модели, построенные с применением машинного обучения, технологий рекуррентных нейронных сетей (Recurrent Neural Network, RNN) и взвешенных конечных автоматов (Weighted Finite State Transducer, WFST). Вычислительная инфраструктура реализована с ускорением на GPU, что позволяет получать многократный прирост производительности относительно CPU.

Языковые модели для повышения качества распознавания могут быть адаптированы под узкую предметную область. Например, для перевода в текст «экономических» или «отраслевых» передач, в которых спикеры используют профессиональную лексику.

Бета-версия 3i Speech Recognition поддерживает русский и английский язык. 3i Speech Recognition будет полезен в работе разработчиков программного обеспечения, системных интеграторов, специалистов в области создания и обработки медиаконтента (телерадиовещательные компании, продакшн-студии, креативные агентства, фрилансеры и т.д.). Сервис быстро и легко интегрируется в приложения и комплексные решения сторонних разработчиков.