Microsoft выпустила MAI-Transcribe-2-Streaming, свою первую модель потоковой транскрипции речи
Microsoft выпустила MAI-Transcribe-2-Streaming, модель для потоковой транскрипции речи в реальном времени с низкой задержкой. Об этом сообщило подразделение Microsoft AI, а японское издание ITmedia AI+ со ссылкой на компанию пишет, что у Microsoft это первая потоковая модель транскрипции.[1][2]
Вместе с ней компания представила ещё две голосовые модели, MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Чем они различаются, Microsoft AI в своём сообщении не раскрывает.[3]
Немецкое издание heise online считает, что все три модели нужны прежде всего голосовым агентам. «С MAI-Transcribe-2-Streaming, MAI-Voice-2.1 и MAI-Voice-2.1-Flash Microsoft дополняет собственное семейство ИИ-моделей аудиофункциями для голосовых агентов», — пишет издание.[4]
Новинки пополнили MAI, собственное семейство ИИ-моделей Microsoft. Цены на модели, их доступность для разработчиков и показатели задержки пока неизвестны.[5]