Microsoft выпустила первую потоковую модель распознавания речи на Foundry
1 октября 2026 года Microsoft открыла доступ к MAI-Transcribe-2-Streaming, MAI-Voice-2.1 и MAI-Voice-2.1-Flash через Foundry и Azure AI Speech. Потоковая модель даёт задержку конца речи 0,13 с против 0,49 с у Grok Voice Transcribe 2.0 и стоит $0,54 за час аудио против $0,10 у пакетной версии.
- Задержка конца речи 0,13 с против 0,49 с у Grok Voice Transcribe 2.0
- Цена $0,54 за час аудио до 31 декабря 2026 года против $0,10 у пакетной модели
- Поддержка 60 языков с автоопределением, заявленный WER 2,5%
- Все три модели в статусе public preview без SLA и без диаризации в потоковой версии
Читать дальше
ИИ