Microsoft выпустила потоковую STT-модель с точностью 2,5% WER
Microsoft AI запустила MAI-Transcribe-2-Streaming — первую потоковую модель речь-в-текст, которая работает в реальном времени. Модель вышла 1 октября 2026 года вместе с двумя моделями синтеза речи: MAI-Voice-2.1 и MAI-Voice-2.1-Flash. По рейтингу Artificial Analysis, MAI-Transcribe-2-Streaming заняла первое место среди 38 моделей по точности финального и первичного транскрипта.
Система распознаёт 60 языков с автоматическим определением языка, выдаёт первые гипотезы через 100 мс после получения аудио и уточняет их по мере поступления контекста. Слова появляются в два раза быстрее, чем у ближайшего конкурента, что критично для голосовых агентов и живых субтитров.
Источник: MarkTechPost
- основатель
- Гейб Ньюэлл
- Microsoft закрывает Power BI Premium и переводит клиентов на дорогой Fabric 2026-10-07
- ИИ заменит 5% задач и добавит 1,5% к ВВП за 10 лет 2026-10-07
- Исследователи Microsoft предложили фреймворк RAFT для улучшения RAG в техподдержке. 2026-10-06
- Microsoft и Google поддержали Apache Ossie для обеспечения интероперабельности корпоративных данных и ИИ-платформ. 2026-10-06
Новости этого рынка выходят у нас в телеграме первыми — @adposium_ai.