Компания Microsoft расширила свою собственную линейку систем искусственного интеллекта для распознавания речи, добавив три новые модели, предназначенные для создания разговорных агентов с низкой задержкой и возможностью работы в режиме реального времени.
Microsoft неуклонно расширяет свой портфель собственных моделей MAI, охватывающий широкий спектр задач — от генерации изображений и логического мышления до программирования и распознавания речи. В прошлом месяце компания представила MAI-Transcribe-2 , которая в ходе тестирования Microsoft превзошла конкурирующие модели транскрипции от OpenAI и Google, при этом стоимость ее использования составила всего 0,10 доллара в час.

Компания Microsoft расширяет свою линейку речевого ИИ тремя новыми моделями: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Эти новые модели разработаны для совместной работы и обеспечения низкой задержки при общении с голосовыми агентами.
Читайте также: ТОП-15 лучших нейросетей для создания видео
В отличие от MAI-Transcribe-2, который обрабатывает только записанный звук, MAI-Transcribe-2-Streaming разработан для приложений реального времени. Вместо того чтобы ждать, пока говорящий закончит говорить, прежде чем вернуть текст, модель начинает выдавать результаты частичной транскрипции чуть более чем через 100 мс после получения аудио. Она постоянно корректирует эти результаты по мере поступления дополнительной информации, прежде чем подтвердить окончательную транскрипцию.
MAI-Transcribe-2-Streaming поддерживает 60 языков, а также обеспечивает непрерывное автоматическое определение языка. Microsoft утверждает, что эта новая модель в настоящее время занимает первое место в рейтинге искусственного интеллекта по точности как частичных, так и окончательных транскрипций. В ходе внутреннего тестирования диктовки и субтитров слова появлялись в транскрипции в два раза быстрее, чем у ближайшего конкурента.
Цена этой модели составляет 0,54 доллара за час аудио до конца 2026 года. Это значительно выше, чем акционная цена в 0,10 доллара за час у модели MAI-Transcribe-2 без функции потоковой передачи.
Читайте также: Нейросети бесплатно онлайн на русском языке: ТОП-20 лучших сервисов
Сегодня Microsoft также анонсировала MAI-Voice-2.1, свою новейшую многоязычную модель преобразования текста в речь. Ранее в этом году Microsoft представила MAI-Voice-2 и более быструю версию MAI-Voice-2-Flash, которые уже использовались в Dynamics 365 Contact Center и Azure Voice Live.
MAI-Voice-2.1 поддерживает 23 языка в 26 языковых версиях. Один сгенерированный голос может переключаться между языками, сохраняя при этом индивидуальность говорящего и используя акцент носителя языка для каждого языка. Стоимость MAI-Voice-2.1 составляет 22 доллара за миллион символов.
Для сценариев с высокой чувствительностью к задержке и большим объемом данных Microsoft анонсировала MAI-Voice-2.1-Flash. Эта модель может генерировать 45 секунд аудио с задержкой около 150 мс. Microsoft утверждает, что она обеспечивает на 55% более быструю обработку и примерно на 60% дешевле, чем аналогичные модели. Стоимость составляет 15 долларов за миллион символов. Обе новые голосовые модели также поддерживают клонирование голоса на разных языках, используя всего несколько секунд эталонного аудио.
Читайте также: Нейросети для создания изображений бесплатно: ТОП-16 лучших ИИ
Все три новые модели доступны через Microsoft Foundry, MAI Playground и Vercel. Голосовые модели также доступны через OpenRouter, а поддержка LiveKit появится в ближайшее время. Их также можно использовать через Azure Voice Live.




