微软测试其首款自研全双工 AI 语音 MAI Realtime 模型:支持中文等 16 种语言、2 种风格
微软自研全双工AI语音模型MAI Realtime曝光!支持中文等16种语言,2种自然语音,听说并行无需等待,实时对话更流畅,未来或集成Copilot,快来了解这项黑科技!
8 月 4 日消息,科技媒体 TestingCatalog 于 8 月 2 日发布博文,报道称微软正测试其首款原生实时语音模型 MAI Realtime,支持 16 种语言、2 种语音,可在对话中听说并行,支持自动识别和中途切换语言。
测试方面,消息称微软已邀请部分合作伙伴,在 MAI Playground 平台测试该模型,目前尚不清楚何时上线 Microsoft Foundry,以及扩展到 Copilot 语音功能上。
运行方面,MAI Realtime 采用双向、全双工交互方式,无需严格按“用户说完、模型再答”的轮次交替,可支持同步聆听和回应。
在支持语言方面,MAI Realtime 模型支持中文等在内 16 种语言,援引博文介绍,附上相关支持的语言如下:
英语
德语
西班牙语
法语
意大利语
葡萄牙语
日语
韩语
中文
荷兰语
印地语
印度尼西亚语
阿拉伯语
俄语
土耳其语
越南语
泰语
在语音风格方面,消息称该模型测试提供 Victoria 和 Grant 两种语音,比 Copilot 目前的语音模式更加自然。用户可以主动地指定语言,也可以启用自动检测。


该模型不支持唱歌或生成非语音音效,定位仍是对话系统。调试面板可显示实时延迟、模型思考内容和处理步骤,样本分享功能或将在测试权限扩大后向平台用户开放。

注:全双工语音(Full-duplex voice)指系统可在同一时间接收用户语音并输出回复,不必等待一方完全说完。它依靠端点检测识别说话开始、停顿和结束,也需要在用户插话时调整输出。
微软此前发布的 MAI 语音模型均为单向模型,包括用于语音合成的 MAI-Voice-2 及其 Flash 版本,以及用于语音识别的 MAI-Transcribe-1.5。

