8月4日,科技媒体TestingCatalog报道,微软正在测试其首款原生实时语音模型MAIRealtime。该模型支持16种语言和2种语音,能够在对话中实现听说并行,并支持自动识别和中途切换语言。
微软已邀请部分合作伙伴在MAIPlayground平台测试MAIRealtime模型。该模型采用双向、全双工交互方式,无需严格按“用户说完、模型再答”的轮次交替,可支持同步聆听和回应。MAIRealtime模型支持包括中文在内的16种语言,提供Victoria和Grant两种语音,比Copilot目前的语音模式更加自然。用户可以主动指定语言,也可以启用自动检测。该模型不支持唱歌或生成非语音音效,定位仍是对话系统。调试面板可显示实时延迟、模型思考内容和处理步骤,样本分享功能或将在测试权限扩大后向平台用户开放。


