微软测试其首款自研全双工 AI 语音 MAI Realtime 模型:支持中文等 16 种语言、2 种风格
最新 8 月 4 日消息,科技媒体 TestingCatalog 于 8 月 2 日发布博文,报道称微软正测试其首款原生实时语音模型 MAI Realtime,支持 16 种语言、2 种语音,可在对话中听说并行,支持自动识别和中途切换语言。
测试方面,消息称微软已邀请部分合作伙伴,在 MAI Playground 平台测试该模型,目前尚不清楚何时上线 Microsoft Foundry,以及扩展到 Copilot 语音功能上。
运行方面,MAI Realtime 采用双向、全双工交互方式,无需严格按“用户说完、模型再答”的轮次交替,可支持同步聆听和回应。
在支持语言方面,MAI Realtime 模型支持中文等在内 16 种语言,最新援引博文介绍,附上相关支持的语言如下:
英语
德语
西班牙语
法语
意大利语
葡萄牙语
日语
韩语
中文
荷兰语
印地语
印度尼西亚语
阿拉伯语
俄语
土耳其语
越南语
泰语
在语音风格方面,消息称该模型测试提供 Victoria 和 Grant 两种语音,比 Copilot 目前的语音模式更加自然。用户可以主动地指定语言,也可以启用自动检测。


该模型不支持唱歌或生成非语音音效,定位仍是对话系统。调试面板可显示实时延迟、模型思考内容和处理步骤,样本分享功能或将在测试权限扩大后向平台用户开放。

最新注:全双工语音(Full-duplex voice)指系统可在同一时间接收用户语音并输出回复,不必等待一方完全说完。它依靠端点检测识别说话开始、停顿和结束,也需要在用户插话时调整输出。
微软此前发布的 MAI 语音模型均为单向模型,包括用于语音合成的 MAI-Voice-2 及其 Flash 版本,以及用于语音识别的 MAI-Transcribe-1.5。
《微软测试其首款自研全双工 AI 语音 MAI Realtime 模型:支持中文等 16 种语言、2 种风格》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
铠侠官宣 GP1 XL-FLASH PCIe Gen6 固态硬盘,随机读取 100M IOPS
其采用铠侠第二代 XL-FLASH 存储级内存,允许更精细的 512 字节粒度数据访问,耐久度可达 50 DWPD,支持将高速闪存介质引入显存系统的新兴 AI 存储架构。... -
三星发声明:将封禁可共享用户网络的智能电视应用
安全研究显示多款三星智能电视热门应用内嵌住宅代理代码,可共享用户网络,甚至可能被改造成恶意僵尸网络。三星已宣布将下架相关应用,推行更严格审核政策。#三星智能电视安全问题#... -
微软测试其首款自研全双工 AI 语音 MAI Realtime 模型:支持中文等 16 种语言、2 种风格
科技媒体 TestingCatalog 于 8 月 2 日发布博文,报道称微软正测试其首款原生实时语音模型 MAI Realtime,支持 16 种语言、2 种语音,可在对话中听说并行,支持自动识别和中途切换语言。... -
全球第一!OpenRouter 称上周 DeepSeek-V4-Flash 调用超 7.22 万亿 Token 登顶
根据全球最大 AI 聚合平台 OpenRouter 的 OpenRouter 的周度统计中,DeepSeek-V4-Flash 以 7.22 万亿 Token 的调用量位居全球第一,单日峰值突破 8 万亿 Token。... -
中美 AI 大模型竞争加剧:OpenAI 等海外巨头大幅降价对标 Kimi、DeepSeek
为应对月之暗面 Kimi K3 和 DeepSeek V4 Flash 等中国模型的竞争,OpenAI 大幅下调 ChatGPT 5.6 Luna 价格 80%,中端模型 Terra 也降价 20%。尽管降价刺激使用,但高昂的算力成本与持续亏损让盈利前景蒙上阴影。 #AI价格战#...












