微软发布MAI流式转写与新语音模型:先区分临时字幕、稳定文本和对话记录

前天 4阅读

微软于2026年10月1日发布MAI-Transcribe-2-Streaming、MAI-Voice-2.1和MAI-Voice-2.1-Flash。流式转写支持60种语言及持续自动语言检测;两款语音生成模型覆盖23种语言。三款模型已可通过Microsoft Foundry接入,官方主公告将LiveKit接入列为后续安排。

转写会先输出临时识别结果,再根据后续语音修订并形成稳定文本。微软还公布了榜单表现与内部速度比较,但这些结果不能代替业务环境实测。转写的每音频小时0.54美元属于截至2026年底的介绍期价格,不宜直接当作长期预算。

微软发布MAI流式转写与新语音模型:先区分临时字幕、稳定文本和对话记录

AI概念插图:以抽象造型表达本文主题,并非真实产品界面、设备照片或实验结果。

同一句话应有清楚的版本关系

以下为独立实施分析。实时字幕可以容许短暂修改,正式对话记录却需要解释修改发生在哪里。如果应用把每一段临时结果直接追加保存,一句逐渐被识别完整的话可能出现多遍;如果总是覆盖上一段,又可能把已经确认的内容一并改掉。接入时应将一段话的临时状态、稳定状态与用户后续纠正区分开。

假设工作人员口述“把周五的预约改到周六上午”,中间停顿后又说“更准确地说,是下午”。界面可以尽快显示听到的内容,但归档记录应保留最终表达及必要的纠正关系。这里关注的是记录质量:后来接手的人应看得出哪一项是识别修订,哪一项是说话者改变主意,不必依靠猜测还原经过。

能听懂的语言与能回复的语言分别配置

公告中的语言覆盖数量不同,给产品设计留下一个具体问题:听到某种语言之后,是否总能用同种语言回答。团队可以按实际服务对象列出允许的组合,为未覆盖的回复语言设计文本回应、语言选择或人工接续。不要只检查入口能否识别,就把整段交互标成已经支持。

语言自动识别也应保留用户纠正入口。一个人可能在句子里混用品牌名称、地址和外语术语,这些片段未必表示整段对话应切换语言。界面宜持续显示当前采用的语言,让用户用简单动作修改;已确认的姓名或术语则应在后续记录里保持一致,避免每次识别都重新解释。

把评估单位从音频片段换成完整交接

试用可以选择几类得到授权的样本:连续口述、长停顿、背景噪声、多人轮换,以及包含日期或数量的自我纠正。除了检查文字准确性,还要看字幕是否反复跳动、稳定文本何时形成、导出记录是否丢失段落,以及人工编辑能否被后续自动结果覆盖。这些都直接影响记录能否用于下一步工作。

测量延迟时也要说明起点。收到音频到首次文字出现,与说完一句话到文字稳定,是两个不同体验。再把语音生成、播放排队和业务查询算进去,才是用户等待一次完整回应的时间。模型层数字更适合帮助定位瓶颈,不能单独说明整场对话是否顺畅。

预算评估可同时保留音频时长、生成字符量和最终完成的会话数。对话过长、重复朗读或用户多次纠正,都可能增加成本却没有增加完成量。介绍期结束前再按正式价格复算,并检查少量长会话是否掩盖了平均值,才能判断适合优先接入哪一种真实工作。

来源与核验

Microsoft AI三款音频模型官方发布,来源日期:2026-10-01。

Microsoft Foundry官方接入说明,来源日期:2026-10-01。

本文核验于北京时间2026年10月2日。公告事实依据所列发行方资料;实施建议及假设场景为原创分析,本站未实际测试相关产品。

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。