Microsoft MAI-Transcribe-2:60 语言转录、说话人分离与 0.10 美元/小时

Microsoft 发布 MAI-Transcribe-2,主打 60 种语言、说话人分离、逐词时间戳、关键词偏置和逐字/清理模式;0.10 美元/小时是限时推出的官方价格。

Microsoft AI 于 2026 年 9 月 3 日发布 MAI-Transcribe-2,定位是处理真实世界音频的 speech-to-text model。官方列出的场景包括 clinical note-taking、法律文件、无障碍服务、closed captioning 和其他需要把声音转换成可搜索文字的流程。这次发布值得留意,不只是因为语言数量,而是把转录、说话人、时间和领域词汇放在同一个产品接口。

MAI-Transcribe-2 支持 60 种语言,并提供 automatic language identification 及 code switching。模型可以在对话自然切换语言时继续处理,不必预先为每段音频指定单一语言。对于跨地区客服、会议记录和多语内容来说,这可以减少前处理和模型切换;但实际质量仍要按本地口音、混合语言比例、收音环境和专有名词测试。

功能上,speaker diarization 用来区分不同说话人,word-level timestamps 则把时间定位到每一个词。再配合 keyword biasing,企业可以把产品名、药物名、缩写或内部术语作为 recognition hints。这些功能对客服质检、字幕搜索、会议导航、医疗记录草稿和内容编辑都有直接用途,但 keyword biasing 是提示,不应被当成强制正确输出。

模型也提供 configurable transcription styles。verbatim 模式保留 filler words、口误和 false starts,适合合规、质量检查和分析;clean 模式则移除部分口头填充,产出较容易阅读的字幕、笔记和发布稿。这个分层比单纯追求一个最低 Word Error Rate 更实际,因为法律或合规记录与公开内容本身就有不同的文字要求。

Microsoft 表示,MAI-Transcribe-2 在 FLEURS 60 语言测试中取得平均 5.2% Word Error Rate,并在 Artificial Analysis 的准确度与延迟比较中位于 Pareto frontier、WER 排名第二;公司也称它比主要竞品快最多 10 倍。这些数字来自 Microsoft 发布的产品文章和其引用的评估,不能直接视为所有音频环境都会重现的结果。

官方把发布价列为每小时音频 0.10 美元,并说明这是截至 2026 年年底的限时价格。产品可经 Microsoft Foundry、MAI Playground 和 OpenRouter 示范或试用;企业真正接入前仍应确认 public preview、地域、配额、数据处理、SLA、音频大小和成本计算方式。对于大量长音频来说,速度降低的不只是费用,也会改变能否即时完成搜索、质检和后续 Agent 工作。

MAI-Transcribe-2 的实际价值,最后取决于转录后的流程。文字如果能带有说话人、时间、术语和可验证的音频片段,才适合接入搜索、摘要、CRM、字幕或 voice agent;如果只输出一段没有 provenance 的文字,后续自动化仍然容易出错。采用测试应把词错率、漏掉的关键内容、说话人错配、时间戳偏差、人工修订和每小时成本一起量度。

因此,这次发布可以视为 Microsoft 把转录模型由「输入音频、输出文字」推向可嵌入企业工作流程的组件。它的 benchmark、速度和价格都值得比较,但在 public preview 阶段,最稳妥的做法仍是用自己的录音建立 golden set,先验证数据边界和人工复核,再决定哪些后续动作可以交给 Agent。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。