
Microsoft AI 於 2026 年 9 月 3 日發布 MAI-Transcribe-2,定位是處理真實世界音訊的 speech-to-text model。官方列出的場景包括 clinical note-taking、法律文件、無障礙服務、closed captioning 和其他需要把聲音轉成可搜尋文字的流程。這次發布值得留意,不只因為語言數目,而是把轉錄、說話者、時間和領域詞彙放在同一個產品介面。
MAI-Transcribe-2 支援 60 種語言,並提供 automatic language identification 及 code switching。模型可以在對話自然轉換語言時繼續處理,不必預先為每段音訊指定單一語言。對跨地區客服、會議記錄和多語內容來說,這可以減少前處理和模型切換;但實際品質仍要按本地口音、混合語言比例、收音環境和專有名詞測試。
功能上,speaker diarization 用來區分不同說話者,word-level timestamps 則把時間定位到每一個字。再配合 keyword biasing,企業可以把產品名、藥物名、縮寫或內部術語作為 recognition hints。這些功能對客服質檢、字幕搜尋、會議導航、醫療紀錄草稿和內容編輯都有直接用途,但 keyword biasing 是提示,不應被當成強制正確輸出。
模型也提供 configurable transcription styles。verbatim 模式保留 filler words、口誤和 false starts,適合合規、品質檢查和分析;clean 模式則移除部分口頭填充,產出較容易閱讀的字幕、筆記和發布稿。這個分層比單純追求一個最低 Word Error Rate 更實際,因為法律或合規記錄與公開內容本身就有不同的文字要求。
Microsoft 表示,MAI-Transcribe-2 在 FLEURS 60 語言測試中取得平均 5.2% Word Error Rate,並在 Artificial Analysis 的準確度與延遲比較中位於 Pareto frontier、WER 排名第二;公司亦稱它比主要競品快最多 10 倍。這些數字來自 Microsoft 公布的產品文章和其引用的評估,不能直接視為所有音訊環境都會重現的結果。
官方把發佈價列為每小時音訊 0.10 美元,並說明這是截至 2026 年年底的限時價格。產品可經 Microsoft Foundry、MAI Playground 和 OpenRouter 示範或試用;企業真正接入前仍應確認 public preview、地域、配額、資料處理、SLA、音訊大小和成本計算方式。對大量長音訊而言,速度降低的不只是費用,也會改變可否即時完成搜尋、質檢和後續 Agent 工作。
MAI-Transcribe-2 的實際價值,最後取決於轉錄後的流程。文字如果能帶有說話者、時間、術語和可驗證的音訊片段,才適合接入搜尋、摘要、CRM、字幕或 voice agent;如果只輸出一段沒有 provenance 的文字,後續自動化仍然容易出錯。採用測試應把詞錯率、漏掉的關鍵內容、說話者錯配、時間戳偏差、人工修訂和每小時成本一起量度。
因此,今次發布可以視為 Microsoft 把轉錄模型由「輸入音訊、輸出文字」推向可嵌入企業工作流程的組件。它的 benchmark、速度和價格都值得比較,但在 public preview 階段,最穩妥的做法仍是用自己的錄音建立 golden set,先驗證資料邊界和人工覆核,再決定哪些後續動作可以交給 Agent。



