科技媒體 TestingCatalog 報道,微軟正在測試其首款原生實時語音模型 MAI Realtime。該模型支持 16 種語言、2 種語音風格,可在對話中實現聽說並行,並支持自動識別和中途切換語言——這意味着用戶無需等待 AI 說完才能開口,對話體驗將無限逼近真人交流。

MAI Realtime 採用雙向、全雙工交互方式,打破了傳統語音助手"用戶說完、模型再答"的輪次交替模式。系統依靠端點檢測技術識別說話的開始、停頓和結束,當用戶中途插話時,模型能即時調整輸出,實現同步聆聽與迴應。這是微軟 MAI 語音模型家族從單向走向雙向的關鍵一步——此前發佈的 MAI-Voice-2 和 MAI-Transcribe-1.5 均只能分別完成語音合成或語音識別的單向任務。
兩種語音風格更自然,但暫時不會唱歌
在語言覆蓋上,MAI Realtime 支持中文、英語、日語、韓語、法語、德語、阿拉伯語等 16 種語言。用戶可主動指定對話語言,也可啓用自動檢測功能,模型能在對話過程中自動識別並切換語言。語音風格方面,測試版本提供 Victoria 和 Grant 兩種聲音,據稱比 Copilot 目前的語音模式更加自然。
不過該模型的定位仍是對話系統,不支持唱歌或生成非語音音效。調試面板可實時顯示延遲數據、模型思考內容和處理步驟,樣本分享功能有望在測試範圍擴大後向更多平臺用戶開放。目前微軟已邀請部分合作夥伴在 MAI Playground 平臺進行測試,但何時上線 Microsoft Foundry、何時擴展至 Copilot 語音功能,尚無明確時間表。從單向到全雙工,從輪次交替到同步對話,微軟正在用 MAI Realtime 向業界宣告——AI 語音交互的"對講機時代"或將成爲過去式。
