一站式AI數字人桌面應用AIGCPanel拋出v2.5.0版本,把過去讓無顯卡用戶乾瞪眼的雲端語音能力真正接進了桌面。這次更新的核心很直白:只要在AI模型頁的"其他模型"入口裏填上火山引擎豆包語音或阿里雲百鍊DashScope的API Key,雲端語音模型就能即刻上線,本地沒有一張顯卡的人,也能靠雲端方案完成高質量語音合成。
填Key這一步被做得格外省心。軟件在保存前會先拿一句"你好,這是一段語音試聽。"合成一遍,接口真正通了才允許保存,免得用戶事後在任務裏翻錯誤日誌找茬。這背後是一張由主進程維護的語音provider註冊表:每個廠商只要把自己的HTTP接口適配成統一的soundTts調用就能接入。豆包語音走X-Api-Key鑑權,吐回來的是多段JSON拼接的單向流,軟件得按分片解析再合併成完整音頻;阿里雲則走DashScope的qwen-tts,返回音頻鏈接或base64數據。以後想加一家新廠商,寫一個provider文件就夠了。

真正的變化在於"聲音"被從散落各處的配置裏收攏成了一套管得起來的體系。數字人側叫"語音音色",直播側叫"直播音色",兩邊各有各的庫,都能添加聲音合成或聲音克隆音色,保存前直接試聽。兩套音色分表存儲、互不干擾,聲音克隆的參考音頻要重新錄或重新傳,再配上對應文字,不再複用數字人那邊的音色庫——過去那種"這個克隆聲音到底被誰帶偏了"的扯皮,從此不再發生。添加彈窗右側還貼心地放了使用說明:克隆顯示錄音要求,合成顯示操作引導。
底層是一套VoiceService工廠加兩個存儲標識SoundVoice與LiveVoice。每條音色記錄裏存着類型、模型標識、參數和參考音頻路徑,試聽和直播實時合成走的是同一條synthesize()調用鏈,效果完全一致。更妙的是直播換音色不用動直播服務:客戶端對外只暴露一個帶Voice:前綴的provider名,其餘路由自己消化,以後新增音色,直播端一行代碼都不用改。直播配置裏優先用你選中的音色,沒選就回退到舊的聲音驅動配置,老用戶的舊配置不會失效。
直播控制檯這次也長了眼睛。頂部新增的"模型控制"區域能直接啓動或停止直播模型、看清運行狀態,旁邊一個"模型日誌"按鈕點開就是實時日誌。要是還沒導入直播模型,這裏會主動提示並一鍵跳到AI模型界面去導入。過去想確認"直播模型起沒起來",得在幾個頁面之間來回切,現在一個區域看全,實現上也沒另起爐竈:從模型列表裏篩出帶直播能力的記錄,狀態徽標和日誌查看複用已有的組件。
界面細節被全面打磨。彈窗內容會自然撐高,小窗口下不再溢出屏幕;左側導航選中項改成品牌藍淺色底塊,暗色模式同步調亮;禁用狀態按鈕改爲淺灰底配中灰字,不再讓人看不清。幾個會咬人的bug也被焊死:通用模型任務在進程異常退出時曾被誤判爲成功,如今改爲校驗是否真正產出結果;部分錯誤提示在英文界面仍顯示中文的舊毛病修好了;新版Windows上因執行wmic導致的報錯也一併消除。
順着這次升級,幾個還在服役的老功能值得新用戶認個臉。"可視化工作流"從v2.0.0起就能拖拽節點把大模型、腳本、工具箱串成流水線,支持斷點續跑,複雜流程不用寫代碼;v2.4.0上線的"綠幕視頻替換背景"和"歌曲翻唱"一個做摳像換背景、一個把歌曲人聲換成指定音色,是發佈後被問得最多的兩塊;v2.3.0的"API服務與接口"讓同一條流水線除了點界面,也能通過HTTP接口調用,方便集成進自己的系統。從v2.0.0的工作流引擎、20+小工具與CLI,到v2.2.0的文生圖生視頻、v2.3.0的接口開放、v2.4.0的摳像與翻唱,再到這次v2.5.0把雲端語音和音色管理收進一套體系,AIGCPanel的路線很清晰:把模型裝一次,讓聲音能被反覆調用。
VIP會員