Cloudflare 近期正式發佈了全新開放權重決策模型 Clef-omni。該模型在原有 Clef 系列的基礎上實現了重大升級,不僅原生支持文本與圖像,更首次新增了對音頻和完整視頻輸入的直接處理能力。目前,其模型權重已在 Hugging Face 平臺全面開源。

在技術實現與功能特性方面,Clef-omni 徹底改變了傳統的處理鏈路。此前版本的 Clef 在面對視頻輸入時,往往需要先將視頻按時間軸拆解爲連續的靜態圖像再進行處理;而全新的 Clef-omni 則直接支持 wav、mp3、mp4和 webm 等主流音視頻格式。這意味着開發者無需再單獨搭建複雜的語音轉寫及音視頻拆分管道,只需通過單次 API 調用即可實現文本、圖像、音頻和視頻的統一處理。

image.png

從性能與基準測試表現來看,該模型基於 Qwen3-Omni-30B-A3B-Instruct 底座架構構建,完整保留了其核心理解能力。作爲一款專注於結構化決策任務的專用模型,它不輸出常規的冗長文本。在官方公佈的實測數據中,純文本請求的中位響應時間約爲130毫秒,圖像請求約爲150毫秒;而處理一段帶有聲音、時長達21秒的視頻,也僅需約1.5秒即可高效完成評分。

伴隨着新模型的登場,Cloudflare 還對旗下其他產品線進行了價格調整與優化。其中,Clef-flash 的輸入價格迎來了約58% 的大幅下調,從原本每百萬輸入 Token0.09美元降至0.038美元,託管版的上下文窗口則同步由64k 調整爲24k。整體來看,隨着 Clef-omni 的開源以及多模態處理能力的補齊,正爲全球開發者構建複雜的智能工作流和自動化決策系統提供更高效、更具性價比的底層支撐。