微信 AI 官方 9 月 4 日宣佈,將通用多模態嵌入模型 WeMM-Embedding 開源,包含 2B、4B、9B 三個版本,支持文本、圖像、視頻、視覺文檔以及任意交錯的多模態輸入。

據微信員工 @ 客村小蔣 分享,微信視覺團隊開源的多模態模型 WeMM-Embedding,簡單來說就是讓系統能同時理解文字、圖片和視頻,把它們放在同一個語義空間裏去比較和檢索。

image.png

已在朋友圈搜索、視頻號推薦等場景落地

他透露,這個模型已經在微信裏大規模使用——朋友圈搜索、視頻號推薦、公衆號推薦、微信電商都在用,每天調用量達 10 億次。在國際權威榜單 MMEB-v2 上,該模型拿下了第一名,超過此前所有已提交的開源與閉源模型。

目前,WeMM-Embedding 的相關資源已同步開放:論文發佈於 arXiv,代碼倉庫託管在 GitHub 的 Tencent/WeMM-Embedding 項目下,模型集合也已上線 Hugging Face。