近日,微信 AI 官方正式宣布将通用多模态嵌入模型WeMM-Embedding向全球开源,并推出了包含2B、4B 以及9B 在内的三个不同参数版本。该模型展现出了极强的多模态兼容能力,不仅全面支持文本、图像、视频,还能原生处理视觉文档以及任意交错的混合多模态输入。
技术底座与多模态同构的核心优势
据微信视觉团队透露,WeMM-Embedding 的核心技术逻辑在于让系统能够同时深度理解文字、图片与视频,并将其映射并统一在同一个语义空间中进行高效比较与精准检索。
在国际权威多模态检索与评估榜单 MMEB-v2上,该模型凭借出色的综合表现在同类方案中斩获第一名,成绩成功超越了此前所有已提交的开源及闭源商业模型。
大规模业务实战落地与开源生态
作为一款在内部经过高强度打磨的技术成果,WeMM-Embedding 绝非停留在实验室阶段。目前,该模型已经在微信生态的多项核心业务中实现大规模落地应用,其实际覆盖场景包括朋友圈搜索、视频号推荐、公众号推荐以及微信电商等核心板块,日均调用量已经突破了10亿次。
为了进一步推动技术社区的繁荣与前沿创新,微信团队此次同步公开了完整的技术生态资源。开发者和研究人员不仅可以通过相关代码仓库进行深入研究,还能在模型托管平台上获取对应的模型集合。
VIP会员