最近、WeChat AIの公式は、汎用マルチモーダル埋め込みモデル「WeMM-Embedding」を世界中にオープンソースとして公開し、2B、4Bおよび9Bの3つのパラメータバージョンをリリースしました。このモデルは非常に強力なマルチモーダル互換性を持ち、テキストや画像、動画だけでなく、ビジュアルドキュメントや任意の交錯した混合マルチモーダル入力もネイティブに処理できます。

技術基盤とマルチモーダル同構の核心的な優位性

WeChatのビジュアルチームによると、WeMM-Embeddingのコア技術ロジックは、システムがテキスト、画像、動画を同時に深く理解し、それらを同じ意味空間にマッピングして効率的な比較と正確な検索を行うことです。

国際的な権威あるマルチモーダル検索および評価ランキングMMEB-v2において、このモデルは優れた総合的な性能により、類似のソリューションの中で第1位を獲得し、これまでに提出されたすべてのオープンソースおよびクローズドソースの商用モデルを上回る成績を収めました。

大規模なビジネス実装とオープンソースエコシステム

WeMM-Embeddingは、内部で高強度のテストを経た技術成果であり、研究室段階にとどまることはありません。現在、このモデルはWeChatエコシステム内の多くの主要な業務で大規模に実装されており、実際のカバー範囲にはフィード検索、動画番組の推薦、公衆号の推薦、WeChatエコマースなど主要なセクターが含まれており、1日あたりの呼び出し量は10億回を超えています。

さらに技術コミュニティの繁栄と先端的なイノベーションを推進するために、WeChatチームは今回の公開に合わせて完全な技術エコシステムリソースを公開しました。開発者や研究者は関連するコードリポジトリを通じて深い研究を行うことができ、モデルホスティングプラットフォームで対応するモデルコレクションを取得することもできます。