浙江大学紫金港学院の卒業生がマイクロソフト研究所と協力し、GPT-4Vに挑戦するマルチモーダルモデル「LLaVA」を発表しました。
LLaVAは11個のテストデータセットにおいて優れた性能を示し、6,000以上のスターを獲得しました。モデルの総合的な能力は高く、GPT-4Vを85%上回る結果となっています。
LLaVAのオープンソースコード、モデル、およびトレーニングデータは現在利用可能です。

浙江大学紫金港学院の卒業生がマイクロソフト研究所と協力し、GPT-4Vに挑戦するマルチモーダルモデル「LLaVA」を発表しました。
LLaVAは11個のテストデータセットにおいて優れた性能を示し、6,000以上のスターを獲得しました。モデルの総合的な能力は高く、GPT-4Vを85%上回る結果となっています。
LLaVAのオープンソースコード、モデル、およびトレーニングデータは現在利用可能です。
DeepSeekはV4シリーズ初の実験的マルチモーダルモデルV4-Flash-Vision-Expを公開。V4-Flashアーキテクチャに視覚モジュールを融合し、従来のテキスト能力に加え高度な画像理解・分析を実現。総パラメータ数3050億で、視覚と言語構造を統合し、画像を精確に解釈しマルチモーダル融合が可能。....
智谱がオープンソースのマルチモーダルモデルGLM-5.3-Flash(320B-A18B)を公開。性能と低価格でAI普及を推進。評価57点でClaude Opus4.8と同等、プログラミング能力も匹敵し、総合性能はGLM-5.2超え。公開前は匿名「Ox-Alpha」でテストし、OpenCode/OpenRouterで首位。....
Metaは300億パラメータのオープンソースマルチモーダルモデル「Muse Glimmer」を発表。Apache 2.0ライセンスで、ローカルエージェントワークフローに最適化され、多段階推論とツール呼び出し能力を強化。テキストと画像処理に対応。Llama 4以来初のモデル重み公開で、オープンソースAIエコシステムを推進。....
商湯科技は軽量統一マルチモーダルモデルSenseNova U1.5-Lite-Previewをコミュニティにオープンソース公開。単一アーキテクチャで視覚理解・推論・生成・編集を統合し、8B-MoEパラメータで4K解像度・リアルな質感・複雑な視覚制御を実現。U1が統一構造の可能性を検証し、U1.5が軽量高パフォーマンスの突破を達成。....
商湯、軽量マルチモーダルモデルSenseNova U1.5-Lite-Previewをオープンソース化。8B-MoTパラメータのNEO-unifyアーキテクチャ採用、ネイティブ4K画像生成、精細テクスチャ、正確な日中英文字生成、安定した画像編集を実現。長文自然言語と構造化視覚指示の理解を強化し、複雑な要求にも高精度なマルチモーダル生成を可能にする。....