9月9日に開催されたJD(京東)グローバル・テクノロジー・エクスプローラー・カンファレンス(JDD)で、JDエクスプロレーション研究院はJoyAI-Echoシリーズの2つの新進展を発表しました。1つ目は超長音声映像生成モデルのアップグレードであるJoyAI-Echo1.5であり、もう1つは対話可能な視聴世界モデルEchoWMの公開とオープンソース化です。前者は音声と映像の連続生成を10分を超えるレベルに引き上げており、後者はネイティブな視聴生成とユーザーの操作を統合し、AIコンテンツが「見られる」から「入って探れる」へと進化しています。
長動画に関する方面では、JoyAI-Echo1.5は音声映像Memory Bank構造を採用しています。この構造により、複数のカットや長期的な生成において人物の姿、音声、ストーリーの流れを正確に保持し、10分以上の音声と映像の継続的生成を可能にします。モデルは長動画後のトレーニングにより推論速度を最大7.5倍にまで向上させ、2枚のH200で480Pの解像度で1秒間に24フレームを生成し、1:1のリアルタイム生成を実現しています。Director Agentは自然言語に基づいてストーリーの展開、カットの計画、生成のレビューおよび完成作品の編集を行うことができます。

世界モデルの方面では通常、2つのアプローチが使われます。1つはユーザーの操作に応じて画像を連続して生成するものですが、自然な音声が欠けている点があります。もう1つは音声と映像を共同で生成するものの、ユーザーが内容を継続的に変更することが難しいという課題があります。EchoWMはこれらの2つの能力を統合し、720Pの動画、環境音、音楽、音声をネイティブに共同生成し、シーンやカメラ、主体の動きに合わせて音声が同期して変化します。統一された「カメラの意図」を通じて、モデルは第一人称でのナビゲーション、第三者視点のカメラと主体の協調制御、そして多ラウンドの連続探索をサポートします。WBench Navigation評価では、EchoWMと4段階因果流式バージョンのEchoWM-Flashが上位2位を独占しており、そのうちEchoWMは158件以上の多ラウンドナビゲーションケースを含むリストで総合第1位を獲得しました。
ベースラインの面では、京东は这次、JoyAIベースモデルのマトリクスを一堂に紹介しました。このモデル群の機能は画像と映像生成、マルチモーダル理解、リアルタイムインタラクション、世界モデリング、インテリジェントな音声、身体的操作をカバーしており、JoyAIをコンテンツ生成から動的な環境の感知、シミュレーション、およびインタラクションへと拡張しています。JDD会場では、次世代の音声映像ベースモデルであるJoyAI-Videoも展示され、商業動画生成、物理法則の再現、第一人称視点、そして複数カットの連続的な物語表現を強化しています。これはEC広告、ショートドラマの創作、身体知能の練習をターゲットにしており、10月に正式リリース予定です。モデルの他にも、EgoLiveの真実データ、JoyAI-Simのシミュレーション変換ツールチェーン、大規模モデルインフラが同時に展示され、本物のデータからシミュレーション変換、モデル開発への支援体制が構築されています。
産業への応用においては、小売、物流、医療、工業、政府の5つの業界モデルとスマートエージェントが一堂に並びました。小売のマルチモーダルモデルは画像検索、スマート販売、素材の品質検査を担当します。物流のスーパーサイコ3.0はAgenticフレームワークによって意思決定、プロセス、物理的実行をつなぎ合わせています。京医千尋3.0は医療画像分析、仮想問診、信頼性のある推論を強化しています。工業のモデルは専門的な選定、保守、CAD設計に深く入り込みます。政府のモデルは政策相談、スマートオフィス、データ分析を提供します。ベースモデルの革新と産業向けAI実践が両輪となって、京东はAIをデジタル世界から物理世界へと広げていく全体的な戦略を構築しています。
VIP会員