9月9日的京東全球科技探索者大會(JDD)上,京東探索研究院端出了 JoyAI-Echo 系列的兩項新進展:超長音視頻生成模型升到 JoyAI-Echo1.5,同時發佈並開源可交互視聽世界模型 EchoWM。前者把音視頻持續生成拉過10分鐘門檻,後者把原生視聽生成和用戶控制擰在一起,讓 AI 內容從"能看"進一步走到"能進、能探索"。

長視頻這條線,JoyAI-Echo1.5押的是音視頻 Memory Bank 架構。它能在多鏡頭、長時程的生成裏死死抓住人物形象、聲音和故事線索不跑偏,撐住10分鐘以上的音視頻持續產出。模型靠長視頻後訓練把推理速度最高拉了7.5倍,只需要2張 H200,就能在480P 下平均每秒生成24幀,做到1:1等時生成;Director Agent 還能按自然語言完成故事展開、分鏡規劃、生成審覈和成片組裝這一整套活。

image.png

世界模型這邊通常分兩路走:一路能跟着用戶操作不停生成畫面,卻缺了自然聲音;另一路能聯合生成音視頻,可用戶很難持續鑽進去改內容。EchoWM 把這兩類能力並在了一起,原生聯合生成720P 視頻、環境音、音樂和語音,讓聲音隨場景、攝像機和主體運動同步變;通過統一的"相機意圖",模型同時支持第一人稱導航、第三人稱攝像機與主體協同控制,以及多輪連續探索。在 WBench Navigation 評測裏,EchoWM 和四步因果流式版本 EchoWM-Flash 包攬前兩名,其中 EchoWM 在涵蓋158個多輪導航案例的榜單上拿下綜合第一

底座層面,京東這次集中亮出 JoyAI 基礎模型矩陣,能力覆蓋圖像與視頻生成、多模態理解、實時交互、世界建模、智能語音和具身操作,把 JoyAI 從內容生成往動態環境的感知、模擬與交互推。JDD 現場還展示了新一代音視頻基礎模型 JoyAI-Video,重點強化商業視頻生成、物理規律呈現、第一人稱視角和多鏡頭連續敘事,瞄準電商廣告、短劇創作和具身智能演練,計劃10月正式發佈。模型之外,京東同步展出了 EgoLive 真實數據、JoyAI-Sim 仿真轉換工具鏈和大模型基礎設施,搭起從真實數據、仿真轉換到模型研發的支撐體系。

產業落地上,零售、物流、醫療、工業、政務五大行業模型和智能體集中亮相:零售多模態模型管圖搜、智能導購和素材質檢;物流超腦3.0用 Agentic 框架把決策、流程和物理執行串起來;京醫千詢3.0強化醫療影像分析、模擬問診和可信推理;工業大模型扎進專業選型、維保和 CAD 設計;政務大模型服務政策諮詢、智能辦公和數據分析。基礎模型創新與產業 AI 實踐雙線推進,構成了京東把 AI 從數字世界推向物理世界的整體佈局。