京东开源JoyAI-Echo WM登顶WBench,世界模型迈入“可进入”的全模态新阶段
它既能根据用户的移动和视角变化持续生成世界,也能同步生成720P视频、环境音、音乐和语音,并支持第一人称、第三人称及多轮连续交互,让AI生成的内容从“可以看”。
近日,京东开源实时可交互世界模型JoyAI-Echo WM,首次将这两种相对独立的能力在一套模型中打通:它既能根据用户的移动和视角变化持续生成世界,也能同步生成720P视频、环境音、音乐和语音,并支持第一人称、第三人称及多轮连续交互,让AI生成的内容从“可以看”,进一步走向“可以进入、可以操作、可以听见”的全模态新阶段。
在面向交互式世界模型的公开评测 WBench Navigation 中,测试涵盖画面质量、场景遵循、交互控制、一致性和物理合理性等多个维度。 JoyAI-Echo WM以81.6分排名第一,其中一致性达到89.8;经过四步因果蒸馏的快速版本 JoyAI-Echo WM Flash,综合得分仍以81.0分排名第二,交互能力更进一步达到87.9。两个版本包揽榜单前两名,EchoWM 已达到当前评测SOTA水平。
在另一项SANA-WM-Bench中, JoyAI-Echo WM在短程简单轨迹和困难轨迹测试中的VBench得分分别达到83.91和83.96,均为参评模型最高。这意味着,模型不仅能“听懂往哪走”,也能在连续移动和转向过程中,保持出色的视角控制和画面稳定性。
依托实时可交互的音视频世界生成能力,JoyAI-Echo WM可应用于游戏、数字人直播、具身智能训练等场景:让游戏世界随玩家操作持续变化,让互动剧情拥有更强的参与感,让数字人在直播中能够保持角色、动作与声音连贯,也为未来具身智能体在虚拟环境中的探索、交互与训练提供新的技术基础。
JoyAI-Echo WM的推出是JoyAI-Echo能力的延伸。今年6月,京东开源JoyAI-Echo长音视频生成框架,重点解决长视频中人物容易“变脸”、声音难保持一致、生成效率低等问题,让AI能够持续生成分钟级音视频内容。
此次升级至JoyAI-Echo 1.5版本,京东同步开源其中的Echo WM与长视频版本Echo-LongVideo。Echo-LongVideo支持约10分钟多镜头音视频生成,即使经过频繁转场、场景变化和新角色加入,仍能保持人物外观、声音与故事线索连贯;同步开放的Echo Director Agent还可完成故事展开、分镜规划、生成审核和成片组装。
JDD期间,京东JoyAI基础模型矩阵全面升级。目前,京东已形成覆盖语音、图像、视频、实时交互、世界建模与具身智能等方向的基础模型能力,推动AI 从数字世界迈向物理世界,全面赋能零售、物流、工业、健康等核心业务,助力京东建设全球最 大物理世界运营中心。

