当世界模型学会"开口说话":从EchoWM开源,看AI生成内容的音画合流
过去两年,AI视频生成的进步几乎都发生在"画面"上:分辨率从480P卷到1080P,时长从几秒卷到几十秒,物理规律和运镜质感也在肉眼可见地逼近实拍。但有一个维度长期被搁置在次要位置------声音 。绝大多数视频生成模型产出的内容是"默片",配音、音效、环境声要靠后期另外补。9月初的京东全球科技探索者大会(JDD)上,京东探索研究院开源的交互视听世界模型EchoWM,把这个问题重新推到了台前:它生成的不是"带画面的视频",而是画面、环境音、音乐和语音原生同步的视听内容,并且允许用户像玩游戏一样走进去持续探索。
世界模型的两条路线,各自卡在哪
要理解EchoWM的意义,得先看世界模型这条赛道的现状。目前业内大致分成两条路线:
第一条是"能交互、但没声音"。 以游戏引擎数据或仿真数据训练的交互式世界模型,可以根据用户的操作持续生成画面,你在里面移动视角、推进场景,模型响应自如。但这类模型普遍缺少自然声音------走路没有脚步声,碰撞没有碰撞音,整个世界是视觉上逼真、听觉上空荡的。对交互体验来说,这就像看一部全程关掉音效的3A游戏。
第二条是"有声音、但难持续进入"。 另一类模型可以联合生成音视频,一段内容里画面和声音是同步的。但用户很难持续参与其中------你能看一段生成的短片,却没法在其基础上不断改变镜头、改变剧情、改变声音,多轮探索的能力非常有限。
这两条路线的分野,本质上反映的是一个更深层的问题:视觉生成和听觉生成,到底是两个任务,还是一个任务? 如果答案是两个任务,那就先做视觉、再补声音,反正后期可以拼;如果答案是一个任务------就像物理世界里画面和声音本来就是同一场事件的两面------那"先生成再配音"的级联式方案,天然就存在同步损耗:口型对不上音、音效跟不上动作、场景切换时声音"迟到"半拍。
EchoWM的技术拆解:统一"相机意图"与原生音画联合
EchoWM的选择很明确:把两条路线拧在一起。根据京东探索研究院公开的技术资料,它有几个关键设计:
其一,统一的"相机意图"接口。 模型把键盘、手柄这类离散操作映射成连续的六自由度相机轨迹,同一个意图流既能驱动第一人称漫游,也能驱动第三人称跟随镜头,不需要为不同视角单独设计控制逻辑。第一人称下,轨迹就是观察者自身的运动;第三人称下,模型需要学会主体和取景如何协同移动------这其实已经带有一定的"导演"属性。
其二,声音与画面联合生成。 音频不是事后贴上去的,而是和视频在同一个生成过程里产出:相机路径驱动视觉分支,声音则跟随场景事件------脚步、碰撞、对话、配乐------自然发生,没有专门的"动作到音效"控制器。换句话说,声音是这个世界模型的"原生属性",而不是外挂。
其三,多轮探索的上下文延续。 在多轮交互中,模型把上一段结尾的短音视频窗口作为下一段的上下文,帮助布局、外观和声音在轮次之间保持连贯。不过团队也坦承,目前还没有显式的持久三维记忆,长时间运行仍可能出现漂移------这是一个诚实的限制声明,也划出了下一代工作的改进方向。
效果上有榜单背书:在涵盖158个多轮导航案例的WBench Navigation评测中,EchoWM与四步因果流式版本EchoWM-Flash包揽前两名,综合排名第一。训练侧,团队构建了一个混合游戏日志、真人游玩录像、Unreal引擎位姿真值仿真和互联网视频的世界数据引擎,再经过视听预训练、动作微调、联合微调和自回归后训练的分阶段流程。代码和论文已通过开源仓库公开。
长视频的另一块拼图:10分钟与2张H200
同一个系列里还有一项容易被忽略的进展:超长音视频生成模型JoyAI-Echo1.5,把音视频的持续生成拉过了10分钟的门槛。
长视频生成的老问题是"记不住":画面一长,人物会变脸,声音会跑调,故事线会断。JoyAI-Echo1.5用的是音视频Memory Bank架构,在多镜头、长时程生成中锁住人物形象、声音和叙事线索。效率方面,通过长视频后训练把推理速度最高提升7.5倍,只需2张H200就能在480P下做到平均每秒24帧的1:1等时生成。配套的Director Agent则试图把"导演"工作流水线化:自然语言输入故事意图,模型完成分镜规划、生成审核和成片组装。
这两个数字放在一起看很有信息量:10分钟是内容可用性的门槛 (低于这个时长,基本只能做碎片素材);2张H200是部署成本的门槛(意味着中等规模的团队也有机会跑起来)。当两个门槛同时被压低,长视听内容的生产方式才真正开始松动。
音画同步,正在从"加分项"变成"及格线"
把视野拉大一点,会发现音画联合生成并不是京东一家的选择,而是一个正在收敛的行业共识。
音乐生成领域,Suno把平台底层全面切换到v6模型家族,支持视频配乐、人声改写、局部改词等玩法;语音合成领域,ElevenLabs把语音、音乐、图像和视频生成整合进了MCP协议,让各类智能体可以直接调用多模态生成能力。更早一些,在数字人和人物表演赛道,行业已经验证过同一个判断:**口型、表情和声音如果不是在同一过程里生成,而是先生成视频再配音,同步感永远差着一口气。**国内也有团队在这个方向上走得比较深,把声音、口型和脸部表情放进同一个模型联合生成,做影视级的人物表演输出------这条路此前主要服务数字人、口播和电商内容,而EchoWM的出现说明,同样的联合生成范式正在向更大的场景蔓延:从"一张会说话的脸"扩展到"一个有声音的世界"。
这背后的逻辑其实一以贯之:**当视觉生成的质量差距被逐渐抹平,同步性就成了新的体验分水岭。**观众对"画面不够真"的容忍度在提高------风格化内容比比皆是;但对"音画不同步"的容忍度极低------哪怕半帧的错位,人耳人眼都会立刻察觉。感知上的这种不对称,决定了音画联合生成不会停留在技术演示,而会成为内容生产的基础要求。
冷静看:还差什么
当然,EchoWM代表的方向还远未到收尾阶段。团队自己承认的显式三维记忆缺失,意味着长时程探索中场景可能漂移;720P的生成规格在电影级需求面前还有距离;世界数据引擎依赖游戏和仿真数据,与真实物理世界的分布仍有gap。此外,交互式世界模型的评测体系也才刚起步,WBench这类榜单覆盖的案例数量还比较有限,榜单成绩与实际体验之间的关系需要更多验证。
但趋势的方向是清晰的。回顾AI内容生成的演进路径:先解决"能不能生成",再解决"生成得好不好",接下来要解决的是"生成得对不对"------物理是否自洽、声音是否同步、多轮交互是否连贯。EchoWM把音画联合与持续交互放进同一个开源模型,等于给行业提供了一个可参照的工程样本:视觉、听觉和控制不必是三个拼接的系统,可以是同一个生成过程的三张面孔。
接下来的看点有两个:一是 JoyAI-Video 音视频基础模型计划10月正式发布,瞄准电商广告、短剧创作等商业场景,届时可以检验这套音画同出能力在真实生产管线里的成色;二是开源社区会在这套架构上长出什么------当"能进、能探索、有声音"的世界模型门槛降低,游戏、短剧、虚拟直播乃至具身智能的仿真训练,都可能成为最先被改写的场景。
AI生成内容的竞争,正在从"画得像不像"转向"世界活不活"。而一个"活"的世界,理应有声音。