选择你喜欢的标签
我们会为你匹配适合你的网址导航

    确认 跳过

    跳过将删除所有初始化信息

    您的位置:0XUCN > 资讯 > 智能
    新闻分类

    EchoWM – 京东开源的交互式视听世界模型

    智能 PRO 稿源:AI工具集 2026-09-11 11:57

    0XU.CN

    EchoWM是什么

    EchoWM 是京东探索研究院开源的交互式视听世界模型。模型延续JoyAI-Echo的原生音视频生成能力,让用户以第一/第三人称视角在AI生成的世界中实时移动探索,画面、空间关系与环境音、语音持续同步且长时间不跑偏。模型采用统一相机意图接口与世界数据引擎训练,WBench导航评测平均分81.7位列第一。

    EchoWM的主要功能

    • 实时可探索世界生成:用户可通过WASD方向键在AI生成的场景中自由移动、转身、折返,世界随操作实时展开。
    • 原生音视频联合生成:在同一框架内同步生成720p视频与环境音、音乐、人物语音,声音随画面变化自然延续。
    • 第一/第三人称双视角控制:第一人称下镜头即观察者移动,第三人称下镜头自动跟随人物、车辆等主体运动。
    • 多轮长时程延续:用上一段末尾的音视频作为下一轮上下文,多轮操作后场景布局、主体外观与声音依然连贯。
    • WBench导航评测第一:158个案例中平均得分81.7,一致性与交互性指标均居前列。

    EchoWM的技术原理

    • 统一相机意图接口:将离散的键盘指令映射为相对初始位姿的连续6-DoF轨迹,用同一套接口描述镜头如何移动;第一人称下它直接表示观察者运动,第三人称下由模型从数据中学习”主体移动—镜头跟随”的耦合关系,无需额外的角色轨迹或相机预设参数,且轨迹仅注入视频分支,音频随画面联动。

    • 世界数据引擎:整合四类互补数据源,内部采集gameplay、人类实玩录像、UE仿真、普通互联网视频;再用轨迹最大平移幅度的第90百分位数为全局”尺子”统一归一化,保留不同轨迹间的相对位移差异,避免分段定标带来的速度突变。

    • 渐进式四阶段训练:第一阶段用AV-rich数据做音视频持续预训练打底;第二阶段冻结骨干、只训练轻量轨迹分支强化控制响应;第三阶段用兼具控制可靠性与视听质量的数据低学习率联合微调;第四阶段自回归后训练,通过Teacher Forcing改造为因果分块生成,结合短时程Self-Gradient Forcing让模型适应自己生成的历史,再用分布匹配蒸馏压缩为四步采样,配合sink-plus-FIFO缓存机制在控制KV成本的同时支撑长时程流式交互。

    微信关注回复“开源”,加入AI开源项目交流群

    如何使用EchoWM

    • 克隆仓库:git clone 下载 github.com/jd-opensource/JoyAI-Echo,进入 echo_wm/ 目录(与长视频项目 echo_longvideo/ 相互独立)。
    • 创建环境:conda create -n echo-wm python=3.11 创建独立环境并激活。
    • 安装依赖:先装 PyTorch 2.9.1(cu128),再 pip install -r requirements.txt,并用 torch.cuda.is_available() 验证显卡可用。
    • 下载模型权重:用 hf download Echo-Team/Echo-WM 下载模型 checkpoint;另需下载 Gemma 3 文本编码器(gated 仓库,需先在 HF 页面接受许可并 hf auth login)。
    • 跑官方示例验证:运行 scripts/run_wm_case.py --case examples/wm_cases/0010 等内置完整案例,确认环境配置无误。
    • 自定义生成:运行 inference_wm.py,传入首帧图片 + 六字段提示词+ 动作串(Action DSL)即可输出带声音的视频。
    • 编写动作指令:用 Action DSL 描述相机运动,格式为 <按键>-<帧数>,逗号连接,如 w-60,a-60 表示前进60帧后左移60帧,支持 w/s/a/d/i/j/k 组合。

    EchoWM的核心优势

    • 视听一体化:在同一框架内原生联合生成720p视频与环境音、音乐、语音,声音随画面场景和事件同步变化,解决了多数世界模型”只出画面不出声”的问题。
    • 统一控制接口:用一套相对6-DoF轨迹同时驱动第一人称观察者移动和第三人称镜头跟随主体,无需为不同视角单独设计控制器。
    • 长时程连贯:通过自回归后训练与sink-plus-FIFO缓存机制,用户可基于上一轮末尾音视频上下文继续多轮探索,场景、主体与声音长时间不跑偏。
    • 评测领先:WBench Navigation评测平均分81.7位列第一,用户研究整体偏好显著优于LingBot-World-v2和HappyOyster。

    JoyAI-EchoWM的项目地址

    • 项目官网:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/

    • GitHub仓库:https://github.com/jd-opensource/JoyAI-Echo

    • arXiv技术论文:https://arxiv.org/pdf/2608.23189

    EchoWM的同类竞品对比

    对比维度EchoWM(京东)HappyOyster
    产品定位可进入的全模态世界模型音视频联合生成 + 实时交互模型
    交互模式第一人称 + 第三人称双视角导演模式 + 第一人称漫游模式
    控制方式统一相机意图接口(6-DoF 轨迹,WASD 映射)视角与动作控制(具体接口公开信息有限)
    音视频生成原生联合生成 720p 视频 + 环境音/音乐/语音支持音视频联合生成
    长时程能力多轮延续 + 自回归后训练,长时程一致性突出支持交互式生成,长时程细节公开较少
    WBench 平均分81.7(第1)76.8
    用户研究(整体偏好)63.13%27.06%

    EchoWM的应用场景

    • 游戏原型开发:创作者进入生成场景试玩,验证空间布局、路线设计与镜头体验后再决定制作方向。
    • 互动叙事:剧情按用户选择分支推进并持续生成,替代传统预制素材,用于互动剧、互动小说。
    • 沉浸式内容:影视与广告内容从”观看”变为”进入”,观众可自由探索画面中的世界。
    • 虚拟游览:博物馆、景区、房产等场景的低成本数字化漫游,无需逐帧建模。
    • 数字人表演:人物语音、动作与周围动态环境、镜头、声音协同生成,适用于虚拟主播、数字员工。

    0XU.CN

    [超站]友情链接:

    四季很好,只要有你,文娱排行榜:https://www.yaopaiming.com/
    关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/

    图库
    公众号 关注网络尖刀微信公众号
    随时掌握互联网精彩
    赞助链接
    热门AI排行
    排名 热点 热门指数