华控投资 | 流形空间打出关键一帧:开源世界模型MoE训练框架Worldscape-MoE,统一异源动作控制

发布时间:2026-07-21
分享:

世界模型正从"会生成视频"的模型,变成具身智能的底层基础设施。流形空间用一个开源框架,迈出了关键一步。

7 月 16 日,华控基金投资的企业--流形空间(Manifold AI)正式开源业内首个面向异源动作控制的世界模型 MoE 训练框架——Worldscape-MoE,让 locomotion(场景探索)、robotic manipulation(机器人操作)和 egocentric hand motion(第一人称手部交互)等主流控制信号,首次在同一个世界模型里共同学习。就在开源 Worldscape-MoE 的前期,流形空间还与优必选成功举办业务战略合作签约仪式。双方将围绕"具身在多行业泛化场景落地、世界模型数据闭环"等领域展开深度合作,加速世界模型从技术验证走向规模化商用。

华控基金于2026年初投资流形空间,将其纳入世界模型赛道的系统性重要布局,并在后续轮次中追加投资。

 

把割裂的控制信号,放回同一个世界

当前世界模型面临一个结构性矛盾:做空间探索的围绕相机轨迹训练,做机器人操作的依赖机械臂关节动作,做第一人称交互的使用手部姿态和 action map——它们都在建模同一个物理世界,却被不同的动作接口切割成了一座座孤岛。数据无法汇合,能力无法复用,模型也难以随新控制信号持续扩展。

Worldscape-MoE 的核心判断是:不同动作接口虽然形式完全不同,但它们约束的是同一个世界。相机轨迹描述视角如何穿过空间,机械臂动作描述机器人如何接触和移动物体,手关节 action map 描述第一人称交互中双手如何改变场景——这些信号的表示形式不同,但都要求模型遵守物体一致性、时序连续性、物理接触和动作因果。

因此,异源控制统一的关键,不是强行把所有动作翻译成同一种格式,而是把问题拆成两层:一层学习跨控制共享的世界规律,一层学习各自控制接口的动作语义。用论文的话说:Worldscape-MoE 统一的不是动作格式,而是动作作用于世界之后的动态规律。

 

MoE 不是堆参数,而是拆解控制冲突

Worldscape-MoE 将Mixture of Experts(MoE)引入Diffusion Transformer(DiT),在每个样本中同时激活共享专家和对应模态专家。共享专家负责沉淀跨控制的世界知识,专属专家负责解释某一种控制接口下的细粒度动作含义。

这与普通的 dense mixed training 有本质区别。后者把相机控制、机械臂控制、手部控制全部混进同一条参数路径,容易产生梯度冲突;Worldscape-MoE 则把异源监督从"互相拉扯的训练噪声",变成"共同放大的世界知识"。

框架覆盖了三类典型的具身控制范式:

• Locomotion:面向场景探索、空间导航和交互式世界漫游,控制信号为相机轨迹或局部视角变化;

• Manipulation:面向机器人操作,要求模型理解机械臂运动、物体接触和任务状态变化;

• Action Map:面向第一人称手部交互,模型根据像素对齐的手关节动作图生成与手-物交互一致的未来视频。

三类信号没有被粗暴压缩成一种通用 token,而是各自以最合适的方式注入同一个 diffusion backbone:轨迹控制经由 Control Adapter 对齐到视频 latent,手部 action map 编码为 latent control feature 作为视觉条件注入,机械臂动作通过Action MLP 编码为紧凑动作嵌入——每种动作保留自己的结构,进入模型后共享同一个世界建模主干。

专家负载分析也验证了设计的合理性:共享专家承担约 69.48% 的 gate-weighted computation,说明模型确实在沉淀跨控制世界知识;同时,manipulation(47.95%)和 hand motion(35.97%)的专属专家负载显著高于 locomotion(20.91%),符合直觉——机械臂和手部交互对接触、遮挡、局部动作语义的要求更高。

 

渐进式扩展:让世界模型真正成为基础设施

如果每新增一种控制信号都要重新训练一个世界模型,世界模型就很难真正成为基础设施。Worldscape-MoE进一步提出 Worldscape-MoE Tuning,将异源控制扩展变成一个渐进式过程:从预训练视频生成模型出发,先接入相机控制和机械臂控制,建立稳定生成先验与基础具身操作能力;随后逐步加入新的控制模态和对应专家。

关键设计在于:新专家不是随机初始化,而是从当前 shared expert 初始化,让新控制分支一启动就继承模型已学到的世界常识;同时采用 grouped learning-rate 策略,shared expert 和预训练继承参数使用保守学习率,新加入模块使用更高学习率,避免新模态冲掉已有世界知识。

这让世界模型的扩展方式发生了根本变化:过去是"为每种控制重新造一个模型",现在是"往同一个世界里接入一种新控制"。未来无论加入单臂机器人、灵巧手、移动底盘、全身 humanoid 动作,还是触觉、力反馈等更复杂监督,都可以沿这一路径继续扩展。目前,Worldscape-MoE 在通用世界模型权威评测榜单长期占据榜首位置。

 

跨控制泛化:走向统一的具身智能内部模拟器

Worldscape-MoE 在out-of-distribution(OOD)泛化上表现突出:能在视觉分布变化很大的场景中保持相机运动一致性,能把模拟器中的机器人操作泛化到更真实的家具服务场景,也能把手部控制迁移到未见过的第一人称交互环境。

更具想象空间的是 loco-manipulation——移动与操作的耦合。过去,这两种能力往往对应两个模型、两类数据、两套控制接口;放入同一个共享世界表示后,模型开始能够生成耦合的移动-操作行为。对于未来具身 Agent 来说,真实任务不会只包含一种动作,智能体需要走到桌边、调整视角、伸手拿起物体、避开障碍并继续完成任务,而这些动作都发生在同一个连续世界中。

从这个角度看,Worldscape-MoE 的意义不只是"支持了三种控制",而是开始把原本割裂的控制能力重新放回同一个世界里。

 

华控布局:在空间智能的纵深卡位

流形空间是华控基金在世界模型的重要布局之一。自 2026 年3月以 Pre-A 轮进入以来,华控持续关注流形空间在具身智能基础设施层的技术突破。华控基金亦正通过系统性的投资布局,推动 AI 从“理解人类语言”向“理解物理世界”演进,投资版图覆盖了从大语言模型到通用世界模型再到3D模型等多个关键环节。

世界不是一座座孤岛。随着流形空间 Worldscape-MoE 的开源,具身智能的底层基础设施正在变得更加统一、开放与强大。华控基金将继续携手被投企业,共同定义 AI 时代的空间智能新范式。