← 全部文章

研究预览 / 运动控制

DeFM-WMP从地形感知到四足运动控制。

融合 DeFM 深度视觉表征与 WMP 世界模型感知框架,扩展多地形训练,让四足机器人在变化的地形中连续运动。

抽象地形网格与连续运动轨迹
感知、记忆与动作,连接变化中的地形。概念示意,非实验轨迹。

看见障碍之后,机器人如何继续向前

本次研究的重点,是把 DeFM 的预训练深度视觉表征融入 WMP 的循环世界模型,并扩展训练地形。我们保留 DeFM 对空间结构的编码,通过可训练读出将其与本体观测融合,再交给世界模型和控制策略使用;同时加入窄桥、石台、花坛与多类跨栏等几何挑战,让四足机器人在同一训练体系中学习连续控制。本文展示的是这一集成与地形扩展工作的仿真进展。

本文以仿真录像展示项目进展,并展开从深度输入到关节力矩的完整计算过程。当前 DeFM 模型已录得 12 类 level-8 地形的通过片段;展示库另收录既有 WMP 模型的双列梅花桩与三类栅栏录像,共 16 类。不同模型的录像用于展示项目能力,不作为单一模型的成功率统计。

One policy,多地形

共享策略的思路是在多地形课程中训练同一个控制器。地形几何发生变化时,策略根据深度观测、运动历史与速度命令调整动作,让接近、跨越和恢复前进连接起来。“One policy” 指同一模型版本内的共享控制方式;本页录像还包含早期检查点,已在卡片中区分来源。

WMP 的原始全称为 World Model-based Perception,来自《World Model-based Perception for Visual Legged Locomotion》[1]。本次预览探索将 DeFM(Depth Foundation Model,深度基础模型)[2] 作为深度视觉前端,把空间特征接入循环状态估计和运动控制。

01 / 先看机器人如何通过地形

16 段连续仿真录像,涵盖石阵、桥梁、花坛、攀爬与栅栏。每段保留 12 秒完整过程,记录条件为 level 8、前向命令、零重置且前向位移不少于 6 米。它们展示具体运行结果;单次通过不等同于多随机种子下的稳定成功率。

从接近到跨越,再到继续前进。点击任一视频查看完整过程。双列梅花桩与三类栅栏来自既有 WMP 实验,其余 12 类来自当前 DeFM 实验。
16地形实录
12 s每段连续录像
0每段录像重置次数

02 / 从深度观测到关节控制

这套系统包含两条相互配合的路径:世界模型从深度与本体观测中维护运动记忆;控制策略结合这份记忆、近期观测历史和速度命令生成动作。RSSM 是连接感知与控制的中间环节,其后仍有特征编码、策略网络和低层控制器。

图 1|完整计算路径。实线表示运行时的数据流,虚线表示训练监督。RSSM 的确定性状态送入策略特征编码器;重建与奖励预测使用完整潜状态。历史观测和速度命令另行进入 Actor,动作经 PD 控制转为关节力矩。

保留空间结构,学习面向控制的读出

DeFM 视觉前端将深度观测编码为空间 token,使地形的局部结构能够进入后续学习。可训练读出融合全局与局部特征,再与本体状态编码汇合,形成世界模型的观测表征。这条路径把地形信息与机器人自身的姿态、关节状态联系起来,为循环状态估计提供共同的感知基础。

用动作推进记忆,用观测修正状态

RSSM 先依据上一时刻的潜状态与一段动作历史推进确定性记忆,再结合当前观测嵌入推断随机后验。下面用 k 表示世界模型更新时刻,A 表示两次更新之间的动作序列。这个顺序很关键:当前观测首先更新随机状态 z,再通过后续递推影响确定性记忆 h。运行中的世界模型按深度更新间隔执行,策略在其间复用最近的 h。

潜状态更新
(1)

训练时,先验与后验之间的 KL 约束与深度重建、本体重建、奖励预测共同塑造潜状态。解码器提供学习信号;在线动作生成不需要先解码一张深度图。

从潜状态走到真实的关节控制链

实际 Actor 接收三部分输入:确定性记忆 h 的编码、最近五帧观测历史 H 的编码,以及速度命令 c。随机状态 z 不直接拼入 Actor。策略输出 12 维动作,经缩放与参考姿态偏置得到关节位置目标,再由 PD 控制器产生力矩。训练侧另有使用特权观测的 Critic,以及基于参考运动的 AMP 判别器,为策略提供价值估计和运动风格奖励。

动作与关节目标
(2)

视觉记忆、近期运动反馈与速度命令在策略中汇合,最终转化为关节目标。由此,地形感知能够沿着状态估计、动作决策和低层控制这条链路,持续参与机器人的运动。

03 / 从连续路面,走向复杂立体地形

窄梁与梅花桩,把落脚空间压缩到有限的支撑面;花坛与坡台,让机器人面对高度突变和边缘跨越;栅栏与低矮通道,则同时考验腿部协调和身体姿态。我们将这些挑战纳入同一训练体系,让策略在丰富的几何变化中学习接近障碍、完成跨越、恢复前进的动作衔接。地形随课程逐步加难,从基础行走延伸到更复杂的运动任务。

参考文献

[1] Lai et al. — World Model-based Perception for Visual Legged Locomotion. ICRA 2025. · 代码 ↗

[2] Patel et al. — DeFM: Learning Foundation Representations from Depth for Robotics. 2026. · 代码 ↗

结论:共享策略,让感知持续参与运动

本次研究预览展示了深度视觉、循环世界模型与运动策略构成的控制闭环:机器人依据地形观测和运动历史,连续完成接近、跨越与继续前进。当前结果支持这一架构在多类仿真地形上的可行性。展示中的 12 类当前 DeFM 录像与 4 类早期 WMP 录像来自不同实验,不能合并为单一策略通过 16 类地形的评测结论。接下来需要固定同一检查点开展多随机种子测试,统计成功率、跌倒与停滞,并比较视觉前端与记忆模块的贡献;真实机器人上的稳定性仍需独立验证。