← 返回文章目录

论文笔记 · 2026/07/22

Cosmos Policy

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

https://arxiv.org/abs/2601.16163

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

1. 概括

Cosmos Policy 将预训练视频生成模型直接微调为机器人策略,让同一个模型同时生成机器人动作、预测动作后果,并判断未来状态的好坏。

它的核心思想是:

当前状态→动作→未来状态→未来价值\text{当前状态}\rightarrow \text{动作}\rightarrow \text{未来状态}\rightarrow \text{未来价值}


2. 论文解决了什么问题?

预训练视频模型能够从大量视频中学习:

  • 物体如何运动;
  • 接触后会发生什么;
  • 场景如何随时间变化;
  • 一种当前状态可能对应哪些不同未来。

这些时空知识很适合机器人控制。

但此前将视频模型用于机器人时,通常需要多个阶段:

视频模型→未来视频→逆动力学或动作模块→机器人动作\text{视频模型}\rightarrow \text{未来视频}\rightarrow \text{逆动力学或动作模块}\rightarrow \text{机器人动作}

这类方法存在三个问题:

  1. 需要额外的动作编码器、动作头或逆动力学模型;
  2. 训练过程复杂,视频预测误差还会传递到动作预测;
  3. 策略、世界模型和价值函数通常是彼此独立的网络。

Cosmos Policy 要解决的核心问题是:能否不修改视频模型结构,直接把一个预训练视频模型变成可执行动作的机器人策略?

本文的思路是:只需要重新组织视频模型潜变量序列中的内容,并在机器人演示数据上进行一次后训练。

3. 核心方法:潜帧注入

视频生成模型不会直接处理原始图片,而是先用 VAE 将图片压缩成潜变量:

It→VAEztI_t\xrightarrow{\mathrm{VAE}}z_t

其中 ztz_t 可以理解为一张图片的“数字压缩包”,论文称其为潜帧。

原始视频模型处理的序列类似:[z(It),z(It+1),z(It+2),…][z(I_t),z(I_{t+1}),z(I_{t+2}),\ldots]

Cosmos Policy 将动作、机器人状态和价值也整理成与潜帧相同的张量形状,然后插入这个序列:

Z=[z(qt),z(It),z(At),z(qt+K),z(It+K),z(Vt+K)]Z=[z(q_t),z(I_t),z(A_t),z(q_{t+K}),z(I_{t+K}),z(V_{t+K})]

其中:

  • (qtq_t):当前关节角、末端位姿等机器人状态;
  • (ItI_t):当前多视角相机图像;
  • (AtA_t):接下来 (K) 步的动作序列;
  • qt+K,It+Kq_{t+K},I_{t+K}:执行动作后的未来状态;
  • Vt+KV_{t+K}:该未来状态的预期累计奖励。

动作和价值并没有真的变成图片,只是被复制、归一化并排列成与视频潜帧相同的尺寸。

例如,低维动作向量At=[a1,a2,…,ad]A_t=[a_1,a_2,\ldots,a_d]经过归一化和重复填充后得到:

z(At)=reshape⁡(repeat⁡(normalize⁡(At)))z(A_t)= \operatorname{reshape} \left( \operatorname{repeat}(\operatorname{normalize}(A_t)) \right)

这样,原视频 Transformer 不需要增加新的输入接口或输出头,就能处理动作、状态和价值。模型通过它们在序列中的固定位置,逐渐学会每个潜帧代表什么。

图片说明

4. 一个模型承担三个功能

Cosmos Policy 使用同一个扩散 Transformer,同时学习三个条件分布。

4.1 机器人策略

根据当前状态生成动作块:At∼πθ(At∣st,c)A_t\sim\pi_\theta(A_t\mid s_t,c)

其中 (c) 是语言任务描述,例如“把红色积木放进盒子”。

模型不是回归唯一动作,而是学习动作分布,因此可以表示多种正确操作方式。

4.2 世界模型

给定当前状态和候选动作,预测动作执行后的状态:s^t+K∼pθ(st+K∣st,At,c)\hat s_{t+K}\sim p_\theta(s_{t+K}\mid s_t,A_t,c)

这里的“状态”主要包括未来机器人本体状态和未来相机图像。

它回答的问题是:执行这个动作之后,可能会发生什么?

4.3 价值函数

预测未来状态最终完成任务的可能性或预期累计奖励:

Vθ(s)≈Eπ[∑τ=tHγτ−trτ∣st=s]V_\theta(s) \approx \mathbb E_\pi \left[ \sum_{\tau=t}^{H} \gamma^{\tau-t}r_\tau \mid s_t=s \right]

它回答的问题是:这个未来状态好不好?从这里继续操作,成功希望有多大?

三个功能共用同一个网络,区别主要在于训练时哪些潜帧保持干净作为条件,哪些潜帧被加噪并要求模型恢复。

5. 统一训练目标

Cosmos Policy 沿用视频扩散模型原来的去噪目标。

设完整多模态潜变量序列为 (Z),加入高斯噪声:

Z~=Z+σϵ,ϵ∼N(0,I)\tilde Z=Z+\sigma\epsilon,\qquad \epsilon\sim\mathcal N(0,I)

模型学习恢复干净序列:L(θ)=E[λ(σ)∣Dθ(Z~;σ,c)−Z∣22]\mathcal L(\theta) = \mathbb E \left[ \lambda(\sigma) \left| D_\theta(\tilde Z;\sigma,c)-Z \right|_2^2 \right]

通过改变条件掩码,同一个去噪任务可以变成:

st→Ats_t\rightarrow A_t

或:

(st,At)→st+K(s_t,A_t)\rightarrow s_{t+K}

或:

st+K→V(st+K)s_{t+K}\rightarrow V(s_{t+K})

因此,作者不需要分别设计策略损失、视频预测网络和价值网络。

6. 为什么还要同时预测未来状态?

策略训练时,模型不只预测动作,还辅助预测:

(At,st+K,Vt+K)(A_t,s_{t+K},V_{t+K})

这会迫使模型理解:

  • 当前物体在哪里;
  • 动作将产生什么后果;
  • 后果是否符合任务目标。

如果只训练

st→Ats_t\rightarrow A_t

模型可能只记住表面的动作相关性。

加入未来状态预测后,模型还必须学习:

st+At→st+Ks_t+A_t\rightarrow s_{t+K}

即“为什么要执行这个动作,以及动作会造成什么变化”。

消融实验中,仅预测动作的版本在 RoboCasa 上从完整模型的 (67.1%) 降至 (44.4%),说明未来状态监督不仅用于规划,也显著提升了直接策略。


7. 基于模型的规划

直接策略可以从动作分布中采样多个候选动作:

At(1),At(2),…,At(N)∼πθ(⋅∣st)A_t^{(1)},A_t^{(2)},\ldots,A_t^{(N)} \sim \pi_\theta(\cdot\mid s_t)

随后对每个候选动作进行一次短期“想象”:

s^t+K(i)∼pθ(⋅∣st,At(i))\hat s_{t+K}^{(i)} \sim p_\theta(\cdot\mid s_t,A_t^{(i)})

再预测这些未来状态的价值:

V^i=Vθ(s^t+K(i))\hat V_i = V_\theta(\hat s_{t+K}^{(i)})

最终执行价值最高的动作:

At∗=At(i),i=arg⁡max⁡iV^iA_t^* = A_t^{(i)},\qquad i=\arg\max_i\hat V_i

整个过程可以概括为:

提出多个动作→想象每个动作的后果→评价后→执行最佳动作\boxed{\text{提出多个动作}\rightarrow\text{想象每个动作的后果}\rightarrow\text{评价后}\rightarrow\text{执行最佳动作}}

这种方法属于 best-of-(N) 一步规划,而不是长时间、多层级的搜索。

【原文图片占位:规划流程图——展示 Policy Model 生成多个动作,Planning Model 预测未来状态和价值,最后选择最高价值动作。】


8. 为什么需要策略 rollout 数据?

专家演示大多是成功轨迹,因此世界模型可能只见过“正确动作会产生什么结果”,却不熟悉:

  • 抓取落空;
  • 夹爪打滑;
  • 拉链没有打开;
  • 机械臂遮挡目标;
  • 动作偏离专家分布。

为了让模型能够评价错误动作,作者部署基础策略,收集真实执行产生的成功和失败轨迹,再重点微调世界模型与价值函数。

可以理解为:

专家演示⇒学会怎么做\text{专家演示}\Rightarrow\text{学会怎么做}

策略 rollout⇒学会哪些错误会导致失败\text{策略 rollout}\Rightarrow\text{学会哪些错误会导致失败}

规划时保留原始模型负责提出动作,使用 rollout 微调后的模型负责预测动作后果和评分。


9. 主要创新点

创新一:不修改架构地生成机器人动作

动作被编码成视频潜帧,直接使用视频扩散模型的原生生成机制,不需要增加专门的动作头或逆动力学模型。

创新二:策略、世界模型和价值函数统一

同一个模型同时表示:

π(A∣s),p(s′∣s,A),V(s′)\pi(A\mid s),\qquad p(s'\mid s,A),\qquad V(s')

三者共享视频模型的时空表示能力。

创新三:未来预测既用于辅助训练,也用于测试时规划

预测未来状态不仅能帮助筛选动作,还能约束策略理解动作后果,从而提升不使用规划时的直接控制性能。

创新四:利用视频预训练表示多模态动作

扩散模型学习的是完整动作分布:p(A∣s)p(A\mid s)

而不是动作均值。这适合存在多种正确操作方式的任务,例如从不同方向抓取物体或选择不同物体顺序。

10. 实验结论

作为不带规划的直接策略,Cosmos Policy 达到:

  • LIBERO:平均成功率 (98.5%);
  • RoboCasa:平均成功率 (67.1%);
  • ALOHA 双臂真机任务:平均得分 (93.6%)。

在两个困难的真机任务中加入世界模型规划后,平均任务完成率提高约 (12.5) 个百分点

11. 局限性

  1. 模型规模较大,完整微调和推理成本较高。
  2. 规划需要为多个候选动作生成未来状态并评分,速度较慢。
  3. 世界模型只预测一个动作块后的状态,不是长时间连续模拟。
  4. 模型预测的是相机和机器人传感器能够观察到的状态,无法直接获得摩擦力、接触力等隐藏信息。
  5. 有效规划仍需要额外收集机器人 rollout 数据。

12. 最终理解

Cosmos Policy 最重要的贡献,不只是“用视频模型控制机器人”,而是将机器人控制重新表达成一个统一的条件生成问题:

st→At→st+K→V(st+K)\boxed{s_t\rightarrow A_t\rightarrow s_{t+K}\rightarrow V(s_{t+K})}

通过把动作、状态和价值统一包装成视频潜帧,作者让一个预训练视频模型同时成为:

机器人策略+世界模型+价值函数\boxed{\text{机器人策略}+\text{世界模型}+\text{价值函数}}

它证明了视频模型学到的时空和物理先验,不仅可以用于“生成未来画面”,也可以直接用于“生成能够改变未来的机器人动作”。