← 返回文章目录

论文总结 · 2026/07/21

Cosmos 系列论文的技术演进与研究判断

Cosmos 系列论文的技术演进与研究判断

一、核心结论

这不是简单的“模型迭代”,而是逐步缝合 Physical AI 的四个断裂接口

这五篇论文可以概括为一条非常清晰的发展路线:

Cosmos 1 建立视频世界模型平台;Transfer1 解决世界生成如何被精确控制;Reason1 补上物理语义与行动推理;Predict2.5 将推理重新接入世界生成;Cosmos 3 最终把语言、视觉、音频和动作统一为世界—行动模型。

因此,它们的核心演进不是单纯从 7B 扩展到更大参数,而是依次解决:

  1. 表示接口:真实世界如何压缩成适合大模型学习的视频 token;
  2. 控制接口:生成的未来如何接受几何、语义和仿真条件约束;
  3. 认知接口:模型如何理解因果、物理约束和行动后果;
  4. 行动接口:模型如何从“生成世界的视频”走向“生成作用于世界的动作”。

从这一角度看,Cosmos 3 不是独立的新模型,而是前四篇工作长期分叉后的一次体系化汇合。(arXiv)


二、总体发展脉络

阶段 论文 核心问题 引入的关键接口 尚未解决的问题
平台奠基 Cosmos World Foundation Model Platform 怎样训练通用 Physical AI 世界模型 视频数据、tokenizer、生成模型、后训练平台 视频逼真不等于物理正确
可控生成 Cosmos-Transfer1 怎样精确控制生成世界的结构 深度、边缘、分割等时空控制图 控制权重依赖人工设计,闭环价值不足
物理推理 Cosmos-Reason1 怎样理解物理规律、行动后果与可供性 物理本体、长思维链、Physical AI RL 推理停留在语言层,尚不能原生输出动作
生成—推理融合 Cosmos-Predict2.5 / Transfer2.5 怎样将推理、统一生成和控制整合 Reason1 文本编码、统一 T2W/I2W/V2W、分布式控制块 仍主要是“推理条件化生成”,不是联合行动学习
全模态世界—行动模型 Cosmos 3 怎样统一理解、生成、预测和控制 动作 token、MoT、正向/逆向动力学与策略模式 因果校准、长程闭环、安全与跨具身泛化仍不足

需要注意的是,这是一条技术逻辑主线,并不完全等同于所有产品版本的发布时间顺序;在 Predict1 和 Predict2.5 之间还存在 Predict2 等中间版本。


三、逐篇论文分析

1. Cosmos World Foundation Model Platform:定义“世界基础模型”的完整技术栈

1.1 论文真正解决的是什么

第一篇工作的意义不在于提出某一个孤立的视频生成模型,而在于把 Physical AI 世界模型定义为一个完整平台,包括:

  • 大规模视频筛选、切分与标注;
  • 连续和离散视频 tokenizer;
  • 扩散式与自回归式世界模型;
  • Text2World、Video2World 等生成能力;
  • 面向机器人、自动驾驶和相机控制的后训练方案;
  • 开放权重、代码和安全机制。

论文将世界基础模型定义为能够被后训练为具体机器人、车辆或仿真环境模型的通用模型。换句话说,它试图把语言模型领域的“预训练—后训练范式”迁移到物理世界建模中。(arXiv)

其数据工程同样重要:团队从大规模视频集合中筛选出约一亿段训练片段,并使用视觉语言模型生成细粒度描述。这说明 Cosmos 从一开始就不是纯粹依靠互联网视频的原始统计规律,而是通过“视频—结构化语言描述”建立语义监督。(ar5iv)

1.2 技术贡献

第一项贡献是双生成范式并行探索。扩散模型更擅长高视觉质量,自回归模型更自然地适合时间序列预测、续写和逐 token 推理。Cosmos 1 没有过早押注单一路径,而是把二者都纳入平台。(ar5iv)

第二项贡献是视频 tokenizer 的基础设施化。世界模型的主要算力瓶颈并不只来自 Transformer,也来自时空序列过长。论文使用强时空压缩把视频转换成潜在 token,同时又通过扩散解码器补偿离散压缩造成的模糊和纹理损失。(ar5iv)

第三项贡献是后训练而非从头训练的应用路线。相机轨迹、机器人动作、多视角驾驶等条件被注入预训练模型,使一个通用视频模型能够转变为特定 Physical AI 场景的预测器。相机条件模型对未见轨迹具有一定泛化能力,多视角驾驶后训练也改善了视角一致性和稀有场景生成。(ar5iv)

1.3 深层局限

Cosmos 1 建立的是:

[ p(x_{t+1:T}\mid x_{\leq t},c) ]

其中 (x) 是视觉世界状态,(c) 是文本、相机轨迹或其他条件。

问题在于,预测一个视觉上合理的未来,不等于预测一个因果上正确的未来。模型可能生成外观逼真、但接触力、摩擦、遮挡后物体状态或动作后果错误的视频。论文提出将世界模型用于策略评估、规划和合成数据,但第一篇工作对这些用途的验证仍以示例和代理视频指标为主。(ar5iv)

因此,Cosmos 1 最准确的定位是:

它建立了 Physical AI 世界模型的“操作系统”,但还没有证明这个操作系统内部模拟出的世界足以替代真实环境。


2. Cosmos-Transfer1:从自由生成转向结构可控的世界生成

2.1 它是对 Cosmos 1 哪个问题的直接回应

Cosmos 1 可以生成未来,却缺乏足够精细的控制。仅靠文本提示,很难保证:

  • 道路几何不变;
  • 机器人姿态严格遵循仿真;
  • 前景主体和背景分别接受不同约束;
  • 多个控制信号之间不会互相冲突。

Transfer1 因而增加了深度图、边缘图、分割图、模糊视频等空间条件,并允许不同条件在不同空间位置和时间位置拥有不同权重。(arXiv)

可将它抽象为:

p(xRGB∣xcontext,c,mdepth,medge,mseg,ws,t)p(x_{\mathrm{RGB}}\mid x_{\mathrm{context}},c,m_{\mathrm{depth}},m_{\mathrm{edge}},m_{\mathrm{seg}},w_{s,t})

其中 (w_{s,t}) 是随空间和时间变化的控制权重。

这一步非常重要,因为它首次将“我要生成什么”与“哪些区域必须服从哪些物理或几何条件”分离开来。

2.2 关键技术贡献

Transfer1 使用类似 ControlNet 的分支设计:主生成模型保持冻结,各模态控制分支可以独立训练,然后在推理时组合。控制分支通过零初始化输出接入主干,从而尽量避免破坏预训练生成能力。(ar5iv)

它最有价值的设计不是“支持四种条件”,而是可组合性:

  • 新模态不必重新训练整个基础模型;
  • 各个控制分支能够单独开发;
  • 推理阶段可以动态组合条件;
  • 前景可强调分割约束,背景可强调深度或边缘约束;
  • 可以通过权重调节“严格遵循结构”和“保留生成多样性”之间的平衡。

论文构建 TransferBench,并在机器人、自动驾驶和人类活动数据上评估条件对齐、图像质量与多样性,同时展示 Sim2Real 和自动驾驶数据增强。(ar5iv)

2.3 需要谨慎解读的地方

论文展示了使用 GB200 NVL72 机架,在约 4.2 秒内生成 5 秒视频的“实时”结果。这个结果证明模型可以通过推理扩展获得很高吞吐,但它是机架级实时,并非单机器人、单车辆设备上的低延迟实时;单卡推理仍明显较慢。(arXiv)

更根本的问题是,控制权重 (w_{s,t}) 多数仍来自人工规则、启发式方法或视觉语言模型,而不是从最终任务收益中学习。例如,生成训练数据时究竟应当多严格地遵循深度,才能让机器人策略学得最好,目前并没有被端到端优化。

因此 Transfer1 的局限可以概括为:

它解决了“怎样控制生成器”,但没有解决“为了下游策略成功,生成器应当接受何种程度的控制”。


3. Cosmos-Reason1:生成路线之外出现的“物理认知分支”

3.1 为什么这一篇看起来与前两篇很不一样

Reason1 不再主要生成视频,而是回答:

  • 视频中的事件是否违反物理规律?
  • 某动作是否可执行?
  • 任务是否已经完成?
  • 下一步合理动作是什么?
  • 某个动作将造成什么后果?

这反映出团队意识到:仅学习像素转移分布并不能自动产生可解释的物理认知。一个模型可能擅长生成“杯子掉落”的画面,却未必能稳定判断杯子为何掉落、是否会破碎,以及机器人应不应该伸手抓取。

Reason1 为此构建了空间、时间和基础物理的分层本体,并为具身推理定义“复杂感知、行动效果预测、物理约束、从交互中学习”等能力。论文明确表示当前只重点研究前三项,把“从交互中学习”留给未来。(arXiv)

3.2 核心贡献不只是长思维链

第一项贡献是问题定义和能力分类。空间、时间、因果、物体恒存、力学、热力学、反物理现象等被纳入统一评估体系,使“物理推理”不再只是模糊概念。(ar5iv)

第二项贡献是Physical AI 专用训练数据闭环。模型经历通用视觉预训练、通用 SFT、Physical AI SFT 和 Physical AI RL,并利用视频、自动生成问答、推理轨迹以及合成物理环境形成训练数据。(ar5iv)

第三项贡献是验证长推理与后训练确实能改善物理任务。论文报告 Physical AI RL 在综合具身推理评估中带来明显提升,并在时间箭头、空间谜题、物体恒存等直觉物理任务上优于基础模型。(ar5iv)

版本命名上存在一个小差异:arXiv 摘要仍将小模型称为 7B,而最新版正文和实验表中多处使用 8B;理解技术路线时可将其统一视为“小规模 Reason1”和 56B 大模型。(arXiv)

3.3 最关键的不足:奖励与真实行动后果错位

Reason1 的 RL 主要使用选择题,准确率奖励通过字符串匹配获得,格式奖励则检查 <think> 和 <answer> 标签。这样的奖励非常容易验证,也适合大规模 RL,但它优化的是:

[ \text{答对选择题并输出正确格式} ]

而 Physical AI 真正需要优化的是:

[ \text{动作是否安全、可执行,并最终完成任务} ]

两者之间仍存在明显距离。(ar5iv)

同时,Reason1 的“下一步动作”主要以自然语言输出,而不是机器人关节轨迹、车辆控制量或位姿变化。因此,它更像一个具身任务分析器或高层规划器,还不是原生策略模型。

这构成了此后 Cosmos 系列必须解决的第二个断裂:

Reason1 知道“应该做什么”,Predict/Transfer 知道“世界可能怎样变化”,但二者尚未在一个可执行的闭环中联合学习。


4. Cosmos-Predict2.5 与 Transfer2.5:生成分支和推理分支首次重新汇合

4.1 Predict2.5 的核心不是简单升级画质

Predict2.5 使用基于 flow 的架构,将 Text2World、Image2World 和 Video2World 合并进单一模型,并直接使用 Cosmos-Reason1 作为文本编码器。它在约两亿段筛选视频上训练,并结合模型合并与强化学习后训练,发布 2B 和 14B 版本。(arXiv)

这是整个系列第一次明确把 Reason1 的物理语义表示接入生成模型:

hphysical=Reason1⁡(text,context)h_{\mathrm{physical}} =\operatorname{Reason1}(text,context) xfuture=Predict2.5⁡(xcontext,hphysical)x_{\mathrm{future}} =\operatorname{Predict2.5}(x_{\mathrm{context}},h_{\mathrm{physical}})

相较于普通文本编码器,Reason1 理论上能够为“物体将怎样运动”“什么变化符合物理约束”“用户究竟要求哪种未来”提供更丰富的条件表示。

同时,将三类生成模式合并意味着模型不再需要为纯文本生成、首帧续写和视频续写维护彼此割裂的系统。这使不同任务之间可以共享运动规律和视觉先验。(arXiv)

4.2 Transfer2.5 如何承接 Transfer1

Transfer2.5 保留自适应多模态控制的总体思想,但不再把四个控制块连续堆在网络开头,而是将它们分散插入主干网络,每七个主干块插入一个控制块。这样,控制信息可以在生成过程的不同抽象层级逐渐注入。(NVIDIA)

官方结果显示,Transfer2.5-2B 相比 Transfer1-7B:

  • 参数规模约小 3.5 倍;
  • 提示和物理条件对齐更好;
  • 长视频中的幻觉与误差累积更少;
  • 多控制输入的综合质量更高。(NVIDIA)

这表明改进主要来自更好的基础模型、条件注入位置和训练方法,而不只是参数规模扩张。

4.3 为什么它仍不是彻底统一

Predict2.5 中的 Reason1 主要作为文本编码器和语义条件提供者。换言之,推理过程影响视频生成,但视频生成过程中产生的新信息并不会自然回流,让 Reason1 在同一次计算中重新修正自己的判断。

其耦合方式更接近:

先理解提示,再生成世界。

而不完全是:

一边模拟未来,一边检查模拟结果,一边修订推理与动作。

此外,Predict2.5 虽然展示机器人动作条件生成、策略学习和闭环仿真应用,但大量基础评估仍然依赖 FVD、FID、VQA 对齐和视觉质量等代理指标。视觉指标与“策略排序是否正确”“危险事件概率是否校准”之间未必具有稳定相关性。

所以,Predict2.5 是第一次真正的融合,但仍属于推理增强的世界生成器,还不是完整的世界—行动模型。


5. Cosmos 3:从“生成未来视频”迈向“联合建模世界与行动”

5.1 最重要的变化:动作成为一级模态

Cosmos 3 将语言、图像、视频、音频和动作放入统一的 token 序列,并明确把动作视为核心模态,而不是附加条件。不同机器人、车辆、相机和人类动作被映射到一个共享动作接口;位姿变化通常表示为相对变换,以减少对具体底层控制器的依赖。(ar5iv)

从理论上看,它把此前相互分离的三类模型统一了:

正向动力学:

[ p(x_{t+1}\mid x_t,a_t) ]

给定当前视觉状态和动作,预测世界如何变化。

逆向动力学:

[ p(a_t\mid x_t,x_{t+1}) ]

给定状态变化,推断造成变化的动作。

策略模式:

[ p(a_t,x_{t+1}\mid x_{\leq t},g) ]

联合生成动作以及该动作预计产生的视觉后果。(ar5iv)

这个设计非常有意义,因为一个动作不再只是抽象数值,而是与它将造成的未来视觉状态共同建模。策略因此可以在生成动作的同时“想象”其后果。

5.2 Mixture-of-Transformers 的真正含义

Cosmos 3 使用 MoT 架构,在同一序列中包含:

  • 自回归子序列:负责语言和推理;
  • 扩散子序列:负责图像、视频、音频和动作生成。

二者使用独立的归一化、MLP 和注意力投影参数,但在共享注意力机制中交互。扩散 token 可以关注推理上下文,而推理 token 仍保持因果自回归。(ar5iv)

因此,“统一”需要准确理解:

Cosmos 3 不是让所有模态完全使用相同参数和相同生成目标,而是在统一 token 空间和共享注意力中,保留推理塔与生成塔的专业化。

这种设计比简单共享一个 Transformer 更现实,因为语言离散自回归与视觉连续去噪的统计性质不同;但它也意味着统一仍然是结构化的专家耦合,而非完全同质的通用 token 模型。

5.3 从前四篇继承了什么

Cosmos 3 几乎逐项吸收了前期成果:

  • 从 Cosmos 1 继承世界模型、视频 tokenizer 和大规模数据平台;
  • 从 Transfer 系列继承控制视频到 RGB 视频的转换能力;
  • 从 Reason1 继承视觉语言推理和具身行为规划;
  • 从 Predict2.5 继承多种生成任务共模;
  • 最终加入动作 token,把预测、逆动力学和策略学习统一起来。

论文在新具身适配实验中显示,使用多任务动作中期训练初始化的 Cosmos3-Nano,在 LIBERO-10 上适配速度明显快于普通预训练初始化;2000 次迭代后两者分别达到 97.4% 和 95.2%,更显著的差距出现在早期适配阶段。(ar5iv)

论文还专门研究不同动作域之间的协同和干扰,发现车辆、相机、机器人操作和人类第一视角动作有时能共享运动和几何先验,但某些混合也会稀释目标域监督。(ar5iv)

5.4 Cosmos 3 的深层局限

第一,架构中的信息流仍有一定不对称性。扩散生成塔可以访问推理上下文,但自回归推理塔在同一次前向过程中保持自包含,不能直接“看到”尚在去噪的未来结果。因此它更擅长“推理指导生成”,而不是完整的“生成结果反过来修正推理”。(ar5iv)

第二,所谓统一动作空间仍依赖域特定投影。相对位姿和伪动作可以屏蔽 PID、关节控制器等底层细节,但也可能丢失力、柔顺性、接触状态和动力学差异。对于软体机器人、灵巧手、腿式机器人等,仅凭位姿变化可能不足以建立真正通用的动作语义。(ar5iv)

第三,大量视频生成能力仍建立在冻结 VAE 上。视觉压缩中的不可逆信息损失,例如细小接触、微弱形变、触觉相关状态,可能成为动作学习的上限。

第四,论文已经观察到动作数据的正迁移与负迁移并存。这意味着“更多动作域联合训练”并不必然产生更通用的策略,数据配比本身将成为类似语言模型混合配方一样的重要研究问题。(ar5iv)


四、五篇论文之间最本质的发展关系

1. 从隐式条件到显式条件

Cosmos 1 中,文本和历史视频以较宽松的方式约束未来;Transfer1 将几何、语义和结构约束显式化。

这标志着模型从:

“生成一个看起来合理的未来”

转向:

“在指定几何和语义边界内生成未来”。


2. 从像素规律到物理语义

Reason1 是一次重要的路线分叉。它承认仅通过视频生成损失,很难学会可解释的:

  • 因果判断;
  • 行动可供性;
  • 任务完成判定;
  • 物体恒存;
  • 物理违规检测。

它为世界模型增加了一个语言化、可监督、可强化学习的认知层。


3. 从两个独立模型到语义条件化世界模型

Predict2.5 使用 Reason1 作为文本编码器,说明团队开始把“理解世界”和“生成世界”接起来。

但该阶段仍是串行关系:

[ \text{Reasoner}\rightarrow\text{Generator} ]

还不是:

[ \text{Reasoner}\leftrightarrow\text{Generator} \leftrightarrow\text{Policy} ]


4. 从外部动作条件到原生动作 token

Cosmos 1 和 Predict2.5 可以用动作作为条件预测视频,但动作仍是模型外部输入。Cosmos 3 则能够直接生成动作 token,并与未来视频联合去噪。

这是系列中最具质变意义的一步:世界模型不再只是供策略调用的模拟器,它本身开始承担策略模型、动力学模型和逆动力学模型的角色。


5. 从模块平台到“统一但专业化”的架构

整个系列并未走向完全单一化,而是形成一种更务实的统一:

  • 共享 token 序列和注意力;
  • 保留模态编码器;
  • 保留推理与生成的独立参数塔;
  • 通过统一训练任务建立跨模态迁移。

这说明 Cosmos 路线对“通用模型”的理解不是所有模态强行共享参数,而是:

共享因果上下文与世界表示,同时允许不同计算机制保留专业性。


五、如何评价这些工作的真实贡献

真正形成方法学突破的部分

第一,平台级数据和模型基础设施。 Cosmos 1 把世界模型从单篇视频生成论文提升为可后训练、可部署、可扩展的平台。

第二,Transfer 的时空条件分配机制。 它提供了一个非常实用的 Sim2Real 接口,让廉价仿真几何可以转化为逼真的训练视频。

第三,Reason1 的能力本体和 Physical AI 后训练流程。 其价值不仅是模型分数,还在于重新定义了物理推理的训练和评估对象。

第四,Predict2.5 的多任务统一与推理接入。 这让世界生成不再是若干互不兼容的模型集合。

第五,Cosmos 3 的动作 token 与三种动作建模模式。 这是从世界生成模型走向世界—行动基础模型的关键结构变化。

仍应谨慎看待的部分

视频质量提升不能直接证明物理真实性。 FVD、FID 和文本对齐高,并不保证碰撞、摩擦、遮挡状态和动作后果正确。

“实时”依赖极大计算资源。 机架级吞吐与机器人控制环中的低延迟不是同一个概念。

语言思维链不等于真实物理推理。 MCQ 奖励可能提高测试正确率,但未必建立可用于连续控制的内部因果模型。

统一模态不等于统一因果表征。 Cosmos 3 已统一接口,但不同模态和动作域是否真的共享同一套可迁移物理概念,仍需更严格验证。


六、未来最有意义的研究方向

1. 从“视频逼真度”转向“干预下的因果正确性”

未来评估不应只询问生成视频是否像真实视频,而应询问:

  • 相同初始状态下改变动作,结果是否随之合理变化?
  • 不改变动作只改变无关背景,动力学结果是否保持稳定?
  • 模型是否能正确预测多个可能结果的概率?
  • 低概率危险事件是否被系统性低估?

应建立成对或成组的干预数据:

[ (x_t,a_t^{(1)},x_{t+1}^{(1)}),\quad (x_t,a_t^{(2)},x_{t+1}^{(2)}) ]

并使用接触事件准确率、状态变化误差、反事实排序、概率校准误差等指标,而非仅依赖视觉距离。


2. 建立与闭环策略价值一致的世界模型指标

世界模型真正重要的标准不是“生成视频有多美”,而是:

使用该模型选择出的策略,在真实世界中是否仍然更优。

可以对若干候选策略分别在世界模型和真实环境中评估,测量:

  • 策略排名相关性;
  • 预期回报误差;
  • 安全违规概率误差;
  • Model Predictive Control 的真实成功率;
  • 世界模型导致的 policy regret。

这是验证世界模型能否用于规划和策略评估的核心闭环。


3. 将 Reason1 的奖励从选择题升级为轨迹结果奖励

Reason1 的下一步应当是让推理过程受到真实行动结果监督,而不是只受答案字符串监督。

可联合使用:

  • 任务成功奖励;
  • 碰撞与安全惩罚;
  • 动作可执行性验证器;
  • 仿真器中的物理约束检查;
  • 多步计划完成率;
  • 预测结果与真实 rollout 的一致性。

最终优化目标应从“说出正确动作”变为:

[ \max_\pi \mathbb E\left[ R(\tau) -\lambda C_{\mathrm{safety}}(\tau) \right] ]

其中推理 token、动作 token 和未来视觉 token 共同接受轨迹级信用分配。


4. 引入显式、持久的世界状态和长程记忆

视频潜变量擅长表示外观,但不一定稳定保存:

  • 被遮挡物体的位置;
  • 容器内部状态;
  • 某个开关此前是否被打开;
  • 物体所有权和任务进度;
  • 长时间尺度的因果变量。

值得研究的方向是将 Cosmos 3 的连续视频 token 与显式对象状态结合:

[ z_t = {z_t^{\mathrm{video}}, z_t^{\mathrm{object}}, z_t^{\mathrm{geometry}}, z_t^{\mathrm{contact}}, z_t^{\mathrm{memory}}} ]

视频生成负责高维观测,结构化状态负责物体恒存、规划和误差修正。评估时间跨度也应从几秒扩展到数分钟乃至完整任务。


5. 让 Transfer 的控制图从人工加权变为任务驱动学习

目前控制权重主要用于平衡视觉质量与条件一致性。更有意义的问题是:

哪些区域、哪些时刻、哪些模态必须被精确控制,才能最大化下游策略学习效果?

可以使用双层优化:

  • 内层:根据控制图生成合成数据并训练策略;
  • 外层:根据真实或高保真环境中的策略成功率更新控制图生成器。

这样,模型可能自动发现:

  • 抓取接触区域需要极高深度精度;
  • 背景纹理应保持多样性;
  • 行驶边界和行人区域需要高分割一致性;
  • 与任务无关区域可以放宽约束以增加域随机化。

6. 构建真正跨具身的动作表示

相对位姿是一个强而实用的起点,但不足以覆盖所有动力学。未来统一动作空间应同时表示:

  • 几何运动意图;
  • 力和力矩;
  • 接触模式;
  • 柔顺性与阻抗;
  • 执行时间尺度;
  • 机器人形态与可达域;
  • 动作不确定性。

一个可能方向是:

[ a_t = (a_t^{\mathrm{intent}}, a_t^{\mathrm{geometry}}, a_t^{\mathrm{contact}}, a_t^{\mathrm{dynamics}}, e_{\mathrm{embodiment}}) ]

其中 (e_{\mathrm{embodiment}}) 描述机器人形态。评估重点应是从未见过的机器人结构上进行零样本或少样本动作迁移,而不仅是同类型机器人数据集间迁移。


7. 系统研究多动作域训练中的正迁移与负迁移

Cosmos 3 已经证明动作数据混合既可能提升目标域,也可能造成干扰。下一步应将数据混合从固定比例升级为动态课程:

  • 根据梯度冲突调整采样比例;
  • 根据目标域验证回报选择辅助域;
  • 使用稀疏专家隔离冲突动力学;
  • 在共享几何先验和域特定控制规律之间分层;
  • 根据训练阶段改变人类、车辆和机器人数据权重。

这很可能成为 Physical AI 领域的“数据配方科学”,其重要性不低于模型结构本身。


8. 为世界模型引入可校准的不确定性和安全边界

世界模型最危险的失败不是生成明显错误的视频,而是:

生成一个非常可信、但对关键风险判断错误的未来。

未来系统应输出多模态未来分布,并区分:

  • 环境本身的随机性;
  • 模型缺少知识造成的不确定性;
  • 输入超出训练分布;
  • 不同动作结果之间的置信区间。

当不确定性过高时,策略应选择保守动作、调用更高保真模拟器或请求真实观测,而不是继续依赖单一生成轨迹。


9. 提升推理与生成之间的双向交互

Cosmos 3 当前主要由推理上下文指导扩散生成。下一代架构可以引入迭代循环:

  1. 推理器提出动作和预期结果;
  2. 生成器模拟若干未来;
  3. 视觉验证器检测物理矛盾与风险;
  4. 推理器根据模拟结果修订计划;
  5. 再次生成并比较候选轨迹。

这比一次性 Chain-of-Thought 更接近人类使用“心理模拟”解决物理任务的过程,也更适合长程规划。


七、一个最值得推进的具体研究项目

“因果校准的全模态世界—行动模型”

我认为沿 Cosmos 路线,最有价值的下一篇工作不应只是 Cosmos 4 的更大参数版本,而应围绕下面的问题展开:

世界模型能否准确预测不同干预的相对结果,并知道自己何时不可靠?

模型设计

在 Cosmos 3 的 MoT 上增加:

  • 对象中心潜在状态;
  • 几何和接触 token;
  • 显式不确定性预测头;
  • 推理—模拟—验证循环;
  • 具身形态条件化动作解码器。

训练目标

同时优化:

[ L = L_{\mathrm{video}} +\lambda_1L_{\mathrm{forward}} +\lambda_2L_{\mathrm{inverse}} +\lambda_3L_{\mathrm{cycle}} +\lambda_4L_{\mathrm{counterfactual}} +\lambda_5L_{\mathrm{calibration}} +\lambda_6L_{\mathrm{return}} ]

其中:

  • (L_{\mathrm{forward}}):动作到未来;
  • (L_{\mathrm{inverse}}):状态变化到动作;
  • (L_{\mathrm{cycle}}):正逆动力学一致性;
  • (L_{\mathrm{counterfactual}}):动作干预的相对结果;
  • (L_{\mathrm{calibration}}):概率与真实频率一致;
  • (L_{\mathrm{return}}):模拟预测与真实任务回报一致。

关键评估

不再以视觉指标为主,而报告:

  • 反事实行动排序准确率;
  • 策略排名与真实排名的相关系数;
  • 接触和碰撞事件误差;
  • 长程状态保持率;
  • 不确定性校准;
  • 新具身少样本适配效率;
  • 基于世界模型规划产生的真实 policy regret。

这一工作会直接回答 Cosmos 系列当前最重要、但尚未完全回答的问题:

它生成的是“可信的视频”,还是“可用于决策的可信世界”?


八、最终判断

Cosmos 系列最值得肯定的地方,是它逐渐摆脱了“视频生成模型用于机器人”的简单叙事,形成了更加完整的技术结构:

[ \text{感知} \rightarrow \text{物理理解} \rightarrow \text{未来模拟} \rightarrow \text{动作生成} \rightarrow \text{结果反馈} ]

其中:

  • Cosmos 1 完成了感知数据与未来模拟的平台化;
  • Transfer1 建立了结构控制接口;
  • Reason1 建立了物理语义和高层决策接口;
  • Predict2.5 将语义推理重新接入统一世界生成;
  • Cosmos 3 则首次把动作、世界变化与推理放入统一模型。

但距离真正可靠的 Physical AI 仍有三个决定性缺口:

  1. 生成概率是否等同于真实物理概率;
  2. 视频指标是否能够预测真实策略表现;
  3. 跨模态统一是否真的形成了跨具身、可干预的因果世界表示。

因此,这条路线未来最重要的竞争不再是“谁能生成更逼真的机器人视频”,而是:

谁能建立一个经得起干预、闭环控制和安全验证的世界模型,并让智能体在其中学到能够迁移到真实世界的行动。

这条研究线更新非常快;也可以设置每月一次的 Cosmos、世界模型与 Physical AI 新论文及开源模型追踪摘要。