宇宙3边引入

作者:袖梨 2026-07-21
普兰贾利·乔希的化身 NVIDIA的虚构

真实的世界是广阔的,在其中操作物理AI系统需要了解一个场景是如何变化的,预测接下来会发生什么,并确定一个行动将如何影响世界.

机器在工厂,仓库,医院等边缘运作. 要了解这些环境并采取行动,它们需要提供数据中心的模型-在内存受约束的系统中的一级性能。

今天,我们将释放NVIDIA Cosmos 3 Edge 在Hugging Face上的Cosmos 3存储器。 它是一个40亿参数的开放世界模型,帮助机器人和视觉AI特工了解他们的周围环境,实时理性,并在边缘设备上产生机器人动作.

下载模式:https://huggingface.co/nvidia/宇宙3-Edge

该模型通过NVIDIA边缘计算机,包括NVIDIA RTX PRO GPU,NVIDIA DGX,NVIDIA GeForce RTXTM GPU,NVIDIA Jetson,包括新公布的Jetson T2000和T3000模块,提供内存高效的高通量推论.

设计为紧凑的开放型号,可用作小型视觉语言型号(VLM),具有最佳级吞吐量,精度可实时推论.

作为训练后的世界行动模型(WAM),宇宙3边缘以机器人控制分辨率(640×360观测)运行,提供实时推理,并在NVIDIA Jetson Thor的推论上生成32个动作——同时在15Hz实现实时控制.

在类似大小(4B参数)模型中,Cosmos 3 Edge在VANTAGE-Bench上排名#1,用于视觉分析,以及机器人政策学习的先进技术,为智能基础设施和机器人设定了艺术状态.

世界模特儿是什么?

一个世界模型学习一个环境如何随时间而变化。 它代表物体,运动,空间关系,和行动的效果.

考虑一个机器人到达一个物体。 认识物体只是第一步。 机器人还必须了解物体的位置,它的钳子是如何移动的,接触发生时会发生什么,以及哪些动作最有可能成功完成任务.

一个世界模型帮助机器人解释这些关系. 它可以预测一个动作的视觉结果,推断引起变化的动作,或者产生一个动作来产生预期的结果.

Cosmos 3 Edge将这些能力汇集在一个模型中,在探测器上. 其共享的表示使物理AI系统能够了解当前的世界状态,模拟可能的未来,并将这些未来与行动联系起来.

两个变形塔,一个共用代表

Cosmos 3结合了两个变压器塔:

  • 自动回转塔:用于理解和推理的处理视觉和文本符号.
  • 散射塔:用于预测,生成,神经模拟的过程视觉,音频,和行动符号.

两座塔台分别维持了正常化层和多层感官. 它们共享多模式关注层,使信息在语言、视频、音频和行动中保持一致。

这种设计允许模型在生成输出前对一个场景进行推理. 视任务而定,Cosmos 3可以从自递式塔产生推理符号,也可以从扩散式塔产生去声的视频和动作符号.

关注模式也适应于每一种信息. 语言使用因果注意,即每个符符都注意它之前的符符. 传播信使更广泛地关注现有情况,支持一致的预测和生成。

这些组成部分共同使模型能够共同反映正在发生的情况、今后可能发生的情况以及行动如何影响结果。

共同代表行动

物理系统对动作的描述不同. 车辆可能通过自我姿态和行动来代表一种行动。 相机使用相机运动. 机器人手臂使用其末端效应器的姿势,而手或抓手也需要代表抓取状态.

Cosmos 3将这些不同的化身描绘成共同的动作表现.

动作编码为紧凑的几何向量,可以捕捉:

  • 操纵状态

这就形成了控制与世界视觉结构之间的直接联系. 该模型可以将像素的变化与物理运动,空间关系,以及控制输入联系起来.

因此,生成的视频变得不仅仅是视觉预测. 它能够代表世界将如何因应某项行动而改变。 这使开发人员在运动、控制以及因果基础上培训数据。

政策模式

作为一项政策,Cosmos 3预测一项行动及其预期的视觉后果.

该模型可以生成系统应该做的,模拟接下来可能发生的事情. 这直接将世界建模与机器人政策培训和评价联系起来.

目前状态、行动和视觉后果。

这些模式使一种模式能够学习因果和政策。 动作可以双向流经模型,使得宇宙3边缘可以预测动作的效果或者从效果推断动作.

机器人手臂捡起香蕉

提示:拿起香蕉放进盘子里.

我们还在发布Cosmos 3 Edge Policy(DROID):一个机器人操纵政策,在DROID数据集上经过培训,用于选址任务,并附有培训后的脚本.

开发者在部署到NVIDIA边缘和加速计算平台之前,可以使用H100或NVIDIA DGX站的一小组,高效地微调宇宙3边缘的目标工作量.

训练有素的样品,以改善业绩

除了这些基础模型之外,我们正在发布经过培训的参考检查站和培训食谱,以帮助开发人员调整和优化Cosmos 3,用于自己的应用.

Cosmos 3是一个开放的世界基础模型平台. 由于模型在经过培训后有高质量的、针对具体领域的数据,其准确性继续提高,用于专门应用。 宇宙是利用开放框架建立适合域的世界模型的起点。 后培训使开发者能够提高模型性能,同时保持输出质量. 为了展示这个工作流程,我们还发布了Cosmos 3 Super 4-Step Distillation检查点以及培训后的脚本,为64B模型提供了更快的参考执行,帮助开发者将Cosmos适应自己的领域,实现更好的下游性能.

Cosmos 3 Super 4-Step(Text-to-Image & Image-to-Video): 宇宙3 超级4-Step(Text-to-Image & Image-to-Video): 宇宙3 超级4-Step(Text-to-Image-Image-to-Video) 宇宙3 宇宙3 超级4-Step: 这些是分配匹配的检查点和脚本,它们将传播从35-50去诺步骤减少到4,在保持图像和视频质量及忠诚的同时,提供最多25x更快的推断。

这些例子可作为开发者可以借鉴的参考执行. 使用开放的训练脚本,可以后训练Cosmos 3 Edge用于定制机器人政策,也可以蒸馏Cosmos 3 Super用于更快的图像和视频生成,适合您的应用.

尝试宇宙三边

Cosmos 3 Edge通过共享的世界代表将理解,预测,模拟和动作联系起来. 开发者可以将其部署在更接近其传感器的设备上. 该模型可用作诱因器或动作生成器.

使用开放的宇宙框架来定制和专门化模型.

检查宇宙3:https://huggingface.co/collections/nvidia/宇宙3

我们继续推进Cosmos 3的物理AI, 即将改进互动世界代、驱动情景模拟和机器人政策。

我们还在投资于更快的推论和在范围更广的硬件上更有效的后培训,减少建设下游模型所需的时间和计算。

这包括优化Cosmos 3检查点,并开放推论和优化vLLM等框架,很快将有更多的优化和开发工具。

第1条中提到的模式

第1条所述的收款

相关文章

精彩推荐