HomeAINVIDIA Cosmos 3 Edge 以 15 Hz 频率本地运行机器人,无需云端支持

NVIDIA Cosmos 3 Edge 以 15 Hz 频率本地运行机器人,无需云端支持

NVIDIA 已发布 Cosmos 3 Edge,这是一款拥有 40 亿参数的开放世界模型,旨在将数据中心级别的 AI 推理能力直接带到在工厂、仓库、医院等场景中运行的机器人和边缘设备上。该模型现已在 Hugging Face 上提供,可帮助机器人和视觉 AI 代理理解其周围环境、进行实时推理并生成物理动作——而无需将计算回传到云端。

要点速览

  • Cosmos 3 Edge 是由 NVIDIA 在 Hugging Face 上发布的、面向边缘设备机器人和视觉 AI 的40 亿参数开放世界模型
  • 它在 NVIDIA Jetson Thor 上可实现 15 Hz 的实时机器人控制,每次推理可生成 32 个动作
  • 该模型结合了两个 Transformer 塔——自回归塔和扩散塔——共享多模态注意力层,以实现统一的推理与动作生成。
  • 在 40 亿参数模型中,它在视觉分析基准 VANTAGE-Bench 排名第 1,并在机器人策略学习方面处于领先地位。
  • 专用策略模型 Cosmos 3 Edge Policy (DROID) 面向机器人抓取与放置任务提供,可在 H100 或 NVIDIA DGX 集群上进行微调。

NVIDIA 推出 Cosmos 3 Edge,将机器人与视觉 AI 带到边缘侧

部署在边缘侧的机器所面临的核心挑战始终如一:内存受限、算力有限,但现实世界的需求却不会放缓。Cosmos 3 Edge 是 NVIDIA 对这一缺口的回应。根据 NVIDIA 开发者布道师 Pranjali Joshi 的介绍,该模型针对广泛的 NVIDIA 边缘硬件进行了内存高效、高吞吐推理优化——包括新近发布的 NVIDIA Jetson T2000 和 T3000 模块、NVIDIA Jetson Thor、NVIDIA RTX PRO GPU、NVIDIA DGX 以及 NVIDIA GeForce RTX GPU。

这种广泛的硬件兼容性至关重要。大多数边缘 AI 部署受限的并非愿景,而是本地硬件实际能运行什么。一个既能覆盖紧凑型 Jetson 模块又能扩展到完整 DGX 系统的模型,为开发者提供了一个可跨广泛部署范围使用的统一框架。

真正重要的实时性能指标

NVIDIA 提供的性能数据颇为亮眼。在 NVIDIA Jetson Thor 上,Cosmos 3 Edge 在保持 15 Hz 实时机器人控制的同时,每次推理可生成 32 个动作。对于机器人应用而言,平滑运动与卡顿失败之间的差异往往取决于推理延迟,在边缘模块上达到 15 Hz 是一个具有实际意义的门槛。在 40 亿参数模型中,它在视觉分析基准 VANTAGE-Bench 上排名第一,并在机器人策略学习方面声称达到业界最先进性能

创新模型架构:双 Transformer 塔,共享表示

将 Cosmos 3 Edge 与标准视觉-语言模型区分开来的,是其双塔式 Transformer 架构。该模型结合了一个自回归塔和一个扩散塔,各自处理不同模态,但共享多模态注意力层,用于对齐语言、视频、音频和动作数据之间的信息。

自回归塔处理视觉和文本 token,用于理解与推理。扩散塔处理视觉、音频和动作 token,用于预测、生成以及 NVIDIA 所称的神经模拟。两个塔各自保留独立的归一化层和多层感知机,但共享的注意力层则是集成发生的地方——迫使模型在决定下一步动作之前,先构建出对场景的单一连贯表征。

用于物理动作的共享几何向量表示

在技术上更具特色的一点,是模型如何在不同机器人形态之间处理物理动作。机械臂的运动方式与轮式载具或摄影机云台不同,而大多数模型会将这些视为相互独立的问题。Cosmos 3 Edge 将它们全部映射到一个共享的紧凑几何向量表示中——以一种在不同形态之间保持一致的方式编码动作中的空间关系与控制输入。

这种设计在像素级视觉变化与物理运动之间建立了直接联系。生成的视频不再只是视觉预测,而是对世界如何因特定动作而发生变化的表征。对于构建训练流水线的开发者而言,这意味着合成数据是以运动、因果与控制为基础的,而不仅仅是视觉外观。

应用与扩展:策略模型与开发者工具

除了基础模型之外,NVIDIA 还发布了 Cosmos 3 Edge Policy (DROID)——一款在 DROID 数据集上进行后训练的机器人操作策略模型,面向抓取与放置任务。它随附后训练脚本一起提供,为开发者将模型适配到自身操作流程提供了一个具体的起点。

后训练、自定义与开发者资源

希望更进一步的开发者可以在一小组 H100 GPU 或 NVIDIA DGX Station 上对 Cosmos 3 Edge 进行微调。NVIDIA 还会与基础模型权重一同发布参考后训练检查点和训练配方,其中包括一个 Cosmos 3 Super 4-Step Distillation 检查点,可将扩散推理从 35–50 个去噪步骤减少到仅 4 个,在不牺牲输出保真度的前提下,为图像与视频生成任务带来最高达 25 倍的推理加速。

更广泛的生态布局同样值得关注。通过同时发布开放权重、训练脚本和参考检查点,NVIDIA 将 Cosmos 3 Edge 定位为不仅仅是一个独立模型,而是面向特定领域自适应世界模型的基础。开发者可以使用专业数据对其进行后训练、为速度进行蒸馏,或直接按原样部署——这一切都在 Hugging Face 上提供的同一开放框架内完成。

基准领先与未来规划

NVIDIA 在 VANTAGE-Bench 上的排名,使 Cosmos 3 Edge 在同级别参数量的视觉分析任务中位居前列,而其在机器人策略学习方面的表现,则在一个大多数边缘模型要么侧重视觉理解、要么侧重控制、而非同时兼顾两者的领域中增加了竞争砝码。

展望未来,NVIDIA 已规划将 Cosmos 3 推进到其所谓的 Physical AI 方向,后续改进将涵盖交互式世界生成、驾驶场景模拟以及更广泛的机器人策略。路线图还包括使用 vLLM 等开放推理框架对 Cosmos 3 检查点进行优化、在更广泛硬件上实现更快的后训练,以及提供更多开发者工具。

这一方向所传递的信号,已超越单一模型发布本身。随着边缘硬件能力不断提升、机器人部署在工业环境中持续扩张,对紧凑、可部署的世界模型的需求只会愈发强烈。一个能够在边缘侧以 15 Hz 频率进行因果推理、模拟物理后果并生成控制动作的模型,开始更像是生产基础设施,而不仅仅是研究里程碑。

常见问题

什么是 NVIDIA Cosmos 3 Edge?

Cosmos 3 Edge 是 NVIDIA 发布的一款拥有 40 亿参数的开放世界模型,使机器人和视觉 AI 代理能够在边缘设备上实时理解其周围环境、进行推理并生成物理动作。

Cosmos 3 Edge 支持在哪些硬件上进行推理?

该模型支持在广泛的 NVIDIA 边缘硬件上进行内存高效、高吞吐推理,包括 NVIDIA Jetson T2000、T3000 和 Thor 模块、NVIDIA RTX PRO GPU、NVIDIA DGX 以及 NVIDIA GeForce RTX GPU。

Cosmos 3 Edge 如何实现实时机器人控制?

在 NVIDIA Jetson Thor 上,该模型每次推理可生成 32 个动作,并以 15 Hz 频率维持机器人控制,从而在无需依赖云端计算的情况下实现实时推理与物理控制。

开发者能否根据自身用例自定义 Cosmos 3 Edge?

可以。开发者可以使用一小组 H100 GPU 或 NVIDIA DGX Station 对模型进行微调,NVIDIA 还提供参考后训练检查点和训练配方,帮助将模型适配到自定义工作负载和专业应用中。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”什么是 NVIDIA Cosmos 3 Edge?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Cosmos 3 Edge 是 NVIDIA 发布的一款拥有 40 亿参数的开放世界模型,使机器人和视觉 AI 代理能够在边缘设备上实时理解其周围环境、进行推理并生成物理动作。”}},{“@type”:”Question”,”name”:”Cosmos 3 Edge 支持在哪些硬件上进行推理?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”该模型支持在广泛的 NVIDIA 边缘硬件上进行内存高效、高吞吐推理,包括 NVIDIA Jetson T2000、T3000 和 Thor 模块、NVIDIA RTX PRO GPU、NVIDIA DGX 以及 NVIDIA GeForce RTX GPU。”}},{“@type”:”Question”,”name”:”Cosmos 3 Edge 如何实现实时机器人控制?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”在 NVIDIA Jetson Thor 上,该模型每次推理可生成 32 个动作,并以 15 Hz 频率维持机器人控制,从而在无需依赖云端计算的情况下实现实时推理与物理控制。”}},{“@type”:”Question”,”name”:”开发者能否根据自身用例自定义 Cosmos 3 Edge?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”可以。开发者可以使用一小组 H100 GPU 或 NVIDIA DGX Station 对模型进行微调,NVIDIA 还提供参考后训练检查点和训练配方,帮助将模型适配到自定义工作负载和专业应用中。”}}]}

本文由人工智能协助生成,并由编辑团队进行审核。

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST