HomeAI借助 Nemotron 3.5 Lightning,NVIDIA 代理式 AI 模型速度提升至 4 倍

借助 Nemotron 3.5 Lightning,NVIDIA 代理式 AI 模型速度提升至 4 倍

NVIDIA 正在通过推出 Nemotron 3.5 Lightning,进一步推进具备代理能力的 AI 模型。这是一款全新的开放模型,专门为如今由自主 AI 代理全天候处理的那类始终在线、高吞吐任务而构建。与此同时,公司还发布了 NeMo Switchyard,这是一款开源路由工具,旨在将每个 AI 请求发送给能够以最快、最低成本处理它的模型。这两项发布共同标志着 NVIDIA 最新一次尝试,让具备代理能力的 AI 系统不仅更智能,而且在大规模运行时真正高效。

要点速览

  • NVIDIA 发布了 Nemotron 3.5 Lightning,一款拥有300 亿参数的开放混合专家模型,专为高吞吐的代理型 AI 工作负载打造。
  • 该模型相比同级别模型可提供最高快 4 倍的输出速度以及30% 更快的任务完成速度
  • NVIDIA 还推出了 NeMo Switchyard,一款开源路由库,可将任务完成成本降低到仅使用单一前沿模型的约三分之一
  • Nemotron 3.5 Lightning 可在本地运行于 NVIDIA RTX PCDGX SparkDGX StationJetson 上,或扩展至数据中心和云端。
  • 这两项发布均为开放且可定制,已获得包括 CrowdStrike、Harvey、CodeRabbit 和 Lila Sciences 在内的生态系统合作伙伴支持。

NVIDIA 推出 Nemotron 3.5 Lightning 以支持代理型 AI 工作负载

Nemotron 3.5 Lightning 是 NVIDIA Nemotron 3 家族的最新成员,公司将其描述为同级别中针对长时间运行代理任务最为高效的模型。它继 Nemotron 3 Nano 之后推出,并延续了 NVIDIA 在每次 Nemotron 发布中遵循的模式:优先考虑开放权重、可定制性和原始速度,而非单纯追求模型规模。

为速度而生的 300 亿参数模型

Nemotron 3.5 Lightning 是一款 300 亿参数的混合专家模型,这意味着它只激活网络中完成特定任务所需的部分,而不是每次都运行整个模型。这一设计选择直接体现在性能上:NVIDIA 表示,该模型可实现最高快 4 倍的输出速度,从而带来30% 更快的代理任务完成速度,相较于同尺寸级别的其他模型。根据 NVIDIA 引用的内部 PinchBench 基准测试,这些速度提升是在不牺牲相对于同类模型准确性的前提下实现的。

该模型被构建用于更大规模多代理系统中的特定角色。Nemotron 3.5 Lightning 并非试图独立规划整个工作流,而是旨在处理狭窄、重复且高吞吐的工作——这类工作在 AI 代理持续运行而非仅响应偶发提示时,会迅速堆积。

定制与后训练以实现领域特定的高准确率

由于 Nemotron 3.5 Lightning 是开放的,组织可以使用 NVIDIA NeMo 在其自身的领域数据、内部工具和工作流上对其进行后训练。这种开放的 AI 模型定制是 NVIDIA 对本次发布定位的核心:企业获得的不是一刀切的模型,而是一个可以针对特定工作进行塑形的基础,无论是解析法律合同还是标记安全告警。

已有多家公司正是这样做。CrowdStrike 正在为网络安全工作负载定制该模型,Harvey 正与 Trajectory 合作开发法律服务应用,而 CodeRabbit 将其与 Baseten 搭配用于自动化代码审查。Lila Sciences 使用它来提升在物理和生命科学任务中的推理能力,而 Fastino Labs 报告称,在针对软件开发、金融和医疗保健工作负载进行调优后,其准确率处于领先水平。NVIDIA 表示,该模型是在 Nemotron 联盟的参与下开发的,联盟成员贡献了评估方法、推理软件和数据集,帮助塑造了最终发布版本。

NeMo Switchyard 为 AI 代理带来智能路由

NeMo Switchyard 解决了一个随着代理型系统扩展而愈发严重的问题:依赖单一默认模型,要么在不需要复杂推理的任务上浪费资金,要么在让轻量模型承担过多任务时损害质量。NVIDIA 的答案是一款开源库,它会在每个请求层面自动决定由哪个模型来处理该任务。

通过动态模型选择降低成本

NeMo Switchyard 会将代理工作流中的每一步路由到对该特定任务最有能力且最具成本效益的模型,而无需开发者重写其应用。开发者可以根据自己最看重的是延迟、质量还是成本,对路由算法进行调优或替换。NVIDIA 的内部基准测试显示,这种 NeMo Switchyard 路由方式在保持接近前沿模型准确率的同时,将任务完成成本降低到将所有请求都交由 Opus 4.8 处理时的近三分之一。

这一差距意义重大。在代理持续运行的系统中,智能路由与默认使用单一模型之间的差异,会在每天成千上万的任务中迅速累积——将看似温和的效率提升,转化为随时间推移在运营成本上的实质性降低。

跨 AI 生态系统的集成

NVIDIA 已经在与广泛的合作伙伴合作,将这类路由能力直接引入开发者日常使用的工具中。来自该生态系统早期工作的结果展示了路由在成本和性能上的巨大影响:

  • Boomi 在将 59% 的流量发送至一个快 5 倍的微调模型的同时,实现了 100% 的领域路由准确率,将后续轮次延迟降低了 21%。
  • Cognition 将分阶段路由器集成到 Devin Desktop 中,相比将所有请求路由到单一前沿模型,平均成本降低了 28%。
  • LangChain 在 145 个多轮 Deep Agents 任务中,将仅 7% 的调用发送至前沿模型,在牺牲 6% 准确率的前提下,将成本降低了 74%。
  • Ramp 在 SWE-Bench 测试中,在匹配前沿模型性能的同时,将成本降低了 58%,运行时间缩短了 33%。
  • Classmethod 在其 opencode 和 Fireworks 工作负载中,在保持质量的同时实现了 27% 的成本降低。

Kong、LiteLLM、Nous Research、Cadence 和 Siemens 也在各自的平台中集成或基准测试 NeMo Switchyard,覆盖从 AI 网关到形式化芯片验证和工程代理等场景。

跨 NVIDIA 硬件的灵活部署

本次发布的一大卖点在于 Nemotron 3.5 Lightning 实际可以运行在哪里。它支持在本地和云端部署,覆盖 NVIDIA RTX PC、DGX Spark、DGX Station 和 Jetson 设备,让组织可以利用已有硬件,而不必将一切迁移到云端。在此基础上,它还能扩展到 RTX PRO 工作站、边缘设备、数据中心以及用于更大规模企业部署的完整云环境

这种灵活性为组织在隐私和延迟方面提供了真正的掌控力。在本地或本地部署模型,适用于需要快速响应和更严格数据控制的高吞吐、专业化任务,而云端部署则仍然适合需要按需扩展的工作负载。

开放数据与平台可用性

与每次 Nemotron 发布一样,NVIDIA 表示会在许可允许的范围内尽可能公开训练数据和技术,使外部研究人员能够对其进行追踪、审计,甚至在相同材料上训练其他模型。与 Lightning 同步,NVIDIA 正发布 Nemotron-RL-Agentic-Terminal-Pivot,这是一个用于对模型进行编码代理任务后训练的代理型强化学习数据集。

Nemotron 3.5 Lightning 现已在 Hugging Face、ModelScope 和 OpenRouter 上提供,同时也可在 build.nvidia.com 上作为一项 NVIDIA NIM 微服务获取,并将通过 NVIDIA 云合作伙伴、后训练平台和更多云服务提供商进一步扩大访问范围。NeMo Switchyard 已于今日在 GitHub 上线,预计很快将支持更多合作伙伴平台。

常见问题

什么是 Nemotron 3.5 Lightning,它有何不同?

Nemotron 3.5 Lightning 是一款拥有 300 亿参数的开放 AI 模型,针对高吞吐的代理型 AI 任务进行了优化,相比同类模型可提供最高快 4 倍的输出速度和 30% 更快的任务完成速度。

NeMo Switchyard 如何提升 AI 效率?

NeMo Switchyard 是一款开源路由库,可动态将 AI 请求定向到最合适的模型,与依赖单一模型相比,可将任务完成成本降低至约三分之一。

Nemotron 3.5 Lightning 能否根据特定组织需求进行定制?

可以。Nemotron 3.5 Lightning 可以使用 NVIDIA NeMo 在组织自身数据上进行后训练,以提升在专业、领域特定任务上的准确率。

Nemotron 3.5 Lightning 可在哪些平台上部署?

Nemotron 3.5 Lightning 支持在 NVIDIA RTX PC、DGX 系统、Jetson 和边缘设备上进行本地和云端部署,并可在 Hugging Face、ModelScope、OpenRouter 和 NVIDIA 云合作伙伴等平台上获取。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”什么是 Nemotron 3.5 Lightning,它有何不同?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Nemotron 3.5 Lightning 是一款拥有 300 亿参数的开放 AI 模型,针对高吞吐的代理型 AI 任务进行了优化,相比同类模型可提供最高快 4 倍的输出速度和 30% 更快的任务完成速度。”}},{“@type”:”Question”,”name”:”NeMo Switchyard 如何提升 AI 效率?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”NeMo Switchyard 是一款开源路由库,可动态将 AI 请求定向到最合适的模型,与依赖单一模型相比,可将任务完成成本降低至约三分之一。”}},{“@type”:”Question”,”name”:”Nemotron 3.5 Lightning 能否根据特定组织需求进行定制?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”可以。Nemotron 3.5 Lightning 可以使用 NVIDIA NeMo 在组织自身数据上进行后训练,以提升在专业、领域特定任务上的准确率。”}},{“@type”:”Question”,”name”:”Nemotron 3.5 Lightning 可在哪些平台上部署?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Nemotron 3.5 Lightning 支持在 NVIDIA RTX PC、DGX 系统、Jetson 和边缘设备上进行本地和云端部署,并可在 Hugging Face、ModelScope、OpenRouter 和 NVIDIA 云合作伙伴等平台上获取。”}}]}

本文由人工智能协助生成,并由编辑团队审核。

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST