HomeAIWaymo 的定制 AI 芯片达到 1000 TOPS,以缩短自动驾驶反应时间

Waymo 的定制 AI 芯片达到 1000 TOPS,以缩短自动驾驶反应时间

自动驾驶车辆只有大约一个心跳的时间来读取路况、判断正在发生什么并做出反应。这个极其短暂的时间窗口正是 Waymo 打造定制 AI 芯片的原因,该芯片旨在将传感器处理压缩到尽可能少的毫秒内。这家由 Alphabet 支持的机器人出租车公司本周在一篇博客文章中详细介绍了这款芯片,这是其首次公开拆解每一辆无人驾驶汽车后备箱中硬件的细节。

要点概览

  • Waymo 设计了自己的 AI ASIC,并采用台积电 5 纳米制程制造,用于比此前依赖的现成硬件更快地处理传感器数据。
  • 该芯片的设计借鉴了超过 2 亿英里的真实世界自动驾驶数据,可运行卷积神经网络和 Transformer 模型。
  • Waymo 称该 ASIC 提供超过 1,000 TOPS 的 AI 性能,可能是在 INT8 精度下测得,但其具体功耗仍不清楚。
  • 公司仍依赖外部供应商,包括 AMD、Micron、Samsung、Sandisk 和 Nvidia,来处理数据记录和编排等非机器学习任务。
  • 在转向自研芯片之前,Waymo 曾使用 Intel FPGA 进行传感器处理,如今则与特斯拉一道加入为自动驾驶打造定制芯片的竞赛。

Waymo 为瞬间决策打造的定制 AI 芯片

Waymo 的新芯片旨在在危险时刻完全展开之前,将大量原始摄像头、雷达和激光雷达数据转化为驾驶决策。公司将其描述为计算栈的前线,负责清洗传入的传感器数据流,并在信息到达的瞬间运行快速 AI 检查,而不是将杂乱的原始数据直接发送到车辆的主处理单元。

基于台积电 5 纳米制程打造

该芯片采用台积电 5 纳米制程技术制造,使 Waymo 与依赖这家台湾代工巨头获取尖端芯片的主要芯片制造商站在同一阵营。选择先进制程节点很重要,因为这让 Waymo 能在更小、更节能的封装中塞入更多算力,而这套系统必须在行驶中的车辆内生存,而非在恒温的数据中心中。

与原始密度同样重要的是灵活性。该 ASIC 被设计为既能运行卷积神经网络,也能运行可比的基于 Transformer 的架构,这两类架构分别代表传统的机器学习方法和驱动当今 AI 聊天机器人与图像生成器的当代模型。这种双重能力让 Waymo 能够随着时间推移更新其感知软件,而无需在每次模型演进时都更换全新的硬件。

芯片如何从 2 亿英里驾驶中学习

Waymo 表示,该芯片架构反映了从超过 2 亿英里的自动驾驶累计数据中汲取的经验,使设计具备现成芯片难以匹敌的真实世界基础。这一规模的驾驶历史塑造了芯片在真实道路环境而非实验室模拟中对响应性、可靠性和冗余性的处理方式。

将延迟最小化视为安全优先事项

降低延迟是该芯片的核心设计目标,因为事故发生的速度比任何远程人工操作员介入的速度都要快。公司解释称:“在这些关键的毫秒内,先进的机器学习模型会构建对环境的高保真理解,以评估最安全的前进路径”,并描述了系统如何执行实时时间域降噪,以在弱光环境下提升可见度。

Waymo 的工程领导者也以同样紧迫的措辞来界定这一挑战。工程副总裁 Satish Jeyachandran 和计算负责人 Daniel Rosenband 表示,公司正在“设计一套最先进系统,即便放在数据中心也会令人印象深刻,同时还要应对车载运行环境和实时需求带来的额外复杂性”,据《The Verge》报道。他们表示,这一计算栈由三个不可妥协的原则所引导:响应迅速、坚固耐用和具备冗余。

所有这些响应性都需要强大的算力支撑。Waymo 声称,其专用前端芯片可提供超过 1,000 TOPS 的 AI 性能,不过公司尚未披露这一数字背后的精度等级或功耗。在缺乏这些细节的情况下,很难与竞争对手的自动驾驶和机器人硬件进行直接对比,不过这一 TOPS 数值很可能是在 INT8 精度下测得,这会让它处于与 Nvidia Drive AGX Thor 平台相近的性能级别。

冗余、散热与其余硬件栈

当硬件被安装在车内、长期暴露于持续震动、路面冲击和极端温度变化之下时,仅有算力远远不够,而数据中心芯片无需承受这些考验。Waymo 通过多层冗余来应对这一问题,本质上是运行重复系统,以防单点故障导致车辆感知能力下线。芯片本身采用液冷,接入与车辆发动机相同的冷却系统,无论外界天气如何,都能将芯片维持在安全的工作温度。

这也凸显了 Waymo 与早期方案的差异。在推出自研 ASIC 之前,公司依赖 Intel FPGA 进行传感器处理。FPGA 非常适合低延迟任务,这也是高频交易公司常用它们的原因之一,但它们编程难度极高,且无法与专用芯片的计算密度相匹敌。

合作伙伴负责非机器学习任务

Waymo 并未从零开始构建其计算栈的每一个部分。公司继续依赖外部供应商来处理编排、数据传输和日志记录等非机器学习功能,并将 AMD、Micron、Samsung、Sandisk 和 Nvidia 列为提供这些组件的合作伙伴,《The Verge》还提到 Socionext 也是参与其中的硬件供应商之一。Waymo 表示,它正在开发数款额外的定制芯片和系统,这意味着当前的 ASIC 只是更广泛自研芯片战略中的一部分,而非对第三方硬件的完全替代。

这种异构方案体现了一种有意为之的权衡。Waymo 并未试图在内部构建整套计算系统,而是将工程力量集中在实时传感器融合和前端机器学习上——这些领域是定制芯片在延迟方面优势最大的地方——同时在其他方面依赖成熟的芯片制造商。

Waymo vs 特斯拉:机器人出租车领域更广泛的芯片竞赛

Waymo 并非唯一押注定制芯片以赢得机器人出租车竞赛的公司。特斯拉多年来一直在为自动驾驶开发自研芯片,并在多次推迟后,最近在奥斯汀推出了有限的 Robotaxi 服务。两家公司在理念上也存在明显分歧:特斯拉 CEO 埃隆·马斯克曾将激光雷达斥为“拐杖”和“愚蠢的差事”,认为融合多种传感器类型的数据会在信号不一致时引入危险的歧义。

Waymo 的路线则完全相反,它押注通过专用芯片融合摄像头、雷达和激光雷达数据会让系统更可靠而非更不可靠,并认为正是定制芯片让其能够在有意义的规模上部署。公司计划在下周斯坦福举办的 Hot Chips 大会上分享更多关于其机器学习加速器的细节,这一场合有望提供迄今为止最清晰的视角,展示其芯片战略与竞争对手在通往同一目标的竞赛中如何一较高下。

常见问题

Waymo 定制 AI 芯片的主要功能是什么?

它能够快速处理来自自动驾驶车辆的原始传感器数据,并以极低延迟将其转化为驾驶响应。

Waymo 芯片采用了哪种制造工艺?

该芯片采用台积电 5 纳米制程技术制造。

Waymo 的芯片可以运行哪些机器学习模型?

它既可以运行卷积神经网络等传统模型,也可以运行现代的 Transformer 模型。

Waymo 如何确保其定制芯片在车载环境中的可靠性?

Waymo 采用多层冗余和液冷系统,以在恶劣环境中维持芯片性能。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Waymo 定制 AI 芯片的主要功能是什么?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”它能够快速处理来自自动驾驶车辆的原始传感器数据,并以极低延迟将其转化为驾驶响应。”}},{“@type”:”Question”,”name”:”Waymo 芯片采用了哪种制造工艺?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”该芯片采用台积电 5 纳米制程技术制造。”}},{“@type”:”Question”,”name”:”Waymo 的芯片可以运行哪些机器学习模型?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”它既可以运行卷积神经网络等传统模型,也可以运行现代的 Transformer 模型。”}},{“@type”:”Question”,”name”:”Waymo 如何确保其定制芯片在车载环境中的可靠性?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Waymo 采用多层冗余和液冷系统,以在恶劣环境中维持芯片性能。”}}]}

本文由人工智能协助生成,并由编辑团队审核。

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST