为了安全抵达目的地,自动驾驶车辆只有几毫秒的时间来接收和处理来自十几个摄像头的实时数据流。这项工作目前主要依靠现成的AI组件来完成,但Waymo已经开始研发自己的AI专用集成电路(ASIC)来优化这一流程。而且,Waymo并非孤军奋战。
这家由 Alphabet 支持的无人驾驶出租车初创公司在周四的一篇博客文章中透露,其首款定制芯片旨在尽快将原始传感器数据转换为驾驶员响应。
该芯片采用台湾代工巨头台积电的 5 纳米工艺技术制造,专门针对运行更传统的机器学习算法(如卷积神经网络)和现代 Transformer 模型(类似于用于运行 AI 聊天机器人或图像生成模型的模型)进行了优化。
据 Waymo 称,该芯片的设计融合了超过 2 亿英里的自动驾驶数据,并经过调整以最大限度地提高响应速度、可靠性和冗余性。
在此之前,Waymo 曾使用英特尔 FPGA 进行传感器数据处理。FPGA 非常适合低延迟应用,这也是高频交易经常在其上运行的原因之一。然而,与专用芯片相比,FPGA 的编程难度众所周知,并且缺乏专用硬件所能达到的计算密度。
事故可能在瞬间发生,速度之快,远程操作员根本来不及接管。因此,Waymo 在设计芯片时,重点在于最大限度地降低延迟。
该公司解释说:“在关键的几毫秒内,先进的机器学习模型能够构建对环境的高度精确的理解,从而评估出最安全的前进路径。” 这包括执行时间降噪,以实时改善弱光环境下的能见度。
所有这些都需要大量的计算。这家无人驾驶出租车初创公司声称,其专用集成电路(ASIC)能够实现超过1000 TOPS的AI性能。但由于不了解芯片的精度和功耗水平,很难将其与现有的自动驾驶汽车和机器人平台进行比较。
我们已联系相关方寻求澄清,如有回复将及时通知您。但考虑到 Waymo 特别强调的是 TOPS 级别,我们推测其性能可能达到 INT8 水平,这与英伟达的 Drive AGX Thor 平台处于同一水平。
除了提供强大的计算能力外,这款芯片还需要具备可靠性。车辆几乎时刻都会受到振动、冲击和极端温度变化的影响,这与数据中心的环境截然不同。
为了应对这种情况,Waymo采用了多层冗余设计。芯片本身由车辆使用的同一冷却系统进行液冷,确保硅芯片无论天气如何都能保持最佳温度。
同时,为了确保硬件故障不会危及乘客安全,Waymo表示每辆车都配备了两块ASIC芯片。正常情况下,这两块芯片协同工作。但如果其中一块芯片发生故障或产生错误结果,另一块芯片可以接管。
航空航天器通常会配备第三套系统,以便在出现故障时作为备用方案。因此,对于一辆将在布满其他车辆、行人和其他障碍物的道路上高速行驶的车辆来说,采用这种冗余设计也就不足为奇了。
需要明确的是,Waymo的定制ASIC芯片并非负责车辆的所有功能。该公司表示,他们正在研发其他几款定制芯片和系统,但目前,诸如编排、数据传输和日志记录等非机器学习任务由其合作伙伴提供的组件处理,这些合作伙伴包括AMD、美光、三星、闪迪和英伟达。
Waymo并非唯一一家自主研发定制芯片的自动驾驶汽车供应商。特斯拉在多年未能按时交付后,终于在奥斯汀推出了有限的Robotaxi服务。多年来,特斯拉一直在为其车辆开发定制芯片。
看看我们的后备箱下面:我们的计算机里有什么
计算是 Waymo 驾驶员的大脑,它将原始传感器数据转化为实时驾驶指令。要在道路上安全可靠地运行物理人工智能,需要从根本上转变系统设计,使其具备确定性、低延迟的性能。过去十年,我们并肩设计硬件、传感器和算法,以应对现实世界边缘计算的独特挑战。现在,我们将首次揭开我们计算系统的神秘面纱,分享我们的计算方法、定制芯片,以及我们如何与行业领导者合作,打造道路上最强大的计算系统。
用于自动驾驶的计算系统需要处理极其多样化的工作负载。在 Waymo,我们正在设计一套最先进的系统,其性能即使在数据中心也堪称卓越,同时还要应对车载运行环境的复杂性以及实时性要求。与传统的驾驶辅助计算不同,我们的系统无需人工辅助即可完成整个驾驶任务,因此对性能的要求要高得多。凭借超过 2 亿英里的全自动驾驶经验,我们围绕三个不可妥协的要求来设计我们的计算系统:
响应迅速:为了做出实时驾驶决策,自动驾驶系统完全在车载环境下运行,持续在毫秒级时间内处理决策。我们精心设计了超低延迟的软件栈,最大限度地缩短了从第一个像素到实际操作的延迟。在这关键的毫秒级时间内,先进的机器学习模型能够构建对周围环境的高度精确理解,从而评估出最安全的行驶路径。实现这一目标需要强大的原始计算能力——我们在短短八年内将其规模扩大了20倍——并结合深度优化的软件栈,以高效利用这些能力。
坚固耐用:我们精心打造的计算系统,从组件到系统层面都具备卓越的耐久性和可靠性,使其能够在严苛的物理环境中稳定运行。我们的硬件能够承受持续的振动、冲击和极端温度。通过与车辆的液冷系统直接集成,无论是在严寒的中西部冬季,还是在酷热的凤凰城,都能保持最佳性能。
冗余设计:由于无需人工接管,主动安全和冗余机制已内置于系统中。我们的计算系统设计为两个独立的引擎。它们通常作为一个整体运行,并行处理所有工作负载;但如果其中一个发生故障,另一个可以无缝接管。

通过优化每个百分位数的动态工作负载,我们显著降低了 Waymo 驾驶员的“像素到动作”延迟(红色到蓝色)。这使得系统拥有在复杂、高密度环境中安全导航所需的快速反应能力
从现成组件到定制系统的演进,需要我们重新思考物理和架构设计。我们高度集成的系统在不影响骑行体验的前提下,提供了强大的处理能力,最大限度地提高了电池效率,同时保留了充足的后备箱空间,并实现了静音运行。我们构建了一个以机器学习为核心的架构,以极低的延迟运行先进的神经网络。为了管理编排、数据传输和日志记录等关键的非机器学习任务,同时最大限度地延长机器学习计算时间,我们将机器学习技术与顶级的CPU、GPU和加速器相结合。最终,我们打造了一个均衡且异构的系统。

为了在原始数据到达我们的核心机器学习系统之前对其进行处理,我们很高兴地推出我们专门定制的 5nm ASIC 芯片。虽然这款芯片只是我们正在开发的众多令人兴奋的定制组件之一,但它是一款专为实时处理、融合原始传感器数据并运行高级神经网络而设计的专用机器学习引擎。通过芯片、传感器和算法的同步开发,我们能够突破传感器保真度、带宽效率和量化方面的极限,从而执行从稀疏卷积到密集 Transformer 的各种异构模型。
该专用集成电路 (ASIC) 的专用加速器可即时从原始激光雷达、雷达和摄像头数据流中提取关键信息,包括用于增强低光照感知能力的时域降噪。这些数据被输入到我们专门开发的推理引擎中,以运行传感器融合机器学习模型,从而在不牺牲保真度的前提下显著提高效率。虽然这些 ASIC 本身就能提供超过 1000 TOPS 的机器学习性能,专门用于前端处理和机器学习模型,但我们对整个技术栈进行了优化,以最大限度地提高性能,尤其是在我们经常使用的低批量处理模式下。
除了自主研发芯片外,我们还与业界领先的合作伙伴紧密合作,他们世界一流的计算解决方案为我们的技术高效扩展提供了强大的基础。我们很荣幸能与 AMD、美光、英伟达、三星、闪迪、Socionext 和台积电等众多合作伙伴携手,共同打造功能最强大的自主计算系统。
这只是未来发展的一个缩影。随着我们探索 Waymo Driver 的新应用场景,以及我们的人工智能技术栈不断发展,对高效、高性能计算的需求只会日益增长


VIP复盘网