过去很长一段时间里,无论是关于训练还是推理,我们谈人工智能都是围绕在云端。但其实在AI应用里,较之云端,端侧市场爆发的潜力有过之而无不及。
尤其是,随着AI算法持续进步,实现商用能力所需的大模型规模正快速缩小,从过去需要数百亿参数下降到约10亿参数级别。这一变化使原本只能部署在云端的大模型具备了在算力和资源受限的端侧设备上运行的可能,为AI从云端走向终端、推动万物智能和AI普惠时代的到来奠定了基础。
基于过去打下的深厚基础,Arm China安谋科技正在为即将到来的智能时代积聚力量。
AIoT时代,端侧AI芯片变了
关于IoT(物联网)这个词,相信大家都不陌生。过去十多年,物联网推动了海量终端设备实现联网和数据采集,在早期介绍,“连接万物”是IoT的核心。然而,随着人工智能的快速发展,这些设备正从“连接万物”进一步迈向“智能万物”,“认知”正在成为物联网发展的下一阶段核心驱动力,进而推动AIoT走到台前
正如安谋科技CPU产品线的产品负责人朱晓鸣在日前举办的WAIC 2026大会现场中所说:“AIoT时代,端侧设备正从被动的数据采集器,演进为具备本地计算、自主决策和持续进化能力的智能终端。”在他看来,包括端侧的真实数据、本地数据的隐私和自主、端侧的实时性和自主性以及低功耗和轻量级芯片技术的发展在内的四种推动力正在让这个变革加速发生。
但与此同时,AIoT对端侧芯片的需求也变了。
据朱晓鸣介绍,传统IoT设备更多承担数据采集和执行指令的角色,而未来的端侧AI不仅需要持续感知环境,还要能够在本地完成分析、推理和决策,并独立运行更复杂的AI任务。为实现这一目标,端侧芯片需要构建更加完善的异构计算架构,包括负责低功耗持续运行的Always-on单元、承担系统控制和逻辑处理的通用CPU,以及面向复杂AI负载的专用加速器,共同支撑不同类型的计算需求。
然而,与云端拥有充足的算力和能源不同,端侧设备始终受到功耗、温度、电池容量、CPU计算能力、内存容量和带宽等多重资源约束,这意味着端侧AI无法简单复制云端大模型的发展路径,而必须在有限资源条件下实现智能能力的最大化。
因此,如何在用户对更强推理能力、更长续航、更高实时性等需求,与芯片资源限制之间找到最佳平衡,成为端侧AI芯片架构设计和系统优化需要解决的核心问题,也是未来AIoT发展的关键所在。
针对这些问题,Arm China安谋科技已经做好了充分准备。
应对需求,安谋科技的三条路径
朱晓鸣表示,为了在有限的功耗和资源条件下最大化端侧AI的计算潜力,Arm China安谋科技已经擘画出了三条芯片架构创新的路径。其中一条方向是在传统CPU基础上进行扩展,通过增加向量和张量处理能力,将通用计算与AI计算深度融合,在保持灵活性的同时提升AI处理效率。
第二条路径是在端侧引入独立的通用小算力NPU,由专用硬件承担AI推理任务,这种方式具备较好的泛化能力和生态兼容性,可以与CPU灵活组合;第三条路径则是存内计算,通过在SRAM等端侧常用存储单元中直接完成部分计算,减少数据搬运带来的功耗开销,从而获得更高的能效表现。
“端侧AI的发展并非单纯追求更大算力,而是在架构、能效和生态之间寻找新的平衡。”朱晓鸣重申。站在这个见解基础上,基于CPU扩展和通用NPU这两条方向,Arm China安谋科技也在Arm生态也正在探索面向嵌入式场景的计算解决方案,以满足未来AI终端不断增长的需求。
具体而言,则涵盖由Cortex-M/A系列CPU以及Ethos系列NPU组成的端侧AI计算解决方案,以及Arm China安谋科技推出的“星辰(STAR)”系列CPU IP产品。
在CPU侧,Arm持续强化其通用计算能力,通过架构升级和指令集扩展,让传统CPU具备更强的AI处理能力。其中,Cortex-M系列针对低功耗、高能效的嵌入式场景进行了优化,并在最新架构中引入Helium向量扩展技术,大幅提升了向量计算、机器学习和数字信号处理能力。相比传统MCU架构,支持Helium的Cortex-M系列产品在音频编解码、机器学习等任务中实现了显著性能提升,使更多AI任务能够直接在端侧完成。
同时,针对更高性能需求的应用,Arm也推出了面向IoT和边缘设备优化的Cortex-A系列产品,通过支持SVE等技术,进一步增强标量计算和矢量计算能力。
除了提升CPU自身能力,Arm也通过Ethos系列NPU为端侧AI提供专用算力补充。由于端侧设备受到功耗、面积和散热限制,并不适合简单堆叠大规模算力,因此Ethos系列NPU IP更强调高能效比,通过承担CPU不擅长的矩阵计算任务,实现AI负载卸载,提高整体系统效率。
据朱晓鸣介绍,目前,Ethos系列已经覆盖从轻量级到高性能的多个产品,包括Ethos-U55、U65和U85,可提供从几十GOPS到TOPS级别的AI算力,满足图像识别、语音处理、实时视觉以及小型语言模型等不同应用需求。
从整体架构来看,Arm希望通过CPU与NPU的协同,覆盖端侧AI从简单感知到复杂推理的完整应用链路。对于低算力需求任务,CPU可以独立完成处理;而当应用涉及更复杂的视觉、语音或AI模型推理时,则可以通过NPU进行加速,实现更高效率的本地计算。这种“通用CPU 专用AI加速器”的异构计算模式,将成为未来端侧智能设备的重要发展方向。
值得一提的是,如上所述,基于Arm技术体系,Arm China安谋科技也推出了“星辰(STAR)”系列CPU IP产品,为AIoT市场提供更多地选择。据透露,Arm China安谋科技在后续产品中回味星辰系列引入全面的Helium技术支持,将Arm最新的端侧计算能力引入国产嵌入式芯片生态。
“通过持续强化CPU性能、引入AI加速能力以及完善生态支持,Arm正在推动更多终端设备从传统控制节点向具备自主智能能力的AI终端演进。”朱晓鸣说。
推出“星辰300”,加速客户布局
对于无论是Arm还是Arm China安谋科技来说,推出极具竞争力的产品只是起点。如何让客户更好地将产品部署到芯片中,是他们这些年来工作的重中之重。事实上,在无论手机、PC、智能汽车抑或数据中心中,他们也正在通过类似CSS子系统等方案为客户提供服务。
来到AIoT市场,Arm China安谋科技也不甘落后,推出了可加速AIoT产品落地的“星辰300”——将STAR系列CPU与Ethos系列NPU进行深度集成,并部署在FPGA原型验证平台。据介绍,通过运行多个典型端侧AI模型,Arm China安谋科技在这个方案上展示了异构计算架构在真实应用场景中的表现。星辰300平台已经支持包括视觉、语音等方向的多个AI应用案例。
在人脸检测Demo展示中,Arm China安谋科技更是展现了完整的端侧AI处理流程:摄像头采集图像数据后,通过网络传输至星辰300平台,由M52 CPU和Ethos-U55 NPU共同运行AI算法,实现人脸信息识别,并将结果实时显示在设备屏幕上。通过这一系列Demo,
“基于CPU与NPU协同的端侧计算方案,Arm China安谋科技希望能够在有限功耗和资源条件下,实现更高效、更实时的AI推理能力,为未来智能终端和AIoT设备的发展提供基础平台支持。”朱晓鸣在分享最后说


VIP复盘网