扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 打破异构芯片“边境税”,Imagination E系列以GPU为核心重塑边缘计算

股市情报:上述文章报告出品方/作者:电子发烧友网;仅供参考,投资者应独立决策并承担投资风险。

打破异构芯片“边境税”,Imagination E系列以GPU为核心重塑边缘计算

时间:2026-09-22 06:55
上述文章报告出品方/作者:电子发烧友网;仅供参考,投资者应独立决策并承担投资风险。
电子发烧友网报道(文/吴子鹏)随着人工智能(AI)从云端向边缘端快速渗透,智能手机、AI PC、智能座舱、机器人等设备的计算负载正以前所未有的速度融合。然而,现有的芯片硬件架构依然处于碎片化状态,带来能效、时延和工程成本等多重瓶颈。

负载已经融合,硅片却没有。这是 Imagination Technologies(以下简称 “Imagination”)对当下边缘计算产业核心矛盾的判断,也是其 GPU-First 战略的出发点之一。为了更好地帮助产业克服这一挑战,日前 Imagination 公布了其 E 系列 GPU IP 的首批性能数据与演示结果,并推出全新的 Neural Super Resolution(NSR,神经超分辨率)AI 加速超分辨率解决方案。

Imagination CEO Markus Mosen 表示:“计算的重心正在往 GPU 转移,通过将图形、计算和 AI 功能整合到一个可编程架构中,我们为芯片设计厂商提供了一款适合长期构建和演进的平台型处理器。归根到底就是两个字 —— 效率,既是客户开发的效率,也是产品运行的效率。”

Imagination CEO Markus Mosen
产业矛盾:负载已经融合,但芯片硬件依然碎片化
如开篇所述,今天的边缘设备,无论是手机、汽车还是机器人,其所处理的任务已形成一个统一闭环:感知、建模、推理、决策与渲染。这些步骤共享同一份内存预算、功耗预算和响应时间要求。然而,在硅芯片层面,硬件架构却呈现严重的碎片化特征。

如今的 SoC 里,图形交给 GPU、信号处理交给 DSP、神经网络交给 NPU、通用计算交给 CPU,每个加速器配套独立 SRAM,形成四套互不相通的内存域。每一个中间结果都要离开本地算力孤岛,模块之间需要通过成本最高的外部 DRAM 反复搬运中间数据。

Markus Mosen 把这种现象称为 “边境税”—— 每一个模块边界都是一道关卡,代价体现在三个维度:
  • 能耗账数据在加速器孤岛与外部内存之间往返,数据搬运本身就会产生功耗开销;
  • 时延账跨模块传输叠加排队延迟,即便最优调度器也无法完全掩盖;
  • 工程账每个加速器拥有独立工具链、驱动和安全模型,集成与维护需要投入巨大人力工程成本。

碎片化之外还有一层更深的时间错位:SoC 芯片一旦完成流片,硬件配置便固定下来;但 AI 模型、底层算子与上层应用的迭代速度远快于硬件。因此,一次硬件选型,必须支撑还没有被定义的新需求。可编程性是一种有效的缓冲 —— 让产品交付到客户手中之后,仍能尽可能延缓淘汰周期。

更深层的趋势是,处理器类别之间的边界正在模糊。CPU 不断增加向量与矩阵扩展,NPU 持续拓宽数字格式支持与可编程能力,GPU 则在吸纳 AI 计算与神经渲染能力。当所有模块互相靠拢,行业面临一个关键设问:谁将成为异构计算的重心?一套共享、可编程的计算重心,意味着更少的数据搬运、更高的资源利用率、更强的灵活性 —— 这份 “重心” 的归属,正是 Imagination GPU-First 战略的出发点。

为什么 GPU 可以成为融合加速的重心
在计算单元融合的进程中,GPU 拥有四大先天优势:
  • 原生大规模并行与强可编程性GPU 本质是大规模并行处理器,天然适配复杂多变、持续涌现的 AI 算子和通用计算任务,提供充足灵活的编程空间。

  • 规模化部署基础GPU 已广泛应用于几乎所有带可视化能力的边缘终端,是硬件标配模块,负责显示和图形处理。

  • 成熟的生态体系拥有成熟驱动程序、标准 API(如 DirectX, Vulkan, OpenCL)以及庞大开发者生态,能够快速吸引并赋能开发者。

  • 不可替代的图形渲染职能任何带显示功能的设备都必须完成图形渲染,GPU 是承担该职责的硬件基础,无法被其他处理器完全取代。

Imagination 首席营收 Jake Kochnowicz 对此补充道:“GPU 是用户体验的核心。不管手机、平板、笔记本还是数字座舱,我们看到的每一个像素,背后都是 GPU 在渲染。如今在芯片和系统里,GPU 往往已经是性能最高、面积最大的那块处理器。既然它已经是一块符合标准的高性能处理器,那当我们要用 AI 来提升体验时,GPU 自然是最先落地、见效最快的地方。”

Imagination 首席营收 Jake Kochnowicz 
Markus Mosen 也特别强调:“其他任何想成为重心的候选方案,都至少需要补齐这四项能力中的一项,而 GPU 四项兼备。” 不过需要澄清:Imagination GPU-First 战略不等于 “GPU 通吃、抛弃 NPU”。Imagination 反复强调,E 系列支持与片上其他加速器异构共存;GPU-First 主张的是,在融合加速的架构选型上,以可编程 GPU 作为核心重心,能够以最小的系统代价获得最大的灵活性。

谈及 “谁是最好的 GPU 技术提供商” 这个问题,Imagination 的底气来自多年技术积累:超过 30 年自研 GPU 架构,4000 余项有效全球专利,并且在图形渲染、计算、虚拟化与车载功能安全等方向具备领先优势。

E 系列 GPU 架构深度解析:把矩阵 AI 单元深度嵌入 GPU 管线
为什么 Imagination 的 E 系列能够实现计算融合?一个关键原因是,E 系列将矩阵乘法单元直接置入 GPU 着色单元(USC)内部,紧邻现有图形算术单元。这意味着 AI 可以复用 GPU 全部现有基础设施 —— 寄存器、控制逻辑、缓存、内存、固件、驱动与工具链,最大化复用已有软硬件投入。

根据 Jake Kochnowicz 的介绍,E 系列 GPU 的核心架构设计思想是 “三统一”:统一内存层次、统一调度、一套软件栈。

在硬件规格与可扩展能力上,E 系列展现出强大潜力:
  • 单核基础规格(1GHz)拥有 2 TFLOPS FP32 算力,矩阵运算性能达到 32 TOPS(INT8/FP8),纹理吞吐高达 64Gtexel/s。AI 算力相比 D 系列提升 4 倍以上。

  • 卓越的扩展性支持 1 到 4 核灵活配置,并已为多芯粒(Chiplet)架构做好准备。在峰值配置下,支持最大 1TB 寻址空间和 768GB/s 峰值带宽,通过 AXI 互联兼容 HBM、LPDDR、GDDR 等各类内存类型。

  • 完整的多精度支持E 系列首次将 BF16、MXFP8、MXFP4 等格式引入嵌入式领域:图形着色与参考路径采用 FP32/FP16;主流推理使用 BF16、INT8、FP8;面向大模型的低精度推理则采用 MXFP8、MXFP4 等微缩放格式,适配带宽受限场景,提升计算密度。所有格式通过行业标准的 Vulkan 协作矩阵扩展提供,底层仍复用同一套软件栈。

  • 智能调度采用 RISC-V 固件调度器,可并行调度图形与 AI 任务。支持多达 16 个虚拟机(VM),提供 QoS 优先级和内存隔离,完美适配车载云游戏、安全隔离等复杂场景。

Imagination 很清楚,GPU IP 无法独立运行,它处在 IP 厂商、SoC 厂商与软件开发商共同构成的生态体系中,“不存在唯一正确的 AI 系统设计”。为此,E 系列在架构层面原生支持四种异构组合模式:

  1. GPU-only纯 GPU 方案,适合车载、工业这类产品生命周期长、对可编程性要求极高的 AI 系统;
  2. GPU 为主 + 辅助 NPU可编程计算作为核心,搭配定向 AI 加速单元;
  3. NPU 为主 + GPU 协处理器主打峰值推理吞吐,GPU 负责图形渲染与通用计算;
  4. GPU/NPU 均衡协同性能、能效与可编程性按需求配比。


为了与片上其他 IP 顺畅协作,E 系列内置硬件 mailbox、低延迟任务交接与共享内存机制,配套一套可由客户集成进自有 SDK 的开放软件栈,在合适的时间、选用合适的处理器,输出计算结果。

实测性能拆解:图形、神经渲染、AI 算子、本地大模型四大维度
架构设计之外,最终仍要看实测数据。E 系列首批性能数据覆盖四个维度。

图形仍是 E 系列的核心能力。在实际游戏负载下,E 系列单位算力帧率(FPS/TFLOPS)较 D 系列最高提升 54%,每瓦性能最高提升 39%。后者来自一项全新底层创新:将指令打包并整体执行,最大化数据复用,减少不必要的数据搬运。

E 系列支持 DirectX 12 FL11_0 与 Vulkan,可运行数百款 PC 与移动游戏。在四核配置下,《博德之门 3》等部分 AAA 级桌面游戏可实现 60fps 以上帧率;《古墓丽影:暗影》《毁灭战士:永恒》等作品也验证了其图形保真能力。这些能力直接面向 PC、AI PC 与车载座舱游戏场景。

如果说图形性能提升属于常规迭代,神经超分辨率(NSR,Neural Super Resolution)就是融合架构价值最直观的落地成果,也直接回答了 “为什么要把 AI 集成进 GPU” 这个根本问题。

神经超分辨率本质属于神经渲染范畴:GPU 先渲染较低分辨率画面,AI 再利用矩阵加速器重构为全分辨率画面,全程单通道处理(single-pass),数据无需离开矩阵加速器就近处理,不用导出到外部 DRAM。技术上有两个关键设计:一是矩阵单元与着色器深度耦合,图形开发者仅需编写一套 Vulkan/OpenCL shader,在同一编程范式下完成开发;二是 Imagination 自研网络自压缩技术,可移除神经网络中约 65% 的冗余权重,降低功耗与带宽占用。

实测数据颇具说服力:单核 1GHz E 系列,将 540p 提升至 1080p 仅需 2.3 毫秒;对比原生渲染,1080p 升 4K 场景下内存带宽消耗最高降低 54%,帧率最高提升 2.5 倍,现场对比画质无明显损失。交付形态上,NSR 以库功能集成于 PowerVR SDK,同时提供 Unreal Engine 与开源 Godot 引擎插件。

在 AI、计算机视觉、信号处理与通用计算基础算子层面,E 系列同样大幅提速:Conv2D 卷积内核最高提速 4.4 倍,GEMM 矩阵乘法内核最高提速 4.8 倍;矩阵乘法负载下,GPU 利用率可达 89%。这一能力是构建语言模型、目标检测网络等基础计算任务的底层支撑。

最后是本地大模型能力,理解 E 系列的 LLM 性能,需要区分 LLM 的两个阶段:
  • Prefill(预填充)阶段,即 “问”—— 处理输入提示词,为每个上下文 token 执行海量矩阵计算,决定首 token 生成时间(TTFT,Time to First Token);
  • Decode(解码)阶段,即 “答”—— 逐 token 生成回答,每个 token 都需要搬运数据、重载权重,吞吐量(tokens/s)高度依赖 SoC 的系统内存带宽。

E 系列将 Prefill 性能相对上一代提升 4.7 倍 —— 这个优化方向针对性极强。在 Agent AI 时代,模型输出第一个 token 前,需要调度器、收集数据、调用工具、完成推理,每一步都叠加 Prefill 计算;代码 Agent 需要逐文件读取完整代码库,多次调用工具才能给出回答,上下文规模呈指数增长,TTFT 因此成为 Agent AI 最关键的用户体验指标。以 Qwen 3.5 4B 为例,在典型工作负载下,1.5GHz 四核 E 系列 GPU 可实现 0.2 秒的首次 Token 生成时间,以及每秒 150 个 Token 的解码吞吐量。

在 Decode 方面,Jake Kochnowicz 表示,E 系列的目标是为开发者提供充足算力支持,让系统集成商可以专注完成终端产品整套系统开发。

结语
把 E 系列放回产业坐标系中,可以得出几个判断。

其一,GPU-First 是对边缘计算融合趋势的一次系统性回应。负载融合与硬件碎片化带来的 “边境税” 真实存在 —— 能耗以纳焦计、时延以毫秒计、工程成本以工程师・年计;而 GPU 作为同时具备可编程性、规模化部署基础、成熟生态与图形刚需属性的计算单元,天然适合成为融合加速的重心。E 系列通过 “统一内存层次、统一调度、一套软件栈” 的架构设计,把这一产业判断转化为可授权的工程方案,并以 54% 的单位算力帧率提升、4.7 倍的 Prefill 加速、2.3 毫秒的 NSR 超分等实测数据完成验证。

其二,E 系列并非 “万能芯片”。它的性能上限受 SoC 内存系统、带宽配置与客户系统设计约束 —— 解码吞吐取决于系统带宽,内存容量与芯粒集成取决于 SoC 实现方案。Imagination 对此并不避讳,甚至主动强调 “AI 性能不能只看 TOPS”。对客户而言,E 系列是一套高度灵活的 IP 方案:单核到四核可选,既可独立运行,也支持四种异构组合模式,系统架构的选择权掌握在芯片设计者手中。

在 Imagination 的技术路线图上,D系列开始布局,E 系列完成 GPU 内 AI 融合,F 系列将主攻扩展效率,后续迭代聚焦 AI 密度与能效提升;整条路线始终沿用同一套软件栈,客户针对每一代 GPU 完成的优化都可复用,不会失效。

股票复盘网
当前版本:V3.0