基础架构

当AI芯片开始“内卷”,Imagination把矩阵加速器塞进了GPU

小到智能手环、摄像头,大到智驾汽车、服务器,现如今算力早已像水电一样渗进我们生活的每个角落。2026年,AI这波浪潮又给芯片行业推开一扇新窗口,行业久违的热闹又回来了。

但热闹背后,芯片行业也有自己的“成长的烦恼”。随着边缘设备应用日趋复杂,芯片设计厂商不断新增针对不同工作负载的专用加速模块、软件栈与数据通路。这种碎片化既加重系统集成负担,也可能使部分固定功能硬件在需求变化后闲置。近年来,各类边缘AI处理器在功能组合上逐渐趋同,力求在性能、能效与灵活性之间取得平衡。

也正是在这个节点,Imagination把它的答案摆上了台面。2026年9月21日,这家公司公布了E系列GPU IP首批性能数据和演示结果,同时推出Neural Super Resolution(NSR,神经超分辨率)方案。核心信息就一句话:一颗处理器、一套软件栈,同时跑图形、计算和AI。

Imagination CEO Markus Mosen表示,过去十年边缘工作负载发生巨大变化,由此带来处理器碎片化、软件复杂性以及芯片资源利用不足等问题。E系列正是为了应对这些挑战而设计,通过将图形、计算和AI功能整合到一个可编程架构中,为芯片设计厂商提供一款值得长期构建和演进的平台型处理器。

 

边缘计算的碎片化困局,GPU为何成为答案?

碎片化怎么破?Imagination首席营收官Jake Kochnowicz在演讲中给出一个判断:GPU是用户体验的核心。不管手机、平板、笔记本还是数字座舱,用户看到的每一个像素背后都是GPU在渲染。对开发者而言,不管哪家GPU,面对的都是同一套行业标准编程模型,代码写出来基本能跑在各家GPU上,这就是开放标准与GPGPU的力量。

在芯片和系统中,GPU往往已经是性能最高、面积最大的处理器。Jake认为,既然它已经是一块符合标准的高性能处理器,当要用AI提升体验时,GPU自然是最先动手、也最快见效的地方,无论是图形超分、生成式新体验,还是语音助手、生产力工具这些以AI为中心的新应用。

 

E系列架构:把矩阵加速器塞进GPU

作为此次发布的重点产品,E系列将可编程AI加速高效集成进GPU渲染管线。Jake解释道,Imagination把矩阵乘法深度嵌入GPU,就放在现有图形算术单元的旁边。这意味着AI能利用GPU现成的一整套基础设施:寄存器、控制、缓存、固件、驱动、工具链,以及围绕GPU的整个生态。

在扩展性上,E系列核心从单核到四核可伸缩,峰值配置下可寻址内存1TB,峰值读带宽768GB/s,通过AXI能接HBM、LPDDR、GDDR或统一内存任意一种。架构中集成了Imagination自研的高性能RISC-V固件处理器,在GPU架构上把图形和计算工作并行调度。底层最多支持4核、16台虚拟机,带高质量服务、工作负载优先级和内存隔离,云游戏、云桌面这类场景都能撑住。

软件兼容性方面,E系列支持DirectX 12、OpenCL、Vulkan,能跑在Linux、Android、Windows上;计算上支持ONNX、PyTorch,并对Llama.cpp做上游化。数据格式上,E系列第一次把BF16、mxFP8、mxFP4等格式带到嵌入式领域,通过面向OpenCL的行业标准SPIR-V协作矩阵扩展提供。

性能数字颇为亮眼:E系列每个核心在FP32下是2 TFLOPS(跑在1GHz);同样的算力拿去做矩阵,每个核心是FP16/BF16下16 TFLOPS、INT8/FP8下32 TOPS。最大四核配置时,FP16超过100 TFLOPS,FP8超过200 TFLOPS,比上一代D系列高出四倍以上。

 

性能:从4.7倍预填充到60fps游戏

E系列的性能提升并非停留在纸面。据Imagination官方数据显示,与上一代D系列相比,该处理器在典型边缘语言模型上的预填充性能提升了4.7倍。以Qwen 3.5 4B为例,在典型工作负载下,一款1.5GHz的四核E系列GPU可实现0.2秒的首次Token生成时间,以及每秒150个Token的解码吞吐量。

Jake补充了更多端侧用例:车机规划行程,TTFT约0.2秒、150 tokens/s;盲人智能眼镜描述周围环境,TTFT约0.25秒、153 tokens/s;邮件解读和摘要,TTFT 0.86秒、约126 tokens/s。用低占用的小模型,TTFT明显小于1秒、吞吐超过100 tokens/s,对用户来说已经足够快、足够跟手。

在基础计算操作方面,与D系列同类产品相比,E系列运行Conv2D内核的速度快4.4倍,运行GEMM内核的速度快4.8倍。在矩阵乘法工作负载下,GPU利用率可达89%。

以目前E系列GPU的性能,已具备“杀入”桌面游戏领域的实力了。该架构带来了显著的图形性能提升,包括对DirectX 12 FL11_0的支持。在实际游戏工作负载中,E系列与上一代同类产品相比,每TFLOPS算力对应的帧率提升高达54%,四核配置在部分AAA级桌面游戏中可实现超过60fps的帧率,每瓦性能提升最高达39%。《博德之门3》在四核E系列上跑到60fps以上,《古墓丽影:暗影》《毁灭战士》也展示了图形保真度。

Jake特别提到一项全新创新:在核心底层把指令打包、当成一个整体来跑,最大化数据复用、最小化不必要的数据搬运,最终换来39%的功耗效率改善。在功耗日益成为瓶颈的今天,这给开发者提供了选择权:要续航、要能效,就降频跑同样的性能;在云端要每瓦性能、要每用户成本,就把这份效率换成更高性能。

 

NSR:神经渲染的“单次处理”样本

通过神经渲染,融合技术为图形处理管线创造了新的机遇。Imagination全新推出的神经超分辨率(NSR)技术利用行业标准扩展,将E系列的矩阵加速技术应用于图形处理管线。

该时序超分辨率方案针对Imagination GPU进行了深度优化,采用单次处理方式,结合Imagination专有的网络自压缩技术,可移除神经网络中约65%的冗余权重,模型更省电。在1GHz单核E系列GPU上,典型的540p到1080p超分辨率操作延迟低至2.3毫秒。从1080p提升至4K时,带宽消耗最高可降低54%,帧率提升2.5倍,同时呈现出与真实图像视觉效果极为接近的画质。

Jake解释了NSR的差异化定位。业界常见做法是图形和AI完全分开:GPU渲染完写进DDR,NPU再读出来超分、写回DDR,这就会导致“成本”很高。另一种趋势是把部分AI能力放到GPU旁边,但还没完全耦合,编程范式不一样,数据还是要在缓存和片上各处搬。Imagination的选择是把矩阵能力直接嵌进GPU算术单元内部。这意味着图形开发者只要写一套shader(Vulkan或OpenCL),在同一套编程范式下就能跑,不用再把数据引出到DDR。

另一个重要区别是Imagination一直采用分块延迟渲染(TBDR):不像桌面端对手那样渲染整帧再超分,而是把屏幕切成成千上万个小块,一次处理一个块,在单个tile上同时完成图形和AI处理。这种设计面向边缘设备上,GPU得跟其他部件共享DDR;而英伟达、AMD的GPU是为独立显存设计的,显存带宽专属于GPU。Jake表示,从功能上说,超分的底层原理差不多,但Imagination把这套技术作为开放IP授权给所有客户,英伟达那套则相对封闭,客户只能买完整系统。

NSR将作为库功能集成于PowerVR SDK中,并通过与Unreal Engine和Godot的集成提供支持。W4 Games、Godot引擎公司技术总监Clay John表示:“开发者通常需要在视觉质量和性能之间进行权衡。针对硬件优化的超分辨率解决方案可以改变这种平衡,让开发者在保持相同甚至更高性能水平的同时,有更多空间提升视觉质量。”

此外,Imagination还强调整个路线图使用同一套软件栈,专有软件栈贯穿GPU家族并授权源代码供客户集成进自有SDK,同时通过开源驱动项目及对Llama.cpp、PyTorch等上游贡献拥抱开放生态,但开源驱动受限于物理平台和微软、谷歌等管控,早期只能依赖模拟器与FPGA。

与只能写上层框架、依赖专有图编译器的NPU不同,GPU允许开发者直接编写OpenCL/Vulkan shader和自有库,承接FFT、Softmax等任务并接入高度优化的开源后端,正如Jake所说,“优化是可以实现的,并且由开发者自行掌控”。

 

Agent PC与中国市场:GPU的新战场

正如大家所期待的那样,在此次发布会上,Agent PC成为了焦点。Jake认为,CPU和GPU在Agentic AI里是伙伴关系:CPU绝对关键,它跑GPU或NPU的驱动,编排所有模型、工具调用和数据流动。Agentic AI可以拆成两块,一块是“agentic”部分:思考做什么、调工具、协调数据、管KV cache、在网络里搬数据;另一块是大语言模型本身的实际计算,落在GPU或AI处理器IP上。

作为GPU厂商,要保证足够高的算力、对应的内存容量和带宽、支持对应的数据类型。Jake比喻:“GPU是发动机,提供把活干完所需的马力,它并不规划往哪开,只是被告知做什么,然后极高效率地执行。”

在中国市场,Imagination正在加码。

Markus Mosen表示,中国区人事调整是为了在中国取得更大成功:中国销售副总裁宣雄文常驻上海,销售网络覆盖北京、上海、深圳。谢巍出任Imagination公司执行副总裁兼中国区总经理,他透露,中国桌面GPU出货今年正在接近百万台量级,中国一直是Imagination非常核心的战略市场,未来会继续关注桌面级市场,并推动E系列GPU IP在AI PC、汽车边缘、具身智能机器人等应用场景落地。

Jake也谈到中国需求的特点:中国对图形和计算的需求非常强,推得更快、更高性能、更全的功能集,真正在把GPU IP的能力边界往前顶;全球其他市场的伙伴通常更多盯着深度嵌入式的汽车应用,面向更受限、更深度嵌入式的设备。

 

GPU-First的长期主义

当AI模型每几个月就变化,固定功能NPU会不会很快过时?E系列的答案是,把矩阵加速器嵌入GPU,让开发者通过可编程路径跟上变化。它不是简单堆TOPS,而是用可编程GPU、统一软件栈、深度矩阵集成和能效,应对模型快速演进和系统碎片化。

正如Markus Mosen所说:“通过将图形、计算和AI功能整合到一个可编程架构中,我们为芯片设计厂商提供了一款值得长期构建和演进的平台型处理器。”E系列是Imagination GPU-First战略的起点,F系列及后续将走向更大配置、更低数据类型和更高效率。

对芯片设计厂商而言,在Agent PC、边缘AI和智能汽车的不确定时代,一颗可编程GPU要比一堆固定功能加速器更值得长期投资。

(0)

本文由 计算杂谈 作者:云中子 发表,转载请注明来源!

关键词:
LensNews

热评文章

发表评论