高通将AI加速功能直接集成至其Adreno移动GPU中,Unity和Unreal引擎已采用Neural Fusion框架。
高通已正式揭晓其下一代旗舰骁龙平台的GPU架构,确立了硬件加速AI渲染与以往移动GPU之间的清晰架构界限。该Adreno Neural Fusion GPU于2026年9月2日宣布推出,其每个处理切片中均嵌入了被称为“矩阵核心”(Matrix Cores)的专用AI计算单元。Unity和虚幻引擎均已实现原生集成,允许开发者在不编写自定义代码的情况下启用AI增强渲染功能。
对于安卓旗舰用户而言,实际影响显而易见:在下一代骁龙设备上游玩或下载的游戏,应在相同的功耗范围内提供更长的电池续航和更清晰的画面。这是通过在图形芯片内部完全执行超分辨率和帧生成技术实现的,从而消除了将数据往返传输至独立AI处理器的需求。
Adreno Neural Fusion的定义性架构转变并非仅仅在于支持AI——因为每颗骁龙芯片中的Hexagon NPU已经能够处理AI推理。相反,创新之处在于位置布局:AI计算 resides 位于三个GPU切片的内部,与用于基于图块的渲染的18MB Adreno高性能内存(HPM)同地部署。正如高通官方博客所述,HPM为GPU提供了“大容量、低延迟的内存,使得基于图块的渲染、帧缓冲区和计算工作负载能够保留在图形子系统本地。”
移动GPU采用基于图块的延迟渲染技术,将帧缓冲区细分为较小的部分,并在将最终输出提交到系统RAM之前,完全在快速的片上内存中处理每一部分。这片上内存即为18MB HPM。通过将AI推理数据容纳在同一存储池中,超分辨率和帧生成算法可以以与GPU原生操作相同的速度进行读写。Snapdragon Game Super Resolution (SGSR) 的GitHub文档证实,SGSR v2已经利用时序数据来增强超分辨率效果;Neural Fusion通过将这些推理任务迁移到专用硬件上,进一步提升了这一能力。
之前的实现方案,包括高通自家的Snapdragon Game Super Resolution,是在通用着色器核心上执行超分辨率,同时将较重的AI任务路由至Hexagon NPU。根据The Futurum Group对早期GSR的分析,初始方法是一种针对Adreno GPU优化的单遍空间技术,虽然节省了电力,但牺牲了重建质量。将数据卸载至NPU需要写入共享内存或DRAM,穿越芯片的系统互连总线,等待推理完成,然后读取结果返回——每一步都会引入延迟和能量开销。矩阵核心通过将AI推理物理定位在渲染管线旁边,绕过了这些总线交叉。
高通表示,与上一代Snapdragon Game Super Resolution系统相比,该架构可将功耗降低高达40%。这一自我报告的数据基准是对比高通自身的先前解决方案,并将在骁龙峰会后等待独立的第三方验证。此外,更广泛的GPU架构带来了额外的12%代际效率提升,这与是否激活Neural Fusion无关。
据AndroidHeadlines对该公告的报道,矩阵核心的运行频率为1.45GHz,与其宿主GPU切片的时钟速度相匹配。这高于当前骁龙8 Elite Gen 5中Adreno 840 GPU的1.2GHz频率。
Adreno矩阵核心并非孤立的增强功能。它们完善了高通所描述的涵盖所有三个核心计算引擎的平台级矩阵加速策略,这一框架在XenoSpectrum的Neural Fusion分析中有所详述。
Hexagon NPU已在多代骁龙芯片中配备了专用矩阵计算单元,作为持续后台AI推理的主要枢纽。Oryon CPU于2026年8月25日预览发布,引入了可扩展矩阵扩展(Scalable Matrix Extension)支持,将矩阵加速直接嵌入CPU核心,以支持与前台应用程序并行运行的AI任务。随着矩阵核心现在集成到Adreno GPU切片中,即将推出的旗舰骁龙平台上的每一个主要处理引擎都可以加速通用矩阵乘法运算——这是几乎所有神经网络推理的基础数学原语。
这种架构实现了动态工作负载路由:平台可以将AI推理任务分配给最合适的引擎,利用NPU处理持续的后台模型,利用CPU处理前台操作,并利用GPU矩阵核心处理必须在图形管线内顺序执行的AI进程。
在Moor Insights & Strategy于9月2日发布的一篇分析中,首席分析师Anshel Sag将Adreno矩阵核心架构描述为“类似于苹果在Apple Silicon GPU中所做的工作”,指的是苹果在其A系列和M系列芯片中集成嵌入式矩阵计算单元的做法。Sag强调,GPU矩阵核心在与NPU并列的同时,提供了有意义的互补AI计算容量。它们并没有取代NPU,而是将一类对延迟敏感的AI工作负载路由到专门为此设计的硅片上。
Adreno Neural Fusion将两种不同的AI渲染能力整合到单一管线中。第一种是AI超分辨率:游戏以较低的分辨率进行内部渲染,以降低GPU工作负载和功耗,而矩阵核心则执行神经网络,以高保真度重建全分辨率输出。以前的移动超分工具如高通的GSR v1依赖没有运动数据的空间算法,而GSR v2虽然结合了时序数据,但仍运行在传统的着色器核心上。Neural Fusion在专用硬件上执行,使得以更低的功耗成本运行更复杂的网络架构成为可能——这一技术演进已在GSR GitHub仓库中得到记录。
第二种能力是帧生成:矩阵核心使用运动矢量和光流数据合成原生渲染帧之间的中间帧。GPU不再从头生成每一个显示帧,而是生成较少的基础帧,并利用AI填补空白,在保持流畅视觉体验的同时降低GPU利用率。高通将其描述为“通过在骁龙图形管线中直接构建AI增强渲染,提供稳定的帧率和提高效率。”
与所有主要的PC帧生成实现一样,存在一个关键的注意事项:合成的帧是在它们插值的原生帧之后计算的,因此在等效帧数下,相对于原生渲染会引入显示延迟。Hardware Unboxed和Digital Foundry的研究表明,在典型的帧率目标下,延迟会增加10到30毫秒,具体取决于配置。这种延迟对于叙事驱动、单人游戏和休闲体验来说是不可感知的。然而,对于依赖反射输入的竞争激烈的移动游戏,通常不建议使用帧生成——高通的AI渲染套件并未改变这一根本权衡。此外,报告的40%节能仅适用于超分辨率工作负载。优先考虑最小化触摸到显示延迟的竞争玩家应观察开发者在具体游戏中如何实现帧生成。
硬件能力和消费者发布往往处于采用管道的两端。在第一方展示中演示帧生成的GPU代表了令人印象深刻的工程成就,但最终能到达玩家手中的,是那些能力已内置于工作室赖以生存的开发工具中的GPU。
高通确认,Unity和虚幻引擎——推动全球绝大多数移动游戏的框架——已经原生集成了Neural Fusion。针对任一平台的开发者都可以在现有工作流程中激活超分辨率和帧生成,无需自定义渲染代码或等待引擎更新。正如HotHardware报道的那样,这种集成随产品上市日期发布,而不是停留在未来的路线图之上。
这是关键的跨界机制。NVIDIA DLSS提供了直接的平行案例:当该技术于2018年推出时,它需要针对每个标题进行自定义集成,直到工作室流水线对齐后才得以广泛采用。高通的预集成方法旨在完全绕过这种摩擦。