以后手机GPU渲染游戏画面,不用再吭哧吭哧把每个像素都算出来了。
一部分像素可以交给AI来“画”。
Arm发布了首款内置专用神经网络加速器的Mali GPU——
Mali G2-Ultra NX。
在神经网络处理场景下,新GPU的每瓦性能最高可以提升4倍。

这还只是Arm此次更新的一小部分。
手机这边,GPU开始用AI补像素,C2 CPU集群则负责给系统级Agent编排任务;
云端,Arm推出了面向智能体工作负载的AGI CPU,以及性能最高达到上一代两倍的Neoverse CSS N4;
到了物理世界,Arm又把Total Design生态项目扩展到机器人,还准备参照自动驾驶的思路,给机器人的自主能力从Level 0一路划到Level 5。
在刚刚举行的Arm Everywhere China 2026大会上,Arm一口气把云端、边缘和物理AI的几项新进展摆到了台前。

如果对Arm不太熟悉,可以简单把它理解成计算世界里的底层建筑师。
Arm通常不直接生产大家能买到的手机、电脑或机器人,而是提供CPU、GPU等IP,以及已经组合、验证好的计算子系统,让芯片公司和设备厂商在这些技术基础上继续开发产品。
这套底层技术已经铺得相当广。
Arm执行副总裁兼首席商务官Will Abbey在现场提到,Arm全球合作伙伴累计出货的芯片已经超过3500亿颗。
如果按照一秒一颗往下数,大约需要1.1万年才能数完……它们已经藏进手机、电脑、汽车和服务器。
现在,Arm准备让这些芯片干的活儿,又多了不少。
手机GPU,开始用AI「画画」了
先看距离普通用户最近的一项发布:
第二代移动终端计算子系统Arm CSS for Mobile 2。

过去提到手机上的AI算力,大家最先想到的通常是NPU。
但随着AI从拍照优化、语音识别这类单项功能,逐渐变成持续运行的系统级Agent,计算方式也开始变化。
比如让手机Agent帮忙安排一次纪念日晚餐,它要先听懂要求,读取时间、位置和个人偏好,再去搜索餐厅、比较选项、调用应用,最后完成预订。
一条指令背后,可能同时拉起多个线程、应用、模型与工具。负责维持上下文、分配任务和协调不同计算单元的,依旧离不开CPU。
Arm边缘AI执行副总裁Chris Bergey在现场给CPU安排了一个新身份:
Agent系统里的编排引擎。
为了承接这类任务,CSS for Mobile 2搭载了全新的C2 CPU集群,包括C2-Ultra、C2-Pro,以及两组SME2单元。
其中,C2-Ultra相比上一代C1-Ultra,AI性能最高达到1.7倍,单线程性能最高提升15%;在相同性能下,功耗最高降低38%。
翻倍的SME2算力,则可以让部分小语言模型的运行速度最高提升70%。
CPU忙着给Agent调兵遣将,旁边的GPU也开始换工作方式了。
此次同步发布的Mali G2-Ultra NX,是首款内置专用神经网络加速器的Mali GPU。
这意味着,AI不再只是运行在GPU之外的辅助工具,而是可以直接进入图形渲染管线,参与画面生成。
传统GPU要呈现一张高质量画面,通常需要老老实实计算大量像素。现在,开发者可以先用较低分辨率进行渲染,再让神经网络重建更多画面细节;也可以让AI生成中间帧、清理光线追踪中的噪点。
说白了,就是让GPU少干一部分“笨活”,再让AI把画面补回来。

按照Arm给出的数据,Mali G2-Ultra NX在神经网络处理场景下,每瓦性能最高提升4倍;即使面对传统游戏内容,图形性能相比上一代也能最高提升14%。
这套能力已经开始往真实游戏里走。
网易《燕云十六声》计划在今年推出支持神经超级采样的版本;腾讯游戏正联合《暗区突围:无限》进行神经超级采样与降噪演示;叠纸游戏《无限暖暖》也在推进相关技术集成。
Arm还与Unity中国合作,把神经图形技术原生集成到团结引擎中。
Agent不睡觉,服务器也得换个干法
手机里的AI越来越忙,云端Agent带来的计算压力只会更大。
Arm云AI业务拓展副总裁Eddie Ramirez在现场提到了一个变化:
过去很多云计算任务是突发式的,任务来了开始计算,完成后便释放资源。
Agent却可能一天24小时持续运行。一个目标会触发数百次工具执行、API调用、数据库访问,甚至拉起其他Agent共同协作。
于是,数据中心面对的不只是模型推理压力,还有大量长期存在的任务调度和执行负载。
Agent时代的新瓶颈,可能不只在AI加速,也在编排。这正是Arm想继续扩大服务器CPU存在感的切口。
据披露,自2019年推出Neoverse以来,全球数据中心累计部署的Neoverse核心已经达到15亿颗。其中,从零增长到10亿颗用了约六年,而从10亿增加到15亿,用时不到一年。
此次新发布的Neoverse CSS N4,主要面向希望开发差异化基础设施芯片的合作伙伴。
单颗裸片最高可以配置128个CPU核心,支持LPDDR6内存和PCIe Gen 7互连。相比上一代CSS N3,性能最高达到2倍,每瓦性能最高达到1.25倍,内存带宽最高达到1.75倍。
如果企业不想自己设计一颗芯片,Arm还准备了另一条路:
直接采用量产就绪的Arm AGI CPU。

这两项产品瞄准的需求并不完全相同。
Neoverse CSS N4强调灵活配置,适合DPU、网络芯片和定制计算平台;AGI CPU则强调快速部署,主要承接对响应速度要求更高的Agent任务。
目前,OpenAI、Meta、Cloudflare、Oracle、SAP、联想等公司都在围绕Arm AGI CPU开发相关方案。
火山引擎则计划把首批基于该CPU的智能体沙箱推向市场,为Agent提供隔离、安全并且可以弹性扩展的执行环境。
Arm还与新紫光集团宣布深化合作,计划在中国成立联合通用人工智能创新中心,研究智能体编排、CXL内存池化、机架级系统架构和边缘AI等方向。
整体来看,Arm并非押注一种服务器形态通吃所有AI负载,而是提供从IP、CSS到完整CPU的多种选项。

客户可以自己造,也可以直接用,Arm负责让它们尽量运行在同一套架构和软件生态上。
机器人,也要有自己的能力等级了
AI从云端进入手机之后,再往前一步,就是让它真正控制机器,在现实世界中行动。
目前,机器人行业还没有一套像自动驾驶分级那样被广泛采用的共同语言。不同企业对“智能”“自主”和“通用”的理解并不完全相同,系统需求也各有一套口径。
因此,Arm这次还提到了机器人能力分级框架。
初步思路是可以将机器人的能力从Level 0一直划到Level 5:
最低等级是只能根据外部刺激作出固定反应的机器人,最高等级则指向能够自主学习和训练的机器人。
每个等级不只描述机器人“能干什么”,还会对应时延、算力部署位置、内存、功耗、确定性和安全性等底层系统要求。

不过,Arm对这套框架的定位更接近一份“邀请函”:
先提出初始框架,再邀请机器人公司、芯片厂商、模型企业和研究机构共同讨论、补充和完善。
同时,Arm还把此前主要服务于云端芯片开发的Total Design生态项目扩展到物理AI,目前已经汇聚超过80家合作伙伴,覆盖AI模型、软件、传感器、计算硬件、虚拟平台和数字孪生等环节。

到了Agent时代,发生变化的远不止硬件设备的形态。
3500亿颗芯片之后,全新计算需求也正在不断涌现。
但即使领域已经从手机、服务器一路扩展到机器人,Arm依旧选择站在底层基座的位置,输出IP、计算子系统与开发工具,交由生态伙伴完成上层的创新落地。
文章来自于"量子位",作者 "闻乐"。