5252a haose01我愿

5252a haose01我愿

「活动」注册就送新人大礼包
95.21MB 版本 V7.64.14 已通过安全检测
下载 5252a haose01我愿,安装你想要的应用,更方便、更快捷,发现更多优质软件。
54% 好评(91人)
47 条评论

应用截图

5252a haose01我愿 5252a haose01我愿 5252a haose01我愿 5252a haose01我愿

版本更新

V5.25.40
5252a haose01我愿电脑版本-5252a haose01我愿2026最新版v.1.1.4.6-22265安卓网

详细信息

软件大小
58.67MB
最后更新
2026-09-09 23:13:19
最新版本
V0.57.05
文件格式
APK
应用分类
使用语言
中文
网络要求
需要联网
系统要求
Android 5.0+

应用介绍

〖One〗,中国最缺大学的省,疯狂建大专-85b83d83

,Token 之后,谁来组织 AI 计算?Arm 寻找下一代计算的答案 Token 之后,AI 计算进入协同竞争时代。 如果说今年 3 月,Arm 推出首款自研 CPU 芯片,是这家公司向市场释放的一个信号,它开始尝试突破过去「只提供底层架构授权」的角色边界。那么在上海举办的 Arm Everywhere China 活动上,Arm 想传递的信息更加明确,不要再用过去「CPU IP 供应商」的方式理解今天的 Arm。 在这场活动中,Arm 没有只围绕某一个产品展开叙事,而是第一次更加完整地将自己的未来方向拆成三条线,云 AI、边缘 AI 和物理 AI。 和往年不太一样,去年 Arm 的主题演讲几乎全部围绕一件事展开 SME2,也就是让 AI 在 CPU 上跑起来。那是一个典型的「架构升级」叙事。但今年的主题演讲,三位业务负责人分别讲边缘 AI、物理 AI 和云 AI,围绕场景展开,算力会在云、端侧和物理世界之间流动,而 Arm 想成为这个「计算基建」的底座。 今年的 Arm 试图回答的是另一个问题,当 AI 正在重新改变计算方式时,下一代计算平台应该如何被设计?当 AI 计算正在从单一芯片性能竞争,转向多个计算单元协同竞争时,谁能够组织这些计算资源?我们惊讶地与多位 Arm 高管的交流中发现,当下的算力平台似乎不再追求为某一种确定的未来而设计,而是选择拥抱某种不确定性。 过去几十年,Arm 最成功的商业模式是通过 CPU 架构和 IP 授权连接整个半导体产业。芯片厂商基于 Arm 架构设计 SoC,终端厂商基于这些芯片打造产品,而 Arm 通过开放授权模式成为移动计算时代的重要基础设施。到今天,基于 Arm 技术的芯片累计出货已经超过 3500 亿颗。 过去,芯片竞争更多围绕单一指标展开,需要更强的 CPU、更大的 GPU、更先进的制程。但进入 AI 时代后,一次完整的 AI 任务已经不再只是某一个计算单元完成,AI 任务也从单次计算逐渐走向连续推理、多模态交互以及智能体式的任务执行。这意味着,未来计算竞争的关键不只是拥有多少算力,而是如何让不同计算资源更加高效地协同。 这次活动的主题演讲,Arm 重点讲述了在不同任务场景里的算力需求变化。 在边缘 AI 领域,算力从「被动响应」到「持续运行」。两年前的 AI 是你问一句、它答一句,任务结束;今天的智能体则要理解上下文、检索本机数据、调用应用、在用户授权下自主完成任务,而且要在手机的功耗和散热约束下持续运行。终端设备正在从执行应用和处理数据的工具,变成能够理解意图、实时响应的智能节点。 在物理 AI 领域,算力从「车」转移到「机器人」。Arm 过去在汽车上的角色是提供安全、实时、低功耗的计算底座,而现在它走到了机器人上,两者共同的特征是感知和执行,都要求从「传感器」到「执行」的延迟足够短。 在云端 AI 领域,Arm 引用 IDC 的数据说,基于 Arm 架构的机架级服务器市场规模已经超越 x86,成为加速计算的主流平台。过去二十年数据中心 CPU 面向的是横向扩展的突发性负载,但智能体则是持续的,一个智能体能发起数百次调用。 「在智能体时代,CPU 的角色不再是加速,而是编排」。Arm 基础设施业务的负责人提到,这也是 Arm 开始改变自身角色的原因。如果继续停留在过去的 IP 授权模式,Arm 可以提供优秀的 CPU 架构,但无法参与决定一次 AI 任务最终如何完成。因此,近几年 Arm 开始逐渐从单纯提供 IP,走向提供更加完整的平台能力。如今,客户可以买 Arm 的 IP、也可以买 CSS,甚至可以买芯片。 但今年最明显的不同,是 Arm 开始正面拥抱 AI 时代最大的特点:不确定性。 下一代终端到底是什么形态,端侧模型最终会发展到什么规模,智能体的算力应该放在 CPU、NPU 还是云端,目前都没有明确答案。Arm 自己也没有假装自己看到了答案。在媒体沟通会上,我们问了很多关于「谁来决定」的问题,得到的回答却都是「待定」。 当被问到 CPU 和 NPU 之间的分工由谁来定,他们认为「系统的所有者拥有控制权」;问 CPU 会不会比 NPU 更重要,他们提到「行业在寻找下一个平衡点」;问 CSS 会跨领域复用还是持续分化,他们回答是「取决于市场需要」;问未来 GPU 里传统着色器和神经计算的资源比例怎么分,他们回答是这个决定「留给芯片合作伙伴」。 从这里我们看出,Arm 和英伟达区别之一就在于英伟达的路线是「我知道未来 AI 计算是什么样,所以我构建一个完整的平台」;Arm 的路线是「未来 AI 计算还没有确定,所以我要构建一个允许变化的平台」。前者用 CUDA 把开发者锁进一种范式,后者把范式的决定权交出去,只保证无论选哪一种,底座都有 Arm 参与搭建。 理解了这一点,再看 Arm 这次发布的每一个产品,会发现它们的设计思路都是同一个逻辑的不同表达,不替客户做决定,但让每一种决定都能跑得更好。 Arm 重新定义 CPU、GPU 和 CSS 过去,芯片厂商习惯于围绕不同功能划分计算单元。CPU 负责通用计算,GPU 负责图形处理,NPU 负责 AI 加速。这种分工在过去几十年里非常有效。但 AI 时代正在模糊这些边界。尤其是在端侧,AI 任务并不是简单地把一个模型丢给某个加速器运行,而是包含了理解、记忆、推理和执行等多个环节。不同阶段需要协调不同类型的计算资源。 因此,未来芯片竞争的重点,可能不再是谁拥有更强的单一计算单元,而是谁能够让这些计算单元更高效地协同。 当 AI 计算不再由单一芯片决定,未来的计算平台应该如何重新设计?我们可以从 Arm 此次发布的 CPU、GPU和 CSS 平台后看看 Arm 的最新思考。 CSS for Mobile 2:第一个 AI 原生计算子系统,重组 SoC 设计方式 过去客户获得的是不同的 IP 模块,需要自行完成大量设计和优化。而 CSS 是 Arm 打造的一套计算子系统,可以让客户能够更快构建面向 AI 时代的芯片,也就是说,是一个「半成品」的芯片设计方案。 有意思的是,去年的第一代 CSS for Mobile 当时叫 Lumex,今年改名为 CSS for Mobile 2,Arm 说是为了让人一眼看出这个子系统面向哪个行业,也从单个 IP 升级到完整 AI 计算平台。 9 月 8 日,Arm 将刚刚推出的 CSS for Mobile 2 定义为首个 AI 原生移动计算子系统,包括 Arm C2 CPU cluster、Mali G2-Ultra NXGPU、SI L2 system interconnect 以及软件和开发工具。 相比上一代,单线程性能提升最高 15%,多线程性能提升最高 12%,网页浏览速度提升最高 15%,应用启动速度提升最高 12%,AI 模型性能最高提升 1.7 倍。 这次发布的 Neoverse CSS N4 是 Arm 迄今可配置性最高的 CSS,单颗裸片支持 128 个 CPU 核心配置,也是首款支持 LPDDR6 和 PCIe Gen 7 的 Neoverse CSS;相比上一代 CSS N3,插槽性能最高提升至 2 倍,每瓦性能最高提升 25%,内存带宽最高提升 75%。 在系统层面,N4 进一步强化了内存和 I/O 能力,以满足智能体 AI 时代更高的数据移动需求。「智能体工作负载让内存需求比以往任何时候都高,在内存访问过程当中,每一纳秒都是非常重要的」,Arm 高管解释道。 CSS 模式的价值已经在产业链中得到验证。微软基于 Neoverse CSS 在 18 个月内完成两代 Cobalt CPU 的交付;云豹智能则基于 CSS N2 构建 DPU 产品。 当被问到 CSS 会不会跨领域复用时,Arm 高管提到「未来我们的产品怎么走,取决于客户到底需要什么。」 Arm 不预设 CSS 应该长什么样,它只希望无论市场往哪个方向走,这个底座都跟得上。「我们服务的还不仅仅只是开发人员,我们还要考虑到智能体。」对 Arm 而言,CSS 的意义并不只是减少客户设计时间,而是把过去分散的 IP 组合成一个可以面向未来变化调整的平台。 C2-Ultra CPU :重新定义 AI 时代 CPU 的位置 在 AI 浪潮的前几年,行业曾经出现一种观点:随着 NPU 等专用加速器的发展,CPU 的重要性可能会下降,手机芯片的竞争会逐渐转向 TOPS 竞争。 Arm 此次推出的 C2 CPU 集群参考配置为 2 颗 C2-Ultra 加 6 颗 C2-Pro,并通过 DynamIQ Shared Unit(DSU)共享 L3 缓存,同时配置两个 SME2 单元增强 AI 工作负载处理能力。相比上一代 C1-Ultra,C2-Ultra 单线程性能提升 15%,多线程性能提升 12%。在实际终端体验中,Arm 测试显示网页浏览速度提升 15%,应用启动速度提升 12%,AI 工作负载性能最高提升 1.7 倍,相同性能下功耗最高降低 38%。Arm 认为,C2 延续了近几年 CPU 性能持续实现「双位数提升」的趋势。 但相比这些性能数字,Arm 更想强调的是一个新的应用场景:Agent。 传统应用更多是用户发起一次请求,系统完成一次任务。但当 AI Agent 进入终端之后,一个任务可能会经历理解用户意图、调用本地数据、生成内容、访问应用服务等多个阶段。一次完整的 AI 任务,不再只是某一个模型推理过程,而是多个计算资源共同参与的连续流程。 例如,用户让手机帮助规划一次旅行。系统首先需要理解用户需求,然后读取本地日历、照片、位置等信息,再调用模型生成计划,最后可能还需要连接第三方应用完成预订。在这个过程中,并不是所有步骤都需要 NPU 完成。有些任务需要低延迟响应,有些需要访问系统资源,有些需要在 CPU、GPU、NPU 之间完成协同。而这些工作,正是 CPU 长期以来擅长的领域。 Arm 工程师在沟通中提到,对于 AI Agent 这样的新型工作负载,峰值算力并不是唯一指标,整个任务链路中的延迟和效率同样重要。因此,未来 CPU 并不会取代 NPU,而是在 AI 计算体系中承担更加重要的基础角色。 Mali G2-Ultra NX GPU:重新定义视觉计算 如果说 C2 CPU 回答的是「AI 时代谁负责组织计算」,那么 GPU 回答的是另一个问题:未来终端的视觉体验,是否会因为 AI 而被重新设计? 移动设备始终面临一个无法绕开的限制,用户希望看到接近 PC 和主机级别的视觉效果,但手机的功耗、散热和电池容量不会无限增长。过去提升画质主要依靠增加 GPU 算力,而 AI 正在提供另一种路径,让 GPU 用更少的计算完成更复杂的视觉效果。 对于游戏开发者而言,这意味着过去因为移动设备性能限制无法实现的视觉效果,开始有机会进入终端设备。 Arm 此次推出首款集成神经网络加速能力的 Mali G2-Ultra NX GPU,本质上是在重新设计 GPU 和 AI 之间的关系。这是第一款将神经网络加速器直接集成到着色器内核中的 Mali GPU。 该加速器支持 int8 和 int16 计算,神经网络加速器的运行频率最高可达到 GPU 时钟频率的两倍,并与执行引擎共享 L1、L2 缓存,可以作为图形管线的一部分参与调度。同时,它拥有独立功耗门控,在不使用时可以关闭。 这意味着 AI 不再只是 SoC 中的一个独立模块,而开始进入传统图形处理流程。 在传统渲染中,GPU 需要计算大量真实像素;而在 AI 原生图形中,GPU 可以只生成部分内容,再由 AI 完成重建。例如,神经超级采样可以只渲染四分之一像素,其余由 AI 恢复;神经帧率超分可以在两帧真实渲染之间生成额外帧;神经超级采样结合降噪,则可以减少光追需要计算的光线数量,再通过 AI 恢复画面质量。 Arm 工程师表示,这套网络采用卷积网络而非 Transformer,模型经过高度压缩,功耗不到 1 瓦。目前 Arm 主要聚焦单帧插值,并没有走向 DLSS 类似的多帧生成路线。 除了 AI 图形能力,G2-Ultra NX 也继续增强传统渲染能力。它采用了 Mali 七代以来最大的一次指令集重构,每个线程组寄存器数量翻倍,寄存器分配从固定 32 或 64 改为 16 为单位动态分配,从而减少寄存器溢出,并支持包括 Unreal Engine 5 Lumen、Nanite 在内的复杂图形工作负载。 同时,Arm 带来了第三代光追单元,通过更紧凑的三角形表达消除冗余数据、减少内存访问,主流光追基准场景下 DRAM 流量最高降低 13%。配合硬件级遮挡剔除(OMM),光线追踪工作负载最高降低 70%,帧率最高提升 30%。在传统渲染方面,游戏基准综合性能平均提升 20% 但 Arm 并没有试图定义唯一的 AI 图形方案。 在《光影新生》的展示中,Arm 展示了 AI 重建和光追结合后的移动端视觉效果。与此同时,Arm 将神经图形相关模型开源到 Hugging Face 和 GitHub,让开发者可以根据自己的游戏风格重新训练模型。 《光影新生》将在 6-12 月内上线|图片来源:极客公园 Arm 高管提到,移动设备种类非常复杂,不同产品拥有不同的功耗预算,因此未来 GPU 中传统着色器和神经计算资源的比例,不应该由 Arm 单独决定,而应该由合作伙伴根据产品定位调整。 SME2:真正的竞争不只是硬件,而是如何让 AI 能力被使用 在沟通会上,Arm 高管坦率表示,SME2 引擎本身与去年保持一致,今年的变化更多体现在 CPU 集群中加入更多 SME2 单元,以及围绕指令集和软件生态进行优化。 如果说 C2 CPU 代表了 Arm 对「AI 时代 CPU 应该扮演什么角色」的判断,那么 SME2 则体现了 Arm 另一层思考:硬件能力最终能否产生价值,取决于软件生态能否真正调用它。 去年,Arm 介绍最多的技术之一就是 SME2。它通过扩展 CPU 处理矩阵计算和向量计算的能力,让更多 AI 工作负载能够运行在 CPU 上。 但今年,Arm 关注的重点已经发生变化。SME2 不再只是一个新的 CPU 指令集,而正在成为 Arm 推动 CPU AI 生态的重要入口。 通过 KleidiAI 等软件优化,Arm 希望降低开发者调用 CPU AI 能力的门槛。目前 KleidiAI 已经支持多个 AI 框架和应用,让开发者不需要针对每一款芯片单独优化,就能够利用 CPU 中的 AI 加速能力。这也体现了 AI 时代芯片竞争逻辑的变化。 过去,芯片厂商竞争的是有没有新的硬件能力;但在 AI 时代,真正决定体验的,是这些能力能否被软件生态快速使用。对于开发者而言,他们并不关心芯片内部增加了多少指令集,而更关心自己的模型和应用能否在不同设备之间快速迁移。 从 C2 CPU,到 SME2,再到 Mali G2-Ultra NX 和 CSS for Mobile 2,Arm 实际上都在回答同一个问题:AI 时代,竞争不再只是制造更强的计算单元,而是让不同计算能力能够被更高效地组织和使用。 如果说过去几年 AI 产业竞争的核心,是如何训练更大的模型、拥有更多参数,那么进入推理时代后,行业正在面对另一个问题:模型产生 Token 之后,如何让这些 Token 被更高效地处理和分配。 随着智能体、多模态应用的发展,一次完整的 AI 任务已经越来越少由单一芯片完成。一个用户请求背后,可能包含语音识别、信息检索、本地数据访问、模型推理、应用调用等多个步骤,而这些步骤可能分别适合运行在 CPU、GPU、NPU 甚至云端。 因此,未来 AI 计算竞争的重点,可能正在从「制造智能」转向「管理智能」、「编排智能」。 Token 会被分散到云、边缘和终端不同位置产生,而决定一个任务应该在哪里运行、什么时候调用哪一种计算资源,以及如何降低整个流程的延迟,会成为芯片产业下一阶段需要解决的问题。 联想高级副总裁贾朝晖在活动现场提出了一个更激进的判断,未来可能有 80% 的 Token 生成会发生在本地设备上。无论这个比例最终是否实现,它都反映出一个趋势,AI 正在从云端走向更多边缘场景,终端设备将不再只是数据入口,而可能成为智能计算的重要节点。 但未来芯片的竞争或许不再是谁能生成更多 Token,而是谁能够以更低成本、更低延迟处理这些 Token。围绕这个问题,一场关于「谁来决定计算资源如何分配」的竞争正在展开。 芯片上下游的公司正在给出不同答案。英伟达选择的是通过 CUDA 构建从硬件到软件的完整 AI 计算平台。过去几年,CUDA 生态帮助英伟达掌握了数据中心 AI 计算入口,而随着 AI 向端侧延伸,英伟达也开始尝试将这套逻辑带到更多设备场景。 苹果则选择了另一条路线。通过自研芯片、操作系统以及应用生态的深度结合,苹果能够在设备内部完成软硬件协同,自己决定不同任务应该如何分配。 高通希望围绕 Snapdragon 平台成为端侧 AI 的重要入口,通过 CPU、GPU、NPU 和软件生态的组合,让 AI 能力更容易进入手机和 PC 等终端设备。 三星则试图通过芯片、存储和终端产品之间的协同形成优势。在 AI 时代,计算效率不仅取决于处理器性能,也取决于数据如何在计算单元和存储之间流动。 相比这些路径,Arm 选择的是另一种方式。当被问到未来 CPU、GPU 和 NPU 之间的任务分配是否会由 Arm 来决定,以及 Arm 是否会建立统一的 AI 调度层时,Arm 给出的答案是否定的。 Arm 认为,最终的调度权应该交给系统拥有者,由 OEM 厂商、芯片设计公司以及软件开发者根据自己的产品需求决定任务运行在哪里。Arm 自身做的,是确保每一个计算单元都具备足够强的基础能力,并通过软件生态让这些能力更容易被调用。这其实也是 Arm 长期商业模式的延续。 过去,Arm 并不制造最终设备,而是通过开放架构让不同厂商基于 Arm 设计自己的产品。进入 AI 时代后,Arm 并没有试图成为唯一的计算调度者,而是希望成为不同计算资源能够高效协同的基础平台。 从这个角度看,Arm 此次发布的 CPU、GPU、CSS 以及软件生态,并不是单纯增加某一个计算单元的能力,而是在回答同一个问题:当 AI 计算越来越复杂时,如何让不同资源更高效地组合在一起。 未来,芯片竞争的标准可能不再只是「谁拥有最强的计算单元」。因为 AI 时代真正困难的问题,不是产生更多 Token,而是让每一个 Token 在正确的时间、通过正确的计算资源完成任务。 过去三十年,Arm 通过指令集架构连接了移动计算产业;未来,它希望通过计算子系统、软件生态以及系统级优化,继续成为 AI 时代计算基础设施的一部分。 在一个未来形态仍未确定的时代,Arm 选择的不是预测唯一答案,而是建立一个能够适应不同答案的平台。 这或许也是它对 AI 时代最大的判断,下一个阶段的竞争,不只是计算能力的竞争,而是组织计算能力的竞争。 本文为极客公园原创文章,转载请联系极客君微信 geekparkGO 加州时间 9 月 9 日,苹果秋季发布会开场,这也是新 CEO 特纳斯上任后的第一场 keynote。折叠屏 iPhone、涨价、AI……苹果这一次究竟能拿出多少「新东西」? 本周四凌晨 00:40,极客公园视频号直播间,我们和极客公园副主编靖宇、极客公园作者 Alan,一起聊聊:新 CEO 特纳斯的第一场大考,苹果到底有多「特努力」? 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 都市快报橙柿互动 2026-09-09 11:41:44 上观新闻 2026-09-09 11:35:29 参考消息 2026-09-08 21:47:08 半岛都市报 2026-09-09 07:35:10 澎湃新闻 2026-09-08 23:14:11 新京报评论 2026-09-09 14:41:24 广东卫视 2026-09-09 16:44:44 闪电新闻 2026-09-09 14:58:38 中国能源网 2026-09-09 08:15:10 政知新媒体 2026-09-09 15:28:16 中国新闻周刊 2026-09-09 18:04:48 界面新闻 2026-09-09 10:48:37 证券时报 2026-09-09 21:06:03 参考消息 2026-09-09 12:27:49 国家统计局 2026-09-09 09:33:56 大风新闻 2026-09-09 20:38:28 吉刻新闻 2026-09-09 21:11:22
〖Two〗,狄龙谈换发型:只是觉得变更清爽了 发型是我释放自己的一个途径-c07302bf,Token 之后,谁来组织 AI 计算?Arm 寻找下一代计算的答案 Token 之后,AI 计算进入协同竞争时代。 如果说今年 3 月,Arm 推出首款自研 CPU 芯片,是这家公司向市场释放的一个信号,它开始尝试突破过去「只提供底层架构授权」的角色边界。那么在上海举办的 Arm Everywhere China 活动上,Arm 想传递的信息更加明确,不要再用过去「CPU IP 供应商」的方式理解今天的 Arm。 在这场活动中,Arm 没有只围绕某一个产品展开叙事,而是第一次更加完整地将自己的未来方向拆成三条线,云 AI、边缘 AI 和物理 AI。 和往年不太一样,去年 Arm 的主题演讲几乎全部围绕一件事展开 SME2,也就是让 AI 在 CPU 上跑起来。那是一个典型的「架构升级」叙事。但今年的主题演讲,三位业务负责人分别讲边缘 AI、物理 AI 和云 AI,围绕场景展开,算力会在云、端侧和物理世界之间流动,而 Arm 想成为这个「计算基建」的底座。 今年的 Arm 试图回答的是另一个问题,当 AI 正在重新改变计算方式时,下一代计算平台应该如何被设计?当 AI 计算正在从单一芯片性能竞争,转向多个计算单元协同竞争时,谁能够组织这些计算资源?我们惊讶地与多位 Arm 高管的交流中发现,当下的算力平台似乎不再追求为某一种确定的未来而设计,而是选择拥抱某种不确定性。 过去几十年,Arm 最成功的商业模式是通过 CPU 架构和 IP 授权连接整个半导体产业。芯片厂商基于 Arm 架构设计 SoC,终端厂商基于这些芯片打造产品,而 Arm 通过开放授权模式成为移动计算时代的重要基础设施。到今天,基于 Arm 技术的芯片累计出货已经超过 3500 亿颗。 过去,芯片竞争更多围绕单一指标展开,需要更强的 CPU、更大的 GPU、更先进的制程。但进入 AI 时代后,一次完整的 AI 任务已经不再只是某一个计算单元完成,AI 任务也从单次计算逐渐走向连续推理、多模态交互以及智能体式的任务执行。这意味着,未来计算竞争的关键不只是拥有多少算力,而是如何让不同计算资源更加高效地协同。 这次活动的主题演讲,Arm 重点讲述了在不同任务场景里的算力需求变化。 在边缘 AI 领域,算力从「被动响应」到「持续运行」。两年前的 AI 是你问一句、它答一句,任务结束;今天的智能体则要理解上下文、检索本机数据、调用应用、在用户授权下自主完成任务,而且要在手机的功耗和散热约束下持续运行。终端设备正在从执行应用和处理数据的工具,变成能够理解意图、实时响应的智能节点。 在物理 AI 领域,算力从「车」转移到「机器人」。Arm 过去在汽车上的角色是提供安全、实时、低功耗的计算底座,而现在它走到了机器人上,两者共同的特征是感知和执行,都要求从「传感器」到「执行」的延迟足够短。 在云端 AI 领域,Arm 引用 IDC 的数据说,基于 Arm 架构的机架级服务器市场规模已经超越 x86,成为加速计算的主流平台。过去二十年数据中心 CPU 面向的是横向扩展的突发性负载,但智能体则是持续的,一个智能体能发起数百次调用。 「在智能体时代,CPU 的角色不再是加速,而是编排」。Arm 基础设施业务的负责人提到,这也是 Arm 开始改变自身角色的原因。如果继续停留在过去的 IP 授权模式,Arm 可以提供优秀的 CPU 架构,但无法参与决定一次 AI 任务最终如何完成。因此,近几年 Arm 开始逐渐从单纯提供 IP,走向提供更加完整的平台能力。如今,客户可以买 Arm 的 IP、也可以买 CSS,甚至可以买芯片。 但今年最明显的不同,是 Arm 开始正面拥抱 AI 时代最大的特点:不确定性。 下一代终端到底是什么形态,端侧模型最终会发展到什么规模,智能体的算力应该放在 CPU、NPU 还是云端,目前都没有明确答案。Arm 自己也没有假装自己看到了答案。在媒体沟通会上,我们问了很多关于「谁来决定」的问题,得到的回答却都是「待定」。 当被问到 CPU 和 NPU 之间的分工由谁来定,他们认为「系统的所有者拥有控制权」;问 CPU 会不会比 NPU 更重要,他们提到「行业在寻找下一个平衡点」;问 CSS 会跨领域复用还是持续分化,他们回答是「取决于市场需要」;问未来 GPU 里传统着色器和神经计算的资源比例怎么分,他们回答是这个决定「留给芯片合作伙伴」。 从这里我们看出,Arm 和英伟达区别之一就在于英伟达的路线是「我知道未来 AI 计算是什么样,所以我构建一个完整的平台」;Arm 的路线是「未来 AI 计算还没有确定,所以我要构建一个允许变化的平台」。前者用 CUDA 把开发者锁进一种范式,后者把范式的决定权交出去,只保证无论选哪一种,底座都有 Arm 参与搭建。 理解了这一点,再看 Arm 这次发布的每一个产品,会发现它们的设计思路都是同一个逻辑的不同表达,不替客户做决定,但让每一种决定都能跑得更好。 Arm 重新定义 CPU、GPU 和 CSS 过去,芯片厂商习惯于围绕不同功能划分计算单元。CPU 负责通用计算,GPU 负责图形处理,NPU 负责 AI 加速。这种分工在过去几十年里非常有效。但 AI 时代正在模糊这些边界。尤其是在端侧,AI 任务并不是简单地把一个模型丢给某个加速器运行,而是包含了理解、记忆、推理和执行等多个环节。不同阶段需要协调不同类型的计算资源。 因此,未来芯片竞争的重点,可能不再是谁拥有更强的单一计算单元,而是谁能够让这些计算单元更高效地协同。 当 AI 计算不再由单一芯片决定,未来的计算平台应该如何重新设计?我们可以从 Arm 此次发布的 CPU、GPU和 CSS 平台后看看 Arm 的最新思考。 CSS for Mobile 2:第一个 AI 原生计算子系统,重组 SoC 设计方式 过去客户获得的是不同的 IP 模块,需要自行完成大量设计和优化。而 CSS 是 Arm 打造的一套计算子系统,可以让客户能够更快构建面向 AI 时代的芯片,也就是说,是一个「半成品」的芯片设计方案。 有意思的是,去年的第一代 CSS for Mobile 当时叫 Lumex,今年改名为 CSS for Mobile 2,Arm 说是为了让人一眼看出这个子系统面向哪个行业,也从单个 IP 升级到完整 AI 计算平台。 9 月 8 日,Arm 将刚刚推出的 CSS for Mobile 2 定义为首个 AI 原生移动计算子系统,包括 Arm C2 CPU cluster、Mali G2-Ultra NXGPU、SI L2 system interconnect 以及软件和开发工具。 相比上一代,单线程性能提升最高 15%,多线程性能提升最高 12%,网页浏览速度提升最高 15%,应用启动速度提升最高 12%,AI 模型性能最高提升 1.7 倍。 这次发布的 Neoverse CSS N4 是 Arm 迄今可配置性最高的 CSS,单颗裸片支持 128 个 CPU 核心配置,也是首款支持 LPDDR6 和 PCIe Gen 7 的 Neoverse CSS;相比上一代 CSS N3,插槽性能最高提升至 2 倍,每瓦性能最高提升 25%,内存带宽最高提升 75%。 在系统层面,N4 进一步强化了内存和 I/O 能力,以满足智能体 AI 时代更高的数据移动需求。「智能体工作负载让内存需求比以往任何时候都高,在内存访问过程当中,每一纳秒都是非常重要的」,Arm 高管解释道。 CSS 模式的价值已经在产业链中得到验证。微软基于 Neoverse CSS 在 18 个月内完成两代 Cobalt CPU 的交付;云豹智能则基于 CSS N2 构建 DPU 产品。 当被问到 CSS 会不会跨领域复用时,Arm 高管提到「未来我们的产品怎么走,取决于客户到底需要什么。」 Arm 不预设 CSS 应该长什么样,它只希望无论市场往哪个方向走,这个底座都跟得上。「我们服务的还不仅仅只是开发人员,我们还要考虑到智能体。」对 Arm 而言,CSS 的意义并不只是减少客户设计时间,而是把过去分散的 IP 组合成一个可以面向未来变化调整的平台。 C2-Ultra CPU :重新定义 AI 时代 CPU 的位置 在 AI 浪潮的前几年,行业曾经出现一种观点:随着 NPU 等专用加速器的发展,CPU 的重要性可能会下降,手机芯片的竞争会逐渐转向 TOPS 竞争。 Arm 此次推出的 C2 CPU 集群参考配置为 2 颗 C2-Ultra 加 6 颗 C2-Pro,并通过 DynamIQ Shared Unit(DSU)共享 L3 缓存,同时配置两个 SME2 单元增强 AI 工作负载处理能力。相比上一代 C1-Ultra,C2-Ultra 单线程性能提升 15%,多线程性能提升 12%。在实际终端体验中,Arm 测试显示网页浏览速度提升 15%,应用启动速度提升 12%,AI 工作负载性能最高提升 1.7 倍,相同性能下功耗最高降低 38%。Arm 认为,C2 延续了近几年 CPU 性能持续实现「双位数提升」的趋势。 但相比这些性能数字,Arm 更想强调的是一个新的应用场景:Agent。 传统应用更多是用户发起一次请求,系统完成一次任务。但当 AI Agent 进入终端之后,一个任务可能会经历理解用户意图、调用本地数据、生成内容、访问应用服务等多个阶段。一次完整的 AI 任务,不再只是某一个模型推理过程,而是多个计算资源共同参与的连续流程。 例如,用户让手机帮助规划一次旅行。系统首先需要理解用户需求,然后读取本地日历、照片、位置等信息,再调用模型生成计划,最后可能还需要连接第三方应用完成预订。在这个过程中,并不是所有步骤都需要 NPU 完成。有些任务需要低延迟响应,有些需要访问系统资源,有些需要在 CPU、GPU、NPU 之间完成协同。而这些工作,正是 CPU 长期以来擅长的领域。 Arm 工程师在沟通中提到,对于 AI Agent 这样的新型工作负载,峰值算力并不是唯一指标,整个任务链路中的延迟和效率同样重要。因此,未来 CPU 并不会取代 NPU,而是在 AI 计算体系中承担更加重要的基础角色。 Mali G2-Ultra NX GPU:重新定义视觉计算 如果说 C2 CPU 回答的是「AI 时代谁负责组织计算」,那么 GPU 回答的是另一个问题:未来终端的视觉体验,是否会因为 AI 而被重新设计? 移动设备始终面临一个无法绕开的限制,用户希望看到接近 PC 和主机级别的视觉效果,但手机的功耗、散热和电池容量不会无限增长。过去提升画质主要依靠增加 GPU 算力,而 AI 正在提供另一种路径,让 GPU 用更少的计算完成更复杂的视觉效果。 对于游戏开发者而言,这意味着过去因为移动设备性能限制无法实现的视觉效果,开始有机会进入终端设备。 Arm 此次推出首款集成神经网络加速能力的 Mali G2-Ultra NX GPU,本质上是在重新设计 GPU 和 AI 之间的关系。这是第一款将神经网络加速器直接集成到着色器内核中的 Mali GPU。 该加速器支持 int8 和 int16 计算,神经网络加速器的运行频率最高可达到 GPU 时钟频率的两倍,并与执行引擎共享 L1、L2 缓存,可以作为图形管线的一部分参与调度。同时,它拥有独立功耗门控,在不使用时可以关闭。 这意味着 AI 不再只是 SoC 中的一个独立模块,而开始进入传统图形处理流程。 在传统渲染中,GPU 需要计算大量真实像素;而在 AI 原生图形中,GPU 可以只生成部分内容,再由 AI 完成重建。例如,神经超级采样可以只渲染四分之一像素,其余由 AI 恢复;神经帧率超分可以在两帧真实渲染之间生成额外帧;神经超级采样结合降噪,则可以减少光追需要计算的光线数量,再通过 AI 恢复画面质量。 Arm 工程师表示,这套网络采用卷积网络而非 Transformer,模型经过高度压缩,功耗不到 1 瓦。目前 Arm 主要聚焦单帧插值,并没有走向 DLSS 类似的多帧生成路线。 除了 AI 图形能力,G2-Ultra NX 也继续增强传统渲染能力。它采用了 Mali 七代以来最大的一次指令集重构,每个线程组寄存器数量翻倍,寄存器分配从固定 32 或 64 改为 16 为单位动态分配,从而减少寄存器溢出,并支持包括 Unreal Engine 5 Lumen、Nanite 在内的复杂图形工作负载。 同时,Arm 带来了第三代光追单元,通过更紧凑的三角形表达消除冗余数据、减少内存访问,主流光追基准场景下 DRAM 流量最高降低 13%。配合硬件级遮挡剔除(OMM),光线追踪工作负载最高降低 70%,帧率最高提升 30%。在传统渲染方面,游戏基准综合性能平均提升 20% 但 Arm 并没有试图定义唯一的 AI 图形方案。 在《光影新生》的展示中,Arm 展示了 AI 重建和光追结合后的移动端视觉效果。与此同时,Arm 将神经图形相关模型开源到 Hugging Face 和 GitHub,让开发者可以根据自己的游戏风格重新训练模型。 《光影新生》将在 6-12 月内上线|图片来源:极客公园 Arm 高管提到,移动设备种类非常复杂,不同产品拥有不同的功耗预算,因此未来 GPU 中传统着色器和神经计算资源的比例,不应该由 Arm 单独决定,而应该由合作伙伴根据产品定位调整。 SME2:真正的竞争不只是硬件,而是如何让 AI 能力被使用 在沟通会上,Arm 高管坦率表示,SME2 引擎本身与去年保持一致,今年的变化更多体现在 CPU 集群中加入更多 SME2 单元,以及围绕指令集和软件生态进行优化。 如果说 C2 CPU 代表了 Arm 对「AI 时代 CPU 应该扮演什么角色」的判断,那么 SME2 则体现了 Arm 另一层思考:硬件能力最终能否产生价值,取决于软件生态能否真正调用它。 去年,Arm 介绍最多的技术之一就是 SME2。它通过扩展 CPU 处理矩阵计算和向量计算的能力,让更多 AI 工作负载能够运行在 CPU 上。 但今年,Arm 关注的重点已经发生变化。SME2 不再只是一个新的 CPU 指令集,而正在成为 Arm 推动 CPU AI 生态的重要入口。 通过 KleidiAI 等软件优化,Arm 希望降低开发者调用 CPU AI 能力的门槛。目前 KleidiAI 已经支持多个 AI 框架和应用,让开发者不需要针对每一款芯片单独优化,就能够利用 CPU 中的 AI 加速能力。这也体现了 AI 时代芯片竞争逻辑的变化。 过去,芯片厂商竞争的是有没有新的硬件能力;但在 AI 时代,真正决定体验的,是这些能力能否被软件生态快速使用。对于开发者而言,他们并不关心芯片内部增加了多少指令集,而更关心自己的模型和应用能否在不同设备之间快速迁移。 从 C2 CPU,到 SME2,再到 Mali G2-Ultra NX 和 CSS for Mobile 2,Arm 实际上都在回答同一个问题:AI 时代,竞争不再只是制造更强的计算单元,而是让不同计算能力能够被更高效地组织和使用。 如果说过去几年 AI 产业竞争的核心,是如何训练更大的模型、拥有更多参数,那么进入推理时代后,行业正在面对另一个问题:模型产生 Token 之后,如何让这些 Token 被更高效地处理和分配。 随着智能体、多模态应用的发展,一次完整的 AI 任务已经越来越少由单一芯片完成。一个用户请求背后,可能包含语音识别、信息检索、本地数据访问、模型推理、应用调用等多个步骤,而这些步骤可能分别适合运行在 CPU、GPU、NPU 甚至云端。 因此,未来 AI 计算竞争的重点,可能正在从「制造智能」转向「管理智能」、「编排智能」。 Token 会被分散到云、边缘和终端不同位置产生,而决定一个任务应该在哪里运行、什么时候调用哪一种计算资源,以及如何降低整个流程的延迟,会成为芯片产业下一阶段需要解决的问题。 联想高级副总裁贾朝晖在活动现场提出了一个更激进的判断,未来可能有 80% 的 Token 生成会发生在本地设备上。无论这个比例最终是否实现,它都反映出一个趋势,AI 正在从云端走向更多边缘场景,终端设备将不再只是数据入口,而可能成为智能计算的重要节点。 但未来芯片的竞争或许不再是谁能生成更多 Token,而是谁能够以更低成本、更低延迟处理这些 Token。围绕这个问题,一场关于「谁来决定计算资源如何分配」的竞争正在展开。 芯片上下游的公司正在给出不同答案。英伟达选择的是通过 CUDA 构建从硬件到软件的完整 AI 计算平台。过去几年,CUDA 生态帮助英伟达掌握了数据中心 AI 计算入口,而随着 AI 向端侧延伸,英伟达也开始尝试将这套逻辑带到更多设备场景。 苹果则选择了另一条路线。通过自研芯片、操作系统以及应用生态的深度结合,苹果能够在设备内部完成软硬件协同,自己决定不同任务应该如何分配。 高通希望围绕 Snapdragon 平台成为端侧 AI 的重要入口,通过 CPU、GPU、NPU 和软件生态的组合,让 AI 能力更容易进入手机和 PC 等终端设备。 三星则试图通过芯片、存储和终端产品之间的协同形成优势。在 AI 时代,计算效率不仅取决于处理器性能,也取决于数据如何在计算单元和存储之间流动。 相比这些路径,Arm 选择的是另一种方式。当被问到未来 CPU、GPU 和 NPU 之间的任务分配是否会由 Arm 来决定,以及 Arm 是否会建立统一的 AI 调度层时,Arm 给出的答案是否定的。 Arm 认为,最终的调度权应该交给系统拥有者,由 OEM 厂商、芯片设计公司以及软件开发者根据自己的产品需求决定任务运行在哪里。Arm 自身做的,是确保每一个计算单元都具备足够强的基础能力,并通过软件生态让这些能力更容易被调用。这其实也是 Arm 长期商业模式的延续。 过去,Arm 并不制造最终设备,而是通过开放架构让不同厂商基于 Arm 设计自己的产品。进入 AI 时代后,Arm 并没有试图成为唯一的计算调度者,而是希望成为不同计算资源能够高效协同的基础平台。 从这个角度看,Arm 此次发布的 CPU、GPU、CSS 以及软件生态,并不是单纯增加某一个计算单元的能力,而是在回答同一个问题:当 AI 计算越来越复杂时,如何让不同资源更高效地组合在一起。 未来,芯片竞争的标准可能不再只是「谁拥有最强的计算单元」。因为 AI 时代真正困难的问题,不是产生更多 Token,而是让每一个 Token 在正确的时间、通过正确的计算资源完成任务。 过去三十年,Arm 通过指令集架构连接了移动计算产业;未来,它希望通过计算子系统、软件生态以及系统级优化,继续成为 AI 时代计算基础设施的一部分。 在一个未来形态仍未确定的时代,Arm 选择的不是预测唯一答案,而是建立一个能够适应不同答案的平台。 这或许也是它对 AI 时代最大的判断,下一个阶段的竞争,不只是计算能力的竞争,而是组织计算能力的竞争。 本文为极客公园原创文章,转载请联系极客君微信 geekparkGO 加州时间 9 月 9 日,苹果秋季发布会开场,这也是新 CEO 特纳斯上任后的第一场 keynote。折叠屏 iPhone、涨价、AI……苹果这一次究竟能拿出多少「新东西」? 本周四凌晨 00:40,极客公园视频号直播间,我们和极客公园副主编靖宇、极客公园作者 Alan,一起聊聊:新 CEO 特纳斯的第一场大考,苹果到底有多「特努力」? 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 都市快报橙柿互动 2026-09-09 11:41:44 上观新闻 2026-09-09 11:35:29 参考消息 2026-09-08 21:47:08 半岛都市报 2026-09-09 07:35:10 澎湃新闻 2026-09-08 23:14:11 新京报评论 2026-09-09 14:41:24 广东卫视 2026-09-09 16:44:44 闪电新闻 2026-09-09 14:58:38 中国能源网 2026-09-09 08:15:10 政知新媒体 2026-09-09 15:28:16 中国新闻周刊 2026-09-09 18:04:48 界面新闻 2026-09-09 10:48:37 证券时报 2026-09-09 21:06:03 参考消息 2026-09-09 12:27:49 国家统计局 2026-09-09 09:33:56 大风新闻 2026-09-09 20:38:28 吉刻新闻 2026-09-09 21:11:22
〖Three〗,德沃·古隆称尼泊尔泥石流灾害根源与气候变化有关-newsa25b9482a1509db7,Token 之后,谁来组织 AI 计算?Arm 寻找下一代计算的答案 Token 之后,AI 计算进入协同竞争时代。 如果说今年 3 月,Arm 推出首款自研 CPU 芯片,是这家公司向市场释放的一个信号,它开始尝试突破过去「只提供底层架构授权」的角色边界。那么在上海举办的 Arm Everywhere China 活动上,Arm 想传递的信息更加明确,不要再用过去「CPU IP 供应商」的方式理解今天的 Arm。 在这场活动中,Arm 没有只围绕某一个产品展开叙事,而是第一次更加完整地将自己的未来方向拆成三条线,云 AI、边缘 AI 和物理 AI。 和往年不太一样,去年 Arm 的主题演讲几乎全部围绕一件事展开 SME2,也就是让 AI 在 CPU 上跑起来。那是一个典型的「架构升级」叙事。但今年的主题演讲,三位业务负责人分别讲边缘 AI、物理 AI 和云 AI,围绕场景展开,算力会在云、端侧和物理世界之间流动,而 Arm 想成为这个「计算基建」的底座。 今年的 Arm 试图回答的是另一个问题,当 AI 正在重新改变计算方式时,下一代计算平台应该如何被设计?当 AI 计算正在从单一芯片性能竞争,转向多个计算单元协同竞争时,谁能够组织这些计算资源?我们惊讶地与多位 Arm 高管的交流中发现,当下的算力平台似乎不再追求为某一种确定的未来而设计,而是选择拥抱某种不确定性。 过去几十年,Arm 最成功的商业模式是通过 CPU 架构和 IP 授权连接整个半导体产业。芯片厂商基于 Arm 架构设计 SoC,终端厂商基于这些芯片打造产品,而 Arm 通过开放授权模式成为移动计算时代的重要基础设施。到今天,基于 Arm 技术的芯片累计出货已经超过 3500 亿颗。 过去,芯片竞争更多围绕单一指标展开,需要更强的 CPU、更大的 GPU、更先进的制程。但进入 AI 时代后,一次完整的 AI 任务已经不再只是某一个计算单元完成,AI 任务也从单次计算逐渐走向连续推理、多模态交互以及智能体式的任务执行。这意味着,未来计算竞争的关键不只是拥有多少算力,而是如何让不同计算资源更加高效地协同。 这次活动的主题演讲,Arm 重点讲述了在不同任务场景里的算力需求变化。 在边缘 AI 领域,算力从「被动响应」到「持续运行」。两年前的 AI 是你问一句、它答一句,任务结束;今天的智能体则要理解上下文、检索本机数据、调用应用、在用户授权下自主完成任务,而且要在手机的功耗和散热约束下持续运行。终端设备正在从执行应用和处理数据的工具,变成能够理解意图、实时响应的智能节点。 在物理 AI 领域,算力从「车」转移到「机器人」。Arm 过去在汽车上的角色是提供安全、实时、低功耗的计算底座,而现在它走到了机器人上,两者共同的特征是感知和执行,都要求从「传感器」到「执行」的延迟足够短。 在云端 AI 领域,Arm 引用 IDC 的数据说,基于 Arm 架构的机架级服务器市场规模已经超越 x86,成为加速计算的主流平台。过去二十年数据中心 CPU 面向的是横向扩展的突发性负载,但智能体则是持续的,一个智能体能发起数百次调用。 「在智能体时代,CPU 的角色不再是加速,而是编排」。Arm 基础设施业务的负责人提到,这也是 Arm 开始改变自身角色的原因。如果继续停留在过去的 IP 授权模式,Arm 可以提供优秀的 CPU 架构,但无法参与决定一次 AI 任务最终如何完成。因此,近几年 Arm 开始逐渐从单纯提供 IP,走向提供更加完整的平台能力。如今,客户可以买 Arm 的 IP、也可以买 CSS,甚至可以买芯片。 但今年最明显的不同,是 Arm 开始正面拥抱 AI 时代最大的特点:不确定性。 下一代终端到底是什么形态,端侧模型最终会发展到什么规模,智能体的算力应该放在 CPU、NPU 还是云端,目前都没有明确答案。Arm 自己也没有假装自己看到了答案。在媒体沟通会上,我们问了很多关于「谁来决定」的问题,得到的回答却都是「待定」。 当被问到 CPU 和 NPU 之间的分工由谁来定,他们认为「系统的所有者拥有控制权」;问 CPU 会不会比 NPU 更重要,他们提到「行业在寻找下一个平衡点」;问 CSS 会跨领域复用还是持续分化,他们回答是「取决于市场需要」;问未来 GPU 里传统着色器和神经计算的资源比例怎么分,他们回答是这个决定「留给芯片合作伙伴」。 从这里我们看出,Arm 和英伟达区别之一就在于英伟达的路线是「我知道未来 AI 计算是什么样,所以我构建一个完整的平台」;Arm 的路线是「未来 AI 计算还没有确定,所以我要构建一个允许变化的平台」。前者用 CUDA 把开发者锁进一种范式,后者把范式的决定权交出去,只保证无论选哪一种,底座都有 Arm 参与搭建。 理解了这一点,再看 Arm 这次发布的每一个产品,会发现它们的设计思路都是同一个逻辑的不同表达,不替客户做决定,但让每一种决定都能跑得更好。 Arm 重新定义 CPU、GPU 和 CSS 过去,芯片厂商习惯于围绕不同功能划分计算单元。CPU 负责通用计算,GPU 负责图形处理,NPU 负责 AI 加速。这种分工在过去几十年里非常有效。但 AI 时代正在模糊这些边界。尤其是在端侧,AI 任务并不是简单地把一个模型丢给某个加速器运行,而是包含了理解、记忆、推理和执行等多个环节。不同阶段需要协调不同类型的计算资源。 因此,未来芯片竞争的重点,可能不再是谁拥有更强的单一计算单元,而是谁能够让这些计算单元更高效地协同。 当 AI 计算不再由单一芯片决定,未来的计算平台应该如何重新设计?我们可以从 Arm 此次发布的 CPU、GPU和 CSS 平台后看看 Arm 的最新思考。 CSS for Mobile 2:第一个 AI 原生计算子系统,重组 SoC 设计方式 过去客户获得的是不同的 IP 模块,需要自行完成大量设计和优化。而 CSS 是 Arm 打造的一套计算子系统,可以让客户能够更快构建面向 AI 时代的芯片,也就是说,是一个「半成品」的芯片设计方案。 有意思的是,去年的第一代 CSS for Mobile 当时叫 Lumex,今年改名为 CSS for Mobile 2,Arm 说是为了让人一眼看出这个子系统面向哪个行业,也从单个 IP 升级到完整 AI 计算平台。 9 月 8 日,Arm 将刚刚推出的 CSS for Mobile 2 定义为首个 AI 原生移动计算子系统,包括 Arm C2 CPU cluster、Mali G2-Ultra NXGPU、SI L2 system interconnect 以及软件和开发工具。 相比上一代,单线程性能提升最高 15%,多线程性能提升最高 12%,网页浏览速度提升最高 15%,应用启动速度提升最高 12%,AI 模型性能最高提升 1.7 倍。 这次发布的 Neoverse CSS N4 是 Arm 迄今可配置性最高的 CSS,单颗裸片支持 128 个 CPU 核心配置,也是首款支持 LPDDR6 和 PCIe Gen 7 的 Neoverse CSS;相比上一代 CSS N3,插槽性能最高提升至 2 倍,每瓦性能最高提升 25%,内存带宽最高提升 75%。 在系统层面,N4 进一步强化了内存和 I/O 能力,以满足智能体 AI 时代更高的数据移动需求。「智能体工作负载让内存需求比以往任何时候都高,在内存访问过程当中,每一纳秒都是非常重要的」,Arm 高管解释道。 CSS 模式的价值已经在产业链中得到验证。微软基于 Neoverse CSS 在 18 个月内完成两代 Cobalt CPU 的交付;云豹智能则基于 CSS N2 构建 DPU 产品。 当被问到 CSS 会不会跨领域复用时,Arm 高管提到「未来我们的产品怎么走,取决于客户到底需要什么。」 Arm 不预设 CSS 应该长什么样,它只希望无论市场往哪个方向走,这个底座都跟得上。「我们服务的还不仅仅只是开发人员,我们还要考虑到智能体。」对 Arm 而言,CSS 的意义并不只是减少客户设计时间,而是把过去分散的 IP 组合成一个可以面向未来变化调整的平台。 C2-Ultra CPU :重新定义 AI 时代 CPU 的位置 在 AI 浪潮的前几年,行业曾经出现一种观点:随着 NPU 等专用加速器的发展,CPU 的重要性可能会下降,手机芯片的竞争会逐渐转向 TOPS 竞争。 Arm 此次推出的 C2 CPU 集群参考配置为 2 颗 C2-Ultra 加 6 颗 C2-Pro,并通过 DynamIQ Shared Unit(DSU)共享 L3 缓存,同时配置两个 SME2 单元增强 AI 工作负载处理能力。相比上一代 C1-Ultra,C2-Ultra 单线程性能提升 15%,多线程性能提升 12%。在实际终端体验中,Arm 测试显示网页浏览速度提升 15%,应用启动速度提升 12%,AI 工作负载性能最高提升 1.7 倍,相同性能下功耗最高降低 38%。Arm 认为,C2 延续了近几年 CPU 性能持续实现「双位数提升」的趋势。 但相比这些性能数字,Arm 更想强调的是一个新的应用场景:Agent。 传统应用更多是用户发起一次请求,系统完成一次任务。但当 AI Agent 进入终端之后,一个任务可能会经历理解用户意图、调用本地数据、生成内容、访问应用服务等多个阶段。一次完整的 AI 任务,不再只是某一个模型推理过程,而是多个计算资源共同参与的连续流程。 例如,用户让手机帮助规划一次旅行。系统首先需要理解用户需求,然后读取本地日历、照片、位置等信息,再调用模型生成计划,最后可能还需要连接第三方应用完成预订。在这个过程中,并不是所有步骤都需要 NPU 完成。有些任务需要低延迟响应,有些需要访问系统资源,有些需要在 CPU、GPU、NPU 之间完成协同。而这些工作,正是 CPU 长期以来擅长的领域。 Arm 工程师在沟通中提到,对于 AI Agent 这样的新型工作负载,峰值算力并不是唯一指标,整个任务链路中的延迟和效率同样重要。因此,未来 CPU 并不会取代 NPU,而是在 AI 计算体系中承担更加重要的基础角色。 Mali G2-Ultra NX GPU:重新定义视觉计算 如果说 C2 CPU 回答的是「AI 时代谁负责组织计算」,那么 GPU 回答的是另一个问题:未来终端的视觉体验,是否会因为 AI 而被重新设计? 移动设备始终面临一个无法绕开的限制,用户希望看到接近 PC 和主机级别的视觉效果,但手机的功耗、散热和电池容量不会无限增长。过去提升画质主要依靠增加 GPU 算力,而 AI 正在提供另一种路径,让 GPU 用更少的计算完成更复杂的视觉效果。 对于游戏开发者而言,这意味着过去因为移动设备性能限制无法实现的视觉效果,开始有机会进入终端设备。 Arm 此次推出首款集成神经网络加速能力的 Mali G2-Ultra NX GPU,本质上是在重新设计 GPU 和 AI 之间的关系。这是第一款将神经网络加速器直接集成到着色器内核中的 Mali GPU。 该加速器支持 int8 和 int16 计算,神经网络加速器的运行频率最高可达到 GPU 时钟频率的两倍,并与执行引擎共享 L1、L2 缓存,可以作为图形管线的一部分参与调度。同时,它拥有独立功耗门控,在不使用时可以关闭。 这意味着 AI 不再只是 SoC 中的一个独立模块,而开始进入传统图形处理流程。 在传统渲染中,GPU 需要计算大量真实像素;而在 AI 原生图形中,GPU 可以只生成部分内容,再由 AI 完成重建。例如,神经超级采样可以只渲染四分之一像素,其余由 AI 恢复;神经帧率超分可以在两帧真实渲染之间生成额外帧;神经超级采样结合降噪,则可以减少光追需要计算的光线数量,再通过 AI 恢复画面质量。 Arm 工程师表示,这套网络采用卷积网络而非 Transformer,模型经过高度压缩,功耗不到 1 瓦。目前 Arm 主要聚焦单帧插值,并没有走向 DLSS 类似的多帧生成路线。 除了 AI 图形能力,G2-Ultra NX 也继续增强传统渲染能力。它采用了 Mali 七代以来最大的一次指令集重构,每个线程组寄存器数量翻倍,寄存器分配从固定 32 或 64 改为 16 为单位动态分配,从而减少寄存器溢出,并支持包括 Unreal Engine 5 Lumen、Nanite 在内的复杂图形工作负载。 同时,Arm 带来了第三代光追单元,通过更紧凑的三角形表达消除冗余数据、减少内存访问,主流光追基准场景下 DRAM 流量最高降低 13%。配合硬件级遮挡剔除(OMM),光线追踪工作负载最高降低 70%,帧率最高提升 30%。在传统渲染方面,游戏基准综合性能平均提升 20% 但 Arm 并没有试图定义唯一的 AI 图形方案。 在《光影新生》的展示中,Arm 展示了 AI 重建和光追结合后的移动端视觉效果。与此同时,Arm 将神经图形相关模型开源到 Hugging Face 和 GitHub,让开发者可以根据自己的游戏风格重新训练模型。 《光影新生》将在 6-12 月内上线|图片来源:极客公园 Arm 高管提到,移动设备种类非常复杂,不同产品拥有不同的功耗预算,因此未来 GPU 中传统着色器和神经计算资源的比例,不应该由 Arm 单独决定,而应该由合作伙伴根据产品定位调整。 SME2:真正的竞争不只是硬件,而是如何让 AI 能力被使用 在沟通会上,Arm 高管坦率表示,SME2 引擎本身与去年保持一致,今年的变化更多体现在 CPU 集群中加入更多 SME2 单元,以及围绕指令集和软件生态进行优化。 如果说 C2 CPU 代表了 Arm 对「AI 时代 CPU 应该扮演什么角色」的判断,那么 SME2 则体现了 Arm 另一层思考:硬件能力最终能否产生价值,取决于软件生态能否真正调用它。 去年,Arm 介绍最多的技术之一就是 SME2。它通过扩展 CPU 处理矩阵计算和向量计算的能力,让更多 AI 工作负载能够运行在 CPU 上。 但今年,Arm 关注的重点已经发生变化。SME2 不再只是一个新的 CPU 指令集,而正在成为 Arm 推动 CPU AI 生态的重要入口。 通过 KleidiAI 等软件优化,Arm 希望降低开发者调用 CPU AI 能力的门槛。目前 KleidiAI 已经支持多个 AI 框架和应用,让开发者不需要针对每一款芯片单独优化,就能够利用 CPU 中的 AI 加速能力。这也体现了 AI 时代芯片竞争逻辑的变化。 过去,芯片厂商竞争的是有没有新的硬件能力;但在 AI 时代,真正决定体验的,是这些能力能否被软件生态快速使用。对于开发者而言,他们并不关心芯片内部增加了多少指令集,而更关心自己的模型和应用能否在不同设备之间快速迁移。 从 C2 CPU,到 SME2,再到 Mali G2-Ultra NX 和 CSS for Mobile 2,Arm 实际上都在回答同一个问题:AI 时代,竞争不再只是制造更强的计算单元,而是让不同计算能力能够被更高效地组织和使用。 如果说过去几年 AI 产业竞争的核心,是如何训练更大的模型、拥有更多参数,那么进入推理时代后,行业正在面对另一个问题:模型产生 Token 之后,如何让这些 Token 被更高效地处理和分配。 随着智能体、多模态应用的发展,一次完整的 AI 任务已经越来越少由单一芯片完成。一个用户请求背后,可能包含语音识别、信息检索、本地数据访问、模型推理、应用调用等多个步骤,而这些步骤可能分别适合运行在 CPU、GPU、NPU 甚至云端。 因此,未来 AI 计算竞争的重点,可能正在从「制造智能」转向「管理智能」、「编排智能」。 Token 会被分散到云、边缘和终端不同位置产生,而决定一个任务应该在哪里运行、什么时候调用哪一种计算资源,以及如何降低整个流程的延迟,会成为芯片产业下一阶段需要解决的问题。 联想高级副总裁贾朝晖在活动现场提出了一个更激进的判断,未来可能有 80% 的 Token 生成会发生在本地设备上。无论这个比例最终是否实现,它都反映出一个趋势,AI 正在从云端走向更多边缘场景,终端设备将不再只是数据入口,而可能成为智能计算的重要节点。 但未来芯片的竞争或许不再是谁能生成更多 Token,而是谁能够以更低成本、更低延迟处理这些 Token。围绕这个问题,一场关于「谁来决定计算资源如何分配」的竞争正在展开。 芯片上下游的公司正在给出不同答案。英伟达选择的是通过 CUDA 构建从硬件到软件的完整 AI 计算平台。过去几年,CUDA 生态帮助英伟达掌握了数据中心 AI 计算入口,而随着 AI 向端侧延伸,英伟达也开始尝试将这套逻辑带到更多设备场景。 苹果则选择了另一条路线。通过自研芯片、操作系统以及应用生态的深度结合,苹果能够在设备内部完成软硬件协同,自己决定不同任务应该如何分配。 高通希望围绕 Snapdragon 平台成为端侧 AI 的重要入口,通过 CPU、GPU、NPU 和软件生态的组合,让 AI 能力更容易进入手机和 PC 等终端设备。 三星则试图通过芯片、存储和终端产品之间的协同形成优势。在 AI 时代,计算效率不仅取决于处理器性能,也取决于数据如何在计算单元和存储之间流动。 相比这些路径,Arm 选择的是另一种方式。当被问到未来 CPU、GPU 和 NPU 之间的任务分配是否会由 Arm 来决定,以及 Arm 是否会建立统一的 AI 调度层时,Arm 给出的答案是否定的。 Arm 认为,最终的调度权应该交给系统拥有者,由 OEM 厂商、芯片设计公司以及软件开发者根据自己的产品需求决定任务运行在哪里。Arm 自身做的,是确保每一个计算单元都具备足够强的基础能力,并通过软件生态让这些能力更容易被调用。这其实也是 Arm 长期商业模式的延续。 过去,Arm 并不制造最终设备,而是通过开放架构让不同厂商基于 Arm 设计自己的产品。进入 AI 时代后,Arm 并没有试图成为唯一的计算调度者,而是希望成为不同计算资源能够高效协同的基础平台。 从这个角度看,Arm 此次发布的 CPU、GPU、CSS 以及软件生态,并不是单纯增加某一个计算单元的能力,而是在回答同一个问题:当 AI 计算越来越复杂时,如何让不同资源更高效地组合在一起。 未来,芯片竞争的标准可能不再只是「谁拥有最强的计算单元」。因为 AI 时代真正困难的问题,不是产生更多 Token,而是让每一个 Token 在正确的时间、通过正确的计算资源完成任务。 过去三十年,Arm 通过指令集架构连接了移动计算产业;未来,它希望通过计算子系统、软件生态以及系统级优化,继续成为 AI 时代计算基础设施的一部分。 在一个未来形态仍未确定的时代,Arm 选择的不是预测唯一答案,而是建立一个能够适应不同答案的平台。 这或许也是它对 AI 时代最大的判断,下一个阶段的竞争,不只是计算能力的竞争,而是组织计算能力的竞争。 本文为极客公园原创文章,转载请联系极客君微信 geekparkGO 加州时间 9 月 9 日,苹果秋季发布会开场,这也是新 CEO 特纳斯上任后的第一场 keynote。折叠屏 iPhone、涨价、AI……苹果这一次究竟能拿出多少「新东西」? 本周四凌晨 00:40,极客公园视频号直播间,我们和极客公园副主编靖宇、极客公园作者 Alan,一起聊聊:新 CEO 特纳斯的第一场大考,苹果到底有多「特努力」? 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 都市快报橙柿互动 2026-09-09 11:41:44 上观新闻 2026-09-09 11:35:29 参考消息 2026-09-08 21:47:08 半岛都市报 2026-09-09 07:35:10 澎湃新闻 2026-09-08 23:14:11 新京报评论 2026-09-09 14:41:24 广东卫视 2026-09-09 16:44:44 闪电新闻 2026-09-09 14:58:38 中国能源网 2026-09-09 08:15:10 政知新媒体 2026-09-09 15:28:16 中国新闻周刊 2026-09-09 18:04:48 界面新闻 2026-09-09 10:48:37 证券时报 2026-09-09 21:06:03 参考消息 2026-09-09 12:27:49 国家统计局 2026-09-09 09:33:56 大风新闻 2026-09-09 20:38:28 吉刻新闻 2026-09-09 21:11:22
〖Four〗,2026年9月9日外交部发言人毛宁主持例行记者会-b23f4abe,Token 之后,谁来组织 AI 计算?Arm 寻找下一代计算的答案 Token 之后,AI 计算进入协同竞争时代。 如果说今年 3 月,Arm 推出首款自研 CPU 芯片,是这家公司向市场释放的一个信号,它开始尝试突破过去「只提供底层架构授权」的角色边界。那么在上海举办的 Arm Everywhere China 活动上,Arm 想传递的信息更加明确,不要再用过去「CPU IP 供应商」的方式理解今天的 Arm。 在这场活动中,Arm 没有只围绕某一个产品展开叙事,而是第一次更加完整地将自己的未来方向拆成三条线,云 AI、边缘 AI 和物理 AI。 和往年不太一样,去年 Arm 的主题演讲几乎全部围绕一件事展开 SME2,也就是让 AI 在 CPU 上跑起来。那是一个典型的「架构升级」叙事。但今年的主题演讲,三位业务负责人分别讲边缘 AI、物理 AI 和云 AI,围绕场景展开,算力会在云、端侧和物理世界之间流动,而 Arm 想成为这个「计算基建」的底座。 今年的 Arm 试图回答的是另一个问题,当 AI 正在重新改变计算方式时,下一代计算平台应该如何被设计?当 AI 计算正在从单一芯片性能竞争,转向多个计算单元协同竞争时,谁能够组织这些计算资源?我们惊讶地与多位 Arm 高管的交流中发现,当下的算力平台似乎不再追求为某一种确定的未来而设计,而是选择拥抱某种不确定性。 过去几十年,Arm 最成功的商业模式是通过 CPU 架构和 IP 授权连接整个半导体产业。芯片厂商基于 Arm 架构设计 SoC,终端厂商基于这些芯片打造产品,而 Arm 通过开放授权模式成为移动计算时代的重要基础设施。到今天,基于 Arm 技术的芯片累计出货已经超过 3500 亿颗。 过去,芯片竞争更多围绕单一指标展开,需要更强的 CPU、更大的 GPU、更先进的制程。但进入 AI 时代后,一次完整的 AI 任务已经不再只是某一个计算单元完成,AI 任务也从单次计算逐渐走向连续推理、多模态交互以及智能体式的任务执行。这意味着,未来计算竞争的关键不只是拥有多少算力,而是如何让不同计算资源更加高效地协同。 这次活动的主题演讲,Arm 重点讲述了在不同任务场景里的算力需求变化。 在边缘 AI 领域,算力从「被动响应」到「持续运行」。两年前的 AI 是你问一句、它答一句,任务结束;今天的智能体则要理解上下文、检索本机数据、调用应用、在用户授权下自主完成任务,而且要在手机的功耗和散热约束下持续运行。终端设备正在从执行应用和处理数据的工具,变成能够理解意图、实时响应的智能节点。 在物理 AI 领域,算力从「车」转移到「机器人」。Arm 过去在汽车上的角色是提供安全、实时、低功耗的计算底座,而现在它走到了机器人上,两者共同的特征是感知和执行,都要求从「传感器」到「执行」的延迟足够短。 在云端 AI 领域,Arm 引用 IDC 的数据说,基于 Arm 架构的机架级服务器市场规模已经超越 x86,成为加速计算的主流平台。过去二十年数据中心 CPU 面向的是横向扩展的突发性负载,但智能体则是持续的,一个智能体能发起数百次调用。 「在智能体时代,CPU 的角色不再是加速,而是编排」。Arm 基础设施业务的负责人提到,这也是 Arm 开始改变自身角色的原因。如果继续停留在过去的 IP 授权模式,Arm 可以提供优秀的 CPU 架构,但无法参与决定一次 AI 任务最终如何完成。因此,近几年 Arm 开始逐渐从单纯提供 IP,走向提供更加完整的平台能力。如今,客户可以买 Arm 的 IP、也可以买 CSS,甚至可以买芯片。 但今年最明显的不同,是 Arm 开始正面拥抱 AI 时代最大的特点:不确定性。 下一代终端到底是什么形态,端侧模型最终会发展到什么规模,智能体的算力应该放在 CPU、NPU 还是云端,目前都没有明确答案。Arm 自己也没有假装自己看到了答案。在媒体沟通会上,我们问了很多关于「谁来决定」的问题,得到的回答却都是「待定」。 当被问到 CPU 和 NPU 之间的分工由谁来定,他们认为「系统的所有者拥有控制权」;问 CPU 会不会比 NPU 更重要,他们提到「行业在寻找下一个平衡点」;问 CSS 会跨领域复用还是持续分化,他们回答是「取决于市场需要」;问未来 GPU 里传统着色器和神经计算的资源比例怎么分,他们回答是这个决定「留给芯片合作伙伴」。 从这里我们看出,Arm 和英伟达区别之一就在于英伟达的路线是「我知道未来 AI 计算是什么样,所以我构建一个完整的平台」;Arm 的路线是「未来 AI 计算还没有确定,所以我要构建一个允许变化的平台」。前者用 CUDA 把开发者锁进一种范式,后者把范式的决定权交出去,只保证无论选哪一种,底座都有 Arm 参与搭建。 理解了这一点,再看 Arm 这次发布的每一个产品,会发现它们的设计思路都是同一个逻辑的不同表达,不替客户做决定,但让每一种决定都能跑得更好。 Arm 重新定义 CPU、GPU 和 CSS 过去,芯片厂商习惯于围绕不同功能划分计算单元。CPU 负责通用计算,GPU 负责图形处理,NPU 负责 AI 加速。这种分工在过去几十年里非常有效。但 AI 时代正在模糊这些边界。尤其是在端侧,AI 任务并不是简单地把一个模型丢给某个加速器运行,而是包含了理解、记忆、推理和执行等多个环节。不同阶段需要协调不同类型的计算资源。 因此,未来芯片竞争的重点,可能不再是谁拥有更强的单一计算单元,而是谁能够让这些计算单元更高效地协同。 当 AI 计算不再由单一芯片决定,未来的计算平台应该如何重新设计?我们可以从 Arm 此次发布的 CPU、GPU和 CSS 平台后看看 Arm 的最新思考。 CSS for Mobile 2:第一个 AI 原生计算子系统,重组 SoC 设计方式 过去客户获得的是不同的 IP 模块,需要自行完成大量设计和优化。而 CSS 是 Arm 打造的一套计算子系统,可以让客户能够更快构建面向 AI 时代的芯片,也就是说,是一个「半成品」的芯片设计方案。 有意思的是,去年的第一代 CSS for Mobile 当时叫 Lumex,今年改名为 CSS for Mobile 2,Arm 说是为了让人一眼看出这个子系统面向哪个行业,也从单个 IP 升级到完整 AI 计算平台。 9 月 8 日,Arm 将刚刚推出的 CSS for Mobile 2 定义为首个 AI 原生移动计算子系统,包括 Arm C2 CPU cluster、Mali G2-Ultra NXGPU、SI L2 system interconnect 以及软件和开发工具。 相比上一代,单线程性能提升最高 15%,多线程性能提升最高 12%,网页浏览速度提升最高 15%,应用启动速度提升最高 12%,AI 模型性能最高提升 1.7 倍。 这次发布的 Neoverse CSS N4 是 Arm 迄今可配置性最高的 CSS,单颗裸片支持 128 个 CPU 核心配置,也是首款支持 LPDDR6 和 PCIe Gen 7 的 Neoverse CSS;相比上一代 CSS N3,插槽性能最高提升至 2 倍,每瓦性能最高提升 25%,内存带宽最高提升 75%。 在系统层面,N4 进一步强化了内存和 I/O 能力,以满足智能体 AI 时代更高的数据移动需求。「智能体工作负载让内存需求比以往任何时候都高,在内存访问过程当中,每一纳秒都是非常重要的」,Arm 高管解释道。 CSS 模式的价值已经在产业链中得到验证。微软基于 Neoverse CSS 在 18 个月内完成两代 Cobalt CPU 的交付;云豹智能则基于 CSS N2 构建 DPU 产品。 当被问到 CSS 会不会跨领域复用时,Arm 高管提到「未来我们的产品怎么走,取决于客户到底需要什么。」 Arm 不预设 CSS 应该长什么样,它只希望无论市场往哪个方向走,这个底座都跟得上。「我们服务的还不仅仅只是开发人员,我们还要考虑到智能体。」对 Arm 而言,CSS 的意义并不只是减少客户设计时间,而是把过去分散的 IP 组合成一个可以面向未来变化调整的平台。 C2-Ultra CPU :重新定义 AI 时代 CPU 的位置 在 AI 浪潮的前几年,行业曾经出现一种观点:随着 NPU 等专用加速器的发展,CPU 的重要性可能会下降,手机芯片的竞争会逐渐转向 TOPS 竞争。 Arm 此次推出的 C2 CPU 集群参考配置为 2 颗 C2-Ultra 加 6 颗 C2-Pro,并通过 DynamIQ Shared Unit(DSU)共享 L3 缓存,同时配置两个 SME2 单元增强 AI 工作负载处理能力。相比上一代 C1-Ultra,C2-Ultra 单线程性能提升 15%,多线程性能提升 12%。在实际终端体验中,Arm 测试显示网页浏览速度提升 15%,应用启动速度提升 12%,AI 工作负载性能最高提升 1.7 倍,相同性能下功耗最高降低 38%。Arm 认为,C2 延续了近几年 CPU 性能持续实现「双位数提升」的趋势。 但相比这些性能数字,Arm 更想强调的是一个新的应用场景:Agent。 传统应用更多是用户发起一次请求,系统完成一次任务。但当 AI Agent 进入终端之后,一个任务可能会经历理解用户意图、调用本地数据、生成内容、访问应用服务等多个阶段。一次完整的 AI 任务,不再只是某一个模型推理过程,而是多个计算资源共同参与的连续流程。 例如,用户让手机帮助规划一次旅行。系统首先需要理解用户需求,然后读取本地日历、照片、位置等信息,再调用模型生成计划,最后可能还需要连接第三方应用完成预订。在这个过程中,并不是所有步骤都需要 NPU 完成。有些任务需要低延迟响应,有些需要访问系统资源,有些需要在 CPU、GPU、NPU 之间完成协同。而这些工作,正是 CPU 长期以来擅长的领域。 Arm 工程师在沟通中提到,对于 AI Agent 这样的新型工作负载,峰值算力并不是唯一指标,整个任务链路中的延迟和效率同样重要。因此,未来 CPU 并不会取代 NPU,而是在 AI 计算体系中承担更加重要的基础角色。 Mali G2-Ultra NX GPU:重新定义视觉计算 如果说 C2 CPU 回答的是「AI 时代谁负责组织计算」,那么 GPU 回答的是另一个问题:未来终端的视觉体验,是否会因为 AI 而被重新设计? 移动设备始终面临一个无法绕开的限制,用户希望看到接近 PC 和主机级别的视觉效果,但手机的功耗、散热和电池容量不会无限增长。过去提升画质主要依靠增加 GPU 算力,而 AI 正在提供另一种路径,让 GPU 用更少的计算完成更复杂的视觉效果。 对于游戏开发者而言,这意味着过去因为移动设备性能限制无法实现的视觉效果,开始有机会进入终端设备。 Arm 此次推出首款集成神经网络加速能力的 Mali G2-Ultra NX GPU,本质上是在重新设计 GPU 和 AI 之间的关系。这是第一款将神经网络加速器直接集成到着色器内核中的 Mali GPU。 该加速器支持 int8 和 int16 计算,神经网络加速器的运行频率最高可达到 GPU 时钟频率的两倍,并与执行引擎共享 L1、L2 缓存,可以作为图形管线的一部分参与调度。同时,它拥有独立功耗门控,在不使用时可以关闭。 这意味着 AI 不再只是 SoC 中的一个独立模块,而开始进入传统图形处理流程。 在传统渲染中,GPU 需要计算大量真实像素;而在 AI 原生图形中,GPU 可以只生成部分内容,再由 AI 完成重建。例如,神经超级采样可以只渲染四分之一像素,其余由 AI 恢复;神经帧率超分可以在两帧真实渲染之间生成额外帧;神经超级采样结合降噪,则可以减少光追需要计算的光线数量,再通过 AI 恢复画面质量。 Arm 工程师表示,这套网络采用卷积网络而非 Transformer,模型经过高度压缩,功耗不到 1 瓦。目前 Arm 主要聚焦单帧插值,并没有走向 DLSS 类似的多帧生成路线。 除了 AI 图形能力,G2-Ultra NX 也继续增强传统渲染能力。它采用了 Mali 七代以来最大的一次指令集重构,每个线程组寄存器数量翻倍,寄存器分配从固定 32 或 64 改为 16 为单位动态分配,从而减少寄存器溢出,并支持包括 Unreal Engine 5 Lumen、Nanite 在内的复杂图形工作负载。 同时,Arm 带来了第三代光追单元,通过更紧凑的三角形表达消除冗余数据、减少内存访问,主流光追基准场景下 DRAM 流量最高降低 13%。配合硬件级遮挡剔除(OMM),光线追踪工作负载最高降低 70%,帧率最高提升 30%。在传统渲染方面,游戏基准综合性能平均提升 20% 但 Arm 并没有试图定义唯一的 AI 图形方案。 在《光影新生》的展示中,Arm 展示了 AI 重建和光追结合后的移动端视觉效果。与此同时,Arm 将神经图形相关模型开源到 Hugging Face 和 GitHub,让开发者可以根据自己的游戏风格重新训练模型。 《光影新生》将在 6-12 月内上线|图片来源:极客公园 Arm 高管提到,移动设备种类非常复杂,不同产品拥有不同的功耗预算,因此未来 GPU 中传统着色器和神经计算资源的比例,不应该由 Arm 单独决定,而应该由合作伙伴根据产品定位调整。 SME2:真正的竞争不只是硬件,而是如何让 AI 能力被使用 在沟通会上,Arm 高管坦率表示,SME2 引擎本身与去年保持一致,今年的变化更多体现在 CPU 集群中加入更多 SME2 单元,以及围绕指令集和软件生态进行优化。 如果说 C2 CPU 代表了 Arm 对「AI 时代 CPU 应该扮演什么角色」的判断,那么 SME2 则体现了 Arm 另一层思考:硬件能力最终能否产生价值,取决于软件生态能否真正调用它。 去年,Arm 介绍最多的技术之一就是 SME2。它通过扩展 CPU 处理矩阵计算和向量计算的能力,让更多 AI 工作负载能够运行在 CPU 上。 但今年,Arm 关注的重点已经发生变化。SME2 不再只是一个新的 CPU 指令集,而正在成为 Arm 推动 CPU AI 生态的重要入口。 通过 KleidiAI 等软件优化,Arm 希望降低开发者调用 CPU AI 能力的门槛。目前 KleidiAI 已经支持多个 AI 框架和应用,让开发者不需要针对每一款芯片单独优化,就能够利用 CPU 中的 AI 加速能力。这也体现了 AI 时代芯片竞争逻辑的变化。 过去,芯片厂商竞争的是有没有新的硬件能力;但在 AI 时代,真正决定体验的,是这些能力能否被软件生态快速使用。对于开发者而言,他们并不关心芯片内部增加了多少指令集,而更关心自己的模型和应用能否在不同设备之间快速迁移。 从 C2 CPU,到 SME2,再到 Mali G2-Ultra NX 和 CSS for Mobile 2,Arm 实际上都在回答同一个问题:AI 时代,竞争不再只是制造更强的计算单元,而是让不同计算能力能够被更高效地组织和使用。 如果说过去几年 AI 产业竞争的核心,是如何训练更大的模型、拥有更多参数,那么进入推理时代后,行业正在面对另一个问题:模型产生 Token 之后,如何让这些 Token 被更高效地处理和分配。 随着智能体、多模态应用的发展,一次完整的 AI 任务已经越来越少由单一芯片完成。一个用户请求背后,可能包含语音识别、信息检索、本地数据访问、模型推理、应用调用等多个步骤,而这些步骤可能分别适合运行在 CPU、GPU、NPU 甚至云端。 因此,未来 AI 计算竞争的重点,可能正在从「制造智能」转向「管理智能」、「编排智能」。 Token 会被分散到云、边缘和终端不同位置产生,而决定一个任务应该在哪里运行、什么时候调用哪一种计算资源,以及如何降低整个流程的延迟,会成为芯片产业下一阶段需要解决的问题。 联想高级副总裁贾朝晖在活动现场提出了一个更激进的判断,未来可能有 80% 的 Token 生成会发生在本地设备上。无论这个比例最终是否实现,它都反映出一个趋势,AI 正在从云端走向更多边缘场景,终端设备将不再只是数据入口,而可能成为智能计算的重要节点。 但未来芯片的竞争或许不再是谁能生成更多 Token,而是谁能够以更低成本、更低延迟处理这些 Token。围绕这个问题,一场关于「谁来决定计算资源如何分配」的竞争正在展开。 芯片上下游的公司正在给出不同答案。英伟达选择的是通过 CUDA 构建从硬件到软件的完整 AI 计算平台。过去几年,CUDA 生态帮助英伟达掌握了数据中心 AI 计算入口,而随着 AI 向端侧延伸,英伟达也开始尝试将这套逻辑带到更多设备场景。 苹果则选择了另一条路线。通过自研芯片、操作系统以及应用生态的深度结合,苹果能够在设备内部完成软硬件协同,自己决定不同任务应该如何分配。 高通希望围绕 Snapdragon 平台成为端侧 AI 的重要入口,通过 CPU、GPU、NPU 和软件生态的组合,让 AI 能力更容易进入手机和 PC 等终端设备。 三星则试图通过芯片、存储和终端产品之间的协同形成优势。在 AI 时代,计算效率不仅取决于处理器性能,也取决于数据如何在计算单元和存储之间流动。 相比这些路径,Arm 选择的是另一种方式。当被问到未来 CPU、GPU 和 NPU 之间的任务分配是否会由 Arm 来决定,以及 Arm 是否会建立统一的 AI 调度层时,Arm 给出的答案是否定的。 Arm 认为,最终的调度权应该交给系统拥有者,由 OEM 厂商、芯片设计公司以及软件开发者根据自己的产品需求决定任务运行在哪里。Arm 自身做的,是确保每一个计算单元都具备足够强的基础能力,并通过软件生态让这些能力更容易被调用。这其实也是 Arm 长期商业模式的延续。 过去,Arm 并不制造最终设备,而是通过开放架构让不同厂商基于 Arm 设计自己的产品。进入 AI 时代后,Arm 并没有试图成为唯一的计算调度者,而是希望成为不同计算资源能够高效协同的基础平台。 从这个角度看,Arm 此次发布的 CPU、GPU、CSS 以及软件生态,并不是单纯增加某一个计算单元的能力,而是在回答同一个问题:当 AI 计算越来越复杂时,如何让不同资源更高效地组合在一起。 未来,芯片竞争的标准可能不再只是「谁拥有最强的计算单元」。因为 AI 时代真正困难的问题,不是产生更多 Token,而是让每一个 Token 在正确的时间、通过正确的计算资源完成任务。 过去三十年,Arm 通过指令集架构连接了移动计算产业;未来,它希望通过计算子系统、软件生态以及系统级优化,继续成为 AI 时代计算基础设施的一部分。 在一个未来形态仍未确定的时代,Arm 选择的不是预测唯一答案,而是建立一个能够适应不同答案的平台。 这或许也是它对 AI 时代最大的判断,下一个阶段的竞争,不只是计算能力的竞争,而是组织计算能力的竞争。 本文为极客公园原创文章,转载请联系极客君微信 geekparkGO 加州时间 9 月 9 日,苹果秋季发布会开场,这也是新 CEO 特纳斯上任后的第一场 keynote。折叠屏 iPhone、涨价、AI……苹果这一次究竟能拿出多少「新东西」? 本周四凌晨 00:40,极客公园视频号直播间,我们和极客公园副主编靖宇、极客公园作者 Alan,一起聊聊:新 CEO 特纳斯的第一场大考,苹果到底有多「特努力」? 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 都市快报橙柿互动 2026-09-09 11:41:44 上观新闻 2026-09-09 11:35:29 参考消息 2026-09-08 21:47:08 半岛都市报 2026-09-09 07:35:10 澎湃新闻 2026-09-08 23:14:11 新京报评论 2026-09-09 14:41:24 广东卫视 2026-09-09 16:44:44 闪电新闻 2026-09-09 14:58:38 中国能源网 2026-09-09 08:15:10 政知新媒体 2026-09-09 15:28:16 中国新闻周刊 2026-09-09 18:04:48 界面新闻 2026-09-09 10:48:37 证券时报 2026-09-09 21:06:03 参考消息 2026-09-09 12:27:49 国家统计局 2026-09-09 09:33:56 大风新闻 2026-09-09 20:38:28 吉刻新闻 2026-09-09 21:11:22
〖Five〗,还是要控制!中国女篮此役出现17次失误 韩旭&杨舒予各3次-1868d2b8,Token 之后,谁来组织 AI 计算?Arm 寻找下一代计算的答案 Token 之后,AI 计算进入协同竞争时代。 如果说今年 3 月,Arm 推出首款自研 CPU 芯片,是这家公司向市场释放的一个信号,它开始尝试突破过去「只提供底层架构授权」的角色边界。那么在上海举办的 Arm Everywhere China 活动上,Arm 想传递的信息更加明确,不要再用过去「CPU IP 供应商」的方式理解今天的 Arm。 在这场活动中,Arm 没有只围绕某一个产品展开叙事,而是第一次更加完整地将自己的未来方向拆成三条线,云 AI、边缘 AI 和物理 AI。 和往年不太一样,去年 Arm 的主题演讲几乎全部围绕一件事展开 SME2,也就是让 AI 在 CPU 上跑起来。那是一个典型的「架构升级」叙事。但今年的主题演讲,三位业务负责人分别讲边缘 AI、物理 AI 和云 AI,围绕场景展开,算力会在云、端侧和物理世界之间流动,而 Arm 想成为这个「计算基建」的底座。 今年的 Arm 试图回答的是另一个问题,当 AI 正在重新改变计算方式时,下一代计算平台应该如何被设计?当 AI 计算正在从单一芯片性能竞争,转向多个计算单元协同竞争时,谁能够组织这些计算资源?我们惊讶地与多位 Arm 高管的交流中发现,当下的算力平台似乎不再追求为某一种确定的未来而设计,而是选择拥抱某种不确定性。 过去几十年,Arm 最成功的商业模式是通过 CPU 架构和 IP 授权连接整个半导体产业。芯片厂商基于 Arm 架构设计 SoC,终端厂商基于这些芯片打造产品,而 Arm 通过开放授权模式成为移动计算时代的重要基础设施。到今天,基于 Arm 技术的芯片累计出货已经超过 3500 亿颗。 过去,芯片竞争更多围绕单一指标展开,需要更强的 CPU、更大的 GPU、更先进的制程。但进入 AI 时代后,一次完整的 AI 任务已经不再只是某一个计算单元完成,AI 任务也从单次计算逐渐走向连续推理、多模态交互以及智能体式的任务执行。这意味着,未来计算竞争的关键不只是拥有多少算力,而是如何让不同计算资源更加高效地协同。 这次活动的主题演讲,Arm 重点讲述了在不同任务场景里的算力需求变化。 在边缘 AI 领域,算力从「被动响应」到「持续运行」。两年前的 AI 是你问一句、它答一句,任务结束;今天的智能体则要理解上下文、检索本机数据、调用应用、在用户授权下自主完成任务,而且要在手机的功耗和散热约束下持续运行。终端设备正在从执行应用和处理数据的工具,变成能够理解意图、实时响应的智能节点。 在物理 AI 领域,算力从「车」转移到「机器人」。Arm 过去在汽车上的角色是提供安全、实时、低功耗的计算底座,而现在它走到了机器人上,两者共同的特征是感知和执行,都要求从「传感器」到「执行」的延迟足够短。 在云端 AI 领域,Arm 引用 IDC 的数据说,基于 Arm 架构的机架级服务器市场规模已经超越 x86,成为加速计算的主流平台。过去二十年数据中心 CPU 面向的是横向扩展的突发性负载,但智能体则是持续的,一个智能体能发起数百次调用。 「在智能体时代,CPU 的角色不再是加速,而是编排」。Arm 基础设施业务的负责人提到,这也是 Arm 开始改变自身角色的原因。如果继续停留在过去的 IP 授权模式,Arm 可以提供优秀的 CPU 架构,但无法参与决定一次 AI 任务最终如何完成。因此,近几年 Arm 开始逐渐从单纯提供 IP,走向提供更加完整的平台能力。如今,客户可以买 Arm 的 IP、也可以买 CSS,甚至可以买芯片。 但今年最明显的不同,是 Arm 开始正面拥抱 AI 时代最大的特点:不确定性。 下一代终端到底是什么形态,端侧模型最终会发展到什么规模,智能体的算力应该放在 CPU、NPU 还是云端,目前都没有明确答案。Arm 自己也没有假装自己看到了答案。在媒体沟通会上,我们问了很多关于「谁来决定」的问题,得到的回答却都是「待定」。 当被问到 CPU 和 NPU 之间的分工由谁来定,他们认为「系统的所有者拥有控制权」;问 CPU 会不会比 NPU 更重要,他们提到「行业在寻找下一个平衡点」;问 CSS 会跨领域复用还是持续分化,他们回答是「取决于市场需要」;问未来 GPU 里传统着色器和神经计算的资源比例怎么分,他们回答是这个决定「留给芯片合作伙伴」。 从这里我们看出,Arm 和英伟达区别之一就在于英伟达的路线是「我知道未来 AI 计算是什么样,所以我构建一个完整的平台」;Arm 的路线是「未来 AI 计算还没有确定,所以我要构建一个允许变化的平台」。前者用 CUDA 把开发者锁进一种范式,后者把范式的决定权交出去,只保证无论选哪一种,底座都有 Arm 参与搭建。 理解了这一点,再看 Arm 这次发布的每一个产品,会发现它们的设计思路都是同一个逻辑的不同表达,不替客户做决定,但让每一种决定都能跑得更好。 Arm 重新定义 CPU、GPU 和 CSS 过去,芯片厂商习惯于围绕不同功能划分计算单元。CPU 负责通用计算,GPU 负责图形处理,NPU 负责 AI 加速。这种分工在过去几十年里非常有效。但 AI 时代正在模糊这些边界。尤其是在端侧,AI 任务并不是简单地把一个模型丢给某个加速器运行,而是包含了理解、记忆、推理和执行等多个环节。不同阶段需要协调不同类型的计算资源。 因此,未来芯片竞争的重点,可能不再是谁拥有更强的单一计算单元,而是谁能够让这些计算单元更高效地协同。 当 AI 计算不再由单一芯片决定,未来的计算平台应该如何重新设计?我们可以从 Arm 此次发布的 CPU、GPU和 CSS 平台后看看 Arm 的最新思考。 CSS for Mobile 2:第一个 AI 原生计算子系统,重组 SoC 设计方式 过去客户获得的是不同的 IP 模块,需要自行完成大量设计和优化。而 CSS 是 Arm 打造的一套计算子系统,可以让客户能够更快构建面向 AI 时代的芯片,也就是说,是一个「半成品」的芯片设计方案。 有意思的是,去年的第一代 CSS for Mobile 当时叫 Lumex,今年改名为 CSS for Mobile 2,Arm 说是为了让人一眼看出这个子系统面向哪个行业,也从单个 IP 升级到完整 AI 计算平台。 9 月 8 日,Arm 将刚刚推出的 CSS for Mobile 2 定义为首个 AI 原生移动计算子系统,包括 Arm C2 CPU cluster、Mali G2-Ultra NXGPU、SI L2 system interconnect 以及软件和开发工具。 相比上一代,单线程性能提升最高 15%,多线程性能提升最高 12%,网页浏览速度提升最高 15%,应用启动速度提升最高 12%,AI 模型性能最高提升 1.7 倍。 这次发布的 Neoverse CSS N4 是 Arm 迄今可配置性最高的 CSS,单颗裸片支持 128 个 CPU 核心配置,也是首款支持 LPDDR6 和 PCIe Gen 7 的 Neoverse CSS;相比上一代 CSS N3,插槽性能最高提升至 2 倍,每瓦性能最高提升 25%,内存带宽最高提升 75%。 在系统层面,N4 进一步强化了内存和 I/O 能力,以满足智能体 AI 时代更高的数据移动需求。「智能体工作负载让内存需求比以往任何时候都高,在内存访问过程当中,每一纳秒都是非常重要的」,Arm 高管解释道。 CSS 模式的价值已经在产业链中得到验证。微软基于 Neoverse CSS 在 18 个月内完成两代 Cobalt CPU 的交付;云豹智能则基于 CSS N2 构建 DPU 产品。 当被问到 CSS 会不会跨领域复用时,Arm 高管提到「未来我们的产品怎么走,取决于客户到底需要什么。」 Arm 不预设 CSS 应该长什么样,它只希望无论市场往哪个方向走,这个底座都跟得上。「我们服务的还不仅仅只是开发人员,我们还要考虑到智能体。」对 Arm 而言,CSS 的意义并不只是减少客户设计时间,而是把过去分散的 IP 组合成一个可以面向未来变化调整的平台。 C2-Ultra CPU :重新定义 AI 时代 CPU 的位置 在 AI 浪潮的前几年,行业曾经出现一种观点:随着 NPU 等专用加速器的发展,CPU 的重要性可能会下降,手机芯片的竞争会逐渐转向 TOPS 竞争。 Arm 此次推出的 C2 CPU 集群参考配置为 2 颗 C2-Ultra 加 6 颗 C2-Pro,并通过 DynamIQ Shared Unit(DSU)共享 L3 缓存,同时配置两个 SME2 单元增强 AI 工作负载处理能力。相比上一代 C1-Ultra,C2-Ultra 单线程性能提升 15%,多线程性能提升 12%。在实际终端体验中,Arm 测试显示网页浏览速度提升 15%,应用启动速度提升 12%,AI 工作负载性能最高提升 1.7 倍,相同性能下功耗最高降低 38%。Arm 认为,C2 延续了近几年 CPU 性能持续实现「双位数提升」的趋势。 但相比这些性能数字,Arm 更想强调的是一个新的应用场景:Agent。 传统应用更多是用户发起一次请求,系统完成一次任务。但当 AI Agent 进入终端之后,一个任务可能会经历理解用户意图、调用本地数据、生成内容、访问应用服务等多个阶段。一次完整的 AI 任务,不再只是某一个模型推理过程,而是多个计算资源共同参与的连续流程。 例如,用户让手机帮助规划一次旅行。系统首先需要理解用户需求,然后读取本地日历、照片、位置等信息,再调用模型生成计划,最后可能还需要连接第三方应用完成预订。在这个过程中,并不是所有步骤都需要 NPU 完成。有些任务需要低延迟响应,有些需要访问系统资源,有些需要在 CPU、GPU、NPU 之间完成协同。而这些工作,正是 CPU 长期以来擅长的领域。 Arm 工程师在沟通中提到,对于 AI Agent 这样的新型工作负载,峰值算力并不是唯一指标,整个任务链路中的延迟和效率同样重要。因此,未来 CPU 并不会取代 NPU,而是在 AI 计算体系中承担更加重要的基础角色。 Mali G2-Ultra NX GPU:重新定义视觉计算 如果说 C2 CPU 回答的是「AI 时代谁负责组织计算」,那么 GPU 回答的是另一个问题:未来终端的视觉体验,是否会因为 AI 而被重新设计? 移动设备始终面临一个无法绕开的限制,用户希望看到接近 PC 和主机级别的视觉效果,但手机的功耗、散热和电池容量不会无限增长。过去提升画质主要依靠增加 GPU 算力,而 AI 正在提供另一种路径,让 GPU 用更少的计算完成更复杂的视觉效果。 对于游戏开发者而言,这意味着过去因为移动设备性能限制无法实现的视觉效果,开始有机会进入终端设备。 Arm 此次推出首款集成神经网络加速能力的 Mali G2-Ultra NX GPU,本质上是在重新设计 GPU 和 AI 之间的关系。这是第一款将神经网络加速器直接集成到着色器内核中的 Mali GPU。 该加速器支持 int8 和 int16 计算,神经网络加速器的运行频率最高可达到 GPU 时钟频率的两倍,并与执行引擎共享 L1、L2 缓存,可以作为图形管线的一部分参与调度。同时,它拥有独立功耗门控,在不使用时可以关闭。 这意味着 AI 不再只是 SoC 中的一个独立模块,而开始进入传统图形处理流程。 在传统渲染中,GPU 需要计算大量真实像素;而在 AI 原生图形中,GPU 可以只生成部分内容,再由 AI 完成重建。例如,神经超级采样可以只渲染四分之一像素,其余由 AI 恢复;神经帧率超分可以在两帧真实渲染之间生成额外帧;神经超级采样结合降噪,则可以减少光追需要计算的光线数量,再通过 AI 恢复画面质量。 Arm 工程师表示,这套网络采用卷积网络而非 Transformer,模型经过高度压缩,功耗不到 1 瓦。目前 Arm 主要聚焦单帧插值,并没有走向 DLSS 类似的多帧生成路线。 除了 AI 图形能力,G2-Ultra NX 也继续增强传统渲染能力。它采用了 Mali 七代以来最大的一次指令集重构,每个线程组寄存器数量翻倍,寄存器分配从固定 32 或 64 改为 16 为单位动态分配,从而减少寄存器溢出,并支持包括 Unreal Engine 5 Lumen、Nanite 在内的复杂图形工作负载。 同时,Arm 带来了第三代光追单元,通过更紧凑的三角形表达消除冗余数据、减少内存访问,主流光追基准场景下 DRAM 流量最高降低 13%。配合硬件级遮挡剔除(OMM),光线追踪工作负载最高降低 70%,帧率最高提升 30%。在传统渲染方面,游戏基准综合性能平均提升 20% 但 Arm 并没有试图定义唯一的 AI 图形方案。 在《光影新生》的展示中,Arm 展示了 AI 重建和光追结合后的移动端视觉效果。与此同时,Arm 将神经图形相关模型开源到 Hugging Face 和 GitHub,让开发者可以根据自己的游戏风格重新训练模型。 《光影新生》将在 6-12 月内上线|图片来源:极客公园 Arm 高管提到,移动设备种类非常复杂,不同产品拥有不同的功耗预算,因此未来 GPU 中传统着色器和神经计算资源的比例,不应该由 Arm 单独决定,而应该由合作伙伴根据产品定位调整。 SME2:真正的竞争不只是硬件,而是如何让 AI 能力被使用 在沟通会上,Arm 高管坦率表示,SME2 引擎本身与去年保持一致,今年的变化更多体现在 CPU 集群中加入更多 SME2 单元,以及围绕指令集和软件生态进行优化。 如果说 C2 CPU 代表了 Arm 对「AI 时代 CPU 应该扮演什么角色」的判断,那么 SME2 则体现了 Arm 另一层思考:硬件能力最终能否产生价值,取决于软件生态能否真正调用它。 去年,Arm 介绍最多的技术之一就是 SME2。它通过扩展 CPU 处理矩阵计算和向量计算的能力,让更多 AI 工作负载能够运行在 CPU 上。 但今年,Arm 关注的重点已经发生变化。SME2 不再只是一个新的 CPU 指令集,而正在成为 Arm 推动 CPU AI 生态的重要入口。 通过 KleidiAI 等软件优化,Arm 希望降低开发者调用 CPU AI 能力的门槛。目前 KleidiAI 已经支持多个 AI 框架和应用,让开发者不需要针对每一款芯片单独优化,就能够利用 CPU 中的 AI 加速能力。这也体现了 AI 时代芯片竞争逻辑的变化。 过去,芯片厂商竞争的是有没有新的硬件能力;但在 AI 时代,真正决定体验的,是这些能力能否被软件生态快速使用。对于开发者而言,他们并不关心芯片内部增加了多少指令集,而更关心自己的模型和应用能否在不同设备之间快速迁移。 从 C2 CPU,到 SME2,再到 Mali G2-Ultra NX 和 CSS for Mobile 2,Arm 实际上都在回答同一个问题:AI 时代,竞争不再只是制造更强的计算单元,而是让不同计算能力能够被更高效地组织和使用。 如果说过去几年 AI 产业竞争的核心,是如何训练更大的模型、拥有更多参数,那么进入推理时代后,行业正在面对另一个问题:模型产生 Token 之后,如何让这些 Token 被更高效地处理和分配。 随着智能体、多模态应用的发展,一次完整的 AI 任务已经越来越少由单一芯片完成。一个用户请求背后,可能包含语音识别、信息检索、本地数据访问、模型推理、应用调用等多个步骤,而这些步骤可能分别适合运行在 CPU、GPU、NPU 甚至云端。 因此,未来 AI 计算竞争的重点,可能正在从「制造智能」转向「管理智能」、「编排智能」。 Token 会被分散到云、边缘和终端不同位置产生,而决定一个任务应该在哪里运行、什么时候调用哪一种计算资源,以及如何降低整个流程的延迟,会成为芯片产业下一阶段需要解决的问题。 联想高级副总裁贾朝晖在活动现场提出了一个更激进的判断,未来可能有 80% 的 Token 生成会发生在本地设备上。无论这个比例最终是否实现,它都反映出一个趋势,AI 正在从云端走向更多边缘场景,终端设备将不再只是数据入口,而可能成为智能计算的重要节点。 但未来芯片的竞争或许不再是谁能生成更多 Token,而是谁能够以更低成本、更低延迟处理这些 Token。围绕这个问题,一场关于「谁来决定计算资源如何分配」的竞争正在展开。 芯片上下游的公司正在给出不同答案。英伟达选择的是通过 CUDA 构建从硬件到软件的完整 AI 计算平台。过去几年,CUDA 生态帮助英伟达掌握了数据中心 AI 计算入口,而随着 AI 向端侧延伸,英伟达也开始尝试将这套逻辑带到更多设备场景。 苹果则选择了另一条路线。通过自研芯片、操作系统以及应用生态的深度结合,苹果能够在设备内部完成软硬件协同,自己决定不同任务应该如何分配。 高通希望围绕 Snapdragon 平台成为端侧 AI 的重要入口,通过 CPU、GPU、NPU 和软件生态的组合,让 AI 能力更容易进入手机和 PC 等终端设备。 三星则试图通过芯片、存储和终端产品之间的协同形成优势。在 AI 时代,计算效率不仅取决于处理器性能,也取决于数据如何在计算单元和存储之间流动。 相比这些路径,Arm 选择的是另一种方式。当被问到未来 CPU、GPU 和 NPU 之间的任务分配是否会由 Arm 来决定,以及 Arm 是否会建立统一的 AI 调度层时,Arm 给出的答案是否定的。 Arm 认为,最终的调度权应该交给系统拥有者,由 OEM 厂商、芯片设计公司以及软件开发者根据自己的产品需求决定任务运行在哪里。Arm 自身做的,是确保每一个计算单元都具备足够强的基础能力,并通过软件生态让这些能力更容易被调用。这其实也是 Arm 长期商业模式的延续。 过去,Arm 并不制造最终设备,而是通过开放架构让不同厂商基于 Arm 设计自己的产品。进入 AI 时代后,Arm 并没有试图成为唯一的计算调度者,而是希望成为不同计算资源能够高效协同的基础平台。 从这个角度看,Arm 此次发布的 CPU、GPU、CSS 以及软件生态,并不是单纯增加某一个计算单元的能力,而是在回答同一个问题:当 AI 计算越来越复杂时,如何让不同资源更高效地组合在一起。 未来,芯片竞争的标准可能不再只是「谁拥有最强的计算单元」。因为 AI 时代真正困难的问题,不是产生更多 Token,而是让每一个 Token 在正确的时间、通过正确的计算资源完成任务。 过去三十年,Arm 通过指令集架构连接了移动计算产业;未来,它希望通过计算子系统、软件生态以及系统级优化,继续成为 AI 时代计算基础设施的一部分。 在一个未来形态仍未确定的时代,Arm 选择的不是预测唯一答案,而是建立一个能够适应不同答案的平台。 这或许也是它对 AI 时代最大的判断,下一个阶段的竞争,不只是计算能力的竞争,而是组织计算能力的竞争。 本文为极客公园原创文章,转载请联系极客君微信 geekparkGO 加州时间 9 月 9 日,苹果秋季发布会开场,这也是新 CEO 特纳斯上任后的第一场 keynote。折叠屏 iPhone、涨价、AI……苹果这一次究竟能拿出多少「新东西」? 本周四凌晨 00:40,极客公园视频号直播间,我们和极客公园副主编靖宇、极客公园作者 Alan,一起聊聊:新 CEO 特纳斯的第一场大考,苹果到底有多「特努力」? 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 都市快报橙柿互动 2026-09-09 11:41:44 上观新闻 2026-09-09 11:35:29 参考消息 2026-09-08 21:47:08 半岛都市报 2026-09-09 07:35:10 澎湃新闻 2026-09-08 23:14:11 新京报评论 2026-09-09 14:41:24 广东卫视 2026-09-09 16:44:44 闪电新闻 2026-09-09 14:58:38 中国能源网 2026-09-09 08:15:10 政知新媒体 2026-09-09 15:28:16 中国新闻周刊 2026-09-09 18:04:48 界面新闻 2026-09-09 10:48:37 证券时报 2026-09-09 21:06:03 参考消息 2026-09-09 12:27:49 国家统计局 2026-09-09 09:33:56 大风新闻 2026-09-09 20:38:28 吉刻新闻 2026-09-09 21:11:22
〖Six〗,于根伟:感谢方方面面的支持,始终与球队风雨同行、荣辱与共-6c97129a,Token 之后,谁来组织 AI 计算?Arm 寻找下一代计算的答案 Token 之后,AI 计算进入协同竞争时代。 如果说今年 3 月,Arm 推出首款自研 CPU 芯片,是这家公司向市场释放的一个信号,它开始尝试突破过去「只提供底层架构授权」的角色边界。那么在上海举办的 Arm Everywhere China 活动上,Arm 想传递的信息更加明确,不要再用过去「CPU IP 供应商」的方式理解今天的 Arm。 在这场活动中,Arm 没有只围绕某一个产品展开叙事,而是第一次更加完整地将自己的未来方向拆成三条线,云 AI、边缘 AI 和物理 AI。 和往年不太一样,去年 Arm 的主题演讲几乎全部围绕一件事展开 SME2,也就是让 AI 在 CPU 上跑起来。那是一个典型的「架构升级」叙事。但今年的主题演讲,三位业务负责人分别讲边缘 AI、物理 AI 和云 AI,围绕场景展开,算力会在云、端侧和物理世界之间流动,而 Arm 想成为这个「计算基建」的底座。 今年的 Arm 试图回答的是另一个问题,当 AI 正在重新改变计算方式时,下一代计算平台应该如何被设计?当 AI 计算正在从单一芯片性能竞争,转向多个计算单元协同竞争时,谁能够组织这些计算资源?我们惊讶地与多位 Arm 高管的交流中发现,当下的算力平台似乎不再追求为某一种确定的未来而设计,而是选择拥抱某种不确定性。 过去几十年,Arm 最成功的商业模式是通过 CPU 架构和 IP 授权连接整个半导体产业。芯片厂商基于 Arm 架构设计 SoC,终端厂商基于这些芯片打造产品,而 Arm 通过开放授权模式成为移动计算时代的重要基础设施。到今天,基于 Arm 技术的芯片累计出货已经超过 3500 亿颗。 过去,芯片竞争更多围绕单一指标展开,需要更强的 CPU、更大的 GPU、更先进的制程。但进入 AI 时代后,一次完整的 AI 任务已经不再只是某一个计算单元完成,AI 任务也从单次计算逐渐走向连续推理、多模态交互以及智能体式的任务执行。这意味着,未来计算竞争的关键不只是拥有多少算力,而是如何让不同计算资源更加高效地协同。 这次活动的主题演讲,Arm 重点讲述了在不同任务场景里的算力需求变化。 在边缘 AI 领域,算力从「被动响应」到「持续运行」。两年前的 AI 是你问一句、它答一句,任务结束;今天的智能体则要理解上下文、检索本机数据、调用应用、在用户授权下自主完成任务,而且要在手机的功耗和散热约束下持续运行。终端设备正在从执行应用和处理数据的工具,变成能够理解意图、实时响应的智能节点。 在物理 AI 领域,算力从「车」转移到「机器人」。Arm 过去在汽车上的角色是提供安全、实时、低功耗的计算底座,而现在它走到了机器人上,两者共同的特征是感知和执行,都要求从「传感器」到「执行」的延迟足够短。 在云端 AI 领域,Arm 引用 IDC 的数据说,基于 Arm 架构的机架级服务器市场规模已经超越 x86,成为加速计算的主流平台。过去二十年数据中心 CPU 面向的是横向扩展的突发性负载,但智能体则是持续的,一个智能体能发起数百次调用。 「在智能体时代,CPU 的角色不再是加速,而是编排」。Arm 基础设施业务的负责人提到,这也是 Arm 开始改变自身角色的原因。如果继续停留在过去的 IP 授权模式,Arm 可以提供优秀的 CPU 架构,但无法参与决定一次 AI 任务最终如何完成。因此,近几年 Arm 开始逐渐从单纯提供 IP,走向提供更加完整的平台能力。如今,客户可以买 Arm 的 IP、也可以买 CSS,甚至可以买芯片。 但今年最明显的不同,是 Arm 开始正面拥抱 AI 时代最大的特点:不确定性。 下一代终端到底是什么形态,端侧模型最终会发展到什么规模,智能体的算力应该放在 CPU、NPU 还是云端,目前都没有明确答案。Arm 自己也没有假装自己看到了答案。在媒体沟通会上,我们问了很多关于「谁来决定」的问题,得到的回答却都是「待定」。 当被问到 CPU 和 NPU 之间的分工由谁来定,他们认为「系统的所有者拥有控制权」;问 CPU 会不会比 NPU 更重要,他们提到「行业在寻找下一个平衡点」;问 CSS 会跨领域复用还是持续分化,他们回答是「取决于市场需要」;问未来 GPU 里传统着色器和神经计算的资源比例怎么分,他们回答是这个决定「留给芯片合作伙伴」。 从这里我们看出,Arm 和英伟达区别之一就在于英伟达的路线是「我知道未来 AI 计算是什么样,所以我构建一个完整的平台」;Arm 的路线是「未来 AI 计算还没有确定,所以我要构建一个允许变化的平台」。前者用 CUDA 把开发者锁进一种范式,后者把范式的决定权交出去,只保证无论选哪一种,底座都有 Arm 参与搭建。 理解了这一点,再看 Arm 这次发布的每一个产品,会发现它们的设计思路都是同一个逻辑的不同表达,不替客户做决定,但让每一种决定都能跑得更好。 Arm 重新定义 CPU、GPU 和 CSS 过去,芯片厂商习惯于围绕不同功能划分计算单元。CPU 负责通用计算,GPU 负责图形处理,NPU 负责 AI 加速。这种分工在过去几十年里非常有效。但 AI 时代正在模糊这些边界。尤其是在端侧,AI 任务并不是简单地把一个模型丢给某个加速器运行,而是包含了理解、记忆、推理和执行等多个环节。不同阶段需要协调不同类型的计算资源。 因此,未来芯片竞争的重点,可能不再是谁拥有更强的单一计算单元,而是谁能够让这些计算单元更高效地协同。 当 AI 计算不再由单一芯片决定,未来的计算平台应该如何重新设计?我们可以从 Arm 此次发布的 CPU、GPU和 CSS 平台后看看 Arm 的最新思考。 CSS for Mobile 2:第一个 AI 原生计算子系统,重组 SoC 设计方式 过去客户获得的是不同的 IP 模块,需要自行完成大量设计和优化。而 CSS 是 Arm 打造的一套计算子系统,可以让客户能够更快构建面向 AI 时代的芯片,也就是说,是一个「半成品」的芯片设计方案。 有意思的是,去年的第一代 CSS for Mobile 当时叫 Lumex,今年改名为 CSS for Mobile 2,Arm 说是为了让人一眼看出这个子系统面向哪个行业,也从单个 IP 升级到完整 AI 计算平台。 9 月 8 日,Arm 将刚刚推出的 CSS for Mobile 2 定义为首个 AI 原生移动计算子系统,包括 Arm C2 CPU cluster、Mali G2-Ultra NXGPU、SI L2 system interconnect 以及软件和开发工具。 相比上一代,单线程性能提升最高 15%,多线程性能提升最高 12%,网页浏览速度提升最高 15%,应用启动速度提升最高 12%,AI 模型性能最高提升 1.7 倍。 这次发布的 Neoverse CSS N4 是 Arm 迄今可配置性最高的 CSS,单颗裸片支持 128 个 CPU 核心配置,也是首款支持 LPDDR6 和 PCIe Gen 7 的 Neoverse CSS;相比上一代 CSS N3,插槽性能最高提升至 2 倍,每瓦性能最高提升 25%,内存带宽最高提升 75%。 在系统层面,N4 进一步强化了内存和 I/O 能力,以满足智能体 AI 时代更高的数据移动需求。「智能体工作负载让内存需求比以往任何时候都高,在内存访问过程当中,每一纳秒都是非常重要的」,Arm 高管解释道。 CSS 模式的价值已经在产业链中得到验证。微软基于 Neoverse CSS 在 18 个月内完成两代 Cobalt CPU 的交付;云豹智能则基于 CSS N2 构建 DPU 产品。 当被问到 CSS 会不会跨领域复用时,Arm 高管提到「未来我们的产品怎么走,取决于客户到底需要什么。」 Arm 不预设 CSS 应该长什么样,它只希望无论市场往哪个方向走,这个底座都跟得上。「我们服务的还不仅仅只是开发人员,我们还要考虑到智能体。」对 Arm 而言,CSS 的意义并不只是减少客户设计时间,而是把过去分散的 IP 组合成一个可以面向未来变化调整的平台。 C2-Ultra CPU :重新定义 AI 时代 CPU 的位置 在 AI 浪潮的前几年,行业曾经出现一种观点:随着 NPU 等专用加速器的发展,CPU 的重要性可能会下降,手机芯片的竞争会逐渐转向 TOPS 竞争。 Arm 此次推出的 C2 CPU 集群参考配置为 2 颗 C2-Ultra 加 6 颗 C2-Pro,并通过 DynamIQ Shared Unit(DSU)共享 L3 缓存,同时配置两个 SME2 单元增强 AI 工作负载处理能力。相比上一代 C1-Ultra,C2-Ultra 单线程性能提升 15%,多线程性能提升 12%。在实际终端体验中,Arm 测试显示网页浏览速度提升 15%,应用启动速度提升 12%,AI 工作负载性能最高提升 1.7 倍,相同性能下功耗最高降低 38%。Arm 认为,C2 延续了近几年 CPU 性能持续实现「双位数提升」的趋势。 但相比这些性能数字,Arm 更想强调的是一个新的应用场景:Agent。 传统应用更多是用户发起一次请求,系统完成一次任务。但当 AI Agent 进入终端之后,一个任务可能会经历理解用户意图、调用本地数据、生成内容、访问应用服务等多个阶段。一次完整的 AI 任务,不再只是某一个模型推理过程,而是多个计算资源共同参与的连续流程。 例如,用户让手机帮助规划一次旅行。系统首先需要理解用户需求,然后读取本地日历、照片、位置等信息,再调用模型生成计划,最后可能还需要连接第三方应用完成预订。在这个过程中,并不是所有步骤都需要 NPU 完成。有些任务需要低延迟响应,有些需要访问系统资源,有些需要在 CPU、GPU、NPU 之间完成协同。而这些工作,正是 CPU 长期以来擅长的领域。 Arm 工程师在沟通中提到,对于 AI Agent 这样的新型工作负载,峰值算力并不是唯一指标,整个任务链路中的延迟和效率同样重要。因此,未来 CPU 并不会取代 NPU,而是在 AI 计算体系中承担更加重要的基础角色。 Mali G2-Ultra NX GPU:重新定义视觉计算 如果说 C2 CPU 回答的是「AI 时代谁负责组织计算」,那么 GPU 回答的是另一个问题:未来终端的视觉体验,是否会因为 AI 而被重新设计? 移动设备始终面临一个无法绕开的限制,用户希望看到接近 PC 和主机级别的视觉效果,但手机的功耗、散热和电池容量不会无限增长。过去提升画质主要依靠增加 GPU 算力,而 AI 正在提供另一种路径,让 GPU 用更少的计算完成更复杂的视觉效果。 对于游戏开发者而言,这意味着过去因为移动设备性能限制无法实现的视觉效果,开始有机会进入终端设备。 Arm 此次推出首款集成神经网络加速能力的 Mali G2-Ultra NX GPU,本质上是在重新设计 GPU 和 AI 之间的关系。这是第一款将神经网络加速器直接集成到着色器内核中的 Mali GPU。 该加速器支持 int8 和 int16 计算,神经网络加速器的运行频率最高可达到 GPU 时钟频率的两倍,并与执行引擎共享 L1、L2 缓存,可以作为图形管线的一部分参与调度。同时,它拥有独立功耗门控,在不使用时可以关闭。 这意味着 AI 不再只是 SoC 中的一个独立模块,而开始进入传统图形处理流程。 在传统渲染中,GPU 需要计算大量真实像素;而在 AI 原生图形中,GPU 可以只生成部分内容,再由 AI 完成重建。例如,神经超级采样可以只渲染四分之一像素,其余由 AI 恢复;神经帧率超分可以在两帧真实渲染之间生成额外帧;神经超级采样结合降噪,则可以减少光追需要计算的光线数量,再通过 AI 恢复画面质量。 Arm 工程师表示,这套网络采用卷积网络而非 Transformer,模型经过高度压缩,功耗不到 1 瓦。目前 Arm 主要聚焦单帧插值,并没有走向 DLSS 类似的多帧生成路线。 除了 AI 图形能力,G2-Ultra NX 也继续增强传统渲染能力。它采用了 Mali 七代以来最大的一次指令集重构,每个线程组寄存器数量翻倍,寄存器分配从固定 32 或 64 改为 16 为单位动态分配,从而减少寄存器溢出,并支持包括 Unreal Engine 5 Lumen、Nanite 在内的复杂图形工作负载。 同时,Arm 带来了第三代光追单元,通过更紧凑的三角形表达消除冗余数据、减少内存访问,主流光追基准场景下 DRAM 流量最高降低 13%。配合硬件级遮挡剔除(OMM),光线追踪工作负载最高降低 70%,帧率最高提升 30%。在传统渲染方面,游戏基准综合性能平均提升 20% 但 Arm 并没有试图定义唯一的 AI 图形方案。 在《光影新生》的展示中,Arm 展示了 AI 重建和光追结合后的移动端视觉效果。与此同时,Arm 将神经图形相关模型开源到 Hugging Face 和 GitHub,让开发者可以根据自己的游戏风格重新训练模型。 《光影新生》将在 6-12 月内上线|图片来源:极客公园 Arm 高管提到,移动设备种类非常复杂,不同产品拥有不同的功耗预算,因此未来 GPU 中传统着色器和神经计算资源的比例,不应该由 Arm 单独决定,而应该由合作伙伴根据产品定位调整。 SME2:真正的竞争不只是硬件,而是如何让 AI 能力被使用 在沟通会上,Arm 高管坦率表示,SME2 引擎本身与去年保持一致,今年的变化更多体现在 CPU 集群中加入更多 SME2 单元,以及围绕指令集和软件生态进行优化。 如果说 C2 CPU 代表了 Arm 对「AI 时代 CPU 应该扮演什么角色」的判断,那么 SME2 则体现了 Arm 另一层思考:硬件能力最终能否产生价值,取决于软件生态能否真正调用它。 去年,Arm 介绍最多的技术之一就是 SME2。它通过扩展 CPU 处理矩阵计算和向量计算的能力,让更多 AI 工作负载能够运行在 CPU 上。 但今年,Arm 关注的重点已经发生变化。SME2 不再只是一个新的 CPU 指令集,而正在成为 Arm 推动 CPU AI 生态的重要入口。 通过 KleidiAI 等软件优化,Arm 希望降低开发者调用 CPU AI 能力的门槛。目前 KleidiAI 已经支持多个 AI 框架和应用,让开发者不需要针对每一款芯片单独优化,就能够利用 CPU 中的 AI 加速能力。这也体现了 AI 时代芯片竞争逻辑的变化。 过去,芯片厂商竞争的是有没有新的硬件能力;但在 AI 时代,真正决定体验的,是这些能力能否被软件生态快速使用。对于开发者而言,他们并不关心芯片内部增加了多少指令集,而更关心自己的模型和应用能否在不同设备之间快速迁移。 从 C2 CPU,到 SME2,再到 Mali G2-Ultra NX 和 CSS for Mobile 2,Arm 实际上都在回答同一个问题:AI 时代,竞争不再只是制造更强的计算单元,而是让不同计算能力能够被更高效地组织和使用。 如果说过去几年 AI 产业竞争的核心,是如何训练更大的模型、拥有更多参数,那么进入推理时代后,行业正在面对另一个问题:模型产生 Token 之后,如何让这些 Token 被更高效地处理和分配。 随着智能体、多模态应用的发展,一次完整的 AI 任务已经越来越少由单一芯片完成。一个用户请求背后,可能包含语音识别、信息检索、本地数据访问、模型推理、应用调用等多个步骤,而这些步骤可能分别适合运行在 CPU、GPU、NPU 甚至云端。 因此,未来 AI 计算竞争的重点,可能正在从「制造智能」转向「管理智能」、「编排智能」。 Token 会被分散到云、边缘和终端不同位置产生,而决定一个任务应该在哪里运行、什么时候调用哪一种计算资源,以及如何降低整个流程的延迟,会成为芯片产业下一阶段需要解决的问题。 联想高级副总裁贾朝晖在活动现场提出了一个更激进的判断,未来可能有 80% 的 Token 生成会发生在本地设备上。无论这个比例最终是否实现,它都反映出一个趋势,AI 正在从云端走向更多边缘场景,终端设备将不再只是数据入口,而可能成为智能计算的重要节点。 但未来芯片的竞争或许不再是谁能生成更多 Token,而是谁能够以更低成本、更低延迟处理这些 Token。围绕这个问题,一场关于「谁来决定计算资源如何分配」的竞争正在展开。 芯片上下游的公司正在给出不同答案。英伟达选择的是通过 CUDA 构建从硬件到软件的完整 AI 计算平台。过去几年,CUDA 生态帮助英伟达掌握了数据中心 AI 计算入口,而随着 AI 向端侧延伸,英伟达也开始尝试将这套逻辑带到更多设备场景。 苹果则选择了另一条路线。通过自研芯片、操作系统以及应用生态的深度结合,苹果能够在设备内部完成软硬件协同,自己决定不同任务应该如何分配。 高通希望围绕 Snapdragon 平台成为端侧 AI 的重要入口,通过 CPU、GPU、NPU 和软件生态的组合,让 AI 能力更容易进入手机和 PC 等终端设备。 三星则试图通过芯片、存储和终端产品之间的协同形成优势。在 AI 时代,计算效率不仅取决于处理器性能,也取决于数据如何在计算单元和存储之间流动。 相比这些路径,Arm 选择的是另一种方式。当被问到未来 CPU、GPU 和 NPU 之间的任务分配是否会由 Arm 来决定,以及 Arm 是否会建立统一的 AI 调度层时,Arm 给出的答案是否定的。 Arm 认为,最终的调度权应该交给系统拥有者,由 OEM 厂商、芯片设计公司以及软件开发者根据自己的产品需求决定任务运行在哪里。Arm 自身做的,是确保每一个计算单元都具备足够强的基础能力,并通过软件生态让这些能力更容易被调用。这其实也是 Arm 长期商业模式的延续。 过去,Arm 并不制造最终设备,而是通过开放架构让不同厂商基于 Arm 设计自己的产品。进入 AI 时代后,Arm 并没有试图成为唯一的计算调度者,而是希望成为不同计算资源能够高效协同的基础平台。 从这个角度看,Arm 此次发布的 CPU、GPU、CSS 以及软件生态,并不是单纯增加某一个计算单元的能力,而是在回答同一个问题:当 AI 计算越来越复杂时,如何让不同资源更高效地组合在一起。 未来,芯片竞争的标准可能不再只是「谁拥有最强的计算单元」。因为 AI 时代真正困难的问题,不是产生更多 Token,而是让每一个 Token 在正确的时间、通过正确的计算资源完成任务。 过去三十年,Arm 通过指令集架构连接了移动计算产业;未来,它希望通过计算子系统、软件生态以及系统级优化,继续成为 AI 时代计算基础设施的一部分。 在一个未来形态仍未确定的时代,Arm 选择的不是预测唯一答案,而是建立一个能够适应不同答案的平台。 这或许也是它对 AI 时代最大的判断,下一个阶段的竞争,不只是计算能力的竞争,而是组织计算能力的竞争。 本文为极客公园原创文章,转载请联系极客君微信 geekparkGO 加州时间 9 月 9 日,苹果秋季发布会开场,这也是新 CEO 特纳斯上任后的第一场 keynote。折叠屏 iPhone、涨价、AI……苹果这一次究竟能拿出多少「新东西」? 本周四凌晨 00:40,极客公园视频号直播间,我们和极客公园副主编靖宇、极客公园作者 Alan,一起聊聊:新 CEO 特纳斯的第一场大考,苹果到底有多「特努力」? 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 都市快报橙柿互动 2026-09-09 11:41:44 上观新闻 2026-09-09 11:35:29 参考消息 2026-09-08 21:47:08 半岛都市报 2026-09-09 07:35:10 澎湃新闻 2026-09-08 23:14:11 新京报评论 2026-09-09 14:41:24 广东卫视 2026-09-09 16:44:44 闪电新闻 2026-09-09 14:58:38 中国能源网 2026-09-09 08:15:10 政知新媒体 2026-09-09 15:28:16 中国新闻周刊 2026-09-09 18:04:48 界面新闻 2026-09-09 10:48:37 证券时报 2026-09-09 21:06:03 参考消息 2026-09-09 12:27:49 国家统计局 2026-09-09 09:33:56 大风新闻 2026-09-09 20:38:28 吉刻新闻 2026-09-09 21:11:22
〖Seven〗,曾以8888万夺央视“标王”,太子奶创始人李途纯逝世-83692984,Token 之后,谁来组织 AI 计算?Arm 寻找下一代计算的答案 Token 之后,AI 计算进入协同竞争时代。 如果说今年 3 月,Arm 推出首款自研 CPU 芯片,是这家公司向市场释放的一个信号,它开始尝试突破过去「只提供底层架构授权」的角色边界。那么在上海举办的 Arm Everywhere China 活动上,Arm 想传递的信息更加明确,不要再用过去「CPU IP 供应商」的方式理解今天的 Arm。 在这场活动中,Arm 没有只围绕某一个产品展开叙事,而是第一次更加完整地将自己的未来方向拆成三条线,云 AI、边缘 AI 和物理 AI。 和往年不太一样,去年 Arm 的主题演讲几乎全部围绕一件事展开 SME2,也就是让 AI 在 CPU 上跑起来。那是一个典型的「架构升级」叙事。但今年的主题演讲,三位业务负责人分别讲边缘 AI、物理 AI 和云 AI,围绕场景展开,算力会在云、端侧和物理世界之间流动,而 Arm 想成为这个「计算基建」的底座。 今年的 Arm 试图回答的是另一个问题,当 AI 正在重新改变计算方式时,下一代计算平台应该如何被设计?当 AI 计算正在从单一芯片性能竞争,转向多个计算单元协同竞争时,谁能够组织这些计算资源?我们惊讶地与多位 Arm 高管的交流中发现,当下的算力平台似乎不再追求为某一种确定的未来而设计,而是选择拥抱某种不确定性。 过去几十年,Arm 最成功的商业模式是通过 CPU 架构和 IP 授权连接整个半导体产业。芯片厂商基于 Arm 架构设计 SoC,终端厂商基于这些芯片打造产品,而 Arm 通过开放授权模式成为移动计算时代的重要基础设施。到今天,基于 Arm 技术的芯片累计出货已经超过 3500 亿颗。 过去,芯片竞争更多围绕单一指标展开,需要更强的 CPU、更大的 GPU、更先进的制程。但进入 AI 时代后,一次完整的 AI 任务已经不再只是某一个计算单元完成,AI 任务也从单次计算逐渐走向连续推理、多模态交互以及智能体式的任务执行。这意味着,未来计算竞争的关键不只是拥有多少算力,而是如何让不同计算资源更加高效地协同。 这次活动的主题演讲,Arm 重点讲述了在不同任务场景里的算力需求变化。 在边缘 AI 领域,算力从「被动响应」到「持续运行」。两年前的 AI 是你问一句、它答一句,任务结束;今天的智能体则要理解上下文、检索本机数据、调用应用、在用户授权下自主完成任务,而且要在手机的功耗和散热约束下持续运行。终端设备正在从执行应用和处理数据的工具,变成能够理解意图、实时响应的智能节点。 在物理 AI 领域,算力从「车」转移到「机器人」。Arm 过去在汽车上的角色是提供安全、实时、低功耗的计算底座,而现在它走到了机器人上,两者共同的特征是感知和执行,都要求从「传感器」到「执行」的延迟足够短。 在云端 AI 领域,Arm 引用 IDC 的数据说,基于 Arm 架构的机架级服务器市场规模已经超越 x86,成为加速计算的主流平台。过去二十年数据中心 CPU 面向的是横向扩展的突发性负载,但智能体则是持续的,一个智能体能发起数百次调用。 「在智能体时代,CPU 的角色不再是加速,而是编排」。Arm 基础设施业务的负责人提到,这也是 Arm 开始改变自身角色的原因。如果继续停留在过去的 IP 授权模式,Arm 可以提供优秀的 CPU 架构,但无法参与决定一次 AI 任务最终如何完成。因此,近几年 Arm 开始逐渐从单纯提供 IP,走向提供更加完整的平台能力。如今,客户可以买 Arm 的 IP、也可以买 CSS,甚至可以买芯片。 但今年最明显的不同,是 Arm 开始正面拥抱 AI 时代最大的特点:不确定性。 下一代终端到底是什么形态,端侧模型最终会发展到什么规模,智能体的算力应该放在 CPU、NPU 还是云端,目前都没有明确答案。Arm 自己也没有假装自己看到了答案。在媒体沟通会上,我们问了很多关于「谁来决定」的问题,得到的回答却都是「待定」。 当被问到 CPU 和 NPU 之间的分工由谁来定,他们认为「系统的所有者拥有控制权」;问 CPU 会不会比 NPU 更重要,他们提到「行业在寻找下一个平衡点」;问 CSS 会跨领域复用还是持续分化,他们回答是「取决于市场需要」;问未来 GPU 里传统着色器和神经计算的资源比例怎么分,他们回答是这个决定「留给芯片合作伙伴」。 从这里我们看出,Arm 和英伟达区别之一就在于英伟达的路线是「我知道未来 AI 计算是什么样,所以我构建一个完整的平台」;Arm 的路线是「未来 AI 计算还没有确定,所以我要构建一个允许变化的平台」。前者用 CUDA 把开发者锁进一种范式,后者把范式的决定权交出去,只保证无论选哪一种,底座都有 Arm 参与搭建。 理解了这一点,再看 Arm 这次发布的每一个产品,会发现它们的设计思路都是同一个逻辑的不同表达,不替客户做决定,但让每一种决定都能跑得更好。 Arm 重新定义 CPU、GPU 和 CSS 过去,芯片厂商习惯于围绕不同功能划分计算单元。CPU 负责通用计算,GPU 负责图形处理,NPU 负责 AI 加速。这种分工在过去几十年里非常有效。但 AI 时代正在模糊这些边界。尤其是在端侧,AI 任务并不是简单地把一个模型丢给某个加速器运行,而是包含了理解、记忆、推理和执行等多个环节。不同阶段需要协调不同类型的计算资源。 因此,未来芯片竞争的重点,可能不再是谁拥有更强的单一计算单元,而是谁能够让这些计算单元更高效地协同。 当 AI 计算不再由单一芯片决定,未来的计算平台应该如何重新设计?我们可以从 Arm 此次发布的 CPU、GPU和 CSS 平台后看看 Arm 的最新思考。 CSS for Mobile 2:第一个 AI 原生计算子系统,重组 SoC 设计方式 过去客户获得的是不同的 IP 模块,需要自行完成大量设计和优化。而 CSS 是 Arm 打造的一套计算子系统,可以让客户能够更快构建面向 AI 时代的芯片,也就是说,是一个「半成品」的芯片设计方案。 有意思的是,去年的第一代 CSS for Mobile 当时叫 Lumex,今年改名为 CSS for Mobile 2,Arm 说是为了让人一眼看出这个子系统面向哪个行业,也从单个 IP 升级到完整 AI 计算平台。 9 月 8 日,Arm 将刚刚推出的 CSS for Mobile 2 定义为首个 AI 原生移动计算子系统,包括 Arm C2 CPU cluster、Mali G2-Ultra NXGPU、SI L2 system interconnect 以及软件和开发工具。 相比上一代,单线程性能提升最高 15%,多线程性能提升最高 12%,网页浏览速度提升最高 15%,应用启动速度提升最高 12%,AI 模型性能最高提升 1.7 倍。 这次发布的 Neoverse CSS N4 是 Arm 迄今可配置性最高的 CSS,单颗裸片支持 128 个 CPU 核心配置,也是首款支持 LPDDR6 和 PCIe Gen 7 的 Neoverse CSS;相比上一代 CSS N3,插槽性能最高提升至 2 倍,每瓦性能最高提升 25%,内存带宽最高提升 75%。 在系统层面,N4 进一步强化了内存和 I/O 能力,以满足智能体 AI 时代更高的数据移动需求。「智能体工作负载让内存需求比以往任何时候都高,在内存访问过程当中,每一纳秒都是非常重要的」,Arm 高管解释道。 CSS 模式的价值已经在产业链中得到验证。微软基于 Neoverse CSS 在 18 个月内完成两代 Cobalt CPU 的交付;云豹智能则基于 CSS N2 构建 DPU 产品。 当被问到 CSS 会不会跨领域复用时,Arm 高管提到「未来我们的产品怎么走,取决于客户到底需要什么。」 Arm 不预设 CSS 应该长什么样,它只希望无论市场往哪个方向走,这个底座都跟得上。「我们服务的还不仅仅只是开发人员,我们还要考虑到智能体。」对 Arm 而言,CSS 的意义并不只是减少客户设计时间,而是把过去分散的 IP 组合成一个可以面向未来变化调整的平台。 C2-Ultra CPU :重新定义 AI 时代 CPU 的位置 在 AI 浪潮的前几年,行业曾经出现一种观点:随着 NPU 等专用加速器的发展,CPU 的重要性可能会下降,手机芯片的竞争会逐渐转向 TOPS 竞争。 Arm 此次推出的 C2 CPU 集群参考配置为 2 颗 C2-Ultra 加 6 颗 C2-Pro,并通过 DynamIQ Shared Unit(DSU)共享 L3 缓存,同时配置两个 SME2 单元增强 AI 工作负载处理能力。相比上一代 C1-Ultra,C2-Ultra 单线程性能提升 15%,多线程性能提升 12%。在实际终端体验中,Arm 测试显示网页浏览速度提升 15%,应用启动速度提升 12%,AI 工作负载性能最高提升 1.7 倍,相同性能下功耗最高降低 38%。Arm 认为,C2 延续了近几年 CPU 性能持续实现「双位数提升」的趋势。 但相比这些性能数字,Arm 更想强调的是一个新的应用场景:Agent。 传统应用更多是用户发起一次请求,系统完成一次任务。但当 AI Agent 进入终端之后,一个任务可能会经历理解用户意图、调用本地数据、生成内容、访问应用服务等多个阶段。一次完整的 AI 任务,不再只是某一个模型推理过程,而是多个计算资源共同参与的连续流程。 例如,用户让手机帮助规划一次旅行。系统首先需要理解用户需求,然后读取本地日历、照片、位置等信息,再调用模型生成计划,最后可能还需要连接第三方应用完成预订。在这个过程中,并不是所有步骤都需要 NPU 完成。有些任务需要低延迟响应,有些需要访问系统资源,有些需要在 CPU、GPU、NPU 之间完成协同。而这些工作,正是 CPU 长期以来擅长的领域。 Arm 工程师在沟通中提到,对于 AI Agent 这样的新型工作负载,峰值算力并不是唯一指标,整个任务链路中的延迟和效率同样重要。因此,未来 CPU 并不会取代 NPU,而是在 AI 计算体系中承担更加重要的基础角色。 Mali G2-Ultra NX GPU:重新定义视觉计算 如果说 C2 CPU 回答的是「AI 时代谁负责组织计算」,那么 GPU 回答的是另一个问题:未来终端的视觉体验,是否会因为 AI 而被重新设计? 移动设备始终面临一个无法绕开的限制,用户希望看到接近 PC 和主机级别的视觉效果,但手机的功耗、散热和电池容量不会无限增长。过去提升画质主要依靠增加 GPU 算力,而 AI 正在提供另一种路径,让 GPU 用更少的计算完成更复杂的视觉效果。 对于游戏开发者而言,这意味着过去因为移动设备性能限制无法实现的视觉效果,开始有机会进入终端设备。 Arm 此次推出首款集成神经网络加速能力的 Mali G2-Ultra NX GPU,本质上是在重新设计 GPU 和 AI 之间的关系。这是第一款将神经网络加速器直接集成到着色器内核中的 Mali GPU。 该加速器支持 int8 和 int16 计算,神经网络加速器的运行频率最高可达到 GPU 时钟频率的两倍,并与执行引擎共享 L1、L2 缓存,可以作为图形管线的一部分参与调度。同时,它拥有独立功耗门控,在不使用时可以关闭。 这意味着 AI 不再只是 SoC 中的一个独立模块,而开始进入传统图形处理流程。 在传统渲染中,GPU 需要计算大量真实像素;而在 AI 原生图形中,GPU 可以只生成部分内容,再由 AI 完成重建。例如,神经超级采样可以只渲染四分之一像素,其余由 AI 恢复;神经帧率超分可以在两帧真实渲染之间生成额外帧;神经超级采样结合降噪,则可以减少光追需要计算的光线数量,再通过 AI 恢复画面质量。 Arm 工程师表示,这套网络采用卷积网络而非 Transformer,模型经过高度压缩,功耗不到 1 瓦。目前 Arm 主要聚焦单帧插值,并没有走向 DLSS 类似的多帧生成路线。 除了 AI 图形能力,G2-Ultra NX 也继续增强传统渲染能力。它采用了 Mali 七代以来最大的一次指令集重构,每个线程组寄存器数量翻倍,寄存器分配从固定 32 或 64 改为 16 为单位动态分配,从而减少寄存器溢出,并支持包括 Unreal Engine 5 Lumen、Nanite 在内的复杂图形工作负载。 同时,Arm 带来了第三代光追单元,通过更紧凑的三角形表达消除冗余数据、减少内存访问,主流光追基准场景下 DRAM 流量最高降低 13%。配合硬件级遮挡剔除(OMM),光线追踪工作负载最高降低 70%,帧率最高提升 30%。在传统渲染方面,游戏基准综合性能平均提升 20% 但 Arm 并没有试图定义唯一的 AI 图形方案。 在《光影新生》的展示中,Arm 展示了 AI 重建和光追结合后的移动端视觉效果。与此同时,Arm 将神经图形相关模型开源到 Hugging Face 和 GitHub,让开发者可以根据自己的游戏风格重新训练模型。 《光影新生》将在 6-12 月内上线|图片来源:极客公园 Arm 高管提到,移动设备种类非常复杂,不同产品拥有不同的功耗预算,因此未来 GPU 中传统着色器和神经计算资源的比例,不应该由 Arm 单独决定,而应该由合作伙伴根据产品定位调整。 SME2:真正的竞争不只是硬件,而是如何让 AI 能力被使用 在沟通会上,Arm 高管坦率表示,SME2 引擎本身与去年保持一致,今年的变化更多体现在 CPU 集群中加入更多 SME2 单元,以及围绕指令集和软件生态进行优化。 如果说 C2 CPU 代表了 Arm 对「AI 时代 CPU 应该扮演什么角色」的判断,那么 SME2 则体现了 Arm 另一层思考:硬件能力最终能否产生价值,取决于软件生态能否真正调用它。 去年,Arm 介绍最多的技术之一就是 SME2。它通过扩展 CPU 处理矩阵计算和向量计算的能力,让更多 AI 工作负载能够运行在 CPU 上。 但今年,Arm 关注的重点已经发生变化。SME2 不再只是一个新的 CPU 指令集,而正在成为 Arm 推动 CPU AI 生态的重要入口。 通过 KleidiAI 等软件优化,Arm 希望降低开发者调用 CPU AI 能力的门槛。目前 KleidiAI 已经支持多个 AI 框架和应用,让开发者不需要针对每一款芯片单独优化,就能够利用 CPU 中的 AI 加速能力。这也体现了 AI 时代芯片竞争逻辑的变化。 过去,芯片厂商竞争的是有没有新的硬件能力;但在 AI 时代,真正决定体验的,是这些能力能否被软件生态快速使用。对于开发者而言,他们并不关心芯片内部增加了多少指令集,而更关心自己的模型和应用能否在不同设备之间快速迁移。 从 C2 CPU,到 SME2,再到 Mali G2-Ultra NX 和 CSS for Mobile 2,Arm 实际上都在回答同一个问题:AI 时代,竞争不再只是制造更强的计算单元,而是让不同计算能力能够被更高效地组织和使用。 如果说过去几年 AI 产业竞争的核心,是如何训练更大的模型、拥有更多参数,那么进入推理时代后,行业正在面对另一个问题:模型产生 Token 之后,如何让这些 Token 被更高效地处理和分配。 随着智能体、多模态应用的发展,一次完整的 AI 任务已经越来越少由单一芯片完成。一个用户请求背后,可能包含语音识别、信息检索、本地数据访问、模型推理、应用调用等多个步骤,而这些步骤可能分别适合运行在 CPU、GPU、NPU 甚至云端。 因此,未来 AI 计算竞争的重点,可能正在从「制造智能」转向「管理智能」、「编排智能」。 Token 会被分散到云、边缘和终端不同位置产生,而决定一个任务应该在哪里运行、什么时候调用哪一种计算资源,以及如何降低整个流程的延迟,会成为芯片产业下一阶段需要解决的问题。 联想高级副总裁贾朝晖在活动现场提出了一个更激进的判断,未来可能有 80% 的 Token 生成会发生在本地设备上。无论这个比例最终是否实现,它都反映出一个趋势,AI 正在从云端走向更多边缘场景,终端设备将不再只是数据入口,而可能成为智能计算的重要节点。 但未来芯片的竞争或许不再是谁能生成更多 Token,而是谁能够以更低成本、更低延迟处理这些 Token。围绕这个问题,一场关于「谁来决定计算资源如何分配」的竞争正在展开。 芯片上下游的公司正在给出不同答案。英伟达选择的是通过 CUDA 构建从硬件到软件的完整 AI 计算平台。过去几年,CUDA 生态帮助英伟达掌握了数据中心 AI 计算入口,而随着 AI 向端侧延伸,英伟达也开始尝试将这套逻辑带到更多设备场景。 苹果则选择了另一条路线。通过自研芯片、操作系统以及应用生态的深度结合,苹果能够在设备内部完成软硬件协同,自己决定不同任务应该如何分配。 高通希望围绕 Snapdragon 平台成为端侧 AI 的重要入口,通过 CPU、GPU、NPU 和软件生态的组合,让 AI 能力更容易进入手机和 PC 等终端设备。 三星则试图通过芯片、存储和终端产品之间的协同形成优势。在 AI 时代,计算效率不仅取决于处理器性能,也取决于数据如何在计算单元和存储之间流动。 相比这些路径,Arm 选择的是另一种方式。当被问到未来 CPU、GPU 和 NPU 之间的任务分配是否会由 Arm 来决定,以及 Arm 是否会建立统一的 AI 调度层时,Arm 给出的答案是否定的。 Arm 认为,最终的调度权应该交给系统拥有者,由 OEM 厂商、芯片设计公司以及软件开发者根据自己的产品需求决定任务运行在哪里。Arm 自身做的,是确保每一个计算单元都具备足够强的基础能力,并通过软件生态让这些能力更容易被调用。这其实也是 Arm 长期商业模式的延续。 过去,Arm 并不制造最终设备,而是通过开放架构让不同厂商基于 Arm 设计自己的产品。进入 AI 时代后,Arm 并没有试图成为唯一的计算调度者,而是希望成为不同计算资源能够高效协同的基础平台。 从这个角度看,Arm 此次发布的 CPU、GPU、CSS 以及软件生态,并不是单纯增加某一个计算单元的能力,而是在回答同一个问题:当 AI 计算越来越复杂时,如何让不同资源更高效地组合在一起。 未来,芯片竞争的标准可能不再只是「谁拥有最强的计算单元」。因为 AI 时代真正困难的问题,不是产生更多 Token,而是让每一个 Token 在正确的时间、通过正确的计算资源完成任务。 过去三十年,Arm 通过指令集架构连接了移动计算产业;未来,它希望通过计算子系统、软件生态以及系统级优化,继续成为 AI 时代计算基础设施的一部分。 在一个未来形态仍未确定的时代,Arm 选择的不是预测唯一答案,而是建立一个能够适应不同答案的平台。 这或许也是它对 AI 时代最大的判断,下一个阶段的竞争,不只是计算能力的竞争,而是组织计算能力的竞争。 本文为极客公园原创文章,转载请联系极客君微信 geekparkGO 加州时间 9 月 9 日,苹果秋季发布会开场,这也是新 CEO 特纳斯上任后的第一场 keynote。折叠屏 iPhone、涨价、AI……苹果这一次究竟能拿出多少「新东西」? 本周四凌晨 00:40,极客公园视频号直播间,我们和极客公园副主编靖宇、极客公园作者 Alan,一起聊聊:新 CEO 特纳斯的第一场大考,苹果到底有多「特努力」? 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 都市快报橙柿互动 2026-09-09 11:41:44 上观新闻 2026-09-09 11:35:29 参考消息 2026-09-08 21:47:08 半岛都市报 2026-09-09 07:35:10 澎湃新闻 2026-09-08 23:14:11 新京报评论 2026-09-09 14:41:24 广东卫视 2026-09-09 16:44:44 闪电新闻 2026-09-09 14:58:38 中国能源网 2026-09-09 08:15:10 政知新媒体 2026-09-09 15:28:16 中国新闻周刊 2026-09-09 18:04:48 界面新闻 2026-09-09 10:48:37 证券时报 2026-09-09 21:06:03 参考消息 2026-09-09 12:27:49 国家统计局 2026-09-09 09:33:56 大风新闻 2026-09-09 20:38:28 吉刻新闻 2026-09-09 21:11:22

加载更多

热门分类

相关推荐