据Android Authority 9月8日报道,Arm公布新一代C2系列CPU核心设计,其旗舰级C2-Ultra的AI模型性能较上代最高提升1.7倍。按照芯片行业通常的发布节奏,该架构预计将用于2027年前后的三星Exynos、联发科天玑芯片,也可能进入谷歌下一代Tensor G7。

C2-Ultra的整体峰值性能比上一代C1-Ultra提升约15%。其中约8个百分点来自主频提升至4.45GHz,另外7个百分点来自微架构改进;同样性能下的功耗降低38%,得益于转向2nm制程。其L2缓存最高可配置为3MB。相比之下,C2-Premium、C2-Pro和C2-Nano核心基本沿用上一代C1架构,仅针对新制程在面积、能效和功耗方面做了优化。

在微架构层面,C2-Ultra的流水线宽度与上代保持一致,但执行窗口扩大了30%,允许同时处理约2600条指令,上一代C1-Ultra约为2000条。Arm还增强了乱序执行机制,通过更智能的分支预测和更快的恢复逻辑,提前识别代码依赖并安排执行顺序,减少了处理器等待数据以及缓存搬运带来的开销。

AI加速是本代CPU升级的重点。Arm在C2的CPU簇中放入两个可扩展矩阵扩展SME2单元,上一代仅支持一个。由于SME2指令在普通CPU流水线上执行,开发者无需为AI加速单独适配运行环境,只要把相关指令编入代码即可。配合低精度数学加速与查找表指令LUTi,Arm称新一代CPU配置可将AI模型性能最高提升1.7倍。在实测场景中,语音转文字延迟降低40%,内存检索延迟降低41%。不过,两个SME2单元只有在AI负载可拆分时才能实现并行加速,并不能无条件带来双倍吞吐。Arm还提到,参考平台上SME2的最高主频由2GHz提升至3GHz。

报道指出,双SME2方案并不是C2-Ultra独有,小米XRING O3平台已能基于上一代C1架构支持两个SME2单元。Android Authority分析认为,Arm正在把重心从单纯追逐通用峰值性能转向加速特定工作负载,尤其是AI场景;但市场是否继续要求更高的通用性能仍是未知数,特别是在移动与PC使用场景不断融合的情况下。