-
华为何庭波最新论文:那颗本应熔化的“韬芯片”,为何运行的更冷静
-
吕栋lvdong@guancha.cn
最后更新: 2026-09-05 10:27:38IV. 麒麟2026功耗,逐模块分析
主导智能手机SoC热预算的模块,正是那些传输数据最多的模块:运行AI推理的NPU、进行像素着色的GPU,以及处理信号的DSP。它们发热严重的原因相同:它们是通信密集型的。由于它们在内存、缓冲区和算术单元之间来回穿梭海量数据,其功耗的很大一部分来自“通勤”而非“计算”——而这正是折叠所能攻克的部分。
为了展示每个模块从逻辑折叠中获益多少,我们让折叠芯片与其平面工艺的前代产品麒麟9030 Pro在相同性能下(相同的AI吞吐量、帧率或基准分数)进行对比测试。一个需要较低速度就能完成相同工作的模块,可以在更低电压下运行,从而带来叠加的节能效果。同时,由于同样的硅片也可以全速运行,每个模块的两种模式——与前任匹配的性能,以及全速模式——结果均已报告。以下是硅片对这些模块的报告。
如图1所示,每个图表包含五个子图——性能、频率、电压、归一化功耗和归一化功耗密度——以及三个柱状条:平面工艺的麒麟9030 Pro、同性能下的麒麟2026,以及涡轮模式下的麒麟2026。归一化子图中的虚线表示9030 Pro的基线。折叠后的占地面积是两层堆叠的投影面积——功耗密度正是以此为标准进行测量的。
在批评者最担心堆叠的模块中,NPU 因其密度最高且温度也最高而首当其冲。然而,它却实现了最大的降幅:在相同的 29 TOPS 下,其时钟频率可以降低 63%,电压可以从 0.85V 降至 0.55V。这导致功耗降低了 66%,功耗密度更是惊人地下降了 73%。GPU 紧随其后:在与 Kirin9030 Pro 相同的 61 FPS 下运行,但电压降低了 200mV,功耗下降了 58%。这种差异完全沿着“通勤”的脉络分布:一个模块越并行、越需要大量数据,折叠带来的回报就越大。
DSP 是一个例外,它提供了一个重要的教训:使用逻辑折叠,面积缩小的速度可能快于功耗(图 2)。第一代折叠(麒麟 2026)以降低 25% 的功耗完成相同工作,但功耗密度——即每平方毫米消耗的功率——却上升了 24%,而真正对控制热量起关键作用的正是功耗密度。这种增长的原因很简单:折叠将 DSP 的占地面积缩小了 40%,因此即使其功耗下降,功耗密度仍然攀升。第二代折叠(麒麟 2027)解决了这个问题:我们已经获得了该硅片,并测得其功耗密度低于平面工艺原版,同时功耗降低了 47%。换言之,密度是一个设计输出,而非宿命。
CPU 性能核心从折叠中获益匪浅——在 HNX 基准测试中,以低 9% 的时钟频率和低 200mV 的供电电压匹配了其前代产品的分数,功耗降低了 41%。但其功耗密度的节省在这些热模块中是最不起眼的。这并非折叠的失败;它暗示了一些重要信息,我们稍后会讨论。
当然,我们不仅关注功耗节省。我们同样让麒麟 2026 的模块全速运行,以观察它们与 9030 Pro 相比能有何种表现。在全力运行时,折叠后的 NPU 可提供 70 TOPS——比其前代产品高出 141%,GPU 的帧率提升 42%,CPU 在 HNX 基准测试中的得分提升 18%;在这些模式下,它们的功耗密度都高于平面工艺的前代芯片。因此,折叠为系统提供了一个平面芯片从未拥有的控制旋钮:根据场景不同,同一个模块既可以成为“吝啬鬼”,也可以成为“纪录打破者”。
V. 平行理论:电路中的 τ 缩放定律与软件中的阿姆达尔定律
缩短“通勤”解释了部分功耗节省,但更多的节省来自于降低电压,因为动态功耗与电压的平方成正比。逻辑折叠通过将电路分为三类来解锁这种降低:真正的串行电路,需要峰值频率和电压;可并行化的电路,将工作分散到许多并行运行的副本上;以及介于两者之间、部分串行部分并行的电路[8]。
绝不妥协的串行电路是少数。绝大多数情况下,现代 SoC 的晶体管服务于第二和第三类电路,即 NPU、GPU 和 DSP,它们之所以消耗大量功率,恰恰是因为它们宽、并行且数据饥渴。CPU 性能核心(大核)是第一类电路中最清晰的代表,因为其单个快速的整数执行线程无法并行化,且必须接近电压和频率曲线的顶端运行。回想一下,折叠在 HNX 基准测试的同性能下仅为其带来了适度的 9% 时钟频率降低——这是线性的“通勤”节省,而非二次方的电压节省。将逻辑折叠应用于低并行度的 CPU 性能核心,需要精心的设计、先进的 EDA 工具链和漫长的验证周期。这是一次系统性的革新,而非权宜之计。尽管麒麟 2026 已取得显著成果,但大部分工作仍在前方,需要在未来三到五年内进行积极、探索性的创新。然而,在通往这些最终成果的道路上,每年都将实现切实且累积的改进。
幸运的是,这些架构上的障碍无需仅由硅片来克服。智能手机拥有一个粗略分析所忽略的优势:深度的硬件-软件协同设计。任务调度器和折叠后的版图并非试图让一个英雄般的大核独自承担所有繁重的工作负载,而是协同优化,在软件中并行化任务,并将其分派到几个小型、高效的核上。这使得大核必须承担的串行工作部分,保持在应用允许的最小范围内。这将工作负载从第一类转移到第二类,即二次方电压杠杆生效的地方。
在这里,两个杠杆结合起来。折叠缩短了导线,同时在同一占地面积内为更多晶体管腾出空间。这些额外的晶体管可以用来创建许多电路副本,这些副本可以并行运行,将工作分散开来,从而使每个副本都能以更低的时钟频率和电压运行。“通勤”论点带来了 C 的线性节省,而并行性论点则带来了 V² 的二次方节省。
折叠后的 NPU 就是一个典型例子。其前代产品包括一个大核和两个能效核,而折叠带来的晶体管盈余则用于支付四个大核。更宽泛的阵列在 0.7V 电压下提供 70 TOPS——远低于其前代产品在提供不到一半性能时所需的 0.85V。更多硬件,更温和地运行,却完成更多工作:二次方杠杆,完全按照公式的预测工作。
这就是为什么一个密度更高的芯片却消耗更少功率的原因。需要高电压的串行工作占比很小,不足以主导功耗预算;其他所有部分——绝大多数的并行部分——被折叠得更宽,时钟设置得更温和,并在更低电压下运行。
这种设计镜像了吉恩·阿姆达尔著名的洞见:程序的串行部分限制了并行性所能带来的收益。阿姆达尔定律是关于软件的。而逻辑折叠揭示的是其硬件孪生兄弟:硅片的串行部分很小,因此芯片的大部分可以用速度换取并行性。它们如同双星——一个支配着代码中的算法,另一个支配着电路中的延迟与能量,构成了系统-技术协同优化(STCO)的理论基石。
标签- 责任编辑: 吕栋
-
-
直通北部湾,中国打通西南出海新水道 评论 24
沙特关键输油管道遇袭,“预防性关闭” 评论 67
“我乐见爱尔兰统一”,英国:??? 评论 85
俄罗斯警告:在切尔诺贝利禁区,乌军有大动作 评论 55
1北大硕士因本科非名校年薪被降5万,如何看待市场上存在的第一学历歧视?评论 106 赞 3
2拼低工资?我认识好几个造船厂的管理者,太了解造船了评论 73 赞 45
3未来发生在英语上的事,现在已经在俄语上发生了评论 66 赞 34
4这种每年被中国人狂炫近 200 万吨的水果,终于国产化了!价格跳水评论 60 赞 9
5谁在阻碍中国人了解印度的饮食评论 49 赞 1
6粤语童谣纳入了人教版音乐课,让外省孩子们多学方言,这是文化自信的表现评论 44 赞 4
7疯狂的台积电:3纳米卖爆,20座厂在建,展望后摩尔时代评论 42 赞 1
8卖土豆的内蒙小城,掏走阿里华为上百亿评论 42 赞 13
9胡塞武装势如破竹!美国力不从心,沙特危矣评论 35 赞 29
10中东战争给美国亚太盟友上了一堂地缘课评论 27 赞 4最新闻 Hot-
“胡塞主动联系,希望美国‘不要介入’”
-
36年来首次!智利政府不举行阿连德纪念仪式
-
“瑞典民主党若首次入阁,将进一步呼应欧洲极右翼”
-
欧洲央行行长:当前通胀冲击将持续更长时间
-
“特朗普说给美国选民听的”
-
“小博索纳罗有份反华文件,背后藏着万斯的影子”
-
沙特关键输油管道遇袭,“预防性关闭”
-
乌方放风:正准备于10月恢复谈判,三方一起谈
-
法拉奇不到24小时吸金7200万英镑,“远超英国两大党”
-
“我乐见爱尔兰统一”,英国:???
-
俄罗斯警告:在切尔诺贝利禁区,乌军有大动作
-
离谱!特朗普:人类灭绝?我就担心中国…
-
“这是一次又一次的背叛”
-
911纪念仪式,穆斯林市长还是去了
-
“瑞典不得不服软,中国太硬”
-
日本前外相岩屋毅等将访华,“感谢中方接受”
-

观察员





上海市互联网违法与不良信息举报中心