苏州炬擎数原科技
Novi Enterprise ↗ 中文 / EN联系我们
← 返回行业资讯
行业资讯 2026-09-28 · 次阅读

端侧推理的功耗散热与稳定性怎么平衡

小
小编
TorchDigit
端侧推理的功耗散热与稳定性怎么平衡

端侧设备一旦部署到现场,就要面对一个云端机房不需要考虑的问题:没有空调,没有冗余电源,有些还装在密闭机柜里。功耗、散热与稳定性三者互相约束,任何一项被忽略,系统都会在连续运行几天后暴露出问题。把这三者拆开看,各自的约束是什么,才能找到能长期站得住的配置。

功耗:先定预算,再定性能

端侧设备通常有明确的供电上限,工控网关常见的是十几瓦到几十瓦,外场设备可能靠电池供电。这个上限决定了芯片能在什么频率、多少核心下持续运行。

AI 推理的功耗特点是突发性强:单次推理的峰值功耗明显高于空闲状态,但持续时间短。因此功耗预算应按峰值而非均值来定,否则会在并发请求或长输入时触发降频甚至重启。常见的做法是给推理任务设置并发上限,用队列把突发请求摊平,同时把非关键任务排到空闲时段。

对靠电池供电的设备,还要考虑推理能耗与任务价值的比值。一次完整推理的电量消耗如果接近待机功耗的数十倍,这类任务就不适合高频执行。

fig-1.png

散热:决定的是持续性能不是峰值

散热设计决定的是设备能跑多久,而不是能跑多快。无风扇设计依靠外壳传导与自然对流,热阻较大,热量散不出去时会触发降频保护。

这个机制对业务的影响容易被误判。评估阶段测到的性能通常是短时峰值,而实际生产中设备可能连续工作数小时。热平衡建立之后的速度,才是用户真实感受到的速度。同样一颗芯片,在通风良好的机柜里和在密闭铁箱里,持续性能可能相差明显。

工程上的应对包括:把长时间任务拆成小批次,在批次之间留出散热间歇;调整部署位置,避免设备相互叠放造成热堆积;在软件层面对温度做监控,温度越限时主动降低并发而不是等到系统强制降频。对工业现场,还需要考虑环境温度本身可能超过室温,散热设计要按最恶劣工况估算。

稳定性:靠机制而不是靠运气

连续运行场景下,稳定性不能依赖单点不出错,而要设计成能容纳出错。几个常见机制值得提前规划。

任务排队与本地缓存让设备在网络中断或上游故障时仍能继续处理本地任务,网络恢复后再做状态同步。看门狗与自动重启解决的是推理进程假死的问题,进程无响应时由外部监控拉起。状态持久化保证重启后不丢失已处理进度,避免重复处理。资源隔离则让推理任务与其他系统功能互不干扰,避免推理把内存占满导致整机异常。

对这些机制的验证方式比较朴素:断网跑一遍,断电拔插一遍,高负载并发跑一遍,看系统能否自行恢复。

fig-2.png

上一篇 无 GPU 的 4 核 ARM 网关跑出 63 tok/s 意味着什么
下一篇 128K 上下文在端侧设备上如何不爆内存

相关阅读