现场失效的功率器件,拆开看几乎都是同一个结局:烧了。但「温度太高」只是症状,不是机理。真正的机理是热失控(Thermal Runaway)——一个电热正反馈的自加速循环:温度小幅升高导致器件参数劣变,参数劣变推高损耗,损耗再推高温度。循环一旦闭合,多大的散热器都拉不回来。这篇我们把物理逻辑、四个阶段、三大诱因和一份能在设计阶段就落地的预防清单讲清楚。
热失控到底是什么:一个不可逆的正反馈循环
硅基 MOSFET 和 IGBT 的麻烦在于:导通电阻和漏电流都随结温升高而增大。总发热大致等于导通损耗(I²×R,随温度上升)加上开关损耗(高温下开关变慢,损耗随之上升)。正常工况下产热 ≤ 散热,温度稳定;一旦散热受阻或负载上升,温度抬头 → 参数劣化 → 损耗上升 → 温升加速。最终结温突破极限——硅器件 150–175℃、SiC 器件约 200℃——芯片击穿、焊层烧融或封装炸裂。

热失控的四个阶段
| 阶段 | 状态 | 外在表现 | 可否挽回 |
| 1. 初始温升 | 产热 ≤ 散热 | 过载、硅脂老化、风扇积灰,温度轻微漂移 | 可以,常规维护即可 |
| 2. 损耗抬升 | 产热开始占上风 | 同等负载下导通电阻/漏电流增大,损耗爬升 | 可以,降载、恢复散热 |
| 3. 正反馈失控 | 产热 ≫ 散热 | 温度指数级上升,保护缺失或连续触发 | 不可逆,损伤持续累积 |
| 4. 器件损毁 | 结温突破极限 | 芯片击穿、焊层熔化、封装炸裂、整机停机 | 不可逆,失效终局 |
这张表的实际意义只有一句话:所有设计动作都要让系统停留在阶段 1,最多从阶段 2 拉回来;进入阶段 3,就已经在写报废单了。

最常见的三大诱因
- 散热硬件缺陷——散热器选小了、导热硅脂干裂、器件与散热器贴合不实、风道堵塞、风扇损坏,本质都是热阻变大,这是触发条件。
- 工况与电路设计问题——长期满载过载、开关频率设得过高、并联器件均流不均导致单管过载发热、驱动电压异常让器件处于不完全导通状态。
- 老化与环境——常年运行漏电流爬升、密闭机柜没有通风规划、灰尘与高温互相叠加。
分层预防:从散热器到控制回路
第一层:被动散热,按最坏情况设计。散热器按最坏工况的损耗选型,而不是典型损耗;保证芯片到散热器的通路完整——导热介质不过期、贴合平整、螺丝均匀锁紧、风道干净。每个界面怎么算,可以看我们此前的IGBT 热阻参数详解。
第二层:主动温控。用模块内置 NTC 实时监测结温并联动动作:到达预警阈值降频/限流,到达临界阈值直接关断。NTC 读数本身也有讲究——参考IGBT 模块 NTC 温度传感器的测量方法。

第三层:电路设计留余量。并联阵列要把均流设计做扎实——布线对称、参数匹配,因为单管电流集中会形成局部热点并扩散到整机,细节见并联 IGBT 的静态、动态与热效应;栅极驱动电压要稳定,避免器件在放大区徘徊;电流、电压、温度按规格书降额 30%–50% 使用。过流场景的保护电路设计可参考IGBT 过电流保护电路设计。
第四层:器件升级。高频大功率场景直接换 SiC——导通损耗、开关损耗双降,温度裕量更大,这是很多平台选择升级到混合 SiC IPM而不是继续堆散热器的原因。
一段话总结
热失控不是「太热」,而是「热改变了参数、参数制造了更多热」的闭环,而且不可逆——所以预防必须前置:合理选型降额优先,其次把散热结构做扎实,然后是均流与驱动设计,再加上智能温控兜底,最后才是材料升级。排查具体失效可以看我们的IPM 常见故障模式汇总;日常维护记住三件事:定期检查导热介质、风扇和风道。


