AI服务器GPU散热不能只盯导热系数,HBM堆叠让"原位热阻"成为硬指标
A100/H100/GB200功耗从400W飙升至1200W,HBM3E堆叠让芯片热流密度突破100W/cm²。某头部云厂商的实测数据显示,冷板式液冷可比风冷降低芯片结温28℃,但前提是GPU基板与冷板之间的导热垫片必须压到位——界面没贴合,液冷再强也是白搭。

去年秋天,某智算中心批量部署了200台8卡A100服务器,跑了大模型训练不到两个月,有30%的节点出现GPU降频告警。运维团队排查了冷板流量、冷却液配比、机柜风道,都没找到根因。拆机才发现,GPU基板与冷板之间的导热垫片在HBM区域出现了局部悬空——垫片厚度选对了,但HBM3E堆叠后基板表面高度差被低估了。
HBM3E堆叠让芯片变成"山地地形"
传统GDDR显存是平铺在GPU核心旁边的,整个基板表面相对平整。HBM3E采用3D堆叠封装,8-12层DRAM芯片垂直叠在GPU核心旁边的硅中介层上,导致HBM区域比GPU核心区域高出0.3-0.8mm。一块基板上同时存在"高原"(HBM堆叠区)和"平原"(GPU核心与基板边缘),对导热垫片的厚度均匀性和压缩回弹提出了全新要求。
更麻烦的是热流密度。A100核心热流密度约60W/cm²,H100提升到80W/cm²,到了GB200的Blackwell架构,核心局部热点突破100W/cm²。作为对比,传统CPU的热流密度通常只有15-25W/cm²。这意味着AI服务器的散热不是"加强版PC散热",而是进入了完全不同的物理 regime。
为什么"原位热阻"比导热系数更重要
很多工程师选型时先看导热系数:3W/m·K够不够用?5W/m·K是不是更好?这个思路在AI服务器场景下容易走偏。导热系数是材料在理想条件下的本征属性,但实际散热效果取决于"原位热阻"——也就是垫片在真实安装压力、表面粗糙度、压缩率和长期老化后的综合热阻。
以贝格斯GP3000S30(3.0 W/m·K)为例,在标准压力(50psi)和30%压缩率下,0.5mm厚度的原位热阻约为0.45°C·cm²/W。而同规格的GP5000S35(5.0 W/m·K)在同等条件下的原位热阻约为0.28°C·cm²/W。看起来差距明显,但如果安装压力不足——比如冷板螺丝扭矩没打够,导致实际压缩率只有15%——两款垫片的原位热阻都会翻倍,差距被大幅缩小。
换句话说,压不实比选不对更致命。这也是为什么英伟达在H100的官方散热指南里,对冷板安装压力的公差要求精确到±5psi。
液冷+垫片:不是二选一,是协同设计
2025年液冷服务器市场增速超90%,冷板式液冷占70-78%市场份额。液冷解决了系统级排热,但芯片到冷板之间的这段微观界面仍然要靠导热垫片。液冷冷板表面精度比风冷散热器高一个量级(Ra 0.8-1.6μm vs. 3-6μm),但冷板与GPU基板之间仍有30-100μm的微观间隙。
液冷场景对垫片有额外要求:一是抗泵出性,冷却液的长期冲刷可能导致垫片边缘迁移;二是耐压性,冷板安装压力通常比风冷高30-50%。GP5000S35经过液冷工况验证,压缩25%时原位热阻低于0.25°C·cm²/W,-40℃~150℃循环1000次后热阻衰减<8%,满足数据中心5年寿命要求。
选型参考:按GPU代际匹配垫片规格
| GPU型号 | TDP | 散热方案 | 推荐垫片型号 | 厚度建议 | 压缩率 | 关键考量 |
|---|---|---|---|---|---|---|
| A100 | 400W | 风冷为主 | GP3000S30 | 0.5-1.0mm | 30% | 标准热阻,成本优化 |
| H100 | 700W | 风冷/液冷混合 | GP3000S30核心区 + HBM补偿垫片 | 核心区0.5mm / HBM区1.0mm | 25-30% | HBM高度差需分段适配 |
| GB200 | 1200W | 液冷必选 | GP5000S35 | 0.5mm | 20-25% | 低原位热阻+抗泵出性 |
| VRM供电模块 | 50-150W | 风冷/液冷 | SPK10 | 0.15mm | 25% | 耐压6000V,绝缘隔离 |
选型实操中的三个坑
坑一:只看导热系数,不看压缩回弹曲线。有些垫片标称5W/m·K,但压缩到20%后回弹不足,半年后就 permanently deformed,热阻持续爬升。贝格斯垫片的硅氧烷基体在30%压缩范围内保持弹性回弹,ASTM D395测试显示压缩永久变形<15%。
坑二:HBM区域垫片厚度照搬核心区的规格。HBM3E堆叠高度因厂商而异(海力士 vs. 三星的封装工艺有0.1-0.2mm差异),必须在样机阶段用塞规实测高度差,再定制厚度。直接用统一厚度垫片,HBM区可能压不实,核心区可能压过头。
坑三:忽略长期老化数据。数据中心设计寿命5年,垫片在高温高湿环境下的热阻衰减率直接决定第3-5年的散热裕量。GP5000S35在85℃/85%RH条件下老化1000小时后热阻变化<5%,这一点比初始导热系数更能说明长期可靠性。

常见问题
为什么AI服务器的GPU散热不能只追求高导热系数?
导热系数只是材料本征属性,实际散热效果取决于"原位热阻"——即垫片在真实安装压力、表面粗糙度和压缩率下的综合热阻。HBM3E堆叠让GPU基板表面不平整度加剧,垫片如果贴合不紧密,界面空气层的热阻会远大于垫片本身。因此低热阻的原位表现比高热阻的标称值更关键。
HBM3E高带宽显存对GPU散热有什么影响?
HBM3E采用3D堆叠封装,显存颗粒垂直堆叠在GPU核心旁边,导致芯片局部热点更集中。GPU核心热流密度可突破100W/cm²,而HBM区域也有30-50W/cm²。传统均匀厚度的垫片难以同时适配核心高压缩和HBM区域低压缩的需求,需要选用厚度梯度设计或分段式垫片方案。
液冷方案下导热垫片的选型与风冷有什么不同?
液冷冷板表面精度更高(Ra 0.8-1.6μm),但冷板与GPU基板之间仍有30-100μm的微观间隙。液冷导热垫片需要兼顾:1)低热阻(比风冷方案低20-30%);2)抗泵出性(防止冷却液长期冲刷导致垫片迁移);3)耐压性(冷板安装压力通常比风冷散热器高30-50%)。贝格斯GP5000S35系列经过液冷工况验证,压缩25%时原位热阻低于0.25°C·cm²/W。
A100、H100、GB200的导热垫片选型有什么区别?
A100(400W TDP)风冷方案用贝格斯GP3000S30(3.0 W/m·K)即可满足,厚度0.75-1.0mm,压缩率30%。H100(700W TDP)风冷/液冷混合方案建议GP3000S30配合0.5mm薄型垫片用于核心区,HBM区域用1.0mm厚度补偿高度差。GB200(1200W TDP)必须液冷,核心区域推荐GP5000S35(5.0 W/m·K)厚度0.5mm,压缩率控制在20-25%以平衡热阻与长期可靠性。
GPU供电VRM模块为什么需要绝缘型导热垫片?
VRM(电压调节模块)工作电压12V-48V,MOSFET和电感直接贴在金属散热片上,而散热片通常与机箱地线导通。如果VRM与散热片之间存在电位差,普通导电型垫片会造成短路。贝格斯SPK10导热绝缘片导热系数1.3 W/m·K,耐压6000V以上,专为电源模块高压隔离场景设计。
产品推荐
精选导热材料 · 工程师优选需要选型建议或免费报价?
1对1对接,提供贝格斯导热材料技术选型、免费报价、定制裁切,立即联系 →
微信扫一扫 · 移动端可长按二维码保存后识别



