1.检查命令
1 2 3 4 5 6 7 8 9 10 11 12
| watch -n 1 nvidia-smi -q -d TEMPERATURE
nvidia-smi --query-gpu=timestamp,temperature.gpu,temperature.memory \ --format=csv -l 1
三个关键温度指标
nvidia-smi --query-gpu=name,temperature.gpu,temperature.memory,temperature.gpu.hotspot \ --format=csv
|
| 指标 |
含义 |
注意 |
temperature.gpu |
GPU 核心温度 |
最常用的参考值 |
temperature.memory |
显存(VRAM)温度 |
GDDR6X 发热量大 |
temperature.gpu.hotspot |
热点温度 |
通常比核心高 10–20°C |
重要:核心温度 70°C 但热点 105°C,GPU 并不健康
2.核心温度范围
| 状态 |
温度范围 |
说明 |
| 待机/空闲 |
30–50°C |
完全正常,风扇可能停转 |
| 轻度负载 |
55–70°C |
正常,办公/浏览器等 |
| 中等负载 |
70–80°C |
正常,轻度游戏/推理 |
| 高负载 |
80–85°C |
正常,重度训练/渲染 |
| 偏热 |
85–90°C |
需关注,检查散热 |
| 降频风险 |
90–100°C |
显卡开始 throttling |
| 危险区 |
100°C+ |
立即处理,可能损坏 |
3.温度过高影响
温度升高 → 性能下降路径:
70°C 正常
80°C 轻微降频(约 3–5%)
85°C 明显降频(约 10–15%)
90°C+ 严重降频(20%+),稳定性风险
100°C+ 强制shutdown保护
4.不同显卡型号温度范围参考
| 显卡系列 |
满载理想温度 |
最高安全温度 |
说明 |
| NVIDIA A100/H100(数据中心) |
65–75°C |
83–90°C |
被动散热,依赖服务器风道 |
| RTX 4090 / 4080 |
65–80°C |
~90°C |
Ada架构,温控较保守 |
| RTX 30 系列 |
68–83°C |
~85–90°C |
Ampere 架构 |
| RTX 20 系列 |
70–85°C |
~85°C |
Turing 架构 |
| Tesla T4 / V100 |
60–75°C |
83°C |
数据中心卡,温控严格 |
5.总结
- 理想工作温度:65–80°C
- 可接受上限:85°C
- 需要干预:>90°C
- 危险温度:>100°C
对于生产环境(如 AI 训练/推理),建议保持核心温度在 75°C 以下,以确保长期稳定性和寿命。