GPU温度正常范围参考

1.检查命令

1
2
3
4
5
6
7
8
9
10
11
12
# 实时温度监控
watch -n 1 nvidia-smi -q -d TEMPERATURE

# 查看温度历史记录(如有日志)
nvidia-smi --query-gpu=timestamp,temperature.gpu,temperature.memory \
--format=csv -l 1

三个关键温度指标

# 查看完整温度信息
nvidia-smi --query-gpu=name,temperature.gpu,temperature.memory,temperature.gpu.hotspot \
--format=csv
指标 含义 注意
temperature.gpu GPU 核心温度 最常用的参考值
temperature.memory 显存(VRAM)温度 GDDR6X 发热量大
temperature.gpu.hotspot 热点温度 通常比核心高 10–20°C

重要:核心温度 70°C 但热点 105°C,GPU 并不健康


2.核心温度范围

状态 温度范围 说明
待机/空闲 30–50°C 完全正常,风扇可能停转
轻度负载 55–70°C 正常,办公/浏览器等
中等负载 70–80°C 正常,轻度游戏/推理
高负载 80–85°C 正常,重度训练/渲染
偏热 85–90°C 需关注,检查散热
降频风险 90–100°C 显卡开始 throttling
危险区 100°C+ 立即处理,可能损坏

3.温度过高影响

温度升高 → 性能下降路径:  
70°C      正常
80°C      轻微降频(约 3–5%)
85°C      明显降频(约 10–15%)
90°C+     严重降频(20%+),稳定性风险
100°C+    强制shutdown保护

4.不同显卡型号温度范围参考

显卡系列 满载理想温度 最高安全温度 说明
NVIDIA A100/H100(数据中心) 65–75°C 83–90°C 被动散热,依赖服务器风道
RTX 4090 / 4080 65–80°C ~90°C Ada架构,温控较保守
RTX 30 系列 68–83°C ~85–90°C Ampere 架构
RTX 20 系列 70–85°C ~85°C Turing 架构
Tesla T4 / V100 60–75°C 83°C 数据中心卡,温控严格

5.总结

  • 理想工作温度:65–80°C
  • 可接受上限:85°C
  • 需要干预:>90°C
  • 危险温度:>100°C

对于生产环境(如 AI 训练/推理),建议保持核心温度在 75°C 以下,以确保长期稳定性和寿命。