nvidis-smi输出解读
nvidia-smi输出显卡使用情况
root@xxx~# nvidia-smi
Thu Aug 27 15:01:03 2026
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 570.133.20 Driver Version: 570.133.20 CUDA Version: 12.8 |
|-----------------------------------------+------------------------+----------------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|=========================================+========================+======================|
| 0 NVIDIA L20 On | 00000000:06:10.0 Off | 0 |
| N/A 57C P0 117W / 350W | 39924MiB / 46068MiB | 52% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
| 1 NVIDIA L20 On | 00000000:06:11.0 Off | 0 |
| N/A 59C P0 127W / 350W | 43359MiB / 46068MiB | 16% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
+-----------------------------------------------------------------------------------------+
| Processes: |
| GPU GI CI PID Type Process name GPU Memory |
| ID ID Usage |
|=========================================================================================|
| 0 N/A N/A 3150 C /usr/bin/python 354MiB |
| 0 N/A N/A 3153 C /usr/bin/python 2890MiB |
| 0 N/A N/A 3154 C /usr/bin/python 2890MiB |
| 0 N/A N/A 3412 C /opt/conda/bin/python 16384MiB |
解读
1. 整体状态
| GPU | 型号 | 温度 | 功耗 | 显存 | 利用率 | 状态 |
|---|---|---|---|---|---|---|
| GPU 0 | NVIDIA L20 | 60°C | 159W / 350W | 43,040 / 46,068 MiB | 23% | 正常 |
| GPU 1 | NVIDIA L20 | 63°C | 179W / 350W | 45,365 / 46,068 MiB | 40% | 正常 |
2.显存占用率
- GPU 0:约 93.4%
- GPU 1:约 98.5%
GPU 1 只剩大约:
1 | 46068 - 45365 ≈ 703 MiB |
这意味着如果再启动新的 CUDA 任务,或者当前任务出现显存波动,GPU 1 很容易触发 CUDA Out Of Memory。
3. 温度正常
1 | GPU 0: 60°C |
对于 L20 而言,这个温度属于正常工作范围,没有散热异常迹象。
4. GPU利用率并不高但显存几乎满了缘由
1 | GPU 0 GPU-Util: 23% |
这是这份 nvidia-smi 最值得注意的地方:
显存接近 100%,但计算利用率只有 23% / 40%。
这通常意味着 GPU 不是一直在进行密集计算,而可能处于:
- 模型已经加载到显存
- 多个进程持有显存
- 训练过程中存在数据加载 / CPU / 网络 / 通信等待
- 推理服务预先加载多个模型或 KV Cache
- 多进程或分布式训练导致显存分配不均衡
- GPU 正在某个阶段等待,而不是持续计算
换句话说:
1 | 显存满 ≠ GPU 算力跑满 |
当前不是算力瓶颈,而更可能存在等待、I/O、数据加载、通信同步,或者模型虽然占着显存但没有持续进行计算。