大模型文件后缀
在 NVIDIA GPU(英伟达显卡) 上部署大语言模型,追求的无非是两个核心指标:吞吐量(并发能力) 和 低延迟(响应速度)。
1. .safetensors 原始权重
这是目前 GPU 部署最常用的格式。在 NVIDIA GPU 上,千万不要直接用原生的 Hugging Face Transformers 库去跑生产环境(效率极低)。
- 最优部署引擎:vLLM
- 优势: 业内公认的 GPU 吞吐量之王。它自研的 PagedAttention 技术彻底解决了显存碎片化问题,能让 GPU 的显存利用率接近 100%。支持动态组批(Continuous Batching),极其适合高并发的企业级 API 服务。
- 次选引擎:TGI (Text Generation Inference)
- Hugging Face 官方出品,生产环境同样非常稳定,支持流式输出和投机采样。
2. .awq / .gptq (GPU专属量化格式)
想在有限的显存里塞下更大的模型(例如在 24G 显存的 RTX 4090 上跑 70B 的模型),这两个后缀是首选。它们是专门为 GPU 硬件设计的 4-bit/8-bit 量化格式。
最优部署引擎:vLLM
优势: vLLM 完美原生支持 AWQ 和 GPTQ 格式。不仅能大幅降低显存占用,还能保持极高的推理速度。
极致单卡速度引擎:ExLlamaV2
优势: 如果你的场景是单人/低并发使用(比如本地聊天、个人助手),ExLlamaV2 在 NVIDIA 显卡上的单卡 Token 输出速度(Tokens per Second)快到飞起,远超其他引擎。
3. .engine (TensorRT)
这是英伟达官方亲儿子格式。你需要使用工具将 .safetensors 或 .onnx 模型“编译”成专门针对你当前显卡型号的 .engine 文件。
- 唯一部署引擎:TensorRT-LLM + Triton Inference Server
- 优势: NVIDIA 官方的性能天花板。它深度优化了底层 CUDA 核心的调用,无论是延迟还是吞吐量,都是所有引擎中最强的。
- 缺点: 编译过程极其痛苦,耗时且经常报错,且编译出来的
.engine文件换一张显卡型号(比如从 A100 换到 H100)就无法运行,必须重新编译,适合追求极致性能的大厂生产环境。
4. .gguf
虽然 .gguf 主打的是 CPU 和 Mac 部署,但它同样支持 GPU 显存卸载(GPU Offloading)。
- 最优部署引擎:Ollama/ llama.cpp
- 优势: 如果你的显存不够大,比如模型有 30G,但你的显卡只有 16G 显存。Ollama 可以把 14G 的模型切分到系统内存(内存+CPU)上跑,剩下的 16G 塞进显存(GPU)里加速。
- 适用场景: 消费级显卡(如 RTX 3060/4060 等)的本地日常调测。