大模型文件后缀

NVIDIA GPU(英伟达显卡) 上部署大语言模型,追求的无非是两个核心指标:吞吐量(并发能力)低延迟(响应速度)


1. .safetensors 原始权重

这是目前 GPU 部署最常用的格式。在 NVIDIA GPU 上,千万不要直接用原生的 Hugging Face Transformers 库去跑生产环境(效率极低)。

  • 最优部署引擎:vLLM
  • 优势: 业内公认的 GPU 吞吐量之王。它自研的 PagedAttention 技术彻底解决了显存碎片化问题,能让 GPU 的显存利用率接近 100%。支持动态组批(Continuous Batching),极其适合高并发的企业级 API 服务。
  • 次选引擎:TGI (Text Generation Inference)
  • Hugging Face 官方出品,生产环境同样非常稳定,支持流式输出和投机采样。

2. .awq / .gptq (GPU专属量化格式)

想在有限的显存里塞下更大的模型(例如在 24G 显存的 RTX 4090 上跑 70B 的模型),这两个后缀是首选。它们是专门为 GPU 硬件设计的 4-bit/8-bit 量化格式

  • 最优部署引擎:vLLM

  • 优势: vLLM 完美原生支持 AWQ 和 GPTQ 格式。不仅能大幅降低显存占用,还能保持极高的推理速度。

  • 极致单卡速度引擎:ExLlamaV2

  • 优势: 如果你的场景是单人/低并发使用(比如本地聊天、个人助手),ExLlamaV2 在 NVIDIA 显卡上的单卡 Token 输出速度(Tokens per Second)快到飞起,远超其他引擎。


3. .engine (TensorRT)

这是英伟达官方亲儿子格式。你需要使用工具将 .safetensors.onnx 模型“编译”成专门针对你当前显卡型号的 .engine 文件。

  • 唯一部署引擎:TensorRT-LLM + Triton Inference Server
  • 优势: NVIDIA 官方的性能天花板。它深度优化了底层 CUDA 核心的调用,无论是延迟还是吞吐量,都是所有引擎中最强的。
  • 缺点: 编译过程极其痛苦,耗时且经常报错,且编译出来的 .engine 文件换一张显卡型号(比如从 A100 换到 H100)就无法运行,必须重新编译,适合追求极致性能的大厂生产环境。

4. .gguf

虽然 .gguf 主打的是 CPU 和 Mac 部署,但它同样支持 GPU 显存卸载(GPU Offloading)

  • 最优部署引擎:Ollama/ llama.cpp
  • 优势: 如果你的显存不够大,比如模型有 30G,但你的显卡只有 16G 显存。Ollama 可以把 14G 的模型切分到系统内存(内存+CPU)上跑,剩下的 16G 塞进显存(GPU)里加速。
  • 适用场景: 消费级显卡(如 RTX 3060/4060 等)的本地日常调测。