模型推理引擎上调度及编排之llm-d

llm-d 是一个专为 Kubernetes 和现代 AI 加速芯片(如 NVIDIA GPU、AMD ROCm 等)设计的高性能分布式大语言模型(LLM)推理服务栈。该项目是 CNCF(云原生计算基金会)Sandbox 项目,它运行在底层模型推理引擎(如 vLLM、SGLang)之上,负责更大规模、高吞吐的集群调度与编排优化。


核心功能与特性

  • 智能路由(Intelligent Routing):

  • 支持前缀缓存感知(Prefix-cache-aware)与负载均衡,显著降低首字延迟(TTFT)。

  • 引入基于预测延迟的调度算法,减少请求排队与尾部延迟。

  • 高级 KV-Cache 管理:

  • 提供多级分层卸载(Tiered Offloading 至 CPU 或本地高速磁盘),扩大多轮对话的有效缓存容量。

  • 全局 KV 缓存索引调度,避免重复计算。

  • 超大模型服务优化(Serving Large Models):

  • 支持Prefill/Decode 分离(PD 分离)架构,让计算密集型的预填充与内存带宽密集型的生成阶段分别运行在不同节点上。

  • 针对超大模型(如 DeepSeek-R1 等)提供基于高速网络互联的宽专家并行(Wide Expert-Parallelism)。

  • 生产级运维与高可用:

  • 基于真实推理指标驱动的 SLO 感知自动扩缩容(Autoscaling)与缩容到零(Scale-to-Zero)。

  • 提供兼容 OpenAI 标准的离线批处理(Batch API)网关,充分利用低谷期算力。

LLM.D架构位置

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
┌──────────────────────────────────────────┐
│ Application │
│ OpenAI API / Agent / RAG │
└────────────────────┬─────────────────────┘

┌──────────────────────────────────────────┐
│ llm-d │
│ │
│ Routing │
│ KV Cache Management │
│ Prefill/Decode Disaggregation │
│ Expert Parallelism │
│ Autoscaling │
│ Flow Control │
│ Batch Processing │
└────────────────────┬─────────────────────┘

┌──────────────────────────────────────────┐
│ Model Inference Engine │
│ │
│ vLLM / SGLang │
└────────────────────┬─────────────────────┘

┌──────────────────────────────────────────┐
│ Accelerators │
│ NVIDIA / AMD / Google TPU / XPU │
└──────────────────────────────────────────┘