llm算子层flashinfer

现在的vLLM并不是把FlashInfer作为一个独立推理框架接进来,而是把FlashInfer作为Attention/Linear等Kernel Backend,由vLLM负责调度和KV Cache管理。当前vLLM已经原生提供FLASHINFERAttention Backend;如果不显式指定,vLLM也会根据模型、GPU、dtype、KV Cache等条件自动选择兼容Backend。

FlashInfer解决这些Attention/Linear计算怎么在GPU上跑得更快


flashinfer在llm架构中位置

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
               vLLM
│
┌────────────┼────────────┐
│ │ │
Scheduler KV Cache Model
│ │ │
└────────────┼────────────┘
│
Attention
│
▼
FlashInfer
│
CUDA Kernel
│
▼
GPU

vllm如何使用flashinfer

1
2
3
4
5
6
# 1.install
pip install flashinfer

2.serve
vllm serve Qwen/Qwen3-8B \
--attention-backend FLASHINFER