llm算子层flashinfer
现在的vLLM并不是把FlashInfer作为一个独立推理框架接进来,而是把FlashInfer作为Attention/Linear等Kernel Backend,由vLLM负责调度和KV Cache管理。当前vLLM已经原生提供FLASHINFERAttention Backend;如果不显式指定,vLLM也会根据模型、GPU、dtype、KV Cache等条件自动选择兼容Backend。
FlashInfer解决这些Attention/Linear计算怎么在GPU上跑得更快
flashinfer在llm架构中位置
1 | vLLM |
vllm如何使用flashinfer
1 | # 1.install |