FlashInfer 是由陈天奇团队专为大模型推理(Serving)设计的,其在 MLSys 大会上荣获过最佳论文奖。
- 推理性能极佳:在多 Batch、动态输入、长上下文的推理场景中,FlashInfer 内核在解码(Decode)和预填充(Prefill)上的带宽利用率显著优于 FlashAttention 系列。
- 原生支持高级注意力与稀疏性:支持 GQA(分组查询注意力)和 MLA(多头潜在注意力),以及块稀疏(Block Sparse)和动态 KV 缓存组织。
- 与推理框架深度整合:它是 vLLM、SGLang 等主流推理服务端引擎的标配,支持复杂的抢占式调度与前缀缓存复用。

