欢迎阅读 FlashInfer 文档!

博客 | 讨论论坛 | GitHub

FlashInfer 是一个用于大型语言模型的库和内核生成器,它提供了 FlashAttention、PageAttention 和 LoRA 等 LLM GPU 内核的高性能实现。FlashInfer 专注于 LLM 服务和推理,并在各种场景中提供最先进的性能。

PyTorch API 参考