flashinfer.fused_moe¶
此模块提供针对不同后端和数据类型的融合混合专家 (MoE) 操作。
类型和枚举¶
|
|
|
实用函数¶
|
|
PyTorch 实现 trt-llm gen reorderRowsForGatedActGemm |
CUTLASS 融合 MoE¶
|
使用 CUTLASS 后端计算混合专家 (MoE) 层。 |
TensorRT-LLM 融合 MoE¶
|
FP4 块缩放 MoE 操作。 |
|
FP8 块缩放 MoE 操作。 |
|
FP8 每张量缩放 MoE 操作。 |