flashinfer.fused_moe

此模块提供针对不同后端和数据类型的融合混合专家 (MoE) 操作。

类型和枚举

RoutingMethodType(value[, names, module, ...])

WeightLayout(value[, names, module, ...])

实用函数

convert_to_block_layout(input_tensor, blockK)

reorder_rows_for_gated_act_gemm(x)

PyTorch 实现 trt-llm gen reorderRowsForGatedActGemm

CUTLASS 融合 MoE

cutlass_fused_moe(input, ...[, ...])

使用 CUTLASS 后端计算混合专家 (MoE) 层。

TensorRT-LLM 融合 MoE

trtllm_fp4_block_scale_moe(routing_logits, ...)

FP4 块缩放 MoE 操作。

trtllm_fp8_block_scale_moe(routing_logits, ...)

FP8 块缩放 MoE 操作。

trtllm_fp8_per_tensor_scale_moe(...[, ...])

FP8 每张量缩放 MoE 操作。