flashinfer.fp4_quantization.nvfp4_block_scale_interleave

flashinfer.fp4_quantization.nvfp4_block_scale_interleave(unswizzled_sf: Tensor) Tensor

为 FP4 格式调整块比例张量。

此函数调整块比例张量,以优化 FP4 操作的内存访问模式。输出需要在 m 维度进行填充,使其成为 128 的倍数。

参数:

unswizzled_sf (torch.Tensor) – 输入张量,数据类型为 uint8 或 bfloat16。

返回值:

与输入形状相同的调整后的张量。

返回值类型:

torch.Tensor

抛出:

AssertionError – 如果输入数据类型不是 uint8 或 bfloat16。