flashinfer.fp4_quantization.nvfp4_block_scale_interleave¶
- flashinfer.fp4_quantization.nvfp4_block_scale_interleave(unswizzled_sf: Tensor) Tensor¶
为 FP4 格式调整块比例张量。
此函数调整块比例张量,以优化 FP4 操作的内存访问模式。输出需要在 m 维度进行填充,使其成为 128 的倍数。
- 参数:
unswizzled_sf (torch.Tensor) – 输入张量,数据类型为 uint8 或 bfloat16。
- 返回值:
与输入形状相同的调整后的张量。
- 返回值类型:
torch.Tensor
- 抛出:
AssertionError – 如果输入数据类型不是 uint8 或 bfloat16。