"""Dynamic tensor-wide NVFP4 range, with FP32 reductions and correction rescaling.""" import torch,triton import triton.language as tl @triton.jit def _partials(X,P,T,COUNT:tl.constexpr,K:tl.constexpr,B:tl.constexpr): i=tl.program_id(0)*B+tl.arange(0,B) x=tl.load(X+i,i