据MarkTechPost报道,Nunchux AI发布VC-Attention,一种无需训练的低比特注意力内核,面向视频扩散Transformer,同时处理值量化误差与softmax阶段缓慢问题。该内核在低比特Tensor Core上加速QK与PV矩阵乘法,并降低视频生成中的注意力开销。
视频DiT将视频展平为时空token序列,每层运行完整自注意力。报道称,5秒720p的Wan2.2-14B片段约7万token,在RTX 5090上注意力占生成时间超过64%;团队称单张B200上注意力约占MiniMax-H3每个去噪步骤三分之二。此前SageAttention2等方法平滑query和key,但在Wan2.2上,经QK平滑与旋转后,value项占输出误差82%。两个矩阵乘法间的softmax仍以FP32运行,在B200和H200上,指数运算及FP8转换成为最长流水线阶段。
针对value离群值,V-Smooth用在线k-means按批次和头聚类value token,key与value一起置换,非因果注意力输出不变。每个128 token硬件块减去均值,只量化残差,使用8比特逐通道E4M3或4比特NVFP4,再用在线softmax已保留的行和加回均值,无需第二遍或额外缓冲区。在100个Wan2.2头上平均,块均值消除8%块能量,排序后消除36%;每个均值对每个value元素花费0.125比特。分组只在前25%去噪步骤运行,置换在相邻4步复用,按完整调度平均占注意力时间3%至4%。
ExpCast-FP8用一次融合乘加从对数域分数直接写出E4M3字节,常数β=-0.35居中剩余误差,不按模型拟合常数。直接路径在每次翻倍的79.6%区间与FP32先取指数再转换写出相同字节,其余相差1个码。论文证明每行总变差上界低于3.64%,在20.48万条Wan2.2注意力行上实测平均1.6%。它只适用于8比特内核,NVFP4没有单一仿射对数到码映射。手写CuTe/CUDA融合将B200上一次V-Smooth调用从42.2毫秒降至4.8毫秒。
测试覆盖Wan2.2-T2V-A14B、LongCat-Video、HunyuanVideo-1.5和MiniMax-H3,以100个提示下BF16 FlashAttention-4输出为保真基准。报道列出:B200上8比特注意力加速1.59倍、端到端1.19倍;H200上1.46倍和1.13倍;RTX PRO 6000上4比特2.27倍和1.36倍;RTX 5090上4比特3.58倍和1.70倍。B200上VC-Attention比无Blackwell内核的SageAttention2快6.02倍,H200上差距1.16倍。工作站卡上,4比特V-Smooth在RTX PRO 6000上与SageAttention3相当,在RTX 5090上差距在5%以内。
保真度上,8比特V-Smooth在Wan2.2上比SageAttention2高2.3 dB PSNR,在HunyuanVideo-1.5上高2.8 dB;加入ExpCast-FP8回退0.7至2.1 dB,但仍在全部4个模型上优于SageAttention2。4比特V-Smooth在Wan2.2上比SageAttention3高2.9 dB,在LongCat-Video上高3.6 dB。Attn-QAT比SageAttention2低3.4至6.7 dB。MiniMax-H3在1344×768下,B200注意力比BF16 FlashAttention-4快1.60倍,PSNR 20.2 dB对19.9 dB。论文报告B300为1.47倍,博客图表列出1.51倍。Nunchux Attention专有扩展在MiniMax-H3注意力上B200达1.91倍、B300达1.83倍。
该方法只改变每次交互成本,可与Sparse VideoGen、Radial Attention等稀疏注意力以及蒸馏、多GPU执行组合。Nunchux称将通过Modelverse等待名单提供免费MiniMax-H3访问。目前没有公开内核发布,Nunchux在自有技术栈中运行专有扩展。