HiFloat赛事成果解读|SmoothQuant+MixQ在Wan2.2视频生成中的量化实践

HiFloat赛事成果解读|SmoothQuant+MixQ在Wan2.2视频生成中的量化实践

2026-09-07

以下文章来源于微信公众号——全球计算联盟GCC

2026年5月,由全球计算联盟(GCC)主办的IEEE ICME 2026低位宽大模型量化挑战赛赛程结束。赛事聚焦HiFloat4/HiFloat8等低位宽数值格式,围绕文本生成图像与文本生成视频两大任务,设置W4A4推理量化与W8A8训练量化两条主赛道,吸引了来自全球高校、科研机构与产业界的众多团队参与。

以下是基于W4A4推理量化赛道,针对开源模型Wan2.2-I2V-A14B的创新方案。本系列将持续分享各赛道创新方案,解析其核心思路,敬请关注!

随着生成式人工智能模型规模的持续扩张,其推理阶段的显存占用与计算开销已成为制约大规模部署的核心瓶颈。以图像生成视频为代表的多模态任务,对模型容量与推理效率提出了更为苛刻的要求。低比特量化作为一种有效的模型压缩手段,通过将权重与激活值从高精度浮点数(如FP16/BF16)映射至低位宽,可显著降低访存开销并利用低比特矩阵乘加速内核提升推理吞吐。然而,将量化推至W4A4时,激活张量中普遍存在的离群通道成为制约量化精度的主要因素。这些离群值在数值幅度上远超普通通道,采用统一的量化步长将导致有效数值分辨率的严重浪费,进而引发生成质量的显著退化。

本文章基于IEEEICME2026低比特宽大模型量化挑战赛,针对开源模型Wan2.2-I2V-A14B实现W4A4的后训练量化(PTQ)。本文的核心方案是将量化难度从激活端向权重端迁移(SmoothQuant),对残余离群列进行选择性高精度保护(MixQ风格),并通过细粒度分块量化抑制局部误差。三者协同作用,在严格满足W4A4约束的前提下,最大限度地逼近全精度模型的生成质量。

一、 W4A4量化的核心瓶颈:

FFN层的激活重尾效应

在high_noise_model.block_00.ffn.0层,激活的通道最大值超过6.0,而权重的通道最大值不足0.6,激活的动态范围是权重的10倍以上;同时激活的幅值分布呈现严重的重尾特性,极少数通道的数值远高于整体分布,绝大多数通道集中在低幅值区间。这种重尾分布对低比特量化是致命的:若采用逐张量或粗粒度逐通道量化策略,量化步长将由少数极端离群通道决定,导致占比绝大多数的小数值通道被压缩进极少的量化区间内,量化信噪比急剧下降,最终全面损伤视频生成的画质、主体一致性与运动连贯性。

图片

图1 Wan2.2 激活,权重统计

二、 核心技术方案:

三层递进的离群感知量化流水线

整套方案为纯后训练量化(PTQ)方案,无需重新训练或微调模型,所有参数通过离线校准一次性确定,推理端仅执行固定计算逻辑,工程落地成本极低。整体流程依次为:离线数据校准→SmoothQuant通道平滑→MixQ离群通道拆分→分块式HiF4权重打包→双分支GEMM推理。

图片

图2 端到端W4A4推理流程

2.1 全局平滑:SmoothQuant重新分配量化难度

方案的第一步是引入SmoothQuant的等价变换思想,在完全不改变线性层计算结果的前提下,将激活张量上过高的动态范围迁移到权重张量上,从全局层面降低4比特量化的难度。对于线性层计算

图片

引入逐输入通道的正缩放因子s,可将计算等价转换为:

其中与分别为沿输入通道维度的逐元素除法与乘法。该变换在浮点计算下完全精确,无任何精度损失。缩放因子的计算公式为:

超参数α控制动态范围的迁移比例:α越大,越多的动态范围从激活迁移至权重。针对Wan2.2FFN上投影层激活尾峰最强的特点,我们将α调优至0.5–0.7区间,在平滑激活的同时,避免权重侧的动态范围过载。

图片

图3 SmoothQuant折叠后最大值示意图

2.2 MixQ静态离群通道拆分

全局平滑可以压缩大部分尾峰,但无法完全消除极端离群通道。针对这部分残留的高幅值通道,本文借鉴MixQ的混合精度思想,将计算拆分为低比特主体分支与高精度离群分支,用极小的计算开销换取显著的精度提升。

原版MixQ针对大语言模型的自回归解码场景设计,利用token间的局部性实现在线离群预测,避免运行时扫描开销。但视频扩散模型的token对应时空维度的图像块,不同去噪步的激活特性差异较大。因此团队对MixQ做了针对性适配:将动态在线预测改为离线静态筛选,所有离群通道在标定阶段一次性确定。

具体实现逻辑为:

1、基于OpenS2V-5M校准集,对每个FFN线性层的输入通道,计算所有时空token下的激活最大绝对值,作为通道评分;

2、按评分从高到低排序,选取前个通道构成离群通道集,其余通道为普通通道集;

3、 推理时采用双分支计算:

其中普通通道严格执行HiF4格式的W4A4量化计算,离群通道保留FP16/BF16高精度计算,最终两路结果相加得到完整输出。这种静态通道拆分的优势十分明显:离群通道占比极低,额外带来的FLOPs可忽略不计;无需运行时离群检测,推理逻辑简单确定,性能稳定。

2.3 精细打包:分块式HiF4权重量化

在完成通道平滑与离群通道拆分后,团队对剩余权重采用分块量化的方式打包为HiF4格式,通过更细的缩放粒度提升权重量化信噪比。

团队探索了两种典型的分块布局:

  • 32×32分块:以32×32的权重子矩阵为一个量化单元,对离群值较多的局部区域适配性更好,能有效提升局部量化精度;
  • 128×1行式分块:沿输入通道维度以128×1为单元,更贴合通用GEMM的内存访问顺序,推理执行效率更高。

每个分块独立存储额外的缩放因子,相比逐通道或逐张量量化,能够更好地适配权重的局部分布波动,进一步压缩权重量化误差。

图片

图4 原理图块布局:密集的二维平铺(左)和K-major条带(右),用于HiF4/MXFP4打包前的局部缩放

三、实验结果与效果分析

本文基于赛事官方的OpenS2V-5M评测集,采用VBenchI2V标准指标,从美学质量、图生视频主体对齐、成像质量、运动平滑度、主体一致性五个维度,对方案进行了完整评测。

图片

从结果可以得出三个核心结论:

1、全面优于原生均匀量化。原生HiFloat4量化在所有维度上相对FP16均匀下降约5%,而本方案将成像质量、主体对齐的精度损失压缩至2.1%–2.6%,追回了近一半的精度差距;美学与主体一致性的损失也控制在3.1%–3.5%区间,全维度显著优于基线。

2、运动平滑度实现反超。方案最突出的亮点是运动平滑度指标达到0.9769,相对FP16基线提升0.4%。这表明针对FFN激活离群的结构化处理,恰好命中了视频生成中运动连贯性的核心计算瓶颈,结构化的量化噪声反而对时序连贯性产生了正向作用,充分验证了方案对视频生成任务的高度适配性。

3、剩余缺口具备优化空间。当前与FP16的精度缺口主要集中在美学质量与主体一致性上,这两类指标对细粒度外观细节更敏感,即使经过平滑,4比特激活仍会截断部分高频信息。同时,早期高噪声阶段的FFN层激活尾峰更显著,深层则相对平缓,未来通过分层调优α与k值、探索HiF4格式下的最优分块布局,可在预算内进一步缩小精度差距。

四、总结与行业启示

这项工作首次系统性地将SmoothQuant与MixQ两大LLM领域的经典量化技术,迁移并适配至视频扩散模型的W4A4推理场景,形成了一套完整、可复现、易落地的后训练量化方案。它的核心价值不仅在于赛事成绩,更在于验证了一个关键结论:对于生成式大模型的低比特量化,“一刀切”的均匀量化并非最优解,结合模型结构与数值分布特性,针对性地设计离群感知机制,能够在极致压缩比下最大程度保留生成质量。

对于产业落地而言,这套纯后训练方案无需重新训练模型,推理开销极低,可快速迁移至其他视频扩散模型,为百亿级视频生成模型的端侧部署、边缘推理与低成本云端服务,提供了一条高性价比的技术路径。目前该方案的完整代码、校准脚本与评测流程已全部开源,可直接复现论文中的全部效果。

五、从量化实践到算力生态

2026全球计算大会即将启幕

SmoothQuant+MixQ在视频生成模型上的成功迁移,验证了一个产业共识:当生成式大模型的参数量与计算复杂度持续攀升,单纯依赖硬件堆叠已非可持续路径——从算法层的量化压缩、到系统层的架构革新,再到产业层的生态协同,”让AI算力更高效、更低成本、更广泛地赋能千行百业”已成为全链路共同追求的目标。

这一目标,正与2026全球计算大会(CGC2026)的主题相契合。作为全球计算联盟(GCC)年度产业旗舰大会,CGC 2026将于10月21—24日在深圳会展中心(福田)举办,并采用「1场主论坛+5大专题分论坛+1场专题展览」矩阵。其中,超节点技术与生态论坛将设置HiFloat相关议题,持续探索更高能效的大模型训练与推理技术。论坛详细信息如下,报名通道已开启,期待您的莅临!

  • 名称:超节点技术与生态论坛
  • 主题:构筑智算新赛道,释放算力高势能
  • 时间:10月21日 14:00—17:00
  • 地点:深圳会展中心(福田)·五层·牡丹厅

即刻扫码,预约超节点技术与生态论坛席位

报名截止:10月14日

图片