RotateAttention : RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation¶
会议: ECCV 2026
论文: ECCV 原文
领域: 视频生成
关键词: 视频生成, 量化注意力, 3D RoPE, 离群值均衡, 范围整流
一句话总结¶
针对基于 3D RoPE 的 DiT 视频生成模型中注意力机制二次计算瓶颈,RotateAttention 提出了与 RoPE 融合/低开销的正交旋转以均衡 Query-Key 离群值,结合注意力概率矩阵 \(P\) 的仿射全动态范围整流与混合精度回退,实现了高达 1.68× 的端到端生成加速和近乎无损的视频质量。
研究背景与动机¶
基于 Diffusion Transformer (DiT) 的视频生成模型在生成长序列、高保真视频方面展现出强大能力,但由于视频 token 数量常动辄超过 10K,注意力机制的时间与空间开销随序列长度呈二次方暴涨,成为推理过程中的首要计算瓶颈。为了大幅减轻硬件计算负担,低比特(如 INT4)FlashAttention 量化被视作一种极具潜力的加速手段。然而,直接将大语言模型(LLM)中成熟的低比特注意力量化策略迁移至带有三维旋转位置编码(3D RoPE)的视频 DiT 时,会遭遇两项严重的结构性痛点:其一,传统用于消除张量离群值(outliers)的在线正交旋转变换(如 Hadamard 变换)在计算密集的视频 DiT 中无法像在内存受限的 LLM 解码阶段那样轻易重叠隐藏,且普通旋转矩阵极难与稀疏分块的 3D RoPE 算子自然兼容融合;其二,经过因果或双向注意力 softmax 算子内部非负指数缩放后的局部概率矩阵 \(P = \exp(S - m) \in (0, 1]\),若沿用传统的对称量化,其取值范围仅落在非负半轴,导致 INT4 的负数表示区间 \([-8, 0)\) 被完全闲置,白白浪费了一半(8个)量化级别,引发严重的精度损失。
这一失败的核心矛盾在于:低比特量化的数值鲁棒性高度依赖于通道间离群值的充分平滑,但 3D RoPE 的显式分块几何变换人为塑造了强烈的各向异性离群值结构,且 LLM 往往只需保留 Query (Q) 为 FP16、仅量化 Key (K) 缓存,而在视频 DiT 中为了获得真实的硬件 Tensor Core 乘法吞吐增益,必须同时对 Q 与 K 实施低比特量化。一旦变换矩阵打破对称性(非正交),就会在一个矩阵中压缩离群值的同时在另一个矩阵中等比放大离群值,进一步恶化量化误差。
本文的切入角度是:深入分析 3D RoPE 作用后 Q 和 K 的通道不相干性(incoherence)分布特征,揭示出离群值严格受制于时间、高度、宽度三个时空维度的分配,且在 Q 与 K 之间呈现高度的跨矩阵对称性以及各维度半段内部的结构化集中分布。核心 idea:设计 RoPE 感知的块对角正交旋转机制(包括可直接与 RoPE 算子权重预融合的交错旋转和基于时空半段配对的极低开销半段旋转)来消除 Q/K 离群值,并为注意力概率矩阵 \(P\) 引入固定缩放与零点的仿射范围整流,配合针对敏感步与敏感块的选择性混合精度回退,构建高精度硬件友好的 INT4 FlashAttention。
方法详解¶
整体框架¶
RotateAttention 专为配备 3D RoPE 的 DiT 视频生成模型量身定制。在整体前向计算流程中,模型首先对输入特征经过 Q、K、V 投影后的张量执行通道平滑(Smoothing)与针对 Value 矩阵的离线融合 Hadamard 变换;随后,针对带有 3D RoPE 的 Query 和 Key 张量,应用严格保持正交性的 RoPE 感知旋转变换(交错旋转 Interleaved Rotation 或半段旋转 Half Rotation),以极低或零推理开销在通道间重新均衡离群值;接着在块级 FlashAttention 内部,预 Softmax 矩阵完成 INT4 矩阵乘法后,对得到的非负概率矩阵 \(P\) 采用范围整流量化映射,将其动态投影至 \([-8, 7]\) 的完整 16 级数值空间,再与量化后的 \(V\) 矩阵相乘;最后,框架结合步骤感知与层敏感性分析,在初始/尾部去噪时间步及敏感 DiT 块采用 FP16 选择性回退(Selective Fallback),其余绝大部分步骤全速运行 INT4 算子。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入特征与线性投影<br/>Q, K, V 张量提取"] --> B["V 矩阵离线 Hadamard 变换<br/>吸收至 Wv 与 Wo 权重"]
B --> C["RoPE 感知旋转变换<br/>交错融合旋转 / 极低开销半段旋转"]
C --> D["INT4 Q-K 块矩阵乘法<br/>计算注意力得分 S = QK^T / sqrt(D)"]
D --> E["范围整流 P 矩阵量化<br/>固定尺度 15 与零点 -8 仿射映射"]
E --> F["INT4 P-V 块矩阵乘法<br/>累加恢复注意力输出"]
F --> G["选择性 FP16 混合精度回退<br/>敏感时间步与敏感 DiT 块保持高精度"]
关键设计¶
1. RoPE 感知旋转变换:正交均衡与算子融合消除 Q/K 离群值
在配备 3D RoPE 的视频 DiT 中,特征维度 \(D\) 被分割为对应时间(帧)、高度和宽度的三个部分 \(D = D_f + D_h + D_w\)。作者引入通道不相干性度量 \(\Psi(X) = \max_{i} |X_{i,:} - \mathbb{E}[X]|\) 分析发现,离群值严格局限在各个时空分段内,且在各分段中往往高度集中在前一半维度,同时 Q 和 K 表现出强烈的跨矩阵对称性。为了在全精度等价条件 \(QK^\top = (QR)(KR^{-\top})^\top\) 下不破坏数值稳定性,作者从奇异值分解 \(R = U \Sigma L^\top\) 严格证明:若存在奇异值 \(\sigma_i \ne 1\),则 \(Q\) 在该主方向被压缩的同时 \(K\) 的对应方向将被以 \(1/\sigma_i\) 放大,导致各向异性缩放严重恶化任一矩阵的量化误差;因此必须满足 \(\Sigma = I\),即变换必须为严格正交矩阵 \(R \in \mathrm{O}(D)\)。
基于此,作者提出了两种互补的正交旋转策略: - 交错旋转(Interleaved Rotation):构造由 \(D/2\) 个 \(2 \times 2\) 正交块(如 2 阶 Hadamard 矩阵 \(H_2\))组成的块对角矩阵 \(R\),直接作用于相邻通道对 \((d_{2i}, d_{2i+1})\)。由于 3D RoPE 的旋转矩阵 \(M\) 本身同样是由 \(2 \times 2\) 旋转块构成的对角块结构,两者的乘积 \(M' = RM\) 完全保持了相同的稀疏块对角模式。因此,交错旋转可以直接在离线状态下与 RoPE 权重乘积预融合,在前向推理中完全保持逐元素计算的极速算子,实现零额外推理开销。 - 半段旋转(Half Rotation):鉴于离群值在每个时空分段 \(j \in \{f, h, w\}\) 内严重偏向于前半段,作者引入分段置换矩阵 \(\Pi = \mathrm{diag}(\Pi_f, \Pi_h, \Pi_w)\),将相距 \(D_j/2\) 的对应维度配对并置于相邻位置,再施加由 \(D_j/2\) 个 \(2 \times 2\) 正交块构成的分块旋转 \(R^j\): $\(Q \Pi R = [Q_f \Pi^f R^f, \, Q_h \Pi^h R^h, \, Q_w \Pi^w R^w]\)$ 该操作同样借助分块置换旋转的稀疏结构,可被高度优化为逐元素计算内核,以仅约完整全维度旋转 \(3\%\) 的极其微小的计算代价彻底平滑各时空分段跨半区的离群能量。
2. 范围整流 P 矩阵量化:双倍有效数值分辨率的仿射重映射
在 FlashAttention 在线 Softmax 的分块计算过程中,局部概率矩阵定义为 \(P_{i,j} = \exp(S_{i,j} - m_{i,j}) \in (0, 1]\),其中 \(m_{i,j}\) 为滑动行最大值。若采用常规的有符号 INT4 对称量化,由于张量值完全恒大于零,量化公式 \(\lfloor (P_{i,j} / \max P_{i,j}) \times 7 \rceil\) 仅能利用 \([0, 7]\) 共 8 个量化离散阶,整个负整数区间 \([-8, 0)\) 被全部废弃。
为了彻底释放 INT4 格式的表示潜力,RotateAttention 提出了范围优化整流机制。设计采用了固定缩放因子 \(15\) 与固定零点 \(-8\) 的仿射变换: $\(\tilde{P}_{i,j} = \left\lfloor \frac{P_{i,j}}{\max(P_{i,j})} \times 15 \right\rceil - 8 \in [-8, 7]\)$ 通过将非负概率分布完整映射到 INT4 的全部 16 个离散级别,该设计直接将量化精度分辨率提升了一倍(由 8 级增加至 16 级),在无需引入额外浮点动态校准运算的前提下显著压低了舍入截断噪声。实验证明该设计在注意力分布平缓弥散的文生视频(T2V)任务中带来了立竿见影的质量改善。
3. 零开销 V 矩阵变换与选择性混合精度回退策略
针对注意力值矩阵 \(V\),作者采用了离线权重融合的 \(D \times D\) 正交 Hadamard 变换 \(H\)。借助矩阵乘法关联律,将注意力输出改写为: $\(\mathrm{Softmax}\left(\frac{QK^\top}{\sqrt{d_k}}\right) V W_o = \mathrm{Softmax}\left(\frac{QK^\top}{\sqrt{d_k}}\right) (V H) (H^\top W_o)\)$ 由此可直接在离线预处理阶段将 \(H\) 分别吸收进值投影权重 \(W_v' = W_v H\) 与输出投影权重 \(W_o' = H^\top W_o\),使得 \(V\) 矩阵的平滑化旋转在运行时完全不需要任何矩阵变换算子开销。
同时,考虑到视频生成模型在扩散过程初期和末期对微细结构和整体构图异常敏感,以及 DiT 网络首尾浅层和深层块具有更高的保真度权重,框架采用了细粒度的选择性 FP16 回退机制。例如在 Wan2.2-T2V 中,仅在前 2 步和后 2 步去噪步、以及首尾各 2 个 DiT 块中回退至 FP16,使得整网高达 \(81\%\) 的 FlashAttention 算子能够平稳运行在 INT4 高速核函数下;在 Wan2.2-I2V 中 INT4 执行比例达 \(68\%\),HunyuanVideo-T2V 中达 \(76\%\),在加速比与图像质量之间达成了帕累托最优平衡。
实验关键数据¶
主实验¶
评估涵盖当今主流的开源 DiT 视频生成基座:Wan2.2 (I2V / T2V, 480P 81帧) 以及 HunyuanVideo (T2V, 480P 129帧)。评价指标聚焦于反映量化微观失真的低层像素差异指标(Cosine 相似度、MSE、SSIM、PSNR)以及端到端生成加速倍率。
| 数据集 / 模型 | 量化类型 | 优化 P | 旋转策略 | Cosine ↑ | MSE ↓ | SSIM ↑ | PSNR ↑ | 端到端加速 |
|---|---|---|---|---|---|---|---|---|
| Wan2.2-I2V (480P, 81帧) | FP16 | - | - | 1.0000 | 0.0000 | 1.0000 | \(\infty\) | 1.00× |
| Wan2.2-I2V | INT4 (SageAttn 基准) | \(\times\) | 无 | 0.9809 | 519.30 | 0.7752 | 22.828 | - |
| Wan2.2-I2V | INT4 | \(\checkmark\) | 无 | 0.9789 | 575.17 | 0.7524 | 22.069 | - |
| Wan2.2-I2V (本文) | INT4 | \(\checkmark\) | 半段旋转 (Half) | 0.9824 | 493.35 | 0.7767 | 22.903 | 1.51× |
| Wan2.2-I2V | INT4 | \(\checkmark\) | 交错旋转 (Interleave) | 0.9792 | 583.88 | 0.7502 | 22.057 | 1.51× |
| Wan2.2-I2V | INT4 | \(\checkmark\) | 全旋转 (Full) | 0.9807 | 515.34 | 0.7808 | 23.176 | - |
| Wan2.2-T2V (480P, 81帧) | FP16 | - | - | 1.0000 | 0.0000 | 1.0000 | \(\infty\) | 1.00× |
| Wan2.2-T2V | INT4 (SageAttn 基准) | \(\times\) | 无 | 0.9458 | 1574.5 | 0.6348 | 17.829 | - |
| Wan2.2-T2V | INT4 | \(\checkmark\) | 无 | 0.9518 | 1410.1 | 0.6582 | 18.427 | - |
| Wan2.2-T2V | INT4 | \(\checkmark\) | 半段旋转 (Half) | 0.9492 | 1466.0 | 0.6504 | 18.462 | 1.68× |
| Wan2.2-T2V (本文) | INT4 | \(\checkmark\) | 交错旋转 (Interleave) | 0.9562 | 1392.1 | 0.6628 | 18.544 | 1.68× |
| Wan2.2-T2V | INT4 | \(\checkmark\) | 全旋转 (Full) | 0.9527 | 1370.2 | 0.6737 | 19.211 | - |
| HunyuanVideo-T2V (480P, 129帧) | FP16 | - | - | 1.0000 | 0.0000 | 1.0000 | \(\infty\) | 1.00× |
| HunyuanVideo-T2V | INT4 (SageAttn 基准) | \(\times\) | 无 | 0.9663 | 1095.3 | 0.6621 | 18.332 | - |
| HunyuanVideo-T2V | INT4 | \(\checkmark\) | 无 | 0.9712 | 1089.6 | 0.6620 | 18.945 | - |
| HunyuanVideo-T2V (本文) | INT4 | \(\checkmark\) | 半段旋转 (Half) | 0.9751 | 1041.9 | 0.6677 | 18.971 | 1.61× |
| HunyuanVideo-T2V | INT4 | \(\checkmark\) | 交错旋转 (Interleave) | 0.9750 | 1045.8 | 0.6588 | 19.037 | 1.61× |
| HunyuanVideo-T2V | INT4 | \(\checkmark\) | 全旋转 (Full) | 0.9744 | 1076.4 | 0.6646 | 18.854 | - |
消融实验¶
下表深入分析了在 Wan2.2-I2V 任务上,是否具备旋转、旋转类型、是否具备严格正交约束以及可学习旋转对量化指标的影响:
| 实验配置变体 | 核心正交性/结构约束 | Cosine ↑ | MSE ↓ | SSIM ↑ | PSNR ↑ | 说明 |
|---|---|---|---|---|---|---|
| 无旋转基线 (SageAttn 风格) | 无旋转 (W/O Rotation) | 0.9809 | 519.30 | 0.7752 | 22.828 | 离群值未平滑,量化截断误差显著 |
| 仅加入优化 P 矩阵整流 | 无旋转,单启优化 P | 0.9789 | 575.17 | 0.7524 | 22.069 | I2V 低熵条件下仅改 P 反而略有精度微扰 |
| 半段正交旋转 (Half Rot) | \(2 \times 2\) 分块正交,配对跨半区 | 0.9824 | 493.35 | 0.7767 | 22.903 | 最佳平衡:精准切除半区聚集离群值 |
| 交错正交旋转 (Interleaved) | \(2 \times 2\) 分块正交,相邻通道配对 | 0.9792 | 583.88 | 0.7502 | 22.057 | 零推理开销(可完全融入 RoPE 权重) |
| 全维度正交旋转 (Full Rot) | \(D \times D\) 全局 Hadamard | 0.9807 | 515.34 | 0.7808 | 23.176 | 全局平滑度最高,但在短序列下算子额外开销较大 |
| 梯度学习旋转 (无正交约束) | 非正交优化矩阵 \(R\) | 严重发散 | 严重恶化 | 严重下降 | 严重恶化 | 验证理论推导:非正交缩放打破 Q/K 平衡导致雪崩 |
| 梯度学习旋转 (带正交约束) | 保持 \(R_i \in \mathrm{O}(2)\) 参数化 | 0.9809 | 519.94 | 0.7746 | 22.713 | 1-2 个校准样本下效果与固定预置 Hadamard 相当 |
关键发现¶
- 半段旋转与交错旋转的适应场景差异:半段旋转(Half Rotation)在离群值集中于半区特征明显的 Wan2.2-I2V 与 HunyuanVideo 上取得最优 Cosine 和 MSE 表现;而交错旋转(Interleaved Rotation)在局部相邻通道强相关的 Wan2.2-T2V 上表现优异,且具备完全融合进 RoPE 的零推理额外开销优势。
- 范围优化 P 量化的任务熵偏好:范围整流在 T2V 任务中几乎无差别全面提升指标(如 Wan2.2-T2V 的 Cosine 从 0.9458 升至 0.9518,PSNR 从 17.829 提升至 18.427 dB)。但在图像引导的 I2V 任务中增益相对有限甚至略微扰动,这是因为 I2V 条件约束强、注意力矩阵呈现尖锐的极低熵状态(大量值极度靠近 0 或 1),普通对称截断反而天然贴合该极化分布。
- 硬件内核与端到端计算收益:在 NVIDIA A10 GPU 上的定制 CUDA 核函数测试显示,INT4 FlashAttention 算子取得了高达 2.2× 的算子级加速;反映在全生成流程中,端到端加速分别达到了 Wan2.2-T2V 的 1.68×、HunyuanVideo 的 1.61× 和 Wan2.2-I2V 的 1.51×。当序列长度超过 30K tokens 时,旋转计算的算销占比低于注意力的 1%,半段旋转更是将旋转算销降至全旋转的 3%。
亮点与洞察¶
- 3D RoPE 离群值分布的几何诱导发现:作者不仅观察到离群值,更进一步指认出离群值严格受 3D RoPE 的时间、高度、宽度频率分配调控,低频通道随长序列累积更大角度展开从而诱发极端离群值,且在 Q 和 K 上具有强烈的跨矩阵对称性,这一洞察直接为设计定制化轻量旋转矩阵指明了方向。
- 正交性守恒的数学证明与反直觉结论:形式化证明了为什么 LLM 中常用的非正交可逆变换(如 FlatQuant、SpinQuant)无法直接套用到双向/视频 DiT 量化——因为当 Q 和 K 必须同时被量化时,任何非正交变换必定会在压缩其中一个矩阵奇异值的同时按倒数放大另一个矩阵的离群值。严格正交约束是避免跨矩阵误差放大的数学底线。
- 与 RoPE 算子稀疏结构的完美融合:巧妙利用 3D RoPE 本身即为 \(2 \times 2\) 块对角矩阵的代数性质,将交错正交旋转直接乘入 RoPE 旋转矩阵并预存为静态参数,使得在线旋转完全零开销融入逐元素 RoPE 内核,展现了极高的系统与算法协同设计水准。
局限与展望¶
- 位置编码范式的特异性局限:当前的半段与交错旋转策略深度绑定于 3D RoPE 的分块频率排布方式,若要推广至 Absolute Learned Positional Embedding、Sinusoidal 或其他变体(如 NoPE/ALiBi 等),需要重新针对对应分布构造置换与旋转模式。
- 可学习旋转的校准样本收益尚未饱和:初步探索表明带正交约束的梯度微调旋转在仅有 1-2 个样本校准时未能超越解析设计的 Hadamard 静态初始化,更完备的大规模正交流形优化校准策略仍有待未来工作进一步释放潜力。
- 与极端稀疏注意力的联合适配:尽管作者提及该正交旋转与 PAROAttention(基于 token 重排的 P 矩阵量化)相互正交可正向叠加,但在极短序列(<10K)叠加重度稀疏剪枝算子时,在线半段旋转的相对开销可能会上升至 10% 左右,仍需更底层的算子级融合编译优化。
相关工作与启发¶
- vs SageAttention 系列 (SageAttention / SageAttention3):SageAttention 主要采用通道平滑(\(Q - \mathbb{E}[Q]\))和 NVFP4 微缩放格式,但由于缺乏针对 3D RoPE 引入的 Q/K 离群值旋转机制,且在 P 矩阵上沿用对称 INT4 浪费了一半表示范围;RotateAttention 在保留平滑的基础上,填补了正交旋转与 P 范围整流,视觉结构完整性与 PSNR 显著占优。
- vs LLM 旋转量化 (QuaRot / SpinQuant / FlatQuant):LLM 工作主要面向自回归解码的内存受限(Memory-bound)场景,倾向于将 Q 保持 FP16、仅量化 KV 缓存,因此允许采用非正交变换将误差不对称推向 Q;而 RotateAttention 针对 Compute-bound 的视频 DiT,开创性地推导并落实了必须同时量化 Q 和 K 时的正交约束与分块轻量化。
- vs PAROAttention:PAROAttention 从 token 维度重排注意力块以改善量化块内数值方差,而 RotateAttention 聚焦于通道(channel)维度的正交几何旋转与仿射范围映射,两者属于完全正交互补的加速维度,具备协同部署的巨大潜力。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 深刻揭示了 3D RoPE 对离群值几何分布的塑形机理,并提出了优雅的 RoPE 融合旋转与 P 范围整流设计。
- 实验充分度: ⭐⭐⭐⭐☆ 覆盖了 Wan2.2 双任务与 HunyuanVideo 两大前沿模型,量化差异、消融与核函数加速测试详实。
- 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰完备,结构精炼,图文呼应紧凑。
- 价值: ⭐⭐⭐⭐⭐ 为端侧和数据中心高吞吐 DiT 视频生成模型的低比特部署提供了极具实用价值的工业级范式。