1、引言:RoPE + Bias 有助于长度外推
在 抛砖引玉:浅谈ROPE位置编码模式下,q、k的分布(均值与方差)对注意力远程衰减的影响该篇博客中,我们特别提到了Qwen2.5系列模型中的 nn.Linear层中只针对q,k,v添加了 bias项,也简单给出了笔者的猜测,相关介绍截图如下:

而当前,其他一些头部模型其实很多是没有添加 bias的,比如deepseek-ai/DeepSeek-V3,不添加 bias也有诸多解释性的缘由,比如避免过拟合等。那么Qwen2.5系列特意针对q,k,v添加了 bias项,他们本身的出发点究竟是什么呢?
这个问题终于在Qwen团队发布了Qwen2.5的技术报告Qwen2.5 Technical Report后给出了解释:

可见Qwen团队引入 bias的缘由还是因为苏神在Bias项的神奇作用:RoPE + Bias = 更好的长度外推性这篇博客中通过实验测试证明了添加 bias项有助于大模型长度外推。
2、问题:为什么加了Bias就有助于长度外推?
大模型长度外推的一大关键是:当文本序列长度大幅增加后,大模型的注意力需要避免泛滥不聚焦的问题(关于大模型在长文本情况下的注意力泛滥不聚焦的问题可以参阅top-k Attention(top-k 稀疏注意力):一种免再训练的大模型长度外推泛化的推理方法),所以一条分析思路就是:
长度外推需要注意力聚焦不泛滥,而注意力聚焦不泛滥又需要设计有效的注意力远程衰减效果,所以加了 bias有助于长度外推其实本质还是因为:
加了 bias有助于实现更有效的注意力远程衰减效果?
而这又和文章开头提到的 抛砖引玉:浅谈ROPE位置编码模式下,q、k的分布(均值与方差)对注意力远程衰减的影响该篇博客中的实验结论相契合了:
其实,加了 bias等价于影响了q,k分布的均值,或者说导致向量有一个明显的‘’基底‘’偏移量 ,而这有助于RoPE下实现预期的注意力远程衰减的效果,我们接下来会:
1)先对这个观点进行几何角度的形象解读;
2)最后再附上一份不太严谨的数学证明。
其中,解读部分我们会采取层层递进的方式进行演绎,以期将概念拆解的更直观易懂。
3、几何角度的解读:“有偏置” (Bias) + “旋转”(RoPE) 会带来远程衰减
问题:把一个带‘基底偏置’的向量,再加上一个‘旋转’(比如 RoPE 里的旋转矩阵)时,会发生什么呢?
- 旋转与基底的叠加
- 在 RoPE 中,我们会对 q或k的部分分量(deepseek的MLA架构就是严格的部分分量)施加相位旋转,类似在“复平面”里把某些坐标绕着原点转一个角度。
- 如果 q本身没有什么偏置(大致均值为 0),那它在旋转时就只是在“原点附近”轻微摆动,远距离时就容易呈现某种随机噪声,不一定会有明确的随距离增减的趋势。
- 但是如果q带了一个明显的“基底方向” ,那么这个“基底”就像一个大矢量坐落在复平面的某个角落;在它的基础上再旋转,就相当于不断给一个非零起点叠加越来越大的相位偏移 。这时候,相位和基底之间的夹角、长度就会发生系统性的变化。
- 同向 vs. 反向
- 如果q与 k这两个基底方向“大致同向”(也都偏正或者都偏负),那一开始它们可能对齐得很好(θ很小,cos(θ)很大),点积就非常大;但随着旋转累积,二者会快速出现更大的夹角,cos(θ)下降就很明显,导致点积随距离衰减。
- 若 q与k的基底方向“相反”(一个是正偏置,一个是负偏置),一开始它们或许就呈现出负的点积(θ≈180∘)。但随着旋转继续,它们可能逐渐“转到”某个角度,cos(θ)反而从负数向正数跃迁,出现了某种“远程增强”的现象。
- 为什么是衰减或增强?
- 可以把这个过程想象成“在一个大圆上有两个点,起初或许重叠度很高,随着绕圆周的旋转,一方离另一方变得更远或更近”。只要有一个常驻的“偏置矢量”在场,旋转就意味着逐渐失配或逐渐变得更匹配,于是随距离(旋转角度)的增大,点积要么更快降低,要么出现意外上涨。
- 这也就是我们在 抛砖引玉:浅谈ROPE位置编码模式下,q、k的分布(均值与方差)对注意力远程衰减的影响该篇博客的实验里看到的: “正偏置 + 正偏置” → 远程衰减;“正偏置 + 负偏置” → 远程增强 ,背后只是“点积 + 旋转”的几何图景在发挥作用。
再问:
- 没有偏置,意味着q和k经常分布在原点周围并随机摆动,相当于你无法确定它们有一个‘特定的方向’在旋转过程中一直发挥作用。
- 这就像你拿一个非常小、随机分布在圆心周围的短向量去做旋转, 旋转幅度再大,它对彼此点积的影响也无规律可言 ——时而对齐,时而相反,时而正交,都只是噪声。自然就不显现出一个清晰的随距离衰减或增强的模式。
总结:
“偏置 + 旋转 → 远程衰减(或增强)”,本质上就是一个“大矢量上不断叠加相移”在点积世界里如何造成数值随距离变化的几何现象。
- 若两大矢量同向 :一开始点积很大,但随着旋转,夹角增大快,数值就会随距离衰减。
- 若两大矢量反向 :一开始点积很小甚至为负,但旋转可能慢慢扭转局势,出现远程增强。
- 若无明显偏置 :旋转只会在原点附近打转,难以形成显著的远程衰减或增强。
这就是我们所看到的“在纯粹向量点积模型中(即注意力机制),偏置(均值)如何决定了旋转后的远程衰减/增强”背后的直观几何解释。
4、数学推导
以下部分会尝试给出一个比较系统的、从理论层面去解释「RoPE下的注意力远程衰减现象如何与 q,k 的分布(均值/方差) 相关」的推导思路。为了使推导更聚焦,我们做如下简化假设:
- 只考虑单头注意力(不去区分多头),并把所有向量的维度看作 d。
- 将 RoPE 视作在每对坐标(2维)上执行相同的“旋转”操作,即用复数表示会更直观。
- q,k 均来自某个多元高斯分布(是否有非零均值、不同方差),我们重点关心它们的均值向量 μq,μk 和协方差矩阵 Σ。
注: 这份推导并不是 100% 严谨完备的“定理+证明”形式,而是帮助我们看清:
- 当 μq,μk 为零或很小的时候,RoPE并不会显著地产生远程衰减;
- 当 μq,μk 同向且较大时,会带来随位置差增大的相位错配,从而引发远程衰减;
- 当二者方向相反或方差过大时,又会导致远程增强或衰减消失。
4.1、 RoPE 的数学表征:用复数表示旋转
为了更方便地处理“旋转”操作,我们先把维度 d 视作由 2d 组二维坐标组成。在每组二维坐标 (x2i,x2i+1) 上,RoPE会做一个如下变换(对第 i 组位置而言):
(x2ix2i+1)⟼(cos(θi)sin(θi)−sin(θi)cos(θi))(x2ix2i+1).
在实际的 RoPE 实现中,θi 会和“序列位置”p 以及一个频率刻度 α(常见是 α≈100002i/d1)相关,比如
θi(p)=αi⋅p,其中 αi=10000−d2i.
用复数形式会更简洁:记
zi=x2i+jx2i+1(其中 j2=−1),
那么二维旋转就是与复数的乘法
zi↦ziexp(jθi(p)).
如果 q∈Rd 表示某个 token 的向量,那么在位置 p 处的 RoPE 变换可写为复数向量
qrope(p)=(z1ejθ1(p),z2ejθ2(p),…,z2dejθ2d(p)).
同理,对 k 也是一样,只不过位置可能是 p′,会得到
krope(p′)=(w1ejθ1(p′),w2ejθ2(p′),…,w2dejθ2d(p′)).
4.2、注意力分数 qrope⋅krope 的表达
4.2.1 在复数形式下的“点积”
我们关心的是:
qrope(p)⋅krope(p′)=i=1∑2dRe(ziejθi(p)⋅(wiejθi(p′))),
这里 ⋅ 表示复共轭,Re(⋅) 表示取实部。将乘法展开可得
=i=1∑2dRe(ziwi)exp(j(θi(p)−θi(p′))).
为简化记号,记
Δi(p,p′)=θi(p)−θi(p′),
那么
qrope(p)⋅krope(p′)=i=1∑2dRe[(ziwi)ejΔi(p,p′)].
4.2.2 若 θi(p) 线性依赖于位置 p
在常见的RoPE中,θi(p)=αip,于是
Δi(p,p′)=αi(p−p′).
对“远距离”而言(比如 ∣p−p′∣ 很大),Δi 也就很大,从而会在复平面里产生较大幅度的旋转。
4.3、q,k 的分布:从高斯随机向量到期望点积
为了研究“远程衰减”这类宏观现象,最直接的方法之一就是去计算其期望值(或者均值的模量等统计量),即
E[qrope(p)⋅krope(p′)].
若我们能证明随着 ∣p−p′∣ 增大,此期望值呈现下降(衰减)或其他行为,就能为实验结论提供一定的理论解释。
4.3.1 假设:q,k ~ 多元正态分布
令
q=(z1,z2,…,zd/2),k=(w1,w2,…,wd/2),
在复数视角里,假设它们满足:
{zi=μq,i+εq,i,wi=μk,i+εk,i,
其中 εq,i,εk,i 是满足某些(复)高斯分布的随机量,具有协方差 Σ,均值为 0;μq,i,μk,i 则是可学习的均值向量。为了不掩盖主要思想,常见简化包括:
- 假设 q,k 独立(或在同一个 token 上是同分布,但不同 token 也相互独立);
- 假设各分量之间独立且方差相同(“同方差”),即 εq,i∼N(0,σ2) 等价于复正态(均值0,方差σ2)。
这样,我们就可以把期望拆成均值部分 + 噪声协方差 的两部分。
4.3.2 期望展开
我们要计算
E[i=1∑d/2Re((ziwi)ejΔi)].
注意到
ziwi=(μq,i+εq,i)(μk,i+εk,i)=μq,iμk,i+μq,iεk,i+εq,iμk,i+εq,iεk,i.
令
Γi=E[εq,iεk,i](这在独立同分布时通常为 0或 σ2δq,k),
其中如果 q 和 k 独立,则 Γi=0。若 q=k(自注意力同一个embedding),会有 Γi=σ2 之类的形式。
那么期望拆解如下:
E[ziwi]=μq,iμk,i+μq,iE[εk,i]+μk,iE[εq,i]+Γi.
由于 εq,i,εk,i 均值为0,E[εk,i]=0,则简化为:
E[ziwi]=μq,iμk,i+Γi.
因此,
E[qrope(p)⋅krope(p′)]=i=1∑d/2Re[(μq,iμk,i+Γi)E[ejΔi]].
假设 q,k 与位置无关(即不会因为句子位置改变它们的分布),则 Δi 是确定的(和随机 εq,i 无关)。故
E[ejΔi]=ejΔi.
这时
=i=1∑d/2Re[(μq,iμk,i+Γi)ejΔi].
4.4、远程衰减/增强的来源:均值项 vs. 协方差项
由上式可见,期望分为两部分:
-
来自 μq,iμk,i 的贡献
i=1∑d/2Re[μq,iμk,iejΔi].
如果 μq,i,μk,i 都是非零(并且方向类似),那么这是一个随 Δi 变动而可能产生周期性衰减或增强的主导项。因为 Δi 会随着 ∣p−p′∣ 增大而带来“相位不断积累”,让实部出现规律性的正负波动,整体常表现为平均值随距离增大而变小(衰减),或者在方向相反时出现另一种远程现象(远程增强)。
-
来自 Γi(噪声协方差)的贡献
i=1∑d/2Re[ΓiejΔi].
- 若 q,k 独立(Γi=0),则这部分不贡献任何平均值;
- 若是同一个向量(q=k,自注意力场景并且分量独立方差σ2),则 Γi=σ2是一个常量,但乘上 ejΔi 仍会在复平面震荡,最后再取实部求和,通常会随 ∣p−p′∣ 呈振荡状,并且可能均值接近零。
- 这解释了若 μq=μk=0 并且是大方差,则我们不会在期望上看到明显的远程衰减,更多地是一种随机震荡/噪声。
因此,从这里我们可以初步得出一个重要结论:
若想让 qrope(p)⋅krope(p′) 在平均意义上呈现“随 ∣p−p′∣ 增大而单调衰减”的趋势,最关键的一环就是 μq,i,μk,i 的非零部分如何与相位旋转相互作用。
- 当 μq,μk 同向且绝对值不小,这会导致随着位置差变大,“相位失配”越来越严重,点积的实部下降显著;
- 当 μq,μk 方向相反,在小距离时它们就相互抵消,随着距离增大,可能因相位而“翻转”导致某些远程增强效应;
- 当 μq,μk≈0 或方差无比大,则噪声占主导,让旋转信号变得难以在期望上显现有序的衰减/增强。
总结
在 RoPE 机制下,q,k 的“非零均值”扮演了“基底向量”的角色,而bias项的加入就是为非零均值助力。
当存在这个‘基底向量’时,随距离增大的旋转相位会与它越来越错配,使得点积平均值随距离衰减;反之,若均值为 0 或方向相反,衰减就不明显或甚至变为远程增强。而注意力远程衰减又是保障大模型长度外推的关键环节,所以为了更好的长度外推性质,建议实施:RoPE+Bias。