GPT-OSS为何“复古地”在Attention机制中配置了偏差项(bias)?
August 6, 2025
GPT-OSS今天发布了,在模型架构配置参数文档中,我们可以看到其核心的注意力机制模块配置了偏差项(attention bias)

而当前很多的头部大模型明确都舍弃了这个bias的配置(比如DeepSeeK、Qwen系列)
特别是Qwen系列,本来在Qwen2.5时代还保留了这个bias的配置,但是到了Qwen3时代也舍弃了
正好博主去年有从数学推导的角度上,详细推理注意力机制中配置上偏差项bias是如何有助于大模型长度外推泛化的内在机制
故此老帖重提,为大家理解GPT-OSS模型中核心的注意力机制为何"复古地"配置偏差项(attention bias)提供一个解读视角