编程与 AI15 分钟阅读更新于 2026-08-03

Transformer 的注意力参数是怎样学会关注关系的

围绕 Q、K、V 投影矩阵和训练过程的描述,解释注意力权重如何从随机参数逐步形成有用的关注模式。

相关工具

模型并没有预先知道该关注谁

看到一张注意力图时,人们容易误以为模型一开始就知道哪些词应该互相关注。实际上,Q、K、V 的投影矩阵通常从初始化开始,注意力模式是在训练过程中逐步形成的。模型通过任务损失获得反馈,再调整这些矩阵,让后续预测更接近目标。

文中提到,Query、Key、Value 是由输入向量分别与三组训练得到的矩阵相乘得到的。矩阵本身没有人工写入“主语”“指代”或“修饰关系”,它们通过大量样本中的预测结果慢慢学出适合当前任务的表示方式。

Transformer Q K V 三组可学习参数矩阵的示意图
Q、K、V 的参数矩阵

输入表示通过三组可学习矩阵投影成 Query、Key 和 Value。

一次训练样本怎样产生反馈

训练时,源序列和目标序列经过模型,解码器在各个位置输出词表概率。交叉熵把这些概率与真实目标词比较,得到损失。若某个位置没有正确利用上下文,预测概率就可能偏低,损失会把这份误差信号传回模型内部。

误差不会只停在输出层。它会沿着输出投影、解码器 FFN、交叉注意力、掩码自注意力和编码器逐层传递。参与注意力计算的 Q、K、V 投影矩阵也会获得更新方向,下一次面对相似上下文时,可能形成更合适的相关性分数。

Transformer 损失通过梯度反馈更新注意力参数的示意图
从损失反馈到注意力参数

输出损失通过反向传播回到注意力投影矩阵,推动 Q、K、V 表示逐步调整。

Q 和 K 学会了什么

Q 和 K 共同决定位置之间的匹配分数。训练过程中,如果某类关系有助于预测目标,模型就会调整投影,使相关位置在 QK 点积空间中更容易匹配;如果某些位置经常带来干扰,模型可能降低它们的相似度。

这不是给每个词分配固定的关注对象。同一个词在不同句子、不同层或不同头中,经过上下文加工后的表示不同,Q 和 K 的匹配结果也会变化。模型学习的是一套根据表示动态判断相关性的参数,而不是一张固定的关系表。

V 学会了传递什么

Key 主要参与匹配,Value 主要参与信息汇总。训练会推动 Value 投影保留那些对后续预测有帮助的特征,并让被高权重读取的位置能够提供更合适的内容。

同一个位置的 Key 和 Value 可以承担不同作用:Key 让它容易或不容易被当前 Query 找到,Value 则决定被找到后能带回什么。Q、K、V 分工后,模型可以同时学习“应该读谁”和“读回来什么”。

为什么一个头可能形成某种关注倾向

多头注意力为每个头提供独立的投影参数。某个头在训练中如果更频繁地通过相邻关系帮助预测,参数就可能形成偏向近距离的模式;另一个头可能在长距离指代或句法联系上获得更多有效反馈。

这些倾向是结果,不是预先分配的职责。一个头也可能在不同层、不同样本中表现不同。注意力权重可以帮助观察模式,但要结合模型输出和多层计算,不能把某次高权重直接等同于固定功能。

参数更新为什么需要稳定的步幅

每次训练都会根据梯度更新参数。如果步幅太大,Q、K 的分数可能突然变得极端,Softmax 过早饱和;如果步幅太小,模型又可能很久学不到有用的关注关系。学习率、缩放点积、LayerNorm 和残差连接共同影响更新是否稳定。

参数更新不是每看到一个样本就把矩阵改成样本的关系图,而是在许多样本的梯度中逐步寻找更有用的方向。单个例子的关注模式可能有噪声,训练过程需要通过批次和多次更新提炼出可泛化的关系。

Transformer 注意力参数通过梯度和学习率逐步更新的示意图
注意力参数的逐步更新

训练通过损失、梯度和学习率反复调整注意力参数,而不是一次写入固定关系。

为什么训练样本要足够多样

如果训练数据只出现一种固定表达,注意力参数可能只学会适应这种局部模式。样本覆盖更多词序、指代、长度和任务情况,模型才有机会区分哪些关系稳定有用,哪些只是偶然共现。

注意力参数最终服务的是预测目标,而不是单独追求某张好看的热力图。某个关系是否被学到,要看它能否在不同上下文中帮助形成更好的隐藏表示和输出概率。

把注意力学习过程串起来

输入表示先经过 Q、K、V 投影,Q 和 K 形成相关性分数,Softmax 得到权重,Value 被加权汇总并用于预测。损失衡量预测与目标的差距,梯度沿着这条计算路径返回,更新投影矩阵和其他参数。

经过许多样本和许多轮更新,模型逐渐形成能支持任务的关注模式。所谓模型学会关注关系,本质上是参数学会把有用的上下文映射到更合适的匹配分数和信息汇总结果。

常见问题

注意力矩阵是人工标注出来的吗?

通常不是。Q、K、V 投影矩阵通过训练学习,注意力权重是模型根据当前输入和参数计算出来的。

一个注意力头的功能是预先规定的吗?

不是。不同头可能在训练中形成不同倾向,但具体模式由数据、层次、参数和任务共同决定。

损失如何影响 Q 和 K?

输出损失通过反向传播返回到产生 Q、K 的投影矩阵,调整它们,使有助于目标预测的位置更容易形成合适的匹配分数。