Transformer 的 QKV 详解
一句话版
Q 是”我要找什么”,K 是”我有什么”,V 是”我给出的内容”。
注意力机制 = 拿 Q 去和所有 K 算相似度,得到权重,再用权重去加权求和 V。
三个角色的类比
想象一场面试:
- Q(Query,查询):面试官心里在问”谁符合这个岗位?”
- K(Key,键):每个候选人的简历标签,供匹配
- V(Value,值):候选人本人的实际能力
面试过程:用 Q(岗位需求)去对比每个 K(简历标签),打分高的候选人权重高,最后综合他们的 V(实际能力)得出结论。
公式
Attention(Q, K, V) = softmax(QKᵀ / √d_k) · V
Q与所有K做点积 → 相似度分数- 除以
√d_k缩放,防止点积过大导致 softmax 梯度消失 softmax归一化成权重- 权重乘
V加权求和 → 输出
在 Transformer 里的位置
- 自注意力:Q、K、V 都来自同一个序列(自己问自己)
- 交叉注意力:Q 来自解码器,K/V 来自编码器(问别人)
这就是
[[Transformer QKV|Transformer 双链]]的姊妹篇示例,验证双链在本站生效。