Transformer 的 QKV 详解

一句话版

Q 是”我要找什么”,K 是”我有什么”,V 是”我给出的内容”。

注意力机制 = 拿 Q 去和所有 K 算相似度,得到权重,再用权重去加权求和 V。

三个角色的类比

想象一场面试:

面试过程:用 Q(岗位需求)去对比每个 K(简历标签),打分高的候选人权重高,最后综合他们的 V(实际能力)得出结论。

公式

Attention(Q, K, V) = softmax(QKᵀ / √d_k) · V
  1. Q 与所有 K 做点积 → 相似度分数
  2. 除以 √d_k 缩放,防止点积过大导致 softmax 梯度消失
  3. softmax 归一化成权重
  4. 权重乘 V 加权求和 → 输出

在 Transformer 里的位置

这就是 [[Transformer QKV|Transformer 双链]] 的姊妹篇示例,验证双链在本站生效。


← 返回博客列表