大模型原理游戏课:模型工坊 16 关 · 第 4 课 / 共 16 课 ↗ AI 教程
04|注意力雷达:每个位置怎样读取其他位置
亲手走过 Q、K、V、因果遮罩与加权汇总。
↗ 4 阅读
LESSON BRIEFING04 / 16
第 4 / 16 关
搭建注意力雷达
让当前位置按相关性读取其他位置的信息。
62系统稳定度
提高匹配、压低干扰,观察聚合信号。
CHECKPOINT
注意力权重由什么决定?
亲手走过 Q、K、V、因果遮罩与加权汇总。
注意力不是一团神秘的“关注”。它是一条明确的数据管线:当前位置发出查询,所有可见位置提供键和值,查询与键决定读取权重,值则携带被读取的内容。
先建立整机直觉
不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。
核心机械结构
- 隐藏状态分别乘以 Wq、Wk、Wv 得到查询、键和值。QKᵀ 产生位置两两之间的匹配分数。
- 分数除以 √d 防止维度升高时点积过大;因果遮罩把未来位置设为不可见。
- softmax 把每行分数变成权重,再与 V 相乘得到按相关性汇总的新表示。
跟着一个例子走
在“机器没有更新它,因为它离线了”中,最后一个“它”的查询可能同时匹配“机器”和其他名词。注意力提供候选线索,最终指代还要经过多层、多头和 MLP 共同处理,并非某一张热力图独自决定。
阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。
容易掉进的坑
注意力权重不是解释模型因果推理的完整证据。高权重代表这一步读取较多,并不等于该 token 是最终结论的唯一原因。
动手工坊
- 为三个 token 写 2 维 Q、K、V,手算缩放点积和 softmax。
- 加入上三角因果遮罩,验证第一个位置不能读取后文。
- 把一个匹配分数提高一倍,观察归一化后其他权重如何联动下降。
完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。
检查点
你应能从张量形状解释 softmax(QKᵀ/√d)V 的每一段。
回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。
参考与延伸
- https://mlx.void.app/zh
- https://arxiv.org/abs/1706.03762
本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。