大模型原理游戏课:模型工坊 16 关 · 第 7 课 / 共 16 课 ↗ AI 教程
07|RMSNorm 稳压器:深层网络如何控制尺度
理解均方根归一化、可学习缩放与 pre-norm 残差结构。
↗ 3 阅读
LESSON BRIEFING07 / 16
第 7 / 16 关
稳定激活水位
把向量尺度拉回稳定范围,避免深层传播失控。
62系统稳定度
稳定不等于把所有维度变成相同数值。
CHECKPOINT
RMSNorm 使用什么量归一化?
理解均方根归一化、可学习缩放与 pre-norm 残差结构。
激活穿过几十层后,尺度可能像电压一样漂移:过大让数值和梯度失控,过小让信号消失。RMSNorm 在每个子层入口校准向量能量。
先建立整机直觉
不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。
核心机械结构
- 先计算向量各维平方的平均,再开方得到 RMS,并用它除原向量。
- 一个很小的 epsilon 防止接近零时除法不稳定;可学习 gain 让网络重新调整每个维度的尺度。
- RMSNorm 不减均值,比 LayerNorm 更简洁;许多现代 LLM 在注意力和 MLP 前使用 pre-norm。
跟着一个例子走
向量 (3,4) 的 RMS 是 √((9+16)/2)≈3.54,归一化后约为 (0.85,1.13)。方向大体保留,整体尺度被拉到稳定范围。
阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。
容易掉进的坑
归一化不是把所有 token 或所有维度变成同一个值,也不是删除有用幅度。它提供参考尺度,后续可学习参数和残差仍能表达差异。
动手工坊
- 手算三个向量的 RMSNorm,并检查归一化后均方值。
- 把输入整体放大 10 倍,观察归一化结果为何接近不变。
- 画出 pre-norm 块:x → norm → sublayer → +x。
完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。
检查点
你应能说明 RMSNorm 稳定的是尺度,而不是语义内容。
回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。
参考与延伸
- https://mlx.void.app/zh
- https://arxiv.org/abs/1910.07467
本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。