大模型原理游戏课:模型工坊 16 关 · 第 14 课 / 共 16 课 ↗ AI 教程
14|收敛航线:预热、衰减、裁剪与正则化
把训练稳定技巧放回优化动态,避免把旋钮当成魔法。
↗ 5 阅读
LESSON BRIEFING14 / 16
第 14 / 16 关
守住收敛航线
组合预热、衰减、梯度裁剪与权重衰减,让大规模训练更稳定。
62系统稳定度
稳定技巧解决的是优化问题,不会替代高质量数据。
CHECKPOINT
梯度裁剪主要防止什么?
把训练稳定技巧放回优化动态,避免把旋钮当成魔法。
数十亿参数一起更新时,错误的步幅会让训练像重载飞船偏离航线。稳定训练不是一个开关,而是学习率、批次、精度、梯度和数据共同形成的控制系统。
先建立整机直觉
不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。
核心机械结构
- 预热从小学习率起步,避免随机初始化阶段的大更新;随后余弦等调度逐渐降低步幅。
- 梯度裁剪限制异常大的全局范数;权重衰减抑制参数无限增长。
- 混合精度提高吞吐并节省显存,但缩放和累积必须处理上溢、下溢与舍入误差。
跟着一个例子走
若全局梯度范数为 20、裁剪阈值为 5,则所有梯度统一乘 0.25,方向保持、整体步幅受限。逐元素截断会扭曲方向,通常不是同一件事。
阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。
容易掉进的坑
训练 loss 持续下降不代表模型更有用。可能出现验证退化、数据记忆、能力偏科或安全回归,必须同时观察独立评估。
动手工坊
- 画出预热+余弦衰减曲线,并标出三个训练阶段。
- 手算全局范数裁剪比例,比较逐元素裁剪。
- 设计一个含训练 loss、验证 loss、吞吐、梯度范数和下游任务的监控面板。
完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。
检查点
你应能把每项稳定技巧对应到它控制的失败模式。
回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。
参考与延伸
- https://mlx.void.app/zh
- https://arxiv.org/abs/1711.05101
本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。