aaihubhub
大模型原理游戏课:模型工坊 16 关 · 第 14 课 / 共 16 课 ↗ AI 教程

14|收敛航线:预热、衰减、裁剪与正则化

把训练稳定技巧放回优化动态,避免把旋钮当成魔法。

author
↗ 5 阅读
LESSON BRIEFING14 / 16
第 14 / 16 关

守住收敛航线

组合预热、衰减、梯度裁剪与权重衰减,让大规模训练更稳定。

稳定技巧解决的是优化问题,不会替代高质量数据。

CHECKPOINT

梯度裁剪主要防止什么?

把训练稳定技巧放回优化动态,避免把旋钮当成魔法。

数十亿参数一起更新时,错误的步幅会让训练像重载飞船偏离航线。稳定训练不是一个开关,而是学习率、批次、精度、梯度和数据共同形成的控制系统。

先建立整机直觉

不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。

核心机械结构

  • 预热从小学习率起步,避免随机初始化阶段的大更新;随后余弦等调度逐渐降低步幅。
  • 梯度裁剪限制异常大的全局范数;权重衰减抑制参数无限增长。
  • 混合精度提高吞吐并节省显存,但缩放和累积必须处理上溢、下溢与舍入误差。

跟着一个例子走

若全局梯度范数为 20、裁剪阈值为 5,则所有梯度统一乘 0.25,方向保持、整体步幅受限。逐元素截断会扭曲方向,通常不是同一件事。

阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。

容易掉进的坑

训练 loss 持续下降不代表模型更有用。可能出现验证退化、数据记忆、能力偏科或安全回归,必须同时观察独立评估。

动手工坊

  1. 画出预热+余弦衰减曲线,并标出三个训练阶段。
  2. 手算全局范数裁剪比例,比较逐元素裁剪。
  3. 设计一个含训练 loss、验证 loss、吞吐、梯度范数和下游任务的监控面板。

完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。

检查点

你应能把每项稳定技巧对应到它控制的失败模式。

回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。

参考与延伸

  • https://mlx.void.app/zh
  • https://arxiv.org/abs/1711.05101

本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。