大模型原理游戏课:模型工坊 16 关 · 第 13 课 / 共 16 课 ↗ AI 教程
13|训练预测学徒:teacher forcing 与交叉熵
从移位标签、并行预测到反向传播,理解权重怎样被数据塑造。
↗ 6 阅读
LESSON BRIEFING13 / 16
第 13 / 16 关
训练预测学徒
并行预测序列各位置的下一个 token,用交叉熵推动权重更新。
62系统稳定度
teacher forcing 训练时看真实前缀,推理时看自身输出。
CHECKPOINT
交叉熵训练比较的是什么?
从移位标签、并行预测到反向传播,理解权重怎样被数据塑造。
推理一次只生成一个 token,训练却可以把一段文本的每个位置同时变成练习题:看到此前 token,预测右边那个真实 token。
先建立整机直觉
不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。
核心机械结构
- 输入序列和标签序列相差一个位置;因果遮罩保证位置 i 看不到答案 i+1。
- 所有位置的 logits 与真实 token 计算交叉熵,批次平均形成 loss。
- 自动微分沿计算图求梯度,优化器根据学习率更新嵌入、注意力、MLP 和输出权重。
跟着一个例子走
文本“A B C D”可产生 A→B、AB→C、ABC→D 三个监督位置,并在一次矩阵计算中并行完成。teacher forcing 使用真实前缀,因此训练状态与自由生成时看到自身错误的状态存在差异。
阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。
容易掉进的坑
模型不是把训练段落原样存进一张可查询数据库。参数会吸收统计模式,也可能记住稀有片段;泛化与记忆同时存在,需要去重、隐私和泄漏评估。
动手工坊
- 为长度 6 的 token 序列写出输入、标签和忽略位置。
- 手算三分类交叉熵,观察真实类概率下降时 loss 如何上升。
- 列出训练数据治理中的许可、隐私、质量、污染四项检查。
完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。
检查点
你应能解释为何训练能并行多个位置,而生成通常逐步进行。
回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。
参考与延伸
- https://mlx.void.app/zh
- https://arxiv.org/abs/1706.03762
本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。