aaihubhub
大模型原理游戏课:模型工坊 16 关 · 第 13 课 / 共 16 课 ↗ AI 教程

13|训练预测学徒:teacher forcing 与交叉熵

从移位标签、并行预测到反向传播,理解权重怎样被数据塑造。

author
↗ 6 阅读
LESSON BRIEFING13 / 16
第 13 / 16 关

训练预测学徒

并行预测序列各位置的下一个 token,用交叉熵推动权重更新。

teacher forcing 训练时看真实前缀,推理时看自身输出。

CHECKPOINT

交叉熵训练比较的是什么?

从移位标签、并行预测到反向传播,理解权重怎样被数据塑造。

推理一次只生成一个 token,训练却可以把一段文本的每个位置同时变成练习题:看到此前 token,预测右边那个真实 token。

先建立整机直觉

不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。

核心机械结构

  • 输入序列和标签序列相差一个位置;因果遮罩保证位置 i 看不到答案 i+1。
  • 所有位置的 logits 与真实 token 计算交叉熵,批次平均形成 loss。
  • 自动微分沿计算图求梯度,优化器根据学习率更新嵌入、注意力、MLP 和输出权重。

跟着一个例子走

文本“A B C D”可产生 A→B、AB→C、ABC→D 三个监督位置,并在一次矩阵计算中并行完成。teacher forcing 使用真实前缀,因此训练状态与自由生成时看到自身错误的状态存在差异。

阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。

容易掉进的坑

模型不是把训练段落原样存进一张可查询数据库。参数会吸收统计模式,也可能记住稀有片段;泛化与记忆同时存在,需要去重、隐私和泄漏评估。

动手工坊

  1. 为长度 6 的 token 序列写出输入、标签和忽略位置。
  2. 手算三分类交叉熵,观察真实类概率下降时 loss 如何上升。
  3. 列出训练数据治理中的许可、隐私、质量、污染四项检查。

完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。

检查点

你应能解释为何训练能并行多个位置,而生成通常逐步进行。

回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。

参考与延伸

  • https://mlx.void.app/zh
  • https://arxiv.org/abs/1706.03762

本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。