大模型原理游戏课:模型工坊 16 关 · 第 1 课 / 共 16 课 ↗ AI 教程
01|预测引擎:大模型每次究竟算出了什么
从一次前向传播到完整生成循环,拆掉“模型一次写出整段话”的错觉。
↗ 3 阅读
LESSON BRIEFING01 / 16
第 1 / 16 关
启动预测引擎
调节上下文信号与随机噪声,观察稳定预测需要什么条件。
62系统稳定度
先让有效信号明显高于噪声。
CHECKPOINT
一次前向传播真正输出什么?
从一次前向传播到完整生成循环,拆掉“模型一次写出整段话”的错觉。
你进入模型工坊的第一间控制室。屏幕上没有“答案”按钮,只有一张长到看不见尽头的候选表:每个 token 后面跟着一个分数。模型的单次工作就是更新这张表;句子则由同一台机器反复运行得到。
先建立整机直觉
不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。
核心机械结构
- 提示词先变成 token id 序列,模型为序列最后一个位置计算隐藏状态。
- LM head 把隐藏状态投影成词表宽度的 logits;softmax 再把相对分数转换成概率。
- 采样器选出一个 token,追加到序列末尾,新的序列重新进入模型。停止词或长度上限结束循环。
跟着一个例子走
假设玩具词表只有“猫、狗、睡、跑、。”五项,logits 分别是 2.1、0.8、1.5、0.2、-0.3。softmax 不会改变排名,却会把分差变成总和为 1 的概率。采样“睡”之后,下一轮输入不再是原提示词,而是“原提示词+睡”。
阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。
容易掉进的坑
“模型先在脑中写完整篇文章再逐字吐出”是错误比喻。它可能在上下文里形成计划,但底层解码仍是一轮一个 token。局部选择会改变后续条件,因此早期偏差可能逐步放大。
动手工坊
- 手写一个五项 logits 数组,减去最大值后计算 softmax,观察数值稳定性。
- 分别用贪心选择与按概率抽样运行十轮,记录两种策略的重复性。
- 画出 tokenize → model → logits → sample → append 的循环,并标注每一步的数据形状。
完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。
检查点
你应能只用一句话解释:一次前向传播输出的是候选分数,而一段文字来自循环。
回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。
参考与延伸
- https://mlx.void.app/zh
- https://arxiv.org/abs/2505.09388
本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。