aaihubhub
大模型原理游戏课:模型工坊 16 关 · 第 1 课 / 共 16 课 ↗ AI 教程

01|预测引擎:大模型每次究竟算出了什么

从一次前向传播到完整生成循环,拆掉“模型一次写出整段话”的错觉。

author
↗ 3 阅读
LESSON BRIEFING01 / 16
第 1 / 16 关

启动预测引擎

调节上下文信号与随机噪声,观察稳定预测需要什么条件。

先让有效信号明显高于噪声。

CHECKPOINT

一次前向传播真正输出什么?

从一次前向传播到完整生成循环,拆掉“模型一次写出整段话”的错觉。

你进入模型工坊的第一间控制室。屏幕上没有“答案”按钮,只有一张长到看不见尽头的候选表:每个 token 后面跟着一个分数。模型的单次工作就是更新这张表;句子则由同一台机器反复运行得到。

先建立整机直觉

不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。

核心机械结构

  • 提示词先变成 token id 序列,模型为序列最后一个位置计算隐藏状态。
  • LM head 把隐藏状态投影成词表宽度的 logits;softmax 再把相对分数转换成概率。
  • 采样器选出一个 token,追加到序列末尾,新的序列重新进入模型。停止词或长度上限结束循环。

跟着一个例子走

假设玩具词表只有“猫、狗、睡、跑、。”五项,logits 分别是 2.1、0.8、1.5、0.2、-0.3。softmax 不会改变排名,却会把分差变成总和为 1 的概率。采样“睡”之后,下一轮输入不再是原提示词,而是“原提示词+睡”。

阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。

容易掉进的坑

“模型先在脑中写完整篇文章再逐字吐出”是错误比喻。它可能在上下文里形成计划,但底层解码仍是一轮一个 token。局部选择会改变后续条件,因此早期偏差可能逐步放大。

动手工坊

  1. 手写一个五项 logits 数组,减去最大值后计算 softmax,观察数值稳定性。
  2. 分别用贪心选择与按概率抽样运行十轮,记录两种策略的重复性。
  3. 画出 tokenize → model → logits → sample → append 的循环,并标注每一步的数据形状。

完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。

检查点

你应能只用一句话解释:一次前向传播输出的是候选分数,而一段文字来自循环。

回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。

参考与延伸

  • https://mlx.void.app/zh
  • https://arxiv.org/abs/2505.09388

本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。