大模型原理游戏课:模型工坊 16 关 · 第 3 课 / 共 16 课 ↗ AI 教程
03|嵌入坐标:编号怎样获得可计算的含义
把查表、向量空间、相似性和上下文激活区分开。
↗ 1 阅读
LESSON BRIEFING03 / 16
第 3 / 16 关
点亮向量坐标
让 token 从编号变成可以计算相似性与方向的向量。
62系统稳定度
向量不是词典释义,而是训练中形成的坐标。
CHECKPOINT
嵌入层的主要作用是什么?
把查表、向量空间、相似性和上下文激活区分开。
token id 只是仓库货号,数字 42 并不比 41 更“接近”。嵌入矩阵为每个货号保存一行向量,让后续层能通过方向、距离和线性组合处理模式。
先建立整机直觉
不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。
核心机械结构
- 嵌入层本质是按 token id 从形状为 vocab_size × hidden_size 的矩阵取行。
- 这些向量通过下一个 token 训练目标共同更新;相似用法常形成相近方向,但不存在人工规定的语义坐标轴。
- 初始嵌入是静态起点。经过注意力和 MLP 后,同一个 token 在不同句子里会得到不同的上下文化激活。
跟着一个例子走
“bank”在“river bank”和“bank account”中查到同一初始向量,但与周围 token 交互后走向不同隐藏状态。PCA 图只是把高维结构压到二维的投影,重叠或远近都可能被投影扭曲。
阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。
容易掉进的坑
不能把嵌入向量当作可逐维翻译的词典释义,也不能因为二维散点相近就断言模型理解了同一种概念。
动手工坊
- 用一个 8×4 的玩具嵌入矩阵按 id 查表,写出批次和序列维度。
- 计算三个向量的余弦相似度,并比较它与欧氏距离关注的差异。
- 为一词多义设计两句上下文,解释为何静态嵌入相同、最终激活不同。
完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。
检查点
你应能区分 token id、初始嵌入和上下文化隐藏状态。
回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。
参考与延伸
- https://mlx.void.app/zh
- https://arxiv.org/abs/1706.03762
本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。