aaihubhub
大模型原理游戏课:模型工坊 16 关 · 第 8 课 / 共 16 课 ↗ AI 教程

08|门控 MLP 工坊:逐位置加工特征

理解扩展维度、SiLU 门控、逐元素乘法与残差回流。

author
↗ 4 阅读
LESSON BRIEFING08 / 16
第 8 / 16 关

开启门控工坊

用逐 token 的非线性变换扩展并筛选特征。

门控让信息通过多少由输入共同决定。

CHECKPOINT

MLP 与注意力的分工更接近哪项?

理解扩展维度、SiLU 门控、逐元素乘法与残差回流。

注意力负责从别的位置取材料,MLP 则像每个位置自己的加工台:扩展特征、非线性筛选、再压回主干宽度。所有位置使用同一套参数,但各自独立加工。

先建立整机直觉

不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。

核心机械结构

  • 两条线性投影分别产生候选内容与门值;SiLU 等激活函数让门具有平滑非线性。
  • 门值与候选内容逐元素相乘,决定哪些特征放大、抑制或翻转。
  • 第三个投影把中间宽度压回 hidden_size,输出通过残差加回原表示。

跟着一个例子走

若某个维度的候选值为 2.0,门值为 0.1,则只留下 0.2;另一个维度门值为 1.4,则可以被增强。门控因此比单纯 ReLU 多一条输入相关的控制通路。

阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。

容易掉进的坑

MLP 并不跨 token 交换信息;它接收到的向量已经包含注意力汇总结果。没有注意力时,逐位置 MLP 无法直接读取远处 token。

动手工坊

  1. 用四维向量手算一轮 gate × value。
  2. 比较 ReLU、GELU 与 SiLU 在负数附近的输出形状。
  3. 估算 hidden=1024、intermediate=4096 时三次线性投影的参数量。

完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。

检查点

你应能把注意力概括为“跨位置混合”,把 MLP 概括为“逐位置变换”。

回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。

参考与延伸

  • https://mlx.void.app/zh
  • https://arxiv.org/abs/2002.05202

本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。