大模型原理游戏课:模型工坊 16 关 · 第 16 课 / 共 16 课 ↗ AI 教程
16|端到端远征:拼回完整模型并看清边界
把数据形状、计算阶段、速度瓶颈和可靠性风险连接成一张系统图。
↗ 5 阅读
LESSON BRIEFING16 / 16
第 16 / 16 关
完成端到端远征
从文本到 token、层堆叠、logit 和采样,追踪完整闭环与能力边界。
62系统稳定度
把每个组件放回闭环,才能判断故障发生在哪一层。
CHECKPOINT
生成循环的正确顺序是?
把数据形状、计算阶段、速度瓶颈和可靠性风险连接成一张系统图。
最终关不是再学一个零件,而是把所有零件放回同一条生产线:文本进入,token 化与嵌入建立初始状态,多层读取和加工,LM head 评分,采样追加,再带着缓存进入下一轮。
先建立整机直觉
不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。
核心机械结构
- prefill 的主要工作随提示词长度增长,可并行处理多个位置;decode 依赖上一轮 token,延迟更受内存带宽和缓存读取影响。
- 参数是跨请求共享的固定权重;激活和 KV cache 属于当前请求,不应被误认为模型长期记忆。
- 输出可靠性还取决于数据、提示、检索、解码、工具、验证和权限,模型架构只是系统的一层。
跟着一个例子走
一次问答可能经历:1200 token 提示词 prefill → 生成 180 token decode → 工具检索两次 → 引用校验。优化只盯模型每秒 token,可能忽略检索延迟、错误重试和未经验证的答案。
阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。
容易掉进的坑
参数更多、上下文更长、采样更确定都不能单独保证正确。真实系统需要把不确定性暴露出来,用证据、评估、护栏和可观测性管理失败。
动手工坊
- 为一次完整请求画时序图,标出 CPU、GPU、网络和人工确认。
- 给每一阶段写一个性能指标和一个正确性指标。
- 设计毕业挑战:用玩具 tokenizer、嵌入、单头注意力和采样器跑通最小生成,并写出它与真实模型的差距。
完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。
检查点
你已能从任意故障现象反向定位:是输入、表示、层计算、解码,还是模型外系统。
回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。
参考与延伸
- https://mlx.void.app/zh
- https://arxiv.org/abs/1706.03762
- https://arxiv.org/abs/2505.09388
本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。