aaihubhub
大模型原理游戏课:模型工坊 16 关 · 第 16 课 / 共 16 课 ↗ AI 教程

16|端到端远征:拼回完整模型并看清边界

把数据形状、计算阶段、速度瓶颈和可靠性风险连接成一张系统图。

author
↗ 5 阅读
LESSON BRIEFING16 / 16
第 16 / 16 关

完成端到端远征

从文本到 token、层堆叠、logit 和采样,追踪完整闭环与能力边界。

把每个组件放回闭环,才能判断故障发生在哪一层。

CHECKPOINT

生成循环的正确顺序是?

把数据形状、计算阶段、速度瓶颈和可靠性风险连接成一张系统图。

最终关不是再学一个零件,而是把所有零件放回同一条生产线:文本进入,token 化与嵌入建立初始状态,多层读取和加工,LM head 评分,采样追加,再带着缓存进入下一轮。

先建立整机直觉

不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。

核心机械结构

  • prefill 的主要工作随提示词长度增长,可并行处理多个位置;decode 依赖上一轮 token,延迟更受内存带宽和缓存读取影响。
  • 参数是跨请求共享的固定权重;激活和 KV cache 属于当前请求,不应被误认为模型长期记忆。
  • 输出可靠性还取决于数据、提示、检索、解码、工具、验证和权限,模型架构只是系统的一层。

跟着一个例子走

一次问答可能经历:1200 token 提示词 prefill → 生成 180 token decode → 工具检索两次 → 引用校验。优化只盯模型每秒 token,可能忽略检索延迟、错误重试和未经验证的答案。

阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。

容易掉进的坑

参数更多、上下文更长、采样更确定都不能单独保证正确。真实系统需要把不确定性暴露出来,用证据、评估、护栏和可观测性管理失败。

动手工坊

  1. 为一次完整请求画时序图,标出 CPU、GPU、网络和人工确认。
  2. 给每一阶段写一个性能指标和一个正确性指标。
  3. 设计毕业挑战:用玩具 tokenizer、嵌入、单头注意力和采样器跑通最小生成,并写出它与真实模型的差距。

完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。

检查点

你已能从任意故障现象反向定位:是输入、表示、层计算、解码,还是模型外系统。

回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。

参考与延伸

  • https://mlx.void.app/zh
  • https://arxiv.org/abs/1706.03762
  • https://arxiv.org/abs/2505.09388

本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。