大模型原理游戏课:模型工坊 16 关 · 第 11 课 / 共 16 课 ↗ AI 教程
11|采样骰子:在稳定、创造与风险之间取舍
操作 temperature、top-k、top-p 与重复惩罚,建立任务型解码策略。
↗ 3 阅读
LESSON BRIEFING11 / 16
第 11 / 16 关
驯服采样骰子
在确定性与多样性之间调温度,并用 top-p 限制候选集合。
62系统稳定度
随机性不是越高越好,要与任务风险匹配。
CHECKPOINT
升高 temperature 通常会怎样?
操作 temperature、top-k、top-p 与重复惩罚,建立任务型解码策略。
logits 给出候选地形,采样策略决定怎么走。写代码、抽取字段和创意写作需要不同风险偏好;不存在一组对所有任务都最佳的旋钮。
先建立整机直觉
不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。
核心机械结构
- temperature 用 logits 除以温度:低温拉大相对差距,高温压平分布。
- top-k 只保留最高的 k 项;top-p 从高到低累加概率,保留达到阈值的最小集合。
- 重复惩罚与停止条件改变候选或终止循环,但过强会破坏必要术语和结构。
跟着一个例子走
若概率为 0.55、0.25、0.12、0.05、0.03,top-p=0.8 会保留前三项,因为前两项刚好 0.80 时实现细节可能含边界项;应测试所用库的精确定义。
阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。
容易掉进的坑
温度 0 不意味着模型获得真理,只意味着更确定地选择当前最高分。最高分仍可能建立在错误知识或不完整上下文上。
动手工坊
- 对同一 logits 使用温度 0.5、1.0、1.5,比较熵和头部概率。
- 为 JSON 生成、客服回答、故事创作分别写一套解码配置及理由。
- 构造重复循环,逐步加入停止词和重复惩罚,观察副作用。
完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。
检查点
你应能根据任务风险解释解码参数,而不是只说“调高更有创意”。
回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。
参考与延伸
- https://mlx.void.app/zh
- https://huggingface.co/docs/transformers/main_classes/text_generation
本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。