aaihubhub
大模型原理游戏课:模型工坊 16 关 · 第 11 课 / 共 16 课 ↗ AI 教程

11|采样骰子:在稳定、创造与风险之间取舍

操作 temperature、top-k、top-p 与重复惩罚,建立任务型解码策略。

author
↗ 3 阅读
LESSON BRIEFING11 / 16
第 11 / 16 关

驯服采样骰子

在确定性与多样性之间调温度,并用 top-p 限制候选集合。

随机性不是越高越好,要与任务风险匹配。

CHECKPOINT

升高 temperature 通常会怎样?

操作 temperature、top-k、top-p 与重复惩罚,建立任务型解码策略。

logits 给出候选地形,采样策略决定怎么走。写代码、抽取字段和创意写作需要不同风险偏好;不存在一组对所有任务都最佳的旋钮。

先建立整机直觉

不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。

核心机械结构

  • temperature 用 logits 除以温度:低温拉大相对差距,高温压平分布。
  • top-k 只保留最高的 k 项;top-p 从高到低累加概率,保留达到阈值的最小集合。
  • 重复惩罚与停止条件改变候选或终止循环,但过强会破坏必要术语和结构。

跟着一个例子走

若概率为 0.55、0.25、0.12、0.05、0.03,top-p=0.8 会保留前三项,因为前两项刚好 0.80 时实现细节可能含边界项;应测试所用库的精确定义。

阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。

容易掉进的坑

温度 0 不意味着模型获得真理,只意味着更确定地选择当前最高分。最高分仍可能建立在错误知识或不完整上下文上。

动手工坊

  1. 对同一 logits 使用温度 0.5、1.0、1.5,比较熵和头部概率。
  2. 为 JSON 生成、客服回答、故事创作分别写一套解码配置及理由。
  3. 构造重复循环,逐步加入停止词和重复惩罚,观察副作用。

完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。

检查点

你应能根据任务风险解释解码参数,而不是只说“调高更有创意”。

回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。

参考与延伸

  • https://mlx.void.app/zh
  • https://huggingface.co/docs/transformers/main_classes/text_generation

本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。