大模型原理游戏课:模型工坊 16 关 · 第 15 课 / 共 16 课 ↗ AI 教程
15|从补全器到助手:指令微调、偏好与对话模板
区分基础能力与行为对齐,理解角色 token 和偏好目标。
↗ 1 阅读
LESSON BRIEFING15 / 16
第 15 / 16 关
塑造助手人格
用指令数据、偏好优化与对话模板把补全文本的模型改造成助手。
62系统稳定度
能力与行为是两个轴:会做不等于会按要求做。
CHECKPOINT
对话模板的作用是什么?
区分基础能力与行为对齐,理解角色 token 和偏好目标。
预训练模型擅长续写互联网上“可能接下来出现的文本”,却不天然知道要简洁回答、拒绝危险请求或遵循工具协议。后训练重新塑造的是行为分布。
先建立整机直觉
不要先背术语。先问三个工程问题:这一阶段接收什么形状的数据、做了哪一种变换、结果交给谁。只要数据流清楚,公式就不再是孤立符号。
核心机械结构
- 监督式指令微调用高质量“指令—回答”样本教授格式、语气和任务跟随。
- 偏好优化比较候选回答,让模型更倾向被选择的行为;奖励设计不完整会产生讨好、冗长或钻规则空子。
- 对话模板把 system、user、assistant、tool 等角色编码为训练时熟悉的特殊 token 序列。
跟着一个例子走
同一句“写一个文件”,基础模型可能继续补全教程文本;经过指令与工具训练的模型会先识别动作、参数和权限,再输出结构化调用或解释不能执行的原因。
阅读例子时,把“固定权重”和“本次请求产生的激活”分别标记。前者在训练后保存,后者会随输入变化;混淆两者会导致对记忆、隐私和性能的错误判断。
容易掉进的坑
对齐不是把事实全部写进模型,也不保证永远听话或安全。它改变倾向,需要与运行时权限、验证和人工确认共同工作。
动手工坊
- 把一段对话展开成带角色边界的 token 模板。
- 写三组偏好对,检查奖励是否误把“更长”当成“更好”。
- 为高风险工具设计模型行为规则和确定性权限门的分工。
完成后不要只保存结果。记录输入、参数、观察和结论,换一组输入重复实验。一个现象只有在可重复时才是证据。
检查点
你应能区分“模型会不会做”和“模型倾向怎样回应”。
回到页面上方的互动任务,调节两个控制量并完成选择题。答对后,本关会在浏览器中记为完成并获得 XP。
参考与延伸
- https://mlx.void.app/zh
- https://arxiv.org/abs/2203.02155
本课程为 aiHubHub 原创改写。外部站点只用于核对概念范围与交互启发,正文、例子、练习和界面均重新设计。