← 返回概念解读

Concept Fable精修版

指令微调

Instruction Tuning · Fine-Tuning

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

学徒终于听懂了任务牌

百草堂有个学徒,药书背得极熟。客人问“黄芪有什么用”,他能滔滔不绝;可客人说“帮我把这三味药按早晚分成服用说明”,他仍从药性讲起。掌柜发现,他有知识,却不会接任务。

掌柜先让他多背药书。学徒知道得更多,答得更长,却更常偏题。有人要比较两张方子的差别,他讲成两篇药材介绍;有人问禁忌,他给出进补建议。

于是掌柜做了一叠任务牌。牌上写着不同请求:请比较、请摘出要点、请按格式写、请拒绝越权、请说明依据。每张牌背后都有合格样子,也标明哪些话不能说。

学徒每天练牌。掌柜不再只问他知不知道药材,而是看他能否听懂客人要的动作:是提取、排序、改写、判断,还是礼貌拒绝。答错时,掌柜让他回看指令,而不是继续背书。

几个月后,来了新问题:“把这张药单整理给老人家看,字要少,提醒饭后。”学徒没有见过同一张牌,却能照任务意图组织回答。他仍靠药书,但交付方式变了。

掌柜先以为学徒缺礼貌,便让他背客套话。学徒开头更周全,后面仍跑偏。客人要‘写成三行给老人看’,他还是讲成药理长文;客人要‘列出不能同服的’,他却热情推荐补药。

后来掌柜不再只考药书,而是拿真实请求训练他:改写、比较、列步骤、拒绝不安全用法、按老人能懂的话解释。每次答偏,掌柜指出客人真正要完成的事。学徒慢慢学会听指令的形状,把已有知识按任务交出去,而不是把知道的东西全倒出来。

百草堂从此少了聪明却不听话的长篇,多了能按请求办事的答复。掌柜明白,知识让人有材料,听指令的训练让材料变成别人要的结果。

揭示

这个故事讲的是:指令微调

Instruction Tuning 是用大量“指令-响应”样例训练模型,使模型更会理解人类任务要求并按指令输出。它让基础模型从单纯预测文本,转向更适合问答、摘要、改写、分类、格式化输出、拒绝不当请求和工具前置判断等交互场景。企业 Agent 中,指令微调能提升任务遵循度,但仍依赖高质量指令数据、覆盖面和严格评测。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 聪明学徒:预训练语言模型
  • 厚铺规:运行时提示词和规则堆叠
  • 任务牌:instruction-response 数据
  • 请比较、请提取、请拒绝:常见指令类型
  • 按要求响应:instruction following 能力
  • 不是写死未来问题:训练可泛化的指令遵循习惯
  • 最后洞察:Instruction Tuning 让模型更像能接任务的助手,而不只是会续写文本的机器

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

SFTchat modelinstruction followingalignment

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。