← 返回概念解读

Concept Fable精修版

监督微调

Supervised Fine-Tuning, SFT · Fine-Tuning

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

照着标准答案练出的柜台手艺

城南有家票据行,新伙计会读账本,却不会按票据行的标准处理客户请求。掌柜需要的是稳定交付,不是偶尔灵光。

一开始,师傅只让伙计看大量旧账。伙计知道很多交易故事,却仍然把退款说明写成催款信,把审批备注写进客户回执。

掌柜又在墙上贴流程图。流程图能提醒人,但不能保证每次输出都长成合格票据。

于是老账房拿出一叠训练册。每页左边是真实客户请求,右边是资深员工写出的标准处理结果。

伙计每天照着练。错一个字段,就重写;漏一个风险说明,就补上;语气不符合企业客户,就重新组织。

训练册里的答案必须经过审核。因为伙计会把答案当成该模仿的行为,哪怕答案只是碰巧写得顺。

练成后,伙计面对相似请求时,能更稳定地产生票据行认可的格式、语气和边界。

但掌柜没有因此取消抽检。标准答案覆盖不到所有例外,训练也可能让伙计在新场景中过度自信。票据行最后形成一条规矩:先用可信样例教会基本动作,再用评测和上线监控确认它在真实柜台上没有走偏。后来,又来了一件更棘手的活。表面看只是旧问题放大,实际把藏在流程里的缝隙都逼了出来:谁先接手、谁能改动、出了错怎样回到上一步,过去靠熟人默契混过去的地方,现在都必须说清楚。主事人没有再催大家更用心,而是把现场重新走了一遍。他让人记录每次交接、每次失败和每次补救,哪些地方只是慢,哪些地方会误伤结果,哪些地方一旦错了就很难追回。新规矩推开后,最初几天并不顺手。有人嫌多了一道检查,有人觉得旧经验被冒犯。可当下一次异常出现时,大家第一次能沿着痕迹找到问题发生的位置,而不是围着结果互相猜。

揭示

这个故事讲的是:监督微调

Supervised Fine-Tuning, SFT 是用带有目标输出的标注样例训练模型,让模型学习在给定输入下生成期望响应。SFT 常用于 instruction tuning、领域问答、格式化输出、客服话术、代码风格和工具调用轨迹学习。它的核心风险在于训练数据质量、覆盖面、标签一致性和过拟合;在 RLHF、DPO 等偏好优化之前,SFT 通常是建立基础行为的第一步。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 客户请求:训练输入
  • 资深员工标准处理结果:监督标签 / target response
  • 照着练:最大似然式监督微调
  • 审核训练册:数据清洗和标签质量控制
  • 格式、语气和边界:SFT 学到的任务行为
  • 抽检:离线评测和上线监控
  • 最后洞察:SFT 用明确示范先教会模型“该怎么做”

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

instruction tuningdemonstrationsalignmentpreference tuning

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。