← 返回概念解读

Concept Fable精修版

数据混合

Data Mixing · Training

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

药铺配方里的药材比例

南城药铺有一口大药锅,专给学徒练辨方。师傅把山里草药、海边贝壳、城中常见丸散和几味罕见毒草的样本都放进库里,让学徒每日照方辨认。

最初,师傅贪图省事,把最多的感冒方和跌打方成筐倒进来。学徒练得很快,普通客人一来,他能马上抓药。可一遇到少见症状,他不是认不出,就是把罕见毒草当成普通清热药,险些闯祸。师傅第一次只看总体答对率,普通方占多数,数字很好看。直到罕见毒草出错,他才发现少数但高风险的样本被平均数遮住了。

有人建议把稀奇药材全倒进去。几个月后又出新问题:学徒天天背怪方,连最常见的咳嗽寒热也拿不准。药铺看似见识广了,真正上柜反而不稳。

师傅这才重排药库。他按来客的真实比例放常见方,又给风险高、代价大的药材留出固定练习位;太相似的药要隔日对照,太罕见但关键的药要加重考核。每次练完,还看学徒在哪类方上常错,再调整下一批样本。重排药库也不是一次完成。入冬后咳喘客人增加,春天湿疹多起来;若药锅比例不随季节动,学徒手感又会偏。

学徒发现,药锅里的材料不是越多越好,也不是越稀奇越好。材料的来源、比例、重复次数和难度会共同塑造他的手感。某一味药放多了,其他味道就被盖住;某一类病从未出现,他上柜时就会盲。有些来源还会互相打架。城中丸散写法整齐,山里草药叫法混乱,若不清洗和标注,学徒会把差异当成药性。

药铺最后留下规矩:配练习药,不是在仓库里随手抓一把,而是在各种来源之间调秤。秤调得对,学徒才既不偏科,也不被少数热闹样本带歪。

揭示

这个故事讲的是:数据混合

数据混合是在预训练或微调中按比例组合不同数据源的策略。代码、数学、中文、安全、客服、行业文档等数据占比不同,模型最终擅长的能力和形成的偏差也会不同。

所以它不是简单地“数据越多越好”。企业继续训练时,要把数据来源、采样权重、过量和不足的风险都纳入评测,用结果反过来调配比例。

隐喻映射

  • 不同原料=不同数据源
  • 配方比例=采样权重和数据混合比例
  • 某味过重=某类能力或偏差被放大
  • 试味=评测反馈
  • 重调配方=根据评测调整数据比例

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

pre-trainingdata curationdomain weights