← 返回概念解读

Concept Fable精修版

监督学习

Supervised Learning · Machine Learning

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

每张木牌背后的答案

药铺学徒要学认草药。师傅把一百张木牌摆在桌上,每张正面贴着草药样本,背面写着正确名字:薄荷、艾草、紫苏、鱼腥草。

学徒先看正面猜,再翻背面对答案。猜错了,师傅指出叶形、气味、绒毛和颜色哪里看漏。反复练习后,他不只是背下这张木牌,而是学会从特征推断名字。

有天师傅混进几张从没见过的新样本。学徒如果只记住旧木牌的位置,就会失败;如果真学到了叶形和气味的规律,就能猜得接近。

师傅还把木牌分成两堆。一堆用来练习,一堆平时不许看,最后考试。因为如果所有木牌都拿来练,学徒可能只是记住答案,没人知道他遇到新草药能不能认。

后来药铺发现,木牌背面的答案也会出错。错标签会把学徒教歪。于是师傅把难样本交给老药师复核,宁可少一点,也要让答案更可靠。

后来,又来了一件更棘手的活。表面看只是旧问题放大,实际把藏在流程里的缝隙都逼了出来:谁先接手、谁能改动、出了错怎样回到上一步,过去靠熟人默契混过去的地方,现在都必须说清楚。

主事人没有再催大家更用心,而是把现场重新走了一遍。他让人记录每次交接、每次失败和每次补救,哪些地方只是慢,哪些地方会误伤结果,哪些地方一旦错了就很难追回。

新规矩推开后,最初几天并不顺手。有人嫌多了一道检查,有人觉得旧经验被冒犯。可当下一次异常出现时,大家第一次能沿着痕迹找到问题发生的位置,而不是围着结果互相猜。这套办法没有让现场变得神奇,只是让责任、边界和回头路都清楚起来。能自动完成的继续自动完成,需要人判断的地方停下来确认,真正危险的动作不再混在普通动作里一起放行。

揭示

这个故事讲的是:监督学习

模型用带标签的数据训练:每个样本都有输入和对应的正确答案,模型学习从输入预测标签。

监督学习常用于分类、回归和预测。关键要素包括输入、标签、训练集、验证/测试集、损失函数和标签质量。标签不准、数据切分不当或目标选错,都会让模型学偏。

隐喻映射

  • 草药样本正面:输入数据
  • 木牌背面答案:标签
  • 练习木牌:训练集
  • 不许看的考试木牌:验证集或测试集
  • 老药师复核:标签质量控制

Soloharness 判断

监督学习能不能落地,常取决于企业有没有高质量标签。没有可靠答案,模型只是在规模化学习错误。

labelsclassificationregressionloss functiontraining set