← 返回概念解读

Concept Fable精修版

自监督学习

Self-Supervised Learning · Pretraining

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

缺字账本里的自学徒弟

小学徒从书页自身寻找练习题,让上下文提供线索,再把答案与原卷核对;不必等先生逐页批改。

面对成千上万页材料,逐句人工讲解无法覆盖;只靠少量范文又学不会陌生表达。

只背有答案的范文,短期分数上升,却把训练锁在熟题里,材料中的广泛模式仍没有被学到。

老匠人从原书自动造题:遮词、续写或配对片段,并把上下文中的答案作为监督信号。

先生把书页遮去半句、打乱章次、抹掉题名,让学徒凭前后文补回去,再自己对照原卷。这一步麻烦,起初还拖慢了工期;可几轮之后,返工少了,师傅也不再凭脾气改规矩。大家终于看见,因此,数据自身构造的任务能扩大训练规模,但仍须用下游评估检验学到的能力。

学徒积累足够练习后,少量人工讲评才有了真正的增量。

学徒做了成千上万次,渐渐懂得词句如何相连,后来少量讲评就能点醒他。从那以后,世上有些教材不用人逐条标好,材料内部的缺口就能逼人学会结构。

概念落点

这个故事讲的是:自监督学习

自监督学习是从数据本身构造监督信号的学习方式,比如预测下一个 token、补全被遮住的词或判断片段关系。它不需要每条数据都由人工标注答案。

这让模型能利用海量未标注数据进行预训练,是大模型可规模化训练的关键。之后还可以通过微调、对齐或接入工具,把通用能力接到具体任务上。

故事对应

  • 无标注账本=海量未标注数据
  • 遮住字或预测下一行=自构造监督信号
  • 学徒自查=预训练目标
  • 之后接任务=下游微调或应用

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

pretrainingmasked language modelingnext-token predictioncontrastive learning