寓言故事
先让机器评审分担试卷,再请老师抽查难题
学堂要训练一批答题助手。老师能判断好坏,但每天几千份答案送来,人工评审很快排到深夜。
校长先减少训练样本。助手变快了,却只学会少数题型,遇到边界问题仍然乱答。评审排队最严重时,答案已经过期。学生问今天的城规,三天后才得到分数,助手学到的反馈也慢半拍。
他又让所有老师全职评分。短期质量上去了,成本却失控,老师没有时间设计更好的课程。
后来校长请来一台评卷机。它按照老师制定的标准,先比较答案哪份更清楚、更诚实、更安全。第一台评卷机只会按字数和礼貌打分,很快把啰嗦答案评得很高。校长暂停使用,让老师把“有用”“守界”“承认证据不足”分开标出来。
评卷机处理大批普通样本,老师集中抽查争议题、危险题和机器不确定的题。错判被记录下来,再用来修正评审流程。
训练助手时,很多反馈来自评卷机,而不是逐条来自人。这样速度快了,覆盖面也更广。后来评卷机先处理清楚题,遇到争议就挂红旗。老师不再被普通样本淹没,能把精力放到最容易带偏方向的地方。
但校长很谨慎。若评卷机本身带偏见,助手会把偏见学得更稳定;若标准写得模糊,机器会把模糊放大。评卷机也不直接裁定所有答案。它更像放大老师标准的助手:标准清楚时能扩展,标准含糊时会把含糊扩展成成批错误。校长因此始终保留抽查权。校长还给老师们留了最后裁量。若评卷机和老师意见长期不合,不是简单相信机器,也不是全部丢弃,而是回头检查标准、样本和校准题。规模变大以后,方向更要常被拉回。
于是学堂保留人类基准、红队题和定期校准,不让机器评审完全自转。校长最后说:机器评卷能扩大训练规模,但它必须被人的目标、抽查和校准拴在正确方向上。