← 返回概念解读

Concept Fable精修版

混合精度训练

Mixed Precision Training · Training

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

银匠为什么有时用大秤有时用小秤

银匠铺早年只打一种银杯。师傅用最精细的小秤称每一粒银屑,慢是慢,但杯子少,时间够。

后来王城下了大单,几千只杯子要在冬宴前交。若每一步都用小秤,炉火会等人,工期一定误。

掌柜先换成大秤。称大块银料很快,可到杯沿花纹和薄片配比时,误差开始让成品变形。

有人坚持所有地方都用小秤。质量稳了,产量却低到无法交付。

老银匠把工序分开:大块熔料、搬运和粗配用大秤;关键合金比例、花纹薄片和最后校准用小秤。每次从大秤转小秤,都要检查误差有没有累积。

学徒们起初觉得麻烦,后来发现炉火不再空等,杯沿也没有变歪。后来王城又追加了带金边的礼杯。老银匠没有把所有工序退回小秤,而是只在容易积累误差的地方加校验:杯沿厚度、花纹深浅、最后重量。

银匠铺还保留一份主账,用最精细的数字记录关键配方,避免多轮粗称把偏差带远。学徒逐渐懂了,粗秤不是偷懒,小秤也不是万能。真正的手艺,是让便宜快速的称量承担大部分重复活,再把昂贵精细的称量留给会影响成败的节点。

掌柜最后明白,速度和精度不是只能二选一,关键在于知道哪些称量能粗一点,哪些必须精。后来管事把这套分工写进炉房规矩:新订单先标出普通工序和要命工序,普通工序追求吞吐,要命工序保留细秤和复核。复查时,他们还会抽几只杯子重新称一遍,确认大秤带来的小误差没有在后面越滚越大。若某批银料杂质多,就临时提高细秤比例;若只是重复粗坯,就让炉火连续跑起来,省下的时间留给最容易变形的杯沿、薄壁和纹路。

揭示

这个故事讲的是:混合精度训练

Mixed Precision Training 是在模型训练中同时使用不同数值精度,例如 FP32、FP16、bf16,以减少显存占用、提高吞吐,同时保留关键计算的稳定性。它通常配合 loss scaling、主权重或关键层高精度计算,避免梯度下溢、数值不稳定和训练质量下降。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 大秤:低精度计算,如 FP16/bf16
  • 小秤:高精度计算,如 FP32
  • 王城大单:大模型训练的算力和吞吐压力
  • 杯沿变形:数值误差导致训练不稳定
  • 主账:高精度主权重或关键状态
  • 误差检查:loss scaling 和数值稳定性控制

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

fp16bf16fp32GPU memorytraining efficiency