← 返回概念解读

Concept Fable精修版

MoD

Mixture of Depths · Architecture

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

每张木板不必都走到第十二道刨床

木桥坊有十二道刨床。无论木板是粗梁还是小垫片,都必须从第一道走到第十二道,老规矩说这样最公平。木料少时,大家不觉得浪费。

后来桥坊同时做大梁、扶手、楔子和临时垫片。好木梁确实需要层层细刨,小垫片走完十二道却没有意义;有些粗梁在第三道发现裂纹,还被送去精修,白白占了后面工位。

坊主先增加刨床,让每块木板仍走满全程。院子更挤,等待更长,简单木片占住了本该给复杂梁材的精细工位。公平流程反而拖慢关键部件。

老木匠提出在每几道工序后设检查口。木板若已经足够平整,就直接出工;裂纹明显的转去修补或废料堆;只有需要细节的梁和扶手继续进入深层刨床。

刚开始,学徒担心提前放行会偷工减料。老木匠便规定每个检查口都要留下判断理由和最低标准。省工不是随便跳过,而是按材料状态决定还要不要继续加工。

桥坊后来更快,也更稳。复杂木料得到更多深加工,简单木片不再耗尽全部工序。坊主明白,不是每个输入都需要同样深度;让不同材料走不同层数,才能把能力花在真正需要的地方。

检查口后来也学会看队伍。若精细刨床拥堵,普通垫片更早出工;若大梁质量波动,就让更多梁材走深层。深度不是固定恩赐,而是根据材料状态和资源压力做分配。

桥坊因此少了两种浪费:简单木片过度加工,复杂梁材加工不足。坊主把这写进工规:让每件材料拿到足够的处理,不让所有材料被迫走同一条最深的路。后来坊主看见产量上升,却没有降低验收。提前出工的木片仍要量尺寸,深加工的梁仍要看承重。省深度不能牺牲结果,只能减少不必要的路径。这让深工序不再被平均分配,而是被留给真正难处理的材料。后来学徒明白,公平不是每块木头走同样路,而是每块木头得到合适处理。

揭示

这个故事讲的是:MoD

Mixture of Depths 动态决定不同 token 是否需要经过全部 transformer layer,让一部分 token 跳过不必要的层,从而减少计算量。它属于动态计算思路,和 early exiting、MoE 等效率技术相邻,核心难点是判断哪些 token 可以少算而不伤害整体质量。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 十二道刨床:Transformer 的多层网络
  • 所有木板走完整路线:每个 token 都经过全部层
  • 简单木片占住深处刨床:低难度 token 消耗不必要计算
  • 入口检查尺与中途复判:动态路由或 depth selection
  • 提前出坊:跳过后续层或减少计算深度
  • 暗裂梁料继续处理:复杂 token 使用更多层
  • 最后洞察:Mixture of Depths 把计算深度变成按需分配的资源

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

early exitingMoEdynamic computationefficiency