← 返回概念解读

Concept Fable精修版

流水线并行

Pipeline Parallelism · Distributed inference

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

长陶窑把一批碗分段向前送

瓷坊要赶制一批大瓶,工序从揉泥、拉坯到晾干、上釉、入窑缺一不可。订单多起来后,师傅们各自从头做到尾,半成品堆满作坊,窑口却常在等泥坯。

坊主一味催快,只让前后工序更不齐。老窑工把长活拆成固定工位:前段连续出坯,中段按节奏晾晒,后段接手上釉和入窑。每批瓶子编号后依次向前传。

开工最初,末段仍有空等,因为第一批还没走完整条线;其中一段太慢时,后面的人也会闲着。窑工便调整每次送来的数量和各段人手,让不同批次同时停在不同阶段。

每只瓶子仍要经过全部工序,但作坊的总产量上来了。把长任务分给连续的阶段,并让小批工作交错前进,才能减少等待。

概念落点

这个故事讲的是:流水线并行

Pipeline Parallelism splits model layers across devices and sends micro-batches through those stages like a pipeline. It helps run large models across multiple GPUs and can improve utilization, but requires scheduling to reduce pipeline bubbles and communication delays.

它的价值在于把一个抽象术语落到可观察的机制、约束和取舍上,便于在真实系统中判断适用范围。

故事对应

  • 揉泥到烧制的长窑线:模型的层序列
  • 不同院子:不同 GPU 或节点
  • 固定段:按层切分模型
  • 小批碗:micro-batches
  • 空等:pipeline bubbles
  • 节拍调整:pipeline scheduling

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

tensor parallelismdata parallelismmodel parallelismGPipe