← 返回概念解读

Concept Fable精修版

数据并行

Data Parallelism · Distributed training

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

同一本练习册被分给了许多学徒

书院要抄一部大典,单个抄手一年也抄不完。山长把同一套范本和墨色发给多组学徒,每组处理不同页次,目标是缩短总工期。

各组可以并行下笔,但每组都要遵守相同的格式。若某组临时改了字形,合卷时就会出现断层;若有人提前交卷,其他组也不能因此跳过自己的页次。

山长每天收回各组的勘误,把共同修正规则发回所有桌面。这里的合校不是把页面拼起来,而是把每个副本从各自样本中学到的更新汇成同一套模型状态。

学徒越多,互相传递勘误越频繁。书院开始按批次合校,并记录慢组和缺席组,避免等待、通信开销或单点缺席抵消并行收益。

数据并行提升的是吞吐,不会自动解决同步、负载、全局 batch 或故障问题;规模越大,合并规则和通信预算越重要。

概念落点

这个故事讲的是:数据并行

Data Parallelism 是分布式训练中常见的方法:在多张 GPU 或多台机器上复制同一个模型,每个副本处理不同数据 batch,随后同步梯度或参数更新。它能提高训练吞吐,是大模型预训练和微调的基础并行策略之一。主要挑战包括梯度同步通信成本、全局 batch size、学习率调整、节点故障、负载均衡和与模型并行、流水线并行、FSDP/ZeRO 等策略的组合。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

故事对应

  • 同一模型复制给许多学徒:每个 worker 持有完整模型副本
  • 不同练习页:不同数据 mini-batch
  • 修正意见:梯度
  • 中央账房求平均:all-reduce 或参数同步
  • 集合钟:同步训练步
  • 通信成本:多卡多机训练的瓶颈
  • 数据分开读,模型同步学:data parallelism 的核心

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

FSDPDDPdistributed training