← 返回概念解读

Concept Fable精修版

多头注意力

Multi-Head Attention · Transformers

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

十二盏灯照同一座码头

县令审一宗走私案,案卷里塞满证词、船期、货单和亲属关系。他让一名师爷通读全卷,师爷总会被最激烈的口供吸走注意,漏掉不起眼的改期记录。

县令改让所有人把线索平均摘抄,纸面更整齐,关键联系却仍埋在字堆里。后来他请四位师爷同时读卷:一位只看人名往来,一位核时辰,一位追货物去向,一位专找前后矛盾。

四人的摘记在堂上合并。某张货单不起眼,却同时被时间和货物流向两条线指出有异,于是成了破案的关键。不同分工看到的是同一案卷,却各自抓住不同关系。

县令留下这套办法:复杂材料不能只靠一双眼睛压出重点,多种视角并行关注,再把结果合起来,判断才更完整。

概念落点

这个故事讲的是:多头注意力

Multi-Head Attention 把注意力分成多个 head,让模型在同一层中并行学习不同类型的关系,再把结果合并。不同 head 可以关注语法、指代、位置、任务约束、工具输出等不同模式。对企业 Agent 来说,它解释了为什么同一上下文里需要同时处理事实、权限、目标、格式和风险;也带来更高计算成本,因此后续有 MQA、GQA 等推理优化变体。

它的价值在于把一个抽象术语落到可观察的机制、约束和取舍上,便于在真实系统中判断适用范围。

故事对应

  • 一盏大灯:单一注意力视角
  • 十二盏小灯:多个 attention head
  • 船、货、单证、泊位:token 之间不同类型的依赖关系
  • 把观察送回调度图:多头输出拼接并投影回模型表示
  • 换粗灯芯:只扩大模型能力但不改变关系分解的修补
  • 危险品误混:企业 Agent 在复杂任务中漏看关键约束的风险
  • 最后洞察:复杂上下文需要多个并行视角,而不是一个万能权重

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

attention headself-attentionQKVtransformer block