← 返回概念解读

Concept Fable精修版

因果注意力/自回归

Causal Attention / Autoregressive · Architecture

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

只能沿时间往前看的钟楼

钟楼记录员每天按时写城中大事。规矩很严:写第七声钟的记录时,只能看前六声钟发生了什么,不能翻看未来的公告。新记录员嫌麻烦,偷偷看明天的成稿来补今天的空白。练习成绩很好,一到真实现场,未来还没发生,他就写不下去。塔主先贴告示禁止偷看。告示没有用,因为桌上仍然摆着完整卷宗,规则靠自觉执行。

第二次修补是让人事后检查有没有未来信息。检查抓得住明显作弊,抓不住那些已经渗进句子选择里的微妙线索。

后来钟楼改了桌面结构:每个时刻的记录格只能看到自己之前的格子。要写下一句,就必须根据过去和当前上下文一步步推出来。

这种单向视野让记录员适合写连续故事、回信、代码和计划。代价也明显:生成越长,步骤越多;早期错误会被后续内容继承。

企业 帮手 使用这类能力时,必须在每一步旁边放证据、工具和停止条件。否则它会沿着最顺的路径继续写,而不是沿着最正确的业务路径走。

塔主最后说,时间的箭头本身就是约束。能在不知道未来的情况下稳定续写,才是真正可部署的生成能力。

有个记录员抱怨,这样写太慢。塔主让他看旧卷:那些提前偷看未来的句子,平时读起来流畅,一遇到现场突发就露馅,因为它们从没学会在缺口里作判断。

后来钟楼把重要记录分成小步,每一步旁边放上可查凭据和停笔铃。记录员可以写下一个字,却不能装作已经知道明天的雨、明天的判决和明天的伤亡。钟声一声接一声地落下,记录也只能沿着已经响过的声音往前走。这条规矩冷硬,却让续写终于能面对真实时间。

揭示

这个故事讲的是:因果注意力/自回归

Causal Attention / Autoregressive 指生成当前位置时只能关注当前位置之前的 token,不能看到未来 token。它是自回归语言模型的基础,使模型能按顺序预测下一个 token 并生成文本。企业 Agent 中,这种机制支撑对话、代码、计划和工具参数生成,但也带来长输出成本、错误累积和需要外部验证的问题。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 只能看前六声钟:因果注意力
  • 偷看明天成稿:训练-推理不一致的信息泄漏
  • 贴告示:只靠规则提醒的修补
  • 桌面结构限制:causal mask
  • 一步步写记录:自回归生成
  • 早期错误被继承:生成链路中的误差累积
  • 最后洞察:生成模型的能力和风险都来自顺序续写

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

autoregressivedecoder-onlycausal masknext-token prediction