← 返回概念解读

Concept Fable精修版

提示敏感度

Prompt Sensitivity · 评估问题

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

换个问法就换个判决的铁算盘

钱庄有台铁算盘,算账很快。掌柜问它‘这笔账能不能放款’,它会给出谨慎建议;伙计问‘帮客户找个通过理由’,它又变得宽松许多。

起初大家觉得这是铁算盘懂人情。后来发现,同一份材料,只要问题顺序、语气、例子或字段名称稍微变化,结论就会明显不同。

伙计们先统一开头,要求每次都写‘请客观准确’。短期看起来稳了一点,但只要把客户背景放在前面或后面,风险评分仍会波动。

一次审批中,A 伙计按旧模板提交,系统建议拒绝;B 伙计换了措辞,系统建议补件后通过。两份输入事实相同,业务却得到两种行动。

掌柜意识到,问题不是某一次输出错,而是系统对表述扰动过于敏感。这样的工具无法支撑可审计、可规模化的流程。

他让账房建立提示稳定性测试。相同案例会生成多种等价问法、字段顺序、格式和示例组合,观察输出是否保持同一业务判断。后来新伙计入职,先学的不是怎样问得更聪明,而是怎样让同一事实在不同问法下仍回到同一套规则。语言可以有礼貌,判断不能随风摆。

对敏感任务,钱庄改用结构化输入、固定模板、明确评分规则和回归测试。必要时让铁算盘只解释原因,不直接决定放款。账房还把最容易晃动的词列成清单:紧急、帮忙、尽量、只供参考。这些词本来无害,却会让铁算盘误以为业务标准变了。

铁算盘没有完全不受措辞影响,但关键决策的波动被监控起来。每次改提示,都要看稳定性是否下降。掌柜说:一句话换个说法就换结果,说明我们还没有把业务标准从语言表面里解放出来。后来管事把这次经验写进日常规矩:先看场景,再看边界,最后看失败时谁能接手。只有这些都清楚,漂亮演示才会变成可交付的工作。

揭示

这个故事讲的是:提示敏感度

Prompt Sensitivity 指模型对提示措辞、顺序、格式、示例选择或字段命名的变化表现出明显性能波动。它会让企业 Agent 在相同事实下给出不同判断,影响评测稳定性和生产可靠性。缓解方式包括结构化输入、固定模板、prompt 变体评测、回归测试、输出约束、业务规则外置和人工审核高风险决策。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 铁算盘:基于 LLM 的判断组件
  • 换个问法就换建议:prompt sensitivity
  • 请客观准确:无法根治敏感性的空泛修补
  • 事实相同但行动不同:生产流程中的稳定性风险
  • 等价问法测试:prompt robustness evaluation
  • 结构化输入和固定模板:降低语言表面扰动
  • 最后洞察:Prompt Sensitivity 衡量提示微小变化对输出可靠性的影响

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

提示工程少样本变异评估稳定性