← 返回概念解读

Concept Fable精修版

SWE-bench

SWE-bench · 基准

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

修旧钟楼的真实工单

老钟楼年久失修,城里常收到报障单:三更慢半刻、雨天钟摆卡住、南面小钟不响。过去考工匠只让他们在新铜片上刻花,分数很好看,真正上楼却修不好旧病。

新考官改了题。他收集真实报障单,连同旧图纸、磨损零件、报时验钟办法一起封成考卷。工匠要读懂故障描述,找到该修的齿轮或钟摆,做出修补,再让钟楼按指定时辰验响。

有些工匠会背修钟书,却找不到旧图纸里被改过的暗轴;有些能换零件,却让另一只小钟慢了。考官不看花哨说明,只看修补后旧钟是否通过验钟。

第一轮有人抱怨题太杂。考官说,城里要的不是会在干净桌上表演,而是能接真实修缮单、理解旧结构、改对地方、不弄坏旁支的人。

后来工坊训练也变了。学徒不再只练新件,而是练读报障、查旧图、做小修、跑验钟。每张题都来自真实麻烦,也有明确通过办法。

第一批考卷让不少漂亮工匠沉默。他们会在新铜片上展示手艺,却无法读懂十年前被人改过的暗轴。考官没有扣他们文采分,只让钟楼按时响;旧病修好,才算过关。

考官还保留了失败工单。谁修好一个故障却弄坏旁边小钟,照样不能通过。修旧钟楼的本事不在讲出漂亮方案,而在读懂老结构、改对地方,并让整座钟重新按时工作。 后来工匠们开始练习读旧报障单,而不是只磨新铜片。旧钟楼有历史、有旁支、有验收声响;能在这种现场修好问题,才接近城里真正需要的手艺。

钟楼考场让大家看见,衡量修缮本事不能只用玩具题。把真实问题、现成旧物和可检验结果放在一起,才更接近城里真正需要的工匠能力。

揭示

这个故事讲的是:SWE-bench

SWE-bench 是评估模型解决真实软件工程问题的基准,通常要求模型基于真实开源仓库 issue 修改代码并通过测试。它比小函数代码题更贴近工程场景,能衡量仓库理解、bug 定位、补丁生成和测试验证能力;但仍受测试覆盖、任务分布和执行环境影响。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 旧钟楼:真实代码仓库
  • 维修工单:GitHub issue 或 bug report
  • 小齿轮题:简单代码生成基准
  • 修改现有结构:patch generation
  • 测试通过:验证标准
  • 回归检查:防止修复引入新问题。

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

软件工程评测代码修复Agent 编程能力