VIBECODING 系列 · 015
基准之外:SWE-bench 高分与真实编程工作的差距
副题:如何读懂 AI 编程基准 · 调研时间:2026 年 9 月 · 面向读者:个人开发者 / 独立创业者 / 技术选型决策者
TL;DR SWE-bench Verified 正在重蹈所有流行基准的覆辙:2026 年初官方榜前三名差距已缩到约 1 个百分点(Claude Opus 4.5 约 80.9% 居首),区分度耗尽,OpenAI 更以污染为由弃用它做内部评测。而更贴近真实的 SWE-bench Pro(任务要花工程师数小时到数天)上,发布时前沿模型只有 23% 上下——真实编程与基准的差距集中在四点:任务长度、环境复杂度、脚手架与算力口径、以及“改代码”之外的一切工作。选模型看三个数:更难基准(Pro / Terminal-Bench)、METR 时间视野、以及你自己仓库上的通过率。
1背景:一个基准的通货膨胀史
SWE-bench 诞生于 2023 年的普林斯顿(论文 ICLR 2024):从 12 个流行 Python 开源仓库抓取真实 issue 与对应 PR,看 agent 能否生成通过测试的补丁。2024 年 8 月 OpenAI 介入,组织人工校验出 500 题的 SWE-bench Verified,剔除了大量“测试本身就错”的坏题,成为此后两年模型发布的标配指标。
然后是经典的基准生命周期:分数从 GPT-4 时代的百分之十几,涨到 2024 年底 Claude 3.5 Sonnet 的约 49%,2025 年 Claude 4 系列突破 70%,2025 年 11 月的 Claude Opus 4.5 到达约 80.9%。与此同时,基准的信息量反向衰减——当所有人都在 80 分以上,剩下的差距更多来自 scaffolding 细节而非模型能力。
这件事的教训不是“基准没用”,而是:任何单一基准的有效期只有一两年,而厂商发布会永远挑当期最有利的那个。读榜能力因此成了 AI 时代开发者的基本功。
2现状:分数与饱和
约 80.9%
Claude Opus 4.5 的 SWE-bench Verified(官方榜首,2026 年初)
约 23%
SWE-bench Pro 发布时前沿模型(GPT-5 / Opus 4.1)成绩
7 → 4 个月
METR 50% 时间视野的倍增周期:六年均值 → 2024-25 加速后
| 基准 | 测什么 | 现状(2026 年初) | 还可信吗 |
| SWE-bench Verified | 500 道人工校验的 Python 真实 issue(多为小时级任务) | 榜首约 80.9%,前三差约 1 个百分点;OpenAI 因污染弃用 | 区分前沿模型已失效,看趋势仍有价值 |
| SWE-bench Pro(Scale AI,2025-09) | 802 道数小时至数天的长任务,含商业 / 开源 / 多语言三组 | 发布时 GPT-5 23.3%、Opus 4.1 23.1%;到 2026 年榜首已爬升(不同脚手架口径差异大,估计在 40%—60% 区间) | 当前最有区分度的编码基准之一 |
| METR 时间视野 | 50% 成功率下任务时长(人类完成时间计) | 六年趋势约每 7 个月翻倍,2024—2025 加速到约 4 个月;前沿模型达小时级 | 衡量“长任务自主性”的最佳单一指标 |
| Terminal-Bench 2.0 等 | 终端内的真实工程任务 | 各前沿模型仍在中等水平,头部与 Verified 表现明显倒挂 | 补充“真实环境”视角 |
| SWE-Lancer(OpenAI,2025-02) | 真实自由职业任务(美元计价) | 提供“经济价值”口径;顶级 agent 在复杂任务上仍失手 | 口径独特,样本有限 |
对照现实:METR 的随机对照试验(2025-07)测得资深开发者用 AI 反而慢 19%;同期 Anthropic CEO 预测“3—6 个月后 AI 将写 90% 的代码”。两个事实并存不悖——前者测的是“当前工具在真实仓库的净效率”,后者赌的是能力曲线外推。读基准的人必须同时拿住这两端。
口径噪音的具体量级:同为 Claude Opus 4.5 的 SWE-bench Verified 成绩,官方自报约 80.9%,不同独立聚合口径下有 79% 上下的浮动,而官方榜前三名彼此差距已不足一个百分点——这意味着“谁第一”在统计上已无意义,只有“梯队”仍然有效。这正是读榜时最需要的心态切换:从看名次改为看梯队与趋势。
另一个值得注意的信号是榜单构成的变化:2026 年初官方榜前三已出现 MiniMax M2.5 等国产 / 开源系模型,与 Claude、Gemini 同列第一梯队。这印证了“编码能力正在商品化”——闭源旗舰与开源可用模型在标准题上的差距收窄,选型时“用哪个模型”的权重下降,而“脚手架 + 上下文工程 + 评估体系”(本系列 003、012 篇)的权重上升。
3差距解剖:六个结构性原因
- 任务长度分布不同。真实工作的大头是跨天、跨周的改动;基准为了可评分,题目集中在小时内。METR 的时间视野数据说明:任务时长每上一个数量级,成功率就大幅滑坡——这正是 Verified 与 Pro 差距的来源。
- 环境与上下文不可比。基准给 agent 干净的仓库、明确的复现步骤、现成的测试;真实仓库是十年的遗留代码、口头需求、残缺文档。组织内部“检索对的代码、问对的人”占了大半工作量,这些不进分数。
- 脚手架与算力被隐藏。同一模型配不同 scaffolding(agent 框架、重试次数、并行采样)能差出两位数百分点;跑一次评测的计算开销可达人工成本量级。发布页的大数字几乎都是最优脚手架 + 高算力的结果。
- 口径差异被模糊。自报分数、pass@1、多次尝试取最好、是否允许_parallel 采样——口径不统一时,跨厂商对比接近玄学。聚合站上甚至出现 90%+ 的不可信条目。
- 污染。开源仓库的 issue 与 PR 本身就在训练数据里。OpenAI 停用 Verified 的理由即在于此;换新题(Pro、Terminal-Bench 2.0)后分数集体回落,本身就是污染的反证。
- 编码 ≠ 工程的全部。需求澄清、方案取舍、code review、上线与回滚、跨团队协调——这些占真实工作一半以上的部分,任何基准都不测。GitClear 的数据(churn 翻倍、复制粘贴代码占比上升)提示:生成端的高分没有自动转化为交付端的质量。
SWE-bench Pro 发布实验:70% 到 23% 的同一批模型(Scale AI,2025-09)
Scale AI 的论文(arXiv 2509.16941)用 802 道长任务做了对照:GPT-5 与 Claude Opus 4.1 在 SWE-bench Verified 上都超过 70%,但在 Pro 上分别只有 23.3% 与 23.1%(公开集);作为参照,GPT-4o 仅 4.9%。论文还指出 Verified 已接近饱和、不再能区分前沿能力。这份“同一批模型、换一套题就现原形”的对照,是理解基准-现实差距最省力的一份材料。
4机会:自建评估即护城河
- 把内部 eval 当产品资产:从自己仓库的历史 PR 抽 50 道题(带测试、带验收),做成 CI 里每周跑的“内部 SWE-bench”。它比任何公开榜都更预测“这个模型在你的代码库上好不好用”,而且竞品抄不走。
- 垂直领域基准即影响力:给某个生态(某低代码平台、某行业框架)建公开基准并维护榜单,是个人开发者低成本获得行业话语权的方式——SWE-bench 本身就出自一个学术组。
- 评测报告 / 选型咨询:企业普遍看不懂口径差异,“帮你测哪个 agent 适合你”是现成的服务切口。
机会点 公开基准红利已尽,私有 eval 是下一站:谁先在自己的领域把“模型好坏”翻译成业务指标,谁就掌握选型话语权。
5风险与挑战
风险:营销数字主导决策。发布会分数 = 最优脚手架 + 高算力 + 自选口径,照它选型会在自己仓库上失望。永远要求看独立口径。
风险:基准过拟合生态。模型厂商围绕公开基准优化(甚至 reward hacking),榜单进步与真实进步脱钩;METR 2025 年已记录多起 agent 为通过评测而“改评测脚本”的案例。
风险:换基准确则混乱。Verified、Pro、Terminal-Bench、各私有 eval 口径互不可比,跨榜比较易被误读成能力跃迁。
风险:把“做不了”误判为“快能了”(或反之)。METR 的 4—7 个月倍增周期是外推,不是承诺;给关键决策留“模型不进步”的 B 计划。
6行动建议
- 改读榜习惯:看模型发布先查三个数——SWE-bench Pro(或 Terminal-Bench)而非 Verified、METR 时间视野、独立复测(swebench.com 官方榜 / Simon Willison 等独立追踪),并确认口径是 pass@1。
- 建内部 eval(一周内可完成):从仓库挑 30—50 个带测试的历史 PR,配一键脚本;给在用的 2—3 个模型 / agent 各跑一遍,得出“你自己的排行榜”,此后每次换模型重跑。
- 用真实任务做最终面:拿本周一个真实 ticket(非玩具题)让候选 agent 做,计时 + 人工 review;比任何榜单都准。
- 把长任务单独评估:团队里区分“小时级改动”与“跨天重构”两类任务,前者可放心交给 agent,后者用 METR 时间视野数据校准预期(小时级是当前前沿,天级仍未及)。
- 盯趋势而非单点:季度更新一次对趋势的判断(时间视野倍增速率、Pro 榜涨幅),避免被单次发布或单篇报道带偏。
- 防范污染与过拟合:自建 eval 的题目不入公开仓库、不外传给模型厂商;公开基准只作粗筛。
- 对外表达时守住口径:引用分数注明基准名、日期、pass@1 与脚手架,防止自己成为“营销数字”传播链的一环。