AI 编程工具按自动化程度分三代:第一代是代码补全(GitHub Copilot 早期形态),人在写、机器猜;第二代是对话式助手(ChatGPT、Cursor 的 Chat 模式),人问、机器答、人粘贴;第三代才是本报告讨论的自主编程 Agent(autonomous coding agent)——给它一个 GitHub issue 或一句需求,它自己规划步骤、检索代码、编辑文件、执行测试、根据报错自我修正,最后产出一个可评审的 Pull Request。
引爆点是 2024 年 3 月 Cognition 公司发布的 Devin。演示视频里它自称"第一个 AI 软件工程师",能独立完成修 bug、部署小应用等任务,配合"AI 取代初级程序员"的叙事迅速出圈。此后学术界(普林斯顿的 SWE-agent)、开源社区(OpenHands/原 OpenDevin)、大厂(OpenAI Codex CLI、Anthropic Claude Code)全面跟进,到 2025-2026 年,"Agent 模式"已经成为几乎所有编程工具的标配。
一个关键的概念区分:Agent = 模型 + 脚手架(scaffold)+ 工具 + 环境隔离。同一个模型,换一个脚手架(文件读写方式、命令白名单、上下文管理策略),SWE-bench 成绩可以差 10-15 个百分点。所以评估 Agent 时不能只看背后是哪个模型,还要看它跑在什么框架里、有没有沙箱、怎么管理长任务的上下文。这直接决定了"虚拟初级工程师"这个比喻的成色。
基准层面,SWE-bench Verified(从真实 GitHub issue 筛出的 500 题,人工校验可解)是行业最通用的标尺。2024 年初 Devin 首测仅 13.86%(此前无辅助基线不到 2%);2025 年中 Qwen3-Coder 等开源模型达到 67% 上下;2026 年 3 月官方榜单上 Claude Opus 4.5 以约 80.9% 领跑,9 月部分第三方追踪器已给 Claude Opus 5 打出 96% 级别的分数。第三方与官方口径差距如此之大,本身就说明评测水很深(见第 5 节)。
| 代表产品 | 形态 | 定价(2026 年中) | 适合谁 |
|---|---|---|---|
| Devin(Cognition) | 云端并行 Agent,按 ACU 计费,含浏览器/终端/编辑器 | Core $20/月起,Max $200/月,超额按量 | 有明确工单队列的团队 |
| Claude Code(Anthropic) | 终端 Agent,配合 Max 订阅 | Pro 约 $20/月,Max 5x $100/月,Max 20x $200/月 | 个人开发者主力工具 |
| OpenAI Codex CLI | 终端/云端 Agent,随 ChatGPT 订阅 | 随 Plus/Pro 订阅,用量限额 | ChatGPT 生态用户 |
| Cursor 后台 Agent | IDE 内并行 Agent | Pro $20 / Pro+ $60 / Ultra $200(月) | 重 IDE 工作流者 |
| OpenHands | 开源自托管 Agent 平台 | 软件免费,自付算力 | 要数据私有的团队 |
| SWE-agent / mini-SWE-agent | 开源研究脚手架 | 免费(Princeton/MIT) | 研究者、自建管线 |
价格曲线值得注意:自主 Agent 从 2024 年"$500/月的奢侈品"变成 2026 年"$20/月起步的日用品",而模型能力同期翻了数倍。单位智能的成本一年降一个数量级,这让"多 Agent 并行"从噱头变成现实——Devin 的卖点已经不是单个 Agent 多聪明,而是能同时开 5-10 个 Agent 干不同的工单。
Devin 的路径几乎是一部行业教科书:2024 年 3 月发布即因演示与真实体验差距陷入"造假"争议(YouTuber 首测大量任务失败);随后靠 SWE-bench 技术报告(13.86%→30%+)逐步挽回技术信誉;2025 年 4 月推出 Devin 2.0,入门价砍到 $20/月并转向"并行工单"定位;2025 年 7 月,在 OpenAI 约 30 亿美元收购 Windsurf 流产、谷歌以约 24 亿美元许可协议挖走 Windsurf 核心团队后,Cognition 接盘收购了 Windsurf 的品牌、产品与剩余团队(Windsurf 当时约 $82M ARR、350+ 企业客户),年底将其并入 Devin 产品线;2025 年 9 月 Cognition 估值达 102 亿美元。
启示:自主 Agent 赛道的护城河不在"演示视频",而在工单分发、沙箱稳定性与验收体系的工程整合。Cognition 用并购把 IDE(入口)、Agent(劳动力)、企业客户(付费方)拼成了闭环——个人开发者从中学到的是:Agent 的价值取决于你的"任务管道"是否顺。
普林斯顿团队 2024 年的 SWE-agent 证明了"模型 + 极简命令行脚手架"就能达到专有系统的水平,其衍生品 mini-SWE-agent(约 100 行核心代码)在 2026 年被 SWE-bench 官方采纳为默认评测脚手架——同一模型用 Claude 4.5 Haiku 跑出 66.6% 的成绩,说明脚手架极简反而减少上下文污染。OpenHands(原 OpenDevin)则走平台路线,提供沙箱、浏览器操作与多 Agent 协作,是自托管阵营事实上的标准。对预算有限的独立开发者,OpenHands + 开源模型(GLM、DeepSeek、Qwen)是一条完全免费的技术路线,代价是运维与调参时间。
真正被大规模日常使用的"Agent",其实是 Claude Code 这类终端工具:它没有 Devin 那样的可视化面板,但胜在便宜(随订阅)、快、可嵌入既有工作流。2025-2026 年社区形成了"写规格 → Claude Code 执行 → 人工 review"的默认协作模式,GLM、Qwen 等模型也通过兼容 Anthropic API 直接接入 Claude Code 生态,把月成本压到 $3-10 级别。对一人公司而言,这条路线的性价比远超独立 Agent 产品。
把 Agent 当雇员来评估,需要回答三个问题:能干什么、干得多快、返工率多少。
能干什么:2026 年的真实边界大致是——擅长:有明确复现步骤的 bug 修复、依赖升级与机械重构、按模板加 CRUD 功能、补测试、写文档、日志排查;不可靠:跨多服务的架构改动、需求本身含糊的"产品级"功能、性能调优(容易给出假优化)、需要产品判断的取舍。规律一句话:验收标准能写成自动测试的任务,Agent 表现接近真人初级;验收依赖人类判断的任务,返工成本经常超过自己写。
干得多快:METR 2025 年 7 月的随机对照实验给全行业泼了冷水——16 名资深开源维护者在自己熟悉的代码库上,用 Cursor+Claude 解题反而比不用慢 19%,而他们主观认为自己快了 20%。这说明在"人比 AI 更懂上下文"的场景,沟通成本(写提示、检查输出、修偏差)会吃掉全部收益。反过来,人对代码库不熟悉、任务本身自包含时,Agent 的加速比普遍为正(多项企业内部数据称 20-40%,属估计值)。结论:Agent 不是普遍加速器,是"陌生度"与"规格清晰度"的套利工具。
返工率多少:SWE-bench 上 80% 的通过率意味着五个任务仍有一个要人工重做,且失败往往在语义层面(测试过了但实现不符合意图)。按工时折算,"Agent 干 8 小时 + 人验收修正 2 小时"对比"人直接写 6 小时",只在任务可并行、单人能同时监督多个 Agent 时才划算——这正是 Devin 卖"并行"的原因,也是"虚拟初级工程师"比喻最贴切的地方:你不会让初级工程师单打独斗,但会让他先写一版你来改。
基准可信度崩塌中。2026 年 SWE-bench Verified 出现严重污染争议:题目与测试用例泄漏进训练数据,OpenAI 已因此撤出该基准,Epoch AI 将饱和点标在约 83%,官方也被迫换用 mini-SWE-agent 统一脚手架并压缩排行榜展示。买 Agent 服务时,厂商贴的基准分数参考价值有限,自建 10-20 道本公司真实任务的小型私有评测集更可靠。
成本失控。自主 Agent 会自循环重试:一个陷入死循环的 Agent 一夜烧掉数十美元 API 费的案例在社区屡见不鲜。必须设置单任务预算上限与重试上限。
安全与权限。Agent 需要真实的环境权限(写文件、跑命令、发网络请求),提示注入可通过 issue 文本、网页内容劫持 Agent 行为。给 Agent 的凭据应当最小化、可撤销,敏感仓库隔离运行。