把 AI 编程开销讲清楚,先要看懂三种模式的经济学结构:订阅制是保险——月费固定,用多用少同价,厂商赌你用不满、你赌自己用得值,适合用量可预测但日内波动大的场景(Agent 编程恰好如此:一个下午烧掉一周额度是常态);API 按量是电费——每个 token 明码标价,轻用便宜、重用失控,且 Agent 自循环重试的特性会把账单放大 3-10 倍;自托管是自建电厂——GPU 按小时烧钱与用量无关,固定成本高到只有满载运行才能摊薄。
2025-2026 年市场的重要变化是订阅档位的"纺锤化":底部出现 $3-10 的国产模型订阅(GLM Coding Plan)与免费档(GitHub Copilot Free、Gemini CLI 免费额度),顶部稳定在 $200(Claude Max 20x、Cursor Ultra、Devin Max 三家不约而同锚定 $200),中间 $20-60 档竞争最激烈。这个结构意味着:99% 的开发者都能在 $200 以内找到不打折的主力方案,超过 $200/月的个人账单几乎都来自 API 按量失控或多订阅叠加。
| 付费方式 | 代表产品(2026 年中官价) | 月成本区间 | 成本性质 |
|---|---|---|---|
| 订阅制 | GLM Coding Plan:Lite $3 → Pro $10 起(分 Lite/Pro/Max/Team) | $3-80 | 固定,含额度 |
| Claude Pro / Max:约 $20 / $100(5x)/ $200(20x) | $20-200 | 固定,5 小时窗口限额 | |
| Cursor Pro $20 / Pro+ $60 / Ultra $200;Devin Core $20 / Max $200;GitHub Copilot Free / Pro $10 / Pro+ $39 | $0-200 | 固定,按量分层 | |
| API 按量 | Claude Sonnet 4.5:$3 输入 / $15 输出(Sonnet 5 降为 $2/$10,缓存再省 90%) | $0-1000+ | 线性,可失控 |
| GLM-4.6 $0.6/$2.2;DeepSeek 峰谷 $0.22-0.44/$0.66-1.32(缓存命中 $0.007) | $1-300 | 线性,缓存友好 | |
| 自托管 | 本地 30B 级(已有显卡边际 $0)→ 自建 355B+ 服务(多卡 H100) | $0-10000+ | 固定为主,运维另计 |
一个容易被忽略的量级感:Agent 编程是上下文密集型负载,每个任务要把代码库相关片段反复喂给模型,输入 token 通常是输出的 20-100 倍。这就是为什么"输入单价与缓存折扣"对 Agent 场景的影响远大于"输出单价",也是 DeepSeek 的 $0.007 缓存命中价、Claude 的 90% 缓存折扣如此关键的缘故。
按社区常见的用量口径(每日编程中 Agent 发起的对话轮次与代码库规模),画出三种典型画像的月账单(21 个工作日;token 量为估计区间,请以自己的账单页校准):
| 画像 | 用量假设(估计) | 订阅路线 | API 按量路线 | 结论 |
|---|---|---|---|---|
| 轻度:业余项目 | 每日 <1 小时,月 20-50 次 Agent 任务 | GLM Coding Plan $3-10 或 Copilot Free $0 | DeepSeek/GLM 约 $2-10 | 两者皆可,$10 内解决 |
| 中度:独立开发主力 | 每日 3-5 小时,月 300-600 次任务,中等仓库 | Claude Max $100-200 或 GLM Max 档 $20-80 | 纯 Claude API 约 $150-500;混合网关(80% GLM/DeepSeek + 20% Claude)约 $40-120 | 重度依赖 Claude 质量选 Max;可接受 90% 质量选混合,省 60% |
| 重度:全天候/多仓库 | 每日 8 小时+,并行多个 Agent,大仓库 | $200 会触顶(限额悬崖) | 纯 Claude 可达 $500-2000+,失控案例更高 | 必须混合网关 + 预算护栏 |
2026 年 Reddit 与 Cursor 论坛上反复出现同一道选择题:Claude Max 20x($200)与 Cursor Ultra($200)都号称"重度可用",但社区实测普遍结论是——Claude Code 的 $200 在月度总量上更宽裕(20x 额度主要作用于 5 小时窗口,周上限约为 $100 档的 2 倍),而部分 IDE 订阅的 $200 档接近"约 $200 等值 token"的上限;更早的 2025 年,社区还流传"顶配套餐叠加接近 $600/月"的极客配置。共同教训:订阅制的"额度"是厂商定义的黑箱,买前先读社区实测当月的真实上限,而不是宣传页的"20x"倍数。另外各家都提供用量的 80% 预警与月封顶(Claude API 可设 spend limit),订阅档触顶则降级到慢速排队——重度用户会真实撞墙。
策略一:模型分层(最大杠杆,省 50-80%)。用 LiteLLM 或 OpenRouter 建统一网关:便宜模型(DeepSeek/GLM 小档)干读代码、写测试、生成样板、批量重构;贵模型(Claude Opus/Sonnet)只做架构决策与最终 review。20/80 分配下,中度用户月账单从 $200 压到 $50 上下是常态。
策略二:喂饱缓存(对 Agent 场景省 60-90% 输入费)。Agent 反复读同一批文件,确保你的工作流命中提供商的 prompt cache:固定系统提示与规则文件放上下文头部、任务间不换端点、DeepSeek/Anthropic 的缓存各自有命中窗口(数分钟到 1 小时),连续作业比碎片化提问便宜得多。
策略三:砍掉无效循环(省的不是钱是时间)。Agent 自循环重试是账单放大的头号来源:同一任务第 3 次失败就应人工介入,而不是让它烧到第 15 次。给每个任务设重试上限与单任务预算(Claude Code 支持 /cost 查看花销,API 侧设 spend limit),每晚睡前确认没有挂机的 Agent 在空转。
策略四:上下文瘦身(间接省 30%+)。把 AGENTS.md/规则文件控制在必要长度、用仓库地图替代全量塞文件、及时 /compact 压缩会话——输入 token 少一半,账单近似少一半,质量往往还更好。
策略五:用好免费额度的"白嫖边界"。2026 年主流免费资源包括:GitHub Copilot Free 档(每月有限补全与对话次数)、Gemini CLI 的免费额度(个人账号自带配额)、各新厂商 API 注册赠金($5-15 不等,估计)。免费档的正确用法是承担"低风险杂活"——提交信息生成、小脚本、文档润色——而把付费额度全部留给核心开发。注意免费档的数据政策通常更宽(可能用于改进服务),客户代码别走免费通道。
预算失控是 API 路线的默认结局。Agent × 自由重试 × 按量计费的组合,在没有 spend limit 时等于把信用卡交给一个不知疲倦的实习生。所有按量账户上线第一天就设月度硬上限。
限额悬崖与质量暗降。订阅制触顶后不是停机就是降级(排队、换小模型),发生在 deadline 前夜最伤;部分 IDE 产品还会在额度内静默切换便宜模型,质量下降而用户不知情——账单页看不出来,只有 diff 质量会告诉你。
最大的隐性成本不是 token 是你的时间。METR 的 RCT 已证明资深开发者在熟悉代码库上可能因 AI 反而慢 19%;同样,为省 $20 折腾自托管、为凑缓存把工作流扭成奇怪形状,都是在用 $100 的时薪省 $10 的电费。成本核算必须把"你的小时"按市场价计入——这是多数 AI 编程成本讨论里缺失的一行。
/cost 确认无失控循环。