"开源代码模型"指权重公开可下载、可自托管编程大模型,与 Claude/GPT 等闭源 API 相对。2023 年这一档位的代表还是 CodeLlama(SWE-bench 类任务个位数得分),2024 年 DeepSeek-Coder-V2 与 Qwen2.5-Coder 开始逼近 GPT-4o,2025-2026 年则是三家中国团队的连续跳级:Qwen3-Coder、DeepSeek-V3.x/V4、GLM-4.6 到 GLM-5.x,把开源代码能力推到与闭源第一梯队"贴身"的位置。
驱动力有三:其一,强化学习后训练(agentic RL)让"会调工具、会跑测试"的能力可以系统性提升,开源团队凭借工程投入追平;其二,MoE 稀疏架构大幅降低推理成本,使开源模型在价格上有资本打数量级差距;其三,Claude Code 开放兼容第三方端点,让开源模型可以直接接入最主流的 Agent 工作流——生态接口的开放与模型权重的开放形成了共振。结果就是 2026 年独立开发者的经典配置:Claude Code 壳 + 国产开源模型 API,月成本从 $100+ 降到 $10 以内。
迭代时间线(均为官方公开信息):2025-07-23,阿里发布 Qwen3-Coder-480B-A35B(Apache 2.0),SWE-bench 67.0%、原生 256K 上下文、支持 358 种语言;2025-09,DeepSeek 发布 V3.2-Exp(稀疏注意力降本),智谱发布 GLM-4.6(200K 上下文,实测号称 Claude Code 场景下对 Claude Sonnet 4 胜多负少);2026-02,阿里发布 Qwen3-Coder-Next(80B-A3B 超稀疏 MoE,主打本地与高吞吐),智谱发布 GLM-5(约 745B 参数,MIT 开源);2026 年内,GLM-5.1/5.2/5.3 连续迭代,官方称 GLM-5.3 为"最强开源权重编程模型、接近 Claude Opus 4.8";阿里后续旗舰(社区称 Qwen3.8 系列,2.4T 参数开源)进一步拉开参数规模。DeepSeek 侧 2025 年末至 2026 年进入 V4 世代,提供 V4-Flash/V4-Pro 分档 API。
| 模型(发布时间) | 参数规模 | 许可证 | 上下文 | 官方 API 价格(输入/输出,每百万 token) |
|---|---|---|---|---|
| Qwen3-Coder-480B(2025-07) | 480B 总参 / 35B 激活 | Apache 2.0 | 256K(可扩 1M) | 约 $2 / $8(阿里云百炼,随档位浮动) |
| Qwen3-Coder-Next(2026-02) | 80B 总参 / 3B 激活 | Apache 2.0 | 256K | 显著低于旗舰档(估计 <$0.5/$2) |
| DeepSeek-V3.2(2025-09) | 约 671B / 37B 激活 | MIT | 128K | $0.22-0.44 / $0.66-1.32(峰谷分时) |
| DeepSeek-V4 系列(2026) | 未完整公开 | MIT(延续惯例) | 128K+ | V4-Flash 约 $0.14/$0.28;V4-Pro 约 $0.44/$1.74 |
| GLM-4.6(2025-09) | 约 355B / 32B 激活 | MIT | 200K | $0.60 / $2.20(Z.ai 官价) |
| GLM-5 → 5.3(2026) | 约 745B(5.3 档公开权重) | MIT(5.2 曾暂缓开源权重) | 200K+ | 与 GLM-4.6 同量级,Coding Plan $3-10/月起 |
| 对照:Claude Sonnet 4.5 | 闭源 | 商业 API | 200K | $3.00 / $15.00 |
能力差距的诚实表述:在 SWE-bench Verified 与各家 Code Bench 上,开源头部与闭源头部的差距已收窄到个位数百分点(官方口径),但在超长时序 Agent 任务(连续数小时的工具调用、复杂调试链)上,闭源旗舰仍领先半个身位——GLM-5.1 官方口径"达到 Claude Opus 4.6 的 94.6%"是当前开源的天花板参照。对日常需求(改 bug、写功能、生成测试、重构),差距多数时候感知不到。
从 0.5B 到 480B 全谱系开源,Apache 2.0 许可(可商用、无收入门槛、仅需保留声明)。谱系价值在于"同一血统覆盖云端到端侧":480B 旗舰走 API,30B-A3B 级(Qwen3-Coder-30B)单张消费级显卡可跑,Qwen3-Coder-Next 则专为 Ollama/vLLM 本地开发优化(官方称吞吐约为同能力模型的 10 倍)。358 种语言的训练覆盖也使它在非英语场景(包括中文注释代码库)表现出色。
MIT 许可(比 Apache 2.0 更宽松),从 V3 起 MIT 开源 + 极低 API 定价的组合拳两次引爆全球(R1 发布时曾引致美股 AI 板块单日大跌)。技术贡献是 MLA 注意力与稀疏化带来的成本结构优势:峰谷分时定价 + 缓存命中约 $0.007/百万 token 的输入价,使其成为大批量、可缓存任务(代码补全、批量重构)的成本下限。短板是工具调用与 Agent 场景的稳定性长期略逊 GLM/Qwen 专项调优的版本(社区共识,定性判断)。
MIT 开源 + 直接兼容 Claude Code 协议 + $3-10/月订阅,GLM 把"用 Claude Code 的壳跑开源模型"做成了产品。GLM-4.6 起官方主打"以约 1/7 价格获得 Claude 九成效果"的定位,GLM-5(2026-02,约 745B,MIT)在 Hugging Face/ModelScope 开源并可接入 Claude Code、Cline、Roo Code、OpenCode 等主流 Agent 工具。注意其开源策略有弹性:GLM-5.2 曾暂缓开放权重,选择"先 API 后开源"的节奏——依赖其开源承诺的产品应把权重已实际可下载当作唯一事实标准。
GLM Coding Plan 的产品设计值得所有做开发者工具的人学习:它不卖模型、不卖 GPU,卖的是"接入即用"——一个 Anthropic 兼容端点 + 订阅额度,用户在 Claude Code 里改一行环境变量就完成迁移。Lite/Pro/Max/Team 四档($3-10/月起步)对齐 Claude Max 的使用习惯,配合 GLM-5.x 的迭代节奏推送给订阅者。结果:2025 年下半年起,"Claude Code + GLM"成为中文独立开发者圈的事实标配,把 AI 编程月成本从 $100-200 压到 $10 级。
启示:开源模型的商业化胜负手不是跑分而是"接入摩擦"。个人开发者也可以学这招——用 OpenRouter 或自建 LiteLLM 网关统一多家模型端点,把切换成本降为零,永远买当月性价比最高的模型。
先给结论:个人与十人以下团队,自托管旗舰模型几乎必然比 API 贵。粗算账(2026 年中行情,GPU 租赁价随供需波动,均为估计值):
| 方案 | 硬件需求 | 月成本(估计) | 适用场景 |
|---|---|---|---|
| GLM Coding Plan 订阅 | 无 | $3-10 | 日常编程,零运维 |
| DeepSeek/GLM API 按量 | 无 | $5-50(重度) | 中等强度,波动可控 |
| 本地 30B-A3B 级(如 Qwen3-Coder-30B/Next) | 1 张 RTX 4090(24G,已有则边际成本为零) | $0-80(电费) | 隐私、离线、补全类 |
| 自托管 355B 级(GLM-4.6,INT4) | 4-8 张 H100/H200 或 2 张 96G 级 | $1500-6000+ | 数据绝对不能出域 |
| 自托管 480B/745B 级 | 整机 8 卡 H200 节点 | $10000+ 级 | 只有机构级负载才可能打平 |
算式很简单:一张 H100 的市场租价约 $2-3/小时(按需、零散租更贵),月成本 $1500 上下;跑 355B 级模型需要多卡,还要叠加 vLLM/SGLang 的部署调优、版本升级、故障恢复的隐形人力。而 $1500/月足够买到约 50-100 次 Claude Max 20x 订阅或数亿 token 的 DeepSeek 输出。自托管打平 API 的临界点大约在日均千万 token 级的重负载 + 高并发 + 长期稳定 + 已有运维人力,四条全占才成立。对个人,真正划算的自托管只有一种:小模型跑在已经拥有的游戏显卡上做补全和离线任务(Ollama 五分钟起步),算边际成本。
服务条款与出口管制。权重 MIT/Apache 开源 ≠ 随便用:走官方 API 时,数据将经过其服务器,部分团队合规上不允许代码出境;而自托管又回到经济性悖论。采购前先过一遍法务口径。
版本节奏与"开源弹性"。三家迭代极快(一年 2-3 个大版本),旧版本权重可能停止修复;且如 GLM-5.2 所示,"先闭后开"的节奏随时可能调整。生产依赖应锁定已下载权重 + 固定 vLLM 版本,而不是跟随 latest。
基准口径混乱。各家公告的"胜过 Claude"多为自选场景(如 Claude Code 74 题内部测试),跨模型横向可比性弱;SWE-bench 本身 2026 年也陷入污染争议。选型请用自己的 10-20 题真实任务盲测。