VIBECODING 系列 · 009

开源代码模型生态:Qwen-Coder、DeepSeek、GLM 系列的能力、许可与自托管经济性

调研时间:2026 年 9 月 · 篇幅约 4 千字 · 面向读者:想省钱、要私有化或想本地跑模型的开发者
TL;DR 开源代码模型已从"能用"进化到"主力可用":Qwen3-Coder(Apache 2.0)、DeepSeek(MIT)、GLM(MIT)三家在 SWE-bench Verified 上从 2024 年的 20% 档追到 2026 年的 70-80% 档,GLM-5.3 系列官方口径已"接近 Claude Opus 4.8",而 API 价格只有 Claude 的 1/5 到 1/10,订阅(GLM Coding Plan $3-10/月起)进一步击穿地板价。对个人开发者的直接含义:日常 vibecoding 用 API/订阅即可吃到 90% 的能力红利;只有 30B 级小模型(如 Qwen3-Coder-Next 80B-A3B)才值得本地部署,480B+ 旗舰自托管对个人几乎必然亏本。选型看任务:复杂 Agent 用 GLM-5.x/DeepSeek,本地与隐私场景用 Qwen 小模型。

1背景与格局

"开源代码模型"指权重公开可下载、可自托管编程大模型,与 Claude/GPT 等闭源 API 相对。2023 年这一档位的代表还是 CodeLlama(SWE-bench 类任务个位数得分),2024 年 DeepSeek-Coder-V2 与 Qwen2.5-Coder 开始逼近 GPT-4o,2025-2026 年则是三家中国团队的连续跳级:Qwen3-Coder、DeepSeek-V3.x/V4、GLM-4.6 到 GLM-5.x,把开源代码能力推到与闭源第一梯队"贴身"的位置。

驱动力有三:其一,强化学习后训练(agentic RL)让"会调工具、会跑测试"的能力可以系统性提升,开源团队凭借工程投入追平;其二,MoE 稀疏架构大幅降低推理成本,使开源模型在价格上有资本打数量级差距;其三,Claude Code 开放兼容第三方端点,让开源模型可以直接接入最主流的 Agent 工作流——生态接口的开放与模型权重的开放形成了共振。结果就是 2026 年独立开发者的经典配置:Claude Code 壳 + 国产开源模型 API,月成本从 $100+ 降到 $10 以内。

2现状与数据

67%
Qwen3-Coder-480B 的 SWE-bench 成绩(2025-07 发布口径)
~1/5-1/10
开源模型 API 相对 Claude Sonnet 的价格(2026,官价口径)
256K-1M
Qwen3-Coder 上下文(原生 256K,YaRN 扩展 1M)
$3/月起
GLM Coding Plan 入门订阅(Lite 档)

迭代时间线(均为官方公开信息):2025-07-23,阿里发布 Qwen3-Coder-480B-A35B(Apache 2.0),SWE-bench 67.0%、原生 256K 上下文、支持 358 种语言;2025-09,DeepSeek 发布 V3.2-Exp(稀疏注意力降本),智谱发布 GLM-4.6(200K 上下文,实测号称 Claude Code 场景下对 Claude Sonnet 4 胜多负少);2026-02,阿里发布 Qwen3-Coder-Next(80B-A3B 超稀疏 MoE,主打本地与高吞吐),智谱发布 GLM-5(约 745B 参数,MIT 开源);2026 年内,GLM-5.1/5.2/5.3 连续迭代,官方称 GLM-5.3 为"最强开源权重编程模型、接近 Claude Opus 4.8";阿里后续旗舰(社区称 Qwen3.8 系列,2.4T 参数开源)进一步拉开参数规模。DeepSeek 侧 2025 年末至 2026 年进入 V4 世代,提供 V4-Flash/V4-Pro 分档 API。

模型(发布时间)参数规模许可证上下文官方 API 价格(输入/输出,每百万 token)
Qwen3-Coder-480B(2025-07)480B 总参 / 35B 激活Apache 2.0256K(可扩 1M)约 $2 / $8(阿里云百炼,随档位浮动)
Qwen3-Coder-Next(2026-02)80B 总参 / 3B 激活Apache 2.0256K显著低于旗舰档(估计 <$0.5/$2)
DeepSeek-V3.2(2025-09)约 671B / 37B 激活MIT128K$0.22-0.44 / $0.66-1.32(峰谷分时)
DeepSeek-V4 系列(2026)未完整公开MIT(延续惯例)128K+V4-Flash 约 $0.14/$0.28;V4-Pro 约 $0.44/$1.74
GLM-4.6(2025-09)约 355B / 32B 激活MIT200K$0.60 / $2.20(Z.ai 官价)
GLM-5 → 5.3(2026)约 745B(5.3 档公开权重)MIT(5.2 曾暂缓开源权重)200K+与 GLM-4.6 同量级,Coding Plan $3-10/月起
对照:Claude Sonnet 4.5闭源商业 API200K$3.00 / $15.00

能力差距的诚实表述:在 SWE-bench Verified 与各家 Code Bench 上,开源头部与闭源头部的差距已收窄到个位数百分点(官方口径),但在超长时序 Agent 任务(连续数小时的工具调用、复杂调试链)上,闭源旗舰仍领先半个身位——GLM-5.1 官方口径"达到 Claude Opus 4.6 的 94.6%"是当前开源的天花板参照。对日常需求(改 bug、写功能、生成测试、重构),差距多数时候感知不到。

3三大玩家与许可

Qwen-Coder(阿里):规模与谱系最全

从 0.5B 到 480B 全谱系开源,Apache 2.0 许可(可商用、无收入门槛、仅需保留声明)。谱系价值在于"同一血统覆盖云端到端侧":480B 旗舰走 API,30B-A3B 级(Qwen3-Coder-30B)单张消费级显卡可跑,Qwen3-Coder-Next 则专为 Ollama/vLLM 本地开发优化(官方称吞吐约为同能力模型的 10 倍)。358 种语言的训练覆盖也使它在非英语场景(包括中文注释代码库)表现出色。

DeepSeek:价格屠夫与架构创新者

MIT 许可(比 Apache 2.0 更宽松),从 V3 起 MIT 开源 + 极低 API 定价的组合拳两次引爆全球(R1 发布时曾引致美股 AI 板块单日大跌)。技术贡献是 MLA 注意力与稀疏化带来的成本结构优势:峰谷分时定价 + 缓存命中约 $0.007/百万 token 的输入价,使其成为大批量、可缓存任务(代码补全、批量重构)的成本下限。短板是工具调用与 Agent 场景的稳定性长期略逊 GLM/Qwen 专项调优的版本(社区共识,定性判断)。

GLM(智谱/Z.ai):Coding 订阅模式的定义者

MIT 开源 + 直接兼容 Claude Code 协议 + $3-10/月订阅,GLM 把"用 Claude Code 的壳跑开源模型"做成了产品。GLM-4.6 起官方主打"以约 1/7 价格获得 Claude 九成效果"的定位,GLM-5(2026-02,约 745B,MIT)在 Hugging Face/ModelScope 开源并可接入 Claude Code、Cline、Roo Code、OpenCode 等主流 Agent 工具。注意其开源策略有弹性:GLM-5.2 曾暂缓开放权重,选择"先 API 后开源"的节奏——依赖其开源承诺的产品应把权重已实际可下载当作唯一事实标准。

GLM Coding Plan:把开源模型包成"小白也能用"的订阅(2025-2026)

GLM Coding Plan 的产品设计值得所有做开发者工具的人学习:它不卖模型、不卖 GPU,卖的是"接入即用"——一个 Anthropic 兼容端点 + 订阅额度,用户在 Claude Code 里改一行环境变量就完成迁移。Lite/Pro/Max/Team 四档($3-10/月起步)对齐 Claude Max 的使用习惯,配合 GLM-5.x 的迭代节奏推送给订阅者。结果:2025 年下半年起,"Claude Code + GLM"成为中文独立开发者圈的事实标配,把 AI 编程月成本从 $100-200 压到 $10 级。

启示:开源模型的商业化胜负手不是跑分而是"接入摩擦"。个人开发者也可以学这招——用 OpenRouter 或自建 LiteLLM 网关统一多家模型端点,把切换成本降为零,永远买当月性价比最高的模型。

4自托管经济性:什么时候值得自己跑

先给结论:个人与十人以下团队,自托管旗舰模型几乎必然比 API 贵。粗算账(2026 年中行情,GPU 租赁价随供需波动,均为估计值):

方案硬件需求月成本(估计)适用场景
GLM Coding Plan 订阅$3-10日常编程,零运维
DeepSeek/GLM API 按量$5-50(重度)中等强度,波动可控
本地 30B-A3B 级(如 Qwen3-Coder-30B/Next)1 张 RTX 4090(24G,已有则边际成本为零)$0-80(电费)隐私、离线、补全类
自托管 355B 级(GLM-4.6,INT4)4-8 张 H100/H200 或 2 张 96G 级$1500-6000+数据绝对不能出域
自托管 480B/745B 级整机 8 卡 H200 节点$10000+ 级只有机构级负载才可能打平

算式很简单:一张 H100 的市场租价约 $2-3/小时(按需、零散租更贵),月成本 $1500 上下;跑 355B 级模型需要多卡,还要叠加 vLLM/SGLang 的部署调优、版本升级、故障恢复的隐形人力。而 $1500/月足够买到约 50-100 次 Claude Max 20x 订阅或数亿 token 的 DeepSeek 输出。自托管打平 API 的临界点大约在日均千万 token 级的重负载 + 高并发 + 长期稳定 + 已有运维人力,四条全占才成立。对个人,真正划算的自托管只有一种:小模型跑在已经拥有的游戏显卡上做补全和离线任务(Ollama 五分钟起步),算边际成本。

机会点 隐私敏感的代码资产(如涉及客户数据的内部工具)用"本地 Qwen3-Coder-30B 写 + 云端大模型匿名化复核"的混合管线,兼顾合规与质量,总成本可压在电费级。

5风险与挑战

服务条款与出口管制。权重 MIT/Apache 开源 ≠ 随便用:走官方 API 时,数据将经过其服务器,部分团队合规上不允许代码出境;而自托管又回到经济性悖论。采购前先过一遍法务口径。

版本节奏与"开源弹性"。三家迭代极快(一年 2-3 个大版本),旧版本权重可能停止修复;且如 GLM-5.2 所示,"先闭后开"的节奏随时可能调整。生产依赖应锁定已下载权重 + 固定 vLLM 版本,而不是跟随 latest。

基准口径混乱。各家公告的"胜过 Claude"多为自选场景(如 Claude Code 74 题内部测试),跨模型横向可比性弱;SWE-bench 本身 2026 年也陷入污染争议。选型请用自己的 10-20 题真实任务盲测。

风险 最省钱的方案往往最贵:为省 $20/月订阅把晚上的时间花在修 vLLM 显存溢出上,是独立开发者最常见的成本误算——你的时薪比 GPU 贵。

6行动建议