"AI 生成代码的版权"常被当成一个问题,实际是三个相互独立的法律问题,答案也各不相同:①训练层——模型用别人的版权代码做训练是否侵权(模型厂商的风险);②输出层——AI 生成的代码本身能不能获得版权保护(你的风险:护城河问题);③冲突层——生成结果是否复现了他人受保护或带 copyleft 义务的代码(你的风险:被诉与许可证传染问题)。此外还有合同层:企业客户的赔偿条款(indemnification)正在把风险从用户转回厂商。2025 年之前这三层都悬而未决,此后美国司法与版权局密集给出答案,方向对 AI 厂商偏友好,但给"代码来源干净度"划了硬线。
| 文件/案件 | 时间 | 关键结论 | 对代码开发者的含义 |
|---|---|---|---|
| 美国版权局《版权与人工智能 Part 2:可版权性》报告 | 2025-01-29 发布 | 纯 AI 生成材料不受版权保护;仅输入提示词通常不构成人类作者身份;人类对输出进行足够的选择、安排、修改时可对其贡献部分获得保护 | 整段让 AI 生成且不修改的代码,可能处于"无主"状态;人类编辑、重构、组织越充分,可保护范围越大 |
| Bartz v. Anthropic(N.D. Cal.,Alsup 法官) | 2025-06-23 裁定;2025-09-25 和解初步批准 | 训练属"极具转换性"的合理使用;但用盗版来源建中央书库不构成合理使用。随后就盗版部分达成约 15 亿美元和解(约合每部作品约 3,000 美元,被称美国史上最大版权和解) | 训练数据合法性分层:"怎么用"可辩护,"从哪来"不豁免 |
| Kadrey v. Meta(同区法院 Chhabria 法官) | 2025-06(Bartz 数日后) | 同样认定训练构成合理使用(同时指出市场替代效应可能改变结论) | 两个联邦法院同向,训练层判例初步成型(均可能上诉) |
| Doe v. GitHub(Copilot 集体诉讼) | 2023–2024 大部分主张被驳回;DMCA 主张驳回后上诉,第九巡回法院 2026-02-11 口辩,待决 | 原告未能提供 Copilot 输出与其代码实质相似的具体例证;DMCA(移除版权管理信息)主张一审亦被驳回 | "输出复现他人代码"目前缺乏成功判例,但风险未被终局排除 |
作家集体起诉 Anthropic 用盗版书训练 Claude。2025 年 6 月 23 日,Alsup 法官做出美国法院对"LLM 训练是否合理使用"的首份实体裁决:用书籍训练模型是"极具转换性"的使用,合法取得的副本用于训练受合理使用保护——这一半是 AI 行业的历史性胜利。另一半:Anthropic 从"影子图书馆"批量下载盗版书并建立永久性中央书库,被认定不属于合理使用,且法院明言其大规模侵权事实无争议。三个月后双方就盗版部分达成约 15 亿美元和解,2026 年 7 月获法院最终批准。对开发者的启示落在工具选择上:主流大厂模型的"训练合法性"问题已大幅缓解,真正的风险转移到了输出端——你生成的代码里是否复现了受保护表达。
代码与其他作品不同:海量优质训练语料带开源许可证,其中 MIT/Apache 宽松但要求保留版权声明,GPL/AGPL 则有强传染性——一旦你的产品"衍生"自 GPL 代码,可能被要求开源整个产品。风险场景很具体:模型逐字复现训练语料中的实现(工具类、算法类代码最易撞车),或 agent 在检索增强(RAG)时直接引用了 GitHub 上的 GPL/AGPL 仓库代码并混入你的闭源项目。2023 年底曾有网友演示让 Copilot 输出与 AGPL 项目几乎一致的代码,GitHub 随后承认其公共代码过滤器调整失误并修复——说明"模型不会照抄"目前是概率承诺而非保证。
厂商端的对冲手段是"版权承诺"条款:微软对 Copilot 的客户版权承诺(Customer Copyright Commitment)承诺因输出侵权被诉时为符合条件的客户提供辩护与赔偿;多家企业级 AI 编程工具也提供类似条款。读这类条款要看三个细节:是否要求开启过滤/拦截功能、是否排除故意侵权场景、赔偿上限是多少。个人免费版通常不在承诺范围内——你以为有兜底,其实没有。
风险一:你的核心资产可能是"无主资产"。按版权局口径,"提示词 → 完整生成 → 原样上线"的代码缺乏人类作者身份,竞争对手抄袭你可能难以主张版权。对策不是放弃 AI,而是留下人类创作痕迹:实质性修改、重组、抽象,并保留 git 历史与提示词记录作为证据。
风险二:判例仍在流动。Bartz/Kadrey 均可能上诉,Copilot 案第九巡回判决随时可能出台,欧盟 AI Act 的训练数据透明度义务也在收紧。年度复查一次法律环境,别把 2025 年的结论当永久答案。
机会:①"AI 代码合规"工具链(许可证扫描、生成代码溯源、提示词存证)需求随企业采用面扩大而增长;②在融资与并购尽调中,"代码可版权性"正在成为新的核查项——提前规范化的团队有尽调优势;③开源模型 + 自建语料白名单(只吃宽松许可代码)是差异化卖点,适合面向企业的代码产品。
全球差异也要纳入视野。上面三层的结论主要基于美国法;欧盟在《AI 法案》下要求通用模型公开"足够详细的训练内容摘要",版权许可与 opt-out 机制的立法讨论仍在推进,对企业客户做 AI 产品的团队而言,欧洲市场要多一道合规评估;中国则自 2023 年起施行《生成式人工智能服务管理暂行办法》,对训练数据合法性、内容标识等提出明确要求(对面向公众提供服务者的约束更强,内部工具相对宽松)。做跨市场产品的原则很简单:按最严辖区准备合规底座,按本地市场调整披露粒度。
最后提醒一个常被忽略的事实:代码最现实的保护从来不是版权。软件专利门槛高、周期长;版权只护"表达"不护"思路";多数公司真正的护城河落在商业秘密 + 合同(保密协议、竞业条款、许可协议)与执行速度上。对独立开发者,"AI 生成代码版权归谁"这个问题的实务答案往往是:护住你的数据、分发渠道与用户关系,比纠结某段函数的版权归属更值得花时间。