VIBECODING 系列 · 024

AI 生成代码的版权与知识产权:训练数据、代码归属、开源许可冲突与法律风险

调研时间:2026 年 9 月 · 篇幅约 3.5 千字 · 面向读者:独立开发者 / 创业者 / 用 AI 写核心业务代码的人
TL;DR AI 代码的法律问题分三层,2025–2026 年三层都有了里程碑答案。训练层:美国法院在 Bartz v. Anthropic 首次认定"用合法取得的作品训练大模型属转换性合理使用",但 Anthropic 为盗版书籍来源支付约 15 亿美元和解——"训练可能合法、来路必须干净"。输出层:美国版权局 2025 年 1 月定调,纯 AI 生成内容不受版权保护、仅提示词不构成作者身份——你的产品代码若想获得保护,人类创作痕迹是关键。冲突层:GitHub Copilot 集体诉讼的 DMCA 主张仍在第九巡回上诉法院待决(2026 年 2 月已口辩)。实务底线三条:保留人类修改记录、启用许可过滤、对 copyleft 代码做扫描。

1背景:三层法律问题拆开看

"AI 生成代码的版权"常被当成一个问题,实际是三个相互独立的法律问题,答案也各不相同:①训练层——模型用别人的版权代码做训练是否侵权(模型厂商的风险);②输出层——AI 生成的代码本身能不能获得版权保护(你的风险:护城河问题);③冲突层——生成结果是否复现了他人受保护或带 copyleft 义务的代码(你的风险:被诉与许可证传染问题)。此外还有合同层:企业客户的赔偿条款(indemnification)正在把风险从用户转回厂商。2025 年之前这三层都悬而未决,此后美国司法与版权局密集给出答案,方向对 AI 厂商偏友好,但给"代码来源干净度"划了硬线。

22025–2026 关键判例与官方文件

文件/案件时间关键结论对代码开发者的含义
美国版权局《版权与人工智能 Part 2:可版权性》报告 2025-01-29 发布 纯 AI 生成材料不受版权保护;仅输入提示词通常不构成人类作者身份;人类对输出进行足够的选择、安排、修改时可对其贡献部分获得保护 整段让 AI 生成且不修改的代码,可能处于"无主"状态;人类编辑、重构、组织越充分,可保护范围越大
Bartz v. Anthropic(N.D. Cal.,Alsup 法官) 2025-06-23 裁定;2025-09-25 和解初步批准 训练属"极具转换性"的合理使用;但用盗版来源建中央书库不构成合理使用。随后就盗版部分达成约 15 亿美元和解(约合每部作品约 3,000 美元,被称美国史上最大版权和解) 训练数据合法性分层:"怎么用"可辩护,"从哪来"不豁免
Kadrey v. Meta(同区法院 Chhabria 法官) 2025-06(Bartz 数日后) 同样认定训练构成合理使用(同时指出市场替代效应可能改变结论) 两个联邦法院同向,训练层判例初步成型(均可能上诉)
Doe v. GitHub(Copilot 集体诉讼) 2023–2024 大部分主张被驳回;DMCA 主张驳回后上诉,第九巡回法院 2026-02-11 口辩,待决 原告未能提供 Copilot 输出与其代码实质相似的具体例证;DMCA(移除版权管理信息)主张一审亦被驳回 "输出复现他人代码"目前缺乏成功判例,但风险未被终局排除
$15 亿
Anthropic 就盗版训练来源的和解金额(2025-09 初批,2026-07 终批)
2025-01-29
版权局 Part 2 报告:纯 AI 输出不受版权保护
2026-02-11
Copilot 案 DMCA 上诉口辩日,判决待出

3案例深读:Bartz v. Anthropic 为什么重要

Bartz v. Anthropic:一场"各打五十大板"的里程碑(2025)

作家集体起诉 Anthropic 用盗版书训练 Claude。2025 年 6 月 23 日,Alsup 法官做出美国法院对"LLM 训练是否合理使用"的首份实体裁决:用书籍训练模型是"极具转换性"的使用,合法取得的副本用于训练受合理使用保护——这一半是 AI 行业的历史性胜利。另一半:Anthropic 从"影子图书馆"批量下载盗版书并建立永久性中央书库,被认定不属于合理使用,且法院明言其大规模侵权事实无争议。三个月后双方就盗版部分达成约 15 亿美元和解,2026 年 7 月获法院最终批准。对开发者的启示落在工具选择上:主流大厂模型的"训练合法性"问题已大幅缓解,真正的风险转移到了输出端——你生成的代码里是否复现了受保护表达

4开源许可冲突:开发者最常踩的坑

代码与其他作品不同:海量优质训练语料带开源许可证,其中 MIT/Apache 宽松但要求保留版权声明,GPL/AGPL 则有强传染性——一旦你的产品"衍生"自 GPL 代码,可能被要求开源整个产品。风险场景很具体:模型逐字复现训练语料中的实现(工具类、算法类代码最易撞车),或 agent 在检索增强(RAG)时直接引用了 GitHub 上的 GPL/AGPL 仓库代码并混入你的闭源项目。2023 年底曾有网友演示让 Copilot 输出与 AGPL 项目几乎一致的代码,GitHub 随后承认其公共代码过滤器调整失误并修复——说明"模型不会照抄"目前是概率承诺而非保证

厂商端的对冲手段是"版权承诺"条款:微软对 Copilot 的客户版权承诺(Customer Copyright Commitment)承诺因输出侵权被诉时为符合条件的客户提供辩护与赔偿;多家企业级 AI 编程工具也提供类似条款。读这类条款要看三个细节:是否要求开启过滤/拦截功能、是否排除故意侵权场景、赔偿上限是多少。个人免费版通常不在承诺范围内——你以为有兜底,其实没有。

风险 最实际的暴露不是诉讼而是合规事故:闭源产品里混入 AGPL 代码被社区发现 → 被要求开源或下线。发生概率远高于版权诉讼,处理成本同样高。CI 里加许可证扫描(如 licensee / scancode 类工具)是性价比最高的防线。

5风险与机会

风险一:你的核心资产可能是"无主资产"。按版权局口径,"提示词 → 完整生成 → 原样上线"的代码缺乏人类作者身份,竞争对手抄袭你可能难以主张版权。对策不是放弃 AI,而是留下人类创作痕迹:实质性修改、重组、抽象,并保留 git 历史与提示词记录作为证据。

风险二:判例仍在流动。Bartz/Kadrey 均可能上诉,Copilot 案第九巡回判决随时可能出台,欧盟 AI Act 的训练数据透明度义务也在收紧。年度复查一次法律环境,别把 2025 年的结论当永久答案。

机会:①"AI 代码合规"工具链(许可证扫描、生成代码溯源、提示词存证)需求随企业采用面扩大而增长;②在融资与并购尽调中,"代码可版权性"正在成为新的核查项——提前规范化的团队有尽调优势;③开源模型 + 自建语料白名单(只吃宽松许可代码)是差异化卖点,适合面向企业的代码产品。

机会点 给独立开发者的"合规三件套"模板(AI 使用政策 + 许可证扫描 CI 配置 + 创作过程存证流程)目前没有成熟开箱方案,做成人人可用的开源工具或小产品,切入成本极低。

全球差异也要纳入视野。上面三层的结论主要基于美国法;欧盟在《AI 法案》下要求通用模型公开"足够详细的训练内容摘要",版权许可与 opt-out 机制的立法讨论仍在推进,对企业客户做 AI 产品的团队而言,欧洲市场要多一道合规评估;中国则自 2023 年起施行《生成式人工智能服务管理暂行办法》,对训练数据合法性、内容标识等提出明确要求(对面向公众提供服务者的约束更强,内部工具相对宽松)。做跨市场产品的原则很简单:按最严辖区准备合规底座,按本地市场调整披露粒度

最后提醒一个常被忽略的事实:代码最现实的保护从来不是版权。软件专利门槛高、周期长;版权只护"表达"不护"思路";多数公司真正的护城河落在商业秘密 + 合同(保密协议、竞业条款、许可协议)与执行速度上。对独立开发者,"AI 生成代码版权归谁"这个问题的实务答案往往是:护住你的数据、分发渠道与用户关系,比纠结某段函数的版权归属更值得花时间。

6行动建议