首页 / 合规与实务风险

索尼、华纳起诉 Anthropic:AI 训练数据的“来源证明”正在成为企业合规底线

AI 模型训练的版权争议,正在从“训练本身是否构成合理使用”,转向一个更难绕开的问题:训练材料从何处取得,企业能否把来源讲清楚。

8月28日,索尼音乐出版(Sony Music Publishing)、华纳查佩尔音乐(Warner Chappell Music)及多家关联音乐出版商在美国加州北区联邦地区法院起诉 Anthropic 及其两名联合创始人。起诉状称,Anthropic 为开发和运营 Claude,曾大规模通过 BT 下载、抓取和下载受版权保护作品;被指涉的材料包括含歌词、曲谱的书籍及音乐作品。Anthropic 已向媒体表示不同意原告主张,并将积极应诉。

它把模型公司最容易被忽略的一段流程摆到了台前:数据进入训练集之前的取得、清洗、留存和授权链条。

争点从训练环节前移到取得环节

索尼和华纳在起诉状中提出四项请求:围绕涉嫌 BT 下载的直接侵权主张、针对两名个人被告的帮助侵权主张,以及针对 Anthropic 的直接侵权主张和版权管理信息被移除或更改的主张。原告同时请求陪审团审理、损害赔偿、销毁侵权复制件,并要求披露相关训练数据情况。

损失金额最终能否获得支持,还要经过美国版权法下的法定赔偿上限、故意侵权认定、每项作品如何计算等程序环节。对法务团队更有参考价值的是原告铺陈事实的方式:把“以非法方式取得作品”与“随后用于训练和建库”放在同一条因果链上陈述,而不是单独讨论训练环节。

这条路径与 Bartz v. Anthropic 的阶段性裁判形成了直接呼应。2025年6月,加州北区法院在该案中区分了两类使用场景:依法取得的图书用于模型训练,与保存盗版复制件建立通用资料库,法院认为训练用途具有高度转换性;但盗版来源的复制件,不能因为后续可能服务于转换性用途,就当然获得合理使用的豁免。之后,该案以15亿美元和解收场,未形成上诉层面的普遍约束规则,但“来源”作为一个事实变量已经写得相当具体。

数据清洗留下了什么,法院会问

音乐出版商还主张,相关流程可能去除了作品标题、作者或版权标识,却保留了歌词等表达内容。该项主张尚待法院认定,但它点出了一个常被误解的地方:数据清洗并不天然中性。

如果清洗的目的只是去重、格式统一或降低噪声,工程记录仍应能说明原始数据、处理规则和留存边界。若流程同时抹去了权利归属、来源链接、许可条件或使用限制,企业日后要回答的就不只是“训练是否侵权”,还包括自己是否履行过来源核验和权利管理义务,而后者往往要靠留痕来自证。

尤其在内容、出版、音乐、图片、法律数据库等高权利密度领域,采购了一个数据集、接入了一个爬虫,或从公开网页抓到了文本,都不等于取得了可用于模型训练、微调、检索增强或再分发的完整授权。合同许可范围、平台条款、技术限制、权利人声明和实际抓取行为,往往需要放在一起看。

采购模型时,合同里要写清的几件事

不少企业做生成式 AI 采购时,把重点放在输入数据会不会被模型用于再训练、是否支持私有化部署、输出能否商用。这些问题当然要问,而这宗诉讼提示采购清单还应加进一组更前置的问题:供应商训练数据的来源政策是什么?对高风险语料是否有授权、排除或退出机制?出现争议后,供应商能否提供审计线索、赔偿承诺和处置方案?

对于把模型嵌入内容生产、知识检索或对外服务的企业,合同中至少应写明:训练和微调数据的权利保证边界;第三方索赔的通知、抗辩和赔偿安排;供应商删除、停用或替换争议数据及相关功能的义务;因禁令、模型下架或服务中断导致的迁移支持;以及日志、版本和数据处理说明的保存期限。

这不等于要求每个使用模型的企业去审计全球训练语料,用户通常也拿不到这样的能力。可行的做法是把风险分层:对通用办公辅助工具,重点确认合同保证、数据不用于训练和退出路径;对面向客户的内容生成、音乐素材、图片生成、专业知识问答等场景,则应把供应商尽调、输入来源核验、输出复核和投诉处理做得更实一些。

输出端拦截补不上输入端的来源缺口

模型公司常用版权过滤、提示词限制和投诉机制来降低输出端风险。这些控制有价值,尤其能减少用户直接索取长段歌词、完整曲谱或高度近似内容的情形,但它们覆盖不到全部场景。

如果争议集中在数据取得和资料库留存,输出端设一道拦截并不能回溯修复输入端的来源缺口。企业的合规工作因此要从“生成后删什么”往前推进到“入库前为什么能用、入库后如何追溯”。对模型供应商如此,对自行做内部微调、知识库建设或网页采集的企业也是如此。

判决未到,可以先动的手

目前案件刚刚起诉,原告的指控并不等于法院认定,Anthropic 也已明确否认相关主张。它是否会和解、法院如何处理个人被告责任、各类作品和数据源之间如何对应,都还有很长的程序要走。

但采购端的变化已经出现:生成式 AI 的竞争不再只有模型能力、算力和价格,训练数据的权利链条也会逐渐成为可审计、可定价的商业条件。对法律、合规和采购团队来说,可以先行的一步是把自己手里的数据流画出来:哪些来自自有资料,哪些来自授权库,哪些来自公开网页,哪些缺少来源记录。那张图,在谈判和应诉时通常比一份笼统的“AI 合规承诺”更用得上。

资料来源

从读到用

带走这份四步核对清单

  • 确认适用规则与生效时间
  • 回到原始证据核对事实
  • 明确责任人与复核节点
  • 保留版本、来源与操作记录