mt logoMyToken
ETH Gas
EN

Anthropic 15亿美元和解背后:AI公司的数据从哪里来,授权边界在哪里?

Favoritecollect
Shareshare

本文作者:赵暄

AI公司的版权风险,往往在模型开口之前就已经发生了。

在与AI创业者沟通时,我们发现,很多团队并不是不知道版权有风险,他们真正困惑的是: 风险究竟发生在哪一步? 有人认为,公司只是调用第三方基础模型,责任应当由上游厂商承担;有人认为,资料来自客户、公开网络或者付费数据库,来源本身没有问题;还有团队会解释,RAG只是检索,模型也没有大段输出原文,应该不至于构成侵权。

这些说法并非完全错误,但它们通常只解释了数据使用链条中的一个环节。等到公司进入融资尽调、大客户审查或者收到权利人投诉时,对方真正追问的往往是: 资料从哪里取得?谁有权把它交给公司?公司获得的是阅读权限,还是复制、切片、训练和长期保存的权限?这批资料进入了哪个知识库或者模型版本?如果权利人要求停止使用,公司能不能准确找到并移除?

2026年7月20日, 美国联邦法院最终批准了Anthropic与部分作者、出版商等权利人达成的15亿美元集体诉讼和解。 需要先说明的是,这15亿美元不是法院判决Anthropic支付的侵权赔偿,也不是AI公司使用书籍训练模型的统一许可价格。这个案件真正值得关注的,是法院把数据取得、资料库建设、模型训练和后续使用拆开审查:一个环节可以主张合理使用,并不意味着整条数据使用链都会自动合法。

法院支持了训练,Anthropic为什么还要支付15亿美元

在Anthropic案中,法院认为,在本案具体事实下,将书籍用于模型训练,是为了分析语言结构和统计关系,而不是向用户提供原书的替代品,因此相关训练具有转换性,可以构成合理使用。法院还支持了一种较窄的数字化方式:购买纸质书后将其扫描为数字件,并销毁对应原件,在没有增加副本数量、没有对外传播的情况下,这类格式转换也可能受到支持。

但从盗版网站下载大量电子书,并将其放入永久、一般用途的资料库,结论就不同了。法院拒绝仅仅因为这些资料未来“可能用于训练”,就把前端的盗版下载和长期保存一并视为合理使用。 换句话说,训练目的具有转换性,并不能自动解决数据取得方式本身的问题。

不过,这也不等于法院已经通过最终判决认定Anthropic承担盗版复制责任。相关责任和赔偿原本仍需继续审理,案件后来通过和解结束。 Anthropic愿意支付15亿美元,更准确地说,是对集体诉讼、法定赔偿、庭审和上诉不确定性的集中定价,而不是向法院支付了一笔“AI训练费”。

可以把这件事理解为:厨师研究一本菜谱的结构和写法,与他从盗版网站下载整套菜谱,再永久存进自己的资料库,不是同一件事。前者讨论怎样学习和使用作品,后者首先要回答资料从哪里来、为什么可以复制,以及为什么可以长期保存。

数据取得、导入复制、清洗切片、模型训练或知识库入库、检索输出和长期留存,是一条链上的不同环节。 不能因为其中一步具有合法依据,就推定整条链条都没有问题。

图1|AI数据使用链中的版权风险节点

使用第三方模型,不等于数据责任都在上游

很多AI创业公司并不训练基础模型,而是通过API调用第三方模型,再自行搭建行业知识库、RAG系统、智能体或者垂直应用。这种模式确实减少了企业直接训练基础模型的部分风险,但并没有把企业自己处理数据的责任一并转移给上游模型厂商。

企业首先要区分“数据”和“作品”。单纯事实、数值、公式和通用信息,未必构成著作权法意义上的作品,但同一批资料中可能同时包含文章、图片、报告、个人信息、商业秘密、平台数据权益和合同限制。因此,判断一批资料能否进入AI系统,不能只问“有没有版权”,还要继续判断资料具体包含什么、企业通过什么方式取得,以及当前用途是否在授权范围内。

RAG也不是版权的真空地带。一份行业报告进入RAG系统,通常要经过下载、格式转换、清洗、切片、向量化和知识库存储。即使模型最终只输出几句总结,前面的技术处理中仍可能发生复制,也可能超出数据库协议或者客户授权的范围。反过来,知识库中包含受保护作品,也不意味着每一次检索输出都必然侵权,仍需结合具体复制方式、输出内容和授权范围分别判断。

因此,“我们只是做RAG”不能替代数据审查,调用第三方模型也不能替企业解决自行建设知识库、处理客户资料和持续优化产品时产生的责任。

中国AI公司最容易误解的三件事

数据不构成作品,不等于可以随便使用

即使某些内容不受著作权保护,仍可能涉及个人信息、商业秘密、平台规则、数据库权益和合同义务。企业不能因为判断某批资料“没有版权”,就直接认为不存在其他限制。

公开看到或者付费购买,不等于可以拿来训练

公开可访问,只能说明用户能够在特定条件下接触内容,并不当然意味着可以批量下载、复制、切片、微调或者长期存入商业知识库。购买数据库账号更像购买一张阅览室门票,它通常允许查询和阅读,却未必允许把馆藏整体搬进企业知识库。

《著作权法》第二十九条规定,许可合同中未明确许可的权利,未经著作权人同意,另一方不得行使。 因此,“来源合法”与“取得当前用途授权”是两件事。 能够阅读、能够下载、能够内部使用、能够建立知识库和能够用于模型训练,并不是天然相同的一组权利。

不适用《生成式人工智能服务管理暂行办法》,不等于没有其他合规义务

一些内部知识库、企业自用工具或者特定B端服务,可能不直接适用该办法,但相关业务仍然会受到著作权、个人信息、数据安全、反不正当竞争以及客户合同和平台条款的约束。

合理使用不是看到“创新”就能刷开的万能门卡

Anthropic案适用的是美国版权法,不能直接照搬到中国。《著作权法》第二十四条列明了合理使用的具体情形,我国目前也尚未设置一项普遍适用于商业性AI训练的文本与数据挖掘例外。

这并不意味着所有AI训练都必然侵权,而是意味着企业不能仅凭“训练具有创新性”“模型没有输出原文”或者“使用不会替代原作品”,就直接得出合理使用结论。仍然要具体判断技术处理中是否形成了作品复制,复制发生在哪个环节,模型、知识库或者最终输出是否保留并呈现了可识别的作品表达,以及相关行为能否落入现行法律规定的具体情形。

最高人民法院已经提出,要稳妥审理大模型训练语料使用和人工智能生成内容侵权等新类型案件。这说明国内裁判标准仍在持续形成,企业不宜把核心产品和数据资产完全建立在尚不确定的合理使用抗辩之上。

历史数据怎么处理:先控增量,再清存量

对于已经运营一段时间的创业公司来说,最现实的问题往往不是“以后怎么做”,而是过去已经进入系统的数据怎么办。很多公司不可能立即停掉产品、清空知识库并重新训练,因此治理方案必须同时考虑法律风险、技术成本和业务连续性。

更现实的顺序是:先停止新增高风险数据,再盘点历史存量;先保存来源、合同和使用记录,再决定隔离、替换还是删除。 企业可以先建立一份数据清单,记录资料来源、取得时间、提供主体、合同和平台条款、使用目的、存储位置,以及进入了哪个知识库、微调任务或者模型版本。

高风险数据应当优先处理,包括来自盗版网站或者来源无法说明的文件、供应商无法提供权利链证明的数据、明显超出客户授权范围使用的资料,以及通过规避付费墙、反爬措施或者访问控制取得的内容。此类行为除可能涉及著作权和合同风险外,还可能在符合相应条件时产生不正当竞争责任。

整改也不只有“继续使用”和“立即删除”两个选项。企业可以先停止新增、限制访问,将可疑数据与生产环境隔离,再根据实际情况补充授权、使用合规数据替换,或者重新建设知识库和重新微调。确有必要删除时,也要确保能够定位相关文件、切片数据、向量记录和备份副本,并保留完整的内部审批和整改记录。

这些措施不能让过去的行为自动变得合法,但可以阻止风险继续扩大,也能够在后续融资、客户审查或者争议处理中证明,公司具备识别问题、限制影响和完成修复的能力。

图2|历史数据整改的五步路径

控制新增风险,可以先从一张数据台账开始

对于资源有限的创业公司,数据治理不需要一开始就建设一套庞大的合规系统。最实用的起点,是先建立一张由业务、技术和法务共同维护的数据台账。

每批数据至少应记录:由谁提供、从哪里取得、依据什么合同或者平台条款、允许用于哪些场景、禁止用于哪些场景、进入了哪个产品、知识库或者模型版本、保存多长时间,以及发生投诉、授权到期或者合作终止后如何退出。

合同也必须写进真实的技术场景。与其笼统约定“数据来源合法”或者“供应商保证不侵权”,不如明确资料是否可以下载、复制、清洗、格式转换、切片、建立知识库、用于检索、微调、评测或者模型优化,并写清适用产品、使用主体、期限和第三方权利主张的处理方式。

企业还要知道一批资料进入了哪个知识库或者模型版本,能否单独隔离、替换和删除。无法定位的数据,一旦发生投诉就很难止损;无法拆分和退出的数据,也会显著增加融资、并购和大客户审查的不确定性。

结语:AI版权风险,往往发生在模型开口之前

Anthropic案最值得中国AI公司注意的,不是“训练构成合理使用”这一句孤立结论,也不是15亿美元这个数字,而是法院将不同的数据使用环节拆开审查:资料从哪里来、为什么可以复制、以什么目的进入资料库,以及为什么要被长期保存。

合理使用不是数据来源违法的免责标签,来源合法也不是可以任意训练、检索和长期保存的同义词。 调用第三方模型可以降低一部分底层训练风险,却不能替企业解决自己建设知识库、处理客户资料和优化产品时产生的责任。

对创业公司而言,现在开始治理并不晚。 先管住今天新增的数据,再逐步处理过去留下的问题;越早建立来源记录、授权边界和退出机制,后续整改成本越低,也越容易把数据从潜在风险,转化为经得起融资和客户审查的公司资产。

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup