蒸馏自己或授权范围内的模型通常没问题,真正要看的,是数据怎么拿到、复制了什么、成品怎么发布。本文比较美国、欧盟、英国、中国、日本、新加坡等十一个法域的规则,并列出判断具体项目需要备齐的证据。
这篇文章解决什么问题
蒸馏自己或授权范围内的模型通常没问题,真正要看的,是数据怎么拿到、复制了什么、成品怎么发布。本文比较美国、欧盟、英国、中国、日本、新加坡等十一个法域的规则,并列出判断具体项目需要备齐的证据。
“蒸馏”经常被说成一种违法手段。法律其实不审判训练方法,它看的是具体行为:教师模型(已经训练好、用来提供预测或输出的模型)的输出是怎么拿到的,拿到之后复制了什么,学生模型(用教师模型的输出训练出来的模型)用什么训练,成品又怎么发布。文中涉及的企业和事件,来自企业公告、项目说明、媒体报道和政府公开文件,本文没有独立核实,行文中逐项注明了出处。法律部分依据2026年10月1日核对的法律文本,比较美国、欧盟、英国、中国、日本、新加坡、韩国、印度、加拿大、澳大利亚和巴西的规则。欧盟按统一框架讨论,成员国的差别另行指出;中国部分只讲内地法律,不含中国香港、中国澳门和中国台湾。
结论放在前面:蒸馏自己的模型,或者在授权范围内蒸馏别人的模型,通常没有问题。违反有效合同、非法获取秘密、复制受保护的表达又找不到例外、违规处理个人信息,或者绕过访问限制,才分别涉及民事、行政乃至刑事责任。判断的依据是证据,而不是”蒸馏”这个叫法。
先把概念弄清楚
知识蒸馏的基本做法,是拿训练好的教师模型给出的预测、概率分布或生成内容,去训练另一个学生模型,让它学到教师模型的一部分行为。Hinton、Vinyals 和 Dean 在2015年的论文里系统讲过这个方法。到了大语言模型阶段,常见做法是用教师模型生成的答案、推理过程或评分做监督微调或强化学习。学生模型不一定比教师模型小,也用不着拿到教师模型的参数。
放到法律上,至少有三种情形。一种是在本地使用合法取得的教师模型权重,读取内部特征来训练学生模型;一种是通过 API 或网页反复提问,只用返回结果训练;还有一种是直接复制参数、源代码、内部数据或保密的训练流程,再做压缩。第三种情形里的复制和窃取,不会因为换了个”蒸馏”的名义就变得干净。
有两种想当然的判断需要修正。学生模型和教师模型能力接近,并不能证明代码被抄、秘密被盗,因为学生模型学到的通常只是输入和输出之间的统计关系。反过来,没复制权重也不代表流程就干净,采集和保存输出本身就可能碰到合同、版权、数据库权利、个人信息或非法访问的问题。
蒸馏和微调、检索增强也要分开看。微调讲的是参数怎么更新,蒸馏讲的是监督信号从哪里来;拿教师模型的输出去微调学生模型,两种说法都成立。检索增强只是在推理时把外部材料放进上下文,未必训练学生模型,它合不合法,回答不了蒸馏训练的问题。
教师模型身上挂着哪些权利
源代码、权重、训练集、系统提示、生成的答案和整体能力,在法律上是几样不同的东西。代码可能受软件版权保护;权重算不算作品,各法域要求不同,得由主张权利的一方来证明;技术秘密要同时满足秘密性、商业价值和保密措施三个条件。模型表现出的抽象能力、思想和数学规律,不会因为开发成本高就受版权保护。
输出的情况更杂。纯机器生成的事实性答案有没有版权,各国看法不一。如果输出里夹着用户创作的内容、他人的文章、程序代码,或者教师模型检索到的材料,这些第三方权利照样存在。服务商在条款里写”输出归用户所有”,只是在它和用户之间分配权利,替不了第三方授权。
开放权重也是同样的道理。一份模型能不能拿来蒸馏、训练竞争模型或者再分发,要看这一版的许可、上游基础模型的许可,以及附带的使用条件。许可文本里的”衍生模型”,范围可能比版权法上的”改编作品”更宽,合同约束和法定权利得分开核对。
几起公开事件说明了什么
先看 DeepSeek 的 R1。据该项目的公开说明,项目公开了用 R1 生成的材料训练较小 Qwen 和 Llama 系列模型的做法,并写明了上游许可:自己的代码和权重用 MIT 许可,部分蒸馏模型还要遵守 Qwen 或 Llama 的基础许可。这条路径的许可链条清楚,能够逐项核对。但这些只是项目自己的说明,法院既没有确认全部训练数据合法,它的存在也不能证明或否定外界对 DeepSeek 调用他人闭源模型的怀疑。
OpenAI 与 DeepSeek 的争议是另一回事。据媒体报道,OpenAI 和美国政府的顾问怀疑 DeepSeek 用了蒸馏,同时报道指出,当时没有公开证据足以确认侵权。报道能说明的只有争议存在。要判断,得查涉案账号接受的是哪一版协议、查询有没有超出授权、输出被拿去做了什么、有没有取得受保护的表达或秘密。2025年的行为要按当时的合同和法律评价,不能拿今天页面上的条款往回推。模型自称 ChatGPT、文风相似、跑分接近,最多只是线索。
Anthropic 的指控同样如此。据该公司公告,DeepSeek、Moonshot 和 MiniMax 借助约24,000个虚假账号,与其模型交互超过1,600万次;其威胁报告又说,Alibaba 在5月至7月间产生了超过1.51亿次交互。这些数字和归因都出自服务商自己的公告和报告,目前没有第三方核实,也没有任何裁判机构确认。只有这些事实最终被证明,才谈得上欺诈取得、访问控制和合同责任。报告里 illicit、attack 之类的用词,不能直接当成已经成立的罪名;请求量再大,也只是评估授权范围、损害和主观目的时的材料,本身算不上独立的违法要件。
美国政府这边,据官方公开文件,白宫科技政策办公室2026年4月23日发布 NSTM 4 备忘录,把正常蒸馏和它所称的对抗性大规模蒸馏区分开,提出信息共享、行业协作和防御措施。NSA、FBI 和 CISA 在9月8日发布联合安全公告。另据公开的议案信息,8月5日提出的 S.5252 议案目前只是参议院提出后转交委员会,还不是法律。备忘录、安全公告、议案和判决的效力各不相同,没有哪一份能说明美国已经全面禁止 AI 蒸馏。
最后是 Thomson Reuters 诉 ROSS。据公开判决文本,美国第三巡回上诉法院9月29日在 No.25-2153 判决中,维持了地区法院的部分简易判决:Westlaw 的2,243条 headnotes 具有原创性,ROSS 拿它们训练直接竞争的法律检索工具,不构成合理使用。法院关注的是竞争性使用,以及对原有市场和训练材料许可市场的影响。这个案子复制的是训练材料,不属于向教师模型提问取得输出的典型蒸馏,可以类比,但还没有对所有 AI 训练或蒸馏下结论。
美国:版权之外,合同和访问权限更要紧
美国版权法第102条(b)项把思想、程序、过程、系统和方法排除在保护之外。机器输出如果缺少足够的人类创作,也拿不到版权,美国版权局2025年的报告谈过这一点。原告只说”你学到了我的能力”,在版权上是站不住的。
如果教师模型返回的是受保护的文章或代码,采集、存储和训练就可能构成复制,需要按第107条的四个因素分析合理使用。商业用途不会自动败诉,”转换性”的说法也代替不了四因素。2025年 Bartz v. Anthropic 案的地区法院裁判,把模型训练和盗版材料库的取得、保存分开评价。它与 ROSS 案的材料和记录都不同,不宜只挑一个来概括全国规则。
合同是更直接的一条路径。OpenAI 现行商业服务协议第3.3条限制用输出开发竞争性 AI 模型,同时列了例外;第4.1条安排双方之间的输出权利。要认定违约,还得证明用户受该版本合同约束、条款明确、行为落在禁止范围内,并处理州法、条款效力和版权法优先适用这些问题。网上挂着一份协议,不代表每个取数的人都同意了;与竞争者签过的明确协议,和普通公众的浏览,法律基础也不一样。
商业秘密方面,美国《商业秘密法》要求信息具有独立经济价值并采取了合理保密措施,同时明确独立开发和反向工程不属于不正当手段。API 对外返回的内容算不算秘密,要逐项证明;未经授权拿走内部权重、代码或非公开的训练材料,则与正常观察输出完全不同。
访问方面,最高法院在 Van Buren v. United States 中,对《计算机欺诈与滥用法》里”超越授权访问”作了较窄的解释:违反使用目的的限制,不会一律变成计算机犯罪。盗用凭证、进入无权访问的区域或绕过账号屏障,仍可能触犯该法。DMCA 第1201条要求被规避的是有效控制作品访问的技术措施,一般的限流和地域限制,通常达不到这个标准。
所以在美国,有完整权利和访问基础的蒸馏是允许的;用合同明文禁止的方式训练竞争模型,可能构成违约;秘密侵害、非法访问和版权责任,各有各的要件。
欧盟与英国:例外都有门槛
欧盟《数字单一市场版权指令》(2019/790)里有两条文本与数据挖掘的路径。第3条供研究机构和文化遗产机构做科学研究,要求材料可合法访问;受商业企业决定性影响、又让企业优先获得成果的机构,可能不算研究机构。第4条范围更宽,商业目的也可以,但只要权利人用适当方式明确保留权利(在线材料可以用机器可读的方式),这条路就走不通。第7条规定,违反第3条等例外的合同条款不可执行,第4条没有这样的保护。所以商业蒸馏不能拿”网上看得到”当理由,对权利保留和合同条件视而不见。
用受保护的输出做自动分析、生成训练信号,有可能落入挖掘例外,前提是它确实属于分析,而且复制的材料、权利和行为都在例外覆盖范围内。这是从规则目的作出的推论,欧盟法院并没有就蒸馏作过统一裁判。成员国的实施规则也要单独核对:德国著作权法第44b条要求在线作品的保留采用机器可读形式,并要求删除不再需要的复制件,第60d条另外规定了科研的条件;法国知识产权法典 L122-5-3 则把科研和一般挖掘分开规定。
软件和数据库的规则同样相关。欧盟法院在 SAS Institute v. World Programming(C-406/10)中认为,软件功能、编程语言和数据文件格式本身不是版权保护的表达,这为区分”学功能”和”抄表达”提供了依据。但判决里关于合法用户观察权的说法,没法直接推广成对远程 API 的任意提取权。数据库指令(96/9/EC)第7条保护在内容取得、核实或呈现上有实质投资的数据库,模型生成新答案的投入与此并不相同;如果实际抓取的是整理好的输出数据库,则另当别论。《商业秘密指令》(2016/943)承认独立发现,允许对合法取得的产品观察、研究、拆解和测试,同时禁止违反保密或限用义务的取得。
AI 法案第53条要求通用 AI 模型的提供者建立版权合规政策,包括识别并尊重权利保留,还要公开训练内容摘要。开放许可模型可以免除部分文档义务,版权政策和训练摘要不在其中。蒸馏出来的学生模型如果属于通用模型,提供者可能要自己承担这些义务。这些义务从2025年8月2日起适用,此前已上市的模型,过渡期到2027年8月2日。2026年对高风险系统时间表的调整,不应当被理解成通用模型的版权义务也整体推迟。提示词和输出里如果含个人数据,还要符合 GDPR;欧洲数据保护委员会 Opinion 28/2024 要求逐案判断模型是否匿名,不能因为材料叫”合成数据”就当作匿名。
英国的门槛更高。CDPA 1988 第29A条允许对合法取得的作品副本做计算分析,但研究必须仅以非商业为目的,通常还要标明出处。这一条不是商业训练的通行证,符合条件的行为也不能被合同排除。真正做非商业研究、又合法访问的蒸馏,可以用这个例外;商业训练,或者把研究副本用在商业学生模型上,光凭”研发”的名义不行。英国另有第9(3)条的计算机生成作品制度,美国”没有人类创作就没有版权”的结论不能原样搬过来。2026年3月的政府报告明确,此前设想的宽泛例外加退出机制已不是优先方向,报告本身也不是立法文本。数据库权、合同、保密信息和《计算机滥用法》,各自独立适用。
中国:新修订的反不正当竞争法是重点
先说著作权。著作权法第3条要求作品具有独创性,模型功能相近,不等于复制作品;AI 输出有没有体现人的独创性投入,要个案判断。第24条是列举式的合理使用,没有新加坡那样的商业计算数据分析例外,个人学习、研究或课堂教学的有限使用,很难扩大到企业批量采集、开发替代产品。第49条、第50条的技术措施规则也要单独检验,验证码、API 配额、地域封锁,不是有了就一定构成受保护的技术措施。
更要紧的是2025年修订、2025年10月15日起施行的反不正当竞争法。第10条规定商业秘密侵害;第13条第3款针对以欺诈、胁迫、避开或破坏技术管理措施等不正当方式,获取、使用其他经营者合法持有的数据,损害其合法权益、扰乱竞争秩序的行为。这条保护的利益,不要求每条输出都有著作权,但也不等于服务商对所有数据都有绝对的所有权。
照这一条推论,用虚假身份或规避技术管理措施组织取数、用于竞争性蒸馏,如果同时满足数据合法持有、手段不正当、造成损害和扰乱竞争秩序,可能构成数据不正当竞争。正常付费查询,或者经许可使用输出,不会因为省下了自己的训练成本就违法。法释〔2020〕7号第14条认可自行开发和反向工程,但先用不正当手段获取秘密、再说自己是反向工程的,法院不支持。要把这条用到云端黑箱的蒸馏上,得证明到底拿到了什么技术秘密、依据是什么,不能把”教师模型的能力”当作一项边界清楚的秘密。
合同上,民法典第496至498条规定了格式条款的订入、提示说明和效力。明确禁止用于竞争模型的条款,只要有效订入又没有无效事由,就可以作为违约的基础;平台写了限制,并不意味着对所有人自动生效。《生成式人工智能服务管理暂行办法》第7条要求使用合法来源的数据和基础模型、尊重知识产权,它主要管向境内公众提供的服务,不向公众提供服务的科研和内部研发,依第2条区别处理,但仍受著作权、秘密和个人信息等一般法律约束。如果把真实用户的对话输入境外教师模型的平台,个人信息保护法第13条,以及提供给其他处理者、向境外提供的规则,也可能单独适用。
综合来看,中国没有针对蒸馏技术本身的禁令。获得授权、使用自有数据,或者不涉及受保护表达和秘密的功能学习,可能合法;批量的竞争性取数,要适用已经生效的第13条新规则,而不是还引用2019年的旧条号。是否构成犯罪,要看具体罪名的构成要件,不能从民事违约直接推出来。
日本、新加坡、韩国:宽严差得很远
日本著作权法第30条之4,允许在不以享受作品所表达的思想感情为目的的必要范围内利用作品,信息解析是其中一种用途,商业目的本身并不排除适用。以统计规律或任务能力为目标的蒸馏,因此比英国的商业蒸馏有更明确的版权基础。不过,如果训练目的包括让模型输出特定作品的表达供人欣赏,就可能不符合这一条;即使符合,为信息解析而销售的数据库被无偿复制、相关市场受到不当损害,仍然可能触发但书。文化厅2024年的说明强调训练和生成要分阶段判断,它只是解释性文件,不是判决。版权例外也消除不了有效的 API 合同、秘密取得和个人信息保护法的约束。
新加坡2021年《版权法》第243条规定的”计算数据分析”,包括用计算机分析信息,以及利用材料改进程序功能;第244条设定了条件。新加坡知识产权局明确说过,这个制度可以涵盖机器学习训练,不限于非商业研究。关键条件是:合法访问原副本,训练副本只用于计算数据分析或准备工作,并限制向他人提供副本的目的。绕过付费墙不算合法访问。第187条还限制合同排除这类允许的使用,行为完全符合第244条时,单纯写着”不得做计算分析”的条款,可能无法执行。但这不等于对方必须向你提供 API 服务,身份欺诈、盗用凭证和独立的秘密侵害,也不能靠这个例外免责。
韩国著作权法第35条之5规定了公平利用:不与作品的一般利用方式冲突,不会不当损害作者的正当利益,并考察使用的目的与性质、作品种类和用途、使用部分的比例与重要性,以及对现实和潜在市场的影响。报告核对的是2026年8月11日施行的版本。政府2026年2月26日公布的促进 AI 学习使用作品的政策和指引,仍然以逐案评估和四因素为基础,其中拟议的制度或责任减免,还不是已生效的商业蒸馏豁免。公平利用只是一项可以争辩的抗辩,不是所有训练的预先许可;即使成立,也不会自动排除合同、秘密、计算机访问和个人信息保护的义务。
印度、加拿大、澳大利亚、巴西:商业训练的空间有限
印度《版权法》第52(1)(a)条对私人或个人使用(含研究)规定了合理处理,软件另有合法持有、互操作和观察研究的特定例外。一般商业生成模型的批量蒸馏,很难直接归入私人或个人研究,软件互操作的例外,也不能扩展成重建竞争模型的一般权利。《信息技术法》第43条处理未经许可访问、下载、复制或提取数据的行为,第66条对有不诚实或欺诈等主观条件的行为规定了刑事责任。盗用账号取得输出,和合法付费后违反限用协议,是两种性质不同的行为。
加拿大《版权法》第29条以研究、私人学习、教育等目的作为入口。CCH Canadian v. Law Society of Upper Canada(2004 SCC 13)的做法是先确认目的,再审查利用是否公平,”研究”不限于非商业情境。商业研发因此没有被一概排除,但数量、替代方式、对作品的影响等因素,仍可能使大规模的商业复制得不到免责。第30.71条的临时技术复制例外,也要求用途本身不侵权,长期保存的蒸馏训练集,一般不算短暂处理的副本。
澳大利亚《版权法》第40条允许为研究或学习进行合理处理,要考虑目的、作品性质、能否在商业上取得、使用的影响,以及数量与实质性。公司做研发,不会因为商业身份就不能主张研究,但批量复制竞争者的训练材料,只靠”研发”的名义也过不了公平性这一关。澳大利亚没有一般性的商业文本与数据挖掘例外,总检察长在2025年10月26日声明,政府不考虑设立这样的例外。
巴西第9.610/1998号法第8条把思想、程序和数学概念排除在保护之外;第29条规定复制等使用原则上要经授权;第46条列举了私人少量复制、引用等限制。学习一般功能或事实不构成侵权;但要把有限引用和私人复制,扩展到为替代性竞争服务建立整批训练集,条文上找不到依据。PL2338/2023 等 AI 议案,现在还不能当作训练许可来用。
十一个法域的相关规定简要对比
| 法域 | 受保护材料训练的主要路径 | 反蒸馏合同的主要边界 | 结论 |
|---|---|---|---|
| 美国 | 授权,或逐案适用第107条合理使用 | 成立与可执行性依州法及联邦优先适用判断 | 没有统一的技术禁令,竞争性复制风险明确 |
| 欧盟 | DSM 指令第3条科研例外、第4条一般挖掘例外 | 第3条受第7条保护;第4条可被权利保留排除 | 合法访问、主体资格、权利保留和成员国实施都会影响结果 |
| 英国 | 第29A条非商业研究;其他用途通常需授权或其他例外 | 合格的第29A条行为不得被合同排除 | 非商业研究例外不能用于商业蒸馏 |
| 中国 | 授权,或符合著作权法第24条等法定限制 | 审查格式条款的订入、提示说明与效力 | 没有一般商业挖掘例外;不正当取数可独立违法 |
| 日本 | 第30条之4非享受性利用及其但书 | 版权例外不自动排除独立合同责任 | 信息解析型蒸馏可能被允许;复现表达、损害权利人利益是界限 |
| 新加坡 | 第243至244条计算数据分析 | 第187条限制合同排除该例外 | 商业训练可进入例外;须合法访问并限制训练副本的用途 |
| 韩国 | 第35条之5公平利用,逐案判断 | 行政指引不能使合同当然失效 | 采用 AI 并不当然免责 |
| 印度 | 第52条特定目的的合理处理及软件特定例外 | 合同与保密义务独立适用 | 一般商业生成模型的蒸馏,难以套用私人研究例外 |
| 加拿大 | 第29条列举目的,加公平性两步分析 | 合同、技术措施和秘密义务分别审查 | 研究可含商业目的;批量训练未必公平 |
| 澳大利亚 | 第40条等目的型合理处理;授权 | 合同与技术措施另行判断 | 没有一般商业挖掘例外;研究的公平性需要证据支持 |
| 巴西 | 第46条等特定限制;授权 | 合同、秘密与数据保护另行判断 | 有限引用或私人复制,不能扩大到大规模商业训练 |
各国相通的几点
输出没有版权,行为也未必就没有约束。教师模型的每条输出都不含受保护表达,版权上的复制请求可能败诉,但有效的服务协议、秘密限用、数据不正当竞争或访问规则仍然可能适用;反过来,服务协议无效,或者当事人没同意,复制第三方作品也不会因此合法。
教师模型被指控过,不影响学生模型这一方的责任判断。教师模型曾被指使用他人作品,不改变它对合同、代码或真实商业秘密的权利,学生模型的开发者也不能借此随意使用第三方表达。如果教师模型无权授予某部作品的许可,学生模型的开发者得另外找授权或法定例外。
民事、行政和刑事责任分开成立。没有授权不一定就是犯罪:版权请求要证明作品和受控制的行为,违约要证明有效合同,秘密侵害要证明具体的秘密和不正当取得或使用,非法访问要证明权限和法定的主观要件,行政监管则看主体、服务和地域。
跨境训练不会自动适用最宽松的法域。账号合同可以选择外国法和争议解决地,但通常排除不了适用的强制性规范。采集、存储、训练和投放市场的地点可能各不相同,版权例外一般依属地法分析,服务器放在日本或新加坡,覆盖不了在别处发生的复制。向欧盟投放模型、真实用户对话跨境传输、面向中国境内公众提供服务,都会各自带来监管义务。
专利等其他权利也不会因为蒸馏而消失。独立开发或合法反向工程,在版权和秘密的分析里分量很重,但免不了有效专利的权利要求。冒用教师模型的品牌、混淆来源,则是另一类问题。
判断一个具体项目,先备齐这些材料
一个蒸馏项目是否合规,取决于这些事实:教师模型的权利和许可版本,账号和协议的主体,访问方式,提示词和输出样本,数据里有没有第三方作品或个人信息,保存和分发的方式,学生模型的训练目标和产品市场。具体到证据,访问日志、付费和身份记录用来证明数据怎么拿到,训练数据的来源和版本用来证明用了什么,受保护表达的比对用来证明有没有复制,秘密清单和保密措施用来证明有没有秘密可言。风格相似、成本更低、能力接近,这些单独都不能替代以上证据。
前面提到的1,600万次和1.51亿次,说明的是规模,不是性质。能说明性质的是账号背后的协议、访问的方式和取得的内容。在这些证据齐备之前,结论宁可留有余地,也不该拿商业竞争关系代替违法的证明。
事件部分的事实来自企业公告、项目说明、媒体报道和政府公开文件,企业的说法仅代表企业自己的陈述。法律与事实核对截至2026年10月1日;涉及历史行为的,应适用行为发生时的文本。本文为法律比较研究,不构成对具体案件或项目的法律意见。
引用与继续阅读
AI蒸馏合不合法?十一个法域的规则比较|AIILAW.cn|2026-10-01|https://aiilaw.cn/ai-distillation-legality-eleven-jurisdictions-20261001/