司法部下场,AI版权案要变天?
纽约时报诉OpenAI案因证据问题对OpenAI日益不利之际,美国司法部提交《美国利益陈述书》,用三段拆解法主张模型训练构成合理使用,并驳斥市场稀释理论。本文拆解司法部的论证框架、这道法律防火墙的产业含义,以及版权维权路线的可能转向。
司法部下场,AI版权案要变天?
当OpenAI在版权诉讼里因证据问题节节败退时,一纸《美国利益陈述书》让整个案子变味了。美国司法部向纽约南区联邦地区法院亮明态度:大语言模型训练阶段使用作品,构成合理使用。这不是和稀泥的表态,而是一套完整的法律拆解框架——把训练从侵权指控的连环套里单独摘出来。本文拆一拆司法部的论证逻辑,以及它对AI产业真正的分量。
📉 证据先输了半局,OpenAI被动挨打
打官司,三分道理,七分证据。
纽约时报起诉OpenAI的诉状里,最狠的一招不是讲法理,而是摆现场:直接展示ChatGPT能够复述、甚至逐字吐出其文章内容。对法官和陪审团来说,这一幕的冲击力远超任何法条引用——你训练出来的东西能原样吐出我的文章,那训练用的原料是什么,还用问吗?
版权人起诉大模型公司的经典套路,就是把两件事绑在一起:未经许可抓取作品是因,生成近似内容是果。训练用的是赃物,产出的也是赃物,训练的目的就是为了实质性替代版权人的作品。这个三段论一旦成立,AI公司几乎无路可逃。
更要命的是OpenAI自己的操作。据案件进展披露,OpenAI对法院进行了误导性陈述,并隐匿了输出日志这一关键证据。在诉讼里,隐匿证据是致命伤——它不仅让对方的主张获得间接印证,还直接消耗法官对一方的信任。案子因此走向对OpenAI日渐不利。
多位诉讼律师私下交流时的看法很一致:这类案件里,技术性失分比法理失分更难挽回。法理可以上诉,信任很难重建。
就在这个节点,司法部出手了。
⚖️ 釜底抽薪:把AI运作拆成三段
司法部的打法,是不接原告的招。
原告要把抓取、训练、输出焊成一条链,司法部偏要把这条链剪成三截:训练数据的获取、模型训练、模型输出。然后逐段定性。
第一段:训练数据的获取。司法部认为,这一阶段的数据使用是纯粹的技术行为——模型不是在阅读文章,而是在学习语言的统计规律,通过统计学习提取抽象知识。这与传统的复制粘贴式侵权完全不同,更类似于人类阅读大量书籍后形成自己的知识体系。
第二段:模型训练。这是司法部论证的核心。训练是针对特定任务对模型进行优化,数据使用具有高度转换性——把原始数据转化为全新的、有独立价值的模型能力。而按美国版权法的合理使用规则,转换性使用正是判断合理使用的关键因素:对原作品进行了新的表达、新的意义或新的信息传递,比如评论、学术研究。
第三段:模型输出。司法部明确切割:即使输出偶尔与原作品高度相似、甚至构成侵权,也不影响训练阶段的合法性。输出端的侵权风险,与训练端的合理使用认定,是两个独立的法律问题。
司法部还援引了美国最高法院和第二巡回法院关于Google扫描图书、软件代码等案件的判例,强调版权作品被用于全新的技术目的时,即使存在完整复制,也可能属于合理使用。这是有判例传统的路线,不是凭空造法。
三个环节,三种定性,一张表看懂:
| 环节 | 司法部定性 | 法律逻辑锚点 |
|---|---|---|
| 训练数据获取 | 纯粹技术行为 | 统计学习,近似人类阅读 |
| 模型训练 | 高度转换性使用 | 转换性是合理使用关键 |
| 模型输出 | 独立法律问题 | 输出侵权不连带训练 |
🧱 一道法律防火墙,链式指控被切断
防火墙的意义,在于火不再串门。
回头看原告的指控结构,本质是一条链式攻击:抓取侵权→训练污染→输出近似→实质替代。四个环节互为因果,只要打穿任何一环,整条链就成立。
司法部的三段拆解,等于给AI企业修了一道法律防火墙:训练阶段的合法性,不受输出阶段争议的连带影响。在这套框架下,训练阶段对版权作品的复制被孤立出来单独评价——输出端是否生成侵权内容、是否替代人类创作者,那是另一个问题,不能倒过来污染训练阶段的合法性。
这个设计的产业含义非常大。过去AI公司在版权诉讼中最怕的不是输掉赔偿,而是被要求推倒重来:一旦训练行为本身被定性为侵权,法理上的终点就是销毁模型或回滚数据。而防火墙框架下,即便个别输出构成侵权,救济也限于个案——模型本身是合法的。
当然,防火墙不是免死金牌。输出端侵权该赔还得赔,训练与输出只是两本账,不是零本账。
🔥 市场稀释理论,为什么被驳
第二个战场,是合理使用的底线问题。
合理使用有一个前提:不能不合理地损害原作者的利益。版权方在近年的AI诉讼中祭出的核心武器,是市场稀释理论——就算AI生成内容没有复制某一篇具体作品,只要它在整体上稀释了原作品的市场,就构成对原作者利益的损害。
这个理论的杀伤力在于绕开逐字证据:不需要证明模型吐出了你的文章,只需要主张整个AI内容生态在抢你的读者、你的广告、你的授权费。
司法部在陈述书中重点驳斥了这一理论。其脉络可以参照2025年Kadrey诉Meta案的判决——法官当时已表达过类似立场:即便AI生成的文章、图片、音乐没有复制某一篇具体作品,市场损害的主张也不能靠想象成立。稀释必须有具体市场、具体证据支撑,泛泛的替代焦虑,不构成否定合理使用的理由。
业内流传的一句概括很传神:版权人要证明的是市场真的丢了,而不是担心市场会丢。
这一段论证落地的效果,是给合理使用补上了最后一块拼图——即便法院认定训练具有转换性,版权方还可以退守市场损害这一关。司法部把这条退路也堵上了。
💡 对AI产业意味着什么
政策表态的价值,在于给成本定价。
训练数据的版权成本,是悬在所有大模型公司头上最大的不确定性之一。如果训练阶段被认定侵权,理论上每一份训练语料都是负债;如果构成合理使用,语料获取的法律成本趋近于零,竞争重新回到算力、算法和产品上。
司法部的立场如果最终被法院采纳,至少带来三个确定性:
- 训练端合规确定性提升:存量模型的合法性有了辩护框架,不用担心被一锅端;
- 版权维权路线转向:版权人大概率会从训练端转向输出端取证和个案索赔,以及向前端的授权谈判要价;
- 证据纪律成为新门槛:OpenAI因隐匿输出日志付出的代价说明,技术侧的日志留存、可审计性,正在变成模型公司的诉讼基础设施。
timeline上的关键节点,串起来看很清晰:
- 纽约时报起诉OpenAI,展示ChatGPT逐字输出其文章
- OpenAI被指对法院误导性陈述并隐匿输出日志,案件走向不利
- 2025年:Kadrey诉Meta案,法院对市场稀释主张表达保留态度
- 近期:美国司法部提交《美国利益陈述书》,主张训练构成合理使用
当然,一纸陈述书不是判决。司法部在OpenAI案中的立场能否被纽约南区法院采纳、会不会被上诉法院改写,都还有变数。但方向已经很清楚:监管层面开始为AI产业的技术逻辑背书,而不是任由版权逻辑按传统媒体时代的框架套裁一切。
小结
司法部这份陈述书,本质上是一次产业立场的选择:把模型训练定义为统计学习而非内容复制,用三段拆解切断版权方的链式指控,再驳掉市场稀释这条退路。对AI公司,这是训练端合法性的护身符;对版权方,维权重心将转向输出端与授权谈判。真正的判决还没落地,但规则的轮廓,已经比半年前清晰得多。接下来的看点,是法院接不接这道防火墙——以及版权人还能在输出端挖出多少实锤。