美国司法部罕见下场,在OpenAI与纽约时报的版权诉讼中提交了一份意见书。立场很明确:用受版权文本训练LLM,一般应算合理使用。司法部甚至用了“非凡转换性”来形容模型训练——言下之意,把人类文字变成参数和概率,不是简单的复制,而是当成了新东西来创造。这份意见书虽不带强制力,却给困扰行业许久的版权阴云投下一道难得的亮光。
真正值得玩味的是司法部的第二层论证:国家安全。它警告说,如果全面许可要求被确立为规则,美国AI开发者将被迫在每一个版权语料库面前停下脚步,整套基础设施的竞争力会被成倍拖累。注意,这不是纯法理辩论,而是把AI训练之争拉进了大国竞争的话语框架。翻译过来就是:法学上的合理使用边界,可能得为地缘政治博弈让路。这种论调显然不只为给OpenAI开脱,更像在给所有美国大模型公司做政策背书。
但意见书也留了一条关键的缝。它把“数据如何获取”和“模型是否复述了受保护段落”两个问题单独摘了出来,明确说这是要由法院逐案判断的独立事实。换言之,训练环节可以宽松,但输入端和输出端的合规底线并未松动。该案的法官并无义务采纳司法部的建议,可这份意见书已经重新划定了争论的重心——法律压力正从训练过程,悄然转向数据来源和生成结果的每一次具体对照。

