切换为使用验证码登录
2026年5月5日,全球学术出版巨头爱思唯尔等五家出版商,在纽约南区法院起诉 Meta 及扎克伯格,指控其用 Sci‑Hub 等盗版学术论文与书籍训练 Llama 大模型,构成大规模版权侵权。

(相关内容呈现在nature官网)
原告方称,Meta科技公司在开发大语言模型时,获取并复制了受版权保护的内容。
目前,美国已有多起类似诉讼,不过,尽管部分案件已经达成和解,美国法院尚未就“使用版权内容训练大型语言模型是否合法”形成明确司法先例。
尽管AI科技企业通常不会公开训练数据来源,但外界普遍认为,大量用于训练模型的网络数据中,既包括开放获取的学术论文,也包括付费墙内的研究文章。
原告方认为,Meta科技公司在训练大语言模型时使用了“Common Crawl”数据集,该数据集通过互联网爬虫收集形成,包含数十亿网页样本。
原告方认为,其中很可能包括未经授权复制的版权内容,例如科学论文摘要以及付费论文。
这份诉状还称,Meta科技公司从多个网站下载并通过BitTorrent文件共享方式获取作品,其中包括Library Genesis(LibGen)和Sci-Hub。LibGen收录大量图书、研究论文和教材;Sci-Hub则提供数百万篇科研论文和书籍的免费访问服务,这两个网站均长期涉及版权争议和法律诉讼。
扎克伯格作为另一位被告,他被指控亲自批准盗版策略。

(此次事件的集体诉讼起诉状首页)
在小编看来,这起诉讼的焦点涉及到整个AI版权领域最核心的法律问题——
使用受版权保护的材料训练AI,是否属于美国版权法中的“合理使用”?
Meta作为被告方则认为,这一方式属于合理使用,他们主张AI训练是“变革性创新”,应受法律豁免。况且,就在2025年,法院曾初步裁定Meta对作家作品的训练暂属“合理使用”。
近年来,围绕AI模型训练的法律争议已成为科技界的常态,2025年,AI公司Anthropic就曾为平息作家的集体版权诉讼,同意支付高达15亿美元达成和解。
但此前 AI 版权诉讼多为作家、媒体(如《纽约时报》),爱思唯尔是首个顶级学术出版商,标志战场从通俗出版转向科研数据核心领域。
可以说,后续的具体判决,不论对于学术资本还是AI巨头,影响都将是巨大的。
若原告胜诉:
AI 公司必须付费授权学术数据,训练成本激增;
Sci‑Hub 等盗版站被进一步定性为侵权源头;
出版商可向所有 AI 企业索赔,重塑数据定价权。
若 Meta 胜诉:
“合理使用” 门槛大幅降低,AI 可免费使用海量版权内容;
学术出版商丧失对科研数据的商业控制权;
全球 AI 训练成本骤降,加速技术迭代。
战火刚刚开始,暂时还没有后续,小编将持续跟进案件的重要节点,一旦有相关后续将第一时间发布在本公众号。
洞悉学术热点,触碰行业水温。
这里是赛恩斯学术公众号,期待你的关注。
