长材茂学网

被指在 AI 训练中滥用盗版书籍,Adobe 面临集体诉讼

来源:长材茂学网-工人日报
2026-04-20 11:07:50

12 月 18 日消息,据外媒 TechCrunch 今日报道,一项由作家 Elizabeth Lyon 发起的集体诉讼对 Adobe 发出新的指控,称对方在训练 SlimLM 语言模型时,使用了包括 Lyon 本人的作品在内的大量盗版书籍。Lyon 来自俄勒冈州,长期从事非虚构写作,并出版多本写作指导类书籍。

Adobe 方面介绍,SlimLM 是一套面向移动设备文档辅助场景的小语言模型,其预训练基础为 SlimPajama-627B 数据集。该数据集由 Cerebras 于 2023 年发布,被描述为去重、多语料的开源集合。然而诉讼认为,SlimPajama 本身来源存在问题。

诉讼文件指出,SlimPajama 是在复制并加工 RedPajama 数据集的基础上生成的,而 RedPajama 包含广受争议的 Books3 数据集。Books3 收录约 19.1 万本书籍,其中包含大量受版权保护作品。

诉讼明确指出,作为 RedPajama 的派生数据集,SlimPajama 同样包含 Books3 内容,因此不可避免地纳入了原告及其他作者的版权作品。

围绕 Books3 和 RedPajama 的争议,早已不止于 Adobe。此前,苹果和 Salesforce 均因涉嫌在 AI 训练中使用相关数据集而遭到起诉,相关案件指控企业未经授权使用受版权保护内容。

在更广泛的行业背景下,类似诉讼正在成为常态。AI 模型对训练数据规模的高度依赖,使数据来源问题频频引发法律风险。今年 9 月,Anthropic 同意向多名作者支付 15 亿美元(注:现汇率约合 105.77 亿元人民币),就其训练 Claude 时使用盗版作品的指控达成和解。该案件被外界视为 AI 训练版权争议的重要节点,然而行业内持续扩大的法律挑战仍未终结。

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,所有文章均包含本声明。

责任编辑:长材茂学网

媒体矩阵


  • 客户端

  • 微信号

  • 微博号

  • 抖音号

客户端

亿万职工的网上家园

马上体验

关于我们|版权声明| 违法和不良信息举报电话:010-84151598 | 网络敲诈和有偿删帖举报电话:010-84151598
Copyright © 2008-2024 by {当前域名}. all rights reserved

扫码关注

长材茂学网微信


长材茂学网微博


长材茂学网抖音


工人日报
客户端
×
分享到微信朋友圈×
打开微信,点击底部的“发现”,
使用“扫一扫”即可将网页分享至朋友圈。