财联社 4小时前
AI巨头成“焚书”祸首?马斯克火速撇清:已要求SpaceXAI无损扫描书籍
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

AI 企业购书取训练语料引版权纠纷,出版业有望受益

随着 AI 生成内容如潮水般涌入互联网,由人工创作的 " 干净语料 " 倏然变为稀缺资源。在这一趋势下,AI 巨头们将目光投向了纸质书籍。

日前,独立媒体 404 MediaX 一则报道指出,人工智能公司正在批量购买 2022 年前出版的珍稀书籍,利用液压切割机切除书脊并加以扫描,从而获取未被 AI" 污染 " 的干净数据(2022 年前出版的图书不包含 AI 生成内容)。

为防止数据再度流入市场,这些书籍在事后往往会被粉碎销毁。报道指出,Anthropic 曾销毁数百万册实体书,甚至包括存世量极少的绝版古籍。

据悉,这项行动被 Anthropic 称作 " 巴拿马计划 ",并且被美国联邦法院判决为合法。法院认定," 合法购买纸质书再加以破坏性扫描 " 的模式属于合理使用。

报道甫一公开,相关舆论迅速在社交媒体发酵:X 平台账号 Hedgie 转述此事时得到马斯克回复。后者表示:" 已经要求 SpaceXAI 团队保存图书馆中所有珍贵的书籍,并采用无损扫描方式,从而避免破坏书脊。"

Hedgie 对此回复称:" 感谢马斯克团队这样做,虽然扫描速度慢一些,但你们仍然可以获得训练数据。如果 SpaceXAI 能够坚持这样做,那么其他业内公司也应该以此为标准。"

无论采取何种方式获取数据,种种迹象表明,书籍已成为 AI 训练语料的重要来源之一。

如上述报道所述,ISBNdb 是一家提供大批量图书采购服务的公司,其号称拥有 " 全球最大的图书数据库 ",并于近年转型为 AI 企业的 " 图书数据供应商 "。《华盛顿邮报》则发现,Anthropic 已与 Better World Books 建立合作,后者是图书馆、零售商和个人出售旧书的平台。

在此背景下,海外出版传媒集团与 AI 企业之间频繁爆发法律纠纷:

7 月 22 日,新闻集团(News Corp)式向加州奥克兰联邦法院提起反诉,指控美国搜索引擎公司 Brave Software 未经授权大规模抓取并转售《华尔街日报》《纽约邮报》等旗下媒体的文章内容,用于人工智能模型训练。

7 月 14 日,一群主要出版商对谷歌提起诉讼,指控该公司非法使用数百万本受版权保护的书籍来帮助其构建 Gemini 人工智能模型,称这是 " 历史上最严重的侵犯版权行为之一 "。谷歌内部指出,如果将出版商提供的文本用于 Google Play 图书,公司可能面临 "100 亿至 1000 亿美元的潜在罚款 "。

中信证券研报指出,预计 2026 年文化 IP 数字化运营有望为出版业带来约 700 亿元增量空间。大模型训练需要大量的优质语料数据,出版企业所拥有的内容资产可以为模型提供丰富的优质语言素材。中泰证券表示,相关出版公司内容版权归属较清晰,垂类内容优势明显,有望跨越互联网、AI 等多个技术周期,成为持续发展的底层核心资产。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 马斯克 人工智能 谷歌 书籍
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论