手机中国 21小时前
AI企业通过中间商大量采购旧书 训练模型后销毁实体书
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

【CNMO 科技消息】近日有调查报道显示,多家头部 AI 企业正通过中间商秘密采购数百万本二手书籍,扫描提取内容作为 AI 模型训练数据,完成数字化后将实体书销毁。

AI 模型训练需要大量高质量的原创数据,但目前网络上存在大量低质量 AI 生成内容,会污染训练数据池,影响模型训练效果。因此 AI 企业将目光转向 2022 年之前出版的纸质印刷书籍,这类内容大多为人类原创,受 AI 生成内容污染的概率更低。

此前已有相关案例出现,AI 企业 Anthropic 曾投入数百万美元,采购大量纸质书籍提取信息训练 Claude 模型,扫描后将实体书销毁,该公司曾因存储 700 万本盗版书籍用于训练,被处以 15 亿美元罚款。近期也有出版联盟起诉 Google,指控其非法使用数百万本版权书籍训练 Gemini 模型。

据书籍数据库平台 ISBNdb 的数据,今年 4 月起二手书批量订单明显增长,单笔订单规模从 1000 本到 100 万本不等,采购没有特定的题材、类型或作者倾向,且采购方对价格不敏感,即使溢价也会直接购买。有二手书卖家透露,此前销量好时每周能卖出约 20 本书,近期每周销量暴涨至数百本,是常规销量的五倍,其他二手书平台也出现了类似的批量订单增长。

为了提高效率、降低成本,AI 企业大多选择破坏性扫描方案,拆除书籍装订后将单页送入高速工业扫描仪扫描,最终导致数百万本实体书被销毁。目前争议主要集中于两方面:一是 AI 企业扫描过程中是否会筛选稀有或绝版书籍,这类书籍退出流通可能造成公共文化资源损失;二是扫描后的书籍内容会进入私有数据库用于 AI 训练,普通公众无法访问,相关知识不能被社会共享。

版权所有,未经许可不得转载

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 书籍 数据库 污染 效果
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论