2026 年 9 月 18 日,纽约南区联邦法院解封了一批文件,里面包含了 OpenAI 和微软的内部记录。
材料显示,OpenAI 和微软通过采集别人生产的内容,训练自己的模型。
但这并不是个例,我们在网上记录的点点滴滴,如今正逐渐变成 AI 的 " 饲料 "。
AI 不会给你点赞、收藏或者转发,因为它压根不理解你创作的内容,只是把你留下的一切收进去,变成它自己的一部分。
于是写作、绘画、说话、歌唱、拍照,这些原本属于人的事,忽然变成了 AI 发展的核心。
但是你也不必太担心,有一个不知道是好是坏的消息,未来 AI 不会再把我们当成饲料了,因为它马上学会自己造饲料。
2026 年 9 月 17 日,纽约南区联邦法院解封了一批文件。这批文件来自《纽约时报》起诉 OpenAI 和微软的版权案,内容是两家公司的内部记录。
在一份内部备忘录里,微软应用科学总监布伦特 · 赫克特(Brent Hecht)把用全网内容训练大模型称为 " 一场规模前所未有的惊人盗窃 ",并说这很可能是 " 人类历史上最大的一次劳动盗窃 "。这句话出自被告公司的员工,不是原告的指控。
这起官司已经打了将近三年。
原告是《纽约 · 时报》,被告是 OpenAI 和微软。此前庭审的走向总体上支持 " 用版权内容训练模型属于合理使用 "。这批解封材料的不同之处,在于它提供的是被告自己的内部记录,而不是法律论证。
微软的内部测算显示,Copilot 上线后,《纽约 · 时报》域名的点击率相比传统 Bing 搜索最多下降 93%。
在内部演示文稿中,赫克特把这种下滑称为 " 死亡循环 ",认为它 " 会同时伤害我们模型的表现,也会伤害整个互联网 "。
他还写道,一个终端产品威胁到自己关键供应商的经济根基,这种情况极不寻常,但这是模型业务和它的 " 内容供应链 " 造成的局面。文稿中的 " 供应商 ",指的就是生产内容的新闻媒体。
ChatGPT 负责人尼克 · 特利(Nick Turley)在内部沟通中说,ChatGPT 这类产品对出版机构构成 " 生存威胁 ",而且 " 在很大程度上是替代性的 "," 随着它们变得更强,会越来越具有替代性 "。
OpenAI 总裁布罗克曼说,这些模型 " 非常擅长新闻 "。纳德拉在今年作证时承认,和聊天机器人对话 " 已经替代了直接去网站获取信息 "。
然而法律要求不能 " 替代或损害原作品的市场 "。
文件同时还给出了训练数据的规模。仅 OpenAI 的训练数据集中,就包含《纽约时报》《每日新闻》和调查报道中心的作品 91692 份拷贝。
在一个从 Common Crawl 派生的数据集中,仅 nytimes.com 一个域名就抓取了两百多万份文档。不过其他媒体表示,从《纽约时报》抓取 390 万份,从《芝加哥论坛》报及其相关报刊抓取 730 万份。
此外还有一个名为 Project Mango 的项目,其数据集包含至少 160903 部新闻出版方的独立作品。OpenAI 把整个 GPT-3 训练数据集交给了微软,微软则通过 Project Taxi 和 Project Mango 把数据回输给 OpenAI。
文件中还记录了具体操作方式。
OpenAI 研究员尼克 · 赖德(Nick Ryder)告诉布罗克曼,自己有一个 " 绕过纽约时报付费墙的黑客方法 ",布罗克曼回复 " 不错 "。
两人搭建的数据集 WebText、WebText2,有相当大一部分是从网上直接抓来的新闻报道。还从 Common Crawl 拉取了数百万篇文章。
此外,在数据进入模型前,他们会刻意删除版权声明,因为研究人员 " 不想让模型向用户输出‘版权声明’ "。
原告代理律师史蒂文 · 利伯曼(Steven Lieberman)说,证据表明,OpenAI 和微软知道自己在做的事是错的。
微软对这批文件回应称,相关言论只是反映了一名员工的个人观点,不是法律分析,更不代表公司立场。赫克特并非决策者,公司雇他是为了 " 呈现不同的、非对称的视角 "。
实际上 OpenAI 已经是 " 二进宫 " 了。
2023 年 9 月,美国作家协会连同 17 位作家,如约翰 · 格里森姆(John Grisham)、乔治 · R · R · 马丁(George R. R. Martin)、朱迪 · 皮考特(Jodi Picoult)、大卫 · 鲍尔达奇(David Baldacci)、乔纳森 · 弗兰岑(Jonathan Franzen)、斯科特 · 图罗(Scott Turow)等人。
在纽约南区对 OpenAI 提起集体诉讼。此后,多起作家诉讼(特伦布莱(Tremblay)、西尔弗曼(Silverman)、夏邦(Chabon)等)陆续并入,原告规模还在扩大。
《纽约 · 时报》诉状里的证物 J,标题叫《GPT-4 记忆〈纽约 · 时报〉内容的一百个例子》,整整 127 页。喂给它一篇文章的开头,它能几乎逐字补完剩下的部分,连署名和引语都在。
2026 年,arXiv 上发布了一篇名为《对齐打地鼠》的论文。
研究者把模型微调成 " 按情节写全文 " ——只给情节摘要,不给原文。结果 GPT-4o、Gemini 2.5 Pro 能复现出 85% 到 90% 的版权书籍原文,单段逐字复现超过 460 个词。研究者给这种现象起了个名字,叫 " 对齐打地鼠 ":你堵住一个漏洞,它在别处又冒出来。
这不是偶然。尼古拉斯 · 卡尔利尼(Nicholas Carlini)早在 2023 年就说过:模型越大、你那段数据被重复喂的次数越多、上下文给得越足,它记得就越死。
实际上扒取网上的公开资料,把人们的记录变成 AI 饲料的,远不止于 OpenAI 和微软。
2026 年 9 月 4 日,一起集体诉讼递到了伊利诺伊北区联邦法院。原告是两个家庭,连同他们的孩子。诉状指控 Meta 未经同意,抓取 Facebook 和 Instagram 用户的照片和生物特征数据,用来训练三样东西:人脸识别系统 NameTag 背后的模型、给 NameTag 做比对用的 " 人脸指纹 ",以及生成式图像模型 Emu 和 Muse Image。
NameTag 是给 Ray-Ban 和 Oakley 智能眼镜准备的。早在 2026 年 6 月初,就有人发现在 Meta 的配套 App 里存在 NageTag 相关的代码,只不过当时并不知道这个功能是干什么用的。
Meta 的回应是:" 这起诉讼没有依据,曲解了我们的工作 ……NameTag 没有向消费者发布,也没有最终决定要做什么。" 它还强调,自己 " 不是在建立一个通用的人脸数据库 "。
话虽如此,但 Meta 已经是第三次因为人脸识别被告上法庭了。
2021 年,它因为 " 自动标记好友 " 违反伊利诺伊《生物识别信息隐私法》,赔了 6.5 亿美元,约 142 万伊利诺伊用户分钱,有人拿到了 400 多美元。2023 年,Instagram 的人脸识别又让它赔了 6850 万美元,约 400 万伊利诺伊居民符合资格。Snap 也因类似问题在 2016 年赔了 3500 万美元。
这部法律的罚则是每人每项 1000 到 5000 美元。
从金额来看,以 Meta 的用户规模,Meta 可能要赔付超过 10 亿美元。不过 Meta 仍然选择付钱,毕竟相对于赔偿而言,法庭并没有阻止 Meta 继续开发模型,因此赔偿仍在可接受的范围内。
Meta 的采集对象,也不只是用户。
2026 年 4 月 21 日,Meta 在美国员工的工作电脑上安装一款追踪软件,实时记录鼠标移动、点击位置和键盘输入,并定期截屏,用来训练它的 AI 模型。
这款工具叫 " 模型能力计划 "(Model Capability Initiative)。Meta 首席技术官安德鲁 · 博斯沃思(Andrew Bosworth)在内部备忘录中说,长期目标是把 AI 智能体培养成 " 承担工作 " 的角色,人类员工则转为 " 指挥、审查和协助改进 "。
这个项目后来改名为 "Agent 转型加速器 "。Meta 的发言人称,这些数据只用于训练模型,不用于绩效考核,并设有保护敏感内容的措施。
但据媒体报道,采集范围覆盖员工日常使用的各类应用和网站,包括谷歌、GitHub、Slack,甚至个人 Gmail;美国员工无法退出,只有受欧盟《通用数据保护条例》约束的欧洲员工被排除在外。
同一周,Meta 裁掉约 8000 名员工,不少员工因此担心,自己正在亲手训练将来取代自己的 AI。到 2026 年 6 月,Meta 暂停了这项计划,原因是追踪工具抓取到了敏感信息,且这些信息一度被全公司访问。
Meta 的手,也不只伸向自家平台。
Meta 专门有个用来扒视频内容的爬虫,名为 MSAE。Meta AI 自己承认,训练数据里有 370 万条 YouTube 视频转录文本的第三方数据集。
2026 年 1 月,包括 h3h3 Productions、Mr. ShortGame Golf、Golfholics 在内的几位 YouTube 博主,合计 620 万订阅,在加州中区联邦法院起诉 Snap,指控它用后端自动化工具,把数百万条 YouTube 视频的视听文件成批下载下来,塞进 HD-VILA-100M 和 Panda-70M 数据集,用来训练 "Imagine Lens" 这类的图像编辑能力。
诉状没有走传统版权路线,而是主攻《数字千年版权法》第 1201 条的反规避:YouTube 的设计是让人在线观看,不是让人拿到原始文件,Snap 涉嫌在规模化层面,违反了该法律法规。
原告之一伊桑 · 克莱因(Ethan Klein)还顺手把英伟达、Meta、字节跳动、亚马逊、OpenAI、苹果一并告了。他的说法是,这些公司 " 一天能抓走 80 年的内容 "。
搜索是谷歌的核心业务,因此谷歌也在名单上。
2026 年 7 月,阿歇特出版集团、Cengage、爱思唯尔,连同畅销书作家斯科特 · 图罗,在纽约把谷歌告了,指控它用数百万本版权书籍训练 Gemini。诉状称,谷歌从 " 已知的盗版来源 " 抓内容,甚至绕过学术网站的付费墙,去拿爱思唯尔旗下《柳叶刀》、《细胞》的文章。
诉状称:Gemini 可以在 20 分钟内,用 0.39 美元,生成一部 10 万字的悬疑小说。谷歌内部文件也警告过,这么做可能 " 给谷歌带来 100 亿到 1000 亿美元的潜在罚款 "。
语音和音乐,也没能幸免。
苹果的 Siri,把 " 意外唤醒 " 时的录音交给外包合同工去听。据外媒报道,里面充斥着医生和病人的对话、商业谈判、疑似犯罪交易。有评估员一天要听多达 1000 条。苹果最终以 9500 万美元和解。
2024 年 6 月,RIAA 代表环球、索尼、华纳,把 AI 音乐公司 Suno 和 Udio 告了,指控它们用受版权保护的录音。
不过我们也不需要担心什么,因为我们即将成为 AI 的最后一批饲料。如今,AI 公司,已经开始自己喂自己了。
2026 年 6 月,Anthropic 发了一篇博客,标题叫《当 AI 建造自己》。里面提到,截至 2026 年 5 月,合并进 Anthropic 生产代码库的代码,超过 80% 是 Claude 写的,不是人写的。在那之前,这个比例还只是个位数。
也就是说,15 个月里,这家公司把绝大部分编程工作交了出去。有工程师已经五个月没写过一行代码;他们每天合并的代码量,是几年前的 8 倍。
2026 年 9 月 17 日,Anthropic 又发布了一份报告,标题是《衡量 AI 发展的速度》,这篇文章主要讲的是 " 研发工作有多少由 AI 主导 "。它采用 Epoch AI 提出的自动化等级,从完全没有 AI 参与的 AL0,到 AI 完全自主的 AL5 来划分。
其中 AL4 指 AI 能从一句大致的目标出发,端到端完成大部分工作,人类只负责监督和最后决策。
文章提到,2026 年 2 月,Anthropic 达到 AL4 这一级别的研发工作还不到 1%。5 月是 12%,7 月是 22%,8 月已经升到 26%。
如果把标准放宽到 "AI 在人的密切指导下完成大块工作 " 的 AL3,则有超过 90% 的研发工作达标。报告还提到 Anthropic 内部最主要的 Agent 平台上,任意时刻约有 3 万个 AI Agent 在从事研究和工程工作,仅在 2026 年 8 月就产生了超过 10 亿次决策。
OpenAI 那边,走的是另一条路。
2026 年 7 月,OpenAI 披露,发布 GPT-5.6 时,它用最强的 Sol 模型,去自主 " 后训练 " 了一个更小的模型 Luna。研究员只给了一句 " 相当不充分的提示 ",Sol 就自己找训练配置、挑 GPU、启动训练脚本、验证运行,还顺带生成了合成训练数据。
这项工作,过去要两个资深研究员做两周。在 OpenAI 内部的 " 递归自我改进指数 " 上,Sol 比上一代 GPT-5.5 高出 16.2 分。
Anthropic 把这件事叫递归自我改进。它的本质,是训练数据的来源,正在从 " 人类生产的内容 ",切换成 "AI 自己生成的内容 "。
而你,就是这次切换完成之前的,最后一茬人类饲料。
问题是,AI 自己生成的数据,撑得起下一波模型吗?
2024 年,舒马伊洛夫(Shumailov)等人在《自然》上发了一篇论文,标题为《AI 模型在递归生成数据上训练时会崩溃》。
他们发现,如果反复用合成数据训练模型,模型会 " 坍缩 ",输出的多样性不断收窄,尾部信息被系统性抹掉,最后变成一种 " 语法正确、但语义空洞 " 的状态。
论文的结论是,你不能用合成数据完全替代人类数据,必须两者叠加。只要原始的人类信号还在,模型就还健康。
所以现在行业的配方,大概是 10% 到 30% 的真实人类数据打底,剩下的靠模型自己喂自己。
那 10% 到 30%,就是我们还剩的用处。但很可惜,连这个用处也在倒计时。
一旦合成数据的质量足够稳定,一旦这个闭环转得够顺,人类数据就再也没有采集的必要。


登录后才可以发布评论哦
打开小程序可以发布评论哦