南风窗 1小时前
用AI写文章,骗不了人了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

作者 |  任早羽

编辑 |  张来

在越来越多人习惯用 AI 代劳之后,人类决定要重新制造 " 差异 ",用以区分 " 人造 " 与 "AI 造 "。

8 月 10 日,Anthropic 发布了新的 " 使用说明 ":8 月 2 日后发布的 Claude 大模型,都将在所生成的文本中,嵌入人眼不可识别的水印,用此标记用以标记此为 AI 生成的内容。

到了 8 月 14 日,Anthropic 发布了一个公告,用以说明 " 水印 " 具体将如何运作,但并没有公开具体的算法与检测密钥,顺势引发了舆论场的轩然大波。

Anthropic 发布的公告

但 Anthropic 此举并不是 " 自发 " 的。" 水印 " 的诞生,是为了满足欧盟《人工智能法案》的相关规定。在 Anthropic 之外,Google、Meta、Microsoft 和 Open AI 等 190 家组织也签署了相同的《人工智能生成内容透明度行为准则》。

这意味着," 标记 " 不是单一产品或者一家公司的决策。事实是,欧盟想借此,探索一套能够让 AI 与人共同生活,且能够有效运转的新规则。

在欧盟的视角里," 标记 " 的必要性恰恰在于,当 AI 可以合成大量信息内容后,如果不加以监管,人类反而会进入一个更具风险性的信息社会。

在过去一段时间里,"AI 味 " 迅速而广泛地侵入了互联网,乃至现实世界。人类利用 AI,以前所未有的规模与速度,生产了大量的信息与文本。人们环顾四周,发现从营销文案到社交平台种草笔记,从外国译著到网络小说,在或长或短的文字里,自己已经被 AI 生成的文本与信息团团围住。

有人喜爱 AI 带来的便捷和贴心回复,觉得自己在对话框里被 " 稳稳接住 ";也有人感到厌恶,称之为 "AI 泔水 ",还产生 " 一闻到 AI 味就想吐 " 的生理反应。

更深的问题是,如果人类社会里的信息混入了大量机器生成的内容,我们如何确定信息的来源,又能够向谁追究信息的真假?

尤其,在身体所带来的直接经验之外,我们往往是通过信息,得以认识、想象并讨论外部世界,建立最基本共同认知的。

" 水印 "

Anthropic 给 Claude 设计的水印,与大部分人的设想不同。

它并不是在生成的文本后多添一句 " 此文本由 AI 生成 ",或者在文本中塞入肉眼看不见的特殊字符那么简单,更不是简单的 " 不是 …… 而是 " 句式。因为如此留下的文本水印,都可以通过再次编辑、排版等等行为去除。

Anthropic 选择的方式是,把水印藏在文本生成的选择过程中,让水印成为文本的一部分。如是,即使人类复制、截图乃至重新手抄了一遍 Claude 生成的文本,水印仍会存在。这种嵌入水印的方式,Anthropic 称为 " 编织 "。

在 8 月 14 日的水印使用说明里,Anthropic 粗略地说明了,Claude 将如何把水印,编织进文本里。

这个逻辑有些绕,但捋清楚之后并不难理解。

首先,当 Cluade 接收到指令要生成一段文字时,模型便会开始基于上下文,在语料库里选择词汇。

假设 Claude 要补充的文本句子是 " 这个故事情节很 ……",下一个词汇 AI 可以选择 " 跌宕起伏 " 或者 " 曲折 "。最终选择哪个词汇并不影响语义表达,但在选择时,Claude 会根据前文所选择的词汇,轻微地调整其中某个词被选中的概率。

如果 Claude 在这次选择中,选择了 " 跌宕起伏 ",使得已有的文本 " 概率表达 " 与选择 " 曲折 " 时发生了变化,那么在下一次选择时,Claude 会偏好的选项也会因需要重新进行概率计算,而发生变化。

也就是说,实际上并不存在严格划分的两个阵营:Claude 一定会选的词汇库 VS 不在 Claude 选择范围内的词汇。相反,最终能让检测密钥检测出 " 此为 AI 作文 " 的关键,在于多次选择后留下的统计规律。

Claude 的常用语句

" 水印只改变了选择单词时所用的随机性来源 ",Anthropic 在说明文档里写道。

正因如此,只有当所生成的文本足够长,Claude 需要做的选择足够多时,水印才有 " 存在 " 的空间。在只有唯一答案的句子里,比如 " 中国的首都是 ……",水印则无法运行。

因此,即使是文本翻译也会存在这种水印,那些想要通过简单编辑以去除水印的动作则会失效。当然,如果只是用 Claude 校对文本,那么水印也就几乎不存在,因为在这样的文本里,需要 Claude 做的决定太少了。

不过,Anthropic 只说明了,文本水印采用的是 Google DeepMind 开发的 SynthID-Text 设计方法,截至发稿前还没有公布其具体的算法和检测密钥。

SynthID-Text 方案

此事引发了大量讨论。因为水印往往只能证明 Claude 参与了这项文本内容,却无法区分是 "Claude 写了这段文字 " 还是 "Claude 大幅编辑了这段文字 ",也因为 Claude 作为 AI 工具,其语料库本身便是建立在人类的文本与智慧之上的,写出来的文字 " 版权 " 究竟属于谁,还有待商榷。

尽管 Anthropic 一再强调,水印不会影响输出文本的质量,但许多日常会用 Claude 辅助做专业工作的人并不吃这一套。在 Reddit 上,已有人提出在,力求用词精准的法律文件里,或者文本分析工作里,水印运行的逻辑下,Claude 输出的质量与精度会被影响。

无法否认,宣告给文本印上水印只是第一步,面对大众,Anthropic 还有大量的论证工作需要慢慢做。

不过,Anthropic 推出水印措施,既不是因为 Claude 确在一众大模型中拥有更加突出的长文本输出能力,也不是纯然为了维护所谓人类创作的尊严。

Anthropic 面临的现实情况是,如果它想要进入欧洲市场,便必须符合当地的 " 行为准则 "。

秩序

" 将安全置于首位的 AI 研究与产品 ",在 Anthropic 首页左侧,公司用超大字体写着。他们把自己塑造为一家公共利益公司,但无论愿景或公司定位多么远大,本质上还是需要融资和商业成功。

当 AI 产品真正进入市场,Anthropic 无法绕过市场的合规体系,何况这个合规体系与其一直以来的品牌宣传一致。

在 8 月 14 日的水印说明文件里,Anthropic 开篇便写了 " 我们与其他几家主要的 AI 提供商一起实施此变更,以符合欧盟 AI 法案的要求 "。

欧盟《人工智能法案》的第五十条明确写到," 提供 AI 系统(包括通用型 AI)并生产合成音频、图像、视频或文本内容的供应商,应确保 AI 系统输出的结果是被标记识别为 AI 生成或处理过的内容,且该标记应当为机器可读 "。

在这个条款里,欧盟并没有要求 AI 公司必须推出 " 水印 " 措施,只是要求,AI 生成的内容必须能够被机器检测出来。围绕着这项要求,欧盟又进一步推动了《人工智能生成内容透明度行为准则》,Anthropic 仅仅是签署这项准则的近 190 家组织之一。

欧盟官网发布关于《AI 生成内容透明度行为准则》的报道

但欧盟为什么要划下这样一条界限?一段由 AI 生成的内容,为什么需要被特别区分出来?

这背后并不指向 AI 必然生产假消息或坏内容的价值判断,而是 " 消息是如何被生产出来 " 的透明度问题。

过去,我们有一整套能够运转的信息生产、验证、传播与信任体系,从政府、法院等国家机器,到国际组织、NGO、媒体等各层机构,再到描述、传闻与小道消息,人们从不同的渠道获得不同的信息,并经由渠道赋予这些信息不同的信任程度。

最重要的是,当虚假消息出现时,我们可以经由消息提供的渠道,追溯相应的责任人。

但现在,在这样一套信息生产机制里,AI 成了新的变量。

与以往不同,AI 可以在短时间内实现大规模的信息生产,甚至是定制化信息。它可以针对受众的各色背景,个性化定制新的 " 叙事 " 与 " 说服文本 ",这在哥伦比亚大学教授 Sandra Matz 的研究中已被证明。

反过来,当同一事件发生时,它也可以被利用 " 伪装 " 成许多背景不同的人,从不同的角度在 " 说话 ",也因此有了影响人类决定的可能。

尤其是 AI 大模型语言学习的原料,就是人类的资料库,它从书籍、新闻与对话中总结人类如何说话、回应,并应用在自己的表达中。

AI 的语言习惯总结

无论 " 不是 …… 而是 " 这类 AI 句式如今多么让人反胃,但它其实一直是人类自己喜欢应用的句式。这也说明,AI 是朝着不断缩小与人类之间表达差异的方向发展的。

在这样的趋势之下,如果没有标记或者水印,公众很难百分百辨别 AI 内容。也就是说,当人在面对 AI 内容时,极有可能并不知道自己正在面对 AI,因此失去信任标尺。

在《人工智能法案》的第 133 条说明里,欧盟这样写道:" 各色 AI 能够生成大量合成内容,人类越来越难以将其与人创作的内容区分开。而 AI 系统的普及与日益增强的能力,对信息生态系统的完整性和可信度产生了重大影响,带来了大规模虚假信息与操纵,欺诈、冒充及误导消费者等新风险 "。

显然,原先维系运转的社会机制,没有能够容纳 AI 这个新变量的空间。当 AI 已经成为不可逆的趋势时,人类需要为它修造新的基础设施,以让 AI 能够顺利地嵌入人类社会。

我们如何共同生活

AI 生产并不与信息的真假划等号,人造的内容也可以谎话连篇。

本质上,欧盟只是通过建立新的信息治理机制,恢复可被追溯的信息来源,让公众知道自己正在面对 AI 内容,并保留进一步判断的可能。

技术总是中性的,而透明度与之延展出来的新秩序之所以重要,恰恰是因为人类能够亲身确认的信息非常有限,而现实世界过于庞杂。

技术带人们拓宽视野,获取更庞杂的信息 /《她》剧照

我们知晓千里之外在发生战争,却不必就在战争现场;我们了解美联储 7 月维持利率水平不变,也不用坐在会场亲耳听见。展开一份地图,我们可以看见族群与国家的边界,这不需要抵达国界碑才知晓邻国的存在。

人类对于未亲身经历的世界的认知,往往来自各式各样的信息。信息经由地图、书本、报道、研究或者描述转化成经验,传入我们的身体,让我们能够在脑海中形成一幅图景,得以 " 想象 " 世界,并形成共同体。

我们讨论战争,但必须有一个共同确认的基础:战争是发生了。专家探讨美联储动作对全球金融市场的影响,但也必须有一个共同确认的基础:美联储主席确实说出了保持利率不变的话。

共同世界不要求人人拥有同样的观点与立场,但需要我们基于讨论的是事实本身。事实是公共判断产生的基础,透明度原则也许同样不保证事件切实发生,但保留了人给出判断时所需的必要条件。

宣布给 AI 生成的内容打上水印只是一小步,水印本身也面临着众多讨论,譬如是否会有把人类文本判定为 AI 文本的可能。

但至少,这一步可以让我们向前推进。在人类与机器都成为信息生产者之后,我们仍然需要一套规则维护好边界,以确认,我们仍然生活在同一个世界里。

-END-

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 欧盟 人工智能 社交平台 互联网
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论