星途科讯 2小时前
OpenAI为GPT-Live嵌入SynthID水印并开放验证API
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

7 月 31 日,OpenAI 更新其 GPT-Live 语音模型,将 Google DeepMind 的 SynthID 水印技术嵌入所有通过 ChatGPT Voice 和 OpenAI API 生成的音频中,并同步开放验证 API。此举允许开发者或组织对音频文件进行自动化的来源检查。

该水印不可见且听不见。此次升级的关键在于,第三方现在可以通过 API 查询信号是否存在,而不仅仅是信号本身的嵌入。

SynthID 音频原理:频谱域嵌入

与在像素空间添加扰动的图像水印不同,SynthID 音频水印运行于频谱图(音频信号频率内容随时间变化的视觉表示)。其嵌入过程分为三步:首先将音频波形转换为时频表示;其次利用心理声学掩蔽原理在频谱图中编码水印图案;最后从修改后的频谱图重建波形。

心理声学掩蔽是耐久性的关键。人类听觉系统无法感知被相邻频段或更响亮声音掩蔽的信号,SynthID 正是利用这些区域放置水印,并采用扩频方法将信号冗余副本分布在多个频段和时间位置。这使得水印即使经过 MP3 压缩(包括 128 kbps 激进编码)、速度 / 音调偏移,甚至通过扬声器播放后重新录制的 " 模拟漏洞 ",依然能够保留。相比之下,传统元数据标签无法经受此类转换。

检测机制采用匹配滤波器,Google 的专有解码器经训练可识别编码器引入的统计模式。由于检测器专有,第三方无法独立运行,这正是开放 API 的核心价值。

开发者 API 解锁自动化审核

此前,水印仅作为 OpenAI 可用的事后法医工具。新的验证 API 改变了这一局面,允许新闻编辑部、社交平台或企业合规团队将来源检查直接整合至工作流中。查询发送至 OpenAI 匹配器,针对提交波形运行并返回判定结果。

Hugging Face 研究员 Sasha Luccioni 曾指出,SynthID 早期的专有检测基础设施限制了其作为通用来源系统的潜力。OpenAI 此前的图像验证工具需用户上传至网页,而新 API 首次解除了这一限制,使开发者能将检查构建到自动化管道中。

需注意,启动时的 API 范围仅限于 OpenAI 源音频。ElevenLabs、开源模型或未通过 GPT-Live 生成的合成语音不会返回信号。无信号并不代表音频真实,仅表示未检测到 OpenAI SynthID 水印。

GPT-Live:实时语音的水印化

GPT-Live 于 2026 年 7 月 8 日发布,取代高级语音模式,成为超过 1.5 亿周活用户的默认语音体验。其全双工架构可同时处理输入输出,每秒多次决策说话、聆听或暂停,避免了传统轮次系统因沉默或噪音导致的中断。复杂问题时,GPT-Live 会在后台委托给 GPT-5.5,同时保持对话流畅。

发布时提供两个层级:付费用户的 GPT-Live-1 和免费用户的 GPT-Live-1 mini。实时安全措施可在模型说话时引导至更安全响应或结束对话,并针对自我伤害、情感依赖等类别构建了原生音频安全评估。

局限性与行业足迹

SynthID 已嵌入 Google Gemini、Imagen 等产品,并于 2026 年 5 月被 OpenAI、NVIDIA 等采纳为图像行业标准。7 月 31 日的更新将其扩展至 GPT-Live 音频,触达最大规模的日常语音受众。C2PA 联盟成员现已超过 6000 个。

然而,该系统并非防绕过。USENIX Security 2025 发表的 UnMarker 论文报告了对 SynthID 的 79% 去除率,尽管 Google 对此提出异议。更根本的限制在于,开源语音模型产生的克隆音频不带 SynthID 水印,也无法通过 API 筛查。水印的有效性取决于平台是否主动集成检测层,这仍是生态系统面临的下一个挑战。

【星途科讯 图文丨三一一 首发于 ZAKER 科技,转载请注明出处】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

自动化 google 社交平台 基础设施 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论