全天候科技 8小时前
当AI开始“自己教自己”:Opus 5.5是首个RSI训练出的大模型?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Anthropic 最新发布的 Claude Opus 5.5,在性能大幅跃升的同时将运行成本压低 40%,这一反常规的组合引发了业界对其训练方式的密切关注。

社交平台 X 上,谷歌工程师 Patrick C Toulme 据此提出一个推测:Opus 5.5 可能经由 Anthropic 内部更强大的 " 教师模型 "Model 2 蒸馏而来,并可能是首个体现 " 递归自我改进 "(RSI)路径的产品模型。

目前没有公开证据直接证实这一推断,但 Anthropic 已公开确认 Model 2 的存在,且该公司发布的 RSI 相关文章显示,AI 参与 AI 研发的程度正在快速深化,这使得上述猜测具备一定背景。

对于投资者和行业观察者而言,这一事件真正值得关注的,是它将三条此前相对分散的趋势串联在了一起:更强的内部模型持续迭代、AI 深度介入 AI 研发流程、以及更小更便宜的产品模型同步涌现

如果这条路径成立,模型能力提升与推理成本下降将有可能同时发生。

Opus 5.5 为什么值得关注?

华尔街见闻提及,Anthropic 将 Claude Opus 5.5 定位为其 5.5 系列的首款发布,性能在多数任务上与 Claude Fable 5.1 持平,但运行成本较 Opus 5 下降 40%,输出速度提升逾 30%。

定价层面的降幅尤为显著。输入和输出 token 价格分别为每百万 4 美元和 20 美元,较 Opus 5 下降 20%;而在代理任务和编程场景中占主要成本的缓存读取,则从每百万 0.50 美元降至 0.20 美元,降幅达 60%。

从实际使用表现来看,早期测试者完成了 680,000 行代码迁移,耗时不足一天,而此前类似工作需要工程团队数周;另一项测试中,Opus 5.5 将一个 Web 应用全站页面加载时间优化成功率达到 39/40,Opus 5 在同等任务上则出现了改动应用行为的副作用。

在将 HAProxy 从 C 语言重写为 Rust 的内部测试中,Opus 5.5 耗时 9.5 小时,较 Fable 5.1 的 12 小时缩短逾 20%,成本节省 51%。

Anthropic 表示,效率优势还体现在 token 消耗层面——Opus 5.5 不仅每个 token 价格更低,完成同等任务所需的 token 数量也更少,两者叠加共同形成了 40% 的综合成本降幅。

Patrick 所说的 " 教师模型 " 到底是什么?

Patrick C Toulme 在 X 上写道:

Opus 5.5 显然是由一个更大的教师模型训练出来的,很可能是 Model 2 Mythos。Opus 5.5 是首个经过 RSI 训练、同时由内部教师模型蒸馏的模型。规模更小、成本更低,正是教师模型蒸馏的产物。

这里涉及的核心技术概念是 " 模型蒸馏 ":让能力更强的教师模型生成高质量训练信号,再用这些信号训练规模更小的学生模型,从而在保留较高能力的同时显著降低推理成本。

Anthropic 已公开确认,其内部存在一个比 Mythos 5 更强大的 Model 2,并被大量用于代码生成、数据生成及代理任务。然而,目前没有任何公开材料直接证明 Opus 5.5 是由 Model 2 蒸馏而来。Anthropic 在发布文档中也未提及具体训练方式。

值得注意的是,Anthropic 在安全条款中将 " 蒸馏攻击 " 单独列为一类威胁——即攻击者通过大量虚假账户从模型中批量提取能力,并为此在 Opus 5.5 上引入了 " 保留推理链 " 等反蒸馏机制。

这一细节从侧面说明,蒸馏技术本身在 Anthropic 的技术体系中具有相当重要的地位。

AI 开始参与 AI 研发

无论 Opus 5.5 的具体训练路径如何,Anthropic 自身发布的 RSI 相关文章提供了一幅更宏观的图景:AI 介入 AI 研发的深度,正在以可量化的速度加快。

截至 2026 年 5 月,Anthropic 代码库中逾 80% 的代码由 Claude 撰写,而在 2025 年 2 月 Claude Code 推出研究预览版之前,这一比例仅为个位数。

在工程产出层面,Anthropic 工程师人均每日合并代码量较 2024 年增长约 8 倍。

Anthropic 文章同时指出,2026 年 4 月,Claude 在约 800 小时内将某类 API 错误降低了 1000 倍,而据主导此项工作的工程师估计,人工完成同等任务需要约四年时间。

在研究判断力层面,Anthropic 设计了一项内部测试:在研究员与 Claude 的协作会话中,找出人类研究员选择了 " 次优 " 方向的关键节点,再比较不同版本的 Claude 与人类在这些节点上的判断优劣。

结果显示,2025 年 11 月的 Opus 4.5 模型在 51% 的情况下给出了比人类更优的下一步建议,而 2026 年 4 月的 Mythos Preview 这一比例升至 64%。

不过,该文章也明确指出了当前的边界:

在选择哪些问题值得研究方面,Claude 与人类之间仍存在较大差距。这正是今日 AI 与能够自主设计下一代 AI 的未来系统之间的距离所在。

Anthropic 同时强调,完全意义上的递归自我改进目前尚未实现,也并非必然到来。

但分析认为,过去模型竞争很大程度上是 " 谁拥有更多算力 ",现在开始出现另一条路径:让更强的模型帮助训练和改进更便宜的模型。如果这条路径成立,模型能力提升与推理成本下降可能同时发生。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 社交平台 元和 谷歌 c语言
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论