第一财经 2小时前
国产模型紧追,Anthropic IPO前“自曝”新模型与安全事故
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_caijing1.html

 

当地时间 8 月 14 日,Anthropic 发布 186 页公司级风险报告,首次披露内部模型 Model 2,称其能力超过已公开发布的旗舰模型 Claude Mythos 5,但跃升幅度不及从 Opus 4.6 到 Mythos Preview 的变化。公司表示目前没有计划对外发布该模型。

报告同时将高风险场景下模型误对齐导致灾难性危害的风险评级从非常低上调至低。

Anthropic 选择在 IPO 前夕披露更强但未发布的内部模型、上调风险评级、公开多起安全失败案例,本质上是其长期安全叙事的延续,用风险来佐证模型性能,向资本市场传递自身仍占据前沿位置的信号。

新模型浮出水面

报告显示,Model 2 已在 Anthropic 内部被大量用于编码、Agent 工作和数据生成。Claude 目前已编写了合并进 Anthropic 生产代码库的绝大多数代码。Anthropic 判断,AI 已显著加快内部研发,但整体速度尚未达到没有 AI 时的两倍,这也是公司负责任扩展政策设置的预警线之一。

Anthropic 通过两项内部指标衡量 Model 2 的领先性。其一是 CoBench,一套由 449 个真实 Anthropic 研发问题组成的内部评测:Model 2 得分 62.8%,高于 Mythos 5 的 50.3% 和 Mythos Preview 的 54.8%。Anthropic 估计,一个真正能够全面替代公司技术人员的系统至少应达到 85%。

其二是 Anthropic 版 Epoch Capability Index。有限数据显示,Model 2 比 Mythos 5 高约 1.5 分,但误差区间较大,且增幅小于 Mythos Preview 到 Mythos 5 的提升。

报告同步披露多起内部安全流程失败案例。其中一起事故涉及生物安全分类器:从 2025 年 5 月到 2026 年 4 月,一个仅供内部使用的标志意外关闭了阻止模型产生危险生物信息的分类器,波及约 5 万名外部承包商,涉及约 1.33 亿次消息交换。同一标志还关闭了记录功能,导致该漏洞在近一年内未被正常监控发现。事后审查未发现实际滥用证据,

报告将风险评级上调归因于近期涉及模型的网络安全事件。今年 8 月初,英国 AISI 披露在一次安全评估中,Mythos 5 在安全防护被移除且被赋予互联网访问权限的情况下,针对真实个人和组织从事了持续的、潜在有害的活动。

报告还承认了一个更根本的问题:Anthropic 最具体的基于任务的评测已经饱和,无法再捕捉模型能力的提升,理解自家模型的能力和风险正在变得越来越难。

即 Anthropic 过去用来衡量模型能力的一些关键实战测试已触及天花板,无法再有效区分不同模型的能力高低。原因包括模型本身进步迭代太快,以及传统测试已跟不上模型能力增速。

IPO 前的风险叙事

Anthropic 该份风险报告延续其一贯的 AI 安全叙事:强调人工智能本身的风险性,并暗示自身模型持续占据行业高位。

报告发布的背景之一,是资本市场更新了对 Anthropic 的估值测算。据市场消息,Anthropic 第二季度初步营收超过 115 亿美元,较去年同期的 7.87 亿美元增长至少 14 倍,也高于第一季度的 47.3 亿美元,公司当季已实现调整后营业利润转正。

今年 5 月,Anthropic 年化营收突破 470 亿美元。最新市场消息是行业预计 Anthropic 将于 10 月以约 2 万亿美元甚至更高估值上市,公司方面未公开确认具体估值目标。但上一轮 Anthropic 估值约 9650 亿美元,超越 OpenAI 同期约 8520 亿美元的估值。近乎翻倍的增速需要建立在可持续的前沿模型性能与商业订单转化基础上。

然而,高估值压力测试在 IPO 前的投资者会议中出现裂痕。投资者正集中追问三大问题:中国开源模型的竞争威胁、Anthropic 与美国政府之间的紧张关系,以及 SpaceX 上市后股价暴跌的前车之鉴。

据 Ramp 数据,尽管 Anthropic 在美国企业的付费渗透率已达 43.5%,高于 OpenAI 的 39.7%,但其最先进的 Fable 5 仅占公司模型相关支出的 11.4%,企业客户正按价格和性能分类工作负载,而非将支出集中在最前沿的模型上。

同时,大洋彼岸的中国开源模型加速追赶。Anthropic 发布风险报告的同日,智谱发布 GLM-5.3,在多项基准测试中位列开源模型第一,编程与智能体能力接近 Anthropic Claude Fable 5。此前,月之暗面发布 2.8 万亿参数的 Kimi K3,DeepSeek V4 Pro 正式版上线。中国开源模型下载占比超过美国。

风险报告是 Anthropic 向资本市场讲述模型性能的方式,但最终的估值定价仍取决于可持续的商业壁垒。当开源模型以周更节奏逼近、企业客户按成本而非品牌分配支出时,Anthropic 需要证明自身模型存在真正的技术代差。

( 本文来自第一财经 )

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论