AI范儿 13小时前
“牛来”了!神秘模型干翻 GPT、Claude,网友猜又是智谱?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

★ 设为星标 | 只讲人话,带你玩转 AIGC。

这两天网上突然冒出来一个神秘模型:Ox Alpha(stealth/ox-alpha),引发了大量关注。

Ox Alpha 外号叫 " 牛来 "(中国人都懂),它是一个匿名上线的 " 隐身模型 ",主打 Coding + Agent + 多模态,目前免费开放。

真正引发讨论的是,它的技术指纹被社区认为高度指向智谱 GLM 系列的新模型。

但既然是匿名测试,这事儿目前还没有官方确认。

Ox Alpha 到底是啥?

它在 8 月 20 日突然出现在 OpenRouter,开发者没有公布身份,因此被标记为 Stealth。

图:Ox Alpha 在 OpenRouter 上

OpenRouter 对它的定位不是普通聊天模型,而是:Coding、长期 Agent 工作、复杂推理和生产级任务。

目前公开出来的规格也相当夸张:

1M Token 上下文,支持文字、图片和视频输入,同时支持推理、Tool Calling,重点针对 Coding 和 Agent 做了优化。

OpenRouter 明确表示,这个模型由匿名第三方开发和运营,OpenRouter 只是负责路由,并不是模型开发者。

而且它现在的使用量已经非常恐怖。

OpenRouter 的 Stealth 页面显示,Ox Alpha 已经处理了大约 1.83 万亿 Token。

真正有意思的是:它可能是谁?

目前社区最热门的猜测是:智谱的 GLM。

更具体一点,很可能是 GLM-5.x 系列某个尚未发布的多模态版本,甚至有人猜测它可能就是未来的 GLM-5.3 Flash。

研究者 Ben Davis 对它做了一系列 " 模型指纹 " 测试,包括 Tokenizer、视频编码方式、输出习惯、音频输入行为等,然后表示自己有 99% 的把握认为它属于 GLM-5.x 系列。

图:Tokenizer 对比

其中几个线索很有意思。

第一,Tokenizer。

Ox Alpha 的 Token 行为与 GLM-5.3 高度吻合。

第二,视频编码。

它处理视频时消耗 Token 的方式,与 GLM-5V-Turbo 的视频编码器表现高度一致。

第三,多模态能力。

现在的 GLM-5.3 本身已经很强,但公开版本并不是这样一个完整的原生视觉 / 视频旗舰模型。

而 Ox Alpha:

文字 ✔

图片 ✔

视频 ✔

1M Context ✔

Agent ✔

Coding ✔

所以一个很自然的推测就是:这可能是智谱正在测试的下一代多模态 GLM。

当然,在官方揭晓身份之前,这些都只能算社区根据技术特征做出的推测。

性能更夸张

现在网上传播最广的是一组 DeepSWE Coding 测试。

简单解释一下,DeepSWE 测的不是 " 让模型写一道算法题 ",而是更接近真实的软件工程任务:给模型一个真实代码项目和具体需求,让它自己理解代码、找到问题、修改代码并完成任务。

所以它更适合观察一个模型实际 " 干活 " 的 Coding / Agent 能力。

图:DeepSWE Coding 测试

这次社区抽取了其中 10 个任务进行测试,结果是:

Ox Alpha:80%

Claude Fable 5:65%

GLM-5.3:62%

Grok 4.6:62%

GPT-5.6 Sol:52%

也就是说,在这 10 个真实 Coding 任务的小样本测试里:这个连开发者是谁都不知道的匿名模型,把 GPT-5.6 Sol、Claude Fable 5、Grok 4.6 和 GLM-5.3 全压了一头。

当然,这里的 80% 并不是完整 DeepSWE Benchmark 的正式成绩。

而且只测了 10 个任务,样本还非常小。

所以现在可以说 Ox Alpha 的 Coding 表现 " 非常惊艳 ",但要直接下结论说它已经全面超过 GPT-5.6 Sol 和 Claude Fable 5,还有点太早。

但这已经非常值得期待了。

我觉得真正值得注意的是另外一件事

它是多模态 Agent。

如果它最后真的是智谱的新 GLM,那么意义可能不只是 "GLM-5.3 又升级了一点 "。(就类似 DeepSeek,昨天刚上线了它的多模态版本)

GLM-5.3 已经把 Coding / Agent 做得很强,现在 Ox Alpha 又补上:图片 + 视频 + 1M Context。

这意味着它的路线可能已经从 Coding Agent 变成多模态 Agent。

Agent 不只是读代码和操作终端,而是可以直接 " 看 " 截图、" 看 " 网页、" 看 " 视频,再根据自己看到的内容调用工具、执行任务。

这个方向的价值,其实比 Benchmark 多涨几分大得多。

所以现在怎么看 Ox Alpha?

我会把它理解成一个非常值得追踪的 " 神秘旗舰模型公测 "。

目前确定的是:它很强、免费、1M 上下文、支持图片和视频,而且明显针对 Coding 和 Agent 做了优化。

目前不确定的是:它到底是谁家的。

但现阶段的技术线索,确实明显指向了智谱 / GLM 系列。

如果最后官方确认 Ox Alpha 真的是智谱的新模型,那就有意思了。

因为前几天发布的 GLM-5.3,本身就已经给了大家一个很大的惊喜。

GLM-5.3 并没有继续疯狂堆参数,而是在 GLM-5.2 基座的基础上,主要通过后训练优化,就让 Coding 和 Agent 能力取得了非常明显的提升。

后来智谱的唐杰老师还专门发文讨论了 Scaling Law。

一个很重要的观点就是:大模型的 Scaling,远远不只是把参数做得越来越大,后训练、强化学习、Agent 环境同样存在巨大的 Scaling 空间。

现在 Ox Alpha 又冒出来了。

能看图片、能看视频、1M 上下文,Coding / Agent 还这么猛。

如果它最后真的是 GLM 的下一代模型,那只能说:智谱可能又从 Scaling Law 里面挖到宝了。

前面的 GLM-5.3,是在同样的基座里继续往深处挖;而这一次,可能又把 Coding、Agent 和多模态进一步揉到了一起。

所以相比 Ox Alpha 在某个 Benchmark 上超过了谁,我反而更关注它背后的这条技术路线。

如果这条路线最终被证实,那么 GLM-5.3 可能还只是一个开始。

至于 Ox Alpha 到底是不是 " 牛来 ",以及背后究竟是谁,应该很快就会有答案。

参考资料

OpenRouter:Ox Alpha 模型页面

https://openrouter.ai/stealth/ox-alpha

Ben Davis:Ox Alpha 模型指纹及 GLM-5.x 身份分析

https://x.com/davis7/status/2090655207831298095

DeepSWE Coding 测试

https://finance.biggo.com/news/9dc856ba-634d-467a-bea2-6ba70233113c?utm_source=chatgpt.com

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

中国人 flash
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论