你发现没?最近老有大模型 " 蒙着脸 " 就跑到海外去打架了。
前几天,一个叫 "Ox Alpha" 的匿名模型,突然空降到国外著名的 AI 模型聚合平台 OpenRouter 上。官方啥也没多说,就撂下一句话:这是个能写代码、能干复杂活儿的前沿模型。
上线不到 12 小时,海外技术圈就炸了锅。因为有个独立研究员拿它跑了个测试,结果有点猛——在 10 个软件工程任务里,Ox Alpha 的通过率干到了80%。什么概念呢?对比一下,Claude Fable 5 是 65%,GPT-5.6 Sol 只有 52%。
好家伙,这哪是空降,这简直是 " 砸场子 "。而且,OpenRouter 还给了一个让所有开发者都眼馋的条件:预览期免费调用。
于是,一个灵魂拷问瞬间传遍了 X(原推特)和 Reddit:这匹突然杀出的 " 黑马 ",到底是哪位大神的 " 小号 "?
一、猜谜大会:四个 " 嫌疑人 ",谁最像 " 牛 "?

在 AI 圈," 蒙面 " 这事儿不新鲜,但每次都能引发全网福尔摩斯式的推理。这次大家把怀疑对象,主要锁定在了四位 " 大佬 " 身上。
头号嫌疑人:小米。 理由很直接,就在 Ox Alpha 出现的前两天,小米 CFO 刚放风说新一代 MiMo 模型快来了。更何况,小米有 " 前科 " 啊!今年 3 月,他们的 MiMo-V2-Pro 就曾化名 "Hunter Alpha" 在 OpenRouter 上匿名测试过。时间点吻合,手法也熟悉,嫌疑确实不小。
二号嫌疑人:智谱 AI(现名 Z.ai)。 这也是后来被最多 " 实锤 " 指向的方向。

为啥?因为 Ox Alpha 的配置单——约 104.8 万 token 的超长上下文、支持图像视频输入、定位智能体任务——这简直就是照着智谱近两年的技术路线图画出来的。况且,智谱也是匿名老手,年初的 "Pony Alpha" 后来被证实就是 GLM-5。巧不巧?上次是 " 马 "(Pony),这次是 " 牛 "(Ox),老外不懂,咱们一看这 " 牛马 " 组合,多少有点那味儿了。
三号和四号嫌疑人,分别是腾讯混元和 Google Gemini。支持者的理由也都很硬:能撑起这么大免费调用规模的厂商不多,腾讯有这个实力;而原生视频输入和百万上下文,一直是 Gemini 的招牌技能,甚至有人跑去问 Ox Alpha" 你是谁 ",模型自己回答说是 Gemini。
但模型自己说的话,能全信吗?当然不能。这就像问一个戴了面具的人 " 你是谁 ",他随口报个明星的名字,太正常了。因为模型可能会从训练数据里 " 学坏 ",或者被提示词带偏,给出一个看似合理却完全错误的答案。这种 " 自我认知 " 的幻觉,在匿名模型上尤其常见。
二、猜模型,已经变成一门 " 技术活儿 "
既然嘴上没实话,那就只能上 " 硬核 " 手段了。现在的海外技术社区,已经形成了一套 " 不用问,问就是看指纹 " 的鉴 AI 方法论。
说白了,就像世界上没有两片相同的叶子,每家大模型公司在训练模型时,都会留下难以磨灭的 " 技术指纹 "。Ox Alpha 可以隐藏名字,但藏不住这些底层代码的习惯。
第一招,也是最准的一招:看 " 分词器 " 指纹。 你可以把分词器理解为模型看世界的 " 眼睛 "。同样一句话 " 我爱北京天安门 ",不同公司的模型,切出来的单词块数量是不一样的。
有人拿了 25 组不同的文字去测试 Ox Alpha 和智谱的 GLM-5.3,发现一个惊人的规律:在输入完全一致的情况下,Ox Alpha 切出来的 token 总数,永远比 GLM-5.3固定多出 75 个。这种一致的、机械的差异,只有同一套底层代码才能做到。
第二招,看 " 视觉编码器 " 的签名。 这是处理视频时的 " 指纹 "。模型看视频,得先把画面转化成 token。
这个过程怎么采样、怎么缩放,每家公司的 " 手癖 " 都不一样。技术大神们专门生成了 4 段参数固定的测试视频喂给 Ox Alpha,然后计算它处理视频时消耗的 token 数。结果发现,Ox Alpha 在这项消耗上的表现,和智谱的 GLM-5V-Turbo完全一致。而小米 MiMo、通义 Qwen 的编码器 " 签名 ",则跟 Ox Alpha 对不上。这就很能说明问题了。

第三招,看 " 脏 token" 反应。 模型在训练时,有些生僻词或特殊符号,它会觉得很 " 扎眼 ",一碰到就容易输出奇怪的内容。测试者发现,给 Ox Alpha 和 GLM-5.3 看同一批 " 扎眼 " 的字符串,两者的 " 应激反应 " 高度相似,但跟 Gemini、DeepSeek、Kimi 的匹配度只有可怜的 18%-22%。
再加上行为风格分析——比如 Ox Alpha 写回答时喜欢用 emoji,密度是每千字 1.3 个,这正是智谱和通义系列模型的 " 通病 ",而 Claude 和 GPT 几乎不用。还有工作节奏——它在解决代码任务时平均要干 117 个步骤,这和 GLM-5.3 的 124 步几乎就是一个节奏。
基于这五重 " 技术指纹 " 的交叉验证,那位最初发起测试的研究员本 · 戴维斯直接放话:Ox Alpha 有 99% 的概率是智谱 GLM 家族的孩子,不是 GLM-5.3V(视觉版),就是下一代 GLM-5.5。另一份独立分析也给出了 90% 的置信度。
三、为什么中国 AI 厂商,都爱上 " 匿名通道 "?

随着 "Ox Alpha" 的身份越来越指向智谱,一个更有趣的问题浮出水面:为什么中国的大模型厂商出海,都这么偏爱 " 匿名测试 "?
这背后其实是一个极为精明的商业策略。大家发现没有,从智谱的 Pony Alpha,到小米的 Hunter Alpha,再到蚂蚁的 Elephant Alpha、美团的 Owl Alpha,再到这次的 Ox Alpha,OpenRouter 上的匿名模型,几乎被中国厂商承包了。
第一层考量,也是最直接的:去品牌化,让效果说话。
在海外开发者市场,除了 DeepSeek 和通义 Qwen 这种开源明星,很多中国 AI 公司的品牌认知度并不高。如果直接挂着 " 某中国公司新模型 " 的牌子,开发者可能带着先入为主的偏见,或者根本懒得点开。
但匿名就不一样了。没有国籍标签,没有公司光环,就是个纯粹的 " 技术盲盒 "。开发者想用,纯粹是因为它跑分高、上下文长、还免费。
这就倒逼模型必须靠硬实力说话。 等大家讨论得热火朝天," 这模型太强了 " 的印象已经根深蒂固,这时候再突然揭晓:" 其实是我们家的!" ——传播效果直接翻倍。一轮讨论模型,一轮讨论厂商,这波热度拿捏得死死的。
第二层考量,也是最实际的:白嫖一场大规模的真实世界压力测试。
实验室里的跑分再好看,也不如开发者拿去写一天代码、跑一个通宵的智能体任务来得真实。100 万 token 的上下文到底会不会崩?连续执行 100 步任务会不会迷路?工具调用到底稳不稳?
这些问题,只有让海量开发者在真实生产环境里 " 蹂躏 " 一遍,才能暴露出来。OpenRouter 为 Ox Alpha 准备了每天100 万亿 token的调用容量,这哪是免费试用啊,这简直就是厂商自己花钱买来的一次 " 全民公测 "。这种规模的测试数据,对于模型的迭代优化,价值连城。
所以你看,所谓 " 匿名测试 ",表面上是一场神秘的假面舞会,实际上是一套极其理性、环环相扣的出海组合拳。它既解决了品牌认知的冷启动问题,又完成了一次低成本、高效率的全球范围压力测试。
按照之前的节奏,Ox Alpha 的免费测试应该会在8 月 27 日前后结束。虽然所有的技术证据链都牢牢锁定了智谱,但在官方亲自揭开面具之前,一切都还是推测。只不过,这次大家猜答案的底气,显然足了很多。
那么问题来了,你觉得这种 " 蒙面测试 " 的方式,对中国 AI 出海是加分还是减分?或者说,你用过哪些匿名模型,后来发现是 " 自家孩子 " 的?欢迎在评论区聊聊。 毕竟,在 AI 这个圈子里,有时候面具戴久了,大家反而更期待看到面具背后那张真实的脸。


登录后才可以发布评论哦
打开小程序可以发布评论哦