进入6–7月,前沿模型团队密集的进行了新版本迭代,在1个多月的时间里有10家头部模型团队发布新模型:Claude Fable 5、智谱GLM 5.2、字节Seed 2.1 pro、腾讯hy、xAI Grok 4.5、OpenAI GPT-5.6-sol-pro、TML inking、Moonshot Kimi K3、阿里Qwen3.8-max-preview以及Google Gemini 3.6-flash。
xbench对这一批新模型从科学推理(ScienceQA)、多模态(BabyVision)、真实复杂长程任务(OneMillion-Bench)三个维度进行评测并更新了leaderboard。
结合本期重点模型的公开发布信息与榜单数据,本轮迭代呈现出三个较为清晰的方向:
· 分数上限未有明显突破,头部模型开始追求更高性价比。Grok-4.5用GPT-5.5 Pro约1/35的成本(500题$13.5 vs $471.1)逼近其ScienceQA分数(72.4 vs 73.0);GPT-5.6-sol-pro用1/6的单价($5/$30 vs $30/$180)把旗舰能力下放到中端价位。榜首仍是Claude Opus 4.8(76.4),本月新模型集中挤在68–73分区间,性价比提升,BoN上限仅提升1分。
· 原生多模态成为新旗舰的出厂标配。阿里Qwen3.8第一次把图像/视频/文档并进 2.4万亿参数的主力旗舰(BabyVision 64.95分,跨入第一梯队),Kimi K3、Thinking Machines Lab inkling也都是原生多模态;GPT-5.6多模态推理两代累计上涨94.0%,字节Seed 2.1继续把多模态推理的SOTA握在手里。多模态推理正从看图回答走向复杂任务的执行链条。
· 开源模型竞赛冲上近3万亿参数,国产开源模型处于全球领先地位。一周之内Moonshot Kimi K3(2.8T总参)与阿里Qwen3.8(2.4T)接连把开源阵营的参数体量推到2.4~2.8万亿一档。而前OpenAI CTO Murati的Thinking Machines Lab首款模型inkling(975B总参、41B激活)同为开源,被外媒定位为领跑美国实验室,但仍落后中国的各大开源模型。在开源模型的比拼上,国产模型暂时领先。
xbench-ScienceQA Leaderboard更新
本期的新模型,均在ScienceQA榜单上进行更新。榜首仍是Claude Opus 4.8(76.4/BoN 84.0),本月新模型高度密集地落在68–73分区间:Claude Fable 5(73.4)、Grok-4.5(72.4)、Kimi K3(71.2)、GPT-5.6-sol-pro与Seed2.1 Pro(并列71.0)、Qwen3.7-max(70.8)、Qwen3.8-max-preview(68.0)均在此区间。Thinking Machines Lab inkling(59.2)的第一款模型,位于第11位。头部竞争的密度明显上升,但BoN并未实现新突破。
本期新上榜模型分数更新概览如下:
· Claude Fable 5:73.4/BoN 83.0,原始分位居全榜第2,但因bio分类器拒答叠加降智,实测反而低于上一版Opus 4.8(76.4),是Claude四代里第一次代际回调。
· Grok-4.5:72.4/BoN 81.0,去重后排名第3,较Grok-4提升+7.4;500题成本仅$13.5,约为GPT-5.5 Pro的1/35,头部模型开始进入价格比拼。
· Kimi K3:71.2/BoN 86.0,去重后升到第5、国产第一;较上代Kimi K2.6(65.8/79.0)均分+5.4、BoN+7.0,其中BoN 86.0更是全榜最高,2.8万亿参数开源旗舰。
· GPT-5.6-sol-pro:71.0/BoN 78.0,比上一代GPT-5.5 Pro(73.0)降低了2.0,但单价降到旗舰的1/6($5/$30 vs $30/$180),提供更高性价比。
· 字节Seed2.1 Pro:71.0/BoN 77.0,排名第6,较上代Doubao-Seed-2.0-pro提升+1.8,但代价是更高的output tokens 16537.6、以及更高的延迟332.22s。
· Qwen3.8-max-preview:平均分68.0但BoN冲到81.0(与Grok-4.5持平,国内仅次于Kimi K3),响应从84.77s拉长到153.70s。
· 腾讯 hy3:66.6/BoN 80.0,排名第8,较hy3-preview一次跳升+9.8;500 题仅$2.8,是全榜最低价。
·Gemini 3.6 flash:65.6/BoN 73.0,Google本月更新的Flash档位模型;分数上低于前代gemini-3.5-flash,但以12.9s的响应位列全榜最快一档。
· GLM-5.2:64.6/BoN 77.0,较上代 GLM-5(65.0/80.0)平均分基本持平。
· inkling:59.2/BoN 72.0,全榜第11,是Thinking Machines Lab首款开源多模态模型。
OpenAI在纯知识推理上进入平台期,进步更多体现在性价比提升上。
· GPT-5.6-sol-pro在ScienceQA拿到71.0分。比自家GPT-5.5 Pro(73.0)反而略低2.0,与Seed2.1 Pro并列,落在grok-4.5(72.4)、Gemini 3 Pro(71.6)、Kimi K3(71.2)之后,距榜首差5.4。回看历代曲线,GPT-5(high)64.4→5.1 62.6(回退 1.8)→5.2 65.2→5.4 Pro 72.2(跳+7.0)→5.5 Pro 73.0(+0.8)→5.6 71.0,真正的跃迁只发生在5.2到5.4 Pro那一跳,此后曲线走平,BoN半年稳定在74-80区间。
· 近乎相同的表现,GPT-5.6-sol-pro比旗舰模型GPT 5.5 pro价格大幅下降。它的500题花费$158.72,是GPT-5.5 Pro($471.11)的约1/3,降了66.3%;input单价从$30降到$5、output单价从$180降到$30,都只有上一代旗舰的1/6。分数下降2.7%,但价格降到1/6,这是一次用中端价位,实现高端推理能力。
· 提分没有靠拉长响应时间。GPT-5.6-sol-pro平均135.94秒答完一题,比GPT-5.5 Pro的156.99秒还快13.4%。需要留意的一点是其token消耗量较大,平均 Output Tokens高达9096.3,接近GPT-5.5 Pro(5192.7)的1.75倍,这也是它虽然单价低、但单题成本没有降到1/6的原因。
Claude Fable 5是四代以来第一次代际回调,增量从分数转向了效率与安全。
· 它的原始分高居全榜第2,实测却低于上一版Opus 4.8,代际曲线首次向下。Fable 5拿到73.4 / BoN 83.0,因拒答机制叠加降智,反而低于Opus 4.8(76.4 / 84.0)。评测中有21道生命科学类题目触发bio分类器拒答,用fallback 到Opus 4.8拟合分数。
· 单次作答退步,但best-of-N依然保持较高分数。Average与BoN的差距从Opus 4.8的7.6扩到9.6,说明模型的作答上限仍在,退步的只是单次答对的稳定性。
· 这一代真正变好的是效率:更快、更省token,价格翻倍却几乎没多花钱。响应16.85s(比Opus 4.8快31%)、平均output 1108.2(少44%);单价看似翻倍($10/$50),但500题$26.8仅比Opus 4.8($25.6)高4.7%,output 减半对冲了单价翻倍。
Grok-4.5在准确率、稳定性、性价比三件事上同时往好的方向走。
· 平均分一次增加+7.4,去重后升到第3,追赶GPT-5.5 Pro。从Grok-4的65.0升到72.4,BoN从78.0升到81.0(+3.0),仅落后GPT-5.5 Pro 0.6分,反超 Gemini 3 Pro(71.6)。
· 稳定性同步收敛,不再出现BoN高、均分偏低的大幅波动。BoN−Avg差值从 13.0收窄到8.6,一次答对与多次采样之间的落差明显变小。
· 分数逼近旗舰模型,成本却只有其1/35。500题仅$13.5,output单价$6是 GPT-5.5 Pro的1/30;响应从227.24s压到52.82s(降76.8%),这一代不是靠拉长推理换分,而是更快更便宜。
字节Seed2.1 Pro分数持续提升,但token消耗量与延迟也在提升。
· 71.0的均分让字节紧贴国际第一梯队,排名第6,国产模型第二(次于Kimi K3 71.2),较上代Doubao-Seed-2.0-pro(high)69.2提升+1.8,紧贴Gemini 3 Pro(71.6),约14个月累计+17.4。
· 代价是token消耗量大幅提升,单题成本反而比上代更贵。平均output 16537.6 tokens(约Fable 5的10倍)、响应332.22s、500题$33.5,比上代$10.2 成本上升不少。模型响应时间一路拉长(116.89 / 233.40 / 227.79 / 332.22s),思考档位可显式切换,本质是用更多token和时间换分。
腾讯hy3用全榜最低的价格,把知识密集任务做进了国产第一梯队。
· ScienceQA 66.6、BoN 80.0,均分入国产前列,上限已达顶尖水平。去重后排名第8,BoN 80.0 已进第一梯队;较hy3-preview版有很大提升56.8→66.6(+9.8)、BoN 72→80(+8.0)。
· 价格极巨优势,500题成本只有同段模型的十分之一量级。input $0.15 / output $0.59,500题仅$2.8(同段DeepSeek-v4-pro $29.4、GLM-5 $9.0),output单价约Doubao-Seed-2.0-pro的1/3。
· 提速与稳定性同步改善,正式版比preview更快也更稳。响应从158.60s压到 79.64s(降49.8%),稳定性BoN−Avg从15.2收窄到13.4。
阿里Qwen3.8-max-preview把能力上限拔到国内顶尖,但均分不升反降、稳定性还没跟上。
· BoN冲到81.0,国内模型第二高分,只比榜首Opus 4.8低3.0。BoN(N=5)与Grok-4.5持平,比上一代Qwen3.7-max的79.0高了2.0,说明模型的能力上限保持持续提升。
· 平均分只有68.0,反而比上一代Qwen3.7-max(70.8)低2.8。也落在kimi-k3(71.2)、Doubao-Seed-2.0-pro(69.2)之下。
· BoN与均分之间13.0分的落差,暴露的是回答一致性、而非能力上限的问题。这是全榜前列最宽的一档,说明模型的作答能力已到位、但单次稳定性欠火候;同时响应从上一代的84.77s拉长到153.70s、几乎翻倍。
Kimi K3用一款2.8万亿参数的开源旗舰,一举拿下ScienceQA的SOTA。
· Kimi K3拿到71.2 / BoN 86.0、去重后升到第5、国产第一,Kimi四代均分一路向上。较上代Kimi K2.6(65.8 / 79.0)均分+5.4、BoN+7.0;四代轨迹 K2 Thinking 51.8 → K2.5 63.2 → K2.6 65.8 → K3 71.2持续爬升,反超Seed2.1 Pro(71.0)、Qwen3.7-max(70.8)登上国产头名。
· BoN 86.0是全榜最高,能力上限已达到第一梯队。高于Gemini 3 Pro(85.0)、Claude Opus 4.8(84.0);不过均分71.2与BoN之间14.8分的落差,也说明单次作答的稳定性仍有提升空间。
Zhipu GLM-5.2是一次横向持平的迭代,科学推理上未拉开新身位。
· 相对于前代模型,GLM 5.2分数略有下降。GLM-5.2(Thinking+max)平均分64.6 / BoN 77.0 / 300.77s,Zhipu榜位仍由GLM-5(65.0 / 80.0)保留;平均分 −0.4、BoN −3.0。
· 这代模型的优势在coding,并不在科学推理能力上。GLM5.2在测试中花了更多 token、并且也更贵、更慢:响应时间从246.56s拉长到300.77s、平均output从7161涨到10996、单价从$0.57/$2.57抬到$1.40/$4.40。说明其专注的增长场景不在科学推理层面。
Google Gemini 3.6 Flash把Flash档位继续推向更快更省,但分数较前一代Gemini 3.5 Flash反而下降。
· Gemini 3.6 Flash较上一代Gemini 3.5 Flash分数大幅下降。平均分65.6 / BoN 73.0,较上一代Gemini 3.5 Flash(70.0 / 77.0)平均分回落4.4、BoN 降4.0;Flash线三代呈现先升后降的轨迹(Gemini 3 Flash 67.4 → 3.5 Flash 70.0 → 3.6-flash 65.6)。
· 速度与成本是Gemini Flash系列的优势。平均响应12.9s是全榜最快,比3.5 Flash的15.4s再快约16%;output单价从$9降到$7.5,500题仅$1.43,延续 Flash一贯的低价定位。
BabyVision Leaderboard更新
本期BabyVision新增8款多模态模型上榜(Seed2.1 Pro、GPT-5.6-sol-pro、Qwen3.8-max-preview、Claude Fable 5、Grok-4.5、inkling、Kimi K3、Gemini 3.6-flash),集中体现原生多模态成为新旗舰标配的行业主线。榜首由字节Seed2.1 Pro与GPT-5.6-sol-pro几乎并列(66.89% vs 66.75%),Qwen3.8-max-preview首次登场即以64.95%冲上第3,三者与Human baseline(94.10%)仍有明显差距。
· 字节Seed2.1 Pro:66.89%,排名第1、除Human外全榜最高,较上代Doubao-Seed-2.0-pro +4.29,豆包视觉线三代持续登顶。
· GPT-5.6-sol-pro:66.75%,排名第2,较GPT-5.5的54.64%上涨+12.11,两代累计涨幅+94.0%,且价格不变。
· Qwen3.8-max-preview:64.95%,排名第3,距榜首仅差1.94,较自家上代提升+38.5%,第一次把视觉并进主力旗舰。
· Gemini 3.6 flash:60.05%,Google本月更新的Flash档位多模态模型,较上一代Gemini 3.5 Flash(61.86%)小幅回落1.81。
· Kimi K3:49.48%,排名第5,较上代Kimi K2.6(40.21%)跳升+9.27。
· Claude Fable 5:36.60%,排名第6,视觉线四代里最大一跳+13.15,但绝对水平仍在中游。
· Grok-4.5:25.52%,排名第7,较Grok-4的16.20%+9.32,多模态仍是xAI明显短板。
· inkling:21.39%,排名第8,原生文/图/音多模态首测入榜,起点位于开源模型中游。
字节Seed2.1 Pro拿下除Human外的全榜最高分,且性价比很具优势。
· 66.89%继续登顶第1,保持了视觉SOTA的地位。豆包视觉线三代持续爬升(Doubao-seed-1.8 30.20 → 2.0-pro 62.60 → 2.1-pro 66.89),一路把多模态SOTA握在手里。
· 视觉SOTA不仅体现在绝对能力上,也体现在性价比。价格$0.88 / $4.42,低于GPT-5.5 与 Gemini 3.5 Flash。
多模态是GPT-5.6-sol-pro本轮最大的进步,几乎追平榜首。
· 66.75%位列第2,距榜首仅0.14,多模态推理已进入头部梯队。较GPT-5.5 的54.64%上涨+12.11(+22.2%),且价格不变($5 / $30)。
· 两代累计涨幅94.0%。34.4→54.64→66.75,在ScienceQA分数见顶走平对比,多模态能力提升较为明显。
阿里Qwen3.8-max-preview第一次把多模态并进主力旗舰,起点就在第一梯队。
· 64.95%冲上第3,距榜首仅1.94,把Gemini 3.5 Flash、GPT-5.5甩在身后。仅次于Seed2.1 Pro(66.89)和gpt-5.6-sol-pro(66.75),领先Google的Gemini 3.5 Flash(61.86)、OpenAI 的 GPT-5.5(54.64)。
· 相较过去挂在独立VL系列的做法,这次一次极大的跃升。Qwen3-VL-235B 22.20 → Qwen3.5-397B 43.30 → qwen3.7-plus 46.91 → qwen3.8-max-preview 64.95,一次提升+18.04(相对qwen3.7-plus +38.5%),直接迈进第一梯队。
Claude Fable 5的视觉能力提升是四代模型里面最大的,但绝对性能仍处于榜单中游。
· 36.60%是Claude视觉线四代里最大的一跳。较上代跳升+13.15(Opus 4.5 14.20→4.7 22.94→4.8 23.45→Fable5 36.60),较两代前翻倍有余(+22.40)。
· 但它距榜首差约30个百分点,性价比也落后国内多模态旗舰约一个数量级。$10 / $50 的定价对应的是中游多模态水平,说明即使其有绝对分数上有较大进步,但基数太低仍未进入第一梯队。
Grok-4.5多模态理解处于中下游,相对其推理能力,多模态是明显短板。
· Grok-4.5 25.52%排第7,进步明显但绝对水平依旧不高。较Grok-4的16.20%提升约58%(+9.32),高于Claude Opus 4.8(23.45),但低于Fable 5(36.60)、Kimi K2.6(40.21);榜首Seed2.1 Pro约为其3倍。
Moonshot Kimi K3把视觉能力顶到Kimi线新高,一举成为Moonshot在榜的多模态代表款。
· Kimi K3较上代一次跳升近10个点。Kimi K3(49.48%)较Kimi K2.6(40.21%)提升+9.27%,Kimi多模态三代持续爬升(K2.5 36.5 → K2.6 40.21 → K3 49.48),去重后排名(第5)。
· 仍在中游,距第一梯队约15%。高于Claude Fable 5(36.60)、Grok-4.5(25.52),但落后Seed2.1 Pro、GPT-5.6-sol-pro、Qwen3.8-max-preview组成的头部三强。
Google Gemini 3.6 Flash的多模态与3.5 Flash基本同档,是一次以速度和成本为主的横向更新。
· Gemini 3.6 Flash分数比上一代Gemini 3.5 Flash降低近2个点。Gemini 3.6 Flash(60.05%)较Gemini 3.5 Flash(61.86%)回落1.81,Gemini多模态线仍稳在60分档(Gemini 3.1 Pro 51.5 → 3.5 Flash 61.86 → 3.6-flash 60.05)。
$OneMillion-Bench Leaderboard更新
需特别说明:因Evaluator模型升级,对所有模型进行过一次重新评测,整个榜单分数进行更新。模型选择以Base模式为主。榜单更新后的榜首是Kimi K3。本期新增Kimi K3、Fable 5、GPT-5.6-sol-pro、Qwen3.8-max-preview、Seed2.1 Pro、inkling、grok-4.5、hy3以及Gemini 3.6 Flash共9款模型入榜,多以Base模式集中在中前段。
本期新上榜模型分数更新概览如下(均为Base模式):
· Kimi K3:Pass 35.0 / Avg 56.9 / EV $356,228,排名第1,且经济价值为整张榜单最高。
· Claude Fable 5:Pass 33.6 / Avg 55.9 / EV $318,061,排名第2,被Kimi K3反超后退居次席。
· GPT-5.6-sol-pro:Pass 32.2 / Avg 53.8 / EV $325,064,排名第3,较自家GPT 5.5的提升+21.5%。
· Qwen3.8-max-preview:Pass 31.9 / Avg 53.1 / EV $346,582,排名第4;经济价值$346,582为全榜第2,仅次于Kimi K3的$356,228。
· 字节 Seed2.1 Pro:Pass 23.7 / Avg 47.8 / EV $225,591,排名第5。
· inkling:Pass 22.1 / Avg 43.7 / EV $252,229,排名第6,长任务相对位次明显高于其纯知识推理。
· Grok-4.5:Pass 15.8 / Avg 44.2 / EV $150,960,排名第8,较Grok-4有提升但EV仅+10.7%。
· Gemini 3.6 Flash:Pass 15.3 / Avg 43.7 / EV $170,542,Google本月更新的模型,分数低于上一代Gemini 3.5 Flash保留。
· 腾讯 hy3:Pass 13.0 / Avg 38.8 / EV $161,758,第10,较hy3-preview 版明显提升。
近期新发布模型总结
Claude Fable 5(Anthropic,2026.6.10)
Claude Fable 5是命名从4.x直接跳到第5代的一次产品级整合发布:它是加装了安全分类器、可通用(GA)的Mythos-class模型(同日Mythos 5走Glasswing 邀请制),定价$10 / $50、默认1M上下文。ScienceQA 73.4 / BoN 83.0,原始分位居全榜第2,但因bio分类器拒答叠加降智,实测反而低于上一版Opus 4.8(76.4 / 84.0),成为Claude四代里第一次代际回调。它的实质增量在体验而非分数:Adaptive thinking强制开启、raw CoT关闭、三类安全分类器(bio / cyber / reasoning_extraction)+ fallback,响应快31%、output少44%,视觉单代跳升+13.15,OneMillion位居Base第2、仅次于kimi-k3。xbench的判断是:这一代对实际使用的推理能力相较4.8并未出现大幅升级,增量集中在安全机制、token效率与部署模式上。
Zhipu GLM-5.2(Zhipu / Z.ai,2026.6.13)
GLM-5.2是Z.ai(原智谱)在GLM-5家族上的迭代,MIT开源、约744B总参 / 40B激活、1M上下文,定位专攻coding、reasoning与agentic工作流,官方称在多项长程coding基准上以约1/6成本对标GPT-5.5。榜单上GLM-5.2(Thinking+max)ScienceQA平均分64.6 / BoN 77.0 / 300.77s,input $1.40 / output $4.40,平均output 10996.0;较上代GLM-5(65.0 / 80.0)平均分基本持平、略降,去重后Zhipu榜位仍由GLM-5保留。从代际曲线看,GLM-5→GLM-5.2是本期少见的一次「不升反微降」:平均分−0.4、BoN−3.0,同时响应时间从246.56s拉长到300.77s、平均output从7161涨到10996、单价从 $0.57/$2.57抬到$1.40/$4.40——花了更多token、更贵、更慢,纯知识推理分数却没有上去。多模态方面它并非视觉旗舰(Zhipu视觉挂在独立的GLM-V 系列),OneMillion重算榜本期也未提供可比结果。xbench的判断是:GLM-5.2在科学推理这一维度上是一次横向持平的迭代,其重心明显押在开源、长上下文与agentic coding的实际落地能力上。
字节 Seed 2.1(ByteDance,2026.6.23)
字节Doubao-Seed-2.1-pro定位为Coding与Agent时代的旗舰,采用Pro(高复杂度探索)+Turbo(规模化生产,价格为Pro一半)双版本、深度思考默认开启,模型与火山引擎API、豆包/TRAE/扣子同批开放。ScienceQA 71.0(第5、国产第一),BabyVision 66.89%登顶全榜第一(除Human外最高),两条线都进入头部。代价是高token、高延迟,ScienceQA平均output 16537.6 tokens、响应332.22s、500题$33.5,但output单价$4.42极低。xbench的判断是:字节以思考档位可切换+极低单价的方式,把视觉SOTA握在手里,纯文本推理稳居国产前二,多模态是其最突出的长板。
腾讯hy3(Tencent,2026.7.6)
腾讯hy3是hy3-preview之后的正式版并开源(Apache 2.0),采用295B总参 / 21B激活的MoE、支持256K上下文,本次不含多模态,仅测ScienceQA与OneMillion。ScienceQA 66.6(去重后第8、国产第四),BoN 80.0已进第一梯队,较preview一次跳升+9.8;价格是最大优势,input $0.15 / output $0.59,500题仅$2.8。OneMillion重算榜第10(Pass 13.0),较preview明显提升,但长链路执行尚未追平头部。xbench的判断是:hy3走的是小激活参数+ 开源+低价路线,以21B激活参数对标数倍体量旗舰,知识密集任务已入国产前列,复杂任务执行仍待提升。
Grok-4.5(xAI,2026.7.9)
Grok-4.5是xAI头部推理模型的一次三件事一起推的升级:准确率、稳定性、性价比同步改善。ScienceQA从Grok-4的65.0跳到72.4(+7.4,去重后第3),BoN从78.0到81.0,稳定性(BoN−Avg)由13.0收窄到8.6;同时响应从227.24s压到52.82s、output单价从$15降到$6,500题成本仅$13.5,约为GPT-5.5 Pro的1/35。它的长板高度集中在纯文本推理,多模态(BabyVision第7,25.52%)与联网复杂任务(OneMillion Base EV仅+10.7%)仍是待补项。xbench的判断是:这一代最强的信号不是分数突破,而是头部推理能力正在快速变便宜。
GPT-5.6-sol-pro(OpenAI,2026.7.10)
GPT-5.6-sol-pro是一次把高端能力搬到中端价位的发布:定价input $5 / output $30,是自家旗舰GPT-5.5 Pro($30 / $180)的1/6。ScienceQA 71.0,比GPT-5.5 Pro低2.0,反映OpenAI纯知识推理进入平台期,进步更多落在性价比(500题$158.7,约GPT-5.5 Pro的1/3)。本次最大的进步在多模态,BabyVision 66.75%(第2)、两代累计上涨94.0%,几乎与榜首持平;OneMillion重算榜第2。代价是思维链偏长(平均output 9096.3 tokens,约GPT-5.5 Pro的1.75倍)。xbench的判断是:分数天花板未动,但把旗舰能力下放到中端价位、并补齐视觉短板,是本次的核心价值。
Thinking Machines Lab inkling(Thinking Machines Lab,2026.7.15)
inkling是前OpenAI CTO Mira Murati创立的Thinking Machines Lab发布的首款模型(公司2025年以$120亿估值完成$20亿种子轮):975B总参 / 约 41B激活的开源权重MoE,从零训练、原生处理文本/图像/音频,主打可定制、面向企业自建而非单纯跑分,官方也坦承并非当前最强。榜单三个维度均已入榜:ScienceQA 59.2 / BoN 72.0(全榜第11、末位),BabyVision 21.39%(第 8),OneMillion重算榜Pass 22.1 / Avg 43.7 / EV $252,229(第6)。可以看到它在纯知识推理上与国产头部约差10分,但在真实复杂长程任务上的相对位次明显更高,与其定位一致。xbench的判断是:inkling代表了美国实验室在开源前沿的一次补位,能力上领跑美国实验室、落后中国头部,其价值更多在可定制的落地路径,而非榜单绝对分数。
Kimi K3(Moonshot AI,2026.7.16)
Kimi K3是月之暗面新发布的开源MoE旗舰,采用2.8万亿总参 / 16-of-896专家激活的稀疏架构(Stable LatentMoE),是迄今体量最大的开源权重模型,配合Kimi Delta Attention(在百万token上下文中解码提速约6.3×)、原生多模态与1M上下文,模型权重预告于7月27日前完整放出。榜单上,kimi-k3 ScienceQA拿到71.2 / BoN 86.0 / 182.13s(去重后第5、国产第一,BoN全榜最高),较上代Kimi K2.6(65.8 / 79.0)平均分+5.4、BoN+7.0,Kimi线四代平均分持续爬升;单价input $3 / output $15、500题$35。多模态BabyVision 49.48%(第5、Moonshot视觉线新高,去重后取代Kimi K2.6的排名),长程任务OneMillion重算榜Pass 35.0 / Avg 56.9 / EV $356,228直接登顶第1、经济价值为全榜最高。xbench的判断是:Kimi K3把开源旗舰的参数与架构一次推到新的量级,纯知识推理登上国产第一,长程复杂任务更成为其最亮眼的一面。
阿里Qwen3.8-max-preview(Alibaba,2026.7.20)
Qwen3.8-max-preview于7月19日世界人工智能大会(WAIC)放出,是Qwen家族第一个突破万亿参数(2.4万亿)、且原生支持图像/视频/文档的多模态旗舰,官方预告开源权重即将到来,主战场点名编程、全栈开发、数据分析、办公流程,首发平台是阿里自家编程工具Qoder / QoderWork。榜单表现上限升、均分落:ScienceQA BoN冲到81.0(国内最高、与grok-4.5持平),但平均分 68.0低于上一代Qwen3.7-max(70.8)2.8,稳定性尚有提升空间;多模态BabyVision 64.95%(第3)较自家上一代暴涨38.5%、跨入第一梯队;OneMillion榜第4,经济价值$346,582为全榜第2、仅次于kimi-k3的$356,228。xbench的判断是:Qwen3.8把原生多模态+Agentic编程/办公+万亿参数三件事压进同一款主力旗舰,能力维度显著变宽,性价比这一Qwen的传统杀手锏则待正式版公布API价格后再看。
Gemini 3.6 Flash(Google,2026.7.22)
gemini-3.6-flash是Google在Gemini Flash线上的最新一次迭代,延续Flash 一贯的低延迟、低价定位,input $1.5 / output $7.5、原生多模态。三个榜单上,它均以Google的更新款身份入榜、去重后不占数字排名:ScienceQA 65.6 / BoN 73.0,较上一代Gemini 3.5 Flash(70.0)小幅回落,但以12.9s的平均响应位列全榜最快;BabyVision 60.05%,较Gemini 3.5 Flash(61.86%)基本持平;OneMillion重算榜Pass 15.3 / Avg 43.7 / EV $170,542,与Gemini 3.5 Flash同档。三条线的共同特征是分数相对3.5 Flash略有回落或持平,而响应更快、output单价更低(从$9降到$7.5)。xbench的判断是:gemini-3.6-flash不是一次冲击分数上限的升级,而是一次面向延迟与成本优化的横向更新,把Flash档位继续做得更快更省。
xbench采用长青评估机制,持续汇报最新模型的能力表现,更多榜单未来将陆续更新,期待你的关注。你可以在xbench.org上追踪我们的工作和查看实时更新的Leaderboard榜单排名;欢迎通过team@xbench.org与我们取得联系,反馈意见。


登录后才可以发布评论哦
打开小程序可以发布评论哦