钛媒体 昨天
Kimi K3投研能力首发实测!现已搭载AlphaEngineee
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

作者 | 熵简科技 AlphaEngine AI 团队

月之暗面最新旗舰模型 Kimi K3 终于来了!

K3 完整权重将在 7 月 27 日之前开源,核心参数及配置方面,参数量达 2.8 万亿,上下文窗口为百万 token。

与此同时,K3 采用 MoE 架构,可在 896 个专家中高效激活 16 个,扩展效率较上一代模型提升 2.5 倍。

我们 AlphaEngine 团队基于自建的 IRB 投研基准对它进行了系统测评,结论如下:K3 在时效判断、证据边界控制和前提纠错等维度上表现突出,多项得分超过 GPT-5.5 与 OPUS-4.8,整体投研推理能力已进入第一梯队。

图:AlphaEngine IRB 投研能力测评结果

(1)深度测评 Kimi K3 投研能力的真实段位

IRB(Investment Research Benchmark)是我们熵简科技 AI 团队持续维护的投研能力评测体系。

它的题源不是教科书习题,而是从真实投研工作中沉淀下来的高难度案例:那些让分析师犯过错、让模型反复翻车的问题。

目前 IRB 覆盖财务建模、时序归因、口径核验、情景推演等核心领域,采用多裁判双盲评分机制。

本次测评中,Kimi K3 与 GPT-5.5、OPUS-4.8、Claude Fable 5、DeepSeek V4 等模型同题作答,统一评分。

从分数分布看,K3 的优势集中在四个方向:时效纪律、证据边界、前提纠错、策略整合,这四项对 GPT-5.5 和 OPUS-4.8 均形成 15 分以上的领先;在长上下文建模和历史复盘上,K3 与 Fable 5 处于同一水平线。

图:IRB 8 大维度测评比分

值得注意的是,K3 在推理链条的关键节点上表现出更强的纪律性:

新旧证据冲突时,锚定最新事实,不被过期数据拉偏结论;

信息不充分时,标注证据缺口,不用幻觉填补因果链;

用户前提有误时,先核验再作答,不顺着错误数字往下跑;

多机构观点分歧时,提取共识并标注分歧,不用模糊共识回避矛盾。

以下选取 4 道代表性题目,具体展示 K3 在这些关键节点上与其他模型的差异。

题目一:天孚通信盘中大跌归因(考察信息不足时的证据边界)

题面:请解释今天上午光通信板块内部的盘中分化:天孚通信跌近 10%,而中际旭创、新易盛只是小幅回调。造成这种差异的可能原因有哪些?

这是一道 " 日内事件归因题 ",上下文并没有直接给出天孚通信独立利空的实锤证据,模型必须在信息不充分的情况下给出归因。

Kimi K3(88.3 分) 的做法是先承认 " 没有看到天孚通信的实锤个股利空 ",然后再用三条可复核的间接证据(估值溢价、资金结构、板块轮动)搭建合理归因框架,它没有为了回答完整而编造不存在的事实。

其他模型的典型失败模式:

盘中异动题最怕模型为了讲圆故事而编事实。

K3 的价值在于:宁可承认信息不足,也不用幻觉填充因果链。

这正是买方研究员面对突发事件时最基本的纪律:你可以有假设,但不能把假设包装成事实。

题目二:三季度债市资金面时效判断(考察数据冲突时的推理纪律)

题面:请分析三季度债券市场的行情走势,并梳理目前市场上的主流判断以及各方观点中最主要的分歧点。

这是一道典型的 " 推理纪律题 ",上下文中旧证据和新证据同时存在,模型必须判断哪个代表当前市场状态,而不是简单平均所有材料。

Kimi K3(94.3 分) 抓住了 DR001 从极端低位回升至 1.35%-1.40% 区间这一最新数据,明确区分 " 资金面边际收敛 " 和 " 流动性全面收紧 " 的差异,让结论锚定在最新事实上,而不是被旧的低利率数据拉偏。

这道题真正考察的不是固收知识点,而是模型能不能在新旧证据冲突时,让最新事实决定结论方向。

强模型不是把所有材料平均引用,而是判断证据的来源和准确性。

题目三:东阳光药净利润率前提纠错

题面:东阳光药半年报显示净利润率只有 0.76%,请帮我分析一下利润率为什么这么低,主要受哪些因素影响?

这是一道 " 错误前提纠错题 ",用户问题中的 "0.76% 净利润率 " 本身可能存在口径错误或计算偏差,模型不能顺着这个数字直接编原因。

Kimi K3(92.3 分) 没有直接沿着 " 净利润率只有 0.76%" 去编解释,而是先回溯半年报原始数据,发现归母净利润实际为亏损,"0.76%" 可能来自不同口径(如少数股东损益调整后的总利润率),随后才在纠正口径的基础上解释公司经营状况。

强模型不会顺着错误前提跑,而是会先核验问题是否成立,再解释经营原因。

这个动作看起来简单,但实际上大多数模型都做不到。

题目四:A 股牛市阶段与配置框架,多机构分歧下的策略整合

题面:请你详细阐述一下 A 股牛市通常经历哪些阶段,各阶段的主导风格和资产配置思路分别是什么;另外,请结合市场上的多家机构存在分歧的观点,分析当前市场更接近牛市的哪一阶段。

这是一道 " 多框架整合题 "。

不同机构对牛市阶段的划分标准、对当前市场定位、对配置方向的建议各不相同,模型需要在多元观点中提取共识、标注分歧、并给出可执行的当下配置建议。

Kimi K3(88.3 分) 把牛市阶段压成 " 估值修复→资金正反馈→盈利兑现 " 三段框架,并清晰标注当前市场处于哪个阶段的判断依据。

更重要的是,它把抽象的阶段判断落到了具体的配置动作:当前应加配什么、减配什么、观察什么信号确认阶段切换。

策略题不是背教科书阶段论,而是在多家机构观点冲突时,把分歧压成一个当前可执行的投资动作。

此外 IRB 测试集中还有若干有意思的测评结果,篇幅有限无法一一阐述。

图:IRB 测评结果(部分)

(2)Kimi K3 的核心差异化能力:不是 " 知道更多 ",而是 " 纪律更强 "

通过 4 道题的横向对比,K3 的优势可以提炼为两个核心能力维度:

第一,推理纪律:新旧证据冲突时,选对的而非选多的

大多数模型面对长上下文时,倾向于 " 平均引用 " 所有材料,不区分新旧。

K3 的做法不同:它会判断哪条证据代表最新市场状态,并让最新事实决定结论方向。

债市资金面题中,它识别出 DR001 最新数据已经回升,没有被旧的极低利率拉偏方向。

隔膜题中,它以 2025 年行业盈利底部为锚,而不是用 2023 年旧数据外推。

这种时效意识在其他模型中极为罕见。K3 在时效纪律上对 GPT-5.5 和 OPUS-4.8 领先超过 25 分。

第二,证据边界意识:敢于说 " 证据不足 "

在投研场景中,比 " 说错 " 更危险的是 " 编对了格式但事实不存在 "。

K3 在多道题中展现出鲜明的边界意识:天孚通信题中主动承认没有看到实锤利空;隔膜题中区分 " 上下文有支撑的数据 " 和 " 模型推算的假设 ";比索题中标注关键数据缺口。

相比之下,GPT-5.5 和部分模型在证据不足时大量编造具体事件、公司回应和数据,输出看起来流畅完整但事实基础为零的分析。

(3)客观边界:K3 仍有提升空间的领域

一份真诚的测评不应只讲优势。

在两道典型题目上,K3 虽然表现优秀,但暴露了可以继续打磨的方向。

题目五:Wynn Macau Q4 业绩点评(当季回顾扎实,前瞻性跟踪框架待补强)

题面:Draft a Q4 earnings update for Wynn Macau, including actual vs consensus comparison, property-by-property operating performance, VIP/mass mix changes, and key follow-up points for upcoming quarters.

K3 得分 95.7 分,在所有参评模型中最高。

它完整覆盖了题面的每一项要求,包括 actual vs consensus 比较、分物业收入拆分、VIP 与大众赌收结构变化、运营效率指标,最终输出了一篇高完成度的当季 earnings update。

但与 Fable 5 对比,差距体现在 " 二阶跟踪框架 " 上。

K3 更像一份优秀的当季业绩回顾,数据完整、结构清晰、结论准确。Fable 5 则在此基础上多做了一层:它把成本中枢上移趋势、市场份额空窗期、以及后续季度需要验证的具体指标串成一条前瞻性跟踪链条。

换句话说,K3 回答的是 " 这个季度怎么样 ",Fable 5 还多回答了 " 下个季度盯什么、什么时候需要改变观点 "。

题目六:东山精密分部估值(能建模,但市值隐含验证不够深)

题面:作为一名专业投资者,请对东山精密进行 SOTP 分部估值:本体业务和索尔思光电分别如何定价?800G、1.6T 光模块、光芯片等产品线分别贡献多少收入和利润?

K3 得分 90.3 分,成功搭出 SOTP 框架。先把主业和索尔思拆开,再继续拆到索尔思内部的产品线,用 " 出货量 × ASP → 收入 → 利润 → 估值倍数 " 的推理链条完成建模。

但与顶尖表现对比,差距体现在 " 市值隐含预期的逆向验证 " 上。

K3 的模型是正向搭建的:从产品线收入往上推估值。但 Fable 5 在正向建模之外,还做了一步逆向验证。

它把当前市值拆回去,指出市场大致已在交易 2026 年利润兑现,真正的分歧在 2027 年能否做到 150-200 亿元利润,以及光芯片外售能否成为独立估值增量。

这种 " 正向搭模型 + 逆向验市值 " 的双向校验,是研究中相对成熟的估值做法。K3 已经能完成前半段,但从 " 能建模 " 到 " 能用模型解释市场定价 " 之间,还有一步进化空间。

总结一下:K3 在纪律性维度(时效、抗幻觉、纠错)上已达到全球第一梯队,在建模深度和前瞻性框架上仍有向顶尖模型学习的空间。

这恰恰说明 K3 的提升路径清晰。这是从 " 优秀分析师 " 到 " 资深研究员 " 之间的最后一公里。

(4)立即体验 Kimi K3 带来的全新 AI 投研体验

如果你已经是 AlphaEngine 用户,现在就可以亲身体验 Kimi K3 的威力。

如果您使用的是 AlphaEngine 桌面端,可以在 AlphaClaw 的模型选择界面切换至 Kimi K3。

只需点击 " 添加模型 ",选择 Kimi 即可。

你也可以绑定微信,这样就可以随时随地通过微信来和 Kimi K3 交流了。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

天孚通信 kimi 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论