钛媒体 14小时前
指控蒸馏的这一周,美国公司在 Kimi 上炼丹
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

文 | AI 唱反调

7   月中旬,Anthropic   今年   2   月的一篇旧博客被重新翻了出来。博客指控月之暗面用   340   万次欺诈交互 " 蒸馏 " Claude ——发布时反响有限,这一次赶上   Kimi K3   发布后的舆论热度,传播范围广得多。

OpenAI   刚入职不到两周的战略未来主管   Dean W. Ball   顺势发了一篇长文,建议美国政府 " 不需要证据 ",让机构发布 " 中国模型可能存在后门 " 的软性法规," 制造足够的监管风险让受监管企业退缩 "。

不到   48   小时,他发帖紧急切割:"I am trying to describe what I believe will happen, not advocate for anything" ——我只是在描述我认为会发生的事,不是在倡导什么。

同一周,arXiv   上挂出一篇论文,来自一家美国医疗   AI   公司。论文本身没有参与这场争论,但它披露的事实,恰好可以拿来检验这套指控在   2026   年的成色。

一个医疗行业的典型样本

7   月   20   日,一篇题为《Cura 1T: Specialized Model for Agentic Healthcare》的论文登上   HuggingFace   日榜第六(7   月   15   日提交)。它不止是一个医疗行业的   AI   应用案例——这是一家美国企业用中国的开源模型,完成的一次医疗技术迭代。

先看是谁做的。作者栏写着   "actAVA AI Team",一家美国医疗   AI   初创。团队名单往下翻:Kevin Riley,前   Salesforce   全球医疗与生命科学业务负责人;Frank Wang,Vlocity   第   11   号员工、前   Salesforce AI Research   首席工程师;Weiran Yao   和   Haolin Chen,出自   Salesforce AI Research,xLAM   和   Webscale-RL   那拨人。

再看为什么分量在行业。医疗是企业级市场里合规要求最高、采购决策最保守的行业之一,一家医疗   AI   公司选基座,考虑的是合规、稳定和成本,不会是话题热度。actAVA   的选择是   Kimi-K2.6,月之暗面   4   月   20   日发布的开放权重模型:1T   总参、32B   激活的   MoE,Modified MIT   协议,商用允许。

K3   发布之后,"Kimi   好用 " 在硅谷已经不需要论证,基座用   Kimi   本身算不上新闻。真正的增量信息是:这套基座已经作为成熟成果,进入了医疗这种行业的生产环节。

论文写得直接。正文第三节第一句:"Cura 1T is post-trained on top of Kimi-K2.6 ( Moonshot AI, 2026 ) "。附录   A   的训练超参表标明:Base model = Kimi-K2.6,LoRA rank = 32。官网产品页同步挂着:"Post-trained from Kimi-K2.6 through recursive self-improvement"。

Cura 1T   论文第三节:基座归属声明(高亮)

具体做法,就是一队   Salesforce   出身的美国工程师,拿着这个开放权重模型,训了一个   rank-32   的   LoRA   适配器(实际训练参数量千万级),然后以闭源   API   卖给美国医疗企业:每百万   token   输入   0.5   美元,输出   2.5   美元。他们自称这个模型在   6   个医疗评测   panel   里   5   个压过   GPT-5.5、Claude Opus 4.8   和   Gemini 3.1 Pro。

这个价格有个反常之处:比   Kimi   官方   API(0.95/4.00   美元)还便宜约一半。微调品卖得比基座便宜,要么是补贴获客,要么它的推理成本另有说法。无论哪种,都值得记下来追问。

四个月前,用   Kimi   是要道歉的

用   Kimi   当底座,actAVA   不是第一个。第一个是   Cursor,场面要难看得多。

3   月   19   日,Cursor   发布   Composer 2。官方博客写得漂亮:CursorBench 61.3   分,压过   Claude Opus 4.6   的   58.2。措辞是 " 我们的第一次继续预训练 ",言下之意,这家上一轮融资估值   293   亿美元、当时正洽谈   500   亿美元新融资的公司,是自己把模型从头练出来的。

不到   24   小时,开发者   @fynnso   调试   API   时,在返回路径里发现一个模型   ID:kimi-k2p5-rl-0317-s515-fast。这串字符的意思很直白:月之暗面的   Kimi K2.5,加一层   RL   微调。

月之暗面预训练负责人   Yulun Du   随后在   X   上确认两者   tokenizer   完全一致,直接   @ Cursor   联创   Michael Truell   质问许可证问题。这几条帖子后来被删了。马斯克在   X   上确认:"Yeah, it's Kimi 2.5."

接下来轮到   Cursor   改口。开发者教育副总裁   Lee Robinson   承认模型基于 " 一个开源基座 ",全程没提   Kimi   的名字,只强调 " 最终模型只有约四分之一的算力来自基座 "。

联创   Aman Sanger   说得直白些:"It was a miss to not mention the Kimi base in our blog from the start. We'll fix that for the next model."3   月   21   日,月之暗面官方账号出面定性:" 授权商业合作 ",Cursor   通过   Fireworks   的托管推理与   RL   平台接入   K2.5。

Cursor   后来在   Composer 2   技术报告(arXiv:2603.24477)里白纸黑字写下   "These evaluations led us to select Kimi K2.5 … as our base model"。他们评估过   GLM5、K2.5   和   DeepSeek V3.2,选了   Kimi。5   月的   Composer 2.5   继续沿用这条路线。行业里对模型供应商最挑剔的一家硅谷公司,把核心编程能力盖在一个中国开源模型上,而且从 " 被抓包 " 走到了 " 写进论文 "。

把   Cursor   和   actAVA   摆在一起,四个月的变化不在技术层面,在姿态层面:3   月,用   Kimi   当底座是要被扒出来、然后道歉的事;7   月,它已经能写进论文第一句、挂上官网首页。

叙事在抓贼,企业在下单

看完硅谷这四个月的姿态变化,再回头看   Dean Ball   那篇长文—— OpenAI   战略未来主管建议美国政府 " 不需要证据 "、给中国开源模型制造监管风险的那一篇——能读出另一层意思。

他的剧本," 不需要证据 "" 制造足够的监管风险 ",建立在一条叙事上:中国模型的能力是从美国模型那里偷来的,所以要用监管把它们挡在企业采购清单之外。Anthropic 2   月的蒸馏指控是这条叙事的弹药库。

这一周它被翻出来的时机,很难说和   K3   的冲击波无关:7   月   17   日纳指收跌   1.4%,费城半导体指数盘中一度跌超   5%,彭博说   K3   打破了 " 美国领先中国 " 的认知,交易员直接管这叫   "Kimi moment"。Ion Stoica   的判断是,中美开源差距从   6   到   9   个月缩到了   2   到   3   个月。

技术栈的真实流向,恰好跟这条叙事相反。美国最挑剔的编程工具公司选了   Kimi   当基座,写进了技术报告;美国医疗   AI   初创在   Kimi   上做   LoRA,写进了论文第一句;Cloudflare   把   Kimi   上架   Workers AI,Airbnb   在生产环境里跑   Qwen,Chamath   的   Social Capital   把部分计算负载转到   Kimi K2。截至   7   月   22   日,Kimi-K2.6   的   HuggingFace   模型卡显示,仅上月的下载量就超过   115   万次。蒸馏如果指的是 " 在前人模型基础上继续造东西 ",那   2026   年最大的蒸馏现场不在北京,在硅谷。

Kimi-K2.6   的   HuggingFace   模型卡:1.1T   参数、Modified MIT   协议、上月下载超   115   万次

这不是说   Anthropic   的指控必然为假。340   万次交互的细节,双方各执一词,外人无法裁决。但指控和现实的同框本身已经是回答:华盛顿还在讨论怎么挡住中国模型,美国企业已经用订单投完票了。Amodei   这一周全程沉默,蒸馏指控翻红不接话,K3   刷屏不接话。沉默有时比声明信息量更大:叙事生产线还在运转,但叙事对应的那个世界,正在他眼皮底下改写。

Ball   那份剧本,发出来不到两天就自己收了回去。切割越快,越说明剧本是真的。剧本越真,越说明有人已经意识到:靠证据打官司的那个阶段,可能已经过去了。

尾声

这篇文章写完的时候,能等的答案有三个。

7   月 27   日前,K3   的完整权重会公开发布。Cursor   和   actAVA   的故事会不会在   K3   上批量复制,两个月后数一遍海外衍生模型的数量就有分晓——那是 " 基座共识 " 从两个案例变成一个产业层的临界点。

Cura   那边验证起来更直接,API key   对所有人开放,评测代码也是开源的,第三方复测的分数对得上,医疗这个最严的垂直场景就算拿下;对不上,前文所有的乐观部分作废。政策端看的是未来两周:有没有机构发布针对中国开源模型的 " 安全提示 " 级文件。如果有,Ball   的剧本就进入执行期,届时再写就是追认,不是预判。

还有一个答案不用等太久。Sanger   道歉时说过,"we'll fix that for the next model"。Cursor   下一代模型发布那天,看一眼基座署名写在第几页,就知道这四个月的变化是不是真的。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

美国 医疗 kimi 美国政府 ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论