科技每日推送 22小时前
Kimi K3太强!老外质疑,为啥美国没留住杨植麟
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

作者 | 赵芷姗

编辑 | 周伟鹏

Kimi K3 发布后的第四天,热度依旧高居不下。

大量需求导致 Kimi 算力紧缺,官方不得不发公告,宣布暂停向新用户订阅提供服务,以保障对已订阅用户的服务。

暂时用不了 K3 的吃瓜网友也没闲着,他们讨论的重点从模型本身,延伸到了创始人杨植麟身上。

1992 年他出生于广东汕头,本科在清华大学,师从智谱 AI 创始人唐杰教授。

毕业后,去了美国卡内基梅隆大学读博,导师更是苹果全球 AI 负责人拉斯 · 萨拉克赫蒂诺弗。但他仅用 4 年就拿下博士学位。

于是,美国网友开始追问:明明杨植麟曾在美国读书,为什么没留在美国?

博士毕业后拒绝苹果 offer

坚定回国创业

有些人猜测是因为美国严苛的移民政策,H1B 工作签证门槛持续收紧,应届生几乎很难中签。

对普通应届生来说确实如此。

但卡内基梅隆大学是公认的计算机领域第一梯队,常年和麻省理工学院、斯坦福大学三足鼎立。

杨植麟就读的 LTI 语言技术研究所,更是全球自然语言处理发源地之一。

随后,他的导师萨拉克赫蒂诺弗公开辟谣,称当时杨植麟要是想留在美国,会有很多机会。

苹果一位高管曾向他抛出过橄榄枝,但杨植麟说想回到自己的祖国,非常坚定要回去创业。

他说,如果不至少尝试创办自己的公司,他会后悔一辈子。

其实,早在卡内基梅隆大学读博期间,杨植麟就已经开始创业。

2016 年,他人在美国读书和清华同学陈麒聪、张宇韬一起在北京创立了循环智能,主要通过语音识别、语义理解、对话复盘、客户意向分析,帮助传统企业完成销售流程数字化、智能化升级。

杨植麟作为联合创始人,主要负责底层大模型技术的研发。他从一开始,就坚持技术自研优先,没有把循环智能做成一家普通的外包型 AI 公司。

博士期间,他做出 Transformer-XL、XLNet 两大里程碑长文本架构,基于这个架构,他在公司内主导搭建了自研预训练自然语言处理底座,区别于同期同行依赖开源 BERT 微调的路线,在金融对话、口语语义识别上效果大幅领先。

等到博士毕业后,他婉拒美国所有高薪 offer,回到中国,全职运营循环智能。

2021 年,杨植麟带领团队,与华为云联合研发千亿级盘古中文自然语言处理大模型,是国内最早入局大模型自研的企业之一。

ChatGPT 爆发后,杨植麟判断通用大模型存在更大机会,于是脱离循环智能,在 2023 年成立月之暗面,推出 Kimi 智能助手。

创新性提出新缩放定律

K3 是多年深耕后的厚积薄发

2023 年堪称是 " 百模大战 " 元年,除了月之暗面外,新成立的大模型公司超过 100 家,半年时间国内扎堆发布了上百个大模型。

整个行业都在照搬 ChatGPT 的底层逻辑,疯狂增加参数量、囤积网页文本、扩建 GPU 集群,他们相信缩放定律永远生效,只要砸钱堆卡、做大模型,能力就会线性上涨。

但在 2024 年,杨植麟就已经提出新缩放定律。

据博主 @Max For AI 透露,当时月之暗面最新 K0-Math 模型发布后,杨植麟在北京办公室做了场小范围的分享,会议室的主题是 " 新的 Scaling Law(缩放定律)"。

他全程没讲产品,没聊融资,而是在探讨 AI 大模型的下一个未来。

他认为缩放定律正在从过去靠堆参数、堆数据,变成强化学习驱动下的推理能力。

之后的几年里,Kimi 发布的新模型都延续了这条路径。

2025 年发布的 K1.5 主打数学、编程、多模态,对标 o1;K2 复用 K1.5 强化学习框架,新增 Token 预算约束损失,控制冗长输出、进一步提升有效 Token 利用率。

今年年初,K2.5 上线,推出第一代多智能体协作系统,内置三层奖励机制,杨植麟在英伟达 GTC 大会上,正式把缩放架构拆成三个维度:Token 效率、上下文长度、智能体集群。

最新推出的 K3,则是对这三个维度的极致放大。

K3 总参数 2.8 万亿,896 个专家单次推理仅需激活 16 位,稀疏效率大幅拉高;原生 100 万 Token 全局无损上下文。

如今,这条路也已经成为全行业共识。

结语

对比 OpenAI、Anthropic 两家美国巨头,动辄数千亿美元的融资规模,Kimi 母公司月之暗面成立至今融资不到 100 亿美元,且大部分是今年刚融的,可用算力不如美国同行十分之一。

人员体量也是天差地别,Kimi 全公司员工才 300 人左右,OpenAI、Anthropic 都是数千人规模的庞大研发队伍。

但就是这样一家 " 小公司 " 追上了美国 AI 巨头。

如果只看月之暗面这家公司,成立才 3 年,很多人可能会觉得太年轻,K3 的成功是运气使然,但如果追溯到杨植麟对 AI 大模型的思考和探索,其实已经有十多年。

所谓一鸣惊人,不过是主动放弃捷径、多年持续深耕之后的水到渠成。

真正拉开 AI 巨头差距的,从来不是短期资本、海量算力、上千人的庞大队伍,而是敢舍弃安稳、提前看透周期、长期落地执行的技术远见。

当下,国内的大模型赛道已进入白热化对决,今天,Kimi K3 还在刷屏全网,但对手们也即将出招了。

7 月 19 日晚,阿里巴巴宣布即将发布并开源千问 3.8 大模型,参数规模达 2.4 万亿,官方称其可能是 " 仅次于 Fable 5 的最强模型 ";DeepSeek V4 正式版也已进入灰测,最快可能在明天发布。

一周内三家模型同台竞技,国产大模型已经成为真正意义上的 " 各领风骚数十天 "。

从国内第一,到冲击全球第一,大模型们的神仙打架,本质是行业走向成熟的标志:没有永远的第一,只有持续的进化。

END •

欢迎点击科技每日推送视频号,看最新视频 ~

Question. Write.Narrate. Believe. Become a story. 易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

美国 kimi ai 创始人 导师
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论