AI 最终是一场体系战
作者/ IT 时报 郝俊慧
编辑/ 孙妍
2013 年,科幻电影《她》结尾时,Samantha 离开了西奥多,她进化得太快,最终进入了一个人类无法抵达的世界。13 年后,这样的未来,可能不再只是想象。
9 月,一个并不算新的概念突然成为全球 AI 圈的高频词—— RSI(Recursive Self-Improvement,递归式自我改进),OpenAI、Anthropic 等全球顶尖 AI 企业先后公布了自家的 RSI 研究进度。
RSI 思想源头可追溯至 20 世纪 60 年代英国数学家 I.J. Good 提出的 " 智能爆炸 " 假设:如果一台超智能机器能够设计出比自己更好的机器,那么它也可以设计出自己的 " 下一代 ",由此可能形成不断加速的智能迭代。
科幻已经照进现实。据 Anthropic 披露,截至 2026 年 8 月,Claude 已在约 26% 的内部 AI 研发工作中扮演 "Lead" 角色,但并未实现完全自主;OpenAI 则宣布已经实现 " 自动化研究实习生 " 目标,并且朝着 2028 年 3 月打造 " 自主 AI 研究员 " 的目标稳步推进。
无独有偶,9 月 22 日,RSI 也出现在了 2026 杭州云栖大会上。"Qwen 团队正在进行 RSI 探索,并已经取得一定进展。" 当天,阿里巴巴集团 CEO 吴泳铭给出了一个更为惊人的判断:未来机器思考的总量,将达到人类的 1000 倍以上," 机器动力不是简单的‘人造体力’,而是创造了完全不同的物种。"
然而,问题随之出现:如果这一天真的到来,如此庞大规模的 " 机器思考 ",由谁来生产?如此聪明的机器智能,由谁来控制?
今年云栖大会上,阿里用 AI 模型、AI 芯片和 AI 云回答了第一个问题,将其定义为 " 机器智能时代的三大基石 ",并将长期坚定投入这三项基础设施建设;而对于第二个问题,吴泳铭说," 很难具体描绘未来是什么样的,但我始终认为,AI 越强大,人类更强大。"
AI 模型
让 AI 开始 " 造 AI"
一年前的云栖大会,吴泳铭首次系统性阐述了 ASI(超级人工智能)的三个演进阶段:智能涌现、自主行动、自我迭代,仅仅过了一年,通往 ASI 的技术路径变得更加清晰," 就是 RSI"。
吴泳铭首先拆解了现在的 " 人工智能(Artificial Intelligence)" 概念,他认为 Artificial 更强调 " 人造的智能 ",言外之意是和人一样的智能,但事实上机器智能是完全不同的物种,随着 ASI 的逐步实现,机器正在成为思考的主力,智能将成为一种规模化的商品," 显然将未来称为‘机器智能时代’更加准确。"
AI 模型是实现 RSI 的基石。吴泳铭认为,过去一年,通往 ASI 的技术路径逐渐清晰:模型可以从真实反馈中发现自己的短板,自主设计实验、构建数据、评价结果,再进入下一轮改进。
Qwen 已有一定探索。据阿里披露,Qwen3.8-Max 曾通过自主搭建训练流程,在人类 " 零参与 " 的情况下持续迭代超过一个月,完成 33 轮有效迭代。结合 RSI 和后训练等技术,新版本在 Artificial Analysis 上的得分提高了 12.5%。
RSI 不仅体现在 AI 自我训练上,在阿里芯片模型协同设计的一项实验中,Qwen3.8-Max 仅基于一份真实的芯片模块规范,便在工业级 EDA 环境中进行了自主设计、验证和优化,模型连续自主运行超过 60 小时,调用 EDA 工具超过 1 万次,最终完成物理实现,并将模块面积减少 42%。
阿里巴巴 ATH 事业群 Token Foundry Qwen LLM 项目负责人刘大一恒在现场演讲中也透露,Qwen3.8-Max 的总参数量为 2.4T,较 2023 年底开源的 720 亿参数 Qwen-72B,总参数量增长约 33 倍,而基于新架构的 Qwen4 正在训练,后续 Qwen4.5 和 Qwen5 计划将总参数量推向 5~10T,目标是完成更复杂、更长程的任务,向 ASI 迈进。
当然,这离严格意义上能够完全自主研发下一代 AI 的 RSI 还相当远。
9 月中旬,由上海交通大学、清华大学、字节跳动、上海人工智能实验室等机构研究者合作在 ArXiv 发表的论文《由人类构建的最后一个人工智能:迈向真正的递归式自我改进(V2)》中提出了 RSI 的三个目标:扩展能力边界、提升资源效率、发现人类预设策略之外的新方案,并 " 以责任转移为判据 " 将 RSI 的自主性划分为 L1~L5 五个层级,而最高 L5 等级的判断标准是,"AI 可以修改负责未来改进的机制本身,并用修订后的机制进行后续轮次 "。
面对 AI 自主进化的未来,更多人类变得焦虑。OpenAI 本月明确表示,完全自主的 RSI 今天尚未发生," 除非能够安全实现,否则我们不应追求它 ",而安全措施与模型性能无法同步的矛盾,或将在全球爆发 L5 到来之前最为激烈的论战。
然而," 与人类的进化一样,人工智能的进化也将经历一段漫长而非凡的历史。迄今为止,人工智能所取得的成就,不过沧海一粟 ",这也是今天 AI 基础设施厂商依然坚定投入的战略注脚。
算力
从一块芯片到一个系统
" 之前阿里哪有硬件,现在全是硬件。"9 月 22 日,2026 杭州云栖大会算力馆,两位参会者边参观边感慨,磐久服务器、直流不间断电源模块、IT 模块、冷却 & 配电模块……阿里云几乎将整个机房搬进了展馆,而且每个展项上都写着 " 自研 " 二字;而在展示阿里全部 AI 能力的智能馆,真武系列超节点永远是人气最旺的展区。
这是阿里第一次全面展现出自己的 " 算力肌肉 "。在展区,记者看到了从计算、CPU、互联、网络到存储的一整套平头哥(阿里巴巴全资控股的半导体公司)芯片,其中真武系列承担 AI 计算,倚天系列承担 CPU 计算,ICN Switch 负责高速互联,磐脉系列承担智能网卡,镇岳系列覆盖存储主控……组建超大规模 AI 集群所需的核心芯片已全面覆盖。
国产 AI 算力的竞争,正在从 " 拼一颗芯片 " 转向 " 拼一台计算机 ",最终拼整个算力系统。
因此也更容易理解,为何阿里并没有公布真武 V900 单芯片的具体算力指标,只表示其性能是真武 M890 的 3 倍,却更强调了其搭载的显存是 216GB,片间互联带宽达到 1200GB/s,并原生支持 FP8、FP4 低精度计算。
如果将这几个数据拆解来看,216GB 显存解决的是记忆常驻问题,更大的模型参数、上下文和 KV Cache 可以尽可能驻留在高速显存中,从而减少频繁的数据搬运;1200GB/s 片间互联解决的则是为了降低模型被切分到多颗芯片之后的通信开销;而原生 FP8/FP4 解决的是成本,据平头哥(阿里巴巴全资控股的半导体公司)副总裁高慧透露,精度每降一档,一度电换来的 Token 数量基本可以翻一倍。
截至 2026 年 6 月,真武系列已服务超过 650 家企业客户。吴泳铭表示,随着平头哥芯片产品线成熟和客户扩大,AI 芯片年出货量将大幅提升。
CPU 也再次走上舞台。今年云栖大会上,平头哥首次公布了倚天服务器 CPU 的规划,据高慧透露,2027 年将推出倚天 720 和倚天 730 两代服务器 CPU,其中倚天 720 将实现单核性能、核密度与能效的全面提升;倚天 730 则首次基于平头哥全自研 CPU 微架构设计,单核 SPECint2017/GHz 性能将最高提升至倚天 710 的 1.4 倍。
所有这些布局最终都集中体现于阿里云当天发布的新一代 AI Native 超节点服务器——磐久 AL64 分布式 SNPO 光互连超节点,以及将在 2028 年推出的磐久 AL144 超节点。阿里提供的数据显示,磐久 AL144 超节点单柜支持 650kw,ScaleUp 规模可扩展至 10368。
其中,一个值得关注的技术是 SNPO(ScaleUp NPO,ScaleUp 专用近封装光学)。按照阿里的说法,磐久 AL64 是全球首款实现 SNPO 光互连技术落地的超节点服务器,这意味着近封装光互连开始从原型概念进入 AI 云的真实工程部署。
在智能馆展区,记者看到了磐久 AL144 超节点,与磐久 AL128 对比可知,AL144 进一步改变了超节点内部的布局方式:AL128 将 GPU Node、CPU Node 和 Switch Node 分开部署,可以根据客户需求灵活组合不同计算、互联资源,更适合对硬件配置和部署方式有定制需求的专有云场景;AL144 则将 CPU 和 GPU 集中到同一个 Compute Node 中,缩短 CPU 与 GPU 之间的数据传输距离,并结合 SNPO 光互连进一步提升 Scale-Up 互联密度。前者强调灵活组合,后者则更强调极致的计算密度和互联效率。
阿里给出的数据是,通过阿里云全新设计的智算中心网络架构,磐久单一集群可扩展至 50 万卡规模。
颇有意味的是,就在一周前,华为也刚刚宣布在新一代昇腾 960 超节点中引入 NPO 近封装光学技术,基于灵衢实现内存统一编址,可扩展至 4096 卡规模,二层 CLOS 四平面组网后,可支持最大 51.2 万卡,再结合多轨道拓扑最大支持 100 万卡集群。
当模型进入十万亿参数、集群迈向十万乃至百万卡之后,真正决定 Token 产能的,是几十万颗芯片能否像一台计算机一样工作。从这个角度来看,两家大厂几乎不约而同地选择了同一个方向,让 " 光 " 进入 AI 超节点。
这种殊途同归背后是一种共识,Agentic AI 正在重新定义整个计算系统,Scaling Law 将持续在 AI 基础设施厂商处奏效。
AI 云
承载机器智能的 " 超级电网 "
当然,芯片仍然不是最终答案。
AI 云是阿里提出的第三个基石,随着可实现千卡 Scale-Up 以及 50 万卡级集群的下一代超节点逐步落地部署,云正从传统 AI 基础设施向 Agentic Cloud 演进。
云栖大会当日,阿里云宣布今年第四季度将在宁夏中卫地域新增灵骏真武 M890 超节点服务,而在 40 天前的 8 月 12 日,阿里云在内蒙古乌兰察布已经正式上线了同款 AI 服务。
官网显示,灵骏真武 M890 超节点实例支持 FP8/FP4 低精度计算,通过 ICN Switch 1.0 芯片 Scale-up 互联规模达 64 卡,卡间互联提升至 800GB/s。在模型训练、智能驾驶、具身智能等训练场景中,相比上一代性能提升三倍。
作为国产十万卡的云上超节点集群,位于乌兰察布的阿里云灵骏真武 M890 超节点已成功运行超 2 万亿参数大模型,Kimi K3 和 Qwen3.8 Max 均已通过该算力形态对外提供服务,企业无需自建机房,即可跨入万亿参数大模型所需的高密度算力门槛。
" 阿里云打造了业界领先的全栈 AI Native 基础设施,灵骏超节点正式上线 30 多天,就有上百家企业级客户陆续接入。" 阿里云弹性计算负责人吴结生透露。
吴泳铭也表示,由于目前客户 AI 需求强劲,行业中长期需求远超供给能力,而全球 AI 数据中心相关供应链紧缺仍限制算力增长,同时他给出了一个阿里云规模增长的明确目标及时间节点:到 2032 年,阿里云运营的全球数据中心规模超过 20GW。
阿里将 AI 云定义为 " 承载机器智能的超级电网 ",一语双关。
全球云计算的计量单位正在发生变化,当 Token 成为新的计算商品,电力正在成为衡量 AI 算力规模的新单位,AWS、微软、阿里等科技公司越来越多地直接用 GW 描述其算力基础设施的规模。
那么,阿里的 20GW 是什么概念?可比数据是,2025 年 AWS 新增 3.9GW 电力容量,并计划到 2027 年底将整体电力容量翻倍;按微软 2026 年 9 月最新规划,2032 年容量将超 38GW,是现在的三倍;OpenAI 计划用 5000 亿美元修建的 " 星际之门 ",目标是 10GW ……
如何把这些算力转化成企业可以直接调用的 Token,成为支持 RSI 庞大算力需求的基础设施,才是 AI 云真正需要解决的问题。
阿里的筹码
AI 最终是一场体系战
今年的杭州云栖大会是阿里整体 AI 体系第一次如此集中地在世人面前亮相,从中可以一窥阿里对 " 机器智能时代 " 即将到来的紧迫感,吴泳铭表示," 我们看到行业的中长期需求,远超我们的供给能力 "。
ChatGPT 出现之后,AI 产业一直在寻找 " 杀手级应用 ":搜索、办公、编程、视频生成、智能体…… IDC 预计,到 2030 年全球年度 Token 消耗量将达 15 万 Peta,年复合增长率超 3400%,但吴泳铭却把今天的 AI Coding 比作 1882 年首次被爱迪生点亮的电灯,仅仅是在替代现有工作,而不是创造一个时代," 机器智能时代真正具有代表性的产品,其实还没有出现 "。
今天的人们很难预测,当机器智能爆发之后,会出现什么样的新产品、新发明,就像站在 1882 年的电灯下,人们很难想象出电气时代的完整图景,但唯一可确定的是,发电站和电网必不可少。
真正决定下一阶段竞争力的,是谁能拥有机器智能时代的 " 发电厂 " 和 " 电网 ",将智能源源不断输送到千行百业,而这套机器智能生产系统,至少在国内,阿里的布局最为完整。
它手里同时握着国产头部 AI 开源大模型、自研全系列芯片和全球规模最大的云计算平台之一,并试图使三者形成一个彼此加速的飞轮:Qwen 生产和进化智能,真武、倚天以及网络、存储芯片提升 Token 生产效率,超节点把越来越多芯片组织成一台巨型计算机,阿里云再把这些能力变成企业可以调用的 Token 和 Agent 服务,与此同时,真实模型和 Agent 负载又反向进入芯片、网络、存储和云平台的下一轮设计。
这便是阿里面向 ASI 的筹码。
排版/ 季嘉颖
图片/ IT 时报 阿里云
来源/《IT 时报》公众号 vittimes
E N D
大家都在看
IT 时报
怕被 AI 替代?
不如先学会用好它
「挨踢妹 @AI 茶水间」
每日投喂
扫码即可加入↓↓↓
请加「星标」不错过我们


登录后才可以发布评论哦
打开小程序可以发布评论哦