《科创板日报》9 月 19 日讯(记者 李明明) " 我们的继任者,正是我们亲手创造出来的 AI。" 9 月 17 日,智谱创始人、首席科学家唐杰在 X 平台发表长文,并转发智谱技术博客,披露 GLM 团队在递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践:由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化——模型开始反向改进承载自己运行的系统。这是国内大模型厂商首次公开跑进生产环境的 RSI 案例。
时点耐人寻味。就在前一天,智谱刚在分析师电话会上披露,约 50 亿美元再融资中约 60% 的净额(约 235 亿港元)将投入下一代 GLM 基础模型和 " 完全自训练 " 体系;昨日,智谱又正式 GLM-5.3-FlashX,其新版本推理速度最高可达 200tokens/s,是 GLM-5.3-Flash 速度的 5 倍,定价提升至原版的 2.5 倍。大洋彼岸的 Anthropic 则公开了内部衡量 AI 自我改进速度的三大指标。战略叙事、工程实践、产品提价、监管仪表盘在 48 小时内密集落地—— RSI 这条曾被视作科幻概念的赛道,这一周同时进入了中国公司的生产环境、价目表和美国公司的披露清单。

两周 3 倍:模型给自己建了一套推理系统
所谓递归自我改进,指的是 AI 系统不再只是被动运行的工具,而是开始参与改进自身——从写代码、调优承载自己的系统,到终极形态:自主设计并训练出自己的 " 继任者 "。它被头部实验室视为通往 AGI 的关键一跃,逻辑很现实:人类研究员的扩张是线性的,而一旦模型开始参与研发自己的下一代,迭代速度就具备了复利式加速的可能。商业含义同样直接——AI 研发效率和推理成本,正是大模型公司眼下最烧钱的两项支出;谁先让模型把这两项成本打下来,谁的商业闭环就先跑通。
据智谱方面对《科创板日报》记者介绍,这次实践的硬指标是:Infra Agent 在超过 10 万张国产芯片组成的集群上,从零搭建了一套完整的生产级推理服务,不到两周将端到端吞吐提升至初始基线的 3 倍,硬件利用效率与单 Token 成本达到主流 NVIDIA GPU 相当水平,并支持 1M 上下文窗口与多模态请求。
据官方博客,此前没人成功部署过如此大规模的国产卡集群——芯片内存容量和带宽受限、生态不成熟、算子不完备,许多文档基本靠猜。做成这件事的不是一支团队,而是 GLM-5.3 驱动的 Infra Agent。GLM-5.3-Flash 的全部线上推理,目前都运行在这套系统之上。
系统已经受真实流量检验:GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode 与 OpenRouter 上线,一周内成为双平台调用量最大的模型,6 天 Token 调用量超过 62 万亿。技术栈上,团队实施了以算力换带宽、以通信换显存等定制化方案,并引入 EPD(Encode – Prefill – Decode)分离式架构。
值得记录的是这次实践的含 RSI 量:Agent 不再只是生成代码,而是围绕推理系统完成了完整工程闭环——根据测试、Trace、Benchmark 等稠密反馈自主提出性能假设、定位精度缺陷、修改底层代码、执行分层测试并持续迭代。GLM 团队同时划清了边界:系统尚未达到完全自主设计和训练下一代模型的阶段,但 RSI 的早期形态已经出现——模型建设推理系统,系统再反过来支撑模型运行。
这次披露并非孤立事件,而是智谱半年来层层递进的一步。今年 7 月,创始人唐杰在内部信《巨浪已来》中提出摸高计划,将完全自训练列为核心方向;8 月 31 日业绩会上,智谱管理层首次为下一代模型定调:从预训练、中训练到后训练全流程让模型自己训练自己,核心特征是自净化—— " 最大的问题是这个模型能自己判断什么时候停止、什么时候纠正自己,而不是简单地把模型训练大 "。
一位大模型业内人士告诉《科创板日报》记者,对智谱而言,RSI 的商业含义同样直接:推理系统的吞吐与单 Token 成本,正是其算力经济账里 80% 理论推理毛利的前提。模型把自己的推理成本打下来,等于给智谱那笔 300 亿算力投入、400 亿年收益的测算补上了一个自我强化的变量。
涨价与降本,正在这家公司身上同步发生。昨日上线的 GLM-5.3-FlashX 定价为 GLM-5.3-Flash 的 2.5 倍,据《科创板日报》记者统计,这已是智谱年内至少第六次提价。一边用 RSI 把推理成本打下来,一边把更快的服务卖出更高的价格,两个动作指向同一本账:把推理生意的毛利做厚。
RSI 全球牌桌:头部实验室竞速透明化,中国厂商落地真实生产环境
RSI 已是全球头部实验室公开竞逐的下一个高地,而 Anthropic 在本周拿出了迄今最激进的一次透明化动作。9 月 12 日,CEO 阿莫迪发表长文《We Must Pace the Frontier》,单方面承诺引入拥有员工级权限的独立第三方评估员进驻公司,并呼吁前沿实验室给 AI 发展定速——递归自我改进被其列为需要全球协调限速的对象。
9 月 18 日,Anthropic 在官网发布《理解前沿实验室中 AI 发展速度的衡量指标》,首次向外界公开三项内部指标:其构建的 " 研发自动化指数 " 显示,截至 8 月,Claude 在 26% 的 AI 研发工作中处于主导地位、超过 90% 的研发工作有 AI 深度参与,但没有任何环节实现完全自主;在其最常用的内部平台上,任意时刻约有 3 万个 AI 智能体在执行研发与工程任务,这些智能体的全部动作 100% 经过在线监控系统,被拦截的比例为 0.002%,约合每 4.7 万次动作拦截一次;算力分配上,投向 AI 研发的算力中约 6% 用于安全研究。
OpenAI 则选择了把时间表公开。9 月 6 日,其官方博客宣布按期达成去年秋天设立的 " 自动化 AI 研究实习生 " 目标:研究部门每投入 1 个人工工作日,对应 3.1 个智能体工作日;下一个节点是 2028 年 3 月前实现 " 自动化 AI 研究员 "。OpenAI 同时承认,以 RSI 方式实现这一目标的路径,尚不清楚如何安全实现。
放回国内坐标,《科创板日报》记者注意到,智谱这次披露的意义在于 " 生产环境 " 四个字:此前国内厂商关于自我改进的表述多停留在论文与规划层面,GLM 是第一个把 RSI 早期形态放到真实流量下检验并公开细节的。竞争逻辑也在此切换——当 AI 开始参与自身系统的构建,AI 研发效率本身成了竞争对象:谁先让模型参与构建下一代模型,谁的迭代速度就获得复利。
国内牌桌上,大厂中,腾讯混元 7 月发布研究智能体 Hyra-1.0,将递归自我改进能力引入自身研发工具栈;字节 Seed 团队也在推进 Seed ‑ for ‑ Seed 的 AI4AI 探索,把 AI 自动数据合成、评测、框架调优逐步融入模型研发流水线;阿里 5 月发布的 Qwen3.7-Max,曾在自研真武 M890 芯片上连续自主工作 35 小时、完成 1158 次工具调用——没有挂 RSI 的名字,做的是同类的事。
海外对照组更能说明赛道热度:据统计,半年内 RSI 相关初创融资已超过 10 亿美元——由 OpenAI 前研究副总裁等人创立、田渊栋加盟的 Recursive 估值已达 46.5 亿美元;Anthropic 离职研究员 6 月创立的 Mirendil,种子轮即获 2 亿美元。竞争逻辑也在此切换:当 AI 开始参与自身系统的构建,AI 研发效率本身成了竞争对象——谁先让模型参与构建下一代模型,谁的迭代速度就获得复利。
对于这次披露,北京计算机学会 AI 专委会秘书长、北京大学特聘研究员张有鱼对《科创板日报》记者表示,智谱此次实践的价值不在于 3 倍吞吐这个数字本身,而在于验证了 Agent 可以在缺乏文档、生态不成熟的国产硬件环境里完成长链条工程任务。这解决的是国产算力最头痛的可用性问题——卡买到了没人会调,现在模型自己会调了。但他同时提醒,目前的 RSI 仍局限于 " 有稠密反馈、可自动验 " 的工程场景。此外,Infra Agent 优化的是推理系统工程,不是模型架构与训练方法的自我设计。离完整意义上的 RSI,即模型自主设计并训练出继任者,中间还隔着整个行业都还没跨过去的一步。
(科创板日报记者 李明明)


登录后才可以发布评论哦
打开小程序可以发布评论哦