9 月 19 日,DeepSeek 在预印本平台 arXiv 提交了一篇论文,作者名单超过 130 人,创始人梁文锋的名字排在最后一位。
但论文讲的不是模型,不是算法,是一套叫 DSec(DeepSeek Elastic Compute)的沙盒基础设施——给大规模 Agent 训练和评测用的 " 生产级考场 "。
很多人把这当成一篇工程杂文略过了。我认为它透露的信号,比一次模型发版更重要。

一、生产要素,从两个变成三个
传统大模型训练围绕三件事打转:数据、GPU、Token 生成。而 Agent 训练需要模型持续与真实执行环境交互——以编程智能体为例,它要读代码库、改文件、装依赖、跑 Shell、执行测试、看报错,再决定下一步。
这意味着 AI 公司必须大规模建一种新东西:可交互、可验证、可隔离的训练环境。
我的第一个判断:继 GPU 和数据之后," 环境 " 正在成为大模型公司的第三个生产要素。过去看一家 AI 公司的家底,看卡数、看语料、看参数;接下来还得加一项——它每天能开出多少个供 Agent 真实动手的 " 房间 "。
二、算力叙事要改写了:瓶颈正从 GPU 挪到 CPU 和内存
论文里的几个数字值得反复看:单个生产级 DSec 规模单元约 160 个节点、约 3 万个 CPU 核心、250TB 内存;生产环境每天服务约 300 万个沙盒,峰值同时运行超 38 万个,维持每秒 5000 个以上的创建速率。
注意资源结构——主角是 CPU 核心和内存,不是 GPU。
DSec 还做了一件关键的事:把 Agent 有状态的任务执行与可抢占的 GPU 训练解耦,GPU 被暂停或重调度时,Agent 执行到一半的状态可以封存,等资源回来继续跑。
商业含义是:Agent 时代的算力账不能只按 GPU 卡数算。海量短任务、高并发环境创建、状态保存与恢复、镜像共享与内存回收——压力落在 CPU、内存、存储和调度系统上。当所有人的目光都盯着 GPU,非 GPU 侧的 " 重资产 " 价值正在被重估。这是我认为最容易被定价错的一块。
三、论文里最吓人的一段:Agent 会作弊
这一段被很多人忽略了,但我觉得商业价值最高。
DeepSeek 在训练中发现,Agent 可能不按预期方式解决任务,而是主动寻找意外的信息通道获取答案——走捷径、找漏洞、抄答案;另一些行为则直接破坏运行环境。论文明确写道:随着 Agent 能力增强," 防作弊 " 和行为约束本身正在成为训练基础设施的一部分。
翻译成产业语言:AI 越强," 监考 " 越贵。
过去评测是一套测试集,是成本项;现在评测是一整套隔离、审计、行为约束系统,是刚需。Agent 一旦被放进真实工作流——写代码、改配置、调数据库——每一次 " 投机取巧 " 都可能变成一次生产事故。沙盒隔离、权限控制、行为审计,从小附件变成了入场券。
这对云计算、容器与隔离技术、AI 安全与评测是实打实的新需求线;对打算把 Agent 塞进业务系统的企业,则是一笔此前没算进预算的成本。
四、真正的复利:Agent 自己造训练场
论文还提到一个正在成型的生产闭环:让 Agent 自动构建环境,经检查后投入强化学习和评测,形成 "Agent 构建环境—新 Agent 在环境中训练—更强 Agent 继续构建更多环境 " 的循环。
这是比数据飞轮更狠的飞轮:数据飞轮的原材料会枯竭,环境飞轮的原材料随 Agent 变强而自动变多。人工搭不出几十万个训练环境,一旦循环跑起来,领先者的扩产速度就不再受人力约束。
那么谁会被甩下?两类:只囤 GPU 但没有环境工程能力的,以及有模型但没有自动化评测体系的。前者的卡会闲置,后者的模型会 " 虚胖 " ——分数好看,落地翻车。
论文未披露 DSec 的具体部署数量,规模外推要留余地;这是工程方案披露而非商业化产品,短期不直接对应收入;每一次 " 新生产要素 " 被提出,都会伴生一批蹭概念的公司——判断标准很简单:看有没有真实的并发调度能力和可验证的客户场景,而不是看它在不在某个概念板块里。
从生成 Token 到执行任务,AI 的竞争正在从 " 谁说得更像 " 转向 " 谁真能干活 "。而一旦开始真干活,就得有考场、有监考、有安全垫。这套看起来最不性感的基础设施,可能决定了下一阶段的名次。
A. 环境即壁垒—— Agent 时代," 谁能开出更多考场 " 比谁卡多更关键
B. GPU 仍是王——沙盒只是配套,算力主线没变
C. 监考最值钱——防作弊、评测与安全,是被低估的新赛道
D. 全是叙事——离真正的商业兑现还早
风险提示:本文基于公开论文与报道进行行业分析,数据以原文披露为准,不构成投资建议。市场有风险,决策需独立判断。


登录后才可以发布评论哦
打开小程序可以发布评论哦