静态互联网数据的增长红利,见顶了。
下一轮模型能力的跃迁,会越来越依赖与真实环境持续交互的「端侧」。
当整个行业还在想办法把更强的模型塞进设备时,一支从北大走出来的团队,给出了上述这一激进的行业判断。
甚至在端侧 AI 迎来爆发的这个时间节点,他们还直接给它重新下了一个定义:
生产力 = 元空端侧 AI= 模型 × Agent × 设备。
端侧 AI 也由此从一条「把模型搬下来」的单向链路,开始变成一套能自己转起来的飞轮。
△ AI 生成
得出这个反常识判断的公司,大家应该也不陌生:元空智能(元空 AI)。
三年前,这支从北大走出来的创业团队,靠国内最早一批 AI Excel 产品 ChatExcel 迅速出圈,短时间积累上百万名用户。
三年后,它已经一路从云端应用,杀到了本地端侧——
就在近期,元空一口气发布端侧模型 Boxer、面向办公场景的元空 AI Work,以及科研 Agent 元空 AI Science。
三者从模型、Agent 到设备侧形成完整闭环,让模型与设备完成共同进化。
更值得玩味的是,当行业还在讨论端侧 AI 到底怎么走进更多设备时,市场已经先给这家公司投了一票。
就在几天前,元空 AI 的端侧模型,刚刚拿下惠普商务电脑预装。
一家从高校实验室走出来的创业团队,就这样从一个办公 AI 产品,一路走到了全球头部硬件厂商的设备里。
△ AI 生成
当前,端侧 AI 的分水岭,正在从「跑起来」走向「长期跑」。
当行业还在反复讨论端侧 AI 究竟该如何落地时,已经有行业玩家顺着原有产品线一路延伸,把端侧能力真正接进了自己的产品路径,并率先跑出了规模化市场结果。
重新定义端侧 AI,让模型和设备共同进化
今天再聊端侧 AI,行业里最常出现的几个关键词依旧很熟悉——
成本、安全、稳定性,以及怎样把一个足够强、又足够小的模型塞进更多的设备。
过去几年,这几乎就是端侧 AI 最核心的工程题。
但在这家公司看来,在当下这个时间点看这个问题,显得多少有些不够用了。(扎心 .jpg )
相较于更习惯从技术本身寻找答案的团队,元空 AI 会在行业内给出这样一套反常识的判断,其实算不上意外。
△ AI 生成
外界最早认识这家公司,大概是因为 2023 年火出圈的 AI 表格产品 ChatExcel。
也就三年时间,ChatExcel 就积累了数百万用户,元空 AI 的产品版图也一路向外延伸——
从 AI DataAgent,到国内首个对标 Claude for Science 的开源 OpenAI4S 项目,再到元空科研实验室 e2Sci.com,已经逐渐从办公场景走进更复杂的科研工作流。
值得一提的是,作为一款面向科研场景的 Agent,元空 AI4Science 也没有停在查文献、跑分析的能力层,而是进一步把文献检索、数据分析、模型与工具调用一路接到真实实验设备,让 AI 开始真正参与实验执行。
这也意味着,科研 Agent 的边界也开始从屏幕里的「信息处理」,开始伸进「真实实验流程」。
也正是因为长期贴着用户的真实使用场景跑,让这个北大团队逐渐看到了模型下一阶段竞争里一个更关键的变量——
大模型从静态互联网数据中攫取的增长红利已经见顶。
下一阶段真正有价值的能力增量,会越来越多来自真实任务、真实环境,以及持续发生的交互。
这听起来多少有些反直觉,但整个行业其实已经陆续亮起预警信号。
△ AI 生成
今年上半年,斯坦福在《AI Index 2026》报告专门提到了一个词,叫「Peak Data」。
简单来说,就是互联网上真正高质量、适合训练的人类生成数据,正在越来越接近被前沿模型吃到头。
更扎心的是,这个趋势已经开始在真实训练实验里露出「迹象」。
此前,Hugging Face 等团队在 JMLR 发表的一项研究中进行了超过 400 次模型训练,最大做到 9B 参数、9000 亿训练 Token,专门模拟模型反复吃已有数据的情况。
结果发现,已有数据重复到一定程度之后,继续增加训练计算的收益不断下降,最终新增算力带来的价值趋近于 0。
换句话说,最容易挖的「富矿」被不断抓取、清洗和训练之后,剩下的数据越来越杂。
已经吃过的数据再反复喂,模型也很难一直长个儿。
于是,大模型继续从互联网里挖静态数据疯狂往前 scaling law 的老路,开始显得有些力不从心了。(doge)
△ JMLR 论文《Scaling Data-Constrained Language Models》
问题也随之而来。
既然互联网里的现成数据越来越难继续提供足够大的增量,下一批真构建真实环境的数据,又会从哪里长出来?
元空 AI,把答案直接指向了「设备」。
换句话说,设备除了是 AI 能力的载体外,它还有另一个身份:一个能持续产生稀缺数据的环境。
这个判断听上去有点反常识,但仔细想的话,其实也很合理。
因为在今天这个时间点,模型要想从现实世界里继续学东西,总得先有一个能碰到真实任务、真实环境的入口。
而设备真正特殊的地方,恰好就在于它天然站在「任务发生」的现场。
无论是 PC、手机还是机器人,只要 AI 真正开始干活,就一定会留下三样东西:为什么做、怎么做、最后做成没有。
这和互联网里的静态数据很不一样。
网页可以告诉模型世界是什么样,但真实设备留下的轨迹,却可以告诉模型「事情究竟是怎么被做成的」。
其与真实环境的每一次执行交互,以及最终的成功或失败,其实都会持续沉淀出新的行为轨迹、环境反馈和结果。
而这些,恰恰也是静态互联网数据里最稀缺的那部分。
当这些真实任务里的动作、反馈和结果被重新沉淀进后训练、强化学习或者记忆系统,模型也就有机会从一次次执行里继续修正自己。
于是,端侧 AI 开始从一条单向链路变成一个循环——
模型做判断,Agent 组织行动,设备真正去执行;现实世界给出反馈,结果再重新回到模型并持续进化。
设备由此也从 AI 能力的「终点」,变成下一轮能力增长的「起点」。
△ AI 生成
也正是基于这套逻辑,元空 AI 把对端侧 AI 的判断压缩成了一条很直给的公式:生产力 = 元空端侧 AI= 模型 × Agent × 设备。
而「生产力」,恰恰是这套公式最后要交付的结果。
毕竟对用户来说,模型、Agent 和设备再怎么协同,最终都得回答一个很骨感且现实的问题——
一件事儿到底有没有被顺利做完,有没有被稳定持续地做完,以及有没有得到一个可靠的交付结果。
这家做了多年 ToC 产品的公司,再清楚不过这个道理。
也正因如此,沿着这套逻辑,端侧 AI 是否真正成立,自然也落到了两个更现实的维度上:
能不能解决真实的生产力问题,以及能不能跨过技术验证阶段,走向面向普通用户的规模化交付。
只有当能力真正进入一台台设备、融进一次次真实任务,并持续产生可验证的结果,端侧 AI 才算真正从一个技术概念,长成一套可以被用户长期使用的生产力系统。
模型 × Agent × 设备,端侧 AI 开始长出真实生产力
行业判断讲得再漂亮,最终还得落到产品上。
既然生产力是端侧 AI 成立的关键标准,那模型、Agent 和设备就必须真正进入任务链路里跑起来。
事实上元空 AI 这套关于端侧 AI 的判断,也已经开始从一个行业命题,沿着产品和技术一路长出更具体的落点。
就在几天前,元空 AI 正式发布端侧模型 Boxer,并同步推出元空 AI Work 与元空 AI Science 两款 Agent 产品,模型、Agent 和设备,也由此被接进了同一条执行链路。
先来说说其中最底层的一环,面向真实办公场景打造的端侧模型「Boxer」。
有意思的是,Boxer 从一开始就没有一味追求更大的参数规模,它押注的是一个今天并不算最性感、却很现实的区间:中尺寸模型。
之所以把端侧模型落在中尺寸区间,背后其实是一笔很现实的「生产力账」。
模型尺寸最终权衡的,无非两件事:任务能不能跑得动,以及设备养不养得起。
这有点像给一辆长期使用的车选动力系统。
跑车发动机当然强,但拿去每天通勤并不经济;微型发动机便宜,真碰到长途又不够用,真正适合大多数用户的,往往是中间那段甜点区。
这个道理,在大模型身上同样适用。
10B 以下的小模型足够轻,适合聊天和简单调度;200B 以上的大模型能力更强,更适合高度开放的复杂问题。
但长期和真实用户、办公场景打交道的元空 AI 发现,绝大多数高频需求恰恰落在中间地带:
做汇报、处理 Excel、设计实验、分析结果,这类任务边界相对明确,却同时考验模型的推理、规划和长链路执行能力。
于是,20B — 100B 成为团队最终押注的区间。
能力足以覆盖复杂工作,资源开销又能压进 PC 和实验设备真正可部署、可持续运行的范围,绝佳。
△ AI 生成
当然,这个平衡点到底有没有成立,最终还得回到两件很现实的事情:能力到底够不够顶,设备跑不跑得动。
能力侧,在元空自建的 WorkArena 评测中,Boxer-35B-A3B-v0-0819 拿下 73.1 分,位列对比组第一,领先第二名 10.3 分;部分任务表现甚至超过一年多前的 GPT-4o。
部署侧,在 40 TOPS 算力、不到 8GB 内存占用下,Boxer 依旧能保留 87.3% 的原始模型任务效果。
这波算是真 · 把高阶模型生产力跑到端上了。
模型跑起来只是第一步,真正把生产力组织起来,还需要 Agent 把理解、规划和执行串成完整流程——
这也正是元空 AI Work 和元空 AI Science 两款 Agent 产品承担的角色。
具体到办公场景,元空 AI Work 打通了目标 - 跨应用执行 - 结果验证 - 状态更新 - 继续工作之间的闭环。
像做表、查数据、写文档、做 PPT,甚至处理代码和文件这些需求,用户只需要直接说清楚目标,剩下的步骤由系统自己往下跑。
更关键的是,这套能力可以完整留在本地,断网也能继续干活,复杂任务中断后还能接着往下执行,be like:
另一个面向科研场景的 Agent 元空 AI Science,则被进一步接进了真实实验流程。
其不仅覆盖文献研究、数据分析、生信和蛋白质工程等科研任务,还进一步把能力延伸到了实验设备本身——
从实验设计、执行到数据回流,都可以由 Agent 串起来,真正做到科研成果的可复刻、可验证、可追溯。
当 Agent 真正进入这些设备,开始持续执行长链路任务,新的疑问也来了。
那就是一次次操作、环境变化和用户反馈,是怎么被长期留下来,并在后续任务里继续发挥作用的。
元空 AI 的答案,指向了 Agent 长期运行的另一块底座—— Memory 记忆飞轮。
其解决的核心问题,便是让 Agent 从「一次性执行」走向「持续认知」。
在任务执行中,任务轨迹、环境事件和用户反馈会在执行过程中持续进入 Memory,并被重构为任务状态、知识资产和用户偏好,让 Agent 具备状态恢复、知识复用和偏好学习能力。
于是一次任务结束后,经验不会跟着清零,最终做到跨任务、跨设备、跨时间持续运行。
真 · 越用越懂用户,这是又…又闭环上了??
从技术可用到商业交付,市场开始用真金白银投票
当生产力这件事具备成熟条件,端侧 AI 接下来要回答的,就是另一道更现实的题:能不能真正走向规模化交付。
市场,已经开始用真金白银投票。
从前两年开始,元空 AI 陆续和芯片硬件厂商合作,而且去年就已经和惠普产生了商业订单,并持续共创端侧 AI 产品。
就在前几天,双方的合作又往前走了一步——元空 AI 正式与惠普达成战略合作。
目前,元空 AI Work 及元空 AI 35B 端侧模型,已经与惠普 Z 系列 ZGX Nano G1n AI 工作站、ZBook 8 G2i 移动工作站和 Z2 Mini G1a 台式工作站完成深度适配,并开始面向制造、金融、医疗、科研等领域输出行业解决方案。
而这场合作的半径,事实上还在持续向外层扩延。
下一步,元空 AI 还将跟随惠普不同 SKU 进入笔记本、工作站、服务器等更多产品线,并借助现有全球渠道继续向海外扩展。
△惠普与元空 AI 签约合作备忘录
硬件厂商愿意和一家成立仅三年的团队持续合作,本身就像一场更严格的「反向评测」。
Benchmark 测的是模型能力,头部硬件厂商筛的是另一套指标:稳定性、兼容性、成本,以及几年之后还能不能继续交付。
模型跑一次很难,跑进几万、几十万台设备更难。
某种程度上,这次战略合作也意味着元空 AI 已经跨过了端侧 AI 更难的一道门槛——从技术可用,走向规模可用。
对企业来说,端侧 AI 有一笔很现实的账。
一次性的硬件投入,换来长期接近零边际成本的本地 Token,以及持续运行的本地智能能力,只要这套能力真正进入业务,企业就有足够明确的付费理由。
长期和用户、真实场景打交道的元空 AI,显然更早感受到这笔账,合作伙伴也看到了同样的价值。
从早年火出圈的 ChatExcel,到后来的元空 AI Work,再到今天把模型、Agent 和设备一起推向端侧,元空 AI 这几年的产品路径,其实始终在回答同一个问题——
AI 到底什么时候,才能真正从「可用」走到「值得长期部署」。
而现在,从技术成熟、产品落地到商业订单,这三个维度已经开始同时给出了具体生动的答案。
参考链接:
[ 1 ] 元空 AI Work 官网:https://www.chatexcel.com/
[ 2 ] 元空 AI Science 官网:https://www.e2sci.com/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦