量子位 昨天
端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

静态互联网数据的增长红利,见顶了。

下一轮模型能力的跃迁,会越来越依赖与真实环境持续交互的「端侧」。

当整个行业还在想办法把更强的模型塞进设备时,一支从北大走出来的团队,给出了上述这一激进的行业判断。

甚至在端侧 AI 迎来爆发的这个时间节点,他们还直接给它重新下了一个定义:

生产力 = 元空端侧 AI= 模型 × Agent × 设备。

端侧 AI 也由此从一条「把模型搬下来」的单向链路,开始变成一套能自己转起来的飞轮。

  AI 生成

得出这个反常识判断的公司,大家应该也不陌生:元空智能(元空 AI)。

三年前,这支从北大走出来的创业团队,靠国内最早一批 AI Excel 产品 ChatExcel 迅速出圈,短时间积累上百万名用户。

三年后,它已经一路从云端应用,杀到了本地端侧——

就在近期,元空一口气发布端侧模型 Boxer、面向办公场景的元空 AI Work,以及科研 Agent 元空 AI Science。

三者从模型、Agent 到设备侧形成完整闭环,让模型与设备完成共同进化。

更值得玩味的是,当行业还在讨论端侧 AI 到底怎么走进更多设备时,市场已经先给这家公司投了一票。

就在几天前,元空 AI 的端侧模型,刚刚拿下惠普商务电脑预装。

一家从高校实验室走出来的创业团队,就这样从一个办公 AI 产品,一路走到了全球头部硬件厂商的设备里。

  AI 生成

当前,端侧 AI 的分水岭,正在从「跑起来」走向「长期跑」。

当行业还在反复讨论端侧 AI 究竟该如何落地时,已经有行业玩家顺着原有产品线一路延伸,把端侧能力真正接进了自己的产品路径,并率先跑出了规模化市场结果。

重新定义端侧 AI,让模型和设备共同进化

今天再聊端侧 AI,行业里最常出现的几个关键词依旧很熟悉——

成本、安全、稳定性,以及怎样把一个足够强、又足够小的模型塞进更多的设备。

过去几年,这几乎就是端侧 AI 最核心的工程题。

但在这家公司看来,在当下这个时间点看这个问题,显得多少有些不够用了。(扎心 .jpg )

相较于更习惯从技术本身寻找答案的团队,元空 AI 会在行业内给出这样一套反常识的判断,其实算不上意外。

  AI 生成

外界最早认识这家公司,大概是因为 2023 年火出圈的 AI 表格产品 ChatExcel。

也就三年时间,ChatExcel 就积累了数百万用户,元空 AI 的产品版图也一路向外延伸——

从 AI DataAgent,到国内首个对标 Claude for Science 的开源 OpenAI4S 项目,再到元空科研实验室 e2Sci.com,已经逐渐从办公场景走进更复杂的科研工作流。

值得一提的是,作为一款面向科研场景的 Agent,元空 AI4Science 也没有停在查文献、跑分析的能力层,而是进一步把文献检索、数据分析、模型与工具调用一路接到真实实验设备,让 AI 开始真正参与实验执行。

这也意味着,科研 Agent 的边界也开始从屏幕里的「信息处理」,开始伸进「真实实验流程」。

也正是因为长期贴着用户的真实使用场景跑,让这个北大团队逐渐看到了模型下一阶段竞争里一个更关键的变量——

大模型从静态互联网数据中攫取的增长红利已经见顶。

下一阶段真正有价值的能力增量,会越来越多来自真实任务、真实环境,以及持续发生的交互。

这听起来多少有些反直觉,但整个行业其实已经陆续亮起预警信号。

  AI 生成

今年上半年,斯坦福在《AI Index 2026》报告专门提到了一个词,叫「Peak Data」。

简单来说,就是互联网上真正高质量、适合训练的人类生成数据,正在越来越接近被前沿模型吃到头。

更扎心的是,这个趋势已经开始在真实训练实验里露出「迹象」。

此前,Hugging Face 等团队在 JMLR 发表的一项研究中进行了超过 400 次模型训练,最大做到 9B 参数、9000 亿训练 Token,专门模拟模型反复吃已有数据的情况。

结果发现,已有数据重复到一定程度之后,继续增加训练计算的收益不断下降,最终新增算力带来的价值趋近于 0。

换句话说,最容易挖的「富矿」被不断抓取、清洗和训练之后,剩下的数据越来越杂。

已经吃过的数据再反复喂,模型也很难一直长个儿。

于是,大模型继续从互联网里挖静态数据疯狂往前 scaling law 的老路,开始显得有些力不从心了。(doge)

△   JMLR 论文《Scaling Data-Constrained Language Models》

问题也随之而来。

既然互联网里的现成数据越来越难继续提供足够大的增量,下一批真构建真实环境的数据,又会从哪里长出来?

元空 AI,把答案直接指向了「设备」。

换句话说,设备除了是 AI 能力的载体外,它还有另一个身份:一个能持续产生稀缺数据的环境。

这个判断听上去有点反常识,但仔细想的话,其实也很合理。

因为在今天这个时间点,模型要想从现实世界里继续学东西,总得先有一个能碰到真实任务、真实环境的入口。

而设备真正特殊的地方,恰好就在于它天然站在「任务发生」的现场。

无论是 PC、手机还是机器人,只要 AI 真正开始干活,就一定会留下三样东西:为什么做、怎么做、最后做成没有。

这和互联网里的静态数据很不一样。

网页可以告诉模型世界是什么样,但真实设备留下的轨迹,却可以告诉模型「事情究竟是怎么被做成的」。

其与真实环境的每一次执行交互,以及最终的成功或失败,其实都会持续沉淀出新的行为轨迹、环境反馈和结果。

而这些,恰恰也是静态互联网数据里最稀缺的那部分。

当这些真实任务里的动作、反馈和结果被重新沉淀进后训练、强化学习或者记忆系统,模型也就有机会从一次次执行里继续修正自己。

于是,端侧 AI 开始从一条单向链路变成一个循环——

模型做判断,Agent 组织行动,设备真正去执行;现实世界给出反馈,结果再重新回到模型并持续进化。

设备由此也从 AI 能力的「终点」,变成下一轮能力增长的「起点」。

  AI 生成

也正是基于这套逻辑,元空 AI 把对端侧 AI 的判断压缩成了一条很直给的公式:生产力 = 元空端侧 AI= 模型 × Agent × 设备。

而「生产力」,恰恰是这套公式最后要交付的结果。

毕竟对用户来说,模型、Agent 和设备再怎么协同,最终都得回答一个很骨感且现实的问题——

一件事儿到底有没有被顺利做完,有没有被稳定持续地做完,以及有没有得到一个可靠的交付结果。

这家做了多年 ToC 产品的公司,再清楚不过这个道理。

也正因如此,沿着这套逻辑,端侧 AI 是否真正成立,自然也落到了两个更现实的维度上:

能不能解决真实的生产力问题,以及能不能跨过技术验证阶段,走向面向普通用户的规模化交付。

只有当能力真正进入一台台设备、融进一次次真实任务,并持续产生可验证的结果,端侧 AI 才算真正从一个技术概念,长成一套可以被用户长期使用的生产力系统。

模型 × Agent × 设备,端侧 AI 开始长出真实生产力

行业判断讲得再漂亮,最终还得落到产品上。

既然生产力是端侧 AI 成立的关键标准,那模型、Agent 和设备就必须真正进入任务链路里跑起来。

事实上元空 AI 这套关于端侧 AI 的判断,也已经开始从一个行业命题,沿着产品和技术一路长出更具体的落点。

就在几天前,元空 AI 正式发布端侧模型 Boxer,并同步推出元空 AI Work 与元空 AI Science 两款 Agent 产品,模型、Agent 和设备,也由此被接进了同一条执行链路。

先来说说其中最底层的一环,面向真实办公场景打造的端侧模型「Boxer」。

有意思的是,Boxer 从一开始就没有一味追求更大的参数规模,它押注的是一个今天并不算最性感、却很现实的区间:中尺寸模型。

之所以把端侧模型落在中尺寸区间,背后其实是一笔很现实的「生产力账」。

模型尺寸最终权衡的,无非两件事:任务能不能跑得动,以及设备养不养得起。

这有点像给一辆长期使用的车选动力系统。

跑车发动机当然强,但拿去每天通勤并不经济;微型发动机便宜,真碰到长途又不够用,真正适合大多数用户的,往往是中间那段甜点区。

这个道理,在大模型身上同样适用。

10B 以下的小模型足够轻,适合聊天和简单调度;200B 以上的大模型能力更强,更适合高度开放的复杂问题。

但长期和真实用户、办公场景打交道的元空 AI 发现,绝大多数高频需求恰恰落在中间地带:

做汇报、处理 Excel、设计实验、分析结果,这类任务边界相对明确,却同时考验模型的推理、规划和长链路执行能力。

于是,20B — 100B 成为团队最终押注的区间。

能力足以覆盖复杂工作,资源开销又能压进 PC 和实验设备真正可部署、可持续运行的范围,绝佳。

  AI 生成

当然,这个平衡点到底有没有成立,最终还得回到两件很现实的事情:能力到底够不够顶,设备跑不跑得动。

能力侧,在元空自建的 WorkArena 评测中,Boxer-35B-A3B-v0-0819 拿下 73.1 分,位列对比组第一,领先第二名 10.3 分;部分任务表现甚至超过一年多前的 GPT-4o。

部署侧,在 40 TOPS 算力、不到 8GB 内存占用下,Boxer 依旧能保留 87.3% 的原始模型任务效果。

这波算是真 · 把高阶模型生产力跑到端上了。

模型跑起来只是第一步,真正把生产力组织起来,还需要 Agent 把理解、规划和执行串成完整流程——

这也正是元空 AI Work 和元空 AI Science 两款 Agent 产品承担的角色。

具体到办公场景,元空 AI Work 打通了目标 - 跨应用执行 - 结果验证 - 状态更新 - 继续工作之间的闭环。

像做表、查数据、写文档、做 PPT,甚至处理代码和文件这些需求,用户只需要直接说清楚目标,剩下的步骤由系统自己往下跑。

更关键的是,这套能力可以完整留在本地,断网也能继续干活,复杂任务中断后还能接着往下执行,be like:

另一个面向科研场景的 Agent 元空 AI Science,则被进一步接进了真实实验流程。

其不仅覆盖文献研究、数据分析、生信和蛋白质工程等科研任务,还进一步把能力延伸到了实验设备本身——

从实验设计、执行到数据回流,都可以由 Agent 串起来,真正做到科研成果的可复刻、可验证、可追溯。

当 Agent 真正进入这些设备,开始持续执行长链路任务,新的疑问也来了。

那就是一次次操作、环境变化和用户反馈,是怎么被长期留下来,并在后续任务里继续发挥作用的。

元空 AI 的答案,指向了 Agent 长期运行的另一块底座—— Memory 记忆飞轮。

其解决的核心问题,便是让 Agent 从「一次性执行」走向「持续认知」。

在任务执行中,任务轨迹、环境事件和用户反馈会在执行过程中持续进入 Memory,并被重构为任务状态、知识资产和用户偏好,让 Agent 具备状态恢复、知识复用和偏好学习能力。

于是一次任务结束后,经验不会跟着清零,最终做到跨任务、跨设备、跨时间持续运行。

真 · 越用越懂用户,这是又…又闭环上了??

从技术可用到商业交付,市场开始用真金白银投票

当生产力这件事具备成熟条件,端侧 AI 接下来要回答的,就是另一道更现实的题:能不能真正走向规模化交付。

市场,已经开始用真金白银投票。

从前两年开始,元空 AI 陆续和芯片硬件厂商合作,而且去年就已经和惠普产生了商业订单,并持续共创端侧 AI 产品。

就在前几天,双方的合作又往前走了一步——元空 AI 正式与惠普达成战略合作。

目前,元空 AI Work 及元空 AI 35B 端侧模型,已经与惠普 Z 系列 ZGX Nano G1n AI 工作站、ZBook 8 G2i 移动工作站和 Z2 Mini G1a 台式工作站完成深度适配,并开始面向制造、金融、医疗、科研等领域输出行业解决方案。

而这场合作的半径,事实上还在持续向外层扩延。

下一步,元空 AI 还将跟随惠普不同 SKU 进入笔记本、工作站、服务器等更多产品线,并借助现有全球渠道继续向海外扩展。

惠普与元空 AI 签约合作备忘录

硬件厂商愿意和一家成立仅三年的团队持续合作,本身就像一场更严格的「反向评测」。

Benchmark 测的是模型能力,头部硬件厂商筛的是另一套指标:稳定性、兼容性、成本,以及几年之后还能不能继续交付。

模型跑一次很难,跑进几万、几十万台设备更难。

某种程度上,这次战略合作也意味着元空 AI 已经跨过了端侧 AI 更难的一道门槛——从技术可用,走向规模可用。

对企业来说,端侧 AI 有一笔很现实的账。

一次性的硬件投入,换来长期接近零边际成本的本地 Token,以及持续运行的本地智能能力,只要这套能力真正进入业务,企业就有足够明确的付费理由。

长期和用户、真实场景打交道的元空 AI,显然更早感受到这笔账,合作伙伴也看到了同样的价值。

从早年火出圈的 ChatExcel,到后来的元空 AI Work,再到今天把模型、Agent 和设备一起推向端侧,元空 AI 这几年的产品路径,其实始终在回答同一个问题——

AI 到底什么时候,才能真正从「可用」走到「值得长期部署」。

而现在,从技术成熟、产品落地到商业订单,这三个维度已经开始同时给出了具体生动的答案。

参考链接:

[ 1 ] 元空 AI Work 官网:https://www.chatexcel.com/

[ 2 ] 元空 AI Science 官网:https://www.e2sci.com/

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 北大 互联网
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论