IT时报 21小时前
刘知远:两年后,今年最强模型能力将下沉到手机
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

端侧智能的 iPhone 时刻何时到来

作者/   IT 时报  郝俊慧

编辑/   孙妍

7 月 19 日上午,2026 世界人工智能大会(WAIC 2026)" 端侧 AI 创新和行业发展论坛 " 接近尾声。圆桌主持人极客公园创始人张鹏抛出最后一个问题:端侧的 iPhone 时刻,什么时候到来?

这是过去三年被反复问起的问题,几乎每一场关于端侧智能的讨论最终都会收尾于此。

面壁智能联合创始人、总裁雷升涛没有直接回答,而是给出了一个比喻:" 我觉得端侧智能落地,不会像冬天里的一场雪,一夜之间便千树万树梨花开,它更像是春天里的几场雨,一场雨下来,有些草绿了,再一场雨下来,玉兰花开了,几场雨下来,各方一起努力迎来满园春色。"

这个略显 " 克制 " 的回答,背后暗含的答案是:端侧模型落地是一个涉及芯片、系统、软件生态和场景定义等复杂因素的系统工程,不会在某一天 " 叮 " 一下便突然降临。

但这并不意味着它离我们还远。2026 年,太多 " 看起来像是那一刻 " 的信号正密集出现,尤其是在 7 月中旬短短一周里。

7 月 15 日,国家网信办公示首批手机端侧生成式人工智能服务备案名单,七款在列:Apple 智能、华为小艺 AI 大模型、OPPO AndesGPT、vivo 蓝心端侧大模型、小米澎湃 AI、三星盖乐世 AI,以及努比亚豆包手机大模型。跑在手机本地的大模型第一次进入监管框架。

7 月 17 日开幕的 WAIC 2026 上,阶跃星辰发布全球首款智能体手机 STEPX Neo、中兴发布全球首款量产 AI 智能体手机努比亚 Navi X Ultra、荣耀发布全球首款机器人手机 Robot Phone ……能打车、能点外卖的 AI 手机似乎触手可及。

7 月 22 日晚,三星在伦敦发布全新折叠旗舰 Galaxy Z Fold8 与 Galaxy Z Fold8 Ultra;次日,面壁智能确认,旗下 MiniCPM 系列端侧大模型为这两款旗舰的 Galaxy AI 提供端侧模型能力,而它只是一家刚满四岁的端侧大模型独角兽公司,在新一轮融资中估值超 200 亿元。

一周之内,监管框架、产业共识、全球旗舰,加速推进。

" 最多再有两年,端侧模型将等效于今年的 Claude 或 GPT-5.6。"WAIC 2026 期间,面壁智能联合创始人、首席科学家刘知远对《IT 时报》记者说,这意味着,即便在断网情况下,两年之后的 AI 手机也可以具备等同于当前最强模型的智能能力,反应更快、更私密、更稳定,还不用消耗 Token。

三星电子中国研究院院长沈志春给出的另一个时间表是,预计明年年初就会有 20B~30B 的模型在端侧商用。

为什么端侧是必然?

AI 手机,不是多几个 AI 功能。

当年惊艳世界的 iPhone 之所以被称为 " 颠覆性革命 ",在于它把手机从通信工具变成了个人计算平台。

但此前已面世的 AI 手机,大多只是增加了影像优化、语音助手、办公辅助等几个零散的 AI 功能,本质上仍是 " 调用服务 ",用户提出问题,手机连接云端模型,再返回答案。但真正意义上的个人智能助手,需要理解用户长期习惯、记住上下文、感知所处环境,并在合适的时候主动完成任务,大量高频、实时、敏感的数据处理需要在本地完成,手机的智能能力要离用户更近。

WAIC 2026 上发布的几款智能体手机,基本都是朝后者的方向演进。行至今日,AI 走向端侧,已是技术演进和产业发展的必然方向,AI 也终于真正成为手机厂商故事里的新主线。

只是,还远未到爆发时刻。

云端模型之不能

沈志春把终端厂商对端侧模型的要求概括为四个字:多、快、好、省。多,是希望端侧模型做更多业务,而不是把所有需求都转给云端;快,是响应更快,要有比云端更快的 Token 输出效率;好,是达到消费者对业务 AI 的需求,即算力和模型参数量达到均衡,最终满足实用需求;省,是省 Token、省空间。

这四个字背后,恰恰是云端模型在手机侧的 " 不能 "。

据面壁智能联合创始人、CEO 李大海介绍,移动互联网时代很多公司尝试过云游戏,理论上把渲染放在云端,终端不需要强算力,但这条路始终没有大规模跑通,核心原因是用户对帧率、延迟和稳定性极度敏感,不接受毫无预期的卡顿。

从商业层面来看,时延也无法满足客户的需求,Akamai 的一项研究表明,浏览器页面加载每延迟 100 毫秒,可能导致转化率下降 7%。

没有人的生活愿意被直播

liko.ai 创始人李少章也认为,端侧智能是揭开 " 家庭隐私担忧死结 " 的唯一办法。年轻人想给独居的父母装摄像头,却往往不被老人接受,谁都不愿意自己的生活被直播,而端侧智能的作用在于,所有计算都在本地完成,只需上传语义结果即可。

成本也是一大原因。高通公司全球副总裁、中国区研发负责人、IEEE Fellow 徐皓指出,从最简单的单轮对话到多轮对话,再到今天的智能体应用,手机 AI 对 Token 的消耗量呈现几十倍的上涨趋势," 如果不断往云端调大模型,显然非常低效 "。

今年的智能体浪潮虽压低了云端的成本,但让手机厂商更审慎对待 AI in Side 策略。虽然 "Token 经济 " 是个听起来很 " 美好 " 的盈利模式,但此前豆包收费引起的风波,说明消费级市场为 Token 买单并不容易。

随着模型效率提升、芯片能力增强,AI 能力将逐步从集中式云端计算走向云端与终端协同。

路线之争

蒸馏,还是重做一遍?

近几年来,端侧模型逐渐进入大公司的视野,科技巨头们不约而同地走向同一条路:把模型做 " 小 ",把能力做 " 强 ",而最常用的方式是蒸馏。

谷歌的 Gemini Nano,便是蒸馏了旗舰机型 Gemini 的核心能力,直接集成在 Android 系统和 Pixel、三星等旗舰手机中,最新开源的 Gemma 4 模型参数只有 2B 和 4B;阿里云在 2026 年 3 月也密集开源了千问 3.5(Qwen 3.5)系列的四款小尺寸模型,参数规模从 0.8B 到 9B,覆盖从边缘设备到轻量服务器的全场景。

蒸馏的天花板

但实验表明,大多数经过剪枝、蒸馏得到的压缩模型,密度低于原始模型;如果后训练不充分,小参数模型的能力密度会显著下降。想得到一个又小又聪明的模型,必须从数据配比、架构选择到训练策略整条链路重做一遍。

刘知远以芯片做了类比,终端对空间和功耗的要求更高,正如制程工艺最先进的芯片是终端芯片,在终端上做高模型密度同样极具挑战。以他的经验来看,善于训练云端模型的团队,即便提前约定好蒸馏端侧模型的尺寸和响应时间,也未必一定能调好。

两种架构的分岔

核心原因之一,是两者的架构起点天然不同。如今各家大模型参数量动辄以万亿计,Kimi 刚刚发布的 K3 就高达 2.8 万亿。

云端模型的需求是 " 多用户高并发 ",当海量用户提问时模型必须快速反应,因此采用的架构多为 MoE(混合专家模式),将模型拆成多个 " 专家 ",每次推理只激活其中一小部分;但 MoE 有一个致命的硬件缺陷,所有专家的参数要 " 全量加载至显存 " 中,这也是近两年存储价格一路上扬的关键原因。

" 端侧模型是戴着枷锁在跳舞。" 沈志春坦言。

相较而言,端侧设备的显存有限,若在处理每个 Token 时都动态切换专家,必然会严重拖慢计算速度。因此端侧模型通常选择密集模型(Dense Model),参数虽少(比如 2B、3B、7B),但每个参数都会被激活参与计算,可这种模式的缺点是单次推理算力需求高。

不同的路线

不同手机厂商和模型厂商选择了不同的路线。

首批手机端侧生成式人工智能服务备案名单中,国行版 Apple 智能背后或是阿里和百度:阿里千问承载文本创作、长文本推理、图文生成、文档总结这类系统底层的生成式能力;据媒体报道,百度也有可能负责 AI 搜索、视觉检索、实景识别,以及中文版 Siri 的知识库优化。

目前尚不清楚哪些苹果机型可支持国产 Apple 智能,但从苹果在今年 WWDC 2026 上发布的自家端侧模型看,其本体参数已超过 20B。核心技术是靠稀疏架构让每次推理只激活一部分,再靠闪存动态加载绕开内存墙,相应的代价是对硬件要求较高,目前只有 iPhone 17 Pro 系列等新机型才支持。

三星也在研究 20B 的手机混合专家模式,方案是推理时让连续的 Token 尽量共用相同的一组或几组专家,由于相邻 Token 在语义上往往高度相关,使用相近的专家并不会显著降低模型质量,从而减少对存储带宽的消耗。

据面壁智能介绍,其 InfLLM-V2 是全球首个开源的原生稀疏注意力方案,可以把上下文切成块,每次只选最相关的部分块参与计算,且零新增参数,原生融入预训练,而不是训完再打补丁。

两条曲线的交汇

论坛当日,端侧智能北京市重点实验室联合北京智源人工智能研究院发布了报告《端侧智能 2026 ——规模化落地元年》。

密度定律:

智能密度 100 天翻一倍

2024 年至今,刘知远团队回测了 50 多个主流大模型,发现大模型的智能密度正以每 3.5 个月翻一倍的速度增长。换算成时间便是,每过 100 天就能用一半的参数,实现当前最强模型的能力,仅用两年,实现同等智能水平所需要的模型规模,就有机会缩小到原来的 1/100。

这也是刘知远判断两年后端侧模型可以实现当前最先进模型能力的理论来源——密度定律。

为此,刘知远提出了一个新的概念 " 模型制程 ",和摩尔定律在芯片制程的逻辑一样,大模型制程遵循密度定律以实现能力递增。

这意味着,AI 正在经历一次类似芯片产业的效率革命。过去需要依赖云端服务器运行的大模型能力,正在通过模型压缩、训练优化和推理加速,逐渐被装进手机芯片。

一个直观的案例便是,面壁智能新发布的 MiniCPM5-1B 参数只有 10 亿,却可以实现两年前 GPT-4o 级别的能力。

之所以说 2026 年是端侧 AI 规模化落地元年,正是面壁智能根据密度定律判断,当下芯片电路密度与模型能力密度两条曲线走到了交汇的一刻:模型在同一参数上能释放更强的智能,芯片在同样面积和功耗上也能支撑更大的模型。

" 这意味着曾经只能跑在云端的智能,会自然下沉到每一台手机、每一辆汽车以及更广泛的每一个终端。" 刘知远表示。

生态落地:

软硬件高度协同

大模型要在端侧高效运行,不仅需要模型本身足够高效,也需要芯片平台在算力、带宽和功耗之间取得精准平衡。

论坛当日,面壁智能与英特尔联合发布 AI Box 产品,将率先在长安汽车上量产落地;具身智能领域,面壁发布的模型 MiniCPM-RobotTrack 原生适配宇树科技机器狗,采用开源架构,不仅可以无缝迁移至同类本体上,迁移至不同本体上也只以天计算。

截至目前,面壁智能已与英特尔、高通、联发科、AMD、英伟达、瑞芯微等主流芯片平台完成适配。智源研究院副院长林咏华在论坛上透露,面壁的 MiniCPM 系列已适配超过 10 款硬件平台,涵盖 ARM、RISC-V 等主流架构,包括此芯科技 P1、辉羲智能具身 RPU、高通 NPU、中移动端侧芯片与恩智浦等相关芯片。

面壁智能联合清华大学和 OpenBMB 开源的 BitCPM-CANN,在华为昇腾平台上验证了 1.58 比特三值大模型的训练方案,采用量化感知训练,从训练一开始就让模型适应低比特表示。李大海判断,1.58 比特已接近量化的极限。

真正懂人的 " 贾维斯 "

端侧 AI 真正的竞争,并不只是让模型运行在手机里,而是让手机里的 AI 真正 " 懂人 "。

从 WAIC 2026 讨论的方向来看,未来 AI 发展方向将从简单的大模型能力竞争,转向智能体能力竞争,模型不仅要回答问题,更要理解上下文、调用工具并完成任务:一个真正的 AI 办公助手,需要知道用户过去的写作习惯、会议内容和工作节奏;一个生活助手,需要理解用户长期形成的消费偏好和行为方式。

其中,长期记忆是一个重要的技术门槛,尤其是对于端侧或者具身智能而言。

坊间传闻金鱼的记忆只有 7 秒钟,而具身智能连一秒都没有。每次推理时,机器人通常接收三张图片(来自两个腕部相机和一个主视角相机)、一段文本输入,最后输出一个可执行的动作。现在大多数 VLA(视觉语言动作)模型的做法,是基于机器人当前看到的画面和要做的任务来判断下一步动作,而非当前观测加历史观测记忆和执行数据,因为后者计算量太大。

但这种局限使模型在需要连续操作的真实任务中表现乏力。" 比如简单的擦黑板擦三次,模型如果没有记忆,根本不知道自己擦了几次,看当前画面是不知道的。" 面壁智能学术合伙人、多模态智能首席科学家姚远进一步指出,这种局限不仅影响任务表现,更导致大量数据无法被有效利用。

面壁智能发布的 MiniCPM-RobotManip 通用 VLA 模型,首次支持 " 原生 1 分钟的视觉历史上下文 " 传统方案处理一帧需 256 个 Token,面壁通过 4 倍压缩降至每帧 64 个 Token;对应到机器人上肢操作,推理速度越快,机器人完成一项操作的时间越短、卡顿越少。

因此,具身机器人在执行擦黑板、做汉堡等 " 较为长程和复杂的真实世界任务 " 时,不再是失忆的 " 金鱼大脑 ",而能像人类一样,基于连续的历史感知做出更优决策,计算成本也大幅下降。

在机器人上下文记忆基准测试 RMBench 中,MiniCPM-RobotManip 得分 53%,而此前的单帧反射方案只有 5%~10%,基本等同于随机猜测。

相比单纯追求参数规模,端侧模型更强调效率和场景适配,在有限算力、有限功耗下,如何让模型发挥最大价值,成为新的技术竞争点。

" 最后一公里 "

"iPhone 时刻 " 迟迟不来,最可能的卡点在哪里?

政策的时间表已经明确。中国信息通信研究院云大所大数据与智能化部主任姜春宇指出,根据 " 人工智能 +" 行动计划目标,智能终端普及率 2027 年要到 70%,2030 年要到 90% 以上。今年 5 月,工业和信息化部、商务部、国家市场监督管理总局等部门联合启动实施《人工智能终端智能化分级》系列国家标准,编号为 GB/Z 177 — 2026,标准落地后,阶跃星辰的 STEPX Neo 成为首批通过 L3 级测试的智能体手机,并入选本届 WAIC" 镇馆之宝 ",小度的 AI 眼镜也拿到 L3 级证书。

但距离真正落地,还有三大卡点。

第一是缺标准,北京智源人工智能研究院副院长兼总工程师林咏华指出,业界一直缺乏端侧模型加芯片的系统评测方法,为此,智源准备联合全球开源机构、国内芯片厂商与模型厂商发起端侧智能评测。

第二是碎片化,沈志春认为,如今最大的矛盾不是端侧模型不够强,而是场景互不相通," 比如,开车时说‘帮我导航到朋友推荐的餐厅’,可通信记录在手机上,车机不知道是哪一家;在家对网关说‘布置一下书房,一会儿要和海外客户开视频会议’,时间表在电脑上,网关找不到链接。"

第三是能力不一致,可穿戴设备可以用 1 到 2 比特量化,个人电脑可能是 4 到 8 比特,同样的上下文、同样的需求,不同终端输出千差万别,但用户的需求是一样的," 有没有可能做一种超高弹性的模型,既能适配不同算力的终端,输出能力又比较接近?" 沈志春发问。

云网端的另一条路

WAIC 2026 上,沈志春的问题从完全不同的方向拿到了半个答案。

7 月 17 日的开幕式主论坛上,中国电信人工智能研究院的智传网(AI Flow)拿下本届世界人工智能大会的最高奖 SAIL 奖。

简单理解,智传网是用算力换带宽。传统通信是对原始信息的符号搬运,而智传网通过生成式智能传输,不再传输海量原始数据,改为传输 Token,在接收端还原重建。

中国电信人工智能研究院院长李学龙给出的数据是:传输一段 24 帧 / 秒的 1080P 高清视频,传统技术需要约 3.6Mbps 带宽,而基于生成式智能传输,不到 100Kbps 就能实现高清稳定实时传输。

在智传网的端边云分层架构里,部署的是不同规模的家族式同源模型,共享统一的知识体系与特征向量,从而实现智能任务在不同设备、不同网络层级之间的接力推理。

这恰恰是碎片化的另一种解法,或许不是让每个终端都跑同一个模型,而是让不同规模的模型共享同一套语义空间。手表上的小模型和云端的大模型说同一种语言,任务就能在层级之间接力,而不必在每一层重新开始。

如果这条路走通,网络侧的压缩,降低了传输门槛;端侧的密度提升,降低了计算门槛,两条曲线同时向下延伸,端云协同的分工线将被重新定义。在确定性网络底座的支撑下,端侧智能可能产生创新性的另类解法。

" 这是特别美妙的事情,大家从各自角度提出一些设想,让整个产业、整个体系变得更好。" 刘知远表示。

排版/   季嘉颖

图片/   WAIC   IT 时报

来源/《IT 时报》公众号 vittimes

E   N   D

大家都在看

IT 时报

怕被 AI 替代?

不如先学会用好它

「挨踢妹 @AI 茶水间」

扫码即可加入↓↓↓

请加「星标」不错过我们

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论