(来源:钛媒体 APP)
下行周期中,手机行业正在寻找新的价值锚点,从目前手机品牌的动作来看,Agent 手机成了卖货的新看点。只不过,不同于过去手机品牌的单点参与,在这轮 Agent 手机浪潮中,大模型企业也纷纷下场,不同技术路线之间的碰撞,也让整个手机产业迎来了久违的火药味。
可以确定的一点是,Agent 是共识,差异在于对 AI 主动服务的边界以及参与方式上。9 月,在 Agent 手机集中爆发之前,各大厂商先带来了在系统层的思考。

日前,在 vivo 开发者大会(VDC)上,除了 Origin OS 在 UI 以及玩法上的迭代,vivo 进一步展示了关于 Agent OS 的阶段性落地架构。相比过去几年围绕大模型参数、AI 功能数量以及单点体验的竞争," 个人化智能 " 成了 vivo 今年想要强调的关键词,以及未来系统迭代的核心。
这是 vivo 第一次将手机定义为 Agent 终端,不是被动做事,而是主动服务,并通过不断的学习用户习惯,逐渐变为一个懂用户的设备。在交流中,vivo 副总裁、OS 领域副总裁、vivo AI 全球研究院院长周围更是多次强调:AI 手机竞赛的下半场,拼的是个人化智能。
全新的 AI 系统体系下,vivo 推出了 " 大模型 +Harness+ 智能体安全架构 "。其中,大模型负责听懂、记住、办事,Harness 把感知、记忆、规划、执行串成一条流水线,深入原系统内核,把手机的 6000 多项原子能力变成 AI 的手和脚。安全架构,则是保证权限控制、任务过程透明度和用户可控性。
与此同时,vivo 还带来个人专属 AI 助理蓝心小 V,其 Pro 模式可自主拆解任务、跨应用整合信息、跨端操作。小 V Cowork 让用户通过手机即可查看并处理 PC 端智能体任务。蓝心智能开放平台也同步升级,支持智能体(Agent)、Skill、MCP 及原子技能快速接入。
值得一提的是,对比过去的系统更新路径,vivo 这次显得更为激进一些,比如对端侧模型的态度以及对自研的坚持。去年的 VDC 上,vivo 认为手机上跑 3B、7B 模型对于内存来说很吃力,不一定要过度追求端侧模型参数量的大小。但仅仅一年时间,这一认知就发生了变化,坚持端侧投入的同时,vivo 还透露正在预研蓝心 30B MoE 端侧大模型,探索万亿大模型在手机上的应用。
对此,周围给出的解释很简单:现在旗舰机型标配内存已经 12-16G,拿 2-4G 内存加载 MoE 的模型变成了现实,所以对于之前技术的判断做了一下修正,做出了自己的 MoE 的模型。
在他看来,30B 给大家的错觉是很大,得益于 MoE 稀疏架构,其实只是把它切成了 30 块或者 100 块,调用的时候并不是全部进行加载。如果以发展的眼光来看,三年之后的 3B 在很多方面能赶上 70B。
不仅如此,在部分厂商走通用模型路线的时候,vivo 依旧在坚持自研,这种打法相对来说更费资金也更耗时间,在快节奏的手机市场,看起来性价比并不是那么高。但 vivo 认为这是对比友商的差异化所在,也是建立优势的关键。
" 当大模型能力越来越强,AI 竞赛的关键正从技术实力转向能否真正服务和帮助好每一个人 ",周围指出," 手机厂商有一个优势,就是更了解用户的使用场景和需求,我们可以做到指令集级别的 GPU 优化,现在做模型训练的厂商如果直接做端侧,可能面临功耗或者内存问题,只有终端厂商和芯片厂商进行合作,才有机会把端侧体验真正做好。"
从 AI 功能到 Agent,再到个人化智能,vivo 正在尝试把 AI 从手机里的一个功能,变成手机本身的一部分。但技术可行不等于产品能直接落地,按照 vivo 的规划,这类端侧模型仍处工程验证阶段,未来随着芯片、模型和系统进一步协同,到 2028 年底有望成为现实。
下周开始,一系列 Agent 手机就要陆续发布,但自证的这条路不会很轻松,还需要回答更多的问题。如何处理第三方应用权限,如何去定义 Agent 的边界,如何去克制主动服务,GUI、MCP 等不同技术路线最终如何共存?这些都还需要产品真正进入用户生活之后才能验证。
在 VDC 大会后,针对 vivo 在 Agent 手机上的路线,我们与周围以及 vivo AI 产品总经理关岩冰、vivo AIOS 产品总监黄梓勋聊了聊,以下是对话实录,略经删减:
提问:今年提出了要预研 30B 端侧大模型,去年的时候,你们的观点还是不一定要追求端侧模型参数量的大小,是什么样的契机想要你们转变,以及有没有考虑到内存的压力?
周围:去年我们觉得手机上跑 3B、7B 模型对于内存来说很吃力,但是在今年年初的时候,行业发生了变化,大模型不一定要一次加载完,可以每次只加载一个或几个专家模型就行了。现在内存标配旗舰机型内存已经 12-16G,拿 2-4G 内存加载 MoE 的模型变成了现实,所以我们去年对于这个技术的判断和,今年做了一下修正,然后快速做出了我们自己的 MoE 的模型。
提问:30B 部署到手机之后,云端是完全不会介入吗?因为手机大部分时间还是联网使用。
周围:完全不会介入。
提问:如果在本地训练好模型的话,将来换一台手机,通过换机助手可以换到同品牌的手机上吗?
周围:这个问题一是要不要迁,二是要不要迁记忆。我们有感知记忆存储,Main-Loop 里的长期记忆系统或者第二大脑系统,大脑肯定能迁移。但是 Harness 不一定要迁,比如做一个项目,项目在 GitHub 上迁移,而机器的个人感知记忆存储要迁,而 Harness 下的大模型和 Main-Loop 迁了没有意义,这是我现在的认知。
提问:AI 自动执行操作的时候会遇到 APP 的权限壁垒或者是逻辑的错误,vivo 怎么样解决这个问题,确保 AI Agent 执行任务的高成功。
关岩冰:执行任务分两类,首先会在自己的应用,系统自有的应用更好加固执行过程中的权限数据类、敏感类,确保整个执行安全、可信,这是内部不断完善的工作。
第二,我们和行业相对 TOP 的合作伙伴也会联合共建执行任务过程中的一些工程或者体验上的细节,比如今天早上我打电话和合作伙伴聊,比如过程中具体哪一步需要询问用户二次确认,现在行业也没有明确的标准,就需要我们不断去摸索、探索、体验、效率和安全的边界,我们在优先保障用户的可控、用户的透明可见的基础上优化性能,这是我们和几个合作伙伴在共同打磨和共建的能力,但需要一定的时间。
提问:30B 的 MoE 模型,是否意味着我们会有少量高频的专家常驻?如果是这样的话,在跨域任务进行的时候,比如专家切换,目前的延迟和能耗的情况是怎样的?您期望 2028 年达到什么目标?
周围:目前都是一个工程验证阶段,只是把模型训练出来了,我预期可能类似于整个工作电流低于 500 毫安左右,相当于是负载低一点的电流,可能是相对理想的状态。专家模型长驻,内存的常驻电流不高,不消耗电,真正耗电是搬运的过程,如果整个过程都是由我们的算力芯片完成,3B 刚开始出来也是 800 多毫安,一年之后 500-600,2028 年底 600 毫安上下能用。
提问:端侧的模型在增长,几年前就是 1B 的小模型,今天已经到了 30B,端侧的模型参数越来越大的话,能不能系统概括一下对于手机硬件提出了什么新要求?
周围:我要澄清一下,模型的载入,目前手机最珍贵的是算力,另一个是内存。目前来说,到 2028 年底,旗舰机就是 12-16G 的配置,真正留给端侧模型加载的我认为 4G 以下是比较合理的状态。端侧模型不会变得有多大,今天 30B 给大家的错觉是很大,其实只是把它切成了 30 块或者 100 块,调用的时候并不是全部进行加载。
提问:两个 G 部署 30B 仍然挺不可思议,比如长时间使用的话,会不会有一定程度的影响用户的体验,而且大部分用户还是使用中端机型和入门机型,中端机型是不是有比较好的用户体验?
周围:我觉得这个问题也是我们在过去大半年问自己的问题,现在部一些端侧模型到笔记本上,动辄都是 64G 才能布一个端侧模型,但是在手机上不太可能。随着 MoE 类稀疏模型出来之后,比如根据任务难度,按需加载部分专家执行,激活 1-3B 参数量,动态的来看可能只需要 2-4G 内存。我们理论上已经能做到了,所以自己训练了 30B MoE 模型。
今天为什么还没有直接带到产品上?因为这个东西对手机硬件也有全新的挑战,首先端侧模型本来很大;二是有搬运和算力的需求,为什么今年才提液态玻璃?为什么 2024 不提?因为 2024 年刚好规划了硬件芯片,一个芯片 24 个月才到,所以今年做液态玻璃刚刚好。今年提 MoE,同样是 24 个月之后,对应的这些芯片规划也会出来,加上我们还有一两年的时间把这个模型调校好,所以到 2028 年底,MoE 实现今天所谓的大模型能力在端侧上一定会变成现实。
提问:如何针对这些领域做一些差异化的创新?
黄梓勋:我们在行业内算是比较坚定用端侧模型做这块的处理,而且过去的形式是用户要触发这个功能的时候才会驱动数据上云或者数据给到 AI 进行实现再返回结果,现在是 AI 走在人前面,这是这次的差异。有时候用户见到这个场景的时候,AI 已经把该做的事情做完了,剩下的只是留给用户做确认,这是我们思路的不同。
这个过程中,可能和行业的差异在于,AI 在人的前面,而且也发挥了端侧模型的优势,包括我们对端侧模型投入的坚持。如果这件事通过云模型做的话,意味着用户还没有启动这个功能,所有的数据上云了,其他的隐私问题可能会更多,效果不一定好,这是我们这块在产品设计上的优势。
周围:其实在 AI 的层面上,我们做了很多事情,我们也是行业第一家把端侧模型用在手机上,去年就已经用了 18 个模块,其中包含了相册。
我们想要做个人化智能的产品给到大家,本质是什么?在 Main-Loop 里,虽然大家在循环里用这个产品和功能,但是要用好它,比如做相册归类那一瞬间,比如找到国庆节带小孩在海边的照片,问这句话的时候,我们早就知道那一张照片在哪了,什么时候知道的?就是 Main-Loop 前面的感知记忆功能来进行决策。
现在大家的相册都是 100G 起,在服务器上跑都要跑半天,为什么手机可以瞬间完成,因为我们已经做了端侧模型,已经在后面默默帮助你把这些照片感知并且把特征记忆住了,我们在后台给每一个人做了个人化的存储空间,其中包含了这些模块的素材。等到 Main-Loop 一旦在相册里想要调用这些相片特性归类的时候,端侧模型已经在这一刻给到支撑了。以前不能做,因为需要把照片丢到云端识别,不好,如果是端侧模型可以在后面默默做到,充分保障隐私安全。
提问:三年前当时蓝心大模型发布的时候,提到云端可能最多做到 1750 亿的参数量,云端是很核心的资产,今年云端重点的讲述放在 Harness 和引擎这一块,参量数也没怎么提,是不是手机厂商会认为云端的价值已经不在于机模本身,而是在于调度和执行上?
周围:2025 年和 2024 年对于大模型的认知完全不一样,整个生态的语言体系都不一样,比如 2024 年,70B 就是云端的主流模型,175B 参数是顶层模型,那时候就是整个行业的天花板了。但是你会发现,到了 2026 年 5 月份 -8 月份这 3 个月,大家对模型的判断来来回回反复好几遍了,我们为什么要做本机模型的 MoE 版本?我们认为接下来两年之后,随着蒸馏技术的演进,可能 3B 的模型都已经能够做很多事情了,一年前的 3B 和今年的 3B 和三年之后的 3B 不一样,如果以发展的眼光来看,三年之后的 3B 在很多方面能赶上 70B。
今天的 30B 和两年后的专家模型,可能每一个专家模型都相当于去年 70B 的能力,在某些方面的专业方向,比如做推理和任务的拆解,它是到位了的,这是行业发展的状态。
提问:头部采用 GUI 的方式,第三方的应用比较庞大,可能有些长尾的确实比较多,我们对于长尾应用的接入会采用哪种方式?如果不用 GUI 的话。
关岩冰:现在行业的情况,未来一段时间肯定是 MCP、skill、Agent、A2A、GUI 这几种技术范式都是会并存的。我们为什么优先和头部合作,还是回归到用户的需求和场景上,用户的需求和场景,90% 集中在头部,相对中长尾的需求,用户现在的行为也会比较分散,即使使用 GUI,体验也不一定好,所以我们回归到用户的体验闭环,相对克制一些,中长尾的暂时还没有大面积覆盖。
提问:我们有没有考虑开放 GUI 的操作能力,关于连接 MCP 或者 GUI 两种方式是怎么样考虑的?去年周总还在聊关于隐私方面的限制,但是今年很多厂商同时支持 MCP 或者 GUI 两种路线。
黄梓勋:我们内部目前认为长远来说,弱界面化、弱交互化,意味着目前的 GUI 技术非常短期,如果不采用 GUI 的方式,我们仍然有其他更高效的技术手段来实现。这也是我们认为安全性的一部分,在过去探索的过程中,还是会跟头部的互联网厂商进行有效的沟通,也在听取他们的意见,他们对于 GUI 方式的接纳程度,以及是否愿意共同营造这样一套 Agent 的体系,所以今天我们在这块的选择上还是弱化了很多 GUI 的部分。
提问:vivo 如何定义系统级 AI 的主动边界,以及在内部判断一个 AI 交互是否过度的时候,有没有衡量标准、产品原则或者量化?
关岩冰:第一,本质就是每一个用户的需求场景和对于好服务的尺度不同,为什么我们提个人化智能,不同用户的主动服务一定不一样,只有不同的用户的主动服务内容、服务策略不一样,才能真正地解决好这件事。
第二个原则,我们在当前的阶段,我会更加克制做过于主动的服务,比如未来逐步会释放一些新的特性或者功能,每天给你一份主动的日程或者行程或者每天待办的建议,这种建议在前期的时候可能会更加克制发给你。
当我们发现用户行为的反馈和阅读、点赞、分享或者保存的记录或者导入到日历的正向行为逐步增多的时候,我们会基于个人的行为习惯增加主动服务的深度和广度。但是每个用户不一样,我们背后有一套评价用户行为的正向或者负向的评价黄金体验标准。这个问题,我们还在不断往前探索。
提问:现在的大模型到底够不够用,过不过剩?手机到底是不是端侧 AI 最好的载体?
周围:通用人工智能,目前是巨头在竞赛。我认为还有一项工作还没有开始,就是自我进化,自我迭代,自我训练,这部分大家刚刚开始,所以所谓的 AI 大模型训练还没有结束,新的征程才刚刚开始。
我认为在很长的一段时间,大家还是用笔记本和 PC 做生产力的变现,特别是 2B 的场景。毫无疑问,手机是贴身跟随我们的设备,脱离了 PC 之后,还是要看一下 Agent 的任务和生产是否正常,碎片时间的利用。这就是我们为什么做 Cowork,不管未来 PC 类和服务器类的市场怎么融合,但是一个移动端进行融合,看板也好,控制端也好,都有这样实际的需求。
在这个点上,我认为当下的手机就能做到了,为什么还要去谈端侧模型呢?因为我们本质上是在讨论今天 PC 的端侧化和服务器的云侧化下到 PC 之后要不要下到手机?今天看到的行业趋势是一定会下下来,至于下到多少场景可以覆盖下来,我们要看一下行业的发展,因为这个行业发展实在太快了。今天我能看到的是 MoE 是很好的解决方案,定制芯片现在的成本很高,但是算力没有问题,有一部分人愿意花高价做随身携手纯端侧的算力中心和生产力中心没有问题,但是人群和市场相对会比较小,这是暂时的观点。
提问:对于 AI 功能和 Agent 手机未来的收费模式有没有自己的思考或者打算?
关岩冰:我们发布的产品未来还是会面向用户,有免费的功能使用,但是一部分用户如果真的想非常深度和非常大的流量使用,我们会为他提供一些额外付费扩大流量包的体验,会有类似的机制,我们会保持一定的探索。相信未来几个月,整个行业会有这样的机制出来,但是面对普通大众用户,还是会提供比较可用的免费空间。
提问:vivo 比较明确地提出了个人化智能概念,各家的叫法差不多,在 vivo 看来,我们的 AI 和其他的友商相比,最核心的差异是什么?
关岩冰:我认为来源于两点,一是讲 AI 战略的时候,小 V 本质上基于蓝心端侧的 Harness,这是最核心的差异化,因为它是端侧,所以我们能更好地调度整个 OS,早上一个场景和一句描述特别恰当,就是蓝心的 Harness 本身和 OS 完全融合,这是相对于其他第三方的第一个差异化。
第二个差异化,基于用户个体数据或者个人专属的上下文,这是最核心的差异化部分。比如您用手机,您的手机本地存了您的相关一些信息或者对您自己的理解,这部分就是您使用 AI 的时候最宝贵的上下文,使用端侧的时候可以更加安全、可控地管理。
周围:为什么大家都在做 Harness,为什么我们的 Harness 不一样?比如行业内都在做拍照手机,为什么只有 vivo 的手机最好?其实是同一个问题,在我们的哲学里,这就是很多用户导向和场景导向的问题,如果这是对用户最重要的,哪怕所有人去做,我们不是说要做得比别人好,但是一定做得让用户在场景里最满意。
产品的竞争力不是在于和友商比,而是在于我们是不是真正理解了用户的痛点和场景,是不是真正让用户满意了。好像今天的大模型,过去三年迭代那么快,刚才的老师也说,为什么 vivo 的无障碍有那么多人用我们的手机,独立参加展览馆,独立生活、化妆、挑衣服、参加演唱,核心就是我们的团队认为,想要为这样的人群在这样的场景下做事的时候,一定要做出让用户偏爱的、不一样、好很多机制的产品,这一句话解释所有的回答。
接下来如果大家都做 Harness 的话,为什么 vivo 要做?我们的不同点在哪?大家可以看一下 vivo 的影像和行业的区别,大概也能猜测到底,两三年后,同样是 AI 智能手机,我们的领先在哪?很难靠几句话说出我们在哪里做得很好,但是一定时间之后,大家会觉得,这是让我满意的手机。
提问:蓝河系统已经 4.0 版本了,消费者不仅仅只在 vivo 的手表上看见这个系统,有没有可能在其他的设备上看见?
周围:蓝河到现在也有 8、9 年了,我们一直期待的是蓝河能不能用来做手机,但是我们在预览版展示区就是一个手机,也是能打电话、录像、拍照、发短信,就是一个完整的通信手机,但生态目前没有那么成熟,我们也想它快点成熟,但是需要时间。我们在技术准备上是按照一个完整的手机准备的。
当然,蓝河除了手表之外,vivo 也会做其他品类的产品,而且这个东西面世之后,行业对我们的评价比较正向,比如做单片机和芯片的合作伙伴都在适配我们的蓝河。如果大家想用安全、低配、高性能需求,用蓝河挺好的。同时我们很好地适配了蓝心大模型,包括所谓的 Harness 都能够很好地运行,这对行业来说也是好事情。
提问:vivo 希望开发者为我们的平台贡献哪些内容?在 AI 时代,因为现在 AI 写代码越来越轻松,开发者可以在这个时代获得哪些机会或者哪些帮助?
关岩冰:面向开发者,我们提供两方面的服务能力,一是让开发者更加低门槛,更加高效地入驻到我们的平台,包括 Agent 、skill、MCP 的服务和能力,我们提供的蓝心智能平台,是让开发者低成本地进入到或者加入我们的生态,共同服务用户。
第二个维度,我们会在整个原系统里整合各个用户视角的触点或者用户场景的产品或者入口整合资源,为开发者做扶持或者赋能。比如小 V 或者小 V 的 Agent 或者 skill 广场,我们会提供这些扶持,也会有一系列的扶持策略,主要是这两方面。
(本文首发钛媒体 App,文 | 志读科技,作者 | 杜志强,编辑 | 杨林)


登录后才可以发布评论哦
打开小程序可以发布评论哦