三易生活 5小时前
九年前三星踩过的坑,智能体手机还要再踩一遍?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

2026 年 7 月 27 日,OPPO 高调宣布启动 " 小布 Next 计划 ",正式开放了行业里首个手机端侧 Multi-Agent 协同系统内测。

说人话,就是在几乎所有品牌都已经明确将于今年秋季推出 "AI 智能体手机 " 的前提下,OPPO 率先把这功能下放给了现有机型,让用户可以 " 尝尝鲜 " 了。

可能有的朋友要说了:不对啊,去年努比亚不是都出了初代豆包手机了,怎么你这今年才内测,而且还是 " 首个 " 呢?

诶,对的,这就是我们要说的关键。因为今年所有的新款 AI 智能体手机,包括努比亚自家的二代豆包手机 NaviX Ultra 在内,有一个算一个,都不会再延续去年初代 " 豆包手机 " 的技术路线。

换句话说,在 AI 智能体手机真正大规模上市之前,大家想象中的那种能 " 无限制全自动操控所有应用 "AI 智能体手机,大概率已经死了。

初代的手机智能体,安全和法律风险其实很大

2025 年 12 月 1 日,字节跳动与中兴通讯合作推出 M153 手机,也就是初代的豆包 AI 手机。它最令人惊艳之处,就是可以让用户完全用语音控制手机里的几乎任何 APP。比如你可以说一句话就让手机自动打开微信发朋友圈,也可以一句话就让手机自动开启电商 APP 买个商品,甚至只需要动动嘴皮,手机还能自动在不少游戏里自动清日常、刷副本……

那,初代豆包 AI 手机是如何实现这些功能的呢?简单来说,它靠的是所谓的 GUI Agent 路线,即通过安卓系统天生自带的 " 无障碍 " 功能权限,让智能体可以实时 " 阅读 " 屏幕内容,并代替用户在屏幕上模拟点击操作。

这样做的好处很明显,那就是不管应用本身 " 愿不愿意 ",只要 AI 能够 " 看得懂 " 屏幕上显示的是什么,就都能代替人去操作。

但 GUI Agent 的缺点也非常突出。一方面来说,它相当于将手机屏幕上的一切内容全部暴露给了智能体,这使得该技术天生自带了隐私泄露的风险。

其次,AI 能够模拟人手点击也就意味着,万一操作出现了严重错误(比如买错了东西、转错了账),从技术手段上无法证明到底是人在操作还是 AI 在操作。因此存在着重大安全隐患。

初代豆包手机能代替用户操作游戏这事,很快引发了争议

而且,GUI Agent 这种 " 什么应用理论上都能操控,不管适配与否 " 的特点,也会导致一些伦理上的争议。比如让它去运行对抗性的游戏(典型的就是棋牌类),当然就属于 " 作弊 "。

当然最重要的是,几乎所有手机软件的使用协议里都会明文写着,软件本身仅授权用户手动操作,禁止使用第三方自动化脚本。而初代豆包手机这种 GUI Agent 技术路线,不仅违反了绝大多数软件的授权协议,甚至有未经应用方同意就读取数据、替代应用原生入口、截留用户操作的不正当竞争嫌疑。

从 " 读屏幕 " 到 " 打商量 ",智能体手机悄然生变

从初代豆包手机当初限量发售,且开卖后没几天就大幅限制智能体 " 替人打游戏 " 的能力,再到后来诸多一线 APP 纷纷对其 " 封杀 " 的过程来看,很显然它所隐含的各种风险,整个行业其实是看得非常清楚的。

但也正因为如此,从各路公开信息来看,如今的这些第二代智能体手机们,已经彻底改变了机内 AI 与第三方 APP 的交互方式。现如今的它们,采用的普遍是官方协议互通(MCP/A2A)的技术路径。

这是什么意思?简单来说就是手机内置的智能体在接到用户的命令(比如,用 XX 应用执行 XX 任务)之后,先对命令进行理解。之后,它会自动打开对应的 APP,然后 " 翻译 " 的更加简洁的命令,发送给 APP 内置的智能体。最后,由 APP 本身内置的智能体驱动它自身,去完成用户想要的操作。

在这个过程中,手机本身的智能体不再直接操控 APP 本身,更不会再去识别屏幕上显示了什么,该点击哪里。这当然可以保护用户隐私,也免去了对第三方 APP 进行非法操作的嫌疑。

但它的缺点也非常明显:如果对应的 APP 没有内置智能体,不能实现 " 自己操控自己 " 呢?

是的,这就是最新一代智能体手机们为了 " 合规 " 所必然付出的代价了。它们只能在研发阶段就尽量去找一线 APP 们 " 打商量 ",必须要对方开放接口、允许机内智能体和软件内置智能体 " 打商量 " 才能实现手机自动操控的效果。倘若第三方 APP 本身并不提供自动执行能力、或者不愿意和某个品牌 " 协商合作 ",那这些最新的手机智能体就什么也做不了。

九年前的悲剧历历在目,如今的后辈们能克服吗

2017 年初,三星随着 Galaxy S8 系列手机,发布了最初代的 Bixby 语音助手服务。当时,它有一个特别突出的特点,就是可以让用户说出一些多步骤的复杂命令,之后手机就能自动跨 APP 执行。比如 " 拍张照片,然后发个微博 "。

初代 Bixby 之所以能做到这种功能,背后靠的是三星彼时推出的 Bixby Capsule 开发框架。说白了,就是要第三方 APP 提前做适配,将自身的功能封装成 Bixby 能对接的 Skill(技能),之后就能实现语音控制的多步骤自动操作。

是不是觉得很眼熟?没错,九年前三星初代 Bixby 选择的这条技术路线,某种程度上来说完全可以看作 2026 年(乃至 2027 年)手机智能体实现方式的鼻祖。它们都不能真正让手机自动控制第三方 APP,它们的功能边界都受限于第三方 APP 的适配与否,而它们的核心交互逻辑也都是「用户指令→系统解析→调用 APP 接口→返回结果」。

那,三星在手机自动化执行系统上开拓得如此之早,它们后续的这套生态,体验一定很好吧 ~

三星当时专门搞了个 "Bixby 市场 ",推广那些适配了 Bixby 技能的第三方 APP

并不是,结果是由于第三方 APP 适配意愿不足,三星砸了不少钱也只搞定了几十款主流 APP,最终他们不得不在后续版本上取消这套机制,也相当于宣告了手机行业最早的 " 自动化交互 " 尝试,以惨败告终。

正因为手机行业实际上已经有过在这条赛道上的惨痛历史,面对如今新一代智能体手机们为了合规,只能放弃 " 强行操控 " 的现状,我们三易生活才会感到一丝疑虑。

当然,要解决这个问题,理论上并不是没有办法。比如就像大家可能已经看到的那样,一些最新的机型会同时内置多个不同来源的大模型,通过 " 广撒网 " 尽可能地提高对各家软件公司 APP 的兼容性。

除此之外,正如三星在九年前已经做过的那般,砸钱鼓励开发者做适配,自然也是多少可行的办法。况且如今的大环境已经不比以前,主流 APP 们增加内置智能体,适配 MCP 生态的意愿,注定是要比过去更强的。

对于入门机来说,内置大模型的第三方 APP 对它们可能变成更重的负担

当然,这不会毫无代价。比如它可能导致手机有更高的研发成本,可能使得手机的功能维护也变得更复杂;万一某些大牌智能体厂商经营困难,也有可能造成不少手机功能受损。甚至,由于大量 APP 都需要加入内置智能体来实现与手机 AI 的对接,这还会让它们体积更大、更耗费手机存储、对入门机也可能更不友好。

只是,从目前的技术趋势来看,这很有可能是整个行业都不得不面对的 " 阵痛 "。而它最终是否能真正开花结果呢?目前还不好说。

【本文图片来自网络】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 努比亚 oppo 字节跳动 安卓
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论