去年底,一代豆包手机把不少人对 AI 手机的想象往前推了一步。用户说一句帮我订明天下午去上海最便宜的机票,手机就能自己打开 App、查航班、填信息,到了付款环节再交给用户确认。

听起来像是手机里多了一个能办事的人,但这条路并没有一直走下去。2026 世界人工智能大会上,二代豆包手机努比亚 NaviX Ultra 真机亮相,虽然暂未开放体验,但现场信息显示,它开始更多采用 MCP、A2A 等协议,和 App 直接沟通,不再主要依靠模拟人手点击屏幕。
这不是简单换一种技术,而是 AI 手机开始重新处理一个关键问题,AI 到底应该怎样进入 App?
一代豆包手机走的是 GUI 路线,说白了就是让 AI 像人一样看屏幕,找按钮,滑页面,再完成点击。它的好处很明显,只要用户能操作,理论上 AI 就能照着做,不需要每个 App 提前开放专门接口。
问题也在这里。AI 每走一步,都可能要截图,上传模型识别,再判断下一步动作,接着继续滑动和点击。现场演示寻找晚上 10 点航班时,就需要不断重复这套流程,手机和云端来回传递,速度自然快不起来。
更麻烦的是权限和生态。GUI 操作往往需要较高系统权限,还要读取屏幕内容,私人聊天、账户信息、财务数据都有暴露风险。AI 要是点错了,甚至误触支付,责任算用户的、手机厂商的、模型厂商的,还是 App 的?
App 平台也有自己的顾虑。

微信、美团、淘宝等超级 App 陆续加强了对异常自动化操作的识别和限制,部分用户曾反馈账号风控提醒,豆包后来下线了相关场景的 AI 操作能力。平台担心的并不只是技术安全,还有入口价值,用户如果直接让 AI 订餐、购物、打车,就可能不再打开 App 浏览页面,广告和推荐流量怎么分?
二代产品的变化,就是把手机助手从屏幕操作员,改成服务调度员。MCP 可以理解成统一插座,App 愿意开放哪些能力,就按标准接出来,AI 不必偷看屏幕,也能查询信息、调用服务。A2A 则更像智能体之间互相传话,手机里的 Agent 把任务交给 App 里的 Agent,再由对方返回结果。
这样做有什么好处?速度会更快,权限边界也更容易划清,平台还能决定哪些服务可以被调用。现场工作人员介绍,字节体系内已有数十款 App 支持新的协议方式,实测响应速度比 GUI 明显提升。至于其他超级 App 开放了哪些接口,目前还没有更多信息。
不过,平台愿意开放多少,才是这条路能不能跑通的关键。MCP 和 A2A 并不是把所有入口都交出去,而是平台自己定规则,自己划范围。AI 想调用我的服务,可以,但要按照我的方式来,这种安排对平台更安全,却也意味着手机厂商不能单方面包办一切。
这也是 AI 手机和普通语音助手的差别。过去大家比的是谁接入的大模型更强,谁能写文章、修图、做摘要。现在模型只是底座,真正影响体验的,是它能不能连接足够多的服务,把查票、订房、付款确认这些环节串起来。

用户每天愿不愿意用,才是商业化能不能成立的尺度。
豆包手机并不是唯一的尝试。大会现场,阶跃星辰的 STEPX Neo 同样吸引了不少关注,它搭载智能体原生操作系统 Step AOS,并开放 A2A、MCP、Skill、CLI、GUI 等多种合作方式。现场演示中,手机可以规划演唱会行程,调用携程安排机票和酒店,再调用支付宝卡片完成相关信息衔接。
荣耀则走了另一条路,发布了 Robot Phone,加入可收纳、弹出和转动的机械云台,结合多模态智能体操作系统,让手机不仅能听懂声音、识别手势,还能联动多个 App,感知周围空间。为什么要加机械结构?因为有些任务不是打开页面就能解决,拍摄、识别和现实环境互动,需要新的硬件帮忙。
路线不同,目标却差不多,都是想让手机从被动执行指令,变成主动完成任务。协议调用见效快,不必更换系统和硬件,头部 App 一旦接入,体验可能马上变化。多模态硬件能制造差异,但未必会成为日常使用的主入口。
真正具备长期想象力的,可能是从操作系统底层重做,让 Agent 成为系统里的核心角色,权限、硬件和服务都围绕它重新组织。可这条路成本更高,也更容易碰到生态阻力。
所以,二代豆包手机的调整,重点不只是速度提升,而是把主动权重新放回平台和协议之间。未来用户说一句话,能不能真的让努比亚都包了,既看 AI 聪不聪明,也看那些超级 App 愿不愿意把服务接出来。这场关于手机新入口的竞争,才刚刚开始。


登录后才可以发布评论哦
打开小程序可以发布评论哦