文 | 窄播,作者 | 李威(北京)
这是《OpenFuture》的第 2 期,本期我们会聚焦讨论 Agent 给硬件带来了怎样的改变。
一套 AI 挂件,把酷奇奇科技推到了一个新的节点。这家 AI 角色硬件公司刚宣布完成了数千万元种子轮融资,由上海浦东人工智能种子基金领投,商汤科技、零以创投跟投,并将开售一款分布式多端互动产品「CookiePi 角色互动伙伴」。
这套 AI 挂件不只是更会聊天的 AI 单体玩具,而是可以和不同的角色跨次元群聊,每个角色都有自己的独立记忆,在靠近后会彼此识别、自主接话。用户不一定要发问,有时只是坐在旁边,就可以一直听海绵宝宝、派大星和章鱼哥聊哲学音乐汉堡混搭的话题。

这个产品有意思的地方是,它反过来改变了用户的位置。酷奇奇一开始也尝试过让用户一直开口和角色对话。但很快发现,一直开口推动话题,对用户是一种负担。酷奇奇科技创始人徐持衡后来得出的结论是:「与其做成让用户一直开口的产品,还不如做成让 AI 主动说。」
这意味着 AI 硬件可以不只是一个等待被唤醒的问答机器,而是变成一个在用户身边主动运行的「关系场」和「内容场」。
也是在这周,阶跃星辰发布了个人智能体 Amoo、智能体原生操作系统 Step AOS 和手机 STEPX Neo,要围绕 Agent 重做一套软硬件结合的解决方案,打破记不住用户的「记忆墙」、难以自主判断复杂任务的「决策墙」和不能跨系统替用户完成任务的「行动墙」。
一个初创公司沿着 AI 陪伴硬件的路径继续向前探索,一个大模型公司直接进入手机和 OS 领域,看起来不是同一类故事,却共同指向同一个变化:Agent 带来的不只是一次功能升级,而是重新定义硬件体验的可能性。AI 硬件正在从「AI 原生」转向「Agent 原生」。
过去两年中,AI 原生硬件的核心是把大模型的问答、语音识别和图像理解能力装进设备,让玩具、眼镜、耳机、录音机多出 AI 功能。而Agent 原生硬件则要求硬件和系统围绕智能体重做,要求其能更长久记住一个人,理解一句话背后的前因后果,甚至能调动更多工具和设备去完成任务。
这意味着不仅硬件要为 Agent 进行重新设计,软件也会因此发生改变。在新的软件中,关系、上下文和行动都会被 Agent 组织起来,成为硬件体验的核心部分。AI 硬件的竞争,也因此从原子能力的叠加,转向一套系统体验的整合。
最终,大家的目标是制造出一个与硬件相对解耦的、适用范围更广的 AgentOS。
Agent 在成为硬件的灵魂
面向 Agent 时代,一个完整的硬件服务链路可能会包括三个层次:上面的硬件层,提供物理世界的触点;中间的 Agent 层,负责打通上下文、编排任务、指挥行动;最下面的基础设施层,由模型、云服务、能力生态为 Agent 提供支撑。这个服务链路本质上是在围绕用户在构建从问答走向委托的新关系。
火山引擎大模型智能硬件负责人邢孝慈给了一个更形象的说法:新一代硬件是「跑在物理世界的命令行终端」。
在程序员的世界中,命令行被用来操作文件和代码,而在硬件语境下,命令行操作的是摄像头、扬声器、麦克风,甚至是手臂和腿脚。过去,用户依靠 GUI 界面一步步点开 App、选择功能、确认结果;未来,用户更接近于用对话描述任务目标,在权限允许和关键节点确认后,把任务执行过程委托给 Agent 去执行。
这种从功能集合向任务委托模式进化的前提是,Agent 能让硬件具备更主动的在场感。硬件能像徐持衡说的那样,在用户面前保持比软件更强的存在感;这种更强的在场感,意味着硬件可以通过麦克风、摄像头和其他传感器获得更持续的上下文输入。
在此基础上,Agent 会赋予硬件更多自主性。酷奇奇科技希望产品能自主判断哪个角色离用户更近,哪些角色应该加入同一段对话,哪些应该保持安静。徐持衡认为,Agent 正在从固定工作流变成一个灵活的、自我编排的流程。这种结构让角色不再只依赖静态设定,而能随用户交互持续更新。
更主动的 Agent 能力,也会重新梳理硬件的价值链条。价值更高的可能不是入口,而是 Agent 本身,然后由此会产生服务于 Agent 的新机会。比如 YoooClaw 旗下⾸款硬件产品 C · ONE 就是在为 Agent 提供上下文采集与存储的解决方案。
C · ONE 的外观与录音卡类似,但在录音之外,还可以记录和整理手机上的消息通知、沟通记录、偏好⾏为。其产品负责人庄程星把团队当前要做的事拆成三块:上下文采集、结构化存储和场景生态构建,然后将这套软硬件组合做成标准接口去适配不同的 Agent runtime、IM 和应用环境。
当 Agent 变成灵魂,硬件的变现逻辑也会发生变化。涂鸦智能技术副总裁柯都敏认为,未来硬件卖出去只是第一步,之后用户有没有激活、是否持续使用、是否持续付费,将决定硬件产品的全生命周期价值。这本质上是在将以卖硬件为主获得收益的逻辑,转化为以硬件为载体,贩卖持续的 Agent 服务的逻辑。
难点在于,模型和 Agent 能力按周变化,硬件却要经历设计、开模、供应链、量产和交付。这意味着,Agent 硬件可能需要把软硬件尽量解耦,把感知、交互和存在位置放在硬件层,把变化更快的模型、服务和工作流留给系统层,让两者能分别按照自己的逻辑进行升级。
上面的一连串变化,最终会引出一个更为核心、也更有吸引力的命题:AgentOS 会如何诞生。所谓 AgentOS 不是在传统系统里增加一个 AI 入口,而是试图让 Agent 成为交互主体,让应用、模型和硬件围绕它来运转。
阶跃星辰此时发布 Step AOS 就是要讲这个故事。微光科技和光帆科技也都在试图重构面向 Agent 的 OS。在 WAIC 2026 上,我们看到千问、荣耀、努比亚也都在发布面向 AgentOS 的新产品和新战略。
微光科技软件中心总经理郝东宁认为,当前轻量 AI 眼镜大量照搬手机、平板、手表和 TV 界面,是一种「COPY 式的 UI」,但未来的交互应该是机器适应人。微光科技为玄景 AI 眼镜推出的鸿雁 AI OS 以智选决策 Agent 为内核,面向系统和应用构建两个智能体,让 App 不再只是用户逐个打开的图标,而会成为智能体调度的服务和工具。
郝东宁表示,微光科技希望下一代交互尽量「隐形」,结合位置、时间、行为和情绪理解情境,再决定是否出现、显示什么、采用语音还是画面。
光帆科技则认为自己不只是 AI 硬件公司,也是一家 AI 原生操作系统公司。光帆科技联合创始人陈康达在一场互动上表示:「过去 Android 和 iOS 的大量代码面向图形化交互;今天面向 AI 多模态交互,很多代码不能用了,需要从底层搭一套原生 OS。」
陈康达认为,自研的面向 AI 多模态交互原生的操作系统,可能是壁垒更高、投入更大、复杂度更高的一件事。这个原生 OS 底层就支持多模态交互,能调度硬件传感器、模型算力、软件应用。
而且,AgentOS 的竞争不会只属于硬件创业公司。手机厂商掌握传感器、账号、系统权限和跨应用能力,是天然的系统竞争者;互联网大厂握有社交、支付、交易和本地生活服务,也不会放弃把微信、支付宝等入口改造成 Agent 可调用的服务层。
从关系到行动,Agent 硬件的三层验证
Agent 给硬件生态带来的变化,最终还是要被做成用户可感知的产品。现阶段还没有一款 Agent 硬件能给出完整答案,但不同团队已经在分别验证其中的关键环节。
从上面的理解出发,我们在过去一段时间重点关注了几家在关系、上下文和 Agent 载体三个层面尝试的产品:酷奇奇尝试优化陪伴体验,C.ONE 在探索让长期上下文通向行动,光帆科技和玄景则在构建一个让 Agent 理解现实世界的感知与反馈能力底座。
1. 不需要用户推动的陪伴对话
与传统硬件不同的是,Agent 硬件会更容易被人类视为伙伴,而陪伴体验是 Agent 硬件融入人们生活的一层「皮肤」。如何用 Agent 能力提升硬件的陪伴感、在场感依然会是接下来硬件创新的重点环节。
酷奇奇科技产品带来的最重要的变化,是让用户不再永远处于对话中心。几个 IP 角色靠近后,也会围绕同一个话题彼此接续。用户可以介入,也可以只是像看剧一样旁听。这把陪伴硬件从一问一答的工具,推向了一种更有共同生活感受的场景中,形成更主动、自然的陪伴效果。
一个明确的变化是,交互的发起也不再仅由唤醒词,而是可以由空间关系触发。硬件在其中提供的是在场感。徐持衡说:「硬件很大程度上把这些 IP 和内容带得离人更近了。你不管它、你不理它,都能感受到这些东西在哪。」
酷奇奇会用测距决定谁该参与对话。设备会主动判断和用户的相对位置,在用户进入到 2 米距离时发起互动。此外,设备与设备之间也会根据距离来决定谁能参与到对话中。一般能维持同一时间有两三个角色在参与话题讨论。

同时,要给设备扮演的角色更强的「活人感」。徐持衡认为,AI 不应该变成一个无所不管的「Mother System」,而应该人格化、具象化,彼此之间有差异、有冲突。「大家对 AI 的认知还是我一句、它一句。怎么能让同样的问题不再得到高度趋同的答复,变得更有随机性、更有活力?」
Agent 化的记忆能力是创造这种体验的核心。酷奇奇科技没有把记忆做成聊天记录,而是参考 OpenClaw 的架构,设计了 Soul、User 和 Memory,分别对应角色的自我、对用户的理解以及双方关系。这样的设计解决了 Prompt、角色卡只能记录、提取,不能理解的问题。
徐持衡认为,在陪伴产品里,记忆不是存档,而是关系如何被压缩、遗忘和重新理解。即使两个角色经历了一模一样的事情,依然会得到不同的个性和成长经历。
酷奇奇还为产品增加了被称作「未说之事」的功能,当角色有情绪波动时,就可以把不适合直接说出口的内容写到这里。这些未说出口的内容被保留下来,会让角色更丰满,也让用户获得一种近似小说主角的体验。
酷奇奇科技希望通过这种「活人感」,先吸引二次元、乙游、OC、娃妈、追星和内容创作者这些愿意「把产品玩起来」的人群,让他们先把自己创造的 IP 和角色养活。
我们认为,这种制造「活人感」的能力是未来 Agent 的必备属性,是覆盖于任务执行能力之上的一种类人的沟通能力。
2. 处理上下文的外挂装置
陪伴之外,我们还看到了更多收集用户上下文的硬件解决方案。在 AgentOS 没有发展为下一个 iOS 或安卓以前,上下文收集更像是一个外挂装置。Looki 选择帮用户每隔 1-5 分钟拍 9-15 秒视频片段,记录生活中的信息;AI 戒指在健康监测之外,也被开发出了信息记录功能;潜调科技正准备推出一款能 24 小时录音的手环。
C · ONE 是其中一款已经上线发售的产品。它可以支持用户录音,打通了以及保存、结构化和调用个人的长期上下文。庄程星表示,团队也尝试过 AI 陪伴硬件,然后发现那个阶段的设备可以判断用户情绪,却不知道原因。没有前因后果,再自然的语音和再准确的情绪判断,也只是一种角色模拟。
然后团队开始转向上下文的处理,想把历史会议、项目节点、团队术语和用户个人信息放进同一条上下文。例如,传统录音硬件只是在记录信息,但 C · ONE 想做到不止记录下研发承诺三天后交付版本,还能结合上市时间、营销物料和达人拍摄周期,判断出真正的 Deadline 可能是当天晚上。
「基于原始文件之后的二次 AI 分析,价值远远大于这份会议纪要本身。」庄程星表示。他把上下文称为「过程产物」,而不是用户要的最终结果。有了上下文积累,才能理解用户,准确推测出下一步的动作。只有能推动进行下一步动作,AI 硬件才会具备新价值。

但在 OpenClaw 出现之前,C · ONE 并没有完全解决「采完之后怎么办」的问题。采集完上下文,进入到执行阶段,往往需要去针对不同问题手搓不同的工作流。靠一个创业团队去手工沉淀场景解决方案首先是一件性价比很低的事,其次即便做了也无法覆盖越来越个性化的需求。
OpenClaw 意味着主动规划任务、调用工具有了解决方案。C · ONE 团队从 2 月开始重新设计 ID 和模具,围绕 OpenClaw 重构嵌入式软件,从零做 YoooClaw App 和前端交互,在 5 月 15 日正式发布了新的硬件产品。「它把我们最核心想做的上下文采集,以及部分数据的结构化沉淀的 MVP 跑通了。」庄程星表示。
为了让用户知道上下文可以怎么被消费和执行,YoooClaw 在做「场景卡片」。它会按工作、生活、理财、健康等大类,以及销售、客户成功、宝妈、自媒体等人群组织场景,让用户更快找到可用闭环。比如,用户关注某只股票,系统可以结合群聊、论坛、大 V 观点和用户选择的策略,给出买入或卖出提醒。
「主动服务这个事其实挺难的。甚至说非常难。」庄程星表示,哪怕是最亲密的家人和朋友,也很难知道对方此刻到底在想什么。因此C · ONE 会先选择会前准备资料、会上记录重点、会后分发任务这类结果可验证的场景。不是立刻做一个无所不知的私人助理,而是先让上下文在确定任务里发挥价值。
3. 让 Agent 找到载体
酷奇奇科技和 C · ONE 团队都选择放大 Agent 的某项属性,探索一个领域或一个环节的 Agent 化体验。还有一部分创业者会像阶跃星辰一样,打造一个更全能的硬件载体来承载自己的 AgentOS,这个载体可能是手机,也可能是 AI 耳机、AI 眼镜。
具备多模态能力的 AI 耳机和 AI 眼镜,会更贴近人的感官位置,能持续获得声音、视觉、位置和行为线索,也能用语音或显示完成低打扰任务目标确认。这样,AgentOS 就不只是能听见用户说了什么,还可以知道用户正在看什么、站在哪里、周围发生了什么,以及用什么方式把结果反馈回来。
光帆科技选择为耳机增加摄像头来创造出这个载体。他们判断:在 AI 多模态时代,光有耳机的听觉能力远远不够,只有加上视觉感知,才能真正做到听你所听、看你所看。比如,线下看到某件衣服时,用户很难用语言准确描述款式、面料和细节,但 Agent 只要能看一眼,就可以进一步做比价、推荐和下单。

所以光帆科技并不把摄像头当作拍摄工具,而是当作 Agent 的视觉传感器。陈康达形容它「相当于给 AI 开了一只眼睛」。这样,用户打车时不再需要打开 App、输入目的地、选择上车点和车型,而是说出目的地后,Agent 结合定位和用户习惯推荐上车点、估算价格,再通过语音或手表完成确认。
这套方案其实是 AI 眼镜完全成熟前的一种替代选择。理想的可穿戴 Agent 需要同时具备麦克风、扬声器、屏幕和摄像头四类传感器。陈康达认为,终局来看,AR 眼镜可能最适合把这几类能力组合起来,但现阶段眼镜还受重量、续航、光机和散热限制。光帆科技本质上是在用多设备协同提前验证多模态 Agent 体验。
微光科技的玄景 AI 眼镜选择了模块化的路径来规避 AI 眼镜当下的研发痛点。玄景 M6 系列把 Mini AR 显示模块做成可拆卸部件,可支持单绿显示或全彩显示,让用户可以根据阅读、导航、翻译、拍摄、观影等不同场景,选择不同模块组合。

这种设计也是要为用户提供一个可长时间佩戴的 Agent 的前端交互和现实感知入口,把现实环境、用户状态和反馈方式放进同一个决策过程。微光科技认为未来的入口属于「硬件 +Agent 的超级综合体」,硬件掌握和用户的第一交互触点和用户心智归属;多家 Agent(如 OpenClaw)提供底层能力。
当 Agent 开始替用户行动,硬件决定它能感知什么,系统决定它能调用什么,服务生态决定行动能否闭环。今天这些创业团队看似在做不同产品,实际都是在面向未来 Agent 时代锁定自己的站位。
它们未必都会长成完整操作系统,但都在回答同一个问题:当模型能力逐渐趋同时,如何给 Agent 提供不可替代的上下文、存在感和行动能力,并把这些能力沉入系统。


登录后才可以发布评论哦
打开小程序可以发布评论哦