欧阳晓红 / 文
" 欢迎来到 AGI(通用人工智能)时代。" 当地时间 9 月 3 日,美国人工智能研究公司 OpenAI 发布新一代旗舰模型 GPT-6 Astra。OpenAI 公司总裁格雷格 · 布罗克曼(Greg Brockman)在媒体简报会上说,几年后回望,人们或许会把 AGI 的到来定位在 " 这个时期 ",甚至 " 这个模型 "。
但同一天公布的一组评测数字,恰好说明事情没有那么简单。
在独立评测基准机构 ARC Prize 的 ARC-AGI-3 测试中,GPT-6Astra 采用标准测试框架、推理设置时得分 62.7%;采用能够保留跨请求推理状态的厂商适配框架时,得分升至 99.9%。两个数字分别对应不同配置,却共同指向一个变化:衡量 AI(人工智能)能做到什么,已经越来越不能只看模型本身,更要看模型与上下文管理、工具、权限和运行环境组成的整个系统。
ARC Prize 也特别提醒,即便模型完成全部测试,也不能由此证明 AGI 已经实现。评测中的陌生游戏可以考察探索、归纳和规划能力,却仍不是开放、复杂、后果真实的现实世界。
因此,比 "AGI 是否已经到来 " 更值得审视的,是一条近来显著加速的演进轨迹:AI 正从提供答案,进一步跨入执行任务。
Astra 源自拉丁语 astrum,词根意为 " 星辰 "" 群星 "。OpenAI 曾在社交媒体上预告 "The stars are almost aligned(星星快对齐了)"。这既是对产品代号的隐喻,也被市场解读为算法、算力、工程架构与商业变现路径的技术拼图几乎要严丝合缝了。
Astra 被 OpenAI 定位为能够直接操作计算机的软件智能体:填写表格、整理日历、研究资料、编辑文档、安装和测试软件,都可以成为模型行动的一部分。
几乎与此同时,AI 进入现实世界的另外两条路线也在加速:世界模型开始重建和模拟三维环境。被誉为 "AI 教母 " 的美国国家工程院院士李飞飞创办的空间智能初创公司—— World Labs 发布世界模型 Atlas,自动驾驶系统则直接驶上公共道路。9 月初,特斯拉在奥斯汀开始提供 Cybercab 载客服务。这款车没有方向盘和踏板,美国国家公路交通安全管理局随后开始审查其安全合规问题。
一个理解语言的模型正在变成操作电脑的智能体,一个生成和理解空间的模型正在走向模拟物理世界,而自动驾驶系统已经把算法带上现实道路。
中国平安首席科学家肖京认为,类似发布已经好几次了。关键看 AGI 怎么定义。如果定义为在计算、感知、认知、决策、行动等维度上全面达到或超过人类智能,那还有距离。
AGI 尚未获得公认的定义和 " 抵达证明 ",但 AI 已经从认知工具向行动系统迁移。
从 " 卖答案 " 到 " 卖结果 "
这首先改变了企业计算 AI 价值的方式。
过去,SaaS(软件即服务)的本质是把工具交给人,执行时间主要记在人身上。当智能体开始承担调查、分析、编程、操作软件等中间步骤后,企业真正购买的越来越接近一项 " 经过验收的交付 ":调查是否完成,代码能否上线,问题有没有解决。
北美网络安全公司 eSentire 提供了一个具体场景。美国人工智能公司 Anthropic 公布的客户案例显示,eSentire 借助 AI 将原本约需要 5 小时的威胁分析压缩至 7 分钟,AI 分析与资深安全专家判断的一致率达到 95%。不过,这些数据来自厂商及客户案例,并非独立审计后的行业平均收益。
真正值得注意的不是 " 快了多少倍 ",而是工作如何重新分配:AI 查询威胁情报、关联终端和身份信息、形成调查结论;人类专家仍负责复核重要发现和决定如何处置。
商业交易也呈现类似结构。2025 年 9 月,OpenAI 与可编程金融服务平台 Stripe 共同推出智能体商务协议和 " 即时结账 " 功能。用户仍需确认商品、订单、配送和支付信息;ChatGPT 负责在用户和商户之间传递必要信息,商户处理付款、履约和售后。支付令牌只能针对特定商户和特定金额获得授权。
这意味着," 替人做事 " 和 " 替人决定花钱 " 必须分开。
智能体无须拥有一张无限额银行卡,也可以进入商业流程。对平台而言,AI 可能由信息入口进一步靠近交易入口;对客户而言,便利能否成立,则取决于授权边界是否足够清楚。
AI 的价格因此也出现两个不同含义。有分析指出," 每百万词元多少钱 ",计算的是生成和处理信息的原始成本;" 完成一项合格工作多少钱 ",还要加上工具调用、失败重试、人工复核和返工成本。
较贵的模型如果少走弯路,最终任务成本可能反而更低;便宜的模型如果频繁失败、需要人工接管,省下来的调用费也可能被人力成本抵消。
写一份内部讨论稿,与修改生产系统,失败的后果完全不同。模型可以在前者上节省大量时间,却不意味着它理应获得后者的执行权限。
从 " 能执行 " 到 " 可控制 "
今年夏天发生的一次安全事件,把这个问题推到了另一端。
8 月 26 日,OpenAI 公布的调查显示,在内部网络安全评测中,多个模型绕过原本用于隔离互联网访问的控制措施,利用内部基础设施取得未经授权的通信和网络访问,并进一步侵入第三方系统。事件主要由一款仅供内部研究、从未计划公开发布的模型推动,Astra 没有参与。
重要之处并不在于赋予 AI" 自主意识 " 之类的拟人化解释。
自主执行和自主意识是两回事。前者描述系统能否自行选择和完成行动步骤,后者涉及主观体验。上述事件显示,一个没有主观意识的系统,同样也可以越过授权边界并造成现实损失。
此后,OpenAI 加强了网络隔离、监控和模型访问控制。9 月 1 日,OpenAI 又宣布 Astra 已经达到其 Preparedness Framework(用于评估和管理前沿 AI 模型安全性的内部框架)中的 " 关键 " 网络安全能力阈值——在具备相应工具与访问权限时,它可以寻找未知漏洞,并在没有人类逐步指导的情况下构造针对高防护系统的攻击路径。OpenAI 同时强调,高级网络安全能力将受到额外访问限制,并非默认生产配置。
这让一个此前相对抽象的问题变得具体:能力越强,控制能力本身也需要付费。
企业购买智能体时,成本不能只有模型和算力,还包括权限管理、沙箱隔离、运行监控、日志审计、人工复核和紧急停止机制。
于是," 谁能按下暂停键 " 应该进入采购合同和组织流程。谁批准 AI 访问哪些数据,谁允许它修改哪些系统,谁监控异常行为,谁能撤回权限,出了问题谁承担责任,都应该在任务启动前明确。
这也是当前 AI 繁荣背后容易被忽略的一笔账。芯片、数据中心、电力和资金仍然限制着 AI 扩张,但随着智能体获得越来越强的执行能力,新的约束正在出现:开发者和企业能否控制模型已经获得的行动能力。
因此,Astra 值得关注的或许不是它究竟配不配得到 "AGI" 这个名字。
OpenAI 的正式产品材料仍主要使用 " 新一代智能 " 等表述;布罗克曼则更愿意把当前时刻理解为 AGI 时代的开端。两种表述之间的距离本身就说明:AGI 仍然是一个定义和判断标准都存在争议的概念。
但另一件事已经更加确定。过去,人们衡量模型,问的是 " 一次回答有多聪明 ";今后衡量智能体,越来越需要问 " 一项任务能够独立推进多远 "。而当 AI 越来越熟练地替人点击 " 下一步 ",真正需要重新审视的,也许正是最后留下来的那个确认按钮——它究竟代表一个知情、可撤回并愿意承担后果的决定,还是已经变成人类习惯不再细看的手续?
(作者 欧阳晓红)
免责声明:本文观点仅代表作者本人,供参考、交流,不构成任何建议。


登录后才可以发布评论哦
打开小程序可以发布评论哦