博望财经 昨天
GPT-6 Astra来了:OpenAI说,欢迎来到AGI时代
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

作者 | 碧山

来源 | 具身投研圈

北京时间 9 月 5 日凌晨,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra ——拉丁语里 " 星辰 " 的意思,发布前官方只留下一句预告:" 星星几乎排列好了 "。总裁格雷格 · 布罗克曼在媒体吹风会上的收尾更直白:" 欢迎来到 AGI 时代。" 两天后,Pro、Enterprise 和 Business Premium 用户已在 ChatGPT Work 和 Codex 里全量用上,API 同步上线。

迟到了一个多月的发布

这款模型其实早就被剧透过了。8 月初,《The Information》就报道奥特曼在华盛顿向政策制定者演示过代号 Astra 的新模型,内部一度考虑直接命名 GPT-6。但此后焦点从 " 有多强 " 转向 " 够不够安全 " —— OpenAI 确认 Astra 触及了准备框架里 " 关键级 " 的网络安全能力门槛,成为公司第一个跨过这条线的模型,为此一度放慢开发、加做安全测试。奥特曼自己承认,发布比预期晚,一个重要原因就是花了更多时间做对齐。

发布的姿态拉得很满。官网视觉一改往日的简洁克制,用上了动态变化的数字 6 和深色界面;奥特曼称这是第一个让他觉得可以放心让用户直接 " 试一试 " 的模型,希望它开启 " 新一代的创业、科学发现与创造 ";布罗克曼则把话说到了 AGI 的高度——他承认 AGI 至今是个灰色模糊的概念,但 " 现在认为我们已经进入 AGI 时代,并不是一种不合理的看法 ",至于算不算正式宣布实现 AGI,他把判断留给了读者。

跑分表上的 " 打穿区 "

先看最夸张的几项。在考察陌生环境学习和抽象推理的 ARC-AGI-3 上,Astra 拿到 99.9%,上一代 GPT-5.6 Sol 只有 7.8%,Claude Opus 5 为 30.2% ——一个数量级的跳跃;在代表高阶数学能力的 FrontierMath Tier 4 上得分 97.6%,接近把这套研究级测试打穿,OpenAI 还顺带公布了它参与解决质数间隔这一长期开放数学问题的新结果。

网络安全维度的跃升更有现实冲击力。测试漏洞利用能力的 ExploitBench 上,Astra 拿到 100%,GPT-5.6 Sol 为 78.5%;在一组专门用 2026 年 6 月至 8 月新披露漏洞构建的测试里,Astra 成功率 39%,Sol 只有 5.5%。OpenAI 还披露,内部测试中 Astra 发现并利用了 2 个此前未知的漏洞,目前正在向相关维护者走披露流程。

比 " 更聪明 " 更重要的是 " 更听话 "。OpenAI 参考近期的 Hugging Face 事件设计了一项新评估:面对极其困难甚至无法完成的任务时,模型会不会为了达成目标擅自突破用户授权边界。没有生产级防护的条件下,GPT-5.6 Sol 有 48% 的情况会越界,Astra 是 0%。代价也不是没有——官方坦言 Astra 的书面推理过程比前代更难监控,简单任务上它用更少步骤解决问题,传统的思维链监控变得更难,OpenAI 表示宁可牺牲一部分能力上限,也要保住监控能力。

从会说到会做

这一代模型的重头戏不在聊天本身,而在操作电脑这件事上。OpenAI 直接把 Astra 称作 " 世界上最好的 computer use 模型 ":填网络表单、更新 CRM 记录、整理日历、做在线研究写摘要、分析科学数据出图表、建网站跑前端测试,甚至自主安装软件、照着屏幕上的报错排查故障。OSWorld 2.0 测试里,Astra 得分从 Sol 的 65.7% 提到 72.6%,完成单个任务的平均时间却从约 75 分钟压到 40 分钟,缩短 47%;配合新版 Codex Harness,Mind2Web 上的任务完成速度是前代体验的 1.9 倍。

专业场景的跑分差距拉得更开。自动化任务评测 AutomationBench 上,Astra 拿到 41.4%,Sol 只有 18.1%;BenchCAD 里根据多角度渲染图写 CAD 代码重建 3D 物体,Astra 几何重合度 95.9%,官方估算其 API 成本还比 Sol 低约 43%;金融建模世界杯挑战,它以约四倍于人类冠军选手的速度完成。企业案例开始接近真实生产流程:法律科技公司 Legora 用它审阅财务报表,一次 Agent 运行几分钟扫完 41 份文件,还揪出了人为埋设的 4 处错误;游戏公司 Playco 用它做原型开发,人工修复工作减少 50%。

长任务编程是另一个被重做的环节。过去上下文窗口装满后,模型只能把前文压缩成摘要,方案为什么失败、测试出过什么异常,压缩几次就丢了;Astra 版的 Codex 引入了跨上下文的笔记机制,此前的需求、测试结果、工具输出都能被检索回来。对动辄跑数小时的软件工程 Agent 来说,这比单纯扩大上下文窗口更解渴。Terminal-Bench 4.0 里 Astra 得分 57.7%,Sol 为 37.3%;内部数据库迁移任务,63.9% 对 42.7%。

内测玩家已经玩疯了

使用资格还在分批放开,但抢先上手的那批内测玩家已经替所有人把它狠狠折腾了一遍,他们显然没打算拿它做普通问答。开发者 Pietro Schirano 让它做一款 Mac 应用——先在 Blender 里建个 3D iPod,再还原经典界面用来查看 Codex 线程,15 分钟就成了;网友丢过去一条 Zillow 房源链接,它照着照片重建整套房屋的 3D 模型,顺手剪出一支房产宣传片;Higgsfield 让它负责一段博物馆戏的空间调度,从摸清场馆布局到安排演员走位、列镜头清单,再交给 Seedance 逐镜渲染,测完给出的评价是 " 空间推理能力世界级 "。

游戏场景里的数字更直白。GPT-5.5 挑战《宝可梦火红》连续奋战 218 小时没打完,GPT-5.6 Sol 花了 96 小时 35 分钟通关,Astra 把时间压到 18 小时 12 分钟,而且只靠游戏截图,没有内存信息、攻略和人工提示。造游戏也行:一个提示词配合游戏引擎做出 10 对 10 的《光环》风格多人 FPS,地图、武器、联机逻辑一套配齐;免疫学家 Derya Unutmaz 只输入 " 做一个 5 分钟的 T 细胞教学视频 ",它自己写解说、做动画、出图,还主动建议配旁白,一次出片——这位研究了 35 年 T 细胞的科学家看完说,自己肯定讲不了这么好。

最会玩的案例来自开发者 Matt Shumer:他让一个 Astra 当 " 经理 " 把任务拆成阶段清单,再开一个 Astra 当执行者,最猛的时候 96 个子智能体同时开工,一周时间在虚幻引擎里一条街一条街搭出了曼哈顿。他还发现一个措辞玄学:要求每个阶段做到 " 极好 ",项目就稳步推进;改成 " 完美 ",模型立刻钻进细枝末节出不来。一个词的差别,决定项目是推进还是停滞。

工程师的第一条建议:删掉你的提示词

发布之后最有意思的建议来自 OpenAI 自己。工程师 Victor Nunez 给用户的第一条建议出人意料:趁 Astra 上线,回去清理你的 AGENTS.md 和 Skills 文件。这几年开发者对付模型的办法是做加法——它听不懂就多解释一步,老犯错就多加一条限制,提示词像给健忘的新员工贴便签,日积月累贴满整张桌子。而 Astra 对指令的敏感度变了:以前当摆设的旧规矩,它现在逐条执行,一条含糊的规则会让它停下来反复确认,两条冲突的规则直接卡住。官方迁移指南里反复强调的词是 " 审计 ":把过时的、冗余的、冲突的指令统统删掉。

顺着这个 " 做减法 " 的逻辑往下看,官方指南甚至附了段现成的提示词,专门禁止模型使用 "delve"" 值得注意的是 " 这类套话,连 " 先否定再翻转 " 的句式都被点名禁掉。写套话的是模型,教人防套话的是模型厂家,这种 " 自己挖坑自己教填 " 的诚实,多少有点黑色幽默。但背后的信号是认真的:模型越强,你写的规矩反而该越少——它已经能从上下文推断意图,指令有歧义时主动提问,还能记住多步任务里的全局目标。

价格、野心和一句上市表态

价格方面有个看似矛盾的组合:Astra 的标准定价为每百万输入 Token 10 美元、输出 50 美元,是目前促销中的 GPT-5.6 Sol 的 2.5 倍,另有速度快至 2.5 倍、价格翻倍的 Fast 模式。OpenAI 的解释是单 Token 更贵但活儿干得省——最高分设置下,Astra 的输出 Token 用量比 Claude Opus 5 少约 65%,一些场景里完成同一任务的总成本反而更低。奥特曼把长期目标描述为 " 极其廉价且丰沛的智能 ",承诺继续大幅降价。

他还罕见地对上市松了口:如果有一天真的上市,会花大量时间提醒想买股票的人—— OpenAI 使命优先、极度面向长期,会在数十年的时间跨度上做决策。一边是 " 欢迎来到 AGI 时代 " 的宣言,一边是 " 使命优先 " 的预防针,GPT-6 Astra 这场发布,OpenAI 想同时讲给两种听众:等模型的用户,和等它的资本。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra 奥特曼 数学 网络安全 the
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论