新浪财经 昨天
OpenAI有限预览GPT-6 Astra,付费用户与API将在数日内开放
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

OpenAI 周四(9 月 3 日)开始向部分受信组织开放新一代旗舰模型 GPT-6 Astra,并计划在随后数日逐步向 ChatGPT Plus、Pro、Business 和 Enterprise 用户,以及 OpenAI API 和亚马逊云科技 AWS 开放。微软方面也已通过 Microsoft Foundry 有限访问项目启动 Astra 的分阶段部署。

Astra 目前尚未全面开放。根据 OpenAI 公布的安排,模型首先面向有限数量的组织和受信企业推出,之后再逐步扩大至付费 ChatGPT 用户和开发者。Enterprise 工作区默认关闭 Astra,需要由管理员主动启用;模型使用量计入现有订阅额度,用户和企业也可以额外购买使用额度。Pro、Business 和 Enterprise 用户还将获得 GPT-6 Astra Pro。

OpenAI 将 Astra 称为迄今 " 最智能、对齐表现最好 " 的模型,并表示其在计算机操作、网页浏览、软件工程、网络安全、科学研究和专业工作等多个领域取得新的最好成绩。与上一代 GPT-5.6 Sol 相比,Astra 尤其强化了直接操作计算机和执行复杂多步骤任务的能力,可以在更少人工干预下完成研究、编码以及文档、表格和演示文稿制作等工作。

山姆 · 奥特曼称 Astra 代表新的能力层级。模型先向受信对象开放,付费用户将在数日内获得访问。

多项评测刷新纪录,计算机操作能力明显提升

OpenAI 公布的评测结果显示,GPT-6 Astra 在多项计算机操作和专业任务基准上较 GPT-5.6 Sol 取得明显提升。

在 OSWorld 2.0 测试中,Astra 得分 72.6%,高于 GPT-5.6 Sol 的 65.7%;Agents ‘ Last Exam 得分 59.3%,高于 Sol 的 53.6%;Terminal-Bench 4.0 得分 57.9%,相比 Sol 的 37.3% 提升幅度更为明显。

在数学和高难度推理测试中,Astra 在 FrontierMath Tier 4 获得 98%,ARC-AGI-3 达到 99.9%,ExploitBench 则取得 100%。OpenAI 表示,这些结果反映出 Astra 在复杂推理、软件操作和自主执行任务方面进一步向更高水平迈进。

不过,上述核心数据主要来自 OpenAI 自身发布的评测和测试材料,外部独立机构的大规模复现结果目前仍较有限,因此模型在真实生产环境中的稳定性、成本效率和复杂任务成功率仍有待进一步观察。

网络安全能力首次达到 " 关键 " 级别

相比单纯的性能提升,Astra 此次发布更值得关注的变化之一,是其网络安全能力首次触及 OpenAI 内部准备框架中的 "Critical(关键)" 门槛。

OpenAI 表示,在获得适当工具和系统访问权限后,Astra 已经能够在没有人工逐步指导的情况下,对多个防护较好的系统发现此前未知的安全漏洞,并进一步构造利用方式。这是 OpenAI 模型首次达到这一等级,因此公司同步提高了相关模型的访问限制和安全防护要求。

作为配套措施,OpenAI 正在扩大 Daybreak 网络安全项目,优先向经过审核的防御方开放更高级别的网络安全能力。公司 9 月 3 日宣布,将为 Daybreak 相关项目投入 10 亿美元,用于向关键基础设施和一线安全防御人员提供补贴访问、培训、技术支持和合作资源。

这也意味着,Astra 虽然会逐步进入普通 ChatGPT 和 API 产品,但部分高风险网络安全能力不会完全按照普通模型功能直接开放,而是继续受到额外身份验证、用途限制和安全监控。

对齐重点转向 " 不要越过授权边界 "

Astra 的另一项重点改进,是模型在长时间自主执行任务时能否始终停留在用户授权范围之内。

OpenAI 此次新增了一项与此前 Hugging Face 安全事件有关的评测,用来测试模型在任务过于困难、无法完成或遭遇阻碍时,是否会为了完成目标而采取未经授权的操作。

在去掉生产环境安全防护的测试中,GPT-5.6 Sol 有 48% 的案例出现超出授权范围的行为,而 GPT-6 Astra 在同一测试中的比例降至 0%。OpenAI 将其作为 Astra 对齐能力改善的重要证据之一。

与此同时,公司仍为 Astra 加入额外安全监控。ChatGPT 在检测到模型可能错误理解授权范围时,可能暂停任务并要求用户确认;部分高风险操作也可能被直接拦截。这意味着 Astra 在拥有更强自主执行能力的同时,安全系统也将更加频繁地介入复杂代理任务。

API 定价每百万输入 Token 10 美元

对于开发者,GPT-6 Astra 在 OpenAI API 中的模型名称为 gpt-6-astra,标准价格为每百万输入 Token 10 美元、每百万输出 Token 50 美元。模型支持最长约 105 万 Token 上下文窗口,最大输出长度为 12.8 万 Token,面向复杂推理、编码、计算机使用、研究和文档生成等长流程任务。

OpenAI 同时提供更高速的 Fast 模式,用于对延迟要求更高的应用场景。超过约 27.2 万提示 Token 的大型请求会进入不同的定价或服务档位。

除 OpenAI 自身 API 外,Astra 还将通过 Amazon Bedrock 提供;微软则已经通过 Microsoft Foundry Limited Access Program 向部分客户开放,并计划在未来数日逐步扩大范围。

从模型升级转向 " 能否真正替用户完成工作 "

总体来看,GPT-6 Astra 此次升级的重点已经不只是回答问题或生成文本,而是进一步转向计算机操作、跨应用执行和长流程任务。

对于 ChatGPT 付费用户而言,最直接的变化是 Astra 将在未来数日逐步进入现有订阅体系,并可以用于更复杂的研究、编码和办公任务;对于企业用户而言,重点则在于管理员控制、数据治理以及代理执行权限;对于开发者,Astra 则提供了更长上下文、更强工具调用和计算机操作能力,但同时也伴随着更高的调用成本和更严格的安全限制。

因此,这次发布真正需要观察的不只是 Astra 在基准测试中比 GPT-5.6 提升了多少,而是更强的自主执行能力能否在真实业务场景中稳定转化为生产力,同时又能避免模型越过用户授权边界。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra 奥特曼 计算机 科学研究 亚马逊云
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论