
作者 | 李水青
编辑 | 心缘
智东西 9 月 4 日报道,刚刚,OpenAI推出了GPT-6 Astra,并称这是当今世界上最智能、最均衡的模型。
OpenAI 联合创始人兼 CEO 萨姆 · 奥尔特曼(Sam Altman)发文称:" 我们相信它是目前全球计算机应用、专业工作、科学研究、编程、网络安全等领域的最佳模型。"


模型一经发布就引起网友围观,有网友在社交平台 X 上称:"OpenAI 在长期落后于 Fable 模型之后,似乎已经取得了领先地位。" 此前 9 月 2 日,Anthropic 刚推出新一代全球最强模型Claude Fable 5.1、Claude Mythos 5.1。

GPT-6 Astra 今天开始向部分组织推出,未来几天将向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,并通过 OpenAI API 和 AWS 提供服务。对于开发者而言,GPT-6 Astra 已通过OpenAI API 提供 gpt-6-astra,同时也可在 Amazon Bedrock 中使用。
GPT-6 Astra 的价格将是 OpenAI 上一代旗舰模型GPT-5.6 Sol 的 2.5 倍,标准版定价为每百万个输入 token10 美元(约合人民币 67.19 元),每百万个输出 token50 美元(约合人民币 335.93 元),缓存输入 1 美元、缓存写入 12.5 美元。这与 Anthropic 最近发布的Fable 5.1 模型定价相同。
API 中为 GPT-6 Astra 提供快速模式,处理速度最高可达标准版的2.5 倍,价格为标准版的2 倍。
一、全面狙击 Fable 5.1,比拼 " 完成任务 "
Terminal-Bench Science 0.1 测试智能体能否使用代码和终端工具完成科学研究工作流程,包括数据分析、运行模拟和拟合模型。在所有对比模型中,GPT-6 Astra 表现最佳,得分高达 64.6%,

ARC-AGI-3 测试智能体在解决陌生交互任务时的学习能力。GPT-6 Astra 在评估中表现出色,得分高达 99.9%。人类测试者的平均得分仅为 48%。OpenAI 使用响应 API 测试工具对 GPT-6 Astra 进行了评估,该工具比原始基准测试工具更能反映实际应用场景下的性能。OpenAI 估计,使用该测试工具,Sol 的得分大约在 30% 左右。




用户可以更加放心地将任务委托给 Astra,相信它的判断力。为了验证这一点,OpenAI 参考了 "Hugging Face" 事件,构建了一个新的评估模型,用于评估模型在面对困难或不可能完成的任务时是否会超出其预期范围。

二、" 世界上最好的计算机使用模型 "
OpenAI 称,Astra 是 " 世界上最好的计算机使用模型 ",标志着计算机使用速度、准确性和安全性迈上了一个新的台阶。
它可以处理繁琐的任务,例如填写在线表格、更新 CRM 中的客户记录以及管理用户的日程安排。它可以进行在线研究,并在用户的电子邮件或文档编辑器中生成摘要。它可以分析科学数据、生成图表、创建网站并运行前端质量保证检查,以确保网站上的所有功能正常运行。它可以帮助用户自主安装和测试软件,并解决用户在屏幕上看到的问题。这些改进也体现在 OpenAI 最先进的评估结果中。
Agents ’ Last Exam 测试智能体在真实软件中完成复杂专业任务的能力,任务范围涵盖金融建模、工程和媒体制作等领域。在本次对比测试中,GPT-6 Astra 取得了 59.3% 的优异成绩,远超 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%。在这些最高分设置下,Astra 使用的输出 token 数量也比 Opus 5 减少了约 65%。



GPT-6 Astra 的计算机使用能力体现在各个领域的输出中,包括游戏开发、电气工程和日常知识工作:
这是 GPT-6 Astra 在 KiCad 中进行印刷电路板(PCB)布局的 15 秒精简回放,它通过放置元件和布线,将电子原理图转化为可制造的 PCB。PCB 布局是当今所有电子设备不可或缺的一部分,但它仍然是一项需要手动完成的任务,也是电子设计流程中常见的延迟来源。加快 PCB 布局速度意味着工程师可以腾出更多时间来发明、优化和测试他们的下一个想法,从而显著提高效率。


GPT-6 Astra 将书面简报转化为 FreeCAD 中五速汽车变速器的详细概念模型,然后使用 Blender 制作齿轮运动动画。它通过后续反馈不断完善设计,帮助工程师在构建物理原型之前,可视化各个部件的装配和运动方式,并进行设计沟通。

比如它能在 2 分 54 秒内完成儿科医生搜索,在 9 分 57 秒里完成寻找公寓,5 分 10 秒里完成车管所预约。

GPT-6 Astra 将计算机使用技术的进步与针对专业环境的定向训练相结合,以帮助解决复杂的工作任务。它既具备解决复杂问题所需的智能,又能够执行多步骤工作流程,并生成精美的文档、电子表格和演示文稿。
BenchCAD 通过生成 CAD 代码来测试模型能否从多视图渲染中重建 3D 对象。借助相关工具,GPT-6 Astra 在所示的对比测试中取得了新高,几何重叠率达到 95.9%,而 GPT-5.6 Sol 为 83.3%,Claude Fable 5.1 为 84.3%。在所示配置下,其 API 成本预计比 Sol 低约 43%,比 Fable 5.1 低约 86%。



GPT-6 Astra 在 Blender 中建模房屋,并将其转换为 Unreal Engine 5 中的可步行场景,帮助设计师和客户在房屋建造之前探索布局并体验空间。
当指令留有解读空间时,GPT-6 Astra 比以往的模型更能做出正确的判断。它利用上下文来填补常规的空白,并在答案可能改变结果时提出更有针对性的问题。在 Codex 中,它可以异步提问,同时继续执行不依赖于你回复的工作。如果你没有回复,它会在适当的情况下做出合理的假设,但会等待你对关键决策的反馈。
以下示例展示了 Astra 如何协作完成日常任务,在这些任务中,缺失的信息可能会实质性地改变答案。
Astra 在任务演变过程中也能更好地保持方向感。早期的模型有时会将转向信息视为新的目标,从而忽略最初的请求或之前的约束条件。Astra 能够整合新的需求,根据要求调整方向,并在不偏离整体任务的情况下回答相关问题。

OpenAI 称,GPT-6 Astra 是迄今为止软件工程领域最好的模型。





早期的上下文窗口仍然可搜索,因此 Astra 可以从之前的消息和工具输出中找到需求或测试结果:即使这些信息没有记录在注释中。用户可以在 Codex 中启用此实验性功能。并且在接下来的几周内,它将成为 Astra 的默认设置。
五、数学领域创纪录,科学评测全面领先
GPT- 6 Astra 是科学发现、数学和健康领域的一项重大进步。今天,OpenAI 将分享关于素数之间差距的另外两项研究。Astra 还在一系列数学和科学评估中创造了新的纪录。
GPQA Diamond 测试研究生水平的生物学、化学和物理学科学推理能力。GPT-6 Astra 在对比测试中取得了 96.0% 的新高分。在成本较低的环境下,它也超过了 GPT-5.6 Sol 的最佳成绩(94.9% 对 94.6%),而其 API 成本预计降低了约 37%。



比如,GPT-6 Astra 可引导科学软件检查测序质量并可视化遗传变异,帮助研究人员评估数据并确定进一步分析的重点。
GPT-6 Astra 在 Jupyter 中构建并运行细胞追踪工作流程,将原始显微镜图像转换为带标记的轨迹和谱系记录,以帮助研究人员跟踪单个细胞的运动和分裂。

通过 GPT-6 Astra 的发布,OpenAI 试图在大模型竞赛中再次拉开身位。Astra 在数十项权威评测中全面碾压自家 GPT-5.6 Sol,并全面 " 狙击 "Claude Fable 5.1,同时在多项任务中实现 API 成本大幅下降,有望倒逼竞争对手重新审视技术路线与商业策略。
从应用价值来看,Astra 正在将 AI 从 " 对话工具 " 推向 " 数字员工 " 的实质跨越。同时,Astra 自称在安全性迈上了一个新的台阶,企业级市场的大门有望被进一步撞开,这也是 OpenAI 向 Anthropic 发起的猛烈反击。


登录后才可以发布评论哦
打开小程序可以发布评论哦