今日,OpenAI 正式发布 GPT-6 系列最新模型 GPT-6 Sol 和 GPT-6 Luna。官方透露,这两款模型均采用与 GPT-6 Astra 类似的训练方式,将其在专业工作、事实性、编码、计算机使用和对齐等方面的能力,带入更快、更经济的模型。据悉,GPT-6 Sol 和 GPT-6 Luna 的 API 价格相比 GPT-5.6 的促销价降低了 50%,而 GPT-6 Astra 则定位为整体性能最强的模型。

性能方面,据悉在 AutomationBench 跨应用业务流程测试中,GPT-6 Sol 在 xhigh 强度下表现优于 Claude Opus 5,单任务成本仅为后者的 9%;GPT-6 Luna 在 high 强度下相比前代提升 5.4%,单任务成本降低 58%。

而在 Last Exam 智能体评估测试中,GPT-6 Sol 在 max effort 状态下取得 56.4% 的成绩,超过 Claude Opus 5 的最高成绩,同时单任务成本降低 60%。此外,这两款模型还针对事实可靠性、计算机操作和价值对齐进行了优化。

编程方面,GPT-6 Sol 在 FrontierCode 1.1 Main 测试中相比 GPT-5.6 Sol 有所提升,并以更低成本达到与 Claude Fable 5.1 xhigh 相当的水平。

在 DeepSWE v1.1 软件工程测试中,GPT-6 Sol 在 max effort 下取得 68.8% 的得分,距离 Claude Fable 5 最高成绩 69.9% 仅相差 1.1 个百分点,单任务成本低约 80%。GPT-6 Luna 在 max effort 下则取得了 66.6% 的成绩,单任务成本分别比 Claude Opus 5 和 Fable 5 低出约 93% 和 96%。

计算机操作方面,GPT-6 Sol 在 OSWorld 2.0 offline 的测试中取得 60.5%,与 Claude Opus 5 medium effort 的 60.3% 接近,单任务成本低约 80%。GPT-6 Luna max effort 则超过 GPT-5.6 Sol medium effort,同时成本约为后者的 1/10。
目前,GPT-6 Sol 和 GPT-6 Luna 已在 ChatGPT Work 和 Codex 中面向 Plus、Pro、Business、Enterprise 及 Edu 用户开放,免费用户和 Go 用户可在桌面应用中使用 GPT-6 Luna,但两款模型暂未在对话中提供。而在 OpenAI 提供的 API 服务中,这两款模型分别以 gpt-6-sol 和 gpt-6-luna 形式提供。
自今年以来,OpenAI 持续在推进模型的迭代。今年 2 月,其推出 GPT-5.3-Codex,将 Codex 与 GPT-5 训练体系结合,进一步提升智能体编程能力。3 月发布 GPT-5.4,将推理、编程和智能体工作流能力整合到单一模型中,并支持智能体操作计算机和跨应用执行任务。随后在 7 月,GPT-5.6 系列正式发布,其中旗舰模型 GPT-5.6 Sol 进一步强化了编程、智能体及网络安全能力,并针对高风险活动和敏感网络安全请求加强防护。
9 月 3 日,OpenAI 方面宣布推出 GPT-6 Astra 模型。当时据其透露,作为旗下目前能力最强、部署范围最广的大语言模型,GPT-6 Astra 首次达到其 " 准备框架 " 中的 " 关键 "(Critical)网络安全能力门槛。
【本文图片来自网络】
加入收藏 点赞 ( 0 ) 踩 ( 0 )


登录后才可以发布评论哦
打开小程序可以发布评论哦