谷歌发布旗舰 AI 模型 Gemini 4 Argon,在多项基准测试中超越 OpenAI 和 Anthropic 的顶级产品,标志着这家搜索巨头在历经数月落后后重新杀回竞争前沿。但这款备受期待的模型目前仅向特定网络安全合作伙伴开放,普通开发者和企业用户尚需等待。
9 月 30 日,谷歌正式推出最新 AI 旗舰模型 Gemini 4 Argon,该模型在 18 项基准测试中的 13 项位居榜首或并列第一,尤以知识型工作和长上下文推理见长。

鉴于近几周来人工智能安全问题在科技界引发了广泛讨论,谷歌表示,其新模型最初将仅供专注于网络安全防御的特定公司和组织使用。待防御者有机会修补系统漏洞并修复模型发现的缺陷后,该模型才会更广泛地发布。
谷歌补充说,Gemini 4 Argon 包含新的安全防护措施,以防止误用和意外行为。这些措施包括监控功能,可以在模型越界执行超出用户预期的任务时将其捕获,并可在模型越界时终止其活动。
Gemini 的高级总监兼产品负责人 Tulsee Doshi 说:
我们看到这些防护措施是有效的。
知识工作领先,编程表现参差不齐
Gemini 4 Argon 在知识工作领域的基准测试中展现出压倒性优势,但编程能力的表现则更为复杂。
在谷歌公布的对比数据中,Argon 在 Vals Index 上得分 68.9%,领先 Opus 5.5 的 67.0%;在 Vals Finance Agent v2 上得分 65.4%,领先 Fable 5.1 约 6.5 个百分点;在 Harvey's Legal Agent Benchmark 上得分 19.6%,约为 Fable 5.1 得分的三倍。

编程方面,Argon 在 DeepSWE v1.1 上以 77.9% 的成绩位居榜首,领先 Astra 和 Opus 约 3 至 4 个百分点,谷歌将其定义为该测试的新最优水平。
然而在 FrontierSWE v2 上,Argon 的 55.0% 落后于 Astra 的 65.5%,差距达 10.5 个百分点;在 Terminal-bench 4.0 上,Argon 的 57.4% 也落后于 Opus 5.5 的 66.4% 近 9 个百分点。

值得注意的是,上述基准测试并非在完全统一的实验条件下进行。以 DeepSWE 为例,谷歌使用自有的 mini-swe agent 框架计算 Argon 得分,竞争对手的数据则来自公开排行榜和各模型方的自有报告。方法论的差异意味着,直接的数字比较需要审慎解读。
百万 token 输出上限,为复杂任务打开空间
Gemini 4 Argon 在技术规格上的一项重要突破是将输出 token 上限从此前的 64,000 大幅提升至 100 万。谷歌将这一设计与深度推理能力直接挂钩,认为更大的生成空间使模型能够在单次运行中完成更复杂的任务链。
谷歌披露的内部部署案例印证了这一潜力。在数据中心内存优化方面,Argon 智能体通过分析集群性能遥测数据并实施优化方案,已释放超过 300 TiB 内存,潜在节省规模估计达 500 TiB 至 1 PiB。
在代码迁移领域,Argon 已参与将 C/C++ 代码迁移至 Rust 的工程项目,涉及 re2 等核心库,以及 Fuchsia 操作系统 Zircon 内核超过 80 万行代码。
在视频解码库 libgav1 的迁移中,Argon 智能体替换了 3.2 万行 SIMD 代码,最终实现的解码器运行速度比此前的 Rust 移植版本快 2.7 倍。
谷歌还报告称,Argon 在量子计算领域协助优化了一个子程序的时空资源,改进幅度达 40%。
网络安全是首发核心,访问权限严格管控
安全防御是 Argon 首批应用场景的重心。
谷歌表示,该模型经过专项训练,能够自主发现、验证并修补软件漏洞,Fairwind Program 的受信参与方和谷歌内部团队将获得不附加网络安全护栏的原始模型访问权限。
谷歌旗下子公司 Wiz 已将 Argon 用于其 "Scan for Good" 漏洞扫描项目。谷歌称,该模型发现了一个存在于全球多家医院所用医疗软件中的严重漏洞,而此前多款前沿模型均未能识别该风险。
在内部安全评估中,Argon 在源代码漏洞发现测试中得分 85.8%,高于 Gemini 3.8 Flash Cyber 的 71.0%;在 Wiz 黑盒渗透测试评估中得分 70.9%,高于后者的 58.2%。
在公开的 CWE-bench v1 漏洞修复测试中,Argon 以 68.0% 与 GPT-6 Astra 并列,Opus 5.5 以 67.0% 紧随其后。
定价策略:推广期具有竞争力,后续将翻倍
谷歌公布了 Argon 的 API 定价:推广期每百万输入 token 收费 2 美元,每百万输出 token 收费 10 美元,缓存输入享受 95% 折扣,折算后约为每百万 token 0.10 美元。
推广期结束后,价格将上调至每百万输入 token 4 美元、每百万输出 token 20 美元,涨幅均为一倍,但谷歌未披露推广期的具体截止时间。

与主要竞争对手相比,Argon 推广期价格具有显著优势:
GPT-6 Astra和Claude Fable 5.1的标准 API 价格分别为每百万输入 token 10 美元、每百万输出 token 50 美元,均为 Argon 推广期的五倍。
Claude Opus 5.5的定价为每百万输入 4 美元、每百万输出 20 美元,与 Argon 推广期后的价格持平。
不过,对于寻求性价比的用户而言,定价格局并非非此即彼。
OpenAI 的 GPT-6.1 Sol 与 Argon 推广期定价相同,均为输入 2 美元、输出 10 美元;谷歌自家的 Gemini 3.8 Flash 现行定价为输入 0.75 美元、输出 3.75 美元,价格更低。
谷歌的基准测试对比未纳入 GPT-6.1 Sol,因此推广期相同价位下两款模型的实际质量差异,尚待市场检验。
跳过 3.5 Pro,直接进入 Gemini 4 时代
Argon 的发布同时意味着谷歌放弃了此前规划中的 Gemini 3.5 Pro。
谷歌在今年 5 月的 I/O 开发者大会上曾宣布计划于 6 月推出 Gemini 3.5 Pro,但该计划始终未能落地,此后以一系列 Flash 模型替代。
根据 AI 评测机构 Vals AI 的分析,这一转变反映出 Gemini 3.5 Pro 在性能上已不足以赶超竞争对手,谷歌因此决定直接跳级发布 Gemini 4,重新争夺 AI 前沿地位。
今年 7 月,皮查伊在投资者电话会议上承认了谷歌的落后局面,但表示 " 我们仍在许多维度上保持前沿水平 ",并将 Gemini 4 视为追赶关键。
去年 11 月,谷歌曾凭借一款新模型短暂登顶 AI 排行榜,一度令 OpenAI 内部拉响 " 红色警报 " 紧急备战;如今 Argon 能否守住这次反攻的成果,仍有待全面开放后的市场验证。


登录后才可以发布评论哦
打开小程序可以发布评论哦