Gemini 4 Argon成本降60% 性能达Astra水平
Google于10月1日正式发布旗舰级人工智能模型Gemini 4 Argon。该模型主要面向软件开发、法律金融等知识密集型企业及复杂长周期任务,官方宣称其性能已达到GPT-6 Astra等同级别产品,但综合成本仅为其60%。
在核心参数方面,Gemini 4 Argon将单次输出Token上限从以往的6.4万大幅提升至100万,支持深度思考并生成数十万至百万级内容,适用于大型代码库处理与多阶段企业流程。在多项测试中,该模型表现突出:在DeepSWE-v1.1长期软件开发测试中取得77.9%的新纪录;在覆盖金融、编程、法律等领域的Vals指数及AutomationBench端到端自动化测试中均位列第一;在LVBench长视频理解测试中以91.7%得分居首。此外,在CWE-bench-v1漏洞修复评估中,Argon以68%的得分与GPT-6 Astra并列第一。

定价方面,Gemini 4 Argon API输入Token单价为2美元/百万(约13.4元人民币),输出为10美元/百万(约67元人民币)。缓存输入Token价格较普通输入降低95%,约为0.1美元/百万。根据Artificial Analysis数据,应用折扣后单任务成本约1.99美元,比GPT-6 Astra(Zui高档)低40%。混合计算下,该模型在Text Arena评测中取得1525分,成本效益曲线位于前列。

目前,Gemini 4 Argon已通过“Fairwind计划”向部分网络安全防御团队开放内测。Google表示将优先收集早期反馈并完善安全机制,随后逐步向开发者、企业及消费者开放。首批用户包括付费API客户及Google AI Ultra订阅者。

在Artificial Analysis Intelligence Index中,该模型获得53分,仅次于Claude Opus 5.5和Sonnet 5.5,与Claude Fable 5.1及GPT-6 Astra持平。不过据Bloomberg援引知情人士消息,部分Google内部员工认为该模型在实际工程应用中尚未完全达到宣传水平,尤其在部分编程任务上仍存在困难,这与官方发布的基准测试成绩形成反差。
社交媒体X上的开发者反馈显示,Argon对提示词(Prompt)极为敏感,默认输出风格一般,但通过额外指令可显著改善;在3D场景生成细节上,目前仍略逊于Claude Opus 5。Google首席执行官r Pichai表示,因外界对下一代模型讨论热烈,故决定尽早公开,目前内部团队在编程与量子计算等任务中的使用反馈积极。
在实际应用层面,Google内部已有数千名员工将该模型用于日常调试、算法研发及大规模代码迁移。例如,Argon协助量子计算研究人员优化了算法时空资源,使某公开基线结果在数分钟内提升40%;通过分析服务器集群遥测数据,自动识别并实施了数据中心内存优化方案,预计可释放300至1000 TiB存储空间。此外,Argon还参与了Google核心C/C++代码向Rust语言的迁移工作,涉及超80万行内核代码。以开源视频libgav1为例,经Argon重写约3.2万行SIMD代码后,新版运行速度提升2.7倍。
针对网络安全领域,Google对Argon进行了专项训练,使其具备自主发现、验证及修复软件漏洞的能力。在“Scan for Good”项目中,安全公司Wiz已免费利用该模型检测关键公共基础设施的高风险暴露。Google透露,Argon曾在早期测试中发现一款全球医院广泛使用的医疗软件存在严重漏洞,可能引发敏感个人信息泄露,而此前多款模型未能识别此问题。