Gemini新模型发布:谷歌7个月追平Astra 还更便宜
谷歌CEO桑达尔·皮查伊。图片由AI生成
距离上一款旗舰模型发布已经过去7个月,谷歌终于拿出了新东西。这一次,它想用更宽的能力覆盖面和更低的价格,把自己重新拉回前沿第一梯队。
美国当地时间9月30日,谷歌DeepMind正式发布Gemini 4 Argon,这是该公司半年多以来首款超越Flash级别的前沿专有模型,主打软件工程、企业知识工作和网络防御三大场景。
Gemini 4 Argon的测试成绩相当亮眼:在谷歌公开的18项基准对比中,该模型在12项中领先、1项并列第一,超过了GPT-6 Astra和Claude Opus 5.5。

独立评估机构Artificial Analysis的智能指数中,Argon得分53,与GPT-6 Astra持平。

第三方测评Arena.ai的Text Arena榜单上,Argon以1525分登顶。

价格同样是Argon的一张王牌。谷歌没有把它定位成高价旗舰模型,而是通过更低的调用成本和缓存优惠降低使用门槛,试图让Argon在性能之外,再建立一层价格优势。
但普通用户暂时还拿不到。Argon首先通过Fairwind计划向可信的网络防御者开放,同时正在参与美国政府的自愿预发布程序。更广泛的开放从付费API客户和Google AI Ultra订阅用户开始,具体时间表未公布。
对于谷歌来说,这次发布的意义远不止一款新模型。过去大半年,Gemini 3.5 Pro几经推迟后夭折,OpenAI和Anthropic快速迭代拉大差距,内部人才流失和领导层调整不断。Argon是谷歌对”已经掉队”叙事的集中回应。
01 跑分第一梯队,但不是全面碾压
从基准测试看,Argon交出了一份不错的答卷,其优势主要集中在企业和长上下文工作流。Harvey法律代理基准中,Argon得分19.6%,是第二名的三倍以上。Zapier的AutomationBench端到端业务执行测试中,Argon以51.3%领先。
金融方面,Vals Finance Agent v2得分65.4%,超过Claude Opus 5.5和GPT-6 Astra。编程方面,DeepSWE v1.1长周期软件工程测试以77.9%位居第一。长视频理解基准LVBench上,Argon得分91.7%。网络安全CWE-bench v1上,则与GPT-6 Astra并列第一。
Artificial Analysis重点强调了Argon的两大亮点:
一是Argon的幻觉率仅15%,是智能指数得分45分以上模型中最低的,远低于GPT-6 Astra的51%。Argon更倾向于承认自己不知道,而不是错误猜测。
二是Argon输出token限制达到100万,是此前6.4万的15倍以上,对智能体编程、审计、迁移等长链条工作尤为关键。

AI测评人@notjazii评论称,谷歌团队在这个模型上卯足了劲。幻觉率最低、登顶Vals指数、Text Arena排名第一、AA上得分53追平Astra、每任务成本更低——几乎在大多数测试中都排第一或第二。

但Argon不是全面碾压,它也有几个明显落后的项目,尤其是FrontierSWE v2和Terminal-Bench Science 0.1,GPT-6 Astra在这两项中都领先10个百分点以上。Claude Opus 5.5在Terminal-bench 4.0上领先约9个百分点。
同时,彭博社披露称,一些谷歌员工对Gemini 4的实际表现持怀疑态度,尤其是在编程领域。基准测试分数不错,但真实工作场景中处理某些编码任务时表现不如人意,前端设计能力尤为薄弱。
内部有人将这种现象归因于”benchmaxxing”——工程师更专注于在基准测试上取得好成绩,而不是打造真正好用的产品。AI初创公司Surge AI创始人埃德温·陈(Edwin Chen)打过一个比方:这就像孩子SAT考了高分,但分数并不一定能转化为现实世界的表现。
02 Argon已在谷歌内部上岗
基准测试之外,更有说服力的是Argon已经进入谷歌内部真实业务流程。
谷歌DeepMind高级副总裁兼首席AI架构师科雷·卡夫克丘奥卢(Koray Kavukcuoglu)表示,已有数千名谷歌员工开始使用Argon,应用场景覆盖代码开发、工程优化、研究分析等多个方向。
其中,Argon最具代表性的能力体现在复杂工程任务上。量子计算团队曾用Argon优化瓶颈子例程的时空资源,一个案例在几分钟内就比已发表的基线提升了40%。
在内存优化方面,一组Argon智能体分析谷歌全舰队性能数据,自主识别并执行优化方案,部署后已释放超过300TiB内存,预计总节省规模达到500TiB至1PiB。
科技分析师@kimmonismus称,最值得关注的是,这些智能体已经开始在谷歌自身基础设施中承担真实任务,包括分析遥测数据、优化内存以及迁移代码库,而不是停留在演示环境中。

代码迁移是Argon落地的另一项重点工作。它正在帮助谷歌将内部C/C++代码迁移至Rust,涉及范围从核心库的数万行代码,到Fuchsia操作系统Zircon内核的80万行以上代码。由于这些系统承担关键功能,所有迁移结果都需要经过自动化检测和人工审计后才能部署。
其中,libgav1视频解码器是一个较为具体的案例。Argon使用3.2万行安全Rust代码替换原有SIMD代码,并通过编译器自动向量化,最终生成的内存安全解码器相比此前Rust移植版本速度提升2.7倍,同时保持视频输出完全一致。
网络安全方面,谷歌专门训练了Argon的防御能力,它可以自主发现、验证并修补关键漏洞。对于可信防御者和内部团队,谷歌将提供不带网络安全护栏的版本,使其发挥全部前沿级防御能力。
云安全公司Wiz已经通过其”善意扫描”计划使用Argon。早期验证中,模型发现了一个全球医院医疗软件中暴露敏感个人信息的关键漏洞,而此前的前沿模型都没有发现。
03 半价抢市场,但普通人买不到
Argon的定价策略,简单说就是”便宜、但你暂时买不到”。
首发促销价输入2美元、输出10美元每百万token,只有GPT-6 Astra标价的五分之一,是Claude Opus 5.5的一半。缓存输入折扣95%,折后仅0.10美元。Artificial Analysis测算,折扣下Argon每智能指数任务成本为1.99美元,相当于GPT-6 Astra的60%。促销结束后标准价与Opus 5.5持平,每任务成本约为Astra的1.2倍。
AI行业观察者@NFT_Chen称,Gemini 4 Argon正好卡在帕累托最优线上。折扣价下每任务成本只有Astra的60%,DeepSWE新SOTA,AutomationBench第一,幻觉率同档最低,输出上限1M tokens。沉寂7个月后,谷歌终于把真正的前沿模型端上桌了。

安全方面,谷歌强调四大防护领域:防止网络和CBRN滥用、抵御提示注入攻击、监控错位行为、加固沙箱环境。
其中Gray Swan间接提示注入测试中,Argon的攻击成功率仅0.7%,低于Claude Opus 5.5的1.0%和GPT-6 Astra的8.5%。谷歌还部署了错位缓解系统,监测Argon的思维链和行动,必要时停止执行,并明确主张在能力提升的关键阶段保持推理透明度。
04 谷歌能重回牌桌吗?
Argon的发布,是谷歌对”已经掉队”的大众印象的一次集中回应。
过去大半年,谷歌在前沿模型领域的存在感下降。Gemini 3系列发布于2025年11月,原定的Gemini 3.5 Pro几经推迟后最终被放弃。彭博情报分析师曼迪普·辛格(Mandeep Singh)估算,训练这样一款模型的成本可能高达4亿美元。同期OpenAI和Anthropic快速迭代,差距越拉越大。
内部动荡也加剧了担忧。2026年8月,戴密斯·哈萨比斯(Demis Hassabis)卸任DeepMind CEO转任Alphabet董事长兼首席科学家,杰夫·迪恩(Jeff Dean)离职创业,卡夫克丘奥卢接任最高职位,这被称为谷歌自2023年OpenAI动荡以来最大的AI领导层洗牌。
传奇工程师杰夫·迪恩、诺贝尔奖得主约翰·江珀(John Jumper)、诺姆·沙齐尔(Noam Shazeer)等明星研究者也相继离开。
Creative Strategies分析师马克斯·温巴赫表示,他此前对Gemini整体评价不高,但从目前的表现来看,谷歌似乎终于拿出了有竞争力的前沿模型,也可能解决了过去的过度推理等问题。

Argon就是在这样的背景下登场的。它至少在纸面上给出了一份有说服力的答卷。但要真正重回前沿竞争,光靠基准测试还不够。
首先是真实可用性。基准高分不等于生产环境好用,前端设计等场景的短板、模型过大带来的推理成本压力、以及”为跑分优化”的倾向,都需要在实际部署中验证。
谷歌首席执行官桑达尔·皮查伊(Sundar Pichai)在社交媒体上表示,将尽快且尽可能安全地使Argon可用,”还有很多内容即将推出,你将看到我们快速迭代。”
沉寂7个月后,谷歌终于拿出了新的前沿模型。它能不能真正扭转局面,让谷歌重新站回AI前沿的中心舞台?答案,或许就在接下来几个月的快速迭代里。


