← 返回文章库Gemini 4 Argon cover

Gemini 4有多强?

Gemini 4 Argon 先向受信任的网络安全防御团队开放,用受限访问、工程验证和分层定价说明更强模型如何同时设计能力、权限与责任边界。

Google在9月30日发布了Gemini 4 Argon,首批开放对象却是受信任的网络安全防御团队,而不是所有聊天用户。

用户 开放状态
受信任的网络安全防御团队 首批逐步开放
付费API客户 后续优先开放
Google AI Ultra订阅用户 后续优先开放
其他用户 开放安排尚未公布

截至北京时间2026年10月1日,更大范围开放的具体日期尚未公布。

一个新模型的发布,通常带来两个问题:比上一代强多少,我什么时候能用?

Gemini 4把第三个问题摆到了前面:如果模型已经能自己找漏洞、验证漏洞、修复代码,应该先把它交给谁?

这比又一轮“谁是最强大模型”的争论,更值得AI产品创业者关注。模型在做什么、被允许做什么、出了错由谁负责,开始变成同一件产品里的三个问题。

先开放给防御方,不是普通内测

这次承担早期开放的是Fairwind计划。它面向政府、医疗机构、电信服务等重要领域的防御方;部分伙伴能使用Argon,也能把它接入代码安全工具CodeMender。计划同时要求用途审查与治理,授权范围限定在防御和研究。

这解释了为什么“发布”不等于“人人可用”。

能发现系统薄弱点的工具,可以帮助维护者提前修补,也可能让攻击者更快找到入口。限制第一批使用者,并不说明它只能做安全工作;它意味着Google先选择了一个有明确责任人、明确用途的开放场景。

从产品角度看,这也不是给聊天机器人贴一个安全标签。对防御团队而言,找到漏洞只是开始,后面还有复现、修复、测试和部署。每一步都可能接触真实系统。模型越能连续执行,权限边界越不能靠一句“请谨慎操作”来保证。

Google此前公布的前沿安全框架,就把风险评估和缓解措施纳入了发布前审查,而不是只在发布后等待投诉。它还强调:大规模内部部署同样可能需要安全评估。

对做企业AI的人来说,这个顺序很实在:先定义谁能用、能访问什么、能执行到哪一步,再讨论把模型接进去。

强在哪里?Google先拿自己的工程来试

发布新模型,展示一道难题的答案,和把它放进自己的生产系统,是两回事。Argon这次更值得看的,是Google披露的内部使用情况。

先看代码。Google称,Argon智能体正参与把C/C++代码迁移到Rust,涉及核心库,也包括超过80万行代码的Fuchsia Zircon内核。这里说的是迁移工作正在进行,不是这些改动已经全部上线;关键系统仍要经过自动与人工审计、仿真测试和审核。

其中一个更具体的例子是视频解码库libgav1。智能体从已有的Rust移植版本出发,反复做性能实验、检查编译器输出,替换了3.2万行SIMD代码。Google报告,新版本保持相同视频输出,运行速度达到原Rust版本的2.7倍。对比对象是那个Rust版本,不是原本经过优化的C++实现;不能把它写成“AI让所有代码提速2.7倍”。

再看内存。Google还称,一组Argon智能体分析数据中心的性能监测数据,寻找并实施内存优化;相关改动部署后,已释放超过300TiB内存。这个结果比“很会写代码”更具体:它要先从监测数据中定位问题,再改动实现,最后靠部署结果验证。上述内部工程结果均由Google披露,未经第三方审计。

这些案例让“连续完成多步任务”有了具体含义。写出一段代码只是其中一步,后面还有性能实验、结果对照和审核。AI可以参与更长的工程过程,不等于工程团队可以省掉验收。

金融、法律和业务流程,不只是聊天题

在Vals AI于9月30日更新的排行榜中,它以68.9%排在Vals Index首位。这项评测覆盖金融、编程、法律和税务,按相关行业在美国经济中的权重汇总。它反映的是一组任务的评测结果,不是企业已经获得的收入或生产率提升。

Google的能力表也不只有编程。下面摘出几项与专业工作有关的结果,每行只比较同一项测试:

评测 Argon GPT-6 Astra
Vals Finance Agent v2 65.4% 53.5%
Harvey法律智能体评测 19.6% 5.4%
AutomationBench 51.3% 41.4%
长视频理解LVBench 91.7% 87.5%
Agent’s Last Exam 39.5% 34.2%
OSWorld 2.0离线子集 69.2% 72.6%

加粗表示本表同一行两款模型中较高的成绩,不代表所有参评模型中的第一名;不同评测的分数不能直接比较。

金融评测关注多步研究,法律评测涉及研究与起草,AutomationBench关注业务任务的端到端执行。这些成绩提示了不同的产品方向,但并不能直接换算成实际客户节省的时间或费用。

还有一个容易被忽略的变化:专业工作不全是读文字。模型页列出了图表和长视频理解成绩。对依赖视觉材料的工作,这是值得单独测试的能力,而不是看完综合榜就默认它已经足够可靠。

同一张表也保留了不领先的项目:Argon在OSWorld 2.0离线子集上的分数低于Astra。它在某项专业研究上表现更好,不意味着操作电脑也全面胜出。

编程更强,也不是每一项都赢

但总分第一,也不代表所有工作都该换成它。

Google公开的对照表显示,Argon在DeepSWE v1.1上得分77.9%,高于GPT-6 Astra的74.1%;换到FrontierSWE v2,它是55.0%,低于Astra的65.5%。这些是Google披露的评测数据,未经第三方审计;不同测试的分数不能横向当成同一种成功率。

Google官方DeepSWE v1.1评测图:四款模型在同一测试中的得分

Google公布的DeepSWE v1.1评测结果。

这个差别比一句“全面碾压”更有用。做代码迁移、修复线上问题和生成一个新应用,并不是同一种任务。选择模型时,最该拿来测试的,是自己产品里经常出现、又最容易失败的那一类工作。

模型排行榜帮你缩小候选范围,不能替你验收产品。

官方评测方法还限定了这些数字的读法:除另有说明外,Argon采用单次尝试、最高思考设置;不同项目分别来自公开榜单或Google自测,不是一场完全统一环境下的横向比赛。DeepSWE使用mini-swe智能体框架;长视频评测中,各模型接收的帧数也因API限制而不同。

因此,既要看分数,也要看任务、工具和运行预算。尤其不能把长视频理解得分当成所有视频产品的准确率,或把某个电脑操作测试的部分得分当成完整任务成功率。

百万输出上限,别读成百万上下文

这次输出Token上限提高到了100万。注意:这是输出上限,不是输入上下文窗口。

上下文决定模型一次能接纳多少材料;输出上限则关系到它在一条任务轨迹里,能生成多长的推理与内容。两者都可能影响复杂任务,但不是同一项能力。

更长的输出预算,给持续处理难题留出了空间。不过,对产品团队来说,“能生成更多”不自动等于“应该生成更多”。

一份需要人工核对的报告,如果变长十倍,检查负担也可能变重。一次代码修改,即使模型解释得很详尽,最终仍要看测试是否通过、行为有没有改变。

因此,更大的输出额度应该对应更明确的停止条件:任务完成就结束,验证失败就回退,触及高风险操作就请求确认。不能把“模型还可以继续想”当成无限延长任务的理由。

单价不贵,不等于任务便宜

Google把首发优惠和优惠结束后的价格分开公布:

费用项目 首发优惠 优惠结束后
输入Token 2美元 4美元
输出Token 10美元 20美元

以上均为每百万Token的价格,不包含其他服务费用。首发优惠持续多久,公告没有给出。

这里不能只盯着“2美元”三个字。

按公布的价格计算,10万输出Token在首发期对应1美元,优惠结束后是2美元。这只是输出部分的算术示例,并不是一个任务的报价:输入、重试和其他服务费用还要另算。

如果新模型一次就完成了旧模型反复失败的任务,较高的单次消耗可能值得;如果它只是把原本够用的回答写得更长,账单增加就未必带来价值。

真正值得记录的是每个合格结果花了多少钱。尤其是多步任务,失败后的重跑、人的修改和验收时间,都不能被一张Token价格表遮住。

对创业者,下一步不是立刻换模型

我的判断是,Gemini 4首先扩大了需要认真测试的任务范围,而不是立刻给所有AI产品发了一张升级通知。

可以先挑一个已有的难题:长资料研究容易漏项,代码修改经常过不了测试,或者业务操作做到一半需要人接手。保留原来模型的结果和成本,等拿到访问权限,再让Argon做同一项工作。

结果更好但更慢,适合放在哪一档服务?能力更强但要更多权限,哪些动作必须人工确认?如果报价优惠结束,原来的收费还能覆盖成本吗?这些问题,比抢着在产品介绍里写“已接入Gemini 4”更接近生意。

截至目前,Google明确的后续优先开放对象是付费API客户和Google AI Ultra订阅用户,但没有公布具体日期。

等权限的这段时间,可以先准备真实任务和验收标准。拿到新模型后,第一件事不是换掉旧模型,而是看看:那个以前一直做不好的任务,这次到底做成了没有。