Google在9月30日发布了Gemini 4 Argon,首批开放对象却是受信任的网络安全防御团队,而不是所有聊天用户。
| 用户 | 开放状态 |
|---|---|
| 受信任的网络安全防御团队 | 首批逐步开放 |
| 付费API客户 | 后续优先开放 |
| Google AI Ultra订阅用户 | 后续优先开放 |
| 其他用户 | 开放安排尚未公布 |
截至北京时间2026年10月1日,更大范围开放的具体日期尚未公布。
一个新模型的发布,通常带来两个问题:比上一代强多少,我什么时候能用?
Gemini 4把第三个问题摆到了前面:如果模型已经能自己找漏洞、验证漏洞、修复代码,应该先把它交给谁?
这比又一轮“谁是最强大模型”的争论,更值得AI产品创业者关注。模型在做什么、被允许做什么、出了错由谁负责,开始变成同一件产品里的三个问题。
先开放给防御方,不是普通内测
这次承担早期开放的是Fairwind计划。它面向政府、医疗机构、电信服务等重要领域的防御方;部分伙伴能使用Argon,也能把它接入代码安全工具CodeMender。计划同时要求用途审查与治理,授权范围限定在防御和研究。
这解释了为什么“发布”不等于“人人可用”。
能发现系统薄弱点的工具,可以帮助维护者提前修补,也可能让攻击者更快找到入口。限制第一批使用者,并不说明它只能做安全工作;它意味着Google先选择了一个有明确责任人、明确用途的开放场景。
从产品角度看,这也不是给聊天机器人贴一个安全标签。对防御团队而言,找到漏洞只是开始,后面还有复现、修复、测试和部署。每一步都可能接触真实系统。模型越能连续执行,权限边界越不能靠一句“请谨慎操作”来保证。
Google此前公布的前沿安全框架,就把风险评估和缓解措施纳入了发布前审查,而不是只在发布后等待投诉。它还强调:大规模内部部署同样可能需要安全评估。
对做企业AI的人来说,这个顺序很实在:先定义谁能用、能访问什么、能执行到哪一步,再讨论把模型接进去。
强在哪里?Google先拿自己的工程来试
发布新模型,展示一道难题的答案,和把它放进自己的生产系统,是两回事。Argon这次更值得看的,是Google披露的内部使用情况。
先看代码。Google称,Argon智能体正参与把C/C++代码迁移到Rust,涉及核心库,也包括超过80万行代码的Fuchsia Zircon内核。这里说的是迁移工作正在进行,不是这些改动已经全部上线;关键系统仍要经过自动与人工审计、仿真测试和审核。
其中一个更具体的例子是视频解码库libgav1。智能体从已有的Rust移植版本出发,反复做性能实验、检查编译器输出,替换了3.2万行SIMD代码。Google报告,新版本保持相同视频输出,运行速度达到原Rust版本的2.7倍。对比对象是那个Rust版本,不是原本经过优化的C++实现;不能把它写成“AI让所有代码提速2.7倍”。
再看内存。Google还称,一组Argon智能体分析数据中心的性能监测数据,寻找并实施内存优化;相关改动部署后,已释放超过300TiB内存。这个结果比“很会写代码”更具体:它要先从监测数据中定位问题,再改动实现,最后靠部署结果验证。上述内部工程结果均由Google披露,未经第三方审计。
这些案例让“连续完成多步任务”有了具体含义。写出一段代码只是其中一步,后面还有性能实验、结果对照和审核。AI可以参与更长的工程过程,不等于工程团队可以省掉验收。
金融、法律和业务流程,不只是聊天题
在Vals AI于9月30日更新的排行榜中,它以68.9%排在Vals Index首位。这项评测覆盖金融、编程、法律和税务,按相关行业在美国经济中的权重汇总。它反映的是一组任务的评测结果,不是企业已经获得的收入或生产率提升。
Google的能力表也不只有编程。下面摘出几项与专业工作有关的结果,每行只比较同一项测试:
| 评测 | Argon | GPT-6 Astra |
|---|---|---|
| Vals Finance Agent v2 | 65.4% | 53.5% |
| Harvey法律智能体评测 | 19.6% | 5.4% |
| AutomationBench | 51.3% | 41.4% |
| 长视频理解LVBench | 91.7% | 87.5% |
| Agent’s Last Exam | 39.5% | 34.2% |
| OSWorld 2.0离线子集 | 69.2% | 72.6% |
加粗表示本表同一行两款模型中较高的成绩,不代表所有参评模型中的第一名;不同评测的分数不能直接比较。
金融评测关注多步研究,法律评测涉及研究与起草,AutomationBench关注业务任务的端到端执行。这些成绩提示了不同的产品方向,但并不能直接换算成实际客户节省的时间或费用。
还有一个容易被忽略的变化:专业工作不全是读文字。模型页列出了图表和长视频理解成绩。对依赖视觉材料的工作,这是值得单独测试的能力,而不是看完综合榜就默认它已经足够可靠。
同一张表也保留了不领先的项目:Argon在OSWorld 2.0离线子集上的分数低于Astra。它在某项专业研究上表现更好,不意味着操作电脑也全面胜出。
编程更强,也不是每一项都赢
但总分第一,也不代表所有工作都该换成它。
Google公开的对照表显示,Argon在DeepSWE v1.1上得分77.9%,高于GPT-6 Astra的74.1%;换到FrontierSWE v2,它是55.0%,低于Astra的65.5%。这些是Google披露的评测数据,未经第三方审计;不同测试的分数不能横向当成同一种成功率。

这个差别比一句“全面碾压”更有用。做代码迁移、修复线上问题和生成一个新应用,并不是同一种任务。选择模型时,最该拿来测试的,是自己产品里经常出现、又最容易失败的那一类工作。
模型排行榜帮你缩小候选范围,不能替你验收产品。
官方评测方法还限定了这些数字的读法:除另有说明外,Argon采用单次尝试、最高思考设置;不同项目分别来自公开榜单或Google自测,不是一场完全统一环境下的横向比赛。DeepSWE使用mini-swe智能体框架;长视频评测中,各模型接收的帧数也因API限制而不同。
因此,既要看分数,也要看任务、工具和运行预算。尤其不能把长视频理解得分当成所有视频产品的准确率,或把某个电脑操作测试的部分得分当成完整任务成功率。
百万输出上限,别读成百万上下文
这次输出Token上限提高到了100万。注意:这是输出上限,不是输入上下文窗口。
上下文决定模型一次能接纳多少材料;输出上限则关系到它在一条任务轨迹里,能生成多长的推理与内容。两者都可能影响复杂任务,但不是同一项能力。
更长的输出预算,给持续处理难题留出了空间。不过,对产品团队来说,“能生成更多”不自动等于“应该生成更多”。
一份需要人工核对的报告,如果变长十倍,检查负担也可能变重。一次代码修改,即使模型解释得很详尽,最终仍要看测试是否通过、行为有没有改变。
因此,更大的输出额度应该对应更明确的停止条件:任务完成就结束,验证失败就回退,触及高风险操作就请求确认。不能把“模型还可以继续想”当成无限延长任务的理由。
单价不贵,不等于任务便宜
| 费用项目 | 首发优惠 | 优惠结束后 |
|---|---|---|
| 输入Token | 2美元 | 4美元 |
| 输出Token | 10美元 | 20美元 |
以上均为每百万Token的价格,不包含其他服务费用。首发优惠持续多久,公告没有给出。
这里不能只盯着“2美元”三个字。
按公布的价格计算,10万输出Token在首发期对应1美元,优惠结束后是2美元。这只是输出部分的算术示例,并不是一个任务的报价:输入、重试和其他服务费用还要另算。
如果新模型一次就完成了旧模型反复失败的任务,较高的单次消耗可能值得;如果它只是把原本够用的回答写得更长,账单增加就未必带来价值。
真正值得记录的是每个合格结果花了多少钱。尤其是多步任务,失败后的重跑、人的修改和验收时间,都不能被一张Token价格表遮住。
对创业者,下一步不是立刻换模型
我的判断是,Gemini 4首先扩大了需要认真测试的任务范围,而不是立刻给所有AI产品发了一张升级通知。
可以先挑一个已有的难题:长资料研究容易漏项,代码修改经常过不了测试,或者业务操作做到一半需要人接手。保留原来模型的结果和成本,等拿到访问权限,再让Argon做同一项工作。
结果更好但更慢,适合放在哪一档服务?能力更强但要更多权限,哪些动作必须人工确认?如果报价优惠结束,原来的收费还能覆盖成本吗?这些问题,比抢着在产品介绍里写“已接入Gemini 4”更接近生意。
截至目前,Google明确的后续优先开放对象是付费API客户和Google AI Ultra订阅用户,但没有公布具体日期。
等权限的这段时间,可以先准备真实任务和验收标准。拿到新模型后,第一件事不是换掉旧模型,而是看看:那个以前一直做不好的任务,这次到底做成了没有。
