Google发布Gemini 4 Argon:瞄准长流程工作,但暂未全面开放
基准测试
用统一题目比较不同AI表现的测试。
Fairwind计划
Google先让可信的网络安全人员试用模型的计划。
token
AI处理文字时使用的计算单位。
发生了什么
9月30日,Google DeepMind(Google的人工智能研究机构)发布Gemini 4 Argon(新一代前沿模型)。Google的官方模型页面称,它面向真实的软件工程、企业中的法律和金融知识工作,以及网络安全防御。重点不是只回答一个问题,而是持续完成有许多步骤的复杂任务。
Argon目前没有向所有人开放。Google先通过Fairwind计划,邀请一小批可信的网络安全防御人员试用。之后才会扩大范围,付费API用户和Google AI Ultra订阅者预计先获得访问权,但公司没有给出具体日期。
为什么此时发布
过去一段时间,Google主要推出更小、更便宜的Flash模型。OpenAI和Anthropic则持续争夺更强的前沿模型。Gemini 4 Argon因此不只是一次产品更新,也是Google重新证明顶级模型能力的动作。
这场竞争的标准也在变化。普通聊天看重一句话答得好不好。企业工作还要看AI能否分解任务、记住上下文、检查结果,并把下一步做完。任务越长,中途出错的机会越多。
分数说明了什么
Google公布的表格显示,Argon在Vals Index知识工作测试中得分68.9%。GPT-6 Astra为63.1%,Claude Fable 5.1为65.8%,Claude Opus 5.5为67.0%。在DeepSWE v1.1软件工程测试中,Argon得分77.9%,也高于表中的三个对手。
但Argon并非每项都第一。在FrontierSWE v2中,GPT-6 Astra得分65.5%,高于Argon的55.0%。在Terminal-Bench 4.0中,Claude Opus 5.5也领先。基准测试能提供可比数字,却不能保证真实公司会得到同样结果,而且这些数字来自Google公布的比较表。
已经确认的能力与安全安排
Google称,Argon可以自动寻找、验证并修补重要软件漏洞。公司也说,它会拒绝有害请求,减少被外部文字诱导的风险,并在必要时监测模型的推理和行动、停止执行。这里展示的是防护方向,不等于已经证明所有风险都消失。
媒体还报道,特别是Ars Technica的报道,Argon的最大输出上限提高到100万token,上一代Gemini模型为6.4万token。更长的输出有助于处理大型代码或资料,但文字更多不代表答案一定正确。
仍然未知的事情
目前最重要的证据仍来自Google自己的测试和早期试用。独立测试能否复现这些成绩,Argon在真实法律、金融和开发流程中能否减少时间和成本,都还要等待。一般用户何时能用、最终价格如何,也没有完整答案。
接下来关注什么
接下来要看Fairwind试用是否发现新的安全问题,以及Google何时扩大开放。更值得观察的是,Argon能否在不同公司的真实任务中稳定工作,而不只是赢得几张测试表。若它的表现被独立验证,Google与OpenAI、Anthropic之间的竞争会进一步升温。
Google的新AI,为什么要先小范围试用?
📰 完整报道: Google发布Gemini 4 Argon:瞄准长流程工作,但暂未全面开放
Gemini 4 Argon想帮助人们完成很长的工作。
基准测试
用相同题目比较AI能力的测试。
Fairwind计划
先让少数人安全试用AI的计划。
网络安全防御
保护电脑和网络不受伤害的工作。
💡 一句话总结
- Google发布Gemini 4 Argon(新AI模型)。
- 它想帮助人们完成很长的工作。
- 目前只有少数安全人员能试用。
它有什么不同
Google DeepMind(Google的人工智能研究机构)说,Argon能处理软件开发、法律、金融和网络安全防御。网络安全防御,就是保护电脑和网络。它不是只回答一句话。它还要按顺序处理很多步骤。比如理解任务、完成工作、检查结果。步骤越多,出错的机会越多。保持前后内容一致,就很重要。
分数代表什么
Google的基准测试(用统一题目比较AI的测试)中,Argon在Vals Index得68.9%。在DeepSWE v1.1中得77.9%。Google公布的部分对比里,它超过了几个竞争模型。可是,它没有每一项都第一。GPT-6 Astra和Claude Opus 5.5也在一些测试领先。测试分数能帮助比较。它不能保证真实工作一定成功。
为什么还不能公开
更强的AI也可能被误用。Google先让Fairwind计划(安全试用计划)中的可信人员试用。公司要观察它的行为。之后才会向付费API用户和Google AI Ultra订阅者开放。具体时间还没有公布。
接下来观察什么
大家要看独立测试的结果。还要看它能否在真实工作中稳定帮忙。如果它不只会考高分,也能少犯错,企业才会真正愿意使用。
Google的新AI来帮忙
📰 完整报道: Google发布Gemini 4 Argon:瞄准长流程工作,但暂未全面开放
Gemini 4 Argon会帮助人做长长的工作。
Google DeepMind
Google里做AI的团队。
Gemini 4 Argon
Google展示的新电脑帮手。
网络安全防御
保护电脑的工作。
Google DeepMind是Google的AI小组。 它展示了Gemini 4 Argon这个电脑帮手。
它可以帮助写电脑程序。 它可以帮助查法律和钱的事情。 它也可以帮助保护电脑。 保护电脑叫网络安全防御。
长工作有很多小步骤。 Argon会一个步骤一个步骤地做。 它做完还会检查。 所以它可能很有用。
可是,现在大家还不能用它。 先让少数人来试一试。 Google要看看它会不会做错事。 Google说它的测试成绩很好。 测试成绩不等于真的工作。 以后还要看它能不能帮上忙。