导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

谷歌Gemini 4 Argon发布:网络安全基准超越竞品,无护栏防御模式引关注

本周三,谷歌正式发布代号Argon的Gemini 4旗舰人工智能模型,称其为在编程、办公及网络防御领域能力最强的前沿模型。此举发生在Claude Opus 5.5发布一周后、GPT 6.1 Sol发布一天后,显示美国实验室持续推动AI发展。

在DeepSWE v1.1软件工程测试(评估AI完成漫长、混乱真实世界编程任务的能力,以百分比计分)中,Argon得分77.9%,高于Claude Opus 5.5的74.2%、GPT-6 Astra的74.1%及Claude Fable 5.1的67.4%。作为对比,今年7月Gemini 3.6 Flash仅得49%。此外,Argon单次回复可生成最多100万token(约75万单词),而此前为6.4万token(约4.8万单词)。

Myriad: How low will Nvidia go? Click to make your prediction.

Myriad: How low will Nvidia go? Click to make your prediction.

不过谷歌自算的DeepSWE分数与竞争对手来自公开榜单的数据存在口径差异。在18项基准测试中,Argon在12项领先、1项持平、5项落后。

网络防御能力突出

该模型最引人注目的特性是网络防御能力。间接提示注入(在邮件中藏秘指令诱使AI助手违背用户意图)是行业噩梦。在Gray Swan基准测试(15次尝试内攻击成功率,越低越好)中,Argon仅0.7%,优于Claude Opus 5.5与Claude Fable 5.1的1.0%、GPT-6 Astra的8.5%,以及Grok 4.6和Kimi K3的逾50%。

Argon通过谷歌“Fairwind”有限访问网络防御计划向审查安全团队开放,该计划于9月2日启动,已有650余家政府及关键基础设施运营商参与。该模型“无网络护栏”,即去除了通常阻止黑客辅助的内置拒绝机制。谷歌逻辑是防御者需以攻代守,但承认存在双向风险,故采取分阶段发布,并参与美国政府自愿前置访问流程。

在Wiz渗透测试基准(要求AI针对真实Web应用漏洞编写可用利用代码且不可见源码,按首次解决比例计分)中,Argon达70.9%,超越Gemini 3.8 Flash Cyber的58.2%。谷歌称Argon帮助Wiz发现了此前前沿模型遗漏的某全球医院医疗软件重大漏洞。

市场与政策背景

今夏谷歌经历动荡,7月仅发小型Flash模型而跳过了承诺的Gemini 3.5 Pro,Alphabet股价跌约4.4%。Argon发布同日,特朗普总统推出自愿无惩罚AI协议,谷歌高层签署。谷歌表示将尽快广泛发布,先面向付费API客户及AI Ultra订阅者,入门价输入每百万token 2美元、输出10美元,标准价则为4美元和20美元,结束时间未定。

此前,Anthropic的Claude Mythos早期版助Firefox发现271处漏洞,OpenAI亦有类似可信访问计划,行业正形成“无护栏模型受限分发”共识。