Google发布Gemini 4 Argon,但普通人暂时用不上
Google发布了新前沿模型Gemini 4 Argon。它没有直接面向大众,而是通过Fairwind Program,向一组受信任的网络安全防御者开放。Google给它的定位很具体:真实世界软件工程、企业知识工作(法律和金融)、网络安全防御,还有创意写作。
发布前已经在Google内部干活
Argon不是纸面发布。数千名Google员工已经在专业编码、深度研究、写作质量上用它。量子计算研究团队用它优化时空资源,几分钟内就比已发表的基线提升40%。它的智能体分析遥测数据,自主识别并应用内存优化。已经释放超过300 TiB内存,预计总节省量在500 TiB到1 PiB之间。
它还承担了把C/C++代码迁移到Rust的工作。规模从re2、libgav1这些核心库的几万行起步,一直做到Fuchsia Zircon内核的80万行以上。在libgav1上,智能体用安全Rust替换了32K行SIMD代码。最终的内存安全视频解码器比先前Rust移植版快2.7倍,输出视频完全一致。性能接近优化过的C++版本。这些不是演示项目,是Google在用自己的生产环境验证模型。
能力更强,价格反而更低
技术上最明显的变化是输出token限制,从64K扩到100万tokens,行业领先。一口气生成长篇代码或研究报告,不用人分步催。它刷新了DeepSWE v1.1基准,得分77.9%,这个基准衡量真实世界的长时软件工程任务。Vals Index上它排第一,该指数衡量AI在金融、编码、法律和税务工作上的经济影响。Vals Finance Agent v2、Harvey的法律智能体基准上同样领先。Zapier的AutomationBench上,它以51.3%排第一;长视频理解基准LVBench,得分91.7%。
价格是首发价:每百万输入tokens 2美元,每百万输出tokens 10美元。缓存输入tokens再打95%折扣。这个价格定得不高,企业试用的门槛被拉低。
核心场景:找出别人漏掉的漏洞
Argon的焦点是网络安全。它能自主发现、验证、修补关键软件漏洞。Wiz通过Scan for Good计划使用它,在全球医院使用的医疗软件里发现了一个关键漏洞。这个漏洞暴露敏感个人信息,之前的前沿模型都没有发现。在评估漏洞修复能力的CWE-bench v1上,Argon以68%并列第一。在Google内部覆盖20种编程语言的综合漏洞基准上,它找到大量漏洞。Wiz的内部黑盒渗透测试里,发现攻击面、识别漏洞、生成验证概念证明,它都优于3.8 Flash Cyber。
放开能力之前的护栏
能力越强,控制越紧。对受信任的防御者和Google内部团队,Argon发布时不带网络护栏,方便他们调用全部防御能力。普通请求的设计则依据Frontier Safety Framework:拒绝有害内容,同时保留合法的双重用途科学研究。这些措施经过内部和外部红队测试,包括手动和自动化攻击。在Gray Swan的间接提示注入基准上,Argon排名第一,是最能抵抗这类攻击的模型。
Google还部署了针对错位的缓解措施,监控Argon的思维链和行动,必要时停止执行。训练阶段也用类似系统监控训练运行,向专门的事件响应团队发送警报,并且刻意不把发现反馈进训练。Google同时呼吁行业保留推理透明度,认为这有助于在能力提升期识别和诊断错位。高风险训练和评估开始前,沙盒环境会被隔离和密封。
谁能先用
访问从一开始就是分层的:先向付费API客户和Google AI Ultra订阅者开放。同时参与美国政府自愿的预发布模型访问流程,之后再逐步扩大范围。普通消费者何时能用上Argon,Google没有公布时间表。创意写作能达到什么水平,Google也没有给出细节。