AI Pulse

谷歌六周内第三次发布Flash:Gemini 3.8

谷歌六周内第三次发布Flash:Gemini 3.8

谷歌发布 Gemini 3.8,DeepMind 最新的推理和编码模型。两个版本:3.8 Flash 管通用任务,3.8 Flash Cyber 管安全场景。这是六周内第三次 Flash 发布,三周前刚出过 3.7 Flash。

两个版本共享同一套基础智能,上面跑着长期代理循环。模型在任务里不断评估和优化自己的输出,一边干活一边检查。复杂任务不需要人逐步喂指令,自己往下走。

3.8 Flash 被谷歌称为“最聪明的主力模型”。软件工程、代理任务、复杂多步推理,都比 3.7 Flash 强。在 DeepSWE v1.1 上,它自主解决完整工程问题的成绩超过大多数更大的前沿模型。成本只占一小部分。金融基准 Vals Finance Agent V2、法务基准 Harvey“s Legal Agent Benchmark 上,它也都超过了 3.7 Flash 和其他前沿模型。覆盖 STEM、人文学科和专业领域的 HLE-Verified,它拿到 54.9%。

性能提升来自一个明确的设计取舍:复杂任务上更努力。模型会执行额外推理步骤、迭代调用工具,有时用更多 token。具体多花多少,谷歌没给数字。开发者在乎效率的话,可以调低努力级别减少 token 开销。或者继续用 3.7 Flash,它仍完全支持。价格没涨,和 3.7 Flash 一样。每百万输入 token 0.75 美元,输出 3.75 美元。

3.8 Flash Cyber 是谷歌最强的网络安全模型,漏洞检测和自动修补到了前沿水平。它带更宽松的网络安全缓解措施,所以只向”可信防御者"开放,入口是新的 Fairwind 项目。Fairwind 覆盖受信任的政府机关、关键基础设施运营商、软件维护者三类机构。申请条件没有公开,以后会不会面向更广的使用者,也没说。

漏洞发现基准 CyberGym 上,3.8 Flash Cyber 超过上一代 3.5 Flash Cyber。大得多的前沿模型也比不过它。谷歌内部测试里,它在 20 种编程语言的复杂代码库中找漏洞,成功率超过 70%。CWE-Bench 修补基准上,它的 pass@1 是 47.2%。一个领先前沿模型是 47.8%,差距不到一个百分点,但成本显著更低。以上数字都出自谷歌或合作方的测试,还没有独立第三方验证。

Chrome 安全团队用它得到的正确补丁数量,是其他更大商业模型的 2.6 倍。云安全公司 Wiz 的内部渗透测试里,召回率比其他领先前沿模型高 7.5% 到 9.7%。成本低 2.3 到 5.2 倍。谷歌云漏洞研究团队用它在不到 2 小时内发现了一个关键基础性漏洞。这类漏洞通常要花几个月。

3.8 Flash 出厂带滥用防护,覆盖化学、生物、放射性和核(CBRN)领域和网络攻击。同时保留正当用途,符合谷歌自己的前沿安全框架。3.8 Flash Cyber 的缓解措施更宽松,内容没有公开,这就是它只给可信防御者的原因。

安全公司 Gray Swan 测了提示注入鲁棒性,3.8 系列在这项指标上比上一代明显提升。提示注入是一种恶意攻击手段。鲁棒性提升后,这类攻击更难得手。

获取渠道分三层。开发者的入口有四个:Google Antigravity、Gemini API、Google AI Studio、Android Studio。想生成界面,用 Stitch。企业走 Gemini Enterprise。个人侧,Google AI Pro 和 Ultra 订阅者能在 Gemini 应用、Google 搜索的 AI 模式、Google Sheets 的 Gemini 里用。

Chrome 安全团队、Wiz、谷歌云漏洞研究团队已经把它用在真实目标上。漏洞发现与修复,正在从按月变成按小时。

阅读原文
📚 相关主题 大模型谷歌

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新