谷歌三连发!Gemini 3.8 Flash专为智能体而生,Flash Cyber则要当最强的盾

谷歌(Google)又在刷新Flash系列的发布节奏了。9月2日,公司宣布推出Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两个新版本。这是六周之内谷歌发布的第三款Flash模型。

Gemini 3.8 Flash:为智能体任务而生

标准版Gemini 3.8 Flash被定位为一款“主力”模型,重点面向智能体任务、软件开发和多步推理场景。谷歌CEO Sundar Pichai在X上表示,这款模型在软件工程、智能体任务和多步推理方面相比3.7 Flash实现了“显著飞跃”。

具体来看,3.8 Flash在DeepSWE v1.1编程基准上以远低于同类产品的成本超越了多数大型前沿模型。它在Agent Arena中排名第14位,超过DeepSeek-V4-Pro,相比排名第32位的3.7 Flash实现了大幅提升。在Text Arena中,它首秀即排名第7,领先于Claude Opus 5。

在专业领域,3.8 Flash同样表现出色。它在Vals Finance Agent V2金融基准和Harvey Legal Agent Benchmark法律基准上均超越了前代和其他前沿模型。在Humanity‘s Last Exam(HLE)-Verified中,它拿到了54.9%的分数,展现了在数学、科学和人文学科等多步推理任务上的能力。

定价方面,3.8 Flash延续了3.7 Flash的入门价格——每百万输入token 0.75美元、每百万输出token 3.75美元。模型拥有100万token的输入窗口和6.4万token的输出限制,支持文本、图像、音频、视频和PDF文件。用户可以根据质量、成本和延迟需求调整模型的“努力程度”——在需要极致性能时,3.8 Flash会执行额外的推理步骤,虽然可能消耗更多token,但能最大化输出质量。

开发者可以在Gemini API、Google AI Studio、Android Studio和Stitch等平台试用这款模型。

Flash Cyber:AI驱动的“网络双胞胎”

如果说标准版Flash是“生产力工具”,那Gemini 3.8 Flash Cyber就是谷歌为防守方打造的一把“专用武器”。

Flash Cyber在网络安全领域接受了专项训练。它在CyberGym网络安全基准上取得了86.2%的分数,在评估AI漏洞修复能力的CWE-Bench上达到47.2%。据Pichai透露,在谷歌内部基准测试中,该模型在20种编程语言上的漏洞发现成功率超过70%。

这款模型的定位非常明确:赋予防御者专家级的能力,让他们在与恶意攻击者(无论是人类黑客还是恶意AI智能体)的对抗中占据上风。谷歌高级产品总监Tulsee Doshi和Gemini安全负责人Raluca Ada Popa在博客中强调,谷歌“从一开始就优先投资漏洞修复,而非漏洞利用等攻击性能力”。

目前,Flash Cyber正通过谷歌的Fairwind计划向“受信任的防御者”逐步开放,优先面向政府机构、关键基础设施运营商及其他寻求高级网络防御能力的合作伙伴。

实战效果:13年的“潜伏者”被揪出来了

Flash Cyber不是实验室里的花架子——谷歌已经在用它保护自己的代码了。

据谷歌披露,Flash Cyber在Chrome漏洞修复中产生的正确补丁数量,是其他体积大得多的商业模型的2.6倍。今年被谷歌以320亿美元收购的云安全公司Wiz报告称,在其内部渗透测试基准上,Flash Cyber对真实世界漏洞的召回率比领先前沿模型高出7.5%至9.7%,而成本仅为后者的五分之一到三分之一。

最让人印象深刻的一个案例:谷歌云漏洞研究团队用Flash Cyber在不到2小时内发现了一个关键的基础性漏洞——这类研究和发现通常需要数月时间。

Chrome工程总监Doug Turner在视频中分享了一个更惊人的细节:Flash Cyber发现的一个漏洞,已经在Chromium和Chrome代码中潜伏了13年。“这是一个非常微妙的bug,”Turner说,“几十甚至上百名工程师都看过这段代码,但从来没有标记过它。”

Turner将最近几个月形容为一场“漏洞末日”——生成式AI让报告的软件漏洞数量出现了“曲棍球棒式”的激增。而Flash Cyber的出现,正是为了帮助防守方在这场不对等的战争中扳回一城。正如Popa所说:“在网络安全中,攻击者只需要在数百万行代码中找到一处重大缺陷。而防守方必须消除每一个缺陷,才能抵御攻击。”

(素材来自:Google 智算芯能前沿网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。