Google DeepMind 在上一版 Flash 模型刚刚交到开发者手中仅三周后,就推出了全新的 Gemini 3.7 Flash,这是一款专为编程和智能体任务打造的全新 AI 模型。仅从这次发布的节奏就能看出,Google 在 Gemini 产品线上的迭代速度有多快——而根据 Google 自身的公告,Gemini 3.7 Flash 的升级在代码准确率、网页开发效率方面都有明显提升,且价格相比前代砍半。
Summary
要点速览
- Gemini 3.7 Flash 大约在 Gemini 3.6 Flash 发布后三周上线,被定位为目前 Google 在 Flash 系列中面向编程和智能体任务最强大的模型。
- 它在多个基准测试中超越 Gemini 3.6 Flash,包括 FrontierCode 1.1 Main(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)。
- 体验价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元——是此前价格的一半,优惠持续至今年年底。
- 覆盖 160 多个国家/地区的 Google AI Pro 和 Ultra 订阅用户可用的个人 AI 智能体 Gemini Spark,从今天起已切换到新模型。
- 本次发布附带更新后的安全防护措施,覆盖 CBRN 和网络攻防滥用风险。
Google 推出 Gemini 3.7 Flash:面向编程和智能体任务的新 AI 模型
Google 将 Gemini 3.7 Flash 描述为其“迄今最智能的主力模型,专为编程和智能体打造”,而发布时间点也颇为关键。本次发布距离 Gemini 3.6 Flash 仅三周时间,Google 将这种快速迭代直接归因于开发者反馈以及内部算法改进,并计划将这些成果延续到后续模型中。
这种速度本身就是一种信号。除非是在与竞争对手赛跑,或是对付费用户的真实使用模式做出响应,否则企业通常不会在数周内连续发布模型更新。Google 将这次更新定位为一次渐进但实质性的升级——虽谈不上完整的代际飞跃,但在编程、知识型工作和网页开发方面的提升足够明显,因此值得单独发布,而不是悄悄写进补丁说明里。
紧随 Gemini 3.6 Flash 之后的渐进式更新
与其说 3.7 Flash 是一次从零重构,Google 更愿意将其描述为一次打磨迭代——这类“快速连发”的更新在整个 AI 行业已越来越常见,各大实验室都在竞争,让自家“便宜又快”的中端模型保持锋利,同时又不动旗舰产品的定价。
聚焦编程、知识型工作和网页开发的改进
本次声明中的重点领域既狭窄又刻意:软件工程、高知识密度的专业工作,以及前端网页开发。Google 表示,这些正是开发者在使用 3.6 Flash 时反馈摩擦感最强的工作流,也是新模型表现出最明显提升的场景。
相较 Gemini 3.6 Flash 的性能与基准测试提升
在 Google 公布的几乎所有基准测试中,Gemini 3.7 Flash 都以较大优势超越了前代模型,尤其是在调试、首次生成代码的准确率以及接近可直接投产的输出方面。
在 FrontierCode 1.1 Main 和 DeepSWE v1.1 上拥有更高的一次通过代码准确率
在 FrontierCode 1.1 Main 基准上,3.7 Flash 得分为 43.6%,而 3.6 Flash 为 34.4%。在 DeepSWE v1.1 上,差距进一步拉大:65.3% 对 49.0%。Google 表示,新模型在解决代码问题以及生成更接近生产可用、无需大量人工清理的代码方面也有更强的提升。
在 Arena.ai 的 WebDev Arena 中展现更优网页开发表现
在网页开发方面,3.7 Flash 能用更少的提示词生成更具功能性的布局和功能完整的应用。在基于参考设计工作时——无论是截图、图片还是完整设计系统——它也展现出更强的设计一致性。在 Arena.ai 的 WebDev Arena 中,它的 Elo 评分为 1588,而 3.6 Flash 为 1538。
在 GDP.pdf 和 AutomationBench 上的推理与准确率提升
在金融、法律和生命科学等知识密集型领域,新模型展现出更敏锐的推理能力。在测试模型处理复杂文档能力的 GDP.pdf 基准上,3.7 Flash 得分为 34.0%,而前代为 22.0%。在衡量真实商业工作流完成度的 AutomationBench 上,它的得分为 30.4%,而前代为 17.0%。
意义何在:这些并非边缘上的小幅提升。在 DeepSWE v1.1 和 AutomationBench 等基准上接近翻倍的成绩,表明 Google 不只是对模型边角做微调——而是在缩小“给出代码建议的助手”和“能可靠完成任务的智能体”之间的差距。对于正在评估要将哪款 AI 编程模型作为标准的开发者和企业而言,这一差别分量不轻。
更佳的开发者体验与成本节省
除了裸数据的基准分数外,Google 表示 3.7 Flash 在实际使用中的行为也有所不同:它更善于应对阻碍,在意图不清时会主动询问澄清,并且更忠实地遵循指令。它还在多步骤规划和工具调用上投入更多“精力”,Google 称这在工程工作流中转化为更少的人工监管和更少的重试。
更好地处理复杂工作流和指令
这种“思考更缜密”的行为,是区分“需要时刻看护的模型”和“可以放心让其长时间执行智能体任务而无需监管的模型”的关键——对于任何希望扩展自动化规模,而不仅仅是加快单次提示速度的团队来说,这都是优先事项。
体验价为上一版本的一半
在成本方面,Google 为 Gemini 3.7 提供的定价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,优惠持续至今年年底——仅为 3.6 Flash 每百万 token 价格的一半。结合性能提升,Google 将其定位为一种让开发者和客户在不成比例增加支出的前提下扩展可投产智能体的方式。根据 Google 的说法,早期客户反馈在这一更低价位上重点提到了精度和性能的提升。
与 Gemini Spark 的集成及更广泛的平台可用性
从今天起,覆盖 160 多个国家/地区、面向 Google AI Pro 和 Ultra 订阅用户的个人 AI 智能体 Gemini Spark,已运行在 3.7 Flash 之上。Spark 在 Google I/O 上以 24/7 可代表用户采取行动的智能体形态亮相,如今在 Google Workspace 应用中的工具使用能力得到增强,同时在复杂、多技能任务上的准确性和输出质量也有所提升。
Gemini Spark 使用 3.7 Flash 驱动个人 AI 智能体
在实际使用中,这意味着 Spark 能更高效地整合文件、撰写邮件和更新状态文档,将用户的想法更顺畅地转化为已完成的行动,减少中间摩擦。
通过 Google AI Studio、Android Studio、Gemini API 和企业平台访问
开发者可以通过 Google AI Studio 和 Android Studio 中的 Gemini API 访问该模型,或在 Google Antigravity 中探索以智能体为先的工作流。企业则可通过 Gemini Enterprise Agent Platform 和 Gemini Enterprise 应用获得访问权限。个人用户只要身处支持国家/地区并订阅了 Google AI Pro 或 Ultra,即可在 Gemini 应用中的 Spark 中自动使用该模型。
更完善的安全特性以支持负责任的 AI 部署
Google 表示,Gemini 3.7 Flash 随附更新后的防护措施,以防止在化学、生物、放射和核(CBRN)领域以及网络攻防方面的滥用——同时仍然支持这些领域中的合法用例。
更新后的 CBRN 与网络攻防滥用防护措施
这些防护与 Google 更广泛的生物韧性(bioresilience)策略及其网络安全项目保持一致,是公司持续扩展其所谓“前沿安全”(Frontier Safety)防护覆盖范围和稳健性的努力的一部分。更多技术细节可在 Google 随发布一同公开的模型卡中查阅。
意义何在:随着 Flash 级模型在智能体任务上变得更便宜、更强大,使其在合法自动化中大放异彩的那些能力——例如对复杂文档的推理、多步骤计划的执行、快速编写可运行代码——也正是监管机构和安全团队担心落入不当之手的能力。将这些防护直接内置到中端、低成本模型中,而不是只保留给旗舰产品,表明 Google 认为“快速、廉价的 AI”是需要重点加固的更大攻击面,而非次要风险。
常见问题
Gemini 3.7 Flash 相比之前的 3.6 Flash 模型有哪些改进?
根据 Google 公布的基准测试结果,Gemini 3.7 Flash 在编程、调试、知识型工作和网页开发方面表现更好,提供更高的代码准确率和更优的业务工作流完成度。
Gemini 3.7 Flash 的价格与 Gemini 3.6 Flash 相比如何?
Gemini 3.7 Flash 以体验价提供,其每百万 token 的成本仅为 3.6 Flash 的一半:输入 token 为 0.75 美元,输出 token 为 3.75 美元,优惠持续至今年年底。
哪些平台和产品支持 Gemini 3.7 Flash?
开发者可以通过 Google AI Studio、Android Studio 和 Gemini API 访问该模型。企业则使用 Gemini Enterprise Agent Platform 和应用。Gemini Spark AI 智能体也已在 Google AI Pro 和 Ultra 订阅中切换至 3.7 Flash。
Gemini 3.7 Flash 集成了哪些安全措施?
该模型包含更新后的防护措施,以防止在化学、生物、放射和核(CBRN)领域以及网络攻防方面的滥用,并与 Google 的生物韧性策略和网络安全项目保持一致。
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Gemini 3.7 Flash 相比之前的 3.6 Flash 模型有哪些改进?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”根据 Google 公布的基准测试结果,Gemini 3.7 Flash 在编程、调试、知识型工作和网页开发方面表现更好,提供更高的代码准确率和更优的业务工作流完成度。”}},{“@type”:”Question”,”name”:”Gemini 3.7 Flash 的价格与 Gemini 3.6 Flash 相比如何?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Gemini 3.7 Flash 以体验价提供,其每百万 token 的成本仅为 3.6 Flash 的一半:输入 token 为 0.75 美元,输出 token 为 3.75 美元,优惠持续至今年年底。”}},{“@type”:”Question”,”name”:”哪些平台和产品支持 Gemini 3.7 Flash?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”开发者可以通过 Google AI Studio、Android Studio 和 Gemini API 访问该模型。企业则使用 Gemini Enterprise Agent Platform 和应用。Gemini Spark AI 智能体也已在 Google AI Pro 和 Ultra 订阅中切换至 3.7 Flash。”}},{“@type”:”Question”,”name”:”Gemini 3.7 Flash 集成了哪些安全措施?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”该模型包含更新后的防护措施,以防止在化学、生物、放射和核(CBRN)领域以及网络攻防方面的滥用,并与 Google 的生物韧性策略和网络安全项目保持一致。”}}]}
本文在人工智能协助下完成,由编辑团队审核。

