谷歌Gemini模型发布节奏惊人:每三周一次重大升级,性能提升显著

8月13日,谷歌正式推出Gemini 3.7 Flash,官方宣称这是“目前最智能的编码与智能体工作模型”。此次更新距离上一版本仅相隔三周,被明确界定为对3.6 Flash架构的优化而非全新基础模型,直接响应开发者反馈。

本次发布内容

在核心编码基准测试中,该模型表现大幅提升:FrontierCode 1.1得分由34.4%跃升至43.6%,DeepSWE v1.1测试中从49.0%增至65.3%。在以用户偏好投票为依据的Arena.ai WebDev Arena测试中,其Elo评分从1538上升至1588。此外,在真实商业流程处理任务中,AutomationBench得分由17.0%提高到30.4%。

降价是另一半故事

伴随性能增强,谷歌公布了截至2026年底的定价策略:每百万输入token收费0.75美元,输出则为3.75美元,仅为3.6 Flash发布时的一半。对于依赖API构建产品的开发者而言,性能跃迁与成本减半的双重利好,显著改善了单位任务的经济性,使模型更适用于规模化部署。

据谷歌DeepMind内部报告,该模型在多个非主流但关键指标上亦有进步:在GDP.pdf知识密集型文档处理测试中表现更优,Legal Agent Bench得分提升2.6分。它支持文本、图像、音频及视频多模态输入,上下文窗口维持100万token,最大输出达64,000 token,与前代保持一致。

驱动谷歌后台智能体

Gemini 3.7 Flash已作为新运行引擎启用于Gemini Spark服务。该服务面向全球160多个国家的Pro与Ultra订阅用户,提供全天候个人AI助手功能。Spark可在后台持续执行文件整合、邮件起草、状态更新等复杂任务,无需等待用户主动指令。此次升级特别强化了其在Google Workspace生态中的工具调用能力,以应对跨应用、多步骤的工作流挑战。

悬而未决的问题:Gemini 3.5 Pro何在?

此次发布存在明显缺憾:旗舰级模型Gemini 3.5 Pro仍未面世。尽管谷歌曾在7月表示正与合作伙伴进行测试并即将推出,但至今未公布具体时间表。有分析指出,尽管Flash系列在基准测试中表现出色,但在真正前沿的技术竞争中,谷歌仍落后于Anthropic和OpenAI。原因在于Flash模型聚焦速度与成本效益,而非极致原始性能——而这正是高端市场关注的核心。

值得注意的是,当前发布节点恰逢谷歌Gemini应用月活跃用户突破10亿大关。一个快速、低成本且高效的模型,正是支撑如此庞大用户基数的理想选择。然而,若旗舰版本迟迟未出,意味着谷歌2026年的技术叙事仍不完整。

下一步关注点

未来焦点将集中于Gemini 3.5 Pro是否如期发布,以及其与Anthropic Claude Opus、OpenAI GPT-4o等顶级模型的真实对比表现。在此之前,谷歌通过频繁迭代Flash系列来维持成本与可用性竞争力的策略,虽稳健可行,但能否真正赢得技术领导地位,仍有待旗舰模型的最终验证。