数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

github (非线智能)官网正文:

Google发布Gemini 3.7 Flash,官方将其定位为面向coding和agent场景的“workhorse model”,也就是用于高频生产任务的主力模型。距离Gemini 3.6 Flash发布仅约三周,3.7 Flash重点强化软件工程、知识工作、Web开发和复杂工作流,并在发布期给出较低的输入/输出价格。

本次ReLE评测的API版本为gemini-3.7-flash。本文主要观察其在中文场景下的综合能力表现,指标包括准确率、响应时间、token消耗和调用花费等。覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及coding八个板块。

gemini-3.7-flash版本表现:

  • 测试题数:约1.5万
  • 总分(准确率):75.4%
  • 平均耗时(每次调用):10s
  • 平均token(每次调用消耗的token):1269
  • 平均花费(每千次调用的人民币花费):27.8

1、新旧对决

对比上一代参照模型gemini-3.5-flash,gemini-3.7-flash的变化较集中:中文综合准确率小幅提升,Agent工具调用改善明显,平均token和调用花费大幅下降,同时响应速度进一步缩短。数据如下:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌Gemini 3.7 Flash实测:花费暴降 82%、10 秒极速响应,Agent 能力大幅跃升引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌Gemini 3.7 Flash实测:花费暴降 82%、10 秒极速响应,Agent 能力大幅跃升

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

*输出价格单位: 元/百万token

  • 总分进入前五:gemini-3.7-flash总分为75.4%,相比gemini-3.5-flash的73.9%提升1.5个百分点,排名从第14位上升至第5位。考虑到Flash系列本身偏高频调用定位,这一排名变化值得关注。
  • Agent工具调用提升最大:agent与工具调用从57.5%提升至66.7%,提升9.2个百分点,是所有分项中变化最明显的一项。这与Google官方强调的agent与复杂工作流方向基本一致。
  • 专业领域多项上升:法律与行政公务从81.3%提升至83.7%(+2.4个百分点),医疗与心理健康从87.5%提升至89.8%(+2.3个百分点),教育从64.9%提升至67.0%(+2.1个百分点)。金融从80.9%提升至81.6%(+0.7个百分点),变化幅度较小但方向为正。
  • Coding基本小幅改善:coding从74.2%提升至74.8%,提升0.6个百分点。ReLE中的coding分项没有出现明显跃升,但在较低响应时间和更低token消耗下保持了小幅上行。
  • 语言指令基本持平:语言与指令遵从从71.1%微升至71.4%,提升0.3个百分点。该项变化很小。
  • 响应速度继续缩短:平均耗时从13s降至10s,缩短约23%。在本轮榜单头部模型中,10s已经属于较低延迟水平。
  • Token与花费明显下降:平均token从2617降至1269,减少约52%;输出价格从63.0元/百万token降至26.25元/百万token,每千次调用花费从151.2元降至27.8元,下降约82%。

2、横向对比

在当前主流大模型竞争格局中,gemini-3.7-flash作为Google Flash系列的新一代商用模型表现如何?我们从三个维度进行横向对比分析:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌Gemini 3.7 Flash实测:花费暴降 82%、10 秒极速响应,Agent 能力大幅跃升
*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

同成本档位对比

  • 20至35元区间的高位模型:若优先看70%以上总分的模型,gemini-3.7-flash(75.4%,27.8元)的重点可比对象包括qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)、Doubao-Seed-2.0-pro(72.8%,22.5元)、Qwen3.5-122B-A10B(70.9%,32.3元)和Qwen3.5-27B(70.6%,25元)。在这一筛选口径下,gemini-3.7-flash的中文综合总分处于前列。
  • 速度是核心差异:gemini-3.7-flash平均耗时为10s,明显快于qwen3.7-plus(73s)、qwen3.5-plus(57s)、Doubao-Seed-2.0-pro(309s)、Qwen3.5-122B-A10B(338s)和Qwen3.5-27B(310s)。对于高频问答、工作流中间步骤和交互式应用,这一延迟差异比单纯总分差异更直接。
  • 向上看头部模型:qwen3.7-max(76.9%,99元)、claude-opus-5(76.8%,168.8元)、kimi-k3(75.6%,172.4元)和doubao-seed-evolving(75.5%,304.7元)仍高于gemini-3.7-flash,但分差在0.1至1.5个百分点之间,调用花费则普遍高出较多。这里更适合理解为“接近头部准确率、但定位更偏高频调用”的模型,而不是纯旗舰推理模型。
  • 与上一代Gemini模型对比:gemini-3.7-flash(75.4%,27.8元,10s)高于gemini-3.5-flash(73.9%,151.2元,13s),也高于gemini-3-flash-preview(71.2%,53.5元,72s)。相较gemini-3.1-pro-preview(75.2%,250.5元,53s),3.7 Flash在ReLE总分上略高0.2个百分点,同时花费和耗时更低。需要注意的是,Pro和Flash定位不同,前者更偏复杂推理与综合能力上限,后者更偏低延迟与高频调用。

新旧模型对比

  • 代际变化偏工程效率:gemini-3.7-flash相较gemini-3.5-flash提升1.5个百分点,幅度不算激进,但平均token、输出单价和每千次调用花费都下降较多。更准确地说,这是一次总分小幅上升、调用效率改善更明显的更新。
  • 能力结构有取舍:Agent工具调用提升9.2个百分点,是本次ReLE结果中最清楚的增量;医疗、法律、教育等专业领域也有小幅改善。但推理数学下降4.4个百分点,说明它并非所有维度都同步增强。
  • Gemini产品线位置变化:当前榜单中,gemini-3.7-flash(75.4%,第5位)已经高于gemini-3.1-pro-preview(75.2%,第9位)、gemini-3.5-flash(73.9%,第14位)和gemini-3-flash-preview(71.2%,第26位)。仅看本轮中文ReLE榜单,3.7 Flash已经不只是低成本补位模型,还是进入头部区间的Flash系列版本。
  • 与近期新模型对比:gemini-3.7-flash与qwen3.6-max-preview(75.4%,139.2元)、qwen3.8-max(75.4%,107.3元)同处75.4%附近,高于gpt-5.5(75.3%,158.5元)、gemini-3.1-pro-preview(75.2%,250.5元)、deepseek-v4-pro(74.9%,94.1元)、claude-opus-4.8-thinking(74.7%,238.2元)和gpt-5.6-sol-pro(74.4%,398.7元)。头部模型分差已经非常密集,排名变化应结合延迟、花费和任务类型一起看。

开源VS闭源对比

  • 闭源阵营中的低延迟前排:在闭源模型中,gemini-3.7-flash的总分进入前列,同时10s平均耗时低于qwen3.7-max(51s)、qwen3.8-max(67s)、gemini-3.1-pro-preview(53s)和doubao-seed-evolving(267s)。Claude Opus 5和gpt-5.5同样具备较低延迟,但调用花费更高。
  • 与开源模型对比:kimi-k3(75.6%,172.4元)略高于gemini-3.7-flash,deepseek-v4-pro(74.9%,94.1元)与其差距为0.5个百分点;qwen3.5-plus(73.3%,22.9元)、glm-5.2(73.0%,110.5元)和kimi-k2.7-code(72.6%,49.7元)则低于3.7 Flash。开源模型在部署自由度和部分低成本场景中仍有优势;在本轮ReLE中,3.7 Flash同时具备较高总分、较低延迟和中等调用花费。
  • 选型需要看调用形态:如果任务强调低延迟、高频调用和Agent工作流中间步骤,gemini-3.7-flash值得重点纳入候选;如果任务强调开放权重、本地部署或特定代码专项,仍需要把kimi-k3、deepseek-v4-pro、qwen3.5-plus、kimi-k2.7-code等模型纳入对比。

3、官方评测

根据Google官方博客(https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/),官方将其称为Flash系列中面向coding和agent的更强主力模型。Google表示,本次更新来自开发者反馈与算法改进,重点提升软件工程、知识工作、Web开发和复杂工作流。

编码与Web开发

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌Gemini 3.7 Flash实测:花费暴降 82%、10 秒极速响应,Agent 能力大幅跃升
  • FrontierCode 1.1 Main:Gemini 3.7 Flash达到43.6%,高于Gemini 3.6 Flash的34.4%。同表中Claude Sonnet 5为42.7%,GPT-5.6 Terra为41.3%。该基准更偏产品级代码质量。
引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌Gemini 3.7 Flash实测:花费暴降 82%、10 秒极速响应,Agent 能力大幅跃升
  • DeepSWE v1.1:Gemini 3.7 Flash为65.3%;3.6 Flash约49%(官方配图为48.6%)。该基准用于观察长程软件工程任务表现。
引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌Gemini 3.7 Flash实测:花费暴降 82%、10 秒极速响应,Agent 能力大幅跃升
  • Code Arena:Gemini 3.7 Flash的Web开发Elo为1588,高于Gemini 3.6 Flash的1538,也高于同表中的Claude Sonnet 5(1541)、GPT-5.6 Terra(1523)和Muse Spark 1.2(1535)。

Agent与复杂工作流

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌Gemini 3.7 Flash实测:花费暴降 82%、10 秒极速响应,Agent 能力大幅跃升
  • Terminal-bench 2.1:Gemini 3.7 Flash为85.8%,高于Gemini 3.6 Flash的78.0%,低于GPT-5.6 Terra的87.4%。
  • Terminal-bench 3.0:Gemini 3.7 Flash为14.9%,高于Gemini 3.6 Flash的5.4%,接近Claude Sonnet 5的14.6%,低于GPT-5.6 Terra的20.8%。
  • AutomationBench:Gemini 3.7 Flash为30.4%,高于Gemini 3.6 Flash的17.0%,也高于同表中的Claude Sonnet 5(10.7%)和GPT-5.6 Terra(23.6%)。Google将这一结果用于说明其在企业工作流自动化上的改善。

知识工作、文档与长上下文

  • GDP.pdf:Gemini 3.7 Flash为34.0%,高于Gemini 3.6 Flash的22.0%,官方将其作为复杂文档处理能力的例子。
  • Harvey LAB-AA:Gemini 3.7 Flash为90.7%,高于Gemini 3.6 Flash的85.1%,也略高于Claude Sonnet 5的90.1%和GPT-5.6 Terra的85.2%。这一基准更偏复杂法律工作流。
  • GDM-MRCR v2(8-needle):Gemini 3.7 Flash在128K平均表现为97.0%,高于Gemini 3.6 Flash的91.8%,也高于Claude Sonnet 5的81.5%和GPT-5.6 Terra的93.5%。这与Google强调的长上下文检索能力相关。

官方表格中也有部分项目并非全面占优。例如CharXiv Reasoning在无工具口径下,Gemini 3.7 Flash为84.5%,低于Gemini 3.6 Flash的85.2%和GPT-5.6 Terra的85.9%;OSWorld-2.0为47.9%,低于GPT-5.6 Terra的50.2%;Agent's Last Exam为26.3%,低于Claude Sonnet 5的33.3%和GPT-5.6 Terra的28.0%。因此,官方结果仍需要按具体任务口径理解。

我们非线智能官网 https://nonelinear.com/static/models.html 已上线gemini-3.7-flash,支持一键接入(附接入代码),添加客服 发送 体验金,可享20-50元首充奖励,欢迎对比体验。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌Gemini 3.7 Flash实测:花费暴降 82%、10 秒极速响应,Agent 能力大幅跃升

快速接入代码如下:

from openai import OpenAI

client = OpenAI(     base_url="https://api.nonlinear.com/v1",     api_key="YOUR_API_KEY", )
response = client.chat.completions.create(     model="gemini-3.7-flash",     messages=[         {"role": "user", "content": "为一个客服Agent设计多轮任务执行方案,并列出关键风险点"}     ], )
print(response.choices[0].message.content)