数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

github (非线智能)官网正文:

Google发布了Gemini 3.8 Flash,官方将Gemini 3.8 Flash定位为面向长程Coding、Agent工作流和多步骤推理任务的主力模型,本次ReLE评测使用的API名称为gemini-3.8-flash,下文涉及ReLE数据时统一使用这一名称。本次ReLE评测侧重中文场景,覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用和coding八个板块,相关官方基准放在第三部分介绍。

gemini-3.8-flash版本表现:

  • 测试题数:约1.5万
  • 总分(准确率):76.2%
  • 平均耗时(每次调用):18s
  • 平均token(每次调用消耗的token):1673
  • 平均花费(每千次调用的人民币花费):76.9

1、新旧对决

与上一代 gemini-3.7-flash 相比,gemini-3.8-flash 的总分和排名有所提升,但耗时、Token消耗和每千次调用费用也明显增加,部分细分领域的分数有所下降。具体数据如下:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌 Gemini 3.8 Flash 实测:强攻长程推理与 Agent,但调用成本上涨 2.8 倍引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌 Gemini 3.8 Flash 实测:强攻长程推理与 Agent,但调用成本上涨 2.8 倍

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

*输出价格单位: 元/百万token

  • 总分小幅上升:gemini-3.8-flash总分从75.4%提升至76.2%,提升0.8个百分点,榜单排名从第6位升至第3位。
  • 推理数学提升最明显:推理与数学计算从80.1%提升至83.9%,增加3.8个百分点,是本次新旧对比中涨幅最大的分项。这一结果与官方强调的多步骤推理方向相符。
  • 语言指令和工具调用温和改善:语言与指令遵从从71.4%提升至73.5%(+2.1个百分点),Agent与工具调用从66.7%提升至67.8%(+1.1个百分点)。这两项也有所上升,但涨幅小于推理数学。
  • 金融和教育基本稳定:金融从81.6%微升至82.1%(+0.5个百分点),教育维持在67.0%。在金融和教育题上,两个版本的分数基本接近。
  • 三个分项出现回调:医疗与心理健康从89.8%降至89.1%(-0.7个百分点),法律与行政公务从83.7%降至82.3%(-1.4个百分点),coding从74.8%降至72.7%(-2.1个百分点)。其中 coding 的结果与官方工程基准并不完全一致,这可能与 ReLE 中文题库的题型、调用设置以及官方长程工程任务的测试口径不同有关。
  • Token和花费同步上升:平均token从1269增加至1673,增加404,约增长32%。输出价格从26.25元/百万token升至52.5元/百万token,每千次调用花费从27.8元升至76.9元,约为上一代的2.8倍。这次升级主要换来了更高的总分和更强的推理表现,代价是更高的耗时、Token消耗和调用费用。

2、横向对比

下面分别看它与同成本档位模型、上一代模型以及开源模型的差异:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌 Gemini 3.8 Flash 实测:强攻长程推理与 Agent,但调用成本上涨 2.8 倍
*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

同成本档位对比

  • 60至100元区间处于高位:gemini-3.8-flash(76.2%,76.9元)处在每千次调用约80元的区间。同一成本区间的可比模型包括qwen3.7-max(76.9%,99元)、deepseek-v4-pro(74.9%,94.1元)、claude-opus-4.8(71.5%,99.4元)、Kimi-K2.5-Thinking(70.8%,77.1元)、GLM-5.1(70.7%,73.8元)、qwen3.6-27b(68.8%,73.2元)等。
  • 低花费Flash模型仍有吸引力:gemini-3.7-flash(75.4%,27.8元)只低0.8个百分点,但平均耗时更短、每千次调用花费更低。qwen3.8-flash(74.0%,10元)和glm-5.3-flash(74.2%,12.7元)总分虽低一些,但花费明显更低。对成本敏感的批量任务,可以优先比较这些模型。
  • 向上看头部模型:qwen3.7-max(76.9%,99元)和claude-opus-5(76.8%,168.8元)总分略高于gemini-3.8-flash;kimi-k3(75.6%,172.4元)、doubao-seed-evolving(75.5%,304.7元)和qwen3.8-max(75.4%,107.3元)则总分略低。gemini-3.8-flash处在头部模型密集区,排名较高,平均耗时也短于多数对比模型。
  • 速度位置靠前:gemini-3.8-flash平均耗时18s,慢于gemini-3.7-flash(10s)、claude-opus-5(15s)和gpt-5.5(15s),但明显快于qwen3.7-max(51s)、qwen3.8-max(67s)、deepseek-v4-pro(145s)、glm-5.3(154s)以及doubao-seed-evolving(267s)。在头部模型中,它的响应速度仍具有一定优势。

新旧模型对比

  • Flash线继续前移:gemini-3.7-flash(75.4%,第6位)已经处在榜单前列,gemini-3.8-flash(76.2%,第3位)进一步前移。排名提升的同时,Token消耗、耗时和每千次调用费用也都增加了。
  • Google产品线参照:当前榜单中,Google相关模型可重点参考gemini-3.8-flash(76.2%,76.9元)、gemini-3.7-flash(75.4%,27.8元)、gemini-3.1-pro-preview(75.2%,250.5元)、gemini-3.5-flash(73.9%,151.2元)和gemini-3-flash-preview(71.2%,53.5元)。在 ReLE 中文综合评测中,gemini-3.8-flash 目前是 Google 系列得分最高的模型。
  • 与近期新模型对比:gemini-3.8-flash(76.2%,76.9元)高于kimi-k3(75.6%,172.4元)、doubao-seed-evolving(75.5%,304.7元)、qwen3.8-max(75.4%,107.3元)、deepseek-v4-pro(74.9%,94.1元)、glm-5.3(75.2%,134.9元)和qwen3.8-flash(74.0%,10元),低于qwen3.7-max(76.9%,99元)和claude-opus-5(76.8%,168.8元)。头部模型之间的分差只有1个百分点左右,实际选型还要看费用、速度和具体任务表现。

开源/商用对比

  • 商用阵营前列:按ReLE榜单类别,gemini-3.8-flash属于商用模型。在商用模型中,它仅低于qwen3.7-max和claude-opus-5,高于doubao-seed-evolving、gemini-3.7-flash、qwen3.8-max、gpt-5.5等模型。
  • 开源模型的参照:开源模型中,kimi-k3(75.6%,172.4元)、glm-5.3(75.2%,134.9元)和deepseek-v4-pro(74.9%,94.1元)与gemini-3.8-flash分差较小,但平均耗时和花费结构不同。需要较高中文综合准确率和较快响应速度的场景,可以优先测试 gemini-3.8-flash。需要本地部署、可控性或开源生态的团队,仍应把开源模型单独纳入评估。
  • 选型边界:gemini-3.8-flash适合对中文综合准确率和响应速度都有要求、同时能够接受中高调用费用的场景。预算有限、调用量较大的任务,gemini-3.7-flash、qwen3.8-flash和glm-5.3-flash更实际。

3、官方评测

根据Google官方博客(https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/),下面只整理官方公布的评测结果。官方基准覆盖软件工程、Agent、专业领域推理、多模态理解和网络安全,不同任务之间的工具设置、判分方式和样本构成存在差异,不同任务的工具设置、评分方式和样本构成不同,横向比较时需要留意测试口径。

Gemini 3.8 Flash综合基准

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌 Gemini 3.8 Flash 实测:强攻长程推理与 Agent,但调用成本上涨 2.8 倍

官方将Gemini 3.8 Flash与Gemini 3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol和GPT-5.6 Terra进行了对比。摘取几项关键结果如下:

  • 软件工程:DeepSWE v1.1为73.7%,高于Gemini 3.7 Flash的65.3%,接近Claude Opus 5的74.0%。
  • 专业知识工作:GDPVal-AA v2为1545,高于Gemini 3.7 Flash的1482,但低于Claude Opus 5的1824。
  • 金融与法律Agent:Vals Finance Agent v2为61.4%,Harvey's Legal Agent Benchmark为10.0%,均高于Gemini 3.7 Flash。
  • 终端与Agent任务:Terminal-bench 2.1为89.4%,高于Gemini 3.7 Flash的85.8%;Terminal-bench 4.0为19.1%,低于Claude Opus 5的51.8%和GPT-5.6 Sol的37.3%。
  • 多模态与复杂推理:CharXiv Reasoning为86.2%,LVBench为87.8%(agentic)/87.1%(static),HLE-Verified为54.9%,LABBench2为86.2%。在OSWorld-2.0上,Gemini 3.8 Flash为59.0%,低于Claude Opus 5的75.4%。

官方结果显示,Gemini 3.8 Flash 在 DeepSWE、Terminal-bench 2.1、金融法律 Agent、CharXiv、LVBench 和 HLE-Verified 等项目上高于 Gemini 3.7 Flash;但在 Terminal-bench 4.0、OSWorld-2.0 和 GDP.PDF 等项目上并非最高。官方测试并非全面领先:部分项目提升明显,另一些项目仍落后于对比模型。

官方对Token与推理行为的说明

Google在博客中提到,Gemini 3.8 Flash在复杂任务上会执行更多推理步骤,并更频繁地迭代调用工具;在较高effort设置下,模型可能使用更多token来提升表现。官方同时建议,如果应用场景以计算开销约束为主,可以使用较低effort设置,或继续使用Gemini 3.7 Flash。Google将 3.8 Flash 定位为更擅长复杂推理和 Agent 任务的版本,同时也接受更高的计算开销。



非线智能官网 https://nonelinear.com/static/models.html 已上线gemini-3.8-flash,支持一键接入(附接入代码),添加客服 发送 体验金,可享20-50元首充奖励,欢迎对比体验。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】谷歌 Gemini 3.8 Flash 实测:强攻长程推理与 Agent,但调用成本上涨 2.8 倍

快速接入代码如下:

from openai import OpenAI

client = OpenAI(     base_url="https://api.nonlinear.com/v1",     api_key="YOUR_API_KEY", )
response = client.chat.completions.create(     model="gemini-3.8-flash",     messages=[         {"role": "user", "content": "分析一份中文业务报告,提取关键结论和后续行动建议"}     ], )
print(response.choices[0].message.content)